先说明资料边界:本文没有拿到一份名为“AI21 CEO 访谈”的原始录音或逐字稿,因而不会编造问答和引号。下面采用访谈式结构,依据 AI21 CEO Ori Goshen 在公司博客、公开演讲摘要和产品说明中反复表达的观点进行主题整理。
这种写法比伪造“现场原话”少一点戏剧性,却更适合回答一个实际问题:企业把生成式 AI 接进工作流以后,为什么常常在演示阶段惊艳,进入日常运营却变得不稳定、昂贵而难以追责?
## 问:企业 AI 最常见的误区是什么
可以把公开观点概括为:把更强的单次回答误认为更可靠的完整工作。现实任务通常包含检索资料、理解目标、拆解步骤、调用工具、处理异常和核对结果。模型在每一步只有少量错误,串起来后也会明显累积。
假设一个五步流程每步成功率为 95%,在相互独立的简化条件下,整条链一次全对的概率约为 77%。这不是某个模型的实测结论,而是解释复合错误的直观算术。任务越长,单看某一步的漂亮答案越不够。
## 问:那就让一个大型模型从头做到尾吗
公开材料给出的方向更接近“规划、执行、验证”。规划器先把目标拆成可观察的子任务;执行器调用知识库、搜索、代码或业务系统;验证器检查输出是否满足条件,必要时退回重做或交给人。
这并不要求每个角色都是独立大模型。某些验证可以是确定性规则,例如总额是否相等、字段是否缺失;某些步骤适合轻量模型;只有需要综合判断的环节才调用高能力模型。

## 问:为什么强调模型无关的编排
AI21 与 Together AI 公布合作时,强调把不同模型放进同一套企业工作流。背后的工程逻辑是:任务并不存在一个永远最佳的模型。
长文档分析、代码生成、分类、实体抽取和快速改写,对推理质量、上下文长度、延迟和价格的要求不同。若工作流能根据任务路由模型,团队就可以把昂贵能力留给难题,把重复性步骤交给更快的模型。
模型无关并不意味着随时无成本切换。提示语法、工具调用、结构化输出和错误特征都可能不同,仍需要适配层与回归测试。它真正减少的是业务流程对单一供应商接口和单一模型行为的深度绑定。
## 问:Token 越便宜,系统就越省钱吗
不一定。单价只是成本方程的一项。无效长上下文、反复重试、低命中缓存、过度思考和错误后的人工返工,都可能比标价差异更大。
AI21 的公开文章把“推理开支不会自然下降”作为讨论起点。可执行的做法是测量每类任务的总成本:输入与输出 token、调用次数、延迟、成功率、重试率,以及最终人工处理时间。
一个便宜模型若让任务重跑三次,可能比一次成功的较贵模型更昂贵。反过来,给每个简单分类都调用旗舰推理模型,也是在为用不到的能力买单。
## 问:验证器到底检查什么
验证器首先检查可确定的约束:JSON 能否解析、必要字段是否齐全、数字是否落在允许范围、引用是否存在、工具是否真实执行。然后才处理开放判断,例如摘要有没有遗漏关键风险、报告是否忠于证据。
开放判断可以由另一模型评分,但“模型评模型”不是最终真理。需要用人工标注样本校准评分器,尤其关注它是否偏爱冗长答案、是否漏掉业务里的严重错误。

## 问:企业知识怎样进入工作流
把几百页文档一次性塞进提示词通常不是好答案。更常见的组合是检索增强、结构化工具和任务状态。检索负责找依据,工具负责查询实时数据或执行动作,状态负责记录已经完成到哪一步。
AI21 用“让知识投入工作”描述其 Maestro 方向。这个表达的重点不是让模型背下更多资料,而是让知识在正确步骤被找到、核验和转化为动作。
知识库更新频繁时,检索比重新训练更灵活;稳定的输出风格和任务习惯,则可能适合微调或模板。两者不是互斥选项。
## 问:评测为什么必须贴近真实流程
通用榜单帮助认识模型,但不能回答“我们的退款工单是否完成得更好”。企业评测应从真实任务抽样,标出成功条件、不可接受错误和允许的人机协作方式。
AI21 关于规模化准确性的材料强调分解任务与验证。落地时可给每一步建立小型测试集,并增加端到端指标:任务完成率、首次成功率、平均处理时间、人工接管率和每个成功任务的成本。
当模型、提示或检索规则更新后,同一套样本要重新运行。没有回归评测的优化,很容易只是把错误从一个环节搬到另一个环节。
## 问:从哪里开始最稳妥
选择一个边界清楚、结果可核验、失败可以人工接管的流程。先画出现有人工步骤,再决定哪些步骤需要模型、哪些只需规则和 API。把日志、版本和评价标准从第一天就留下来。
接着用少量真实任务跑通“计划、执行、验证、接管”闭环,再逐步扩大权限。不要把自主性当作目标本身;减少可靠完成任务所需的摩擦,才是价值。
这组公开观点最终指向同一件事:企业 AI 不是一次聊天,而是一套接受检查的生产系统。模型能力固然重要,编排、验证和成本纪律决定了它能否长期工作。
## 参考资料