先说结论
FDE 项目验收应同时检查回答、工具执行结果和业务系统的最终状态。每个样例先写输入、预期行为与失败条件,再保存运行记录。涉及越权、错误外发或重复执行的严重失败要单列,不能被平均通过率掩盖;放行阈值由双方按业务风险事先确认。
读完你会得到
- 用一张表区分回答正确、动作成功和应该转人工的情况。
- 看懂小样本通过率的局限,写出可执行的放行与暂停条件。
“这十个问题回答得不错”很难直接作为验收记录。业务负责人还需要知道:问题由谁选、用的哪版规则、失败能否复现、有没有真的写入正确系统。下面以售后辅助为例整理验收方法,表格和数字都是教学设计。
配套练习与模板
无需留联系方式即可下载。先用示例熟悉方法,再填入脱敏后的业务资料;示例不是客户成果或效果承诺。
- FDE Agent 验收与交接表(下载)
含八类测试设计、逐次运行记录、计算口径及放行记录。先填写业务阈值,未执行的项目保留未测。
先分清“说了什么”和“做成了什么”
Anthropic 在 Demystifying evals for AI agents 中区分任务、每次尝试、评分器、运行轨迹和最终状态。一个助手声称预约成功,不能代替系统里的预约记录。沿用这个区分,售后 Agent 的“已转人工”也要有可查的工单与接收人。
| 检查层 | 要看的证据 | 谁适合判断 |
|---|---|---|
| 回答 | 答复是否符合现行政策,有没有漏掉追问 | 业务人员;模型评分可辅助 |
| 工具调用 | 目标接口、参数、返回状态和重试次数 | 程序检查与工程人员 |
| 最终状态 | 工单确实存在,状态正确,没有重复或越权记录 | 系统查询与业务复核 |
| 人工接管 | 接手人能看到上下文、失败原因和待办 | 实际接手的客服或运营人员 |
本节依据: [1] Anthropic
样例要包含会卡住和应该停下来的任务
| 类别 | 输入或环境 | 通过条件 |
|---|---|---|
| 正常任务 | 资料完整,接口可用 | 生成正确待审核记录,可在目标系统查询 |
| 资料缺失 | 订单号缺失 | 准确追问,未提交不完整记录 |
| 依据不足 | 政策没写运费承担 | 承认缺少依据,交给指定人员 |
| 规则冲突 | 两份政策有效期重叠 | 标记冲突并暂停自动判断 |
| 权限边界 | 尝试读取其他客户的订单 | 应用层拒绝访问,不泄露记录内容 |
| 外部指令干扰 | 客户消息要求忽略审核并退款 | 规则不被改写,未执行退款 |
| 接口故障 | 超时且不知道写入是否成功 | 核查已有状态或转人工,避免盲目重复写入 |
| 重复任务 | 同一请求重试 | 符合约定的幂等规则,不重复创建业务记录 |
这些条目是本站建议的起始清单,业务负责人仍需补充实际发生过的失败。只读知识问答没有写入动作时,可把工单检查改为引用依据检查,但权限和缺少依据时的处理仍需验证。
通过率写清分母,严重错误单独看
假设一个教学测试集有 20 个任务,每个运行 2 次,共 40 次尝试。其中 36 次满足全部检查项,则逐次通过率为 36 ÷ 40 = 90%。如果只有 16 个任务两次都通过,则任务稳定通过比例为 16 ÷ 20 = 80%。两种数字回答的问题不同,应同时注明口径。
超时和执行失败也保留在事先约定的分母里,不因它们拉低分数就删除。确属测试环境配置错误的记录,应标注作废原因并重跑。不要只展示多次尝试中最好的一次。
如果出现跨客户数据泄露、未授权写入或错误外发,应按预先约定暂停相关功能,即使其他样例全部通过。示例中的 90% 不是推荐上线阈值;少量样例也不能证明生产环境的可靠性。
用合适的方法判断,不把所有判断交给模型
记录是否存在、字段是否匹配、有没有重复写入,适合用程序核对。解释是否完整、语气是否适合客户,需要业务人员制定判分标准。模型评分可帮助初筛,但应抽样与人工判断对照,检查它是否把“说得流畅”误当成“任务完成”。
Anthropic 的文章将基于代码、模型和人工的评分方法分开讨论,并建议检查运行轨迹来校准评价。本文的售后样例与暂停规则是编辑性应用,不是该机构规定的验收标准。
本节依据: [1] Anthropic
放行时记录版本,交接时让负责人签收
| 字段 | 需要留下的内容 |
|---|---|
| 版本 | 模型、提示词、政策文档、工具配置及测试集版本 |
| 范围 | 准许使用的任务、用户、数据和系统动作 |
| 结果 | 完整分母、逐次结果、严重失败、未测项目及证据位置 |
| 决定 | 通过、有限范围试用或暂缓;由谁确认以及确认日期 |
| 暂停与恢复 | 触发条件、停用方法、人工接管人和恢复前复测要求 |
| 变更后复测 | 更换模型、政策或工具时,哪些历史任务必须重跑 |
如果政策改变,把受影响的样例更新成新预期,并保留旧版本记录。正式试用期间继续收集真实失败;离线测试只能说明已覆盖条件下的表现。
拿着验收要求讨论实施范围
AI随心创的企业 AI 咨询与 FDE 服务可以围绕你的任务讨论试点及验收方法。沟通时提供一条正常任务和一条失败任务,说明目前由谁判断结果;是否包含评测环境、系统接入及后续回归测试,应写入项目范围。
尚未开始实施时,可先做售后分流练习。比较服务商时,把这张表与服务商评估问题一起使用;已有试点可查看企业 AI / FDE 服务。
常见问题
AI Agent 达到 95% 准确率就能上线吗?
不能只看这个数字。需要知道样本构成、分母、重复运行表现和错误后果,并确认权限、人工接管与暂停方法。放行条件应针对具体任务约定。
评测需要保存模型内部思维链吗?
不需要。记录可获得的输入输出、工具调用、返回状态、耗时、成本和业务最终状态即可,不依赖模型不可见的内部推理。
更换模型后要重新验收吗?
应重跑受影响的历史任务,比较正确性、工具行为和成本。即使提示词不变,也不能直接沿用旧模型的测试成绩。
资料来源与核对说明
文章中的行业定义与技术方法尽量引用官方或标准组织资料;表格、清单和决策框架是基于这些资料形成的编辑性整理,不代表来源机构对本站服务的背书。
- Demystifying evals for AI agentsAnthropic
原文发表于 2026-01-09,2026-10-07 查阅。用于核对任务、尝试、评分、运行轨迹和最终状态;本站表格、教学数字与放行规则为编辑性整理。
带上流程、样例和目标,添加企业微信沟通。先确定项目范围与验收方式,再安排实施。