先说结论
企业 Agent 上线前,必须同时通过任务、工具、数据、权限、评测、可观测性和人工接管七类检查。模型能调用工具只是开始,生产可用取决于它是否在正确边界内稳定完成任务并可恢复。
读完你会得到
- 得到一份从设计到上线的 Agent 验收表。
- 识别提示注入、过度权限和不安全输出等关键风险。
- 把轨迹和工具调用纳入评测。
下面的检查项可以直接用于方案评审和上线门禁。它不替代具体行业的法律与安全评估,但能帮助团队避免把普通演示当成生产系统。
设计阶段:任务边界比角色人设更重要
- 目标可验证
能判断任务完成、失败或需要追问。
- 范围有限定
写出允许和禁止处理的任务。
- 停止条件明确
达到目标、缺少信息、超时或风险触发时停止。
- 人工升级可达
用户知道何时、如何转给人员。
- 状态有边界
会话、长期记忆和业务记录分别管理。
本节依据: [1] Anthropic
工具阶段:最小权限、结构化输入、可恢复错误
| 问题 | 设计要求 | 验收证据 |
|---|---|---|
| 能做什么 | 单一清晰职责 | 工具说明与参数模式 |
| 能访问什么 | 最小权限与业务系统鉴权 | 权限矩阵 |
| 高风险吗 | 不可逆动作需要人工确认 | 审批与拒绝路径 |
| 失败怎么办 | 返回可解释错误并允许安全重试 | 故障测试记录 |
| 输出去哪 | 下游系统继续验证和转义 | 输入输出校验测试 |
本节依据: [2] OWASP Foundation
评测阶段:不只测最终答案,还要测过程
| 维度 | 要验证什么 | 样例来源 |
|---|---|---|
| 任务结果 | 正确、完整、符合格式 | 业务专家标注 |
| 工具选择 | 该调用时调用,不该调用时拒绝 | 典型与边界任务 |
| 参数精度 | 从上下文提取正确实体与字段 | 历史错误与合成变体 |
| 轨迹效率 | 不过度循环或调用无关工具 | 运行日志 |
| 安全边界 | 抵抗注入、越权和敏感数据请求 | 对抗测试 |
| 交接恢复 | 能请求补充信息、转人工或回滚 | 故障演练 |
上线阶段:逐步开放,不一次给满权限
- 影子模式
Agent 给建议但不执行,与人工结果比较。
- 有限用户
选择受训用户和低风险任务,收集真实反馈。
- 受控执行
只开放部分工具,并保留关键动作确认。
- 持续评测
每次模型、提示、工具和知识变更前后回归。
- 逐步扩围
只有质量、采用和风险同时过门槛才扩大。
常见问题
Agent 上线前要准备多少条评测数据?
没有适用于所有任务的固定数量。先覆盖主要任务、边界、高风险和历史失败类型,再观察新增样例是否持续发现新问题。质量和覆盖比凑数量更重要。
人工确认会不会让 Agent 失去价值?
不会。对高风险动作保留确认,是权限与风险设计。Agent 仍可完成资料收集、判断建议和参数准备,把人工集中在真正需要负责的节点。
资料来源与核对说明
文章中的行业定义与技术方法尽量引用官方或标准组织资料;表格、清单和决策框架是基于这些资料形成的编辑性整理,不代表来源机构对本站服务的背书。
- Building effective agentsAnthropic
用于区分预定义路径的工作流与由模型动态决定步骤和工具使用的 Agent。
- OWASP Top 10 for Large Language Model ApplicationsOWASP Foundation
用于核对提示注入、输出处理、敏感信息泄露和过度代理等常见安全风险。
- Evaluation best practicesOpenAI Developers
用于建立任务级评测:定义目标、收集数据、设置指标、运行比较并持续评估。
- Generative Artificial Intelligence ProfileNIST
用于识别生成式 AI 全生命周期的特有风险,并把风险管理纳入设计与运营。
带上流程、样例和目标,添加企业微信沟通。首次沟通先判断是否值得做,不承诺没有数据依据的结果。