直接回答
验收对象不是一次回答,而是一条被岗位采用的工作链
企业应验收“真实材料进入后,智能体完成了哪些动作,依据从哪里来,哪里调用了模型或工具,异常如何停止,谁确认结果,结果是否真的进入后续工作”。演示成功只能证明一次能力;连续 30 天留下可复核的任务与采用记录,才能支持继续、调整或停止的决定。
执行前基线
先选十个真实任务,记录人工当前怎么做
从目标岗位最近完成的工作中选十个有代表性的任务,同时包含常规、资料不足、规则冲突和高风险样本。逐项记录人工耗时、返工原因、所需证据、最终交付物和责任人。十个任务不是统计学上的通用结论,只是第一轮可复核基线;样本不足时应报告原始计数,不发布夸大的百分比。
四层标准
从答案正确走向业务可用
正确、完整、符合格式,业务人员愿意继续使用。
关键结论能返回来源,重要步骤和工具动作有记录。
高风险动作必须等待人工确认,异常有明确升级路径。
能观察任务量、采用率、返工率、模型用量与改进记录。
统一口径
六项指标必须先定义,再开始试运行
30 天路径
四个检查点只回答是否值得继续
- 第 1 天
冻结任务边界、十个样本、人工基线、责任人和禁止自动执行的动作。
- 第 7 天
检查常规任务能否重复完成;若基本输入仍不稳定,先修工作链,不扩大任务范围。
- 第 14 天
加入资料不足、规则冲突和权限边界样本,验证追问、拒绝、停止和人工接管。
- 第 30 天
比较最终采用、返工、人工介入、证据完整性与运行成本,作出继续、更新或停止决定。
人工确认
这些动作不应因为演示流畅就默认自动化
- 对外发送邮件、消息、公告或正式文件。
- 写入或删除业务系统中的客户、合同、财务和人员数据。
- 付款、下单、退款、签约或改变权限。
- 资料冲突、证据缺失,或结果将影响医疗、安全、公共服务等高风险事项。
具体边界由企业按业务风险、法律义务和系统可恢复性确定。本文给出的是验收方法,不代替法律、合规或安全评估。
常见失败
为什么演示成功,上线后却失败?
- 演示只选了一个最容易的问题,没有测试边界和异常。
- 只看生成结果,没有检查来源、权限和人工责任。
- 没有真实岗位负责人,项目由技术团队单独推动。
- 没有工作日志和纠偏记录,系统无法从错误中持续改进。
- 任务频率太低,用户无法形成稳定使用习惯。
下载清单
企业智能体 30 天验收清单
清单覆盖任务、数据、结果、证据、权限、人工确认、异常和运营八个方面,可直接用于第 1、7、14、30 天评审。
下载项目验收清单事实与方法边界
协议兼容不等于业务已经可上线
MCP 授权规范处理受保护资源的授权流程,A2A 规范定义智能体之间发现与任务协作的协议能力;这些是技术层事实。把权限节点、异常升级和最终采用纳入 30 天验收,是数位人的方法建议。生成合成内容还应根据适用法规完成标识与治理,不能用协议兼容替代组织责任。
验收通过后,是否可以取消人工复核?
不能一概而论。低风险、规则稳定、错误可恢复的动作可以逐步减少人工介入;涉及付款、合同、医疗、公共服务、生产安全等高风险事项,应长期保留明确的人类责任节点。
