AI PRACTICE

智能体企业落地实战:验收业务结果与返工成本

《智能体企业落地实战》系列第8篇。

智能体说“已完成”,业务系统里真的完成了吗?Anthropic 在 2026 年 1 月的智能体评估文章 中,明确区分了执行过程和环境中的最终结果;7 月的评估活动说明 继续强调,单轮回答测试会漏掉多步骤任务中的问题。

本篇所说的验收,是由业务和技术人员共同检查:企业智能体是否在授权范围内完成任务,结果能否使用,复核和返工的代价是否可接受。

“处理完了”要能在业务系统里核对

假设企业准备让智能体协助处理售后工单。以下为验收设计示例,不是实际客户案例。

用户提交产品故障说明,智能体查找保修条款,整理建议,再提交给售后专员。若首期范围只到建议草稿,验收就应核对草稿是否关联正确工单、依据能否查到、缺失信息是否列明。系统不能因为生成了建议,就把工单标成已解决。

回答内容、操作记录和业务系统状态,需要共同支持任务完成的判断。

若经批准可以更新工单,还要检查实际改了哪个字段,是否写入正确对象,专员能否看到。一次调用没有报错,也可能没有保存成功。建议让验收人员直接核对系统记录,确认演示界面的提示与实际结果一致。

答案质量与操作质量需要分别记录。解释准确但未保存,属于交接失败;保存成功却关联错客户,属于对象错误。它们需要不同的修复方法,合成一个总分会丢掉这一区别。

测正常任务,也要测它该停下来的时候

验收材料若都是信息完整、权限齐全的工单,只能说明系统在这些条件下表现如何。真实运行还会遇到附件缺页、同名产品、过期条款、权限不足和系统超时。

企业可以把这些情况写进测试任务,同时注明期望行为:需要补问、转交人工,还是等待查询结果。停止处理本身也可能是正确结果。资料不足时生成确定结论,才应被记为失败。

异常测试应同时说明输入情况和预期处理,避免把正确停止记成失败。

建议将越权读取、未经确认对外发送、错改客户记录等列为上线前必须解决的问题,由项目负责人明确通过标准。这类错误不宜用其他任务的高分抵消。具体底线应按业务后果确定,不能拿另一行业的准确率直接套用。

还应模拟一次结果不明的操作。例如工单提交超时,智能体先查记录是否已保存;确定没有提交成功后,再按规则重试。否则同一个请求可能生成重复工单。发生异常时,售后专员应能接管原任务,不必从头找材料。

换模型以后,用同一批任务重新验证

模型升级、提示词调整、知识资料更新,都可能改变结果。要判断变化,建议保留固定的业务测试任务及标准,把旧版本和新版本放在相同条件下比较。

Anthropic 的评估文章区分了能力测试和回归测试:前者检查尚未做好、需要提升的任务,后者保护已经具备的能力。企业可以据此分别保存已通过的任务,以及待解决的难题,避免只展示新版本擅长的部分。

模型或资料变更后,固定任务验证既有能力,新失败任务用于发现改进方向。

相同任务也应重复运行,观察结果是否稳定。保修条款引用偶尔正确、偶尔引用过期版本,仍需要查清。测试记录要保留当时的模型、规则、资料版本和权限条件,才能让下一次比较成立。

对明确字段和系统状态,可以用程序核对;涉及解释是否充分、建议是否合适,则需要业务人员判断。模型评分可辅助筛查,但应先与人工判断校准。业务专家有分歧的任务,先明确标准,不宜用一个自动分数掩盖分歧。

测试材料还应与调试材料分开。反复用同一份工单修改提示词,再把它作为验收依据,只能证明系统对这份材料适应得更好。建议保留未用于调试的同类任务,由业务人员检查,观察它处理新输入的表现。

把复核和返工也算进成本

如果报价只列模型调用费,企业还看不到完整的任务成本。附件处理、系统查询、失败重试、人工复核,都可能消耗资源;智能体输出越难检查,专员花在复核上的时间越多。

建议按一个可比期间计算:运行费用、人工复核与返工费用相加,再除以验收通过的任务数。运行费用中要包含失败尝试,人工费用采用企业一致的核算方式。开发投入和固定维护费用另行列明,方便判断扩大使用范围是否值得。

若没有验收通过的任务,先记录失败费用,不计算成功任务单价。

单次成功任务成本需要计入失败尝试、人工复核和返工费用。

时间也要按全程比较。原来专员从收件到交出可用建议要多久,现在准备、等待、复核和返工合计多久。如果总时间没有改善,要找到被增加的步骤,再决定调整任务还是继续投入。

费用不能孤立决定验收。低成本方案如果需要专员重新核对全部材料,也可能失去采用价值。业务负责人应同时查看通过任务的质量、处理时间和人工负担。

每个失败,都应留下下一次检查的依据

OpenAI 当前的智能体评估文档 说明,执行过程记录可以帮助判断工具选择、任务交接和指令执行的问题。企业排查失败时,也应能看见它用了哪些资料、执行了什么操作、停在哪一步;记录范围按权限与敏感信息要求设置。

发现失败后,保留资料与过程、定位原因、修复并回归验证,才能减少重复问题。

可以从一次失败工单开始:由售后负责人说明正确处理方式,技术人员定位是取错资料、规则含糊还是保存失败。修好后把任务加入测试,再检查原有任务有没有退步。OpenAI 2026 年 9 月的工作流文章 也把异常反馈、测试和人工复核作为持续改进的一部分。

下一次验收,请供应商带来任务结果、原始依据、系统记录和复核工时,让经办人实际接手一次。企业智能体验收,要看业务结果和返工成本。

可信金科开展垂类业务系统与智能体开发,重视业务规则、结果留痕和人工复核。评估试点时,可先明确一项任务的通过标准,再讨论模型、接口和维护安排。


系列阅读:系列目录 · 上一篇:金融智能体上线的五项准备

业务咨询

文中涉及的征信监管改造与 AI 智能体落地问题,可通过邮件或微信与我们联系。

fuyuanhui@kexinjinke.com

邮件咨询
微信咨询二维码
微信扫码 · 详细沟通产品方案