智能体试点最容易被演示效果带着走:一段回答看起来不错,就开始接接口、排开发。到了验收阶段,团队才发现任务量没有记录、人工到底花了多少时间说不清、出错由谁承担也没有约定。此时再讨论投入产出,通常只能回到主观判断。立项前先核对四类证据,能把“想试一试”变成可比较的项目候选。
立项表先填证据,不先填功能
第一类证据是任务量,说明需求在一个完整业务周期内出现多少次。第二类是可替代工时,只计算智能体能够接手的具体步骤。第三类是错误后果,既看损失大小,也看错误何时会被发现。第四类是验收依据,确认谁签字、用什么基线、达到什么条件才算完成。

四项不能互相替代。任务频繁但每次只需极少人工处理,未必值得单独建设;可释放工时可观,但错误会直接形成对外承诺,就要增加权限与复核成本;技术效果不错,却没有业务验收人,也难以进入正式流程。
频次账从记录取样
频次不能只问“这件事多不多”。应先确定统计单位和观察窗口,再从工单、邮件、表单或系统日志中提取数量。周期性业务至少覆盖一个完整周期;存在明显峰谷的任务,还要把高峰和常态分开,避免用短期样本外推全年。

记录还要区分“请求数”和“可复用任务数”。同一客户连续补充材料,系统里可能留下多条操作记录,但业务上仍是一项任务。相反,一封汇总邮件也可能包含多个需要独立处理的对象。统计口径不先统一,后面的年化工时会被重复计算或漏算。
高频的另一项价值是更快积累评测样本。样本量足够,团队才能比较不同版本的结果,并观察失败类型是否稳定下降。若任务间隔长、条件每次都变,优先把流程和记录补齐,通常比立即开发更有意义。
工时账只算可替代步骤
先把现有流程拆成准备材料、判断、录入、复核、沟通等步骤,再标出哪些步骤可以由智能体完成。会议等待、跨部门协调或最终签字如果仍由人工承担,就不能算进可释放时间。测算口径可写成:单次可替代时长 × 周期任务量 × 参与岗位数,再减去运行后的人工处理、复核和返工工时。
给一个假设测算示例(非统计数据):某类材料初审单次需要 20 分钟,每个工作日发生 12 次,全年按 250 个工作日计算,现有年工作量约为 1000 小时。若智能体完成预处理后可以释放其中七成,估算可释放约 700 小时。计算关系是 20 ÷ 60 × 12 × 250 = 1000,1000 × 70% = 700;企业应代入自己的任务记录、岗位数量和复核比例。

可释放工时不等于财务利润,更不能直接解释为减少相同人数。它可能被用于缩短等待、承接增量或降低积压。比较投入时,还要加入建设、评测、业务规则更新和日常维护;如果这些持续成本超过可实现收益,方案就需要缩小范围。
测算表还应保留三个版本:上线前基线、试点目标和实际结果。任务量变化时,单看总工时会造成误判;同时记录单任务用时和任务数量,才能分辨改善来自智能体,还是来自业务量自然下降。
错误成本看后果和发现时点
错误评估可以先回答三个问题:结果是否会离开内部环境,是否会触发不可逆动作,是否涉及资金、合同或客户权益。仅供内部参考且可以立即修改的内容,允许更宽的试验空间;进入内部流程的分类、台账或初审结果,需要抽检、撤回和责任记录;对外生效的文件或动作,则应限制智能体权限,并由有权人员确认。

发现时点也会改变成本。同样一处字段错误,如果提交前即可拦截,处置范围较小;如果会继续影响后续计算、通知或审批,就需要提高控制等级。立项表因此不只写“高、中、低”,还要写清拦截位置、恢复方式和责任角色。
验收账要有基线和签字人
在可信金科的项目评审口径中,验收项至少包括三部分。第一是有权确认结果的业务负责人,第二是能够与上线前基线比较的主指标,第三是未达标时的处置和达标后的使用范围。三部分应在开发前形成记录;上线后再补,基线和责任边界都可能缺失。
主指标应直接对应任务。例如处理效率可以看单任务用时或积压量,任务质量可以看抽检通过率、首次解决率或人工接管率。使用次数可以辅助观察采用情况,但不能单独证明结果正确。指标也不宜堆得过多,一到两个主指标,加上必要的风险约束,更方便做取舍。

四类证据齐全后再排序
将候选任务放入同一张表,可以按缺口决定下一步。记录充分、可替代工时明确、风险可控制且能够验收的,进入试点比较;缺少频次数据的,先补采样;后果较高的,缩小权限或改为辅助模式;没有验收人的,暂不排开发。
排序时不必把四项简单相加成一个总分。频次与工时可以比较收益,但错误后果和验收条件更像准入门槛。达到门槛后,再比较预计释放工时与全周期投入,决策逻辑会比一个加权分数更容易解释。
现在可以从近期工单或操作日志中选出几项重复任务,各取一条真实记录,填入任务量、可替代步骤、错误后果和验收依据。优先讨论缺口最少的一项,再结合场景诊断 确认流程和数据条件。四笔账的作用不是给项目包装一个漂亮数字,而是在投入前留下可以复核的决定依据。
可信金科的 FDE 工程师会与业务人员共同核对任务记录、控制边界和验收基线。证据齐全后,再把候选场景收敛为可验证的试点。
