AI PRACTICE

智能体进研发流程·第三篇|研发资产盘点:能迁移的只有评测集、规则文件和业务理解

这是《智能体进研发流程》系列第三篇(收官)。第一篇 讲入口,第二篇 讲闸门,这一篇讲资产。

2026 年 5 月 Code with Claude 公开活动上,AI 编程公司 Cognition 的联创说了一句在国内立项会上会很刺耳的话:现在做 AI 的生存方式,就是接受你今天造的东西很可能在六个月到一年后被废弃。同一场活动上,法律 AI 公司 Harvey 的应用 AI 负责人说:六个月前你问我我们的架构长什么样,我给的答案和今天根本不同。

立项书要写三年规划,年度预算要报固定资产。这两句话该怎么放进机构的语境,是这一篇要回答的问题。

重建的范围只覆盖 AI 生成的代码、脚手架、路由逻辑与演进路径,运行多年的核心业务系统留在圈外,正确做法是为智能体开受控操作通道

先说清楚"重建"指的是什么

Anthropic 在 2026 年 8 月发布的《The Claude Code Guide For Startups》里,把持续重建当成受访公司的共同特征。但这个词的范围必须先划清:它指的是 AI 生成的那部分代码,以及为跟上模型能力而搭的脚手架与演进路径,不包括跑了十年的核心业务系统。

存量系统为什么不能一概推倒,站内《当智能体变成"数字劳动力"》 已经论证过:那些界面和流程里沉着大量业务规则、校验约束和例外处理,正确做法是给智能体开一条受控的操作通道。模型层与应用层怎么解耦、换模型时怎么保住知识与围栏,见《中小企业私有化部署大模型》 。本篇讲的是另外一层。

造第四遍的时候,你已经知道要什么

数据分析公司 Clay 的联创描述过这个过程:你造一遍、再造一遍、再造一遍,到第四遍你已经知道全部需要什么,于是做对了。后面补的那句更要紧——他们并不是把东西扔掉,只是重建它,这一次更清楚。指南对沉没成本的处理写得很硬:由于模型能力持续演进,开创性的功能和关键脚手架在成为沉没成本的那一刻就被丢弃。

造四遍之所以在今天变得可行,靠的是并行隔离副本。官方文档的说明是,每个会话跑在自己的工作树里,一个会话的编辑不会触碰另一个会话的文件;三份工作副本共用同一个对象库。指南给的用法是新旧两版并排跑,对两者都跑评测,只有新的赢了才合并。

这句话把上一篇和这一篇缝在了一起:没有评测集,“新的赢了"就没有判据,重建就退化成凭印象换一套。

v1 留在主干、v2 跑在自己的工作树里,两版对同一套评测集打分,得分高的那版才合并

旧路径不消失,重建就没完成

医疗科技公司 Commure 的 CEO 给了一条完成标准:重建不是在新路径上线时完成,是在旧路径消失时才完成。

指南解释了为什么以前做不到:拆除工作在优先级之争里总是输,它枯燥,而且不交付任何功能。现在它有了新的做法。Commure 的工程师调用一个可复用作业规程,大意是"对每一个已经全量放开的特性开关,开一个变更请求删掉它和相关代码”,然后由工程师复核返回的结果。过去吃掉大量开发周期的迁移,现在变成一个计划加一次扇出。

国内机构对这条标准应该不陌生。一套报表系统并行上线后旧口径迟迟不停用,两套数字对不上,季末审计问的是以哪一套为准。新路径上线只是中点,立项时就该写明旧路径的下线时点和责任人。

一次重建走过只读出方案、并行重建、新路径上线到旧路径清除四步,新路径上线只是中点

大改之前先只读出方案

官方文档对计划模式的定义是:只调研并提出改动方案而不落盘,读文件、跑探查命令、写出计划,但不编辑源码。

这是拦截架构漂移最便宜的位置。上一篇讲过那种"看着对但其实不对"的偏离,一旦落进代码就很难查;而在只读阶段,方案还是一份可以被人逐条驳回的文字。对机构来说还有一个附加价值:这份方案本身就是评审材料,评审记录和变更留痕在同一份文档里对齐。

什么该当资产,什么该当耗材

把上面几件事合起来看,可以列出一张两栏清单:

该当资产(跨模型换代继续有效)该当耗材(随能力变化重做)
机构自己的评测集与黄金样本集针对某代模型写的提示词与参数
写下来的规则文件与架构不变量为绕开旧模型短板搭的脚手架
对业务口径的理解:字段含义、例外、监管边界某一版外壳的路由逻辑与配置
权限、审计与留痕的结构设计一次性演示件与临时集成脚本

分栏的依据是它跟不跟着模型走。评测集之所以在左栏,是因为新模型上线前正好要用它来判断值不值得换;规则文件之所以在左栏,是因为它写的是这家机构怎么做事,与用哪个模型无关。

指南里有个例子能说明右栏的性质:视频与图像模型不断更新,每一个上线前都要重新配技能、评测、路由逻辑和生产测试。这是常态运维,不是一次性项目。

资产与耗材的两栏清单:评测集、规则文件、业务口径理解与留痕结构跨模型换代仍有效,提示词、脚手架、路由配置随能力变化重做

自己先用,才知道产品该做成什么样

指南给的产品化路径是三段:先建内部智能体,内部自己天天用,再看反馈决定要不要提升为面客产品。

两个例子说明了内部使用能换来什么。分析平台 Omni 的 CTO 说,他们从"用文件、不用向量"的取向受到启发,敢在自家产品里保持简单,避开了检索增强流水线会带来的大量复杂度。应用开发商 Emergent 的情况更直接:因为自家产品背后用的是同一家模型,线上一出现异常行为,他们能在本地快速判断这是模型行为问题还是外壳问题。

国内不少机构会先在 Dify、扣子这类平台上试出第一个可用版本,那一步解决的是"能不能跑通"。进入生产之后要回答的是另一组问题:谁维护评测集,换模型要重做哪些,旧路径什么时候拆。两组问题的答案不在同一层。

内部建、内部用、产品化三段飞轮各自的产出物、换来的判断与常见误判

立项与采购逻辑要跟着改

国内的节奏也支持这个判断。IDC 在 2025 年 7 月的新闻稿中称,34% 的受访中国企业在开展智能体的测试验证,30% 进入较大投入阶段,同时 66% 偏好按业务成果计费,明显高于全球的 52.7%。中国信息通信研究院《人工智能产业发展研究报告(2025年)》则指出,在数据安全与合规要求较高的金融、政务、医疗等行业场景中,基于私有化部署的落地需求在不断释放。

也有需要警惕的一面。斯坦福 2026 年 AI Index 提到,有证据提示重度依赖 AI 可能带来长期的技能发展迟滞。资产清单的左栏之所以重要,正因为它是留在人和机构里的那部分。

立项与采购前,建议逐条答完这四问:

  1. 评测集由谁维护,交付后归谁;
  2. 规则文件放在哪里,谁有权改;
  3. 旧路径的下线时点写在哪份文件里;
  4. 换一代模型,哪些要重做、哪些能直接接着用。

可信金科在方案阶段就把这四问写进对系统的验收口径,评测集与规则文件的归属一并写明。

模型会换,外壳会改,脚手架会被丢掉。能迁移的只有评测集、规则文件和业务理解。

立项与采购前要答完的四个问题,每个问题都对应一件可核对的交付物

系列到此收官。入口怎么开见第一篇 ,闸门怎么建见第二篇

业务咨询

文中涉及的征信监管改造与 AI 智能体落地问题,可通过邮件或微信与我们联系。

fuyuanhui@kexinjinke.com

邮件咨询
微信咨询二维码
微信扫码 · 详细沟通产品方案