企业已经让 AI 处理工单、提取材料或生成经营简报后,“要不要换新模型”就成为持续运营问题。正确的比较对象是新旧两套应用配置在同一业务条件下的表现,而不是两张模型排行榜。本文提出一套升级决策方法:先验证原有能力没有不可接受的退化,再判断新增收益是否值得迁移,并保留可执行的回退路径。文中的业务场景是构造示例,不代表壹典项目数据。
变化已经进入接口和运行行为
本次检索关注近期模型迁移资料,而不以新品发布宣传作为升级依据。截至 2026 年 10 月 2 日查阅,Anthropic 的 Sonnet 5.5 Messages API 迁移指南将变更按原模型分组:从 Sonnet 4.6 等版本迁移时,不传 thinking 字段的行为可能不同;指南还要求按类型读取响应内容块。[1] 这说明即使业务提示词不变,原有预算和解析假设也可能失效。
这些是该供应方、指定接口与迁移路径的事实,不代表所有模型升级都有相同变更。企业应查阅实际采用平台的版本说明,确认模型标识、支持参数、工具协议、输出结构和停用安排。兼容层统一了接口外观,也不等于已经统一各模型的行为。
受影响最明显的是已经把模型输出接入后续动作的应用:分类结果决定工单去向,抽取结果进入数据库,工具选择影响审批流程。普通写作助手也需要回归,但若结果总由人逐项检查、没有自动写入,其可接受的试用边界可以更宽。
把一次升级拆成四项证据
第一项是兼容性证据:请求能否被接受、响应能否完整读取、异常是否仍有明确分支。它解决应用会不会坏,并不证明业务效果更好。可以先用少量覆盖关键接口的样例排除硬错误,再进入较昂贵的业务评估。
第二项是任务收益证据:用相同材料、相同业务规则和相同评审标准比较新旧方案。第三项是分层风险证据:把高后果任务、边界输入、拒答与转人工单列,不能让低风险任务的大量改善抵消关键失败。第四项是回退证据:旧版本是否仍可用,相关提示配置、检索配置与输出适配能否一并恢复。
这四项是本文归纳的决策框架,不是新的行业标准。Anthropic 的评估文章区分能力评估与回归评估,并强调智能体评估对象包含模型及其运行框架。[2] 据此,企业应同时回答“新增加了什么”与“以前可靠的事情是否仍可靠”,而不是只挑新模型擅长的题。
先固定比较条件,再允许优化
建议先做一轮尽量保持其他条件不变的替换测试,记录模型版本、提示词、检索材料、工具定义、推理设置和超时规则。部分旧参数若不被新接口支持,应明确记录必要适配,不能声称是完全单变量实验。
随后可以针对新模型优化提示词或推理设置,但把优化后的完整配置作为另一候选版本。这样能够区分直接替换是否可行,以及投入适配后是否值得采用。只给新方案更多检索材料、更多重试或更长时间,却用相同名字报告为“模型能力提升”,会误导投入判断。
比较应覆盖质量、时效和人工负担。记录首次合格比例、经修正后合格比例、转人工与失败,以及相应处理时间。接口成功不能自动算业务成功;一份更完整但需要更久复核的答案,也不一定更适合现有流程。
构造示例:总分更高,仍然可以暂缓
假设一个内部工单助手评估 100 个任务,其中 80 个是普通分流,20 个涉及必须转人工的异常。旧方案分别通过 72 个和 20 个,新方案分别通过 79 个和 17 个,总通过数从 92 提升至 96。这些是构造数字,没有运行模型或做统计推断。
若丢失的三个异常处理都可能导致越权承诺,那么总通过率上升不足以批准全量替换。合理选择包括暂缓升级、先修复异常分支,或仅在能可靠识别的普通任务范围内试用。局部发布还要验证分流规则本身,不能假设系统总能提前知道哪些任务有风险。
反过来,如果旧方案在某些新任务上经常失败,新方案已经显示稳定收益,也不必因其他场景尚未评估而完全放弃。可以让新能力进入独立的人工辅助入口,保留原有生产路径。这里的关键是明确批准了哪个使用范围,而不是给整套模型贴上“更好”或“更差”的标签。
评估集要能揭露退化,也要承认不确定性
任务集应包含正常业务样本、历史失败和少量专门构造的边界案例。开发过程中反复查看的样本适合诊断,但最终决定最好保留一组未用于调参的任务。异常样本可以刻意多收集,以检验控制能力;汇总时需说明这不是生产发生比例,不能据此直接估算日常返工量。
对有标准结果的字段采用规则检查,对开放式解释用明确评分准则和盲审。模型裁判可以帮助扩大覆盖,但应以人工样本校准,不能因为它偏好更长、更流畅的回答,就认定业务更准确。多次运行同一任务有助于观察不稳定性;相应次数与成本必须记录。[2]
样本少时,尤其不能把“没有观察到关键错误”写成“保证无错误”。评估报告应保留未覆盖的语言、材料类型和业务边界。若差异只在少数模糊任务上出现,先复核评分规则与证据,再决定是否扩大试验;不能为得到想要的结论事后移动合格线。
灰度发布的重点是代表性与可停止
离线通过后,可以先做影子运行:新方案处理获准使用的真实输入,但不提交外部动作,由旧方案继续提供正式服务。它能够观察真实材料分布,却不能直接证明用户接受度或自动执行安全;额外的数据处理与算力开销也需计入。
随后按明确业务范围开展小规模灰度,即只让部分符合条件的实际任务使用新方案。Google 的灰度发布资料提醒,样本量、持续时间、负载时段与观测指标共同影响代表性。[3] 因此,“放了半小时没投诉”不能替代验收;低峰期通过,也不代表高峰期表现可靠。
应在开始前确定停止条件、责任人和观察窗口,区分接口错误、业务退化与依赖服务故障。回退的是完整发布单元:模型选择、提示配置、解析器、相关工具定义和必要的数据版本。已经发生的外部写入不会因切回旧模型自动消失,需要另行核对与补偿;影子运行阶段应尽量避免这类副作用。
升级是一项有期限的运营决策
发布评审最终可以形成一页决策单:批准范围、直接替换与适配后的比较、关键失败清单、运行成本变化、回退演练结果,以及下一次复核条件。业务负责人确认质量与后果,技术负责人确认兼容和运行,不能把所有判断压成一个综合分数。
小团队不必先建庞大的评估平台,可以从一类高频任务和历史失败清单开始。多部门应用则需按任务分别批准,防止某个部门获得收益、另一个部门承受退化。样本维护、人工评分和影子运行都有成本,投入应与任务后果和变更频率匹配。
如果旧模型即将停止服务,维持原状可能已经不是可选项。此时应准备可迁移的备用方案,并明确临时缩小能力、增加人工复核或暂停高后果动作的条件。旧版本可用性未经确认,就不能把“随时回退”写进承诺。
企业 AI 的持续价值不依赖每次都追随最新模型,而依赖能够判断何时升级、升级到什么范围,以及出现问题时如何恢复。把迁移证据持续积累下来,下一次选择新模型才会更快,也更容易解释。
