企业合成训练数据值得投入吗?先证明补足了真实业务缺口

生成大量训练样本已不难,难的是证明它们改善了真实业务。合成数据适合补充可描述、可验证的覆盖缺口,却不能替代对真实分布的认识。本文结合模型崩塌研究与生成工具文档,提出从缺口定义、真实数据保留、训练采样到独立验收的投入判断方法,并用构造场景说明如何比较收益、成本和停止条件。

企业讨论合成训练数据时,常先问能生成多少条、每条多少钱。更值得先问的是:现有模型在哪一种真实输入上失败,生成器从哪里获得纠正这种失败的知识,改善又由什么独立证据证明?本文的判断是,合成数据应作为针对明确缺口的工程投入;扩充样本数量本身,既不是能力增长的证据,也不是采购验收标准。

争论正在转向训练流程,而非简单赞成或反对合成数据

这里的合成训练数据,指通过规则、模拟器或生成模型构造、用于模型学习的样本。本文主要讨论企业文本与结构化任务中的样本扩充,不把结论直接推广到所有视觉仿真或基础模型预训练。对数据团队、模型负责人和采购决策者而言,关键变化是:生成已经可以规模化,瓶颈开始转向如何引入有效信息、控制训练中看到的分布,并证明业务收益。

2024 年发表于 Nature 的研究展示了递归使用模型生成数据时的退化:后续模型可能逐渐失去原分布中的少见内容。论文讨论的是特定递归训练过程及其误差累积,不能据此说任何一次合成数据微调都会失败。[1] 相反,ICML 2025 的 Collapse or Thrive 比较了替换、累积与固定规模子集训练等流程,发现保留历史真实数据并累积训练,与反复用新合成数据替换旧数据,结果并不相同;固定训练预算又改变了退化表现。[2]

2026 年 9 月 16 日发布的 Fisher-Rao 视角预印本继续研究真实与合成数据的混合,在有限类别分布、扰动有界等假设下推导稳定性条件。[3] 这是理论证据,不是企业微调的通用配方。本文据此作出的工程推断是:决策单位应从“合成数据占百分之几”转为“哪些真实信息仍被保留、实际参与多少训练、用什么外部证据约束”。

先判断缺的是表达、覆盖,还是业务事实

第一种缺口是表达形式。业务规则已经明确,但用户会用简称、口语、错别字或不同语序描述同一问题。围绕经过确认的原始样例产生变体,可能增加输入表达的覆盖;前提是变体没有改变决定答案的事实。把“不支持退货”改成“支持退货”属于标签语义变化,不能当普通改写放行。

第二种缺口是已知规则的组合。例如采购申请需要同时检查金额、部门和批准状态。可以按规则构造边界组合,由确定性逻辑给出标签,再由模型生成自然表达。这种做法的价值来自规则提供的信息,而不是生成器凭空知道了业务。若规则存在歧义,应先由业务负责人澄清。

第三种缺口是从未观测到的真实机制:新设备的实际故障、陌生客户群的行为、尚未确认的异常原因。让模型编写大量类似案例,不会自动补上事实依据。此时应优先采集、标注或受控试验;合成样本最多用于提出假设或测试接口流程,不能充当这些场景已经被真实验证的证据。

构造场景:为采购申请分流补样本

以下是构造示例,不是壹典项目,也没有运行训练实验。假设企业要将采购申请分为“信息齐全可进入审批”“需要补充信息”“超出当前流程需人工处理”。历史样本以常规申请为主,开发集显示模型容易漏掉单位缺失,以及跨币种但没有汇率日期的情况。

可先建立任务矩阵:申请类型、金额单位、币种关系、必要字段是否齐全。领域人员确认每一种组合应采取的动作,并挑出业务上不可能出现的组合。生成器只负责将合法组合转成不同表达,同时保存规则编号和预期动作。不能为了提高困难样本比例而把现实中不可能的组合大量纳入。

同一案例中的字段与叙述要交叉核对。例如结构字段标记“汇率日期缺失”,正文却写出具体日期,该记录就应退回。更重要的是分清来源:真实事件、基于真实事件的改写、按规则构造,三者分别记录。未经独立确认的生成答案,不得因为另一模型表示同意就变成业务事实。

已有文章关于训练数据集验收的方法,可用于检查这些样本的隔离与可追溯性。这里进一步要解决的是投资问题:即使样本格式、标签和版本均合格,它们是否确实改善了目标缺口,而非仅让模型更擅长生成器偏好的表达?

真实数据保留在仓库里,还不够

采购或自建方案应说明真实数据如何进入每一轮训练。文件仍在存储中,并不等于模型实际看见它。如果每轮只随机抽取固定数量,合成池持续扩大时,稀少真实案例被抽中的机会可能下降;如果改为使用全部累积数据,训练与治理成本又会增加。研究中的累积策略与固定预算策略不能混为一谈。[2]

本文建议同时记录三种量:各来源可用的独立案例数、训练中各来源实际被采样的次数,以及关键业务切片获得的曝光。一次改写出一百种措辞,不应登记为一百次独立业务观察。样本长度不同,还应记录各来源贡献的训练 token 数,避免条数比例掩盖实际权重。

这不意味着必须永久保留每一条历史数据。过期规则、错误标签和不再允许使用的数据需要退出相应训练范围,并留有治理记录。对保留哪些真实样本的判断,应围绕当前任务与合法使用边界;对采样配额的判断,应通过开发集比较,再用独立验收验证,而不是直接照搬论文中的比例。

验收应比较业务改善,而非生成通过率

生成阶段的检查可以帮助减少明显错误。NVIDIA NeMo Data Designer 的 Validators 文档支持对目标列运行验证并返回结构化结果,包含代码检查、自定义函数与远端验证等方式。[4] 这说明检查可以嵌入生产流程,但通过字段校验、语法检查或评分,不等于训练后的模型满足业务目标。

对上述构造场景,本文建议在同一底座和明确预算下设置三组:只使用现有真实训练数据;加入围绕缺口的合成数据;把相近的人力预算用于补标真实案例。开发阶段固定评估规则,并记录训练步数、token、生成费用及复核工时。若第二组额外使用更多计算,结果只能解释为整套方案效果,不能把差异全部归因于数据来源。

最终验收使用没有参与生成种子、提示调整和模型选择的真实留出案例。合成挑战集可以检查已声明的边界,但不能单独证明真实业务泛化。需要补充真实稀少案例时,应在采样报告中说明它们被额外抽样,分别报告总体分布结果与重点切片结果;不能把人为增多的困难案例比例当成线上发生率。

指标要与动作后果连接。例如“错误放入审批的数量/实际应补充信息或转人工的数量”度量漏拦截;“误要求补充的数量/实际信息齐全的数量”度量额外负担。另报每个切片样本数和不确定性。验收容忍度由错误成本与人工处理能力事先确定,本文不提供冒充行业标准的统一阈值。

算清成本,并为无效扩量设置停止条件

合成路线的完整成本包含种子整理、规则确认、生成、筛选、人工复核、训练、评估,以及上线后修正错误的工作。每千条的生成报价仅覆盖其中一部分。可比较“达到同一验收目标的总成本”,或者在总预算相同的前提下比较关键错误率;若两条路线都未达到目标,就不能用便宜来代替合格。

在构造场景中,若增加表达变体改善了常规分流,却没有减少跨币种申请的漏拦截,应回到规则和输入证据检查,不能继续只加措辞。若真实切片退化而合成集得分上升,应暂停扩量,检查生成风格、采样权重和标签偏差。若专家复核成为主要成本,直接补标少量真实案例可能更合算。

扩量决策至少应有四份可解释材料:具体失败切片及业务代价;合成样本引入信息的来源;真实数据在训练中的保留与采样记录;独立验收及与替代方案的成本比较。只有这些材料支持继续投入,样本规模才有扩大依据。企业真正需要购买或建设的,是可检验的任务改善过程。

参考资料

  1. [1] Shumailov et al. — AI models collapse when trained on recursively generated data (Nature, 2024)
  2. [2] Kazdan et al. — Collapse or Thrive: Perils and Promises of Synthetic Data in a Self-Generating World (ICML, 2025)
  3. [3] Marchi et al. — Preventing Model Collapse: A Fisher-Rao Perspective on the Dynamics of Training with Synthetic Data (arXiv v1, 16 September 2026)
  4. [4] NVIDIA NeMo Data Designer — Validators (Latest documentation, accessed 8 October 2026)
返回洞察
鲁ICP备2024109755号-2
可拖动移动。右键、长按或按 Shift+F10 可选择停靠位置。