系列第 8 篇 · 子领域训练方法 / Training【来源信息】 - 类型顶会论文 - 标题An Information-Theoretic Criterion for Efficient Data Synthesis - 作者/机构李翰禹、孙政奇、邓小铁北京大学前沿计算研究中心 - 出处ICML 2026 · arXiv:2605.16379 - 原文https://arxiv.org/abs/2605.16379 - 本文性质论文解读非原创研究关键结论以原文为准一句话结论合成数据不是「假数据」而是模型/环境参与产生的新训练材料。ICML 2026 这篇用数据处理不等式讲清一件事纯自我训练会模型崩塌但只要注入「外部校正信号」不标注也能训出推理能力——关键在于信号够不够「划算」。背景与痛点互联网高质量数据快用完了模型要往前走越来越靠合成数据代码智能体读代码、改代码、跑测试、按报错继续改数学题生成多解、验证器筛正确解。但一个老问题悬而未决同样是合成数据有时提升模型有时反而让它退化。论文用数据处理不等式给出解释——反复加工同一份信息不能凭空产生新信息就像图片被反复截图只会越来越糊。核心方法讲人话论文关心的不是「数据是不是机器生成的」而是训练过程有没有新的判断标准参与进来。学生自己编题、自己判对错练再多也难保证方向对错误会被放大但若做完题有答案、老师、判题系统或实验告诉他哪对哪错每一轮都被外部标准校正。代码和数学是最好的对照程序一运行就知道报错没、测试过没过数学答案可校验。被保留的数据不只是「模型又写了一遍」而是经过了测试/验证/筛选——把模型原本没有的信息带回训练。论文进一步提出「信息注入效率」为了获得一次有效训练系统需要提供多少新的、和任务相关的信息一个简洁反馈如对/错若能排除大量错误方向效率就高若反馈夹杂大量无关细节模型只学到表面形式效率就低。实验与数字论文对比两类范式SFT监督微调让模型模仿某个参考答案容易学到答案的措辞、步骤顺序等无关信息RLVR基于可验证奖励的强化学习只要求答案通过验证用更简洁信号筛出大量有用样本。结论RLVR 泛化性往往明显好于 SFT因为高层级可验证信号把「什么样的结果可接受」教给了模型而非某个具体答案的表面形式。这也解释了代码/数学易成功、医疗/法律/金融难后者正确性往往不能靠一个简单程序判断缺外部校正信号。为什么重要反直觉点「不标注」训出推理能力的关键不在于生成而在于生成之后的校正。一个简洁的验证信号测试通过/答案正确比一堆人工标注的参考答案更高效。这给所有垂直行业泼了冷水合成数据不能替代真实世界。医疗、法律、科研的进步取决于行业愿不愿意把「脱敏案例、专家审核规则、受控环境、真实纠错记录」组织成可进入训练循环的校正信号。复现 / 落地思路优先用「可验证奖励」做合成数据筛选代码跑测试、数学跑校验器只保留通过的轨迹警惕 reward hacking别让模型学会利用评分捷径如更长、更专业的形式而非真判断正确垂直领域先建最小可用校正信号如规则引擎、专家审核接口再谈大规模合成。今日可做的 3 件事把你正在做的合成数据流程加一道「外部验证」关卡只保留被测试/校验通过的样本。对比 SFT 与 RLVR 在同一任务上的泛化差异看简洁信号是否带来更好迁移。给你的垂直场景列一张「可进入训练循环的校正信号」清单先补最便宜的一条。下篇预告第 9 期我们读 RAG看 ACL 2026 的 AutoSearch——Agentic RAG 不是搜得越多越好过度搜索反而又慢又贵。