资讯中心

7B扩散LLM,居然能跟671B的DeepSeek V3掰手腕,扩散vs自回归,谁才是未来?

📅 2026/8/27 14:29:10
7B扩散LLM,居然能跟671B的DeepSeek V3掰手腕,扩散vs自回归,谁才是未来?
前言语言是离散的所以适合用自回归模型来生成而图像是连续的所以适合用扩散模型来生成。在生成模型发展早期这种刻板印象广泛存在于很多研究者的脑海中。但最近这种印象正被打破。更多的研究者开始探索在图像生成中引入自回归如 GPT-4o在语言生成中引入扩散。香港大学和华为诺亚方舟实验室的一项研究就是其中之一。他们刚刚发布的扩散推理模型 Dream 7B 拿下了开源扩散语言模型的新 SOTA在各方面都大幅超越现有的扩散语言模型。在通用能力、数学推理和编程任务上这个模型展现出了与同等规模顶尖自回归模型Qwen2.5 7B、LLaMA3 8B相媲美的卓越性能在某些情况下甚至优于最新的 Deepseek V3 671B0324。同时它还在规划能力和推理灵活性方面表现出独特优势彰显了扩散建模在自然语言处理领域的广阔前景。各语言模型在通用、数学、编程和规划任务上的比较。语言模型在标准评估基准上的比较。* 表示 Dream 7B、LLaDA 8B、Qwen2.5 7B 和 LLaMA3 8B 在相同协议下评估。最佳结果以粗体显示次佳结果带有下划线。这项工作的作者之一、香港大学助理教授孔令鹏表示「Dream 7B 终于实现了我们从开始研究离散扩散模型以来一直梦想的通用语言模型能力」。研究团队将在几天内发布基础模型和指令模型的权重基础模型https://huggingface.co/Dream-org/Dream-v0-Base-7BSFT 模型https://huggingface.co/Dream-org/Dream-v0-Instruct-7B代码库https://github.com/HKUNLP/Dream他们相信虽然自回归模型依然是文本生成领域的主流但扩散模型在生成文本方面有其天然的优势。而且随着社区对扩散语言模型后训练方案探索的不断深入这个方向还有很大的挖掘空间。当然在这个方向上扩散模型究竟能走多远现在还很难判断。但前 Stability AI 的研究总监 Tanishq Mathew Abraham 表示「即使你不相信扩散模型是未来我也不认为你可以完全忽略它们它们至少可能会有一些有趣的特定应用。」为什么用扩散模型生成文本目前自回归AR模型在文本生成领域占据主导地位几乎所有领先的 LLM如 GPT-4、DeepSeek、Claude都依赖于这种从左到右生成的架构。虽然这些模型表现出了卓越的能力但一个基本问题浮现出来什么样的架构范式可能定义下一代 LLM随着我们发现 AR 模型在规模化应用中显现出一系列局限 —— 包括复杂推理能力不足、长期规划困难以及难以在扩展上下文中保持连贯性等挑战这个问题变得愈发重要。这些限制对新兴应用领域尤为关键如具身 AI、自主智能体和长期决策系统这些领域的成功依赖于持续有效的推理和深度的上下文理解。离散扩散模型DM自被引入文本领域以来作为序列生成的极具潜力的替代方案备受瞩目。与 AR 模型按顺序逐个生成 token 不同离散 DM 从完全噪声状态起步同步动态优化整个序列。这种根本性的架构差异带来了几项显著优势双向上下文建模使信息能够从两个方向更丰富地整合大大增强了生成文本的全局连贯性。通过迭代优化过程自然地获得灵活的可控生成能力。通过新颖的架构和训练目标使噪声能够高效直接映射到数据从而实现基础采样加速的潜力。近期一系列重大突破凸显了扩散技术在语言任务中日益增长的潜力。DiffuLLaMA 和 LLaDA 成功将扩散语言模型扩展至 7B 参数规模而作为商业实现的 Mercury Coder 则在代码生成领域展示了卓越的推理效率。这种快速进展结合扩散语言建模固有的架构优势使这些模型成为突破自回归方法根本局限的极具前景的研究方向。训练过程Dream 7B 立足于研究团队在扩散语言模型领域的前期探索融合了 RDM 的理论精髓与 DiffuLLaMA 的适配策略。作者采用掩码扩散范式构建模型其架构如下图所示。训练数据全面覆盖文本、数学和代码领域主要来源于 Dolma v1.7、OpenCoder 和 DCLM-Baseline并经过一系列精细的预处理和数据优化流程。遵循精心设计的训练方案作者用上述混合语料对 Dream 7B 进行预训练累计处理 5800 亿个 token。预训练在 96 台 NVIDIA H800 GPU 上进行总计耗时 256 小时。整个预训练过程进展顺利虽偶有节点异常但未出现不可恢复的损失突增情况。自回归建模和 Dream 扩散建模的比较。Dream 以移位方式预测所有掩码 token实现与 AR 模型的最大架构对齐和权重初始化。在 1B 参数规模上作者深入研究了各种设计选项确立了多个关键组件特别是来自 AR 模型如 Qwen2.5 和 LLaMA3的初始化权重以及上下文自适应的 token 级噪声重排机制这些创新为 Dream 7B 的高效训练铺平了道路。AR 初始化基于团队此前在 DiffuLLaMA 上的研究成果作者发现利用现有自回归AR模型的权重为扩散语言模型提供重要初始化效果显著。实践证明这种设计策略比从零开始训练扩散语言模型更为高效尤其在训练初期阶段如下图所示。Dream 1B 模型上 200B token 的从零训练与使用 LLaMA3.2 1B 进行 AR 初始化的损失对比。AR 初始化虽然在从因果注意力向全注意力转变初期也会经历损失上升但在整个训练周期中始终保持低于从零训练的水平。Dream 7B 最终选择了 Qwen2.5 7B 的权重作为初始化基础。在训练过程中作者发现学习率参数至关重要设置过高会迅速冲淡初始权重中宝贵的从左到右知识对扩散训练几无助益设置过低则会束缚扩散训练的进展。作者精心选择了这个参数以及其他训练参数。借助 AR 模型中已有的从左到右知识结构扩散模型的任意顺序学习能力得到显著增强大幅减少了预训练所需的 token 量和计算资源。上下文自适应 token 级噪声重排序列中每个 token 的选择深受其上下文环境影响然而作者观察到现有扩散训练方法未能充分把握这一核心要素。具体而言传统离散扩散训练中系统首先采样一个时间步 t 来确定句子级噪声水平随后模型执行去噪操作。但由于实际学习最终在 token 级别进行离散噪声的应用导致各 token 的实际噪声水平与 t 值并不完全对应。这一不匹配导致模型对拥有不同上下文信息丰富度的 token 学习效果参差不齐。上下文自适应 token 级噪声重排机制示意图。Dream 通过精确测量上下文信息量为每个掩码 token 动态调整 token 级时间步 t。针对这一挑战作者创新性地提出了上下文自适应 token 级噪声重排机制该机制能根据噪声注入后的受损上下文智能调整各 token 的噪声水平。这一精细化机制为每个 token 的学习过程提供了更为精准的层次化指导。规划能力在此前的研究中作者已证实文本扩散可以在小规模、特定任务场景下展现出色的规划能力。然而一个关键问题始终悬而未决这种能力是否能扩展到通用、大规模扩散模型中如今凭借 Dream 7B 的问世他们终于能够给出更加确切的答案。他们选择了《Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning》中的 Countdown 和数独任务作为测试平台这些任务允许研究者精确调控规划难度。评估对象包括 Dream 7B、LLaDA 8B、Qwen2.5 7B 和 LLaMA3 8B并将最新的 Deepseek V3 671B0324作为参考基准。所有模型均在少样本学习环境下进行测试且未针对这些特定任务进行过专门训练。不同规划难度下不同模型在 Countdown 和数独任务中的性能表现对比。结果清晰显示Dream 在同等规模模型中表现卓越。特别值得一提的是两种扩散模型均显著超越了同级别 AR 模型在某些情况下甚至优于最新的 DeepSeek V3尽管后者拥有数量级更庞大的参数规模。这一现象背后的核心洞见是扩散语言模型在处理多重约束问题或实现特定目标任务时更有效。以下为 Qwen 2.5 7B 与 Dream 7B 在三个规划任务中的表现示例Qwen2.5 7B 与 Dream 7B 的生成结果对比。推理灵活性相较于 AR 模型扩散模型在两个核心维度上显著增强了推理灵活性。任意顺序生成扩散模型彻底打破了传统从左到右生成的束缚能够按任意顺序合成输出内容 —— 这一特性为多样化的用户查询提供了可能性。1、Completion 任务Dream-7B-instruct 执行补全任务的效果展示。2、Infilling 任务Dream-7B-instruct 执行指定结尾句填充任务的效果展示。3、精细控制解码行为不同类型的查询通常需要不同的响应生成顺序。通过调整解码超参数我们可以精确控制模型的解码行为实现从类 AR 模型的严格从左到右生成到完全自由的随机顺序生成的全谱系调控。模拟 AR 模型的从左到右解码模式。在解码顺序中引入适度随机性。完全随机化的解码顺序。灵活的质量 - 速度权衡在上述演示中作者展示了每步生成单个 token 的情况。然而每步生成的 token 数量由扩散步骤控制可以根据需求动态调整从而在速度和质量之间提供可调的权衡减少步骤可获得更快但粗略的结果增加步骤则以更高计算成本换取更优质的输出。这一机制为推理时间 scaling 开辟了全新维度不是替代而是补充了主流大型语言模型如 o1 和 r1中采用的长思维链推理等技术。这种灵活可调的计算 - 质量平衡机制正是扩散模型相较传统 AR 框架的独特优势所在。Dream 7B 与 Qwen2.5 7B 在 Countdown 任务上的质量 - 速度性能对比。通过精准调整扩散时间步参数Dream 能够在速度优先与质量优先之间实现灵活切换。有监督微调作为扩散语言模型后训练阶段的关键一步作者实施了有监督微调以增强 Dream 与用户指令的对齐度。他们精心从 Tulu 3 和 SmolLM2 筛选并整合了 180 万对高质量指令 - 响应数据对 Dream 进行了三轮深度微调。实验结果充分展现了 Dream 在性能表现上与顶尖自回归模型比肩的潜力。展望未来作者正积极探索为扩散语言模型量身定制更先进的后训练优化方案。有监督微调效果对比图。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】