小米MiMo-V2.6-Flash-RL推测解码原理DFlash五层MTP草稿模型如何让生成飞起来【免费下载链接】MiMo-V2.6-Flash-RL项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Flash-RL小米 MiMo-V2.6-Flash-RL 是小米推出的 3090 亿参数稀疏 MoE 多模态大模型支持 100 万 token 上下文。它的一大亮点是内置推测解码Speculative Decoding一个仅 5 层的 DFlash 草稿模型MTP 多词元预测一次性并行猜出后续 7 个 token再由主模型一次前向并行验证让生成速度成倍提升而输出结果与单独跑主模型完全一致。本文带你从零看懂这套 DFlash 推测解码的原理。⚡ 为什么大模型需要推测解码逐字生成的瓶颈自回归大模型是一个字一个字往外蹦的每生成一个新 token都必须等上一步算完。生成越长这种串行等待越浪费——GPU 大部分时间卡在显存读写上而不是在计算。推测解码的核心思路可以概括为三步让一个轻量草稿模型先快速打草稿一口气猜出几个 token让大主模型一次前向并行验证这整段草稿保留猜对的前缀猜错的位置则采纳主模型给出的正确答案继续下一轮打草稿。这样每猜一轮、验一轮就能产出多个 token且数学上生成分布与主模型独立运行完全一致——加速但不改变输出。 认识 DFlash只有 5 层的轻量 MTP 草稿模型在 MiMo-V2.6-Flash-RL 仓库中草稿模型被独立放在 dflash/ 目录关键参数见 dflash/config.json参数取值作用层数5只有 5 个 Transformer 层推理开销极小注意力类型滑动窗口窗口 1024只关注附近上下文省算力隐藏维度4096与主模型同维度便于直接复用特征block_size8每轮并行预测 7 个新 tokenis_causalfalse块内 7 个位置双向互看一次算完mask_token_id151675草稿块中待填位置的遮罩标记模型结构定义在 dflash/dflash.pyDFlashDraftModel类。对比主模型 48 层 256 路由专家的稀疏 MoE 架构见 config.json这个草稿模型轻得多却猜得很准。巧妙之处不重算上下文直接借用主模型的特征传统草稿模型要自己从头处理整个提示词开销不低。DFlash 的做法更聪明从主模型 48 层中均匀抽取 5 层——第 0、11、23、35、47 层——的中间隐藏特征把 5 份特征拼接后经过一个线性层fc投影回 4096 维作为草稿模型的上下文草稿层注意力中的 K/V 向量由主模型上下文特征与自身草稿特征拼接而成见 Qwen3DFlashAttention。相当于草稿模型不需要重新读一遍原文而是直接看主模型的笔记就动笔。特征提取逻辑在 extract_context_feature训练时loss_decay_gamma: 7.0还会让模型优先把块内靠前的 token 猜准进一步提升整块命中率。 完整流程草稿 7 个、验证 8 个还白赚 1 个完整推理循环实现在 spec_generate 方法中每一轮大致三步并行打草稿取 8 个位置的块首位放已确定的 token其余 7 位填 mask 标记5 层草稿模型一次前向就得到 7 个新 token 的概率并行验证把这整个 8 token 块送入主模型一次前向算出每个位置的正确答案统计接受从前到后数连续匹配的长度代码用cumprod连乘实现保留匹配前缀且在第一个不匹配处额外采纳主模型的 token 作为奖励 token。也就是说每轮平均能白赚若干个 token而主模型验证 8 个 token 的成本与生成 1 个 token 几乎相同——这就是生成飞起来的原因。⚙️ 实际启用SGLang 部署时加几行参数即可官方推荐使用 SGLang 部署完整命令见 README.md。关键推测解码参数有--speculative-algorithm EAGLE启用草稿-验证框架--speculative-num-steps 3最多草稿步数--speculative-num-draft-tokens 4每步草稿 token 数--enable-multi-layer-eagle启用主模型多层特征复用即上文 DFlash 的特征借用技巧主模型权重按 64 个 MoE 分片存放于根目录如 model_pp0_ep0_shard0.safetensors草稿模型权重随 dflash/ 目录一起分发推理引擎加载时会自动配对使用。总结MiMo-V2.6-Flash-RL 生成快的秘密是先猜后验的分工协作5 层 SWA 草稿模型DFlash一次前向并行猜出 7 个 token复用主模型 5 层中间特征免掉草稿模型重算上下文的开销主模型整块并行验证一次前向验 8 个 token结果与逐字生成完全一致。这套 MTP 推测解码机制是通用的推理加速方案也正是 MiMo-V2.6-Flash-RL 能支撑 100 万上下文长文与 Agent 多轮任务的关键底座。【免费下载链接】MiMo-V2.6-Flash-RL项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Flash-RL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考