资讯中心

奖励决定模型有没有完成任务

📅 2026/8/9 2:48:25
奖励决定模型有没有完成任务
新智元报道DeepSeek-R1之后「让模型想得更久」几乎成了提升推理能力的标准答案。但对多模态大模型而言推理 token 更多并不必然意味着视觉推理更充分。恰恰相反模型在开头还能准确描述图像随着生成内容不断累积后续推理却可能越来越依赖自己写出的文字。只要早期描述出现一点偏差错误就会沿着自回归链条被反复引用、逐步放大最后得到一个语言上严丝合缝、视觉上完全失真的答案。这不是简单的「没看见」而是看见之后没能一直记住。从后训练角度看问题还可以进一步抽象在典型的自回归多模态模型中视觉条件在生成开始时已经固定语言轨迹却随着推理持续增长。如果强化学习只奖励最终答案训练目标就不会主动区分两类轨迹——一类始终以图像为依据另一类中途丢失视觉证据、靠语言先验碰巧答对。久而久之策略优化就可能把概率质量分配给「答案正确但证据失真」的轨迹。本文将这种由rollout数据分布、序列结构与稀疏结果奖励共同诱发的系统性视觉衰减概括为「分布性视觉遗忘」。西北工业大学、香港科技大学和浙江大学的研究团队提出Remember-R1试图从源头上修正这一偏置不修改推理流程而是在强化学习后训练中加入三种过程奖励让模型不仅要答对还必须在整条推理链中持续表达、保留并准确调用视觉证据。论文链接https://arxiv.org/abs/2608.01314代码链接https://github.com/Ch921-cell/Remember-R1模型链接https://huggingface.co/JM-Chen/Remember-R1-7B要理解 Remember-R1首先要区分两个看似相近的问题视觉记忆失败模型最初读取了正确证据却在长链推理中逐渐减少对图像的依赖。Remember-R1针对的是第二种。其关键矛盾可以写成一句话视觉证据是固定条件语言状态是增长变量模型越往后推理越容易被自己生成的文本重新定义上下文。假设同一个问题产生两条推理轨迹轨迹 A 在每个关键步骤都重新调用图像证据最终答对轨迹 B 在中途脱离图像依靠语言先验或早期描述继续推演也最终答对。如果奖励函数只检查最终答案那么两条轨迹得到的结果奖励几乎相同。对强化学习来说它们都是「好样本」。这构成了一个典型的轨迹不可辨识问题结果监督知道终点是否正确却不知道模型为什么到达这个终点。当这种不可辨识性与长序列中的自回归累积叠加视觉遗忘就不再只是偶发错误。每轮 rollout 都可能产生一批「碰巧答对但已经不看图」的轨迹如果这些轨迹继续获得正向优势策略就会逐渐提高它们的生成概率。最终被强化的不只是某个答案而是一种越来越偏向文本自洽、越来越远离视觉证据的推理分布。严格来说这种偏置并非静态训练集单独造成而是由三者共同形成模态分布不对称视觉条件固定文本上下文持续增长信用分配稀疏最终答案奖励难以定位视觉依赖从哪一步开始衰减正确轨迹不唯一相同答案背后可能对应完全不同的证据路径。现有方法通常在推理阶段补救重新插入原图或局部图像或者增加视觉声明和验证步骤。它们解决的是「模型忘了之后如何再看一次」。Remember-R1则把问题前移到后训练阶段追问的是能否从一开始就让模型少学那些会忘记图像的轨迹从「答案正确」到「证据正确」Remember-R1的核心不是简单给模型多发几种奖励而是重新定义什么叫「值得强化的推理」。从优化视角看它的总奖励可以抽象为总奖励 答案正确性奖励 视觉词汇奖励 视觉记忆奖励 视觉关键区域奖励其中答案正确性奖励决定模型有没有完成任务另外三项奖励则约束模型用什么方式完成任务。严格来说论文将后三项称为过程奖励而不是传统损失函数中的 L1、L2 或KL正则项。但从策略优化的作用来看它们构成了行为层面的奖励正则化通过提高视觉忠实轨迹的相对收益缩小「可接受策略」的范围阻止模型沿着纯文本捷径继续优化。第一层用视觉词汇奖励约束「说了什么」研究团队先从训练图像中提取物体类别、颜色、大小、数量和空间关系等短视觉词组再通过严格的词或短语匹配统计回答覆盖了哪些视觉事实。奖励不仅取决于匹配了多少视觉词还取决于这些词最后一次出现的位置。视觉证据覆盖越充分、在推理链中保持得越久得分越高。这一项约束的是视觉证据的语义分布不能只在开头说一句「图中有……」随后就进入纯语言推理关键视觉事实必须持续出现在后续轨迹中。第二层用视觉记忆奖励约束「看了多久」只要求模型反复说出视觉词还不能证明它真的在使用图像。为此Remember-R1从模型最后一层提取每个生成步骤对视觉 token 的注意力并比较推理早期和后期的平均水平。如果后期视觉注意力快速下降奖励就会降低如果模型在整条推理链中保持相对稳定的视觉依赖奖励就会提高。这一项约束的是视觉依赖的时间分布。它不要求注意力绝对不变而是直接惩罚「越想越不看」的系统性衰减。第三层用关键区域奖励约束「看向哪里」模型持续看图并不意味着它看对了地方。无差别关注整张图像同样可能制造虚假的视觉忠实。研究团队将训练样本中的关键区域映射到对应的视觉 token计算注意力落在问题相关区域的比例并对推理后期赋予更高权重。模型不仅要保持视觉注意力还要把有限的注意力预算持续分配给真正决定答案的区域。这一项约束的是视觉注意力的空间分布防止模型通过「形式上看图、实际上看错位置」来获取奖励。三层奖励由此形成完整闭环视觉词汇奖励约束证据有没有进入语言轨迹视觉记忆奖励约束证据有没有贯穿推理前后视觉关键区域奖励约束模型调用的是不是有效证据。它们与答案正确性奖励共同进入 GRPO 训练。对同一个问题生成的多条 rollout依据视觉证据完成推理的轨迹会获得更高相对优势逐渐占据更多策略概率中途滑向纯文本推理的轨迹则被压低。7B模型七项基准全涨给推理过程增加约束最直接的风险是过度正则化模型可能为了反复提及图像而生成冗余描述也可能因为注意力被强行拉回视觉 token损害原有的推理和感知能力。因此Remember-R1需要回答两个问题奖励正则化能否跨任务提升推理以及这种提升是否以牺牲基础视觉能力为代价。实验覆盖数学与逻辑推理、综合多模态能力和视觉感知三类任务。Remember-R1-7B在七项基准上均高于对应基座模型与其他视觉遗忘缓解方法相比也展现出更具竞争力的整体表现。其中MathVista从62.30提升至69.80增加7.50 分MMVet从59.44提升至72.37增加12.93 分RealWorldQA从69.28提升至69.67基础视觉感知能力没有因过程约束而下降。前两项结果表明过程奖励带来的收益并未CNHao.cN局限在一种推理任务上RealWorldQA的结果则说明在论文所测试的范围内Remember-R1不是通过牺牲「看见」的能力来换取「推理」的提升而是在重新组织模型调用既有视觉能力的方式。这组实验为「后训练可以纠偏视觉轨迹分布」提供了实证支持。不过它证明的是论文所覆盖模型与基准上的有效性并不等于视觉遗忘22Co.cN已经被彻底消除。更准确的说法是三种过程奖励显著降低了长链推理向纯文本分布漂移的倾向。全新后训练范式Remember-R1表面上在解决视觉遗忘背后触及的却是大模型后训练中更普遍的问题当结果奖励无法唯一确定正确行为时模型究竟会学到哪一种策略后训练不仅放大能力也规定能力如何被调用一种常见理解是强化学习后训练主要负责激发基础模型中已有的潜在能力。但 Remember-R1进一步表明即使「能力已经存在」模型在长轨JINtc.cN迹中何时调用、持续调用多久、依据哪些证据调用仍然取决于奖励函数如何分配优势。换句话说后训练优化的不只是能力上限也在塑造能力的调用策略。模型具备视觉感知能力不代表它会在长链推理中持续51Byyb.cN使用这种能力只有当视觉依赖进入奖励函数策略优化才会把「持续看图」变成高概率行为。过程奖励的本质是给正确性增加「证据条件」最终答案奖励定义的是模型是否答对。Remember-R1加入的过程奖励定义的是模型是否依据正确证据答对。这一步看似只是奖励工程实际上缓解了结果监督中的不可辨识性。它为「正确」增加了证据条件让原本能够获得相同TCQncy.cN结果奖励的多条轨迹在策略更新中被重新排序。因此奖励正则化不是额外教给模型一个答案而是在改变答案背后的轨迹分布视觉忠实的轨迹被上调脱离观测的语言捷径被下调。从视觉推理走向长程智能体这种分布偏置并非图像问答独有。在长视频理解中早期帧会被后续文本摘要覆盖在屏幕操作中智能体可能逐渐相信CNHao.cN自己的动作描述而不是最新界面状态在机器人导航中内部计划也可能压过实时环境反馈。这些任务具有共同结构外部观测相对固定或稀疏模型内部生成的语言状态持续增长。推理越长策略22Co.cN越可能从「依据环境行动」滑向「依据自身叙事行动」。Remember-R1提供的普遍启示是与其等模型遗忘后再增加检索、回看或验证步骤不如在后训练阶段直接奖励「持续依据环境」的轨迹。只要JINtc.cN能够把证据表达、记忆保持和关键区域注意力转化为可计算信号奖励函数就有机会纠正 rollout 数据中固有的分布漂移。结语长链推理时代人们习惯把更多 token、更长思考和更强能力画上等号。Remember-R1提醒我们对于多模态模型推理长度只有在证据没有中途退出时才有价值。这项工作的关键贡献不只是设计了三种视觉奖励而是把「视觉遗忘」从推理阶段的表面故障重新表述为可以由后训练干预的策略分布问题。答案奖励负责告诉模型终点在哪里过程奖励则不断校准它通往终点的证据路径。从这个意义上说后训练的下一步可能不只是让模型获得更高分而是让它学会无论思考多长都不能忘记自己的判断究竟来自哪里。