资讯中心

RLHF 全流程拆解:SFT→奖励模型→PPO,每一步在做什么

📅 2026/8/4 0:28:44
RLHF 全流程拆解:SFT→奖励模型→PPO,每一步在做什么
一个只经过预训练、没经历过RLHF的模型你问它帮我写一封邮件它大概率会续写你的问题——“帮我写一封邮件这是一个很常见的需求……”预训练造出了博闻强识的人RLHF 才把他改造成能干活、有安全边界的助手。这个改造分三步监督微调SFT、奖励模型训练、强化学习优化PPO/DPO/GRPO。每一步解决一个前一步解决不了的问题。今天把整个流程彻底拆开逐步说清楚每一步在做什么、为什么这么设计、以及 2023-2025 年各家的演化方向。为什么预训练不够预训练的目标只有一个预测下一个 token。输入互联网上 TB 级别的文本让模型反复猜下一个词是什么。这个过程让模型积累了惊人的知识但造就了一个奇怪的产物——• 你问如何制造炸弹它可能真的告诉你互联网上有这类文字• 你说帮我总结这份文件它可能先重述一遍你的话再开始总结• 它懂数学但做数学题时会随机出错因为预训练没有对错反馈RLHF 的目标就是打通三道关听指令、回避有害内容、越来越好。完整流程鸟瞰RLHF 三阶段RLHF 包含三个串行阶段每个阶段的产出是下一阶段的输入Phase 3RL 优化 Phase 2奖励模型训练 Phase 1SFT 监督微调 预训练 Base Model 高质量指令→回答对\n人工标注 10k~100k 条 SFT Model\n能对话但不稳定 同问题多答案\n 人类排序偏好 Reward Model\n能打分哪个答案更好 PPO / DPO / GRPO\n用打分信号持续优化 LLM Chat Model\n对话流畅、安全、能推理下面逐阶段拆解。Phase 1SFTRLHF 的训练起点核心问题预训练模型会续写但不会回答。SFT 的数据格式很直接User: 帮我把以下英文翻译成中文Hello WorldAssistant: 你好世界每一条数据就是一个输入指令 → 正确输出的配对。由人工精心撰写或筛选数量从几千到几十万不等——OpenAI 在 InstructGPT 论文里用了约 1.3 万条高质量 SFT 数据效果就已经显著好过纯预训练模型Ouyang et al., 2022。SFT 的本质强制模型学会一种新的输入输出格式。Base Model 看到的是海量随机文本SFT Model 看到的是指令 → 帮助性回答的一致模式。SFT 之后模型已经能正经对话。但有两个残留问题不稳定同一问题多次问答案质量参差不齐“刚好够格”SFT 只能学到数据里已有的正确行为没有机制让模型主动变得更好这引出第二阶段的必要性我们需要一个能持续判断哪个回答更好的打分机制。Phase 2奖励模型RLHF 的偏好代理数据怎么来人类标注员拿到同一个问题的 4 个不同回答按质量排序问题解释一下什么是量子纠缠回答 A[详细、准确、有类比、无危险内容] → 第 1回答 C[准确但太技术性普通人看不懂] → 第 2回答 B[浅显但有轻微错误] → 第 3回答 D[完全跑题] → 第 4这样的偏好对A C B D可以拆成若干个两两比较A C、A B、A D、C B……每一个两两对都是一条训练数据。奖励模型的结构奖励模型Reward ModelRM的结构和 LLM 几乎相同区别在最后一层• LLM 最后一层输出下一个 token 的概率分布• RM 最后一层输出一个标量分数这个回答得几分训练目标让 RM 在人类认为更好的回答上打出更高分数。为什么不直接让人类打分第三阶段的 RL 训练要给模型生成的数百万条输出打分。人类来不及成本也无法承受。奖励模型是人类偏好的代理打分员一次性训练好之后无限复用。这也是 RLHF 最关键的设计取舍用有限的人类标注训练出一个可扩展的偏好代理。Phase 3PPORLHF 的强化学习核心这是三个阶段里工程复杂度最高的一步。四个角色同时在场PPO 训练同时维护四个模型角色职责权重是否更新Actor演员要训练的 LLM生成回答✅ 更新Critic评论家估计当前状态的预期价值辅助优势函数计算✅ 更新Reward Model给 Actor 的输出打分Phase 2 产物❌ 冻结Reference ModelSFT 模型的副本充当基线防止 Actor 跑偏❌ 冻结内存压力可想而知2 个同量级 LLMActor Ref 2 个辅助模型同时驻留 GPU。训练循环KL 惩罚防止奖励 Hacking这是 PPO 最核心的安全机制。假设没有 KL 惩罚模型可能发现反复输出这是个好问题您真聪明然后……能骗过奖励模型得高分。或者生成一段奇怪的重复文本恰好触发 RM 的盲点。KL 散度惩罚强制 Actor 不能与 Reference ModelSFT 模型偏离太远实际奖励 r − β × KL(Actor || Reference)β是超参数β 越大模型越保守β 越小模型探索空间越大但越容易不稳定。PPO 的 clip 机制也起到类似作用每次更新幅度不能太大保证训练稳定。演化DPO 和 GRPO 如何简化 RLHFPPO 的工程复杂度是公认的痛点。2023-2025 年出现了两个重要的简化方案。DPO干掉奖励模型2023 年斯坦福提出DPODirect Preference OptimizationRafailov et al., 2023。核心洞察奖励模型和语言模型之间存在一个解析关系可以直接用偏好对优化语言模型绕过奖励模型训练这一步。DPO 的损失函数直接接收preferred/rejected对Loss −log σ(β × [log P(preferred|x)/P_ref(preferred|x) − log P(rejected|x)/P_ref(rejected|x)])效果把 4 个模型减到 2 个LLM Reference训练代码量大幅下降。维度PPODPO需要 Reward Model✅❌需要 Critic✅❌训练稳定性高clip 机制对数据质量更敏感GPU 内存需求极高4 模型中2 模型适合场景复杂偏好、在线 RL静态偏好数据、快速迭代现在小模型和开源微调实验基本首选 DPO省去了奖励模型训练的工程量。GRPODeepSeek-R1 的推理突破2025 年初GRPOGroup Relative Policy Optimization随 DeepSeek-R1 爆出DeepSeek-AI, 2025。GRPO 的思路更激进把 Critic 也干掉。替代方案是组内相对排名一个数学问题 生成 N8 个回答 规则打分\n对1 错-1 组内得分排名\n高分 → 正向更新\n低分 → 负向更新 更新模型关键条件必须有明确的对错标准。数学题答案对不对、代码能不能运行——这类任务天然适合 GRPO。GRPO 不适合没有明确对错的开放式写作场景。DeepSeek-R1 用 GRPO 训出了长思维链推理能力——模型在解题过程中学会了先想再答的模式而不是经过复杂的 RLHF 人类偏好标注。完整演化对比一图看清三条路Base Model SFT 经典 RLHFPPO 训练 Reward Model PPO 训练\nActorCriticRMRef DPO去掉 RM 直接偏好优化\nLLMRef 两模型 GRPO去掉 CriticRM 组内相对排名\n规则打分 Chat Model\n通用对话 Chat Model\n数据驱动偏好 Reasoning Model\n长思维链推理几个常见误解误解 1RLHF 训练量很小无足轻重SFT 数据量确实比预训练小几个数量级但 RL 阶段的计算量相当可观。PPO 训练每次 rollout 都要推理 打分4 模型同驻 GPU通常需要持续数天到数周的集群计算。误解 2奖励模型很准RM 是人类偏好的代理但不是人类。它有自己的盲点对回答长度有偏更长的回答往往得分更高哪怕质量差、对自信语气有偏。这就是奖励 Hacking问题持续被研究的原因。误解 3DPO 已经完全替代 PPO没有。对于需要在线反馈、复杂偏好建模比如同一个用户不同场景有不同偏好的场景PPO 的在线 RL 优势仍然成立。两者在不同场景下各有用武之地。写在最后RLHF 是一个系统工程而不是一个算法。SFT 解决格式问题奖励模型解决好坏标准问题PPO/DPO/GRPO 解决持续优化问题——三者缺一不可但也可以按场景取舍组合。趋势很清楚后训练流水线正在向更简单、更高效的方向演化。DPO 干掉了奖励模型GRPO 干掉了 Critic未来也许有更极简的方案出现。但核心思路不会变——“根据好坏反馈调整模型行为”这是让 LLM 从知识库变成助手的根本机制。你现在团队用的是哪条路线A. 经典 PPO稳定性最重要B. DPO数据够好就用这个C. GRPO我们做数学/代码任务D. 还在研究中看完文章有点开窍了 这部分建议收藏——三条路线的对比表下次讨论后训练方案直接调出来。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】