资讯中心

阿里Qwen出手:Skill-RM把奖励模型做成可复用Agent Skill

📅 2026/8/7 0:44:27
阿里Qwen出手:Skill-RM把奖励模型做成可复用Agent Skill
一句话讲清楚阿里巴巴 Qwen 团队提出 Skill-RM 把异构的奖励评估标准 rubric 、参考答案、 checklist 、 verifier 等封装成可执行的 Reward-Evaluation Skill 让 Agent 按需检索资源、收集证据并聚合打分在 RewardBench2 、 RM-Bench 、 JudgeBench 三项基准上以 Qwen3.5-27B 骨干取得 86.2 平均分超越同骨干 LLM-as-a-Judge 基线 2.3 分。论文标题Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill论文链接https://arxiv.org/abs/2606.03980Github 链接https://github.com/Qwen-Applications/Skill-RM一道 JSON 题暴露 RM 的「拼凑困境」论文 Figure 1 给了一个极简但典型的判卷场景。 Prompt 要求写一个normalizeScores(values)函数返回包含minScore、maxScore、normalizedScores的 JSON 字符串。两个候选回答摆在一起■A用了 snake_case 键名 JSON 结构也不对■B camelCase 键名正确字段齐全。怎么判如果只看「像不像好代码」两个回答都可能骗过浅层 judge 。真正靠谱的评估要同时动用好几类资源1.Rubric代码类任务优先跑测试2.Checklist camelCase 标识符、精确 JSON 键名3.Verifier Python sandbox 执行parse_json检查4.Aggregation rule正确性优先于风格平局才看次要维度。传统 LLM-as-a-Judge 会把上述内容全塞进一个 prompt 让模型自己琢磨先看哪条、后看哪条。 Skill-RM 换了个思路把这些资源写进 Reward-Evaluation Skill 按固定流程「诊断 → 选资源 → 验证 → 聚合」走一遍。论文示例轨迹里 A 得 2/5 B 得 5/5 最终选 B——每一步证据都挂在结构化输出里事后能复查。这个例子虽小却点中了当下 RM 的核心矛盾评估标准已经碎片化编排层却还停留在 flat prompting。背景 RM 从「打分器」变成「多源验证器」做过 RLHF 管线的人大概都踩过坑训练用的 reward 信号和线上用户真实偏好经常对不上。数学题步骤全对、答案错一位标量 RM 仍可能给高分代码能跑通、变量命名违规 flat judge 有时又过度纠结风格。大模型后训练里 Reward Model RM 是 RLHF 、 RFT 、 GRPO 等流程的「方向盘」。早期范式是点式标量预测优化目标为是 prompt 是回答 输出一个数。简单、快但信息损失大。模型能力往推理、代码、工具调用方向扩张后「怎么判好坏」也跟着变复杂■数学题要对答案、跑 verifier ■代码题要过单元测试■安全场景要拆约束、做 policy veto ■事实类问题要查 reference 、检索证据■Agent 轨迹要逐步校验 tool call 合法性。信号来源各异现有设计却缺统一编排。标量 RM 把多维证据压成不透明分数 LLM-as-a-Judge 能写理由但资源选择、证据追踪、信号聚合往往藏在模型「直觉」里难复现。 rubric 条件化、工具增强 judge 等方向各有进展大多一次只暴露一种资源模态——缺的是可复用、可编排、证据可追溯的抽象层。Agent Skill 范式为何能迁移到 RM Anthropic 的 Agent Skills 、开源 agentskills.io 规范把「怎么做一类任务」打包成文件系统制品核心是SKILL.md流程 元数据旁边挂脚本、参考文档、可执行资源 Agent 按需渐进式加载。奖励评估和 Agent 做任务底层逻辑很像都要在多种工具/文档里选对资源、按步骤执行、留下可复查记录。 Anthropic 的 Skill 把这类流程固化成文件 Skill-RM 把它专门用到「怎么给模型回答打分」。论文把资源库分成五类每类在判卷链路里各司其职资源类型例子作用Rubric Criterion有用性、正确性、安全定义评判维度与优先级Reference答案键、证据段落支撑事实/数学正确性Checklist Constraint格式要求、禁止行为把指令遵循拆成可检查项Verifier ToolPython sandbox产出可执行观测Calibration Aggregation证据优先级规则解决冲突、映射到最终判断Skill-RM 的核心动作把奖励知识外化成Reward-Evaluation Skill——带资源库、调用协议、证据 schema 的可执行评估程序相当于给 judge 一份「判卷说明书」加「工具箱」。Skill-RM 总览 Reward-Evaluation Skill 含流程文档与结构化资源库评估时动态检索 rubric 、 verifier 等资源产出可追溯的 Agentic 评估轨迹。三步走 Skill-RM 实际怎么判一道题把形式化定义翻译成工程语言流程可以压成三步。第一步加载 Skill 规格。 类似读SKILL.md这次要评哪些准则输出格式是点式分数、成对偏好还是从 个候选里选一个论文把 Skill 记为 —— 是说明书 是工具箱。第二步按协议收集证据。 Agentic judge 逐步执行列出可用资源 → 检视 rubric → 调 verifier → 填 checklist 。每激活一条准则 就记一条证据 是观测比如 sandbox 返回parse_json: pass 是局部判定满足/违反/不确定。所有证据汇总成 是最终结论字段。第三步确定性读出奖励。 读出函数 从完整轨迹 映射到任务所需输出 给标量 给最优候选编号 即成对偏好。点式 RM 、 pairwise RM 、 rubric 聚合 RM 被收进同一套 Skill 执行范式——差别只在最后一步怎么读 。关键设计是渐进式披露资源默认潜伏 Skill 规格触发才加载。 flat prompt 把整库资源一次性倒给 judge 上下文噪声会把关键信号淹没——后面消融实验会验证这一点。资源库本身通过 LLM 辅助策展从文献、 benchmark 文档、可验证评估实践里聚合候选去重、泛化、版本冻结。论文 Appendix 列了 6 类通用资源 helpfulness rubric 、 math answer-first rubric 、 code test-first rubric 、 safety bounded-help rubric 、 JSON format checklist 、 evidence priority aggregation rule 加样本级扩展接口。实验同骨干对比才是硬指标RewardBench2 / RM-Bench / JudgeBench 主结果论文在三大 RM benchmark 上对比了标量 RM 、生成式 RM 、 rubric 系统、 agentic judge 等基线。外行看榜单容易被 MoE 大模型分数吸引内行应盯同骨干 Qwen3.5-27B方法RewardBench2RM-BenchJudgeBench平均GPT-4o Judge64.973.159.865.9Skywork-Reward-V2-Llama-3.1-8B84.192.880.085.6Qwen3.5-27B Judge81.189.880.883.9RewardAgent (Qwen3.5-27B)82.080.566.376.3Skill-RM (Qwen3.5-27B)85.091.582.186.2同骨干下 Skill-RM 三项全涨平均从 83.9 提到 86.2 2.3 。 RewardBench2 和 RM-Bench 拿到完整行最高 JudgeBench 上 122B MoE 变体冲到 85.2 27B 版 82.1 也已超过同骨干 judge 的 80.8 。三大 benchmark 完整对比加粗为最高、下划线为次高。 Skill-RM (Qwen3.5-27B) 平均 86.2 为完整行第一。和 TIR-Judge-Zero agentic verifier judge 平均 76.4 比 Skill-RM 的优势在统一编排多种资源而不只是挂一个 Python 执行器。和 OpenRubrics 、 Auto-Rubric 等 rubric 系统比 Skill-RM 能同时调度 rubric 、 reference 、 verifier 、聚合规则不必为每种任务单独改 prompt 模板。挂载样本级资源 RL 场景的关键增益标准 benchmark 通常只给 prompt 和候选回答。真实 RL 管线里 per-sample 的 reference 、约束、 verifier 输出经常可用。 Skill-RM 通过 Skill 接口挂载这些sample-specific资源方法RewardBench2RM-BenchJudgeBench平均Qwen3.5-27B Judge81.189.880.883.9OpenRS sample-spec.84.087.593.188.2Skill-RM85.091.582.186.2Skill-RM sample-spec.86.091.589.789.1OpenRS 在 JudgeBench 上冲到 93.1 定制评估协议但同骨干平均最高仍是 Skill-RM sample-spec. 的 89.1。无样本资源时 Skill-RM 已 2.3 挂上样本资源后再 2.9 说明 Skill 接口对 RL 下游价值更大。消融 append 资源反而降分这篇论文最有启发的一行数据在这里方法平均ΔBaseline (Qwen3.5-27B Judge)83.90.0 appended resources81.0-2.9 appended sample-spec.82.0-1.9 Python tool83.6-0.3Skill-RM86.22.3Skill-RM sample-spec.89.15.2把 reference 和 verifier 直接粘进 prompt 平均分从 83.9 掉到 81.0 。 append 模式下 judge 同时看到 rubric 、 checklist 、 verifier 说明却缺少 Skill 协议规定的「先诊断再选资源」顺序关键信号如 sandbox 的 parse_json 结果容易被长 prompt 稀释——这和渐进式披露的设计正好相反。单独给 Python 工具也几乎没增益 83.6 。2.3 分的提升更像是编排赢了而不是资源变多了。论文还在 GPT-4o 、 Claude-3.5-Sonnet 、 DeepSeek-V3 等多个骨干上做了补充实验 Appendix Table 8 趋势一致 Skill-RM 相对同骨干 flat judge 均有正向提升说明机制不绑死 Qwen 一家。Best-of-N 重排哪里赚、哪里还难JETTS 固定池实验用 Qwen2.5-72B-Instruct 生成 10 个候选比较重排质量和生成能力无关。 Baseline 和 Skill-RM 走相同 sequential pairwise knockout Skywork-Reward-V2-Qwen3-8B 独立打分选最高。■GSM8K Skill-RM 97.8 Oracle10 上界 97.9 Baseline 97.7——数学近乎饱和 Skill 只是把最后 0.1 抠出来■IFEval 、 HumanEval Skill-RM 明显超过 Baseline 和 Skywork 指令遵循和代码场景收益最实在■BigCodeBench Skill-RM 有正向提升但距 Oracle 仍有明显差距复杂代码任务的重排仍是短板。如果你在工程里做采样解码 Best-of-N IFEval 和 HumanEval 值得优先加 Skill-RM 式重排层 BigCodeBench 这类复杂代码任务单靠 judge 重排很难贴近 Oracle10 上界。指令遵循 RL 能当奖励源吗IF-RewardBench 排序Kendall 相关 overall assessment 方法Single-TurnMulti-TurnSystem-Prompt平均Gemini-3-Flash0.5890.4600.4890.513Qwen3.5-27B0.5070.4400.2870.411Skywork-V2-Llama3.1-8B0.1530.2050.0390.133Skill-RM0.6190.5400.4130.524标量 RM Skywork 平均 0.133 在 IF 场景几乎失灵 Skill-RM 平均 0.524 最高 Single-Turn 0.619 和 Multi-Turn 0.540 拉满。 System-Prompt 子集 0.413 仍落后 Gemini-3-Flash 的 0.489——长系统提示是指令遵循 judge 的硬骨头后续 Skill 扩展值得盯。VerInstruct GRPO 下游训练方法IFEvalIFBenchAdvancedIF平均Tulu 382.627.625.045.1VerIF83.727.622.844.7Skill-RM84.827.625.445.9VerIF 是最接近的对照同样用 VerInstruct GRPO 。 Skill-RM 平均 45.9 最高 IFEval 1.1 、 AdvancedIF 2.6 IFBench 持平 27.6 。增幅不大但方向正确——Skill-RM 可以端到端接入 RL 奖励链路而不只是离线 benchmark 刷分。和 TIR-Judge 、 OpenRS 差在哪快速对照三条代表性路线TIR-Judge-Zero给 judge 挂 Python 执行器让模型写代码验证答案。强项是 verifiable 任务弱项是资源类型单一——rubrics 、 checklists 、聚合规则仍靠 prompt 硬塞。OpenRS样本级资源做得深 JudgeBench 上样本资源挂载后极强 93.1 。代价是评估协议定制程度高跨任务泛化要单独适配。Skill-RM用 Skill 抽象统一调度所有资源类型默认协议下就能涨分挂载样本资源后进一步拉升。 trade-off 是推理开销多步 Agentic 轨迹比单次标量 RM 慢论文也承认需要 early stopping 、证据缓存、 artifact 剪枝来控成本。局限三件事还没解决作者列了三条边界1.评估范围以文本 IF 和标准 RM benchmark 为主多模态、长程 Agent 、主观偏好待扩展2.Skill 靠人工策展自动化构建与持续更新是开放题3.推理成本高于标量 RM 生产环境要算 ROI——Best-of-N 重排可能划算每 token 在线 RL 奖励可能要慎重。RM 竞争正在转向「评估基础设施」Skill-RM 本质是把 agentskills.io 那套「说明书 工具箱」搬进判卷同一骨干 Qwen3.5-27B 上编排式 Skill 比 flat judge 平均高 2.3 分 append 资源反而掉 2.9 分——说明问题在流程不在堆料。对齐训练要的是稳定、可审计的奖励信号 flat prompt 每次让 judge 从零决定资源用法复现性和透明度都吃亏。几条工程建议基于论文数据而非空泛展望■RL 管线里已有 reference / verifier 的试试封装成 Skill 式接口别直接 append 进 prompt——消融已经证明会降分■采样解码后加 Best-of-N 重排 IFEval / HumanEval 收益明确■System-Prompt 长上下文场景仍是弱点值得单独扩 Skill 资源库■上线前算清楚延迟 Agentic 多步评估的 token 开销能不能被 Best-of-N 的质量增益覆盖。开源仓库 https://github.com/Qwen-Applications/Skill-RM 已放出。 Qwen 应用团队这条线如果和 Qwen3.5 训练栈深度整合有机会成为开源对齐方案里「可编排奖励」方向的标杆实现。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】