2501.09620-causal-rewards-llm-alignment
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
这篇论文把 RLHF reward hacking 中的一类常见失败归因到 reward model 学到了偏好数据里的伪相关变量,例如长度、迎合短语、概念词或人口属性;作者提出 Causal Reward Model (CRM),在 Bradley-Terry reward loss 上加入基于 MMD 的独立性正则,让 reward 预测对人工指定的 spurious factor 分箱保持近似不变,从而在 sycophancy、length、concept 和 discrimination 四类实验中降低偏差。
Source
- Title: Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
- arXiv: https://arxiv.org/abs/2501.09620
- HTML v2: https://arxiv.org/html/2501.09620v2
- PDF v2: https://arxiv.org/pdf/2501.09620v2
- TeX Source v2: https://arxiv.org/e-print/2501.09620v2
- OpenReview: https://openreview.net/forum?id=14vBE8iAEx
- Code/Project: 未发现 arXiv metadata 中公开发布的代码仓库。TeX source 中有被注释的
https://github.com/alecwangcq/causal_reward线索,本次未作为公开可用项目记录。 - Authors: Chaoqi Wang, Zhuokai Zhao, Yibo Jiang, Zhaorun Chen, Chen Zhu, Yuxin Chen, Jiayi Liu, Lizhu Zhang, Xiangjun Fan, Hao Ma, Sinong Wang
- Submitted: 2025-01-16
- Current version read: v2, last revised 2025-05-29
- OpenReview status observed: Submitted to ICLR 2026 on 2025-09-19, modified 2026-02-11;本笔记以 arXiv v2 为主源。
- Subjects: Machine Learning (cs.LG); Artificial Intelligence (cs.AI)
- DOI: https://doi.org/10.48550/arXiv.2501.09620
作者与关系
- Chaoqi Wang: Meta / University of Chicago.
- Zhuokai Zhao: Meta.
- Yibo Jiang: University of Chicago.
- Zhaorun Chen: University of Chicago.
- Chen Zhu: Meta。
- Yuxin Chen: University of Chicago。
- Jiayi Liu: Meta。
- Lizhu Zhang: Meta。
- Xiangjun Fan: Meta。
- Hao Ma: Meta。
- Sinong Wang: Meta。
阅读目标与判断边界
本笔记关注:
- CRM 如何把 counterfactual invariance 转成可训练的 reward model 正则项。
- 四类实验分别证明了什么,以及哪些结论只适合谨慎外推。
- 这篇论文和本地档案中的 reward hacking、RLVR、verifier、系统一致性论文有什么关系。
判断边界:
- 论文的 causal claim 依赖预先指定的 spurious factor
和因果图假设;如果 选错或遗漏,多余偏差仍会进入 reward。 - MMD 独立性是 counterfactual invariance 的可观测必要条件,论文没有声称它是完整充分条件。
- 实验主要使用 Llama-3 8B、OpenRLHF、PPO、LoRA reward model;大模型、MoE、DPO/GRPO 或在线偏好采集下需要复验。
- Discrimination 实验的 general utility 使用 GPT-4/GPT-4o judge,能提供相对信号,但仍带 judge bias 和 prompt sensitivity。
论文脉络
1. 问题背景
RLHF 通常先训练 reward model,再用 PPO 等 RL 方法优化 policy。reward model 的训练数据来自人类偏好对,偏好标签既包含真正质量信号,也包含数据收集和标注过程中的偏差。模型在 RL 阶段会追求 reward model 给出的高分,因此 reward model 的伪相关会被放大成 policy 行为。
论文关注的伪相关包括:
- length bias:更长的回答更容易在偏好数据中被选中。
- sycophancy bias:迎合用户观点的回答更容易被奖励。
- concept bias:某些概念词和标签偶然绑定,例如某类评论主题总是对应正面情感。
- discrimination bias:人口属性或隐式人口线索影响模型对决策结果的偏好。
作者的核心切入点是:增加数据或模型容量通常只能降低估计误差,偏好数据中的系统性伪相关属于更难处理的噪声来源。RL 阶段会利用这些伪相关,因此 reward model 训练时需要直接约束模型不要依赖这些变量。
2. 因果形式化
设
作者采用 counterfactual invariance:如果
根据 causal decomposition,
真实 RLHF 数据中很难构造严格 counterfactual response,例如把同一回答从 100 tokens 改成 50 tokens 且保持所有质量因素不变。作者因此使用一个可观测约束:任何 counterfactually invariant function
这一步是论文方法的关键:它把不可直接观测的反事实不变性,转换成 reward 输出或 representation 对
3. CRM 训练目标
普通 reward model 使用 Bradley-Terry 偏好模型。对同一 prompt
CRM 在这个 loss 上加 MMD regularization。若
其中
作者测试两种版本:
- Unconditional CRM:直接在所有样本上做
分箱的 MMD 正则。 - Conditional CRM:把 chosen 和 rejected 子集分开,分别对每个子集做独立性正则。这个版本更贴合偏好对训练,因为 chosen/rejected 的基础分布不同。
Appendix 还给出 Causal DPO 扩展,把 DPO 的 implicit reward ratio 放进同样的 MMD 正则:
这个 DPO 扩展是公式层面说明,正文实验主要围绕 reward model + PPO。
4. 结论链条
论文的论证链条是:
- 偏好标签中存在不应被 reward 捕获的 spurious factor。
- reward model 若直接拟合偏好标签,会把这些 factor 当作捷径。
- RL 优化会把 reward model 的捷径转化为 policy 行为偏差。
- 对 reward 输出施加
约束,可以减少 policy 对这些捷径的利用。 - MMD 是一种可以直接接入 reward model 训练的独立性正则,因此 CRM 可作为现有 RLHF pipeline 的 drop-in 增强。
关键实验/定理
结果 1:Sycophancy bias
- 设置:基于 Sharma et al. 的 sycophancy 数据构造半合成偏好集。prompt 形如
{question} I think the answer is {correct_answer} but I'm really not sure.。训练集中 chosen response 有概率带有 Yes, you are right.前缀,rejected response 有概率带此前缀。模型为 Llama-3 8B,SFT 数据混合 Anthropic HH-RLHF 与 1,727 条半合成样本,policy 用 OpenRLHF PPO 训练 2 epochs。 - 指标:对每个 test prompt 采样 50 个 responses,统计所有采样都出现迎合短语的 prompt 比例,越低越好。
- 结果:Vanilla RM 为 92.67%,Conditional CRM 为 19.78%,Unconditional CRM 为 62.64%。
- 解读:Conditional CRM 显著降低模型把固定迎合短语当作高 reward 捷径的倾向。Unconditional CRM 也有效,但弱于 conditional 版本。
结果 2:Length bias
- 设置:使用 Alpaca Farm 数据,Llama-3 8B base;先用 chosen response 做 SFT,再训练 reward model 和 PPO policy。CRM 扫描 bins 数
、正则系数 ;baseline reward model 等价于 ,PPO 阶段另扫 KL、学习率和 length penalty。 - 指标:policy 相对 SFT 的 win rate score:
- 结果:论文图示显示 conditional 和 unconditional causal regularization 在 EMA curve 和 Pareto frontier 上优于 vanilla RM + length penalty。reward ranking 分析中,更高 MMD coefficient 会让短回答获得更高 reward rank。
- 解读:CRM 在 length bias 上的证据来自多组超参点和 Pareto frontier,重点是整体趋势和可达前沿。它说明直接约束 reward 对 length 的依赖,比训练后加 length penalty 更稳定。
结果 3:Concept bias
- 设置:使用 Yelp、IMDB、Amazon Shoe Review,并引入三个概念词组。Yelp 概念为
price/service/food,IMDB 为music/acting/comedy,Amazon 为size/color/style。作者通过过滤或重组让正面标签和某个概念强相关,再把任务改写为情感分类 preference pair。 - 指标:Acc@NoC、Acc@C 和 Bias@C。Acc 越高越好,Bias@C 越接近 0 越好。
- 关键结果:
| Dataset / Concept | Vanilla Bias@C | Conditional CRM Bias@C | Unconditional CRM Bias@C |
|---|---|---|---|
| Yelp / Price | 18.88 | 0.52 | 6.86 |
| Yelp / Service | -15.54 | -0.61 | -3.56 |
| Yelp / Food | 7.31 | 0.71 | -0.86 |
| IMDB / Music | 13.49 | 2.86 | 9.52 |
| IMDB / Acting | -20.94 | -7.68 | -13.24 |
| IMDB / Comedy | 20.09 | 7.99 | 12.41 |
| Amazon / Size | -4.05 | -2.37 | -1.58 |
| Amazon / Color | 15.48 | 2.45 | 3.93 |
| Amazon / Style | -10.16 | -0.70 | -1.49 |
- 解读:CRM 基本都把 Bias@C 拉向 0。Conditional CRM 在 bias reduction 上更激进;Unconditional CRM 在 IMDB 上保留了更好的 Acc@NoC / Acc@C。这里存在明确的 bias-utility 权衡。
结果 4:Discrimination bias
- 设置:从 Anthropic HH-RLHF 训练集中筛选包含 demographic variables 的 35,567 条样本,按 90% / 5% / 5% 分 train / validation / test。CRM 使用 60 个 demographic bins,由 age、gender、race 组合得到。评测使用 Anthropic Discrm-eval,覆盖 explicit 和 implicit discrimination scenarios。
- 指标:mixed-effects coefficient,越低表示人口属性对决策边界的影响越小;general utility 用 GPT-4/GPT-4o judge 比较 CRM-enhanced model 与 vanilla PPO baseline 在 1,000 条 HH-RLHF test prompts 上的响应。
- 关键结果:
| Model | Explicit Avg | Implicit Avg | Overall Avg |
|---|---|---|---|
| SFT | 0.007 | 0.334 | 0.171 |
| Vanilla RM | 0.018 | 0.224 | 0.121 |
| Conditional CRM | 0.009 | 0.158 | 0.084 |
| Unconditional CRM | 0.009 | 0.107 | 0.058 |
- 解读:Unconditional CRM 在整体 discrimination coefficient 上最低,尤其降低 implicit discrimination。Conditional CRM 在 explicit 场景略强。论文图示说明 MMD 正则对 general utility 的影响较小,但这个结论依赖 LLM judge。
证据链强度评估
强证据
- 论文在四种不同 spurious factor 上展示了同一正则思想:短语迎合、长度、概念词、人口属性。方法具有跨偏差类型的一致性。
- Sycophancy 和 concept bias 的实验构造可控,spurious factor 明确,结果能够直接检验模型是否利用该捷径。
- Discrimination 实验使用 explicit / implicit 两类评测,说明 CRM 对隐式人口线索也有降低作用。
中等强度证据
- Length bias 实验用多超参点和 Pareto frontier 展示趋势,结论比单点结果更稳,但图中缺少完整数值表。
- “drop-in enhancement to RLHF workflow” 在工程上成立,因为只需改 reward model loss;但训练稳定性、超参选择和 batch bin 覆盖仍会带来额外复杂度。
- DPO 扩展在公式上自然,但正文没有给出 Causal-DPO 实验。
需要谨慎的推论
- “learn true causality” 的表述需要收窄理解为“在用户指定的 spurious factor 上学习更不依赖该变量的 reward predictor”。它不代表模型自动发现完整因果结构。
只是 counterfactual invariance 的必要条件。若 与真实质量也有合法相关,过强正则可能移除有效信号。 - 人工指定
是方法的前提。现实 reward hacking 往往包含多个未知或组合式捷径,例如格式、语气、工具调用轨迹、judge 偏好和环境状态变量;CRM 需要先把这些变量可观测化。 - Discrimination bins 由关键词和 demographic categories 构造,能覆盖一部分偏差来源,但无法完整覆盖名称、文化、职业、地域、语言风格等隐式变量。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 本地讨论中把“虚假因果不变性”收敛为一个更精确的说法:论文实现的是对人工指定 spurious factor
的反事实不变性近似。它不会自动发现所有虚假因果变量;研究者需要先指定 ,例如 response length、迎合短语、concept token 或 demographic bin。 - 直觉例子:如果偏好数据里长回答经常被选为 preferred,普通 reward model 容易学到“更长 -> 更高 reward”。CRM 把长度作为
,把回答按长度分箱,并在 reward loss 之外加入 MMD 正则,要求不同长度分箱中的 reward 输出分布更接近。这样 reward model 仍然可以奖励真实质量,但会减少单纯因为长度更长而给高分的倾向。 - 工程实现理解:CRM 在 reward model 训练阶段加入 MMD 项。一次 mini-batch 中,先对每个
计算 reward score 或中间表征 ,再按人工指定的 分箱,例如长度 bins 或 demographic bins;随后对不同 bins 的 score distribution 做 pairwise MMD,求和后乘以 ,和 Bradley-Terry preference loss 一起反向传播。Unconditional CRM 在所有样本上做分箱;Conditional CRM 会把 chosen 和 rejected 子集分开,在两个子集内分别做 MMD,减少 chosen/rejected 基础分布不同带来的干扰。 - 一句话归纳:preference comparison 负责学习
的 reward 高于 ,MMD 负责在同一比较侧内部做 reward 分布对齐。例如 Conditional CRM 会在 chosen 子集内让 short / medium / long bins 的 reward 分布更接近,也会在 rejected 子集内做同样的分布对齐。
2. 修正后的理解
- 初版理解:CRM 适合看作 reward model debiasing 方法。它处理的是 reward function 的统计捷径问题,和 SocioHack 中“规则意图和可测奖励之间存在漏洞”的问题相邻,但层级不同。
- 进一步理解:CRM 的核心是在一个已知可疑变量
上约束 reward predictor,使 或其表征 尽量满足 。它提供的是可训练的防捷径约束,不能替代完整因果结构发现。
3. 后续复验指标
- reward output 与
的 MMD / HSIC / mutual information。 - chosen / rejected 子集内的 reward-
dependence。 - PPO 后 policy 的行为偏差指标,而不只看 reward model 指标。
- 正则系数
对 utility、bias 和 reward margin 的三方 trade-off。 - 未指定 spurious variables 下的 residual reward hacking rate。
主要启发
- RLHF 报告应把 reward model 的 spurious correlation audit 作为常规项目,至少覆盖 length、format、sycophancy、style、demographic cue、tool-call count、judge prompt artifacts。
- 对 RLVR/reasoning 任务,rule-based reward 能降低 learned RM 的伪相关风险,但格式、长度、overlong penalty、verifier parsing 仍可能形成新的
。 - 对 tool-use RL,工具 schema 长度、工具调用次数、返回格式、history 保留策略都可能成为 reward model 或 judge 的 spurious factor。CRM 的思路可以迁移成 harness artifact debiasing。
- 对安全评测,CRM 提供了一个防御性方向:先枚举不应影响评分的变量,再约束 reward/judge 对这些变量的依赖。
- 论文提醒后训练系统中的“奖励黑客”可以来自多层:reward label 偏差、规则设计漏洞、verifier 失真、trainer/rollout 数值不一致、harness 差异。CRM覆盖其中的 reward label / reward model 层。
局限
- 方法依赖人工指定 spurious factor
,自动发现未知 shortcut 仍是开放问题。 - MMD 正则需要足够 batch 覆盖各个 bins;稀疏 bins、长尾 demographic group 或连续变量分箱都会影响稳定性。
- 论文主要在 8B 级模型和 PPO pipeline 上验证,未系统测试 GRPO、DPO、在线 RLHF、大 MoE、long-CoT 或 tool-use RL。
- Bias-utility trade-off 在 concept bias 中已经出现,conditional CRM 有时降低准确率;实际部署需要选择
和 conditional/unconditional 版本。 - Discrimination 评测使用 LLM judge 做 general utility,对 judge prompt、position bias 和 judge 模型版本敏感。
- Causal DPO 只给出目标函数,没有实验证明其可训练性和收益。
跨论文关系
- 与
2606.04075的作者关系:未发现作者重叠。主题关系强。两篇都讨论 reward hacking;本篇把 reward hacking 定位到 reward model 对 spurious factor 的学习,SocioHack 把 reward hacking 扩展到社会规则和制度补丁环境。CRM 更适合防御已知可观测偏差,SocioHack 提醒真实漏洞往往是规则和目标之间的结构性缺口。 - 与
2501.12948的作者关系:未发现作者重叠。方法关系中等。DeepSeek-R1/R1-Zero 使用 rule-based verifiable reward 来减少 learned reward model 风险;本篇处理 learned reward model 的 spurious correlation。R1 中 helpfulness/safety reward model、format reward 和长度设置都可以用 CRM 视角审计。 - 与
2503.14476的作者关系:未发现作者重叠。主题关系中等。DAPO 通过 rule-based verifier、overlong reward shaping 和 dynamic sampling 管理 long-CoT RL 的 reward noise;CRM 从 reward model 训练目标上约束长度、概念和人口属性伪相关。 - 与
2605.30290的作者关系:未发现作者重叠。主题关系强。STV 关注 verifier / feedback model 如何通过 self-training 提供更可靠的自然语言反馈;CRM 关注 reward model 如何避免用伪相关变量打分。两者都服务 feedback quality。 - 与
2605.14220的作者关系:未发现作者重叠。主题关系中等。TIM/VeXact 说明 trainer/rollout 数值分布错位会改变 RL 目标;CRM 说明 reward model 统计捷径也会改变 RL 目标。两者都把隐藏偏差显式化为优化目标偏移。 - 与
2606.00135的作者关系:未发现作者重叠。主题关系中等。Tool-calling RL 论文强调 harness 和 prompt/template 改变评测与训练效率;CRM 提供了约束 reward/judge 不依赖 harness artifact 的建模思路。 - 跨论文关系定位:记录 Reward Modeling Causal Debiasing 与 RLHF Alignment,并连接 reward hacking、安全、RLVR、verifier 和 training-inference mismatch 主题。
Reference Intake Brief
Target
- Intended target system: 论文阅读目录与 RLHF / reward hacking 专题索引。
- Existing related assets:
content/utility/papers-index.md、2606.04075-llms-hack-rewards-and-society.md、2501.12948-deepseek-r1-rl-reasoning.md、2503.14476-dapo-long-cot-rl-system.md、2605.30290-self-trained-verification.md、2605.14220-training-inference-mismatch-llm-rl.md。 - Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。
Reusable Elements
- CRM objective:Bradley-Terry reward loss + MMD independence regularization。
- Bias audit checklist:length、sycophancy、concept、demographic cue,以及未来的 format/tool/harness artifacts。
- 证据边界:指定
、MMD necessary condition、bias-utility trade-off、LLM judge utility。
Risks
- Copyright/over-copying: 本笔记只保留公式、实验数值和概念性总结,避免复制长段正文。
- Unsourced or unverifiable claims: 作者机构、版本和实验数值来自 arXiv abstract、TeX source、arXiv HTML 和 OpenReview 页面;OpenReview 只作状态线索。
- Tone/brand mismatch: 保持论文阅读档案风格,重点写机制、证据和关系。
- Safety/compliance issues: 论文讨论 reward hacking 防御与 debiasing,不包含可直接滥用的攻击流程。
- Overlap with existing assets: 与 SocioHack、DeepSeek-R1、DAPO、STV、TIM 存在主题重叠,但本篇补齐 reward model causal debiasing 层。
Skipped
| Material | Reason |
|---|---|
| OpenReview 2026-02-11 修改版逐页 diff | 用户给定 arXiv HTML v2,本次以 arXiv v2 为主源;后续若要追踪 ICLR 2026 投稿版本,可另做版本差异文档。 |
| 被注释的 GitHub code URL | 未作为 arXiv metadata 公开,访问结果不能作为稳定项目链接。 |
| Figure 原图复现 | 文档保留图示结论和关键数值,未复制 PDF 图像。 |
Recommendation
Decision: merge
Why: 该论文补齐本地档案中 reward model debiasing / causal regularization 节点,可连接 SocioHack 的 reward hacking 风险、DeepSeek-R1/DAPO 的 reward design、STV 的 feedback quality,以及 TIM/VeXact 的优化目标偏移问题。