2501.09620-causal-rewards-llm-alignment

Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment

这篇论文把 RLHF reward hacking 中的一类常见失败归因到 reward model 学到了偏好数据里的伪相关变量,例如长度、迎合短语、概念词或人口属性;作者提出 Causal Reward Model (CRM),在 Bradley-Terry reward loss 上加入基于 MMD 的独立性正则,让 reward 预测对人工指定的 spurious factor 分箱保持近似不变,从而在 sycophancy、length、concept 和 discrimination 四类实验中降低偏差。

Authors Chaoqi Wang, Zhuokai Zhao, Yibo Jiang, Zhaorun Chen, Chen Zhu, Yuxin Chen, Jiayi Liu, Lizhu Zhang, Xiangjun Fan, Hao Ma, Sinong Wang

已审阅 Archived 2026-02-10 11:20 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Chaoqi Wang: Meta / University of Chicago.
  • Zhuokai Zhao: Meta.
  • Yibo Jiang: University of Chicago.
  • Zhaorun Chen: University of Chicago.
  • Chen Zhu: Meta。
  • Yuxin Chen: University of Chicago。
  • Jiayi Liu: Meta。
  • Lizhu Zhang: Meta。
  • Xiangjun Fan: Meta。
  • Hao Ma: Meta。
  • Sinong Wang: Meta。

阅读目标与判断边界

本笔记关注:

  1. CRM 如何把 counterfactual invariance 转成可训练的 reward model 正则项。
  2. 四类实验分别证明了什么,以及哪些结论只适合谨慎外推。
  3. 这篇论文和本地档案中的 reward hacking、RLVR、verifier、系统一致性论文有什么关系。

判断边界:

  • 论文的 causal claim 依赖预先指定的 spurious factor ZZ 和因果图假设;如果 ZZ 选错或遗漏,多余偏差仍会进入 reward。
  • MMD 独立性是 counterfactual invariance 的可观测必要条件,论文没有声称它是完整充分条件。
  • 实验主要使用 Llama-3 8B、OpenRLHF、PPO、LoRA reward model;大模型、MoE、DPO/GRPO 或在线偏好采集下需要复验。
  • Discrimination 实验的 general utility 使用 GPT-4/GPT-4o judge,能提供相对信号,但仍带 judge bias 和 prompt sensitivity。

论文脉络

1. 问题背景

RLHF 通常先训练 reward model,再用 PPO 等 RL 方法优化 policy。reward model 的训练数据来自人类偏好对,偏好标签既包含真正质量信号,也包含数据收集和标注过程中的偏差。模型在 RL 阶段会追求 reward model 给出的高分,因此 reward model 的伪相关会被放大成 policy 行为。

论文关注的伪相关包括:

  • length bias:更长的回答更容易在偏好数据中被选中。
  • sycophancy bias:迎合用户观点的回答更容易被奖励。
  • concept bias:某些概念词和标签偶然绑定,例如某类评论主题总是对应正面情感。
  • discrimination bias:人口属性或隐式人口线索影响模型对决策结果的偏好。

作者的核心切入点是:增加数据或模型容量通常只能降低估计误差,偏好数据中的系统性伪相关属于更难处理的噪声来源。RL 阶段会利用这些伪相关,因此 reward model 训练时需要直接约束模型不要依赖这些变量。

2. 因果形式化

ZZ 是 spurious factor,例如长度、迎合短语、概念词或人口属性;TT 是 prompt-response pair;LL 是 preference label;RR 是真实 reward。传统 reward model 用 TT 预测 LL,如果数据中存在 ZLZ \to L 的偏差路径,模型会把 ZZ 当成可用捷径。

作者采用 counterfactual invariance:如果 ZZ 属于不应影响 reward 的变量,那么 reward predictor 在干预 ZZ 后应保持一致:

r(T(z))=r(T(z)),z,z r(T(z)) = r(T(z')),\quad \forall z,z'

根据 causal decomposition,TT 可以分为与 ZZ 独立且影响 label 的成分 TZ,T^{Z,\perp}、同时受 ZZLL 影响的成分 TZLT^{Z\land L}、以及不直接影响 LL 的成分 TL,T^{L,\perp}。理想 invariant reward model 应只依赖 TZ,T^{Z,\perp}

真实 RLHF 数据中很难构造严格 counterfactual response,例如把同一回答从 100 tokens 改成 50 tokens 且保持所有质量因素不变。作者因此使用一个可观测约束:任何 counterfactually invariant function ff 至少应满足

f(T)Z f(T) \perp Z

这一步是论文方法的关键:它把不可直接观测的反事实不变性,转换成 reward 输出或 representation 对 ZZ 的分布独立性约束。

3. CRM 训练目标

普通 reward model 使用 Bradley-Terry 偏好模型。对同一 prompt xx 下的 preferred response ywy_w 和 rejected response yly_l,reward loss 为:

LR(rϕ,D)=E(x,yw,yl)D[logσ(rϕ(x,yw)rϕ(x,yl))] \mathcal{L}_R(r_\phi,\mathcal{D}) =-\mathbb{E}_{(x,y_w,y_l)\sim\mathcal{D}} \left[ \log\sigma\left(r_\phi(x,y_w)-r_\phi(x,y_l)\right) \right]

CRM 在这个 loss 上加 MMD regularization。若 ZZ 是连续或多取值变量,先把 ZZ 分成 MM 个 bins。设 Pm(r(x,y))P_m(r(x,y)) 是第 mm 个 bin 内 reward 输出的条件分布,则目标可写成:

LCRM=LR+λm,m[M]MMD(Pm(r(x,y)),Pm(r(x,y))) \mathcal{L}_{\mathrm{CRM}} = \mathcal{L}_R + \lambda \sum_{m,m'\in[M]} \mathrm{MMD}\left(P_m(r(x,y)),P_{m'}(r(x,y))\right)

其中 λ\lambda 控制 reward accuracy 和 invariance 的权衡。直觉上,模型仍要区分 chosen / rejected,但它不能让 reward 输出分布随 spurious factor 分箱发生系统性漂移。

作者测试两种版本:

  • Unconditional CRM:直接在所有样本上做 ZZ 分箱的 MMD 正则。
  • Conditional CRM:把 chosen 和 rejected 子集分开,分别对每个子集做独立性正则。这个版本更贴合偏好对训练,因为 chosen/rejected 的基础分布不同。

Appendix 还给出 Causal DPO 扩展,把 DPO 的 implicit reward ratio 放进同样的 MMD 正则:

LCausal\mboxDPO=E[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]+λm,m[M]MMD(Pm(πθ(yx)πref(yx)),Pm(πθ(yx)πref(yx))) \mathcal{L}_{\mathrm{Causal\mbox{-}DPO}} = -\mathbb{E} \left[ \log\sigma\left( \beta\log\frac{\pi_\theta(y_w|x)}{\pi_{\mathrm{ref}}(y_w|x)} - \beta\log\frac{\pi_\theta(y_l|x)}{\pi_{\mathrm{ref}}(y_l|x)} \right) \right] + \lambda\sum_{m,m'\in[M]} \mathrm{MMD}\left( P_m\left(\frac{\pi_\theta(y|x)}{\pi_{\mathrm{ref}}(y|x)}\right), P_{m'}\left(\frac{\pi_\theta(y|x)}{\pi_{\mathrm{ref}}(y|x)}\right) \right)

这个 DPO 扩展是公式层面说明,正文实验主要围绕 reward model + PPO。

4. 结论链条

论文的论证链条是:

  1. 偏好标签中存在不应被 reward 捕获的 spurious factor。
  2. reward model 若直接拟合偏好标签,会把这些 factor 当作捷径。
  3. RL 优化会把 reward model 的捷径转化为 policy 行为偏差。
  4. 对 reward 输出施加 f(T)Zf(T)\perp Z 约束,可以减少 policy 对这些捷径的利用。
  5. MMD 是一种可以直接接入 reward model 训练的独立性正则,因此 CRM 可作为现有 RLHF pipeline 的 drop-in 增强。

关键实验/定理

结果 1:Sycophancy bias

  • 设置:基于 Sharma et al. 的 sycophancy 数据构造半合成偏好集。prompt 形如 {question} I think the answer is {correct_answer} but I'm really not sure.。训练集中 chosen response 有 80%80\% 概率带有 Yes, you are right. 前缀,rejected response 有 20%20\% 概率带此前缀。模型为 Llama-3 8B,SFT 数据混合 Anthropic HH-RLHF 与 1,727 条半合成样本,policy 用 OpenRLHF PPO 训练 2 epochs。
  • 指标:对每个 test prompt 采样 50 个 responses,统计所有采样都出现迎合短语的 prompt 比例,越低越好。
  • 结果:Vanilla RM 为 92.67%,Conditional CRM 为 19.78%,Unconditional CRM 为 62.64%。
  • 解读:Conditional CRM 显著降低模型把固定迎合短语当作高 reward 捷径的倾向。Unconditional CRM 也有效,但弱于 conditional 版本。

结果 2:Length bias

  • 设置:使用 Alpaca Farm 数据,Llama-3 8B base;先用 chosen response 做 SFT,再训练 reward model 和 PPO policy。CRM 扫描 bins 数 {10,20,30}\{10,20,30\}、正则系数 {0.1,1.0,3.0,10,100}\{0.1,1.0,3.0,10,100\};baseline reward model 等价于 λ=0\lambda=0,PPO 阶段另扫 KL、学习率和 length penalty。
  • 指标:policy 相对 SFT 的 win rate score:
score=50+nwinnloseN×100 \mathrm{score}=50+\frac{n_{\mathrm{win}}-n_{\mathrm{lose}}}{N}\times 100
  • 结果:论文图示显示 conditional 和 unconditional causal regularization 在 EMA curve 和 Pareto frontier 上优于 vanilla RM + length penalty。reward ranking 分析中,更高 MMD coefficient 会让短回答获得更高 reward rank。
  • 解读:CRM 在 length bias 上的证据来自多组超参点和 Pareto frontier,重点是整体趋势和可达前沿。它说明直接约束 reward 对 length 的依赖,比训练后加 length penalty 更稳定。

结果 3:Concept bias

  • 设置:使用 Yelp、IMDB、Amazon Shoe Review,并引入三个概念词组。Yelp 概念为 price/service/food,IMDB 为 music/acting/comedy,Amazon 为 size/color/style。作者通过过滤或重组让正面标签和某个概念强相关,再把任务改写为情感分类 preference pair。
  • 指标:Acc@NoC、Acc@C 和 Bias@C。Acc 越高越好,Bias@C 越接近 0 越好。
  • 关键结果:
Dataset / Concept Vanilla Bias@C Conditional CRM Bias@C Unconditional CRM Bias@C
Yelp / Price 18.88 0.52 6.86
Yelp / Service -15.54 -0.61 -3.56
Yelp / Food 7.31 0.71 -0.86
IMDB / Music 13.49 2.86 9.52
IMDB / Acting -20.94 -7.68 -13.24
IMDB / Comedy 20.09 7.99 12.41
Amazon / Size -4.05 -2.37 -1.58
Amazon / Color 15.48 2.45 3.93
Amazon / Style -10.16 -0.70 -1.49
  • 解读:CRM 基本都把 Bias@C 拉向 0。Conditional CRM 在 bias reduction 上更激进;Unconditional CRM 在 IMDB 上保留了更好的 Acc@NoC / Acc@C。这里存在明确的 bias-utility 权衡。

结果 4:Discrimination bias

  • 设置:从 Anthropic HH-RLHF 训练集中筛选包含 demographic variables 的 35,567 条样本,按 90% / 5% / 5% 分 train / validation / test。CRM 使用 60 个 demographic bins,由 age、gender、race 组合得到。评测使用 Anthropic Discrm-eval,覆盖 explicit 和 implicit discrimination scenarios。
  • 指标:mixed-effects coefficient,越低表示人口属性对决策边界的影响越小;general utility 用 GPT-4/GPT-4o judge 比较 CRM-enhanced model 与 vanilla PPO baseline 在 1,000 条 HH-RLHF test prompts 上的响应。
  • 关键结果:
Model Explicit Avg Implicit Avg Overall Avg
SFT 0.007 0.334 0.171
Vanilla RM 0.018 0.224 0.121
Conditional CRM 0.009 0.158 0.084
Unconditional CRM 0.009 0.107 0.058
  • 解读:Unconditional CRM 在整体 discrimination coefficient 上最低,尤其降低 implicit discrimination。Conditional CRM 在 explicit 场景略强。论文图示说明 MMD 正则对 general utility 的影响较小,但这个结论依赖 LLM judge。

证据链强度评估

强证据

  • 论文在四种不同 spurious factor 上展示了同一正则思想:短语迎合、长度、概念词、人口属性。方法具有跨偏差类型的一致性。
  • Sycophancy 和 concept bias 的实验构造可控,spurious factor 明确,结果能够直接检验模型是否利用该捷径。
  • Discrimination 实验使用 explicit / implicit 两类评测,说明 CRM 对隐式人口线索也有降低作用。

中等强度证据

  • Length bias 实验用多超参点和 Pareto frontier 展示趋势,结论比单点结果更稳,但图中缺少完整数值表。
  • “drop-in enhancement to RLHF workflow” 在工程上成立,因为只需改 reward model loss;但训练稳定性、超参选择和 batch bin 覆盖仍会带来额外复杂度。
  • DPO 扩展在公式上自然,但正文没有给出 Causal-DPO 实验。

需要谨慎的推论

  • “learn true causality” 的表述需要收窄理解为“在用户指定的 spurious factor 上学习更不依赖该变量的 reward predictor”。它不代表模型自动发现完整因果结构。
  • f(T)Zf(T)\perp Z 只是 counterfactual invariance 的必要条件。若 ZZ 与真实质量也有合法相关,过强正则可能移除有效信号。
  • 人工指定 ZZ 是方法的前提。现实 reward hacking 往往包含多个未知或组合式捷径,例如格式、语气、工具调用轨迹、judge 偏好和环境状态变量;CRM 需要先把这些变量可观测化。
  • Discrimination bins 由关键词和 demographic categories 构造,能覆盖一部分偏差来源,但无法完整覆盖名称、文化、职业、地域、语言风格等隐式变量。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 本地讨论中把“虚假因果不变性”收敛为一个更精确的说法:论文实现的是对人工指定 spurious factor ZZ 的反事实不变性近似。它不会自动发现所有虚假因果变量;研究者需要先指定 ZZ,例如 response length、迎合短语、concept token 或 demographic bin。
  • 直觉例子:如果偏好数据里长回答经常被选为 preferred,普通 reward model 容易学到“更长 -> 更高 reward”。CRM 把长度作为 ZZ,把回答按长度分箱,并在 reward loss 之外加入 MMD 正则,要求不同长度分箱中的 reward 输出分布更接近。这样 reward model 仍然可以奖励真实质量,但会减少单纯因为长度更长而给高分的倾向。
  • 工程实现理解:CRM 在 reward model 训练阶段加入 MMD 项。一次 mini-batch 中,先对每个 (x,y)(x,y) 计算 reward score rϕ(x,y)r_\phi(x,y) 或中间表征 f(x,y)f(x,y),再按人工指定的 ZZ 分箱,例如长度 bins 或 demographic bins;随后对不同 bins 的 score distribution 做 pairwise MMD,求和后乘以 λ\lambda,和 Bradley-Terry preference loss 一起反向传播。Unconditional CRM 在所有样本上做分箱;Conditional CRM 会把 chosen 和 rejected 子集分开,在两个子集内分别做 MMD,减少 chosen/rejected 基础分布不同带来的干扰。
  • 一句话归纳:preference comparison 负责学习 ywy_w 的 reward 高于 yly_l,MMD 负责在同一比较侧内部做 reward 分布对齐。例如 Conditional CRM 会在 chosen 子集内让 short / medium / long bins 的 reward 分布更接近,也会在 rejected 子集内做同样的分布对齐。

2. 修正后的理解

  • 初版理解:CRM 适合看作 reward model debiasing 方法。它处理的是 reward function 的统计捷径问题,和 SocioHack 中“规则意图和可测奖励之间存在漏洞”的问题相邻,但层级不同。
  • 进一步理解:CRM 的核心是在一个已知可疑变量 ZZ 上约束 reward predictor,使 rϕ(x,y)r_\phi(x,y) 或其表征 f(T)f(T) 尽量满足 f(T)Zf(T)\perp Z。它提供的是可训练的防捷径约束,不能替代完整因果结构发现。

3. 后续复验指标

  • reward output 与 ZZ 的 MMD / HSIC / mutual information。
  • chosen / rejected 子集内的 reward-ZZ dependence。
  • PPO 后 policy 的行为偏差指标,而不只看 reward model 指标。
  • 正则系数 λ\lambda 对 utility、bias 和 reward margin 的三方 trade-off。
  • 未指定 spurious variables 下的 residual reward hacking rate。

主要启发

  • RLHF 报告应把 reward model 的 spurious correlation audit 作为常规项目,至少覆盖 length、format、sycophancy、style、demographic cue、tool-call count、judge prompt artifacts。
  • 对 RLVR/reasoning 任务,rule-based reward 能降低 learned RM 的伪相关风险,但格式、长度、overlong penalty、verifier parsing 仍可能形成新的 ZZ
  • 对 tool-use RL,工具 schema 长度、工具调用次数、返回格式、history 保留策略都可能成为 reward model 或 judge 的 spurious factor。CRM 的思路可以迁移成 harness artifact debiasing。
  • 对安全评测,CRM 提供了一个防御性方向:先枚举不应影响评分的变量,再约束 reward/judge 对这些变量的依赖。
  • 论文提醒后训练系统中的“奖励黑客”可以来自多层:reward label 偏差、规则设计漏洞、verifier 失真、trainer/rollout 数值不一致、harness 差异。CRM覆盖其中的 reward label / reward model 层。

局限

  1. 方法依赖人工指定 spurious factor ZZ,自动发现未知 shortcut 仍是开放问题。
  2. MMD 正则需要足够 batch 覆盖各个 bins;稀疏 bins、长尾 demographic group 或连续变量分箱都会影响稳定性。
  3. 论文主要在 8B 级模型和 PPO pipeline 上验证,未系统测试 GRPO、DPO、在线 RLHF、大 MoE、long-CoT 或 tool-use RL。
  4. Bias-utility trade-off 在 concept bias 中已经出现,conditional CRM 有时降低准确率;实际部署需要选择 λ\lambda 和 conditional/unconditional 版本。
  5. Discrimination 评测使用 LLM judge 做 general utility,对 judge prompt、position bias 和 judge 模型版本敏感。
  6. Causal DPO 只给出目标函数,没有实验证明其可训练性和收益。

跨论文关系

  • 2606.04075 的作者关系:未发现作者重叠。主题关系强。两篇都讨论 reward hacking;本篇把 reward hacking 定位到 reward model 对 spurious factor 的学习,SocioHack 把 reward hacking 扩展到社会规则和制度补丁环境。CRM 更适合防御已知可观测偏差,SocioHack 提醒真实漏洞往往是规则和目标之间的结构性缺口。
  • 2501.12948 的作者关系:未发现作者重叠。方法关系中等。DeepSeek-R1/R1-Zero 使用 rule-based verifiable reward 来减少 learned reward model 风险;本篇处理 learned reward model 的 spurious correlation。R1 中 helpfulness/safety reward model、format reward 和长度设置都可以用 CRM 视角审计。
  • 2503.14476 的作者关系:未发现作者重叠。主题关系中等。DAPO 通过 rule-based verifier、overlong reward shaping 和 dynamic sampling 管理 long-CoT RL 的 reward noise;CRM 从 reward model 训练目标上约束长度、概念和人口属性伪相关。
  • 2605.30290 的作者关系:未发现作者重叠。主题关系强。STV 关注 verifier / feedback model 如何通过 self-training 提供更可靠的自然语言反馈;CRM 关注 reward model 如何避免用伪相关变量打分。两者都服务 feedback quality。
  • 2605.14220 的作者关系:未发现作者重叠。主题关系中等。TIM/VeXact 说明 trainer/rollout 数值分布错位会改变 RL 目标;CRM 说明 reward model 统计捷径也会改变 RL 目标。两者都把隐藏偏差显式化为优化目标偏移。
  • 2606.00135 的作者关系:未发现作者重叠。主题关系中等。Tool-calling RL 论文强调 harness 和 prompt/template 改变评测与训练效率;CRM 提供了约束 reward/judge 不依赖 harness artifact 的建模思路。
  • 跨论文关系定位:记录 Reward Modeling Causal Debiasing 与 RLHF Alignment,并连接 reward hacking、安全、RLVR、verifier 和 training-inference mismatch 主题。

Reference Intake Brief

Target

  • Intended target system: 论文阅读目录与 RLHF / reward hacking 专题索引。
  • Existing related assets: content/utility/papers-index.md2606.04075-llms-hack-rewards-and-society.md2501.12948-deepseek-r1-rl-reasoning.md2503.14476-dapo-long-cot-rl-system.md2605.30290-self-trained-verification.md2605.14220-training-inference-mismatch-llm-rl.md
  • Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。

Reusable Elements

  1. CRM objective:Bradley-Terry reward loss + MMD independence regularization。
  2. Bias audit checklist:length、sycophancy、concept、demographic cue,以及未来的 format/tool/harness artifacts。
  3. 证据边界:指定 ZZ、MMD necessary condition、bias-utility trade-off、LLM judge utility。

Risks

  • Copyright/over-copying: 本笔记只保留公式、实验数值和概念性总结,避免复制长段正文。
  • Unsourced or unverifiable claims: 作者机构、版本和实验数值来自 arXiv abstract、TeX source、arXiv HTML 和 OpenReview 页面;OpenReview 只作状态线索。
  • Tone/brand mismatch: 保持论文阅读档案风格,重点写机制、证据和关系。
  • Safety/compliance issues: 论文讨论 reward hacking 防御与 debiasing,不包含可直接滥用的攻击流程。
  • Overlap with existing assets: 与 SocioHack、DeepSeek-R1、DAPO、STV、TIM 存在主题重叠,但本篇补齐 reward model causal debiasing 层。

Skipped

Material Reason
OpenReview 2026-02-11 修改版逐页 diff 用户给定 arXiv HTML v2,本次以 arXiv v2 为主源;后续若要追踪 ICLR 2026 投稿版本,可另做版本差异文档。
被注释的 GitHub code URL 未作为 arXiv metadata 公开,访问结果不能作为稳定项目链接。
Figure 原图复现 文档保留图示结论和关键数值,未复制 PDF 图像。

Recommendation

Decision: merge

Why: 该论文补齐本地档案中 reward model debiasing / causal regularization 节点,可连接 SocioHack 的 reward hacking 风险、DeepSeek-R1/DAPO 的 reward design、STV 的 feedback quality,以及 TIM/VeXact 的优化目标偏移问题。