2604.04648-caution-pessimism-best-of-n-reward-hacking

From Curiosity to Caution: Mitigating Reward Hacking for Best of $N$ with Pessimism

Best-of-N 在候选数量增大时会把输出推向 reward model 高估且分布外的区域,作者提出 caution:训练一个 predictor 去预测冻结 reward model 的中间特征,用预测误差作为分布外不确定性,并在推理时从 reward score 中扣除该不确定性,从而让多候选选择既能利用额外 inference compute,也能降低候选数量较大时的 reward hacking。

Authors Zhuohao Yu, Zhiwei Steven Wu, Adam Block

已审阅 Archived 2026-04-17 10:20 Updated 2026-07-13 09:48 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Zhuohao Yu: Carnegie Mellon University.
  • Zhiwei Steven Wu: Carnegie Mellon University.
  • Adam Block: Columbia University.

阅读目标与判断边界

本笔记关注:

  1. Best-of-NN 为什么会在大 NN 下发生 inference-time reward hacking。
  2. caution 如何把 RL pessimism / RND-style prediction error 转成 reward-level penalty。
  3. 它与已存档 reward hacking、RLVR、verifier-guided inference、large rollout exploration 论文的关系。

判断边界:

  • 本文主要评估 reasoning benchmarks 和 learned reward model 下的 candidate reranking;结论不能直接外推到所有安全任务或真实用户交互场景。
  • 理论结果是线性高斯和低维子空间设定下的 proof of concept;语言模型真实分布只借用其直觉。
  • 方法降低了 reward model overoptimization 风险,同时会引入保守性、额外推理开销和 λ\lambda 选择问题。

论文脉络

1. 问题背景

Best-of-NN 的流程很直接:对同一个 prompt xx 采样 NN 个候选响应 y1,,yNπ(x)y_1,\dots,y_N \sim \pi(\cdot\mid x),用 learned reward model r^(x,y)\hat r(x,y) 打分,然后选择最高分:

i^N=argmaxi[N]r^(x,yi). \hat i_N = \arg\max_{i\in[N]} \hat r(x,y_i).

如果 r^\hat r 在 base model 的典型响应分布附近近似真实目标 rr^\star,小 NN 时 BoN 往往有效。随着 NN 增大,极端候选更容易出现,选择分布会偏离 reward model 的训练分布。此时被选中的响应可能拥有高 r^\hat r,但真实正确性或任务质量下降。本文把这个现象定义为 inference-time reward hacking。

2. 核心假设或切入点

作者的关键判断是:reward hacking 候选通常对 reward model 来说是分布外样本。既有工作常通过限制最终选择分布和 base policy 的距离来控制风险,例如 χ2\chi^2 regularized BoN;本文选择在每个候选的 reward estimate 上直接加入不确定性扣分。

这个切入点来自 offline RL / pessimism:如果某个 action 的 reward estimate 不可靠,使用 lower confidence bound 选择更稳的 action。对应到 BoN,作者定义:

rLCB(x,y)=r^(x,y)λα(x,y), r_{\mathrm{LCB}}(x,y)=\hat r(x,y)-\lambda\alpha(x,y),

其中 α(x,y)\alpha(x,y) 是不确定性或 OOD score,λ\lambda 控制 pessimism 强度。最终选择:

i^=argmaxi[N]rLCB(x,yi). \hat i = \arg\max_{i\in[N]} r_{\mathrm{LCB}}(x,y_i).

3. 方法 / 系统 / 理论框架

caution 借用 curiosity / Random Network Distillation 的 prediction error,但用途改成惩罚分布外响应。

作者使用冻结 reward model RR 的第 LL 层 hidden state 作为目标特征:

T(x,y)=hLR(x,y). T(x,y)=h_L^R(x,y).

再训练一个轻量 predictor Pθ(x,y)P_\theta(x,y),让它在典型响应数据上预测这个目标特征:

L(θ)=E(x,y)DtrainPθ(x,y)T(x,y)2. \mathcal L(\theta) = \mathbb E_{(x,y)\sim \mathcal D_{\mathrm{train}}} \left\|P_\theta(x,y)-T(x,y)\right\|^2.

训练数据来自 base model 在训练 prompts 上生成的响应,因此只需要 prompts,不需要新增人工 preference labels。推理时用 predictor error 定义不确定性:

α(x,y)=Pθ(x,y)T(x,y)2. \alpha(x,y)=\left\|P_\theta(x,y)-T(x,y)\right\|^2.

最终的候选分数为:

rLCB(x,y)=r^(x,y)λPθ(x,y)T(x,y)2. r_{\mathrm{LCB}}(x,y) = \hat r(x,y) - \lambda\left\|P_\theta(x,y)-T(x,y)\right\|^2.

直觉上,predictor 在训练分布附近误差小;候选响应越偏离 reward model 熟悉的 feature region,误差越大,扣分越强。与传统 RND 使用随机 target features 不同,本文 target 来自 reward model 中间层,因此 OOD score 与 reward model 的任务相关表示绑定。

4. 结论链条

论文的论证链条是:

  1. BoN 让候选数量 NN 变大,会增加极端高 proxy reward 样本出现概率。
  2. learned reward model 在典型响应附近更可靠,在分布外响应上会依赖长度、格式、表面推理步骤等 spurious features。
  3. predictor error 可以近似衡量候选响应是否落在 reward model 熟悉的 feature manifold 附近。
  4. rLCB=r^λαr_{\mathrm{LCB}}=\hat r-\lambda\alpha 做选择,可以压低 proxy 高估、OOD 高误差候选。
  5. 实验中,普通 reward model BoN 在 N=512N=512 出现明显 accuracy degradation;caution 显著降低 degradation,并在 GSM8K、MATH-500、BBH-Hard 上保持更稳定的 scaling。

关键实验/定理

结果 1:Best-of-NNNN 下出现 reward hacking,caution 降低 degradation

  • 设置:base model 使用 Llama-3.2-3B-Instruct;主 reward model 使用 OASST DeBERTa;候选数量 NN 从 1 到 512;ground-truth reward 是最终答案 correctness;训练 predictor 只用 GSM8K train split 上 base model 生成的响应。
  • 指标:Peak Accuracy、N=512N=512 Final Accuracy、Peak 到 Final 的 Degradation。
  • 结果:
Dataset Method Peak Acc Final Acc at N=512N=512 Degradation
GSM8K Reward Model 79.3 71.5 7.7
GSM8K Pessimism Only 81.3 80.3 1.0
GSM8K RM + Pessimism 82.6 81.1 1.5
MATH-500 Reward Model 11.5 8.5 3.0
MATH-500 Pessimism Only 13.6 11.9 1.7
MATH-500 RM + Pessimism 12.3 10.1 2.3
BBH-Hard Reward Model 17.3 1.7 15.6
BBH-Hard Pessimism Only 22.9 22.1 0.9
BBH-Hard RM + Pessimism 18.5 11.0 7.5
  • 解读:在 GSM8K 上,RM + Pessimism 最强;在 MATH-500 和 BBH-Hard 上,Pessimism Only 更强,说明当 reward model 跨域失效时,继续相信 r^\hat r 会拖累选择,单纯用 distributional familiarity 反而更稳。

结果 2:reward-model features 比传统 random RND 更有效

  • 设置:GSM8K 上扫 λ{0.0,0.2,0.4,0.6,0.8,1.0}\lambda\in\{0.0,0.2,0.4,0.6,0.8,1.0\},比较使用 reward model features 的 caution 与随机 target features 的传统 RND。
  • 指标:Peak Accuracy、N=512N=512 Final Accuracy。
  • 结果:
λ\lambda Caution Peak Caution Final Traditional RND Peak Traditional RND Final
0.0 78.9 71.2 78.9 71.2
0.2 79.5 72.5 78.7 71.3
0.4 80.3 76.0 78.5 72.1
0.6 81.5 80.2 78.4 73.1
0.8 82.1 81.0 78.1 74.9
1.0 81.3 79.8 77.0 72.9
  • 解读:λ=0.6\lambda=0.60.80.8 最稳,说明 penalty 需要足够强才能抑制大 NN 下 proxy exploitation。随机 RND 效果弱,说明 prediction error 本身不够,关键在于 error 是否发生在 reward model 的语义特征空间。

结果 3:更低 reconstruction loss 不一定带来更好的 OOD detection

  • 设置:比较 lightweight predictor、full predictor、trainable/frozen/separate embeddings、projection layer。
  • 指标:reconstruction loss、Peak Accuracy、Final Accuracy。
  • 结果:Full + Trainable Emb. 的 reconstruction loss 低到 0.127,但 peak/final 只有 80.3/80.2;Lightweight + Trainable Emb. loss 为 0.242,peak/final 达到 82.2/82.2。
  • 解读:predictor 如果过强,可能连分布外特征也能重构,削弱 novelty sensitivity。有效的 caution 需要在拟合训练分布和保留 OOD 误差之间取得平衡。

定理直觉:低维真实 reward 子空间下,pessimism 能避免 off-subspace exploitation

  • 设置:响应 yiRdy_i\in\mathbb R^d 来自高斯参考分布;真实 reward r(y)=θ,yr^\star(y)=\langle\theta^\star,y\rangle 只依赖低维子空间 VV;learned reward r^(y)=θ^,y\hat r(y)=\langle\hat\theta,y\rangleVV 上与真实 reward 一致,但在 VV^\perp 上存在误差。
  • BoN 风险:普通 BoN 会选择 r^\hat r 高的样本,大 NN 时更容易选中 VV^\perp 上被 reward model 高估的样本。
  • Pessimism 条件:若 α(y)\alpha(y) 能近似 projVy\|\mathrm{proj}_{V^\perp}y\|,且 λ\lambda 足够大,则 pessimistic selection 的 regret bound 不随 NN 增长。
  • 论文主结果形式:
E[r(yipess)r(yiBoN)]logN, \mathbb E\left[ r^\star(y_{i_{\mathrm{pess}}})- r^\star(y_{i_{\mathrm{BoN}}}) \right] \gtrsim \sqrt{\log N},

并且:

limNE[r(yi)r(yipess)]E[r(yi)]=0. \lim_{N\to\infty} \frac{ \mathbb E\left[ r^\star(y_{i^\star})- r^\star(y_{i_{\mathrm{pess}}}) \right] }{ \mathbb E\left[r^\star(y_{i^\star})\right] } =0.
  • 解读:这个理论结果说明,在一个可分析的 proxy-error 模型里,普通 BoN 的错误会随极值搜索增强,pessimism 可以把 off-subspace 误差从选择目标中扣掉。

证据链强度评估

强证据

  • 多个 reward models 在 GSM8K 上出现 BoN rise-then-fall,支持 learned reward selection 会在大 NN 下发生 overoptimization。
  • GSM8K / MATH-500 / BBH-Hard 三组结果显示,caution 明显降低 N=512N=512 degradation。
  • 与传统 random RND 的 ablation 表明,reward model feature grounding 是方法有效性的关键组成。

中等强度证据

  • Predictor 只在 GSM8K train responses 上训练,却能在 MATH-500 与 BBH-Hard 上起作用,支持 OOD penalty 有一定跨 prompt 分布泛化。
  • case study 显示 reward model 偏好 verbose、surface reasoning、格式不合规的错误答案,而 pessimism 更偏向格式合规和分布熟悉的答案。
  • 理论分析为 “大 NN 会放大 reward model off-subspace error” 提供清晰模型,但假设和真实 LLM 响应空间距离较远。

需要谨慎的推论

  • “Pessimism Only 在 BBH-Hard 更好” 说明 OASST reward model 在该设置下跨域失效严重,不能直接推出所有 reward models 都应被完全替换。
  • 对 safety alignment 的价值仍属推论;本文没有在 jailbreak、real-world preference、multi-turn agent 或 adversarial prompting 上系统验证。
  • Prediction error 可能同时惩罚有害 OOD、有效新解法和罕见表达风格;实际部署需要配合 calibration set 和 human/verified reward audit。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 初始阅读后的核心判断:本文回应的是 large-NN candidate selection 的 Goodhart 问题。它把 “更多候选” 带来的探索收益和 “更强 proxy overoptimization” 的风险分开处理:生成端仍然采样很多候选,选择端用 pessimistic reward 抑制 reward model 高估区域。
  • 它与 BroRL / ProRL 讨论中的 large rollout 维度有直接关系。扩大 rollout width 可以提高训练或推理时看到高质量轨迹的概率,也会提高遇到 proxy exploit 轨迹的概率。caution 可以作为 large-NN reranking 的风险控制模块或诊断工具。

2. 修正后的理解

  • caution 的新意在 reward-level uncertainty penalty,现有 reward model 保持冻结。它假设已有 reward model 的中间特征包含任务相关分布结构,然后用 predictor error 识别候选是否偏离这组结构。
  • 在跨域 reward model 很弱时,RM + Pessimism 可能弱于 Pessimism Only。这提示实际系统应报告 λ\lambda sweep、proxy/true reward frontier 和 OOD split,避免只报告单一默认配置。

3. 后续复验指标

  • NN 报告 proxy reward、true accuracy、OOD score 和 selected-response length/format/style 分布。
  • 对比 RM onlyPessimism onlyRM + Pessimismχ2\chi^2 regularized BoN、Best-of-Poisson、Soft BoN。
  • 在不同 reward model、不同 base model、不同 prompt domain 上扫 λ\lambda,检查最优 λ\lambda 是否稳定。
  • 对被 penalty 过滤的样本做人审或 verifier audit,区分真实 reward hacking、有效新解法、格式差异和 reward model blind spot。

主要启发

  • Best-of-NN 的安全问题可以在推理时出现,不需要 policy update。只要选择目标是 learned proxy,候选数量越大,极端 proxy error 越容易进入最终输出。
  • RND-style prediction error 可以从 “鼓励探索” 转为 “避免不可靠区域”。方向取决于系统处在 online exploration 还是 offline selection。
  • reward model 中间特征比随机特征更适合做 OOD penalty,因为它携带了 reward model 实际用来判断响应质量的表示结构。
  • 对 verifier-guided inference、agent trajectory reranking、tool-use 多候选选择,单纯扩大候选池需要同时报告 proxy score 和真实指标随 NN 的曲线。

局限

  1. 实验主要使用 Llama-3.2-3B-InstructOASST DeBERTa,模型规模、reward model 类型和任务覆盖仍有限。
  2. 评测集中在 reasoning benchmarks,真实偏好、开放式对话、多轮 agent 和安全红队场景尚未系统验证。
  3. 方法需要额外 predictor / target forward,论文认为可并行且与 reward model evaluation 同阶,但部署中仍会增加 latency、memory 和 batching 复杂度。
  4. λ\lambda 需要校准。appendix hyperparameter table 写默认 λ=0.8\lambda=0.8,但实验细节段落提到 λ=0.2\lambda=0.2;复现时应以代码和最终版本为准。
  5. Prediction error 会惩罚分布外响应,其中可能包含真正更优但表达罕见的解法。强 pessimism 在创造性、开放式或跨域任务上可能降低召回。
  6. 理论分析依赖线性 reward、高斯参考分布、低维真实子空间和理想化 RND 学习假设,主要提供机制直觉。

跨论文关系

  • LLM-as-a-Verifier:后者用连续 verifier score 和 PPT 扩展多候选轨迹选择;caution 提供候选分布外 uncertainty penalty。两者可组合为 soft pairwise ranking 加 pessimistic correction,并应联合观察真实 outcome、候选数 NN 与 verifier uncertainty。
  • 2506.19248:最直接的配套阅读。HedgeTune / Best-of-Poisson 侧重校准 inference-time selection pressure;本文侧重把每个候选的 reward score 改成 lower confidence bound。前者调 “选多强”,后者调 “哪些高分候选应降权”。
  • 2403.03185:二者都把 reward hacking 放在 reference distribution 失效语言下。ORPO 在 policy optimization 阶段约束 occupancy shift;本文在 BoN selection 阶段约束 reward estimate 的 OOD uncertainty。
  • 2501.09620:CRM 在 reward model 训练阶段降低已知 spurious factors;caution 在 reward model 固定后用 OOD predictor 做推理时防护。两者可以组合成 “先 debias reward,再 pessimistic selection”。
  • 2506.10947:Spurious Rewards 关注 RLVR gain 可能来自 model prior 和 objective bias;本文显示 inference-time gain 也可能来自 proxy overoptimization。两者都要求报告真实指标、proxy 指标和 spurious baseline。
  • 2510.01180:BroRL 把 rollout width 作为 RL scaling 维度;本文提醒大 NN 选择会放大 reward model 错误。若 BroRL 类方法引入 learned reward / verifier reranking,caution 可作为防止大 rollout pool 诱导 reward hacking 的诊断或选择模块。
  • 2605.30290:STV 使用 verifier-guided refinement / selection;本文提供 verifier/reward score 在大候选池下过度优化的检测语言。后续可以在 V-R 或 verifier BoN 中加入 prediction-error penalty。
  • 2510.20270:ImpossibleBench 展示 coding agent 会利用 unit-test proxy;本文展示 learned reward model BoN 会利用 reward proxy。二者都说明 evaluation / selection proxy 进入优化闭环后需要真实目标 audit。
  • 2503.11926:CoT monitor signal 进入训练目标后会被优化压力改变;本文展示 reward model signal 进入推理选择目标后同样需要校准和 OOD 检测。
  • 2606.04075:SocioHack 从社会规则环境展示 RL 会搜索 reward/规则缺口;本文给出更窄的 inference-time 机制:固定模型参数,只做多候选选择,也能把输出推向 reward/true objective 分离区域。

Reference Intake Brief

Target

  • Intended target system: 新增论文笔记,更新索引行和 reward hacking / inference-time alignment 关系章节。
  • Existing related assets: papers-index.md2506.192482403.031852501.096202506.109472510.01180
  • Proposed form: 新建独立 Markdown 文档;更新索引行、对应论文的关系章节和站点标签。

Reusable Elements

  1. caution 公式:rLCB(x,y)=r^(x,y)λPθ(x,y)T(x,y)2r_{\mathrm{LCB}}(x,y)=\hat r(x,y)-\lambda\|P_\theta(x,y)-T(x,y)\|^2
  2. inference-time reward hacking 诊断:随 NN 报告 proxy reward、true reward、degradation 和 selected-response distribution。
  3. large rollout / Best-of-NN 风险判断:候选池越大,既增加找到好样本的概率,也增加找到 proxy exploit 样本的概率。

Risks

  • Copyright/over-copying: 只记录摘要式分析、公式和少量表格数值,未复制长段原文。
  • Unsourced or unverifiable claims: 作者机构、版本、实验设置来自 arXiv 页面和 TeX source;代码开源状态需后续确认。
  • Tone/brand mismatch: 采用论文存档风格,保留本地判断与作者主张边界。
  • Safety/compliance issues: 内容涉及 reward hacking 机制,但不沉淀可执行攻击流程或具体 exploit prompt。
  • Overlap with existing assets: 与 2506.19248 强重叠;本文新增价值是 reward-level pessimism、RND-on-RM-features 和跨域 BoN degradation 实验。

Skipped

Material Reason
图中具体样例答案全文 避免过度复制,同时不影响机制分析。
appendix proof 逐行推导 当前笔记保留定理设定和结论,详细证明可按需单独展开。
未发布代码实现细节 arXiv 页面未提供代码仓库,等待后续版本确认。

Recommendation

Decision: merge

Why: 本文与已存档 inference-time reward hacking、correlated proxy、spurious reward、large rollout exploration 论文形成强关系,补齐了 “BoN 大候选池如何用 pessimism 做推理时防护” 这一方法节点。