2604.04648-caution-pessimism-best-of-n-reward-hacking
From Curiosity to Caution: Mitigating Reward Hacking for Best of $N$ with Pessimism
Best-of-N 在候选数量增大时会把输出推向 reward model 高估且分布外的区域,作者提出 caution:训练一个 predictor 去预测冻结 reward model 的中间特征,用预测误差作为分布外不确定性,并在推理时从 reward score 中扣除该不确定性,从而让多候选选择既能利用额外 inference compute,也能降低候选数量较大时的 reward hacking。
Source
- Title: From Curiosity to Caution: Mitigating Reward Hacking for Best-of-
with Pessimism - arXiv: https://arxiv.org/abs/2604.04648
- HTML v1: https://arxiv.org/html/2604.04648v1
- PDF v1: https://arxiv.org/pdf/2604.04648v1
- TeX Source v1: https://arxiv.org/e-print/2604.04648v1
- DOI: https://doi.org/10.48550/arXiv.2604.04648
- Code/Project: 未发现官方代码链接;论文 reproducibility statement 表示后续会开源代码。
- Authors: Zhuohao Yu, Zhiwei Steven Wu, Adam Block
- Submitted: 2026-04-06
- Current version read: v1, submitted 2026-04-06
- Subjects: Machine Learning (
cs.LG) - Comments: 29 pages, 8 figures; preprint under review
作者与关系
- Zhuohao Yu: Carnegie Mellon University.
- Zhiwei Steven Wu: Carnegie Mellon University.
- Adam Block: Columbia University.
阅读目标与判断边界
本笔记关注:
- Best-of-
为什么会在大 下发生 inference-time reward hacking。 caution如何把 RL pessimism / RND-style prediction error 转成 reward-level penalty。- 它与已存档 reward hacking、RLVR、verifier-guided inference、large rollout exploration 论文的关系。
判断边界:
- 本文主要评估 reasoning benchmarks 和 learned reward model 下的 candidate reranking;结论不能直接外推到所有安全任务或真实用户交互场景。
- 理论结果是线性高斯和低维子空间设定下的 proof of concept;语言模型真实分布只借用其直觉。
- 方法降低了 reward model overoptimization 风险,同时会引入保守性、额外推理开销和
选择问题。
论文脉络
1. 问题背景
Best-of-
如果
2. 核心假设或切入点
作者的关键判断是:reward hacking 候选通常对 reward model 来说是分布外样本。既有工作常通过限制最终选择分布和 base policy 的距离来控制风险,例如
这个切入点来自 offline RL / pessimism:如果某个 action 的 reward estimate 不可靠,使用 lower confidence bound 选择更稳的 action。对应到 BoN,作者定义:
其中
3. 方法 / 系统 / 理论框架
caution 借用 curiosity / Random Network Distillation 的 prediction error,但用途改成惩罚分布外响应。
作者使用冻结 reward model
再训练一个轻量 predictor
训练数据来自 base model 在训练 prompts 上生成的响应,因此只需要 prompts,不需要新增人工 preference labels。推理时用 predictor error 定义不确定性:
最终的候选分数为:
直觉上,predictor 在训练分布附近误差小;候选响应越偏离 reward model 熟悉的 feature region,误差越大,扣分越强。与传统 RND 使用随机 target features 不同,本文 target 来自 reward model 中间层,因此 OOD score 与 reward model 的任务相关表示绑定。
4. 结论链条
论文的论证链条是:
- BoN 让候选数量
变大,会增加极端高 proxy reward 样本出现概率。 - learned reward model 在典型响应附近更可靠,在分布外响应上会依赖长度、格式、表面推理步骤等 spurious features。
- predictor error 可以近似衡量候选响应是否落在 reward model 熟悉的 feature manifold 附近。
- 用
做选择,可以压低 proxy 高估、OOD 高误差候选。 - 实验中,普通 reward model BoN 在
出现明显 accuracy degradation; caution显著降低 degradation,并在 GSM8K、MATH-500、BBH-Hard 上保持更稳定的 scaling。
关键实验/定理
结果 1:Best-of- 大 下出现 reward hacking,caution 降低 degradation
- 设置:base model 使用
Llama-3.2-3B-Instruct;主 reward model 使用OASST DeBERTa;候选数量从 1 到 512;ground-truth reward 是最终答案 correctness;训练 predictor 只用 GSM8K train split 上 base model 生成的响应。 - 指标:Peak Accuracy、
Final Accuracy、Peak 到 Final 的 Degradation。 - 结果:
| Dataset | Method | Peak Acc | Final Acc at |
Degradation |
|---|---|---|---|---|
| GSM8K | Reward Model | 79.3 | 71.5 | 7.7 |
| GSM8K | Pessimism Only | 81.3 | 80.3 | 1.0 |
| GSM8K | RM + Pessimism | 82.6 | 81.1 | 1.5 |
| MATH-500 | Reward Model | 11.5 | 8.5 | 3.0 |
| MATH-500 | Pessimism Only | 13.6 | 11.9 | 1.7 |
| MATH-500 | RM + Pessimism | 12.3 | 10.1 | 2.3 |
| BBH-Hard | Reward Model | 17.3 | 1.7 | 15.6 |
| BBH-Hard | Pessimism Only | 22.9 | 22.1 | 0.9 |
| BBH-Hard | RM + Pessimism | 18.5 | 11.0 | 7.5 |
- 解读:在 GSM8K 上,RM + Pessimism 最强;在 MATH-500 和 BBH-Hard 上,Pessimism Only 更强,说明当 reward model 跨域失效时,继续相信
会拖累选择,单纯用 distributional familiarity 反而更稳。
结果 2:reward-model features 比传统 random RND 更有效
- 设置:GSM8K 上扫
,比较使用 reward model features 的 caution与随机 target features 的传统 RND。 - 指标:Peak Accuracy、
Final Accuracy。 - 结果:
| Caution Peak | Caution Final | Traditional RND Peak | Traditional RND Final | |
|---|---|---|---|---|
| 0.0 | 78.9 | 71.2 | 78.9 | 71.2 |
| 0.2 | 79.5 | 72.5 | 78.7 | 71.3 |
| 0.4 | 80.3 | 76.0 | 78.5 | 72.1 |
| 0.6 | 81.5 | 80.2 | 78.4 | 73.1 |
| 0.8 | 82.1 | 81.0 | 78.1 | 74.9 |
| 1.0 | 81.3 | 79.8 | 77.0 | 72.9 |
- 解读:
到 最稳,说明 penalty 需要足够强才能抑制大 下 proxy exploitation。随机 RND 效果弱,说明 prediction error 本身不够,关键在于 error 是否发生在 reward model 的语义特征空间。
结果 3:更低 reconstruction loss 不一定带来更好的 OOD detection
- 设置:比较 lightweight predictor、full predictor、trainable/frozen/separate embeddings、projection layer。
- 指标:reconstruction loss、Peak Accuracy、Final Accuracy。
- 结果:Full + Trainable Emb. 的 reconstruction loss 低到 0.127,但 peak/final 只有 80.3/80.2;Lightweight + Trainable Emb. loss 为 0.242,peak/final 达到 82.2/82.2。
- 解读:predictor 如果过强,可能连分布外特征也能重构,削弱 novelty sensitivity。有效的 caution 需要在拟合训练分布和保留 OOD 误差之间取得平衡。
定理直觉:低维真实 reward 子空间下,pessimism 能避免 off-subspace exploitation
- 设置:响应
来自高斯参考分布;真实 reward 只依赖低维子空间 ;learned reward 在 上与真实 reward 一致,但在 上存在误差。 - BoN 风险:普通 BoN 会选择
高的样本,大 时更容易选中 上被 reward model 高估的样本。 - Pessimism 条件:若
能近似 ,且 足够大,则 pessimistic selection 的 regret bound 不随 增长。 - 论文主结果形式:
并且:
- 解读:这个理论结果说明,在一个可分析的 proxy-error 模型里,普通 BoN 的错误会随极值搜索增强,pessimism 可以把 off-subspace 误差从选择目标中扣掉。
证据链强度评估
强证据
- 多个 reward models 在 GSM8K 上出现 BoN rise-then-fall,支持 learned reward selection 会在大
下发生 overoptimization。 - GSM8K / MATH-500 / BBH-Hard 三组结果显示,
caution明显降低degradation。 - 与传统 random RND 的 ablation 表明,reward model feature grounding 是方法有效性的关键组成。
中等强度证据
- Predictor 只在 GSM8K train responses 上训练,却能在 MATH-500 与 BBH-Hard 上起作用,支持 OOD penalty 有一定跨 prompt 分布泛化。
- case study 显示 reward model 偏好 verbose、surface reasoning、格式不合规的错误答案,而 pessimism 更偏向格式合规和分布熟悉的答案。
- 理论分析为 “大
会放大 reward model off-subspace error” 提供清晰模型,但假设和真实 LLM 响应空间距离较远。
需要谨慎的推论
- “Pessimism Only 在 BBH-Hard 更好” 说明 OASST reward model 在该设置下跨域失效严重,不能直接推出所有 reward models 都应被完全替换。
- 对 safety alignment 的价值仍属推论;本文没有在 jailbreak、real-world preference、multi-turn agent 或 adversarial prompting 上系统验证。
- Prediction error 可能同时惩罚有害 OOD、有效新解法和罕见表达风格;实际部署需要配合 calibration set 和 human/verified reward audit。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 初始阅读后的核心判断:本文回应的是 large-
candidate selection 的 Goodhart 问题。它把 “更多候选” 带来的探索收益和 “更强 proxy overoptimization” 的风险分开处理:生成端仍然采样很多候选,选择端用 pessimistic reward 抑制 reward model 高估区域。 - 它与 BroRL / ProRL 讨论中的 large rollout 维度有直接关系。扩大 rollout width 可以提高训练或推理时看到高质量轨迹的概率,也会提高遇到 proxy exploit 轨迹的概率。
caution可以作为 large-reranking 的风险控制模块或诊断工具。
2. 修正后的理解
caution的新意在 reward-level uncertainty penalty,现有 reward model 保持冻结。它假设已有 reward model 的中间特征包含任务相关分布结构,然后用 predictor error 识别候选是否偏离这组结构。- 在跨域 reward model 很弱时,RM + Pessimism 可能弱于 Pessimism Only。这提示实际系统应报告
sweep、proxy/true reward frontier 和 OOD split,避免只报告单一默认配置。
3. 后续复验指标
- 按
报告 proxy reward、true accuracy、OOD score 和 selected-response length/format/style 分布。 - 对比
RM only、Pessimism only、RM + Pessimism、regularized BoN、Best-of-Poisson、Soft BoN。 - 在不同 reward model、不同 base model、不同 prompt domain 上扫
,检查最优 是否稳定。 - 对被 penalty 过滤的样本做人审或 verifier audit,区分真实 reward hacking、有效新解法、格式差异和 reward model blind spot。
主要启发
- Best-of-
的安全问题可以在推理时出现,不需要 policy update。只要选择目标是 learned proxy,候选数量越大,极端 proxy error 越容易进入最终输出。 - RND-style prediction error 可以从 “鼓励探索” 转为 “避免不可靠区域”。方向取决于系统处在 online exploration 还是 offline selection。
- reward model 中间特征比随机特征更适合做 OOD penalty,因为它携带了 reward model 实际用来判断响应质量的表示结构。
- 对 verifier-guided inference、agent trajectory reranking、tool-use 多候选选择,单纯扩大候选池需要同时报告 proxy score 和真实指标随
的曲线。
局限
- 实验主要使用
Llama-3.2-3B-Instruct和OASST DeBERTa,模型规模、reward model 类型和任务覆盖仍有限。 - 评测集中在 reasoning benchmarks,真实偏好、开放式对话、多轮 agent 和安全红队场景尚未系统验证。
- 方法需要额外 predictor / target forward,论文认为可并行且与 reward model evaluation 同阶,但部署中仍会增加 latency、memory 和 batching 复杂度。
需要校准。appendix hyperparameter table 写默认 ,但实验细节段落提到 ;复现时应以代码和最终版本为准。 - Prediction error 会惩罚分布外响应,其中可能包含真正更优但表达罕见的解法。强 pessimism 在创造性、开放式或跨域任务上可能降低召回。
- 理论分析依赖线性 reward、高斯参考分布、低维真实子空间和理想化 RND 学习假设,主要提供机制直觉。
跨论文关系
- 与 LLM-as-a-Verifier:后者用连续 verifier score 和 PPT 扩展多候选轨迹选择;
caution提供候选分布外 uncertainty penalty。两者可组合为 soft pairwise ranking 加 pessimistic correction,并应联合观察真实 outcome、候选数与 verifier uncertainty。 - 与 2506.19248:最直接的配套阅读。HedgeTune / Best-of-Poisson 侧重校准 inference-time selection pressure;本文侧重把每个候选的 reward score 改成 lower confidence bound。前者调 “选多强”,后者调 “哪些高分候选应降权”。
- 与 2403.03185:二者都把 reward hacking 放在 reference distribution 失效语言下。ORPO 在 policy optimization 阶段约束 occupancy shift;本文在 BoN selection 阶段约束 reward estimate 的 OOD uncertainty。
- 与 2501.09620:CRM 在 reward model 训练阶段降低已知 spurious factors;
caution在 reward model 固定后用 OOD predictor 做推理时防护。两者可以组合成 “先 debias reward,再 pessimistic selection”。 - 与 2506.10947:Spurious Rewards 关注 RLVR gain 可能来自 model prior 和 objective bias;本文显示 inference-time gain 也可能来自 proxy overoptimization。两者都要求报告真实指标、proxy 指标和 spurious baseline。
- 与 2510.01180:BroRL 把 rollout width 作为 RL scaling 维度;本文提醒大
选择会放大 reward model 错误。若 BroRL 类方法引入 learned reward / verifier reranking, caution可作为防止大 rollout pool 诱导 reward hacking 的诊断或选择模块。 - 与 2605.30290:STV 使用 verifier-guided refinement / selection;本文提供 verifier/reward score 在大候选池下过度优化的检测语言。后续可以在 V-R 或 verifier BoN 中加入 prediction-error penalty。
- 与 2510.20270:ImpossibleBench 展示 coding agent 会利用 unit-test proxy;本文展示 learned reward model BoN 会利用 reward proxy。二者都说明 evaluation / selection proxy 进入优化闭环后需要真实目标 audit。
- 与 2503.11926:CoT monitor signal 进入训练目标后会被优化压力改变;本文展示 reward model signal 进入推理选择目标后同样需要校准和 OOD 检测。
- 与 2606.04075:SocioHack 从社会规则环境展示 RL 会搜索 reward/规则缺口;本文给出更窄的 inference-time 机制:固定模型参数,只做多候选选择,也能把输出推向 reward/true objective 分离区域。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记,更新索引行和 reward hacking / inference-time alignment 关系章节。
- Existing related assets: papers-index.md;2506.19248;2403.03185;2501.09620;2506.10947;2510.01180。
- Proposed form: 新建独立 Markdown 文档;更新索引行、对应论文的关系章节和站点标签。
Reusable Elements
caution公式:。 - inference-time reward hacking 诊断:随
报告 proxy reward、true reward、degradation 和 selected-response distribution。 - large rollout / Best-of-
风险判断:候选池越大,既增加找到好样本的概率,也增加找到 proxy exploit 样本的概率。
Risks
- Copyright/over-copying: 只记录摘要式分析、公式和少量表格数值,未复制长段原文。
- Unsourced or unverifiable claims: 作者机构、版本、实验设置来自 arXiv 页面和 TeX source;代码开源状态需后续确认。
- Tone/brand mismatch: 采用论文存档风格,保留本地判断与作者主张边界。
- Safety/compliance issues: 内容涉及 reward hacking 机制,但不沉淀可执行攻击流程或具体 exploit prompt。
- Overlap with existing assets: 与 2506.19248 强重叠;本文新增价值是 reward-level pessimism、RND-on-RM-features 和跨域 BoN degradation 实验。
Skipped
| Material | Reason |
|---|---|
| 图中具体样例答案全文 | 避免过度复制,同时不影响机制分析。 |
| appendix proof 逐行推导 | 当前笔记保留定理设定和结论,详细证明可按需单独展开。 |
| 未发布代码实现细节 | arXiv 页面未提供代码仓库,等待后续版本确认。 |
Recommendation
Decision: merge
Why: 本文与已存档 inference-time reward hacking、correlated proxy、spurious reward、large rollout exploration 论文形成强关系,补齐了 “BoN 大候选池如何用 pessimism 做推理时防护” 这一方法节点。