2506.19248-inference-time-reward-hacking-llms
Inference Time Reward Hacking in Large Language Models
这篇论文把 reward hacking 扩展到 inference-time alignment 场景:Best-of-N 这类“多采样后按 proxy reward 选最高分”的方法,会随着候选数量增大先提升真实质量,再因 winner's curse 选中过度高估的样本而降低真实质量;作者用全正二阶与单调似然比条件证明常见一参数推理策略的 true reward 曲线至多一个峰值,提出 Best-of-Poisson 近似最优 KL-constrained reward tilting,并用 HedgeTune 在少量校准数据上寻找 BoN、SBoN、BoP 的最佳操作点,从而在数学、推理和人类偏好任务上减少过度优化。
Source
- Title: Inference-Time Reward Hacking in Large Language Models
- arXiv: https://arxiv.org/abs/2506.19248
- HTML v2: https://arxiv.org/html/2506.19248v2
- PDF v2: https://arxiv.org/pdf/2506.19248v2
- TeX Source v2: https://arxiv.org/e-print/2506.19248v2
- Code: https://github.com/hskhalaf/hedging
- Authors: Hadi Khalaf, Claudio Mayrink Verdun, Alex Oesterling, Himabindu Lakkaraju, Flavio du Pin Calmon
- Submitted: 2025-06-24
- Current version read: v2, revised 2025-11-04
- Subjects: Machine Learning (cs.LG)
- arXiv comment: Accepted to NeurIPS 2025 (Spotlight Paper)
作者与关系
- Hadi Khalaf: Harvard University.
- Claudio Mayrink Verdun: Harvard University。
- Alex Oesterling: Harvard University.
- Himabindu Lakkaraju: Harvard University。
- Flavio du Pin Calmon: Harvard University.
阅读目标与判断边界
本笔记关注:
- inference-time reward hacking 和 training-time reward hacking 的区别。
- BoN、SBoN、BoP 为什么会出现 winner's curse,以及 BoP 为什么接近最优 tilted distribution。
- HedgeTune 如何用 true reward / gold reward 校准推理参数。
- 这篇论文和本地 reward hacking、RLVR、verifier、BoN / pass@
论文的关系。
判断边界:
- 作者分析的是固定 reference policy、固定 proxy reward model、推理阶段采样和选择的 reward hacking;它不直接处理策略训练过程中的梯度更新、occupancy shift 或 reward model 训练。
- HedgeTune 需要一次性访问 true reward、verifiable reward、gold reward model、更强 judge 或人工偏好数据来做校准。没有校准信号时,方法只能退化为普通超参搜索或保守推理策略。
- 理论分析把 proxy reward 映射到经验分位数
,核心结论在一维 reward rank 上成立;LLM 输出语义、prompt 差异和 reward model 校准质量通过 empirical CDF 与 true reward 曲线间接进入。 - 实验覆盖 PPE 的 MMLU Pro、MATH、GPQA,以及 AlpacaFarm / AlpacaRM human-preference setup;结果说明方法有效,但仍需在更强 base model、更复杂安全任务和多 reward setting 中复验。
论文脉络
1. 问题背景
当前很多 alignment 方法都在优化某种 reward:RLHF、DPO、BoN、SBoN、reward-guided decoding 都把 proxy reward 当作可计算目标。proxy reward 可以是 reward model 分数、judge 分数、verifier 分数,也可以是隐式偏好目标。问题在于 proxy reward 只是 true reward 的近似;当推理时生成很多候选并选择 proxy 最高者时,选择过程会系统性偏向 proxy 高估的样本。
作者把这一现象解释为 winner's curse:候选越多,极值越容易包含估计误差。起初增加
2. Inference-Time Reward Hacking 的定义
设 reference policy 为
论文定义 inference-time reward hacking:当
这里
3. BoN 与 SBoN
Best-of-
- 从
独立采样 。 - 用 proxy reward 计算
。 - 返回 proxy reward 最高的样本。
SBoN 在最后一步换成 softmax sampling:
4. 核心理论:true reward 曲线至多一个峰值
论文把 proxy reward 按 empirical CDF 映射为分位数:
在这个坐标里,BoN、BoP 等方法诱导出一族一参数分布
对
这个定理给了 HedgeTune 一个关键可计算性保证:如果 true reward 随 proxy optimization 先升后降,那么只需找一个峰值;如果曲线单调,方法也会返回边界解。
5. Best-of-Poisson
BoP 把 BoN 的固定候选数
- 采样
。 - 设置
,保证至少一个候选。 - 从
采样 个响应,并返回 proxy reward 最高者。
在
它的 KL 和 expected reward 分别为:
BoP 的意义在于接近最优 reward tilting。标准 KL-constrained reward optimization 的形式是:
其最优解是指数倾斜分布:
直接从
这让 BoP 成为 inference-time 近似 RLHF reward-KL frontier 的简单方法。
6. HedgeTune
HedgeTune 的目标是找到
流程:
- 对每个 prompt,把候选按 proxy score 排序,并映射成 empirical quantile
。 - 根据 BoN、SBoN 或 BoP 选择对应的 score function
和密度 。 - 对每个 prompt 估计 residual:
- 求平均 residual 的根:
BoN 的条件为:
SBoN 的条件可以写成 covariance 为零:
BoP 的条件为:
直觉是:如果更高 proxy 分位数仍然和 true reward 正相关,就可以继续加大推理优化强度;当这个边际相关性归零,继续追 proxy 只会增加被 winner's curse 伤害的风险。
关键实验/定理
定理 1:Inference-time reward hacking 曲线的单峰性
- 设置:一参数推理策略族
,满足 TP 与 monotone score 条件;true reward 有界非负。 - 结论:
要么单调,要么只有一个内部极值。 - 解读:常见 inference-time 方法的 hacking threshold 可以用一维搜索定位。
定理 2:BoP 的 KL 与期望 reward
- 设置:proxy reward 分位数
均匀分布,BoP 以 控制 Poisson 候选数。 - 结论:BoP 密度、KL 和 expected reward 有闭式表达。
- 解读:BoP 具有明确 reward-KL 轨迹,是可分析的一参数策略族。
定理 3:BoP 近似最优 tilted distribution
- 设置:比较 BoP 分布
和最优 KL-constrained exponential tilt ,在相同 expected proxy reward 下比较 KL。 - 结论:数值验证显示 KL gap 上界为
。 - 解读:BoP 用随机化候选数近似最优 reward tilting,同时保留黑盒采样可实现性。
结果 1:Verifiable reward setup
- 设置:使用 Preference Proxy Evaluations (PPE) 数据集;任务包括 MMLU Pro、MATH、GPQA;reward models 包括 InternLM-2 1.8B、Llama-3-Offset-Bias 8B、Skywork-Llama-3.1 8B;true reward 为 correctness。
- 结果:多个 dataset-reward model pair 中,BoN 随
增大出现 true accuracy 先升后降;HedgeTune 能恢复 BoN/BoP 的最佳操作点,SBoN 给出更好的 reward-distortion 曲线。 - 解读:即使 proxy reward model 较强,inference-time overoptimization 仍会发生。
结果 2:Human-preference setup
- 设置:Pythia 1.4B AlpacaFarm reference model 生成响应;AlpacaRM 作为 gold reward;训练 Pythia 44M proxy reward models;偏好数据规模为 10k、20k、46k、80k;包含 0% 和 25% label noise;4 个随机种子。
- 结果:proxy 数据少、label noise 高时 reward hacking 更明显;SBoN 的
hedging 可以在达到峰值后保持 true reward 平台;当 proxy 与 gold reward 从一开始相冲突时,最优策略接近 reference / uniform selection。 - 解读:HedgeTune 在接近真实偏好建模的设置里仍能找到保守操作点,但依赖 gold reward 或验证集。
证据链强度评估
强证据
- 理论主线清楚:winner's curse、TP
/MLR、单峰性、HedgeTune residual root 四个环节连接紧密。 - BoP 的构造有明确动机:Poissonization 产生近似 exponential tilt 的分布结构,和 KL-constrained reward optimization 直接相连。
- 实验覆盖 verifiable correctness 和 human-preference 两类 proxy mismatch,不只依赖 toy example。
- 论文把“继续增加 inference compute 也可能伤害 true reward”表达成可校准阈值,具有直接工程意义。
中等强度证据
- BoP 近似最优性的
KL gap 是一维 uniform reward 分位数模型下的数值结论;真实 LLM 输出空间依赖 empirical quantile 近似。 - PPE 和 AlpacaRM setup 能代表一部分 reward model mismatch,但仍是离线候选集选择,和在线生产 traffic、multi-turn assistant、tool-use agent 有差异。
- SBoN 的优势依赖可调
和校准数据;若 proxy reward 极弱或 true reward 不可得,hedging 收益可能有限。
需要谨慎的推论
- HedgeTune 缓解的是 inference-time selection overoptimization,不能替代 reward model 训练阶段的 causal debiasing、policy training regularization 或 occupancy control。
- 论文需要 true reward / gold judge 做一次性 calibration。很多安全场景中 true reward 昂贵、争议大或只能事后观测,这会限制部署。
- BoN/SBoN/BoP 仍会增加采样成本。SBoN 还能固定
后调 ,但候选生成成本仍存在。 - 单峰性假设给出可搜索结构,但复杂任务中 prompt-level 曲线可能不完全一致。论文使用 prompt-average residual,可能掩盖部分 subgroup 的过度优化。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 本文补齐本地 reward hacking 图谱中的 inference-time 层:模型和 reward model 都固定,风险来自候选集选择和推理超参,区别于训练梯度更新。
- BoN / pass@
不能天然理解为“采样越多越好”。当选择依据是 proxy reward, 同时增加搜索能力和 Goodhart 压力。 - HedgeTune 的核心工程价值是把“多采样后怎么选”改成可校准的部署参数,减少凭经验选择
或 reward threshold。
2. 修正后的理解
- reward hacking 可分层理解:CRM 处理 reward model 训练阶段的 spurious factor;ORPO 处理 policy optimization 后的 occupancy shift;本文处理 inference-time selection 的 winner's curse;CoT monitoring 论文处理 monitor signal 被优化后的可观测性失真。
- 在 verifiable reward 任务上,HedgeTune 很实用,因为 correctness 能提供校准 true reward;在开放式安全和偏好任务上,需要可靠 gold judge 或人工评估集。
- BoP 的意义不只在随机候选数本身,而在它给出了一个单参数、黑盒采样可实现、接近最优 reward-KL frontier 的 inference-time policy family。
3. 后续复验指标
- 对每个 reward model 报告 proxy reward、true reward、KL / distortion、
或 sweep 曲线。 - 按 prompt subgroup 报告 hacking threshold,检查平均最优参数是否伤害特定任务群。
- 对比 BoN、SBoN、BoP、regularized BoN、reward model ensemble、verifier-guided refinement。
- 在 multi-turn tool-use、code agent、safety refusal、long-CoT reasoning 上复验 HedgeTune。
- 报告校准集大小、gold reward 噪声、proxy strength、label noise 对
稳定性的影响。
4. 详细介绍后的理解框架
- 这篇论文的最小问题单元是“固定 base model + 固定 proxy reward + 多候选推理选择”。模型参数不更新,reward model 也不更新,唯一变化的是 inference-time selection pressure。
在 BoN 中同时扮演两个角色:增加搜索覆盖,也增加对 proxy reward 极值误差的暴露。前半段带来真实收益,后半段触发 winner's curse。 - SBoN 和 BoP 的共同价值是把“硬选 proxy 最高分”改成可连续调节的推理策略族,让系统能在 reward-KL tradeoff 上选操作点。
- HedgeTune 的本质是 deployment calibration:用一小批可验证或 gold-scored 数据,估计 true reward 对 proxy selection pressure 的边际收益,在边际收益归零处停止加压。
- 这使本文成为 reward hacking 图谱里的 inference-time 层:CRM 管 reward model 训练,ORPO 管 policy optimization 分布漂移,HedgeTune 管推理时的候选选择强度。
主要启发
- Inference-time scaling 也需要 alignment calibration。更多 samples 会同时扩大可选解空间和 reward model 误差极值。
- Best-of-
的安全部署应该报告 true reward sweep,并配套报告 proxy reward 或 win rate。 - SBoN / BoP 这类带连续推理参数的方法,比硬选最高分更适合做 deployment-time hedging。
- 如果一个系统已经有小规模人工评估集或 verifiable benchmark,可以用 HedgeTune 先确定
、 、 ,再固定到线上推理策略。 - 对 RLHF/RLVR 系统来说,training-time KL anchor 与 inference-time hedging 是两层不同防线:前者约束 policy drift,后者约束 selection pressure。
局限
- HedgeTune 需要 true reward 或 gold reward calibration set;很多高价值安全目标难以获得稳定 true reward。
- 理论分析依赖 reward rank / quantile 表示,语义层面的 error mode 和 subgroup 差异需要额外诊断。
- 实验主要是离线候选集 reranking;在线交互、多轮工具调用、长上下文和 agent memory 场景尚未覆盖。
- BoP 的近似最优性是 uniform reward mapping 下的 reward-KL 结论;真实输出空间中仍需观察 empirical CDF 估计误差。
- 当 proxy reward 从一开始就和 true reward 冲突时,hedging 会返回接近 reference 的保守策略,无法从坏 proxy 中创造有效信号。
- 论文没有把不同 prompt subgroup 的最优
做成 deployment policy,统一 可能对少数任务群过度优化或保守。
跨论文关系
- 与 LLM-as-a-Verifier:后者用 verifier score 从多条 agent trajectories 中选择输出,直接处于 inference-time proxy optimization 场景。随着候选池和 verification compute 增大,应报告 true outcome 的
sweep、oracle gap 和 score calibration,检查 proxy winner's curse 是否出现。 - 与 2403.03185:两者共同给 reward hacking 提供形式化坐标。ORPO 关注训练后策略离开 reference occupancy 后 proxy 失效;本文关注推理阶段 candidate selection 把分布推向 proxy 高估区域。两者都把 reference distribution 放在定义中心。
- 与 2501.09620:CRM 在 reward model 训练阶段降低已知 spurious factor 的影响;HedgeTune 在 reward model 固定后限制推理时的 overoptimization。两者可以组合:先训练更稳的 reward model,再校准 inference-time selection strength。
- 与 2503.11926:CoT monitor 一旦成为训练目标会 Goodhart 化;本文展示 proxy reward 一旦成为推理选择目标也会 Goodhart 化。两者都支持“测量信号进入优化闭环后必须重新校准”的判断。
- 与 2606.04075:SocioHack 讨论 RL 在社会规则环境中寻找制度漏洞;本文提供更基础的 inference-time 机制,说明即使不训练模型,只在候选中选最高 proxy,也会产生 reward hacking。
- 与 2506.10947:Spurious Rewards 说明 RLVR gain 可以来自 prior amplification 和 objective bias;本文说明 inference-time reward gain 也需要加入 proxy / true reward sweep,避免把 proxy score 提升解释成真实能力提升。
- 与 2605.30290:STV 比较 V-R 与 BoN,并强调 verifier calibration;本文给出 BoN 在 proxy reward selection 下的 hacking threshold 语言,可用于诊断 verifier-guided inference 是否过度追 verifier 分数。
- 与 2504.13837:两者都提醒 pass@
/ Best-of- 相关指标需要看分布变化。 2504.13837关注 RL 是否扩大 base model reasoning boundary;本文关注从候选集中按 proxy reward 选择时,true reward 随的非单调变化。 - 与 2606.00135:tool-calling RL 中 harness 和 judge 会改变 effective reward;本文提供一个 deployment-time 校准框架,可用于 tool-use agent 多候选 trajectory reranking。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记 / reward hacking 与 inference-time alignment 专题。
- Existing related assets:
content/utility/papers-index.md;2403.03185;2501.09620;2503.11926;2606.04075;2506.10947。 - Proposed form: 新建独立 Markdown 文档,更新 papers-index.md 的索引行,并维护对应论文的关系章节。
Reusable Elements
- Inference-time reward hacking 定义:proxy reward 和 KL 继续上升,true reward 过阈值后下降。
- Winner's curse 解释:多候选极值选择放大 proxy overestimation。
- BoP:Poissonized BoN,单参数近似 reward-KL optimal tilting。
- HedgeTune:用校准 true reward 找 BoN/SBoN/BoP 的最佳推理参数。
- 复验 checklist:proxy sweep、true reward sweep、distortion、subgroup threshold、gold reward noise。
Risks
- Copyright/over-copying: 笔记使用概括和必要公式,避免长段复制论文原文。
- Unsourced or unverifiable claims: 版本、作者、comment、分类来自 arXiv abstract / source;代码链接来自 TeX appendix。
- Tone/brand mismatch: 保持技术档案风格,区分作者结论和本地分析。
- Safety/compliance issues: 论文涉及 reward hacking,但本文聚焦机制、评测和防御,不沉淀可直接滥用的操作流程。
- Overlap with existing assets: 与 ORPO、CRM、SocioHack、CoT monitoring、Spurious Rewards 强重叠,本笔记新增价值是 inference-time selection / hedging 层。
Skipped
| Material | Reason |
|---|---|
| 完整 proof 细节 | 长期价值集中在定理条件、HedgeTune residual 和 BoP 结论。 |
| 所有 appendix 图逐项复写 | 代表性实验趋势已经覆盖,细节可回源查看。 |
| 代码仓库实测 | 用户请求是论文分析,未要求复现实验。 |
Recommendation
Decision: merge
Why: 这篇论文补齐本地 reward hacking 图谱中的 inference-time alignment 节点,和 ORPO、CRM、CoT monitoring、SocioHack、Spurious Rewards 一起构成“reward 设计、reward model、policy optimization、inference selection、monitor feedback”五层风险视角。