2506.19248-inference-time-reward-hacking-llms

Inference Time Reward Hacking in Large Language Models

这篇论文把 reward hacking 扩展到 inference-time alignment 场景:Best-of-N 这类“多采样后按 proxy reward 选最高分”的方法,会随着候选数量增大先提升真实质量,再因 winner's curse 选中过度高估的样本而降低真实质量;作者用全正二阶与单调似然比条件证明常见一参数推理策略的 true reward 曲线至多一个峰值,提出 Best-of-Poisson 近似最优 KL-constrained reward tilting,并用 HedgeTune 在少量校准数据上寻找 BoN、SBoN、BoP 的最佳操作点,从而在数学、推理和人类偏好任务上减少过度优化。

Authors Hadi Khalaf, Claudio Mayrink Verdun, Alex Oesterling, Himabindu Lakkaraju, Flavio du Pin Calmon

已审阅 Archived 2026-03-13 16:20 Updated 2026-07-13 09:48 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Hadi Khalaf: Harvard University.
  • Claudio Mayrink Verdun: Harvard University。
  • Alex Oesterling: Harvard University.
  • Himabindu Lakkaraju: Harvard University。
  • Flavio du Pin Calmon: Harvard University.

阅读目标与判断边界

本笔记关注:

  1. inference-time reward hacking 和 training-time reward hacking 的区别。
  2. BoN、SBoN、BoP 为什么会出现 winner's curse,以及 BoP 为什么接近最优 tilted distribution。
  3. HedgeTune 如何用 true reward / gold reward 校准推理参数。
  4. 这篇论文和本地 reward hacking、RLVR、verifier、BoN / pass@kk 论文的关系。

判断边界:

  • 作者分析的是固定 reference policy、固定 proxy reward model、推理阶段采样和选择的 reward hacking;它不直接处理策略训练过程中的梯度更新、occupancy shift 或 reward model 训练。
  • HedgeTune 需要一次性访问 true reward、verifiable reward、gold reward model、更强 judge 或人工偏好数据来做校准。没有校准信号时,方法只能退化为普通超参搜索或保守推理策略。
  • 理论分析把 proxy reward 映射到经验分位数 u[0,1]u\in[0,1],核心结论在一维 reward rank 上成立;LLM 输出语义、prompt 差异和 reward model 校准质量通过 empirical CDF 与 true reward 曲线间接进入。
  • 实验覆盖 PPE 的 MMLU Pro、MATH、GPQA,以及 AlpacaFarm / AlpacaRM human-preference setup;结果说明方法有效,但仍需在更强 base model、更复杂安全任务和多 reward setting 中复验。

论文脉络

1. 问题背景

当前很多 alignment 方法都在优化某种 reward:RLHF、DPO、BoN、SBoN、reward-guided decoding 都把 proxy reward 当作可计算目标。proxy reward 可以是 reward model 分数、judge 分数、verifier 分数,也可以是隐式偏好目标。问题在于 proxy reward 只是 true reward 的近似;当推理时生成很多候选并选择 proxy 最高者时,选择过程会系统性偏向 proxy 高估的样本。

作者把这一现象解释为 winner's curse:候选越多,极值越容易包含估计误差。起初增加 nn 能提升真实质量,因为 proxy 仍携带有效信号;继续增加 nn 后,selection pressure 会挑出 proxy 高但 true quality 低的样本,true reward 开始下降。这个峰值位置就是 hacking threshold。

2. Inference-Time Reward Hacking 的定义

设 reference policy 为 πref\pi_{\mathrm{ref}},proxy reward 为 rp(x)r_p(x),true reward 为 rt(x)r_t(x)。一个 inference-time alignment 方法用参数 θ\theta 把 reference policy 转换成 πθ\pi_\theta,例如 BoN 中 θ=n\theta=n,SBoN 中 θ=λ\theta=\lambda,BoP 中 θ=μ\theta=\mu。真实表现为:

f(θ)=EXπθ[rt(X)]. f(\theta)=\mathbb{E}_{X\sim \pi_\theta}[r_t(X)].

论文定义 inference-time reward hacking:当 θ\theta 增大时,expected proxy reward 和 DKL(πθπref)D_{\mathrm{KL}}(\pi_\theta\Vert\pi_{\mathrm{ref}}) 继续增大,但存在阈值 θ\theta^\dagger,使得 θ>θ\theta>\theta^\dagger 后 true reward 低于阈值处 true reward:

EXπθ[rt(X)]>EXπθ[rt(X)]. \mathbb{E}_{X\sim\pi_{\theta^\dagger}}[r_t(X)] > \mathbb{E}_{X\sim\pi_\theta}[r_t(X)].

这里 θ\theta^\dagger 是最优操作点,也是推理时应该停止增加 proxy optimization pressure 的位置。

3. BoN 与 SBoN

Best-of-nn 的机制很简单:

  1. πref\pi_{\mathrm{ref}} 独立采样 X1,,XnX_1,\ldots,X_n
  2. 用 proxy reward 计算 rp(Xi)r_p(X_i)
  3. 返回 proxy reward 最高的样本。

SBoN 在最后一步换成 softmax sampling:

Pr(Z=i)=eλrp(Xi)j=1neλrp(Xj). \Pr(Z=i)= \frac{e^{\lambda r_p(X_i)}}{\sum_{j=1}^n e^{\lambda r_p(X_j)}}.

λ0\lambda\to 0 时接近均匀选择,λ\lambda\to\infty 时接近 BoN。SBoN 多了一个平滑调节维度,可以在固定 nn 下控制 proxy exploitation 强度,因此天然适合 hedging。

4. 核心理论:true reward 曲线至多一个峰值

论文把 proxy reward 按 empirical CDF 映射为分位数:

u=Fp(rp(x)),u[0,1]. u=F_p(r_p(x)),\quad u\in[0,1].

在这个坐标里,BoN、BoP 等方法诱导出一族一参数分布 pθ(u)p_\theta(u)。作者证明:如果 pθ(x)p_\theta(x)(θ,x)(\theta,x) 满足严格 TP2_2,且 score function

ψ(x,θ)=θlogpθ(x) \psi(x,\theta)=\partial_\theta \log p_\theta(x)

xx 严格递增,那么对任意有界非负 true reward rtr_tf(θ)=EXπθ[rt(X)]f(\theta)=\mathbb{E}_{X\sim\pi_\theta}[r_t(X)] 要么单调,要么只有一个内部极值。

这个定理给了 HedgeTune 一个关键可计算性保证:如果 true reward 随 proxy optimization 先升后降,那么只需找一个峰值;如果曲线单调,方法也会返回边界解。

5. Best-of-Poisson

BoP 把 BoN 的固定候选数 nn 改成随机候选数:

  1. 采样 nPoisson(μ)n'\sim \mathrm{Poisson}(\mu)
  2. 设置 n=n+1n=n'+1,保证至少一个候选。
  3. πref\pi_{\mathrm{ref}} 采样 nn 个响应,并返回 proxy reward 最高者。

u[0,1]u\in[0,1] 均匀假设下,BoP 的密度为:

qμ(u)=(μu+1)eμ(u1). q_\mu(u)=(\mu u+1)e^{\mu(u-1)}.

它的 KL 和 expected reward 分别为:

DKL(πBoPπref)=eμ1(Ei(μ+1)Ei(1))μ+log(μ+1)1, D_{\mathrm{KL}}(\pi_{\mathrm{BoP}}\Vert\pi_{\mathrm{ref}}) = \frac{e^{-\mu-1}(\mathrm{Ei}(\mu+1)-\mathrm{Ei}(1))}{\mu} +\log(\mu+1)-1,
E[UBoP]=11μ+1eμμ2. \mathbb{E}[U_{\mathrm{BoP}}] = 1-\frac{1}{\mu}+\frac{1-e^{-\mu}}{\mu^2}.

BoP 的意义在于接近最优 reward tilting。标准 KL-constrained reward optimization 的形式是:

π=argmaxπxΔXEπx[rp(X)]1λDKL(πxπref). \pi^\star = \arg\max_{\pi_x\in\Delta_\mathcal{X}} \mathbb{E}_{\pi_x}[r_p(X)] -\frac{1}{\lambda} D_{\mathrm{KL}}(\pi_x\Vert \pi_{\mathrm{ref}}).

其最优解是指数倾斜分布:

πλ(x)=πref(x)eλrp(x)Z(λ). \pi^\star_\lambda(x) = \frac{\pi_{\mathrm{ref}}(x)e^{\lambda r_p(x)}}{Z(\lambda)}.

直接从 πλ\pi^\star_\lambda 采样需要对所有 continuation 做归一化,LLM 中不可行。BoP 只需要黑盒采样和 reward scoring,却能在 matched expected reward 下把 KL gap 控制在数值上很小的范围:

0DKL(qμπref)DKL(gλπref)8×104. 0\le D_{\mathrm{KL}}(q_\mu\Vert\pi_{\mathrm{ref}}) -D_{\mathrm{KL}}(g_\lambda\Vert\pi_{\mathrm{ref}}) \le 8\times10^{-4}.

这让 BoP 成为 inference-time 近似 RLHF reward-KL frontier 的简单方法。

6. HedgeTune

HedgeTune 的目标是找到 θ\theta^\star,使 true reward 对 proxy optimization pressure 的边际收益为零。输入是一批校准 prompt,包含候选响应的 proxy score 和 true reward / gold score。

流程:

  1. 对每个 prompt,把候选按 proxy score 排序,并映射成 empirical quantile ut,ku_{t,k}
  2. 根据 BoN、SBoN 或 BoP 选择对应的 score function ψ(u,θ)\psi(u,\theta) 和密度 pθ(u)p_\theta(u)
  3. 对每个 prompt 估计 residual:
Rt(θ)=Eupθ[rt(u)ψ(u,θ)]. R_t(\theta) = \mathbb{E}_{u\sim p_\theta} \left[ r_t(u)\psi(u,\theta) \right].
  1. 求平均 residual 的根:
Rˉ(θ)=1TtTR^t(θ)=0. \bar R(\theta^\star) = \frac{1}{|T|} \sum_{t\in T}\hat R_t(\theta^\star) =0.

BoN 的条件为:

01rt(u)(1n+lnu)un1du=0. \int_0^1 r_t(u) \left( \frac{1}{n^\dagger}+\ln u \right) u^{n^\dagger-1}du =0.

SBoN 的条件可以写成 covariance 为零:

Covufλ(rt(u),u)=0. \mathrm{Cov}_{u\sim f_{\lambda^\dagger}}(r_t(u),u)=0.

BoP 的条件为:

Euqμ[rt(u)(u1+uμu+1)]=0. \mathbb{E}_{u\sim q_{\mu^\dagger}} \left[ r_t(u) \left( u-1+\frac{u}{\mu^\dagger u+1} \right) \right]=0.

直觉是:如果更高 proxy 分位数仍然和 true reward 正相关,就可以继续加大推理优化强度;当这个边际相关性归零,继续追 proxy 只会增加被 winner's curse 伤害的风险。

关键实验/定理

定理 1:Inference-time reward hacking 曲线的单峰性

  • 设置:一参数推理策略族 {πθ}\{\pi_\theta\},满足 TP2_2 与 monotone score 条件;true reward 有界非负。
  • 结论:f(θ)=Eπθ[rt(X)]f(\theta)=\mathbb{E}_{\pi_\theta}[r_t(X)] 要么单调,要么只有一个内部极值。
  • 解读:常见 inference-time 方法的 hacking threshold 可以用一维搜索定位。

定理 2:BoP 的 KL 与期望 reward

  • 设置:proxy reward 分位数 uu 均匀分布,BoP 以 μ\mu 控制 Poisson 候选数。
  • 结论:BoP 密度、KL 和 expected reward 有闭式表达。
  • 解读:BoP 具有明确 reward-KL 轨迹,是可分析的一参数策略族。

定理 3:BoP 近似最优 tilted distribution

  • 设置:比较 BoP 分布 qμq_\mu 和最优 KL-constrained exponential tilt gλg_\lambda,在相同 expected proxy reward 下比较 KL。
  • 结论:数值验证显示 KL gap 上界为 8×1048\times10^{-4}
  • 解读:BoP 用随机化候选数近似最优 reward tilting,同时保留黑盒采样可实现性。

结果 1:Verifiable reward setup

  • 设置:使用 Preference Proxy Evaluations (PPE) 数据集;任务包括 MMLU Pro、MATH、GPQA;reward models 包括 InternLM-2 1.8B、Llama-3-Offset-Bias 8B、Skywork-Llama-3.1 8B;true reward 为 correctness。
  • 结果:多个 dataset-reward model pair 中,BoN 随 nn 增大出现 true accuracy 先升后降;HedgeTune 能恢复 BoN/BoP 的最佳操作点,SBoN 给出更好的 reward-distortion 曲线。
  • 解读:即使 proxy reward model 较强,inference-time overoptimization 仍会发生。

结果 2:Human-preference setup

  • 设置:Pythia 1.4B AlpacaFarm reference model 生成响应;AlpacaRM 作为 gold reward;训练 Pythia 44M proxy reward models;偏好数据规模为 10k、20k、46k、80k;包含 0% 和 25% label noise;4 个随机种子。
  • 结果:proxy 数据少、label noise 高时 reward hacking 更明显;SBoN 的 λ\lambda hedging 可以在达到峰值后保持 true reward 平台;当 proxy 与 gold reward 从一开始相冲突时,最优策略接近 reference / uniform selection。
  • 解读:HedgeTune 在接近真实偏好建模的设置里仍能找到保守操作点,但依赖 gold reward 或验证集。

证据链强度评估

强证据

  • 理论主线清楚:winner's curse、TP2_2/MLR、单峰性、HedgeTune residual root 四个环节连接紧密。
  • BoP 的构造有明确动机:Poissonization 产生近似 exponential tilt 的分布结构,和 KL-constrained reward optimization 直接相连。
  • 实验覆盖 verifiable correctness 和 human-preference 两类 proxy mismatch,不只依赖 toy example。
  • 论文把“继续增加 inference compute 也可能伤害 true reward”表达成可校准阈值,具有直接工程意义。

中等强度证据

  • BoP 近似最优性的 8×1048\times10^{-4} KL gap 是一维 uniform reward 分位数模型下的数值结论;真实 LLM 输出空间依赖 empirical quantile 近似。
  • PPE 和 AlpacaRM setup 能代表一部分 reward model mismatch,但仍是离线候选集选择,和在线生产 traffic、multi-turn assistant、tool-use agent 有差异。
  • SBoN 的优势依赖可调 λ\lambda 和校准数据;若 proxy reward 极弱或 true reward 不可得,hedging 收益可能有限。

需要谨慎的推论

  • HedgeTune 缓解的是 inference-time selection overoptimization,不能替代 reward model 训练阶段的 causal debiasing、policy training regularization 或 occupancy control。
  • 论文需要 true reward / gold judge 做一次性 calibration。很多安全场景中 true reward 昂贵、争议大或只能事后观测,这会限制部署。
  • BoN/SBoN/BoP 仍会增加采样成本。SBoN 还能固定 nn 后调 λ\lambda,但候选生成成本仍存在。
  • 单峰性假设给出可搜索结构,但复杂任务中 prompt-level 曲线可能不完全一致。论文使用 prompt-average residual,可能掩盖部分 subgroup 的过度优化。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 本文补齐本地 reward hacking 图谱中的 inference-time 层:模型和 reward model 都固定,风险来自候选集选择和推理超参,区别于训练梯度更新。
  • BoN / pass@kk 不能天然理解为“采样越多越好”。当选择依据是 proxy reward,nn 同时增加搜索能力和 Goodhart 压力。
  • HedgeTune 的核心工程价值是把“多采样后怎么选”改成可校准的部署参数,减少凭经验选择 nn 或 reward threshold。

2. 修正后的理解

  • reward hacking 可分层理解:CRM 处理 reward model 训练阶段的 spurious factor;ORPO 处理 policy optimization 后的 occupancy shift;本文处理 inference-time selection 的 winner's curse;CoT monitoring 论文处理 monitor signal 被优化后的可观测性失真。
  • 在 verifiable reward 任务上,HedgeTune 很实用,因为 correctness 能提供校准 true reward;在开放式安全和偏好任务上,需要可靠 gold judge 或人工评估集。
  • BoP 的意义不只在随机候选数本身,而在它给出了一个单参数、黑盒采样可实现、接近最优 reward-KL frontier 的 inference-time policy family。

3. 后续复验指标

  • 对每个 reward model 报告 proxy reward、true reward、KL / distortion、nnλ\lambda sweep 曲线。
  • 按 prompt subgroup 报告 hacking threshold,检查平均最优参数是否伤害特定任务群。
  • 对比 BoN、SBoN、BoP、regularized BoN、reward model ensemble、verifier-guided refinement。
  • 在 multi-turn tool-use、code agent、safety refusal、long-CoT reasoning 上复验 HedgeTune。
  • 报告校准集大小、gold reward 噪声、proxy strength、label noise 对 θ\theta^\star 稳定性的影响。

4. 详细介绍后的理解框架

  • 这篇论文的最小问题单元是“固定 base model + 固定 proxy reward + 多候选推理选择”。模型参数不更新,reward model 也不更新,唯一变化的是 inference-time selection pressure。
  • nn 在 BoN 中同时扮演两个角色:增加搜索覆盖,也增加对 proxy reward 极值误差的暴露。前半段带来真实收益,后半段触发 winner's curse。
  • SBoN 和 BoP 的共同价值是把“硬选 proxy 最高分”改成可连续调节的推理策略族,让系统能在 reward-KL tradeoff 上选操作点。
  • HedgeTune 的本质是 deployment calibration:用一小批可验证或 gold-scored 数据,估计 true reward 对 proxy selection pressure 的边际收益,在边际收益归零处停止加压。
  • 这使本文成为 reward hacking 图谱里的 inference-time 层:CRM 管 reward model 训练,ORPO 管 policy optimization 分布漂移,HedgeTune 管推理时的候选选择强度。

主要启发

  • Inference-time scaling 也需要 alignment calibration。更多 samples 会同时扩大可选解空间和 reward model 误差极值。
  • Best-of-nn 的安全部署应该报告 true reward sweep,并配套报告 proxy reward 或 win rate。
  • SBoN / BoP 这类带连续推理参数的方法,比硬选最高分更适合做 deployment-time hedging。
  • 如果一个系统已经有小规模人工评估集或 verifiable benchmark,可以用 HedgeTune 先确定 nnλ\lambdaμ\mu,再固定到线上推理策略。
  • 对 RLHF/RLVR 系统来说,training-time KL anchor 与 inference-time hedging 是两层不同防线:前者约束 policy drift,后者约束 selection pressure。

局限

  1. HedgeTune 需要 true reward 或 gold reward calibration set;很多高价值安全目标难以获得稳定 true reward。
  2. 理论分析依赖 reward rank / quantile 表示,语义层面的 error mode 和 subgroup 差异需要额外诊断。
  3. 实验主要是离线候选集 reranking;在线交互、多轮工具调用、长上下文和 agent memory 场景尚未覆盖。
  4. BoP 的近似最优性是 uniform reward mapping 下的 reward-KL 结论;真实输出空间中仍需观察 empirical CDF 估计误差。
  5. 当 proxy reward 从一开始就和 true reward 冲突时,hedging 会返回接近 reference 的保守策略,无法从坏 proxy 中创造有效信号。
  6. 论文没有把不同 prompt subgroup 的最优 θ\theta 做成 deployment policy,统一 θ\theta 可能对少数任务群过度优化或保守。

跨论文关系

  • LLM-as-a-Verifier:后者用 verifier score 从多条 agent trajectories 中选择输出,直接处于 inference-time proxy optimization 场景。随着候选池和 verification compute 增大,应报告 true outcome 的 NN sweep、oracle gap 和 score calibration,检查 proxy winner's curse 是否出现。
  • 2403.03185:两者共同给 reward hacking 提供形式化坐标。ORPO 关注训练后策略离开 reference occupancy 后 proxy 失效;本文关注推理阶段 candidate selection 把分布推向 proxy 高估区域。两者都把 reference distribution 放在定义中心。
  • 2501.09620:CRM 在 reward model 训练阶段降低已知 spurious factor 的影响;HedgeTune 在 reward model 固定后限制推理时的 overoptimization。两者可以组合:先训练更稳的 reward model,再校准 inference-time selection strength。
  • 2503.11926:CoT monitor 一旦成为训练目标会 Goodhart 化;本文展示 proxy reward 一旦成为推理选择目标也会 Goodhart 化。两者都支持“测量信号进入优化闭环后必须重新校准”的判断。
  • 2606.04075:SocioHack 讨论 RL 在社会规则环境中寻找制度漏洞;本文提供更基础的 inference-time 机制,说明即使不训练模型,只在候选中选最高 proxy,也会产生 reward hacking。
  • 2506.10947:Spurious Rewards 说明 RLVR gain 可以来自 prior amplification 和 objective bias;本文说明 inference-time reward gain 也需要加入 proxy / true reward sweep,避免把 proxy score 提升解释成真实能力提升。
  • 2605.30290:STV 比较 V-R 与 BoN,并强调 verifier calibration;本文给出 BoN 在 proxy reward selection 下的 hacking threshold 语言,可用于诊断 verifier-guided inference 是否过度追 verifier 分数。
  • 2504.13837:两者都提醒 pass@kk / Best-of-nn 相关指标需要看分布变化。2504.13837 关注 RL 是否扩大 base model reasoning boundary;本文关注从候选集中按 proxy reward 选择时,true reward 随 nn 的非单调变化。
  • 2606.00135:tool-calling RL 中 harness 和 judge 会改变 effective reward;本文提供一个 deployment-time 校准框架,可用于 tool-use agent 多候选 trajectory reranking。

Reference Intake Brief

Target

  • Intended target system: 新增论文笔记 / reward hacking 与 inference-time alignment 专题。
  • Existing related assets: content/utility/papers-index.md2403.031852501.096202503.119262606.040752506.10947
  • Proposed form: 新建独立 Markdown 文档,更新 papers-index.md 的索引行,并维护对应论文的关系章节。

Reusable Elements

  1. Inference-time reward hacking 定义:proxy reward 和 KL 继续上升,true reward 过阈值后下降。
  2. Winner's curse 解释:多候选极值选择放大 proxy overestimation。
  3. BoP:Poissonized BoN,单参数近似 reward-KL optimal tilting。
  4. HedgeTune:用校准 true reward 找 BoN/SBoN/BoP 的最佳推理参数。
  5. 复验 checklist:proxy sweep、true reward sweep、distortion、subgroup threshold、gold reward noise。

Risks

  • Copyright/over-copying: 笔记使用概括和必要公式,避免长段复制论文原文。
  • Unsourced or unverifiable claims: 版本、作者、comment、分类来自 arXiv abstract / source;代码链接来自 TeX appendix。
  • Tone/brand mismatch: 保持技术档案风格,区分作者结论和本地分析。
  • Safety/compliance issues: 论文涉及 reward hacking,但本文聚焦机制、评测和防御,不沉淀可直接滥用的操作流程。
  • Overlap with existing assets: 与 ORPO、CRM、SocioHack、CoT monitoring、Spurious Rewards 强重叠,本笔记新增价值是 inference-time selection / hedging 层。

Skipped

Material Reason
完整 proof 细节 长期价值集中在定理条件、HedgeTune residual 和 BoP 结论。
所有 appendix 图逐项复写 代表性实验趋势已经覆盖,细节可回源查看。
代码仓库实测 用户请求是论文分析,未要求复现实验。

Recommendation

Decision: merge

Why: 这篇论文补齐本地 reward hacking 图谱中的 inference-time alignment 节点,和 ORPO、CRM、CoT monitoring、SocioHack、Spurious Rewards 一起构成“reward 设计、reward model、policy optimization、inference selection、monitor feedback”五层风险视角。