← Back to list
Exp-RSFT

Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback

生成式推荐 Meta
Abstract 7 │ Reading 7 │ Rating —
2026-08-01
Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya
Netflix Research, Stanford University, Meta
针对生成式推荐后训练中日志反馈稀疏且带噪、学出来的 reward model 无法泛化的问题,本文分析 Exp-RSFT——把每条日志轨迹按 exp(R(τ)/λ) 加权做监督微调,等价于 KL 约束下对行为策略的指数倾斜,因而完全离线、不需要 reward model 也不需要倾向性分数;理论上证明其次优性分解为随 log(1/p*) 增长的覆盖代价与随 O(σ√(T·log|A|)) 增长的噪声代价,二者随温度反向移动并在闭式 λ*=2√(R_max·ε/log(1/p*)) 处取最优,且覆盖代价随轨迹长度线性而非指数累积;HSTU 骨干上的实验在 ML-1M/ML-20M/Amazon Books 与私有 StreamCo 上复现了预测的倒 U 曲线,Exp-RSFT 五项排序指标全线最优(相对 BC NDCG@10 +8.5%~+12.3%,StreamCo 相对 RSFT +106.20%),而 PPO 与 DPO 因过优化一个连 Item Mean 都打不过的 reward model 而严重崩塌。
评分原因
摘要评分:生成式推荐后训练/对齐是主线议题,方法简洁且带覆盖代价与噪声代价的理论拆解,并在大规模工业数据集上复现了理论预测;但指数奖励加权本质是 RWR/AWR 谱系的既有思路,且只有离线工业数据集、无线上 A/B,工业验证不足,给 7。
精读评分:理论贡献扎实且干净——把指数 reward 加权的次优性拆成覆盖代价与噪声代价、给出闭式最优温度并预测出倒 U 曲线,Table 2「学出来的 RM 连 Item Mean 都打不过」是可复用的负面结论;但算法本身是 RWR/MARWIL 谱系的既有方法(作者自陈),实验全部退化到 T=1、恰好回避了理论中最有新意的多步部分,且单次运行无种子方差、ML-1M 测试集仅 1530 条而相对 RSFT 只差 1.9%,唯一的大幅增益来自不可复现的私有 StreamCo,也无线上 A/B。
rl industrial transformer training-stability

Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback 精读

Keertana Chidambaram(Stanford MS&E,实习于 Netflix Research)、Sanath Kumar Krishnamurthy(Meta)、Qiuling Xu、Ko-Jen Hsiao、Moumita Bhattacharya(Netflix Research)。arXiv:2608.00816v1,2026-08-01,cs.IR。后两位与第二位标注为同等贡献。

1 研究动机与背景

1.1 生成式推荐的后训练缺口

生成式推荐(generative recommender)把推荐重构成「在用户交互历史上做序列生成」,与 LLM 的 next-token prediction 同构。SASRec、HSTU、OneRec 这一谱系的模型都是用 behavior cloning(行为克隆) 训练的:直接最大化日志里下一个物品的似然。作者一开始就点出这条范式的结构性缺陷——行为克隆不加区分地模仿两类行为:

  • 高价值参与(genuine enjoyment,用户真正喜欢);
  • 低价值参与(accidental clicks、click-bait,误点与标题党)。

RLHF 在 LLM 上已经证明:拿真实用户反馈做后训练,能突破单纯行为克隆的上限。推荐场景看起来是 RLHF 的天然温床——评分、评论、观看时长、复访这些有机反馈(organic feedback) 规模巨大,而这恰恰就是区分高价值与低价值参与所需的信号。

1.2 把 RLHF 搬到推荐上的四个独特障碍

论文列了四条,每一条都直指标准 RLHF 流水线在推荐里失效的具体环节:

  • 用户交互稀疏(Sparse user interactions)。大目录下用户只碰到极小一部分物品,而且物品表征纯粹从用户行为里学出来、没有语义接地(no semantic grounding)。在这么稀疏的数据上拟合的 reward model 必须在巨大物品空间上做外推,泛化极差。后训练时策略会去利用(exploit) 这些预测误差——即 reward hacking,系统性地挑选那些「reward model 不可靠」的物品,而不是用户真正偏好的物品。
  • 奖励带噪(Noisy rewards)。即使被观测到的 reward 也只是偏好的不完美度量:同一物品在不同 session 的评分会变、点击受 position bias 影响、隐式信号会因与偏好无关的原因波动。任何直接在日志 reward 上优化的方法都必须防止过拟合到这些噪声。
  • 无法在线探索(No online exploration)。工业数据集是预先收集的静态数据,策略无法在训练中途向用户索要新反馈。标准 RLHF 用「训一个 reward model 当模拟器」绕开这一点,但在推荐设定下这个模拟器继承了上面的泛化失败,等于把问题原样搬回来。
  • 日志策略未知(Unknown logging policy)。reward 只在「线上策略曾经展示过的物品」上被观测到,天然带选择偏置。原则上 IPS(Inverse Propensity Scoring)可以按展示概率重加权来纠偏,但生产日志策略要么太复杂(Covington et al. 2016)要么不可访问(Liang & Vlassis 2022),无法估计倾向性;而且 IPS 权重方差极大,日志策略接近确定性时尤甚。

1.3 本文的选择:Exp-RSFT

为同时绕开这四条,作者采用 Exponential Reward-Weighted SFT(Exp-RSFT):把每条日志轨迹 $\tau$ 用 $\exp(R(\tau)/\lambda)$ 加权,其中 $R(\tau)$ 是该轨迹被观测到的累计 reward,$\lambda>0$ 是温度。这个设计有三条直接的性质:

  1. 永不查询学习出来的 reward model,因此不可能 reward hack;
  2. 不需要倾向性分数(propensity scores),因此不受未知日志策略之苦;
  3. 完全离线,不需要在线探索。

论文非常坦率地承认:算法本身早已为人所知(RWR,Peters & Schaal 2007;MARWIL,Wang et al. 2018;LPI,Liang & Vlassis 2022)。本文的贡献是给出「它在这个 regime 下何时、为何有效」的理论刻画,并用实验证实理论预测。三条贡献:

  • 理论上的次优性分解:证明 Exp-RSFT 学到的策略能与任意想要模仿的对照策略(comparator policy)竞争(含最优策略),且相对最优策略的次优性裂成两个可解释的项——coverage cost(覆盖代价),只随「最优轨迹在日志策略下概率的倒数」对数增长;noise cost(噪声代价),只随目录规模对数增长。分析是轨迹级(trajectory-level) 的,不需要 reward model 也不需要 value function,并把 contextual bandit 作为 $T=1$ 的特例回收。
  • 温度作为权衡参数:两项代价随 $\lambda$ 反向移动——覆盖偏好小温度,噪声鲁棒性偏好大温度。两者之和在一个闭式 $\lambda^\star$ 处最小,因此理论预测性能随 $\lambda$ 变化呈倒 U 形。
  • 验证理论的实验:三个公开基准 + 一个大规模私有数据集上,温度扫描确实描出了预测的倒 U 曲线;Exp-RSFT 优于 behavior cloning、线性 reward 加权(RSFT)、PPO 与 DPO。相对 RSFT 的增益把「温度」隔离为起作用的关键成分。与理论所针对的 regime 一致:学到的 reward model 在本文设定下打不过 naive baseline,而 PPO 与 DPO 因过优化它而崩溃。

2 相关工作

生成式推荐的后训练。 标准方法是 RLHF、GRPO、DPO。RLHF 与 GRPO 都从当前策略采样输出、再用 reward model / verifier / 模拟器打分;但推荐里没有 ground-truth 正确性可验证,也没有活的用户响应模拟器,所以打分必须来自一个「从稀疏观测出发在巨大目录上外推」的学习型 reward model,这直接招来 §5 中记录的 reward hacking。DPO 绕开了 reward model 训练,但需要 (preferred, dispreferred) 对,而评分、观看时长这类标量反馈并不提供偏好对;用 reward model 给候选排序来构造偏好对,等于把同一个问题重新引入。

除了 reward 建模的问题,日志数据只包含日志策略选择展示过的物品的反馈。经典离线策略学习用 IPS 或保守 value function(CQL)来纠正,但生产日志策略下倾向性不可得,value function 又要在目录上泛化。行为克隆什么都不需要,但无法超越日志策略。于是「直接在日志 reward 上优化、同时保持贴近日志策略」的方法成为这个 regime 的自然候选。

指数 reward 加权。 本文分析的算法有一长串前身:RWR、MARWIL、IQL、CRR、LPI,都用回报或优势的单调(通常是指数)函数去加权对数似然。IQL、CRR、MARWIL 从学习出的 value function 构造 advantage;RWR 直接按回报加权,本文与之相同,彻底避开 value function 估计。相对 Mukherjee et al. (2025) 的线性 reward 加权,指数形式增加了温度 $\lambda$ 这个显式鲁棒性旋钮,并且避免了线性方案在基于似然的目标里的负权重病态(Steck 2010;Schnabel et al. 2016)。已有的该家族分析处理的是优化稳定性、收敛性、value function 估计中的分布漂移,没有任何一篇刻画 reward 噪声下的行为,或量化大动作空间下有限覆盖的代价。提供这一刻画正是 §4 的贡献。

LLM 后训练中的 reward 加权。 RLOO 每个 prompt 采多条输出、按 group-relative reward 加权;ALoL 需要倾向性分数与学习出的 value function。两者都无法迁移到本文设定——新反馈无法采样、倾向性未知。

3 背景与方法

3.1 问题设定

用户交互历史作为初始上下文 $s_1\sim d_0$。从 $s_1$ 出发,策略生成一条长度 $T$ 的推荐轨迹:第 $t$ 步在当前状态 $s_t$ 下选择物品 $a_t\in\mathcal{A}$,状态确定性地追加所选物品更新,$s_{t+1}=(s_t,a_t)$。策略 $\pi$ 因此在轨迹 $\tau=(s_1,a_1,\dots,s_T,a_T)$ 上诱导一个分布,乘积形式与求和形式等价:

$$\pi(\tau\mid s_1)=\prod_{t=1}^{T}\pi(a_t\mid s_t),\qquad \log\pi(\tau\mid s_1)=\sum_{t=1}^{T}\log\pi(a_t\mid s_t). \tag{1}$$

每条轨迹得到一个标量 reward $R(\tau)$,概括用户在这次推荐 session 里的反馈。作者刻意把 $R$ 当作轨迹的任意泛函:它可以由每步观测到的反馈算出,可以是轨迹中途收集的中间反馈,可以是终局的 session 级反馈,也可以是任何别的评估指标。分析唯一要求的是「反馈能被表示成与每条轨迹绑定的标量 reward」。假设有一个在未知日志(行为)策略 $\pi_\beta$ 下收集的离线数据集 $\mathcal{D}=\{\tau_i\}_{i=1}^n$,含观测 reward。策略从上下文 $s$ 出发的价值为

$$V^\pi(s)=\mathbb{E}_{\tau\sim\pi(\cdot\mid s)}[R(\tau)]. \tag{2}$$

Contextual bandit 是 $T=1$ 的特例:$\tau=(s,a)$,$R(\tau)=r(s,a)$。

3.2 从 KL 约束优化到指数加权 SFT

沿用 AWAC(Nair et al. 2020),寻找一个在保持贴近数据生成分布的前提下最大化期望 reward 的策略:

$$\max_{\pi}\ \mathbb{E}_{s\sim d_0,\ \tau\sim\pi(\cdot\mid s)}[R(\tau)]\quad \text{s.t.}\quad \mathbb{E}_{s\sim d_0}\big[D_{\mathrm{KL}}(\pi(\cdot\mid s)\,\|\,\pi_\beta(\cdot\mid s))\big]\le\varepsilon, \tag{3}$$

优化在轨迹上的分布这一层进行。用乘子 $\lambda$ 写拉格朗日量并令泛函导数为零,得到闭式解

$$\pi^*(\tau\mid s)=\frac{1}{Z(s)}\,\pi_\beta(\tau\mid s)\exp\!\Big(\frac{R(\tau)}{\lambda}\Big),\qquad Z(s)=\sum_{\tau'}\pi_\beta(\tau'\mid s)\exp\!\Big(\frac{R(\tau')}{\lambda}\Big), \tag{4}$$

其中求和遍历从初始状态 $s$ 出发的所有轨迹。式 (4) 可以读成把行为策略朝高 reward 轨迹做一次指数倾斜(exponential tilt)。

这里有一个对工程落地至关重要的观察:生成式推荐器本身就在轨迹上定义自回归分布,因此倾斜后的分布 $\pi^*$ 仍然落在同一个自回归策略类里——不需要换模型结构。为得到参数化策略 $\pi_\theta$,把 $\pi^*$ 投影到策略类上,即最小化 $D_{\mathrm{KL}}(\pi^*\|\pi_\theta)$。用密度比 $\pi^*/\pi_\beta$ 把期望改写到 $\pi_\beta$ 下,并像 AWAC 那样丢掉配分函数,得到加权极大似然目标:

$$\theta^*=\arg\max_{\theta}\ \mathbb{E}_{\tau\sim\mathcal{D}}\left[\exp\!\Big(\frac{R(\tau)}{\lambda}\Big)\sum_{t=1}^{T}\log\pi_\theta(a_t\mid s_t)\right], \tag{5}$$

内层求和就是式 (1) 的轨迹对数似然。这就是 Algorithm 1:一次标准的监督微调,只是每条日志轨迹被自己「取指数、按温度缩放后的 reward」加权。 它不需要 reward model、不需要倾向性分数、不需要知道 $\pi_\beta$;唯一的超参 $\lambda$ 控制正则强度。

Algorithm 1(Exp-RSFT)

输入: 离线数据集 D = {τ_i}_{i=1}^n 及其 reward R(τ_i); 初始策略 π_θ; 温度 λ > 0; 轮数 E
for e = 1, ..., E do
    for 每个 mini-batch B ⊂ D do
        L(θ) ← -(1/|B|) * Σ_{τ∈B} exp(R(τ)/λ) * Σ_{t=1}^{T} log π_θ(a_t | s_t)
        更新: θ ← θ - η ∇_θ L(θ)
    end for
end for
输出: 微调后的策略 π_θ

值得强调这个目标的极简性:相对普通 SFT 只多了一个逐样本标量权重,梯度形状不变,因此工业训练栈几乎零改造成本。

4 理论分析

作者从三个视角分析指数 reward 加权:相对行为策略的改进、对带噪用户反馈的鲁棒性、reward 优化与离线数据覆盖之间的权衡。全程固定一个上下文 $s$,记 $\mathcal{T}$ 为从 $s$ 可达的轨迹集合,$|\mathcal{T}|\le|\mathcal{A}|^T$。

4.1 热身:无噪时的单调改进

先看理想情形——数据集给出真实 reward $R^*$。沿用 MARWIL(Wang et al. 2018)的策略改进论证,reward 加权策略 $\pi^*_\lambda(\tau\mid s)\propto\pi_\beta(\tau\mid s)\exp(R^*(\tau)/\lambda)$ 满足 $V^{\pi^*_\lambda}(s)\ge V^{\pi_\beta}(s)$。也就是说,在没有 reward 噪声时,指数加权通过把概率质量搬向更高 reward 的轨迹,一定不劣于行为策略。

但现实中用户反馈是带噪的:点击受呈现效应影响、评分随用户语境变化、参与信号含有与偏好无关的随机变动。因此作者转入更现实的设定——观测 reward 是底层 reward 的带噪估计。

Assumption 4.1(Sub-Gaussian Reward Noise):观测 reward 满足 $\hat R(\tau)=R^*(\tau)+\xi(\tau)$,其中 $R^*$ 是期望 reward,$\xi(\tau)$ 对每条轨迹 $\tau$ 都是零均值 $\sigma$-sub-Gaussian 随机变量。

这条假设覆盖了推荐系统里常见的反馈信号:有界反馈(点击、评分)通过 Hoeffding 引理满足;近似高斯变动的连续反馈同样被覆盖。关键的是,假设只加在最终的轨迹级 reward 上——中间 reward 之间可以任意相关,只要它们的聚合产生一个 sub-Gaussian 的轨迹级误差即可。这一点让理论对「session 内多步反馈高度相关」的真实推荐场景保持适用。

记 $\pi_\lambda(\tau\mid s)\propto\pi_\beta(\tau\mid s)\exp(\hat R(\tau)/\lambda)$ 为从带噪 reward 得到的策略。作者不只把 $\pi_\lambda$ 与 $\pi_\beta$ 比,而是与任意对照策略 $\tilde\pi$ 比,这样学到的策略可以对任何目标策略(包括最优策略)做评估,同时显式计入「那个目标离线数据分布有多远」。

4.2 Theorem 4.2:带噪 reward 下的策略改进

Theorem 4.2:固定上下文 $s$。在 Assumption 4.1 下,以至少 $1-\delta$ 的概率,对每一个对照策略 $\tilde\pi$:

$$V^{\pi_\lambda}(s)\ \ge\ V^{\tilde\pi}(s)-\lambda\,D_{\mathrm{KL}}\big(\tilde\pi(\cdot\mid s)\,\|\,\pi_\beta(\cdot\mid s)\big)-2\epsilon,\qquad \epsilon:=\sigma\sqrt{2\log(2|\mathcal{T}|/\delta)}. \tag{6}$$

定理把性能差拆成两个可解释项:

  • 第一项 $\lambda D_{\mathrm{KL}}(\tilde\pi\|\pi_\beta)$ 是 coverage cost(覆盖代价):离线学习无法可靠地模仿那些「把概率质量放在日志数据之外」的策略;
  • 第二项 $2\epsilon$ 是随机用户反馈诱导的 noise cost(噪声代价)。由于 $\log|\mathcal{T}|\le T\log|\mathcal{A}|$,噪声惩罚的量级是 $O(\sigma\sqrt{T\log|\mathcal{A}|})$,只随目录规模对数增长——这是在百万级目录下仍然可用的关键。

证明骨架(附录 A.1)分四步:

  1. 噪声事件:每个 $\xi(\tau)$ 是 $\sigma$-sub-Gaussian,标准尾界配上对 $|\mathcal{T}|$ 条轨迹的 union bound 给出,以至少 $1-\delta$ 概率 $|\xi(\tau)|\le\epsilon,\ \forall\tau\in\mathcal{T}$。注意这里不需要轨迹间独立性——union bound 只用到每个 $\xi(\tau)$ 的边缘尾部。
  2. 变分恒等式:定义 $F(\pi)=\sum_\tau\pi(\tau\mid s)\hat R(\tau)-\lambda D_{\mathrm{KL}}(\pi\|\pi_\beta)$,则

$$F(\pi)=\lambda\log Z-\lambda D_{\mathrm{KL}}(\pi\,\|\,\pi_\lambda). \tag{14}$$

由于 KL 非负且当且仅当 $\pi=\pi_\lambda$ 时为零,倾斜策略 $\pi_\lambda$ 是 $F$ 的唯一最大值点,特别地 $F(\pi_\lambda)\ge F(\tilde\pi)$。

  1. 对照不等式:展开 $F(\pi_\lambda)\ge F(\tilde\pi)$ 并在左边丢掉非负项 $\lambda D_{\mathrm{KL}}(\pi_\lambda\|\pi_\beta)\ge0$,得 $\sum_\tau\pi_\lambda\hat R\ \ge\ \sum_\tau\tilde\pi\hat R-\lambda D_{\mathrm{KL}}(\tilde\pi\|\pi_\beta)$。
  2. 噪声换算:在事件 (A1) 上,$V^{\pi_\lambda}(s)\ge\sum_\tau\pi_\lambda\hat R-\epsilon$ 且 $\sum_\tau\tilde\pi\hat R\ge V^{\tilde\pi}(s)-\epsilon$,串起来即得。

若 $D_{\mathrm{KL}}(\tilde\pi\|\pi_\beta)=\infty$ 则界平凡成立,所以全程假定它有限——等价于 $\tilde\pi(\cdot|s)$ 的支撑落在 $\pi_\beta(\cdot|s)$ 的支撑内。§4.1 的无噪单调改进就是 $\sigma=0$(故 $\epsilon=0$)并取 $\tilde\pi=\pi_\beta$ 的特例。

4.3 Theorem 4.3:温度如何显式控制噪声–覆盖权衡

Theorem 4.2 里 $\lambda$ 只是个正则参数。当 reward 有界时,可以刻画 $\lambda$ 如何显式控制这个权衡。

Theorem 4.3:设 $R^*(\tau)\in[0,R_{\max}]$。在 Theorem 4.2 的条件下,以至少 $1-\delta$ 概率,对每个对照策略 $\tilde\pi$:

$$V^{\pi_\lambda}(s)\ \ge\ V^{\tilde\pi}(s)-\lambda\,D_{\mathrm{KL}}\big(\tilde\pi(\cdot\mid s)\,\|\,\pi_\beta(\cdot\mid s)\big)-R_{\max}\big(e^{2\epsilon/\lambda}-1\big). \tag{7}$$

当 $\lambda\ge2\epsilon$ 时,$R_{\max}(e^{2\epsilon/\lambda}-1)\le 4R_{\max}\epsilon/\lambda$。

含义:增大 $\lambda$ 让策略更保守,线性地抬高对照代价,同时以 $O(1/\lambda)$ 的速率降低对 reward 噪声的敏感度;反之,减小 $\lambda$ 允许更强地利用高 reward 轨迹,但会放大 reward 噪声。

证明骨架(附录 A.2)的核心是把「真实倾斜」与「带噪倾斜」之间的总变差界住。记真实 reward 下的倾斜为 $\pi^*_\lambda\propto\pi_\beta\exp(R^*/\lambda)$(配分 $Z^*$),带噪倾斜为 $\pi_\lambda\propto\pi_\beta\exp(\hat R/\lambda)$(配分 $Z$):

  1. 干净对照不等式:把变分恒等式 (14) 用在真实 reward 上,得 $V^{\pi^*_\lambda}(s)\ge V^{\tilde\pi}(s)-\lambda D_{\mathrm{KL}}(\tilde\pi\|\pi_\beta)$,确定性成立(两边只涉及真实 reward,不需要噪声事件)。
  2. 分解:$V^{\pi_\lambda}(s)=V^{\pi^*_\lambda}(s)-\big(V^{\pi^*_\lambda}(s)-V^{\pi_\lambda}(s)\big)$,于是只需界住噪声差。
  3. 界住噪声差:因 $R^*\in[0,R_{\max}]$,有 $|V^{\pi^*_\lambda}-V^{\pi_\lambda}|\le R_{\max}\sum_\tau|\pi^*_\lambda-\pi_\lambda|=2R_{\max}D_{\mathrm{TV}}(\pi^*_\lambda,\pi_\lambda)$。定义噪声权重 $w(\tau)=\exp(\xi(\tau)/\lambda)$,在事件 (A1) 上 $e^{-\epsilon/\lambda}\le w(\tau)\le e^{\epsilon/\lambda}$。带噪配分函数因式分解为 $Z=Z^*\sum_\tau\pi^*_\lambda(\tau|s)w(\tau)$,故 $\rho:=Z^*/Z$ 满足 $e^{-\epsilon/\lambda}\le\rho\le e^{\epsilon/\lambda}$;两式相除给出策略比 $\pi_\lambda/\pi^*_\lambda=w(\tau)\rho\in[e^{-2\epsilon/\lambda},e^{2\epsilon/\lambda}]$,于是 $|w\rho-1|\le\max(e^{2\epsilon/\lambda}-1,\,1-e^{-2\epsilon/\lambda})=e^{2\epsilon/\lambda}-1$(因为 $x\ge0$ 时 $e^x-1\ge1-e^{-x}$),从而 $D_{\mathrm{TV}}\le(e^{2\epsilon/\lambda}-1)/2$。
  4. 合并:代回即得 (7);$\lambda\ge2\epsilon$ 时用 $e^x-1\le2x\ (x\in[0,1])$ 得到 $4R_{\max}\epsilon/\lambda$ 的简化式。

这一步的技术要点在于:噪声不是加性地污染 value,而是乘性地扰动倾斜分布,因此界必须走 TV 距离而不是直接的 reward 误差累加,$e^{2\epsilon/\lambda}$ 的形式正是这个乘性结构的产物。

4.4 Theorem 4.4:覆盖依赖的次优性界与闭式最优温度

最后把对照策略 $\tilde\pi$ 取成上下文 $s$ 的最优策略,把「一般对照界」转化为「相对最高 reward 轨迹的次优性刻画」。令 $\tau^\star(s)\in\arg\max_\tau R^*(\tau)$ 为从 $s$ 出发的最优轨迹,定义它在行为策略下的覆盖 $p^\star(s)=\pi_\beta(\tau^\star(s)\mid s)$。

Theorem 4.4:在 Theorem 4.3 的条件下,以至少 $1-\delta$ 概率:

$$\max_\tau R^*(\tau)-V^{\pi_\lambda}(s)\ \le\ \lambda\log\frac{1}{p^\star(s)}+R_{\max}\big(e^{2\epsilon/\lambda}-1\big). \tag{8}$$

当 $\lambda\ge2\epsilon$ 时右端至多为 $\lambda\log(1/p^\star(s))+4R_{\max}\epsilon/\lambda$,该式在

$$\lambda^\star=2\sqrt{\frac{R_{\max}\,\epsilon}{\log(1/p^\star(s))}} \tag{9}$$

处取最小,最小值为 $4\sqrt{R_{\max}\,\epsilon\,\log(1/p^\star(s))}$。

这是全文的中心权衡。第一项度量「从离线数据中恢复最优轨迹的难度」:如果行为策略几乎不访问最优轨迹,任何保支撑(support-preserving)的方法都无法可靠地恢复它。第二项刻画对带噪反馈的敏感度。因此——最优温度随 reward 噪声上升、随数据覆盖上升而下降。

覆盖项的序列化解读。 用式 (1) 的自回归分解,

$$\log\frac{1}{p^\star(s)}=\sum_{t=1}^{T}\log\frac{1}{\pi_\beta(a^\star_t\mid s^\star_t)}, \tag{10}$$

其中 $(s^\star_t,a^\star_t)$ 是最优轨迹上的状态与动作。覆盖惩罚因此分解为逐步代价之和。这是一个非常漂亮的观察:虽然「在行为策略下观测到某条特定长度-$T$ 轨迹」的概率随 horizon 乘性衰减,但界里对应的惩罚是它的对数,跨步加性累积。因此恢复目标轨迹的代价随轨迹长度线性增长,而非指数增长——这为把方法推广到多步 session 级推荐提供了理论底气。

证明骨架(附录 A.3):若 $p^\star(s)=0$ 则右端无穷,界平凡。否则取 $\tilde\pi(\cdot|s)$ 为 $\tau^\star(s)$ 上的点质量,此时 $V^{\tilde\pi}(s)=\max_\tau R^*(\tau)$ 且 $D_{\mathrm{KL}}(\tilde\pi\|\pi_\beta)=\log\frac{1}{\pi_\beta(\tau^\star(s)|s)}=\log\frac{1}{p^\star(s)}$,代入 Theorem 4.3 即得 (8)。第二个论断把右端记为 $g(\lambda)=\lambda\log\frac{1}{p^\star}+\frac{4R_{\max}\epsilon}{\lambda}$,它是凸的,$g'(\lambda)=\log(1/p^\star)-4R_{\max}\epsilon/\lambda^2$ 在 (9) 处为零。

实践上的诚实说明:reward 无噪时噪声项消失,越小的温度越偏向最优轨迹,剩下的限制只由离线覆盖决定。带噪时 $\lambda$ 不能任意减小——激进重加权改善了对高 reward 轨迹的利用,但放大了对 reward 噪声的敏感度;大温度提高鲁棒性但代价是更贴近行为策略。这正是 §5 中观测到的倒 U 关系的解释。作者明确指出:虽然式 (9) 刻画了 $\lambda^\star$,但求值需要 reward 噪声水平和最优轨迹覆盖这些未知量,因此不能直接用于实践中的超参选择,$\lambda$ 仍需经验调优。

5 实验设置

实验的形式化实例化。 理论考虑的是自回归生成式推荐器的一般轨迹级设定;实验则实例化到 next-item 推荐,即单步情形 $T=1$。此时轨迹由「用户上下文 + 一个推荐物品」构成,$\tau=(s,a)$,轨迹 reward 退化为观测到的物品级反馈 $R(\tau)=r(s,a)$。这样既能直接评估指数 reward 加权,又保留与一般形式的联系。

数据集。 三个公开序列推荐基准 + 一个大规模工业数据集:MovieLens 1M(ML-1M)、MovieLens 20M(ML-20M)、Amazon Reviews(Books)、以及一个匿名化的私有流媒体数据集 StreamCo。基准覆盖了从「稠密的电影推荐」到「稀疏的大目录推荐」的谱系。

Table 1:数据集统计

Dataset Users Items Avg. Interactions/User Test Cases ($r\ge4.5$)
ML-1M 6,040 3,706 165.60 1,530
ML-20M 138,493 26,744 144.41 40,667
Amazon Books 811,227 695,762 14.47 424,271
StreamCo O(Millions) O(Thousands) O(Tens) O(Thousands)

Amazon Books 是目录规模与稀疏度的极端点(69.6 万物品、人均仅 14.47 次交互),恰好落在理论关心的「覆盖极差」regime;ML-1M 则是「覆盖好但测试样本只有 1,530 条」的另一端。

模型与训练设置。 底座生成式推荐器统一用 HSTU(Zhai et al. 2024)。预训练好的 HSTU 直接作为 behavior cloning(BC)baseline,做 next-item 预测。对需要 reward model 的方法,在推荐器表征之上训一个轻量 reward head 预测所选物品对应的反馈,其预测的物品级 reward 作为优化信号。

对比算法(5 个),横跨行为克隆、reward 加权 SFT、RL 对齐三类:

  • BC(Behavior Cloning):预训练 HSTU,只用 next-item 预测训练,无 reward 优化。
  • RSFT(Reward-weighted SFT):按观测 reward 线性加权训练样本(Mukherjee et al. 2025)。
  • DPO:提升偏好物品相对非偏好物品的似然。由于推荐数据集不含显式偏好对,作者采样候选物品并用 reward model 打分来构造偏好,遵循 online DPO 风格训练(follow OneRec)。
  • PPO:用学习出的 reward model 给出的 reward 更新推荐策略。
  • Exp-RSFT(本文):即 Algorithm 1。在实验的 $T=1$ 设定下,它按 $\exp(r(s,a)/\lambda)$ 加权 next-item 似然,是 §3.2 轨迹级指数加权的单步实例化。

由于 StreamCo 的私有性质,报告相对 RSFT 的相对变化而非绝对值(因保密无法以 BC 为基准)。训练轮数:ML-1M 30 epochs、ML-20M 12 epochs、Amazon Books 10 epochs。

评估。 在 ML-1M / ML-20M / Amazon Books 的标准测试划分上评估,只保留评分 $\ge4.5$ 的 held-out 交互。这既把评估聚焦在高偏好推荐上,也与 reward 优化目标对齐。所有方法(含 BC)都在同一批过滤后的测试集上评估。设 $r_i$ 为 ground-truth 物品在全部候选中的排名,报告:

$$\mathrm{HR@}K=\frac1N\sum_{i=1}^{N}\mathbb{1}(r_i\le K), \tag{11}$$

$$\mathrm{NDCG@}K=\frac1N\sum_{i=1}^{N}\frac{\mathbb{1}(r_i\le K)}{\log_2(r_i+1)}, \tag{12}$$

$$\mathrm{MRR}=\frac1N\sum_{i=1}^{N}\frac{1}{r_i}. \tag{13}$$

HR 与 NDCG 的截断取 $K\in\{10,50\}$。此外还报告 Avg Reward(reward-model-as-judge,见 §6.2)。

训练细节(附录 B.1):全部实验在 4 张 NVIDIA A100 上完成。每个「算法–数据集」配置只跑一次训练(single run),作者以「Exp-RSFT 的提升在全部 5 个评估指标、全部 4 个数据集上一致」作为鲁棒性证据;温度 $\lambda$ 与训练轮数在 §5 给出,其余超参(含固定随机种子)随代码提供,可精确复现。

评分分布(附录 B.2)。Figure 2 显示三个公开数据集的评分集中在高分端,这正是评估采用 $r\ge4.5$ 过滤的动机。

Figure 2: Distribution of ratings in the three public test datasets.

6 主要实验结果

6.1 Reward model 质量基准:学习出的 RM 打不过朴素基线

这是全文最关键的一张「否定性」表。为评估学习出的 reward model 的可靠性,作者拿它的预测误差与三个极其朴素的基线比:User Mean、Item Mean、Global Mean 预测器。

Table 2:Reward model 预测性能 vs. 朴素基线(各行最优加粗;列依次为 User-Mean / Item-Mean / Global-Mean / 训练出的 reward model)

Dataset Metric User Item Global RM
ML-1M MSE 1.0784 0.9179 1.2394 1.2166
ML-1M MAE 0.8232 0.7619 0.9268 0.8680
ML-20M MSE 0.9550 0.8898 1.0939 0.8963
ML-20M MAE 0.7588 0.7320 0.8423 0.7307
Amazon Books MSE 1.1578 0.7290 1.1868 1.1067
Amazon Books MAE 0.7411 0.5651 0.8636 0.8140
StreamCo MSE 2.412 2.568 2.568 2.486
StreamCo MAE 2.112 2.442 2.451 1.916

分析:在 8 行里 reward model 只赢下 2 行(ML-20M MAE、StreamCo MAE),在目录最大、最稀疏的 Amazon Books 上被 Item Mean 拉开巨大差距(MSE 1.1067 vs 0.7290,MAE 0.8140 vs 0.5651);在 ML-1M 上甚至连 Global Mean 的 MSE 都只是勉强打平(1.2166 vs 1.2394)。这直接印证了 §1.2 的第一条障碍:为未见过的物品准确预测用户反馈本身就极其困难。而 PPO/DPO 的全部优化信号都来自这样一个 reward model——它们优化的是一个连 Item Mean 都不如的代理。这就是后面 reward hacking 的机制根源。

6.2 主表:PPO/DPO 崩塌,Exp-RSFT 全线最优

Table 3:公开基准($r\ge4.5$)与私有 StreamCo(高 reward 轨迹)上的推荐性能(各数据集每列最优加粗;StreamCo 为相对 RSFT 的变化率,因数据保密用 RSFT 代替 BC 作基准)

Dataset Method NDCG@10 NDCG@50 HR@10 HR@50 MRR Avg Reward
ML-1M BC 0.1304 0.1866 0.2405 0.4967 0.1116 3.8672
ML-1M DPO 0.0091 0.0231 0.0163 0.0824 0.0122 3.3737
ML-1M PPO 0.0303 0.0617 0.0673 0.2124 0.0285 4.4775
ML-1M RSFT 0.1437 0.2003 0.2608 0.5163 0.1230 3.6558
ML-1M Exp-RSFT 0.1465 0.2029 0.2712 0.5261 0.1235 3.6933
ML-20M BC 0.1753 0.2313 0.3035 0.5569 0.1510 3.7388
ML-20M DPO 0.0196 0.0342 0.0372 0.1052 0.0195 4.4008
ML-20M PPO 0.1164 0.1688 0.2141 0.4536 0.1008 3.7547
ML-20M RSFT 0.1847 0.2403 0.3161 0.5677 0.1593 3.7904
ML-20M Exp-RSFT 0.1912 0.2462 0.3238 0.5726 0.1651 3.8611
Amazon Books BC 0.0328 0.0478 0.0589 0.1279 0.0296 4.2824
Amazon Books DPO 0.0008 0.0020 0.0019 0.0075 0.0013 4.8615
Amazon Books PPO 0.0094 0.0156 0.0184 0.0469 0.0088 4.4549
Amazon Books RSFT 0.0349 0.0514 0.0630 0.1388 0.0314 4.3350
Amazon Books Exp-RSFT 0.0356 0.0520 0.0641 0.1397 0.0319 4.3374
StreamCo RSFT 0.00% 0.00% 0.00% 0.00% 0.00% 0.00%
StreamCo DPO −99.30% −96.77% −99.14% −95.52% −95.34% +19.21%
StreamCo PPO −4.88% −24.01% −14.66% −35.71% −8.60% +13.39%
StreamCo Exp-RSFT +106.20% +69.71% +98.07% +49.58% +86.31% +17.27%

逐条分析:

  1. Exp-RSFT 在四个数据集的五个排序指标上全部最优。相对 BC 的 NDCG@10 提升:ML-1M +12.3%(0.1304→0.1465)、ML-20M +9.1%(0.1753→0.1912)、Amazon Books +8.5%(0.0328→0.0356)。
  2. 相对 RSFT 的增量把「温度」隔离出来。RSFT 与 Exp-RSFT 的唯一区别就是权重从线性变成 $\exp(r/\lambda)$。NDCG@10 增量:ML-1M +1.9%、ML-20M +3.5%、Amazon Books +2.0%;StreamCo 上则是翻倍级的 +106.20%。这是全文最重要的对照实验设计——它排除了「加权本身」的功劳,把增益归因于温度这个显式鲁棒性旋钮。
  3. Avg Reward 与推荐质量完全反向。这是 reward hacking 最直白的证据:在每一个数据集上,取得最高 Avg Reward 的方法都伴随排序指标的严重退化——ML-1M 上是 PPO(Avg Reward 4.4775 最高,NDCG@10 却只有 0.0303,掉到 BC 的 1/4),ML-20M / Amazon Books / StreamCo 上都是 DPO(Amazon Books 上 Avg Reward 4.8615 最高,NDCG@10 却是 0.0008,几乎归零)。作者的 reward-model-as-judge 协议是:对 10,000 个评估上下文各采 10 条生成,取 reward model 预测 reward 的均值。
  4. DPO 崩得比 PPO 更彻底。Amazon Books 上 DPO 的 NDCG@10 是 BC 的 1/41,StreamCo 上相对 RSFT 掉 −99.30%。原因在 §2 已经交代:推荐数据没有天然偏好对,用 reward model 打分构造偏好对等于把 reward model 的误差直接编码进监督标签,比 PPO 只把它当作标量 reward 更致命。
  5. PPO 在 ML-20M 上退化最轻(NDCG@10 0.1164,仍是 BC 的 66%),恰好对应 Table 2 里 reward model 在 ML-20M 上表现最好(MAE 甚至赢过 Item Mean)。「RM 越可靠 → RL 崩得越轻」这条对应关系在跨数据集层面成立,是对论文因果叙事的有力旁证。
  6. StreamCo 上的巨大相对增益(+106.20% NDCG@10)说明:工业级稀疏噪声数据恰是 Exp-RSFT 相对线性加权优势最大的地方,与理论「噪声越大、温度旋钮越有价值」的预测方向一致。

训练曲线(附录 B.4)印证崩塌发生在训练早期。以 ML-1M 为例(Figure 5,epoch 0 即 BC baseline):DPO 在第 5 个 epoch 就把 NDCG@10 从 0.13 砸到 0.017 并再无恢复;PPO 起初尚能维持,从第 10 个 epoch 开始持续下滑到 0.03;而 RSFT 与 Exp-RSFT 全程单调上行并稳定在 BC 之上。

Figure 5: All metrics across training epochs for all algorithms on ML-1M.

Figure 6: All metrics across training epochs for all algorithms on ML-20M.

Figure 7: All metrics across training epochs for all algorithms on Amazon Books.

Figures 8–10 把镜头拉近到只看 RSFT 与 Exp-RSFT:Exp-RSFT 在每个数据集、几乎每个 epoch 上都优于 RSFT,而且两者都稳定高于 BC 虚线。ML-1M 上还能看到 RSFT 在第 25 个 epoch 后开始回落(HR@10 从 0.269 掉到 0.261),Exp-RSFT 则保持平稳——温度提供的正则效果同时改善了训练后期的稳定性。

Figure 8: RSFT versus Exp-RSFT across training epochs on ML-1M.

Figure 9: RSFT versus Exp-RSFT across training epochs on ML-20M.

Figure 10: RSFT versus Exp-RSFT across training epochs on Amazon Books.

6.3 温度扫描:倒 U 形曲线验证理论预测

这是论文唯一的、也是最重要的「理论–实验对拍」实验。Theorem 4.3 与 4.4 预测由温度 $\lambda$ 控制的权衡:小值激进强调高 reward 动作但提高对 reward 噪声的敏感度,大值贴近行为策略、改进潜力受限。作者在所有数据集上扫描 $\lambda$。

Figure 1: NDCG@10 for different values of λ across datasets.

结果:所有数据集上性能都呈倒 U 形——$\lambda$ 从大值下降时性能改善,在中间温度($\lambda\approx0.5\text{–}1.0$)达到最大,$\lambda$ 过小时再度退化。ML-1M 与 ML-20M 的峰值在 $\lambda=0.5$,Amazon Books 的峰值在 $\lambda=1.0$(其扫描范围更宽,$\lambda\in\{0.5,0.75,1.0,1.5,2.5,5.0\}$,$\lambda=5.0$ 时 NDCG@10 掉到 0.0345,但仍高于 BC 的 0.0328)。三张子图里 BC 都是一条水平虚线,整条曲线在所有扫描到的 $\lambda$ 上都位于 BC 之上——这意味着 Exp-RSFT 对 $\lambda$ 的选择相当鲁棒,调错温度只是少赚,不会亏。

与理论的对应:大温度通过限制对行为策略的偏离而压制改进(式 (8) 第一项 $\lambda\log(1/p^\star)$ 随 $\lambda$ 线性增长);过小的温度放大噪声敏感度(第二项 $R_{\max}(e^{2\epsilon/\lambda}-1)$ 随 $\lambda\to0$ 爆炸)。这正是式 (9) 所刻画的内点最优。

7 消融与分析

7.1 倒 U 不是早停假象(附录 B.3)

一个自然的质疑是:倒 U 会不会只是「不同 $\lambda$ 下最佳 epoch 不同」造成的选择效应?作者用 Figures 3 与 4 分别报告最佳 epoch 与最后一个 epoch 下全部五个指标的完整温度扫描,两种选法下倒 U 形状都出现,从而排除了早停作为混淆因素。这是一个虽小但重要的严谨性检查——它把「倒 U」从「调参痕迹」升格为「优化目标本身的性质」。

Figure 3: Best-epoch values of all five metrics for different λ, on the three public benchmarks.

Figure 4: Final-epoch values of all five metrics for different λ, on the three public benchmarks.

从 Figure 1 也能直接看出这一点:ML-1M 与 ML-20M 的 best-epoch(实线)与 final-epoch(虚线)两条曲线几乎平行,峰值位置一致。

7.2 组件贡献的隐式消融

论文没有设独立的消融章节,但整个 baseline 阵列本身就构成一组干净的逐层消融:

对比 隔离出的成分 结论
BC → RSFT 「用不用 reward 加权」 reward 加权有效(ML-1M NDCG@10 0.1304→0.1437,+10.2%)
RSFT → Exp-RSFT 「线性权重 vs. 指数权重 + 温度」 温度旋钮再带来 +1.9%~+3.5%(公开集)与 +106%(StreamCo)
Exp-RSFT vs. PPO/DPO 「用不用学习型 reward model」 用 RM 的方法全线崩塌,不用 RM 的方法全线改进
$\lambda$ 扫描 「温度取值」 内点最优,倒 U,$\lambda\approx0.5\text{–}1.0$

这组对照的说服力在于它们两两只差一个变量,把「加权」「温度」「reward model」三个因素彻底解耦。

8 核心贡献总结

  1. 把一个老算法放进正确的理论显微镜下。Exp-RSFT(= RWR / MARWIL / LPI 谱系)本身不新,但此前所有分析都关注优化稳定性、收敛性与 value function 估计的分布漂移,没有人刻画 reward 噪声下的行为,也没有人量化大动作空间下有限覆盖的代价。本文补上了这块空白。
  2. 次优性的双项分解 + 闭式最优温度。Theorem 4.4 把次优性拆成 $\lambda\log(1/p^\star)$(覆盖)与 $R_{\max}(e^{2\epsilon/\lambda}-1)$(噪声),二者随 $\lambda$ 反向移动,最优点 $\lambda^\star=2\sqrt{R_{\max}\epsilon/\log(1/p^\star)}$。分析是轨迹级的、无需 reward model 与 value function,并把 contextual bandit 作为 $T=1$ 特例回收。
  3. 覆盖代价随 horizon 线性而非指数增长。式 (10) 的自回归分解显示:轨迹概率乘性衰减,但界里的惩罚是其对数,因此跨步加性累积。这条结论对把方法推到多步 session 级推荐至关重要。
  4. 理论预测被实验精确复现。倒 U 形温度曲线在三个公开基准 + 一个工业数据集上一致出现,且经 best-epoch / final-epoch 双重检验。
  5. 对「推荐场景下 reward model 有多不可靠」的定量记录。Table 2 显示学习出的 RM 连 Item Mean 都打不过;Table 3 显示 Avg Reward 与真实排序质量系统性反向。这两张表本身就是可复用的负面结论。

9 与已归档相关工作的对比

AdaGRPO AdaGRPO: Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation (JD.com / 早稻田 / 电子科大, RecSys '25)

关系:独立并发(本文参考文献中未出现 AdaGRPO,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇论文的 root cause 陈述几乎逐字重合——生成式推荐的 RL 后训练依赖一个从稀疏、曝光偏置日志中学出的 reward model,而这个 RM 在它被查询的大部分区域并不可信,于是策略把它的预测误差当作可优化的信号(reward hacking),排序质量反而崩塌。更惊人的是两篇都用「先量化 RM 到底有多差」来奠定叙事:Exp-RSFT 的 Table 2 显示 RM 的 MSE/MAE 连 Item Mean 都打不过;AdaGRPO 的 Table 1 显示 RM 对 ground-truth 排名的聚合影响在 $K=50$ 时仅 +0.48、在 $K=128$ 时转为 −0.28。两者独立地得出「工业 RM 在聚合意义上近乎无用」这一结论。
  • 相近的技术骨架:两者的解法都不是「造一个更强的 reward」,而是保留监督似然作为主干、用一个由 reward 派生的标量去调制它,并把「施加多少 reward 压力」暴露成一个显式旋钮。AdaGRPO 的逐实例目标是 $L_i=L_{\mathrm{NLL}}^{(i)}+\lambda\alpha_i L_{\mathrm{GRPO}}^{(i)}$,$\alpha_i\in\{0,1\}$;Exp-RSFT 的目标是 $\mathbb{E}[\exp(R/\lambda)\sum_t\log\pi_\theta]$。把 $\alpha_i$ 与 $\exp(R/\lambda)$ 并置来看,两者都是「reward 决定的、detached 的逐样本权重乘在对数似然上」——AdaGRPO 是二值门控,Exp-RSFT 是连续指数权重。
  • 本文的差异与推进:(i) AdaGRPO 保留 RM 但只在它可信的样本子集上准入,Exp-RSFT 干脆彻底不要 RM,直接在日志 reward 上优化——从「有条件地信任」推到「不需要信任」。(ii) Exp-RSFT 给出了 AdaGRPO 完全没有的理论刻画:次优性双项分解、闭式 $\lambda^\star$、覆盖代价随 horizon 线性增长。AdaGRPO 的两个诊断 $f_1,f_2$ 是经验分层分析的产物,阈值 $\tau=1/3,\rho=0.9$ 靠跨任务经验稳健性辩护,没有对应的界。(iii) 反过来,AdaGRPO 的 clip 需要 on-policy rollout(要采 $K$ 条 rollout 才能算秩诊断),Exp-RSFT 则完全离线、零采样开销,训练栈改造成本更低。(iv) AdaGRPO 有线上 A/B(+0.43% effective IPV),Exp-RSFT 只有离线工业数据集。
  • 可比的方法/实验差异:AdaGRPO 的旋钮是秩阈值(哪些样本可以说话),Exp-RSFT 的旋钮是温度(每个样本能说多响)。两者面对的是同一个 precision–coverage 权衡的两种参数化:AdaGRPO 用二值 clip 换来「构造即可解释」(每个被 clip 的样本都能说清为什么),Exp-RSFT 用连续权重换来「闭式最优点 + 倒 U 可预测」。AdaGRPO 在 §4 里发现 RM 的价值随候选集增大而增大(HARD 分区 $K=50$ 时 $\Delta=+11.41$、$K=128$ 时 $\Delta=+30.77$),这与 Exp-RSFT 的 $O(\sigma\sqrt{T\log|\mathcal{A}|})$ 噪声界方向一致:目录/候选规模只带来对数级的代价。

OxygenREC-v2 OxygenREC-v2: Internalizing Discrimination into Generative Recommendation (JD.com, 2026-07-27)

关系:独立并发(本文未引用,两者同一诊断、不同处方)· 已加载对方精读

  • 共同关注的问题:OxygenREC-v2 把它的两个痛点归为同一个 root cause,第一条与本文完全一致——「离线排序模型对分布外输出打分不可靠,于是策略可以在不真正改善推荐质量的前提下把代理分数刷上去」。这与 Exp-RSFT 的 Table 3 现象(Avg Reward 最高的方法排序指标最差)是同一件事的两种表述。两篇的结论也一致:问题不在于把代理 reward 用得更好,而在于代理 reward 这个环节本身应该被移除。
  • 相近的技术骨架:两者都主张「用日志里本就存在的信号直接监督生成器,而不是委派给一个外部打分器」。OxygenREC-v2 的原话是「让信号成为内部的而非外部的,就从源头上移除了代理奖励问题」;Exp-RSFT 则是把日志 reward 直接做成似然权重。两者的后训练目标也都落在「advantage/reward 加权的对数似然」这一族里——OxygenREC-v2 的 EA-TOSD 含一路 low-entropy advantage-weighted self-distillation,正是 RWR 谱系的同构项。
  • 本文的差异与推进:(i) 抽象层次不同。Exp-RSFT 是一条与骨干无关、与物品标识无关的一般性目标(任何自回归生成式推荐器 + 任何标量 reward 都能套),并配一个理论;OxygenREC-v2 是一整套 SID 生成式推荐系统的工程设计(行为指令 $I_b$ 进 decoder prefix、特权 teacher、熵感知蒸馏)。(ii) 是否需要 rollout。OxygenREC-v2 的可验证 reward 要从 $G$ 条 on-policy rollout 里选最优,Exp-RSFT 纯离线加权,不采样。(iii) 对噪声的处理。OxygenREC-v2 用「熵感知」防止特权蒸馏偏置,本质是在 token 维度上分辨哪些位置的 teacher 自信是「作弊」来的;Exp-RSFT 用温度在轨迹维度上统一地压制噪声,并给出 $\sigma$-sub-Gaussian 假设下的显式界。前者更精细但无理论,后者更粗但可分析。(iv) OxygenREC-v2 有六个 JD 生产场景的线上 A/B(+1.6–4.4% UCTCVR、+2.8–6.8% GMV),Exp-RSFT 没有。
  • 可比的方法/实验差异:OxygenREC-v2 显示「增益最大的是 order 行为——最稀疏、价值最高的那个」;Exp-RSFT 则显示相对增益最大的是 StreamCo(+106.20% NDCG@10)这个最稀疏、噪声最大的工业数据集。两者都指向「越稀疏噪声越大的场景,去掉代理 RM 的收益越大」这一共同经验规律。

GenRec GenRec: A Preference-Oriented Generative Framework (JD.com, 2026-04-16)

关系:独立并发(本文未引用;GenRec 的 §1.1(iii) 与本文的动机同构)· 已加载对方精读

  • 共同关注的问题:GenRec 的第三个挑战原文是「SFT 阶段基于 offline log 的 next-token likelihood 训练,本质上只是在模仿历史行为,并不直接优化用户偏好;而 offline log 又相当稀疏、非平稳,naive 地用 RL 对齐容易出现 reward hacking」——这与本文 §1.1/§1.2 的诊断逐条对应(行为克隆的模仿本性、日志稀疏、RL 招致 reward hacking)。
  • 相近的技术骨架:GenRec 的 GRPO-SR 在 GRPO 之外加了一项 NLL 正则,把策略强锚定到真实用户正向轨迹 $\mathcal{D}^+$ 上。GenRec 精读里那句「和标准 KL-divergence 正则不同,NLL 正则显式地把策略拉向『真实用户行为分布』而不是『参考模型分布』,因而对 reward over-optimization 有更硬的约束」——这恰好是 Exp-RSFT 式 (3) 那条 $D_{\mathrm{KL}}(\pi\|\pi_\beta)\le\varepsilon$ 约束的工程化表述。两篇独立地得出「anchor 应当落在行为日志而不是 reference policy 上」这一结论,只是 Exp-RSFT 把它写成了受约束优化并解出闭式解 (4),GenRec 则是把它作为一项 loss 加权相加。
  • 本文的差异与推进:GenRec 仍然保留一个稠密代理 RM(基于 SIM 的 preference 模型),只是额外用 gating $\mathcal{G}$ 过滤 + NLL 锚定来压制 hacking;Exp-RSFT 则论证这条路本身就有上限,因为 RM 在稀疏大目录下连 Item Mean 都打不过。有意思的是 GenRec 的消融给出了同方向的证据:去掉 gate 后 HaR(幻觉率)看起来极低,但 HR@50 从 0.7438 掉到 0.7016——低 HaR 不等于高质量,与本文「Avg Reward 高不等于推荐好」是同一类观察。另一方面,GenRec 有月级全量线上 A/B(click +9.5%、transaction +8.7%),工业验证强度远超本文。
  • 可比的方法/实验差异:GenRec 的 NLL 锚定是均匀权重的(对 $\mathcal{D}^+$ 里所有正样本一视同仁),Exp-RSFT 则按 $\exp(r/\lambda)$ 分级加权——在 GenRec 的框架里,这相当于把「点击」和「下单」以指数比例区别对待,而不是都算作 $\mathcal{D}^+$。这是一个可以直接把本文结论迁移到 GenRec 上的具体改进点,且 GenRec 缺的正是「$\lambda$ 该取多大」这个问题的答案。

Step 2.5 被剔除的近似候选(记录以防门槛放水): - OneSug OneSug(Kuaishou):其 RWR 同样不用学习型 RM、直接用分级日志行为,但权重进入的是 DPO margin($rw_\Delta$ 缩放偏好差),而非对数似然;且论文的核心问题是「多阶段级联 → 端到端生成式 query suggestion」,不是 RM 不可靠 / reward 噪声。解法路径实质偏离。 - AMRS AMRS(LUCID):问题同构(在线探索不可行,必须纯离线优化),但解法正好相反——它构建 world model 当模拟器,再用 world-model 打分做 DPO。这正是 Exp-RSFT 论证会失败的路线,属于对立而非同构。 - HRPO HRPO(CityU,同日 arXiv):同样是生成式推荐的 RL 后训练,但 root cause 是信用分配 / 终局 reward 稀疏(把 item 级终局反馈沿 SID trie 残差化成 token 级 credit-to-go),不是 reward 噪声或 RM 不可靠;解法是 PPO 式 RRPO + 位置级 group 归一化,与加权 MLE 骨架不同。 - BLADE BLADE(USTC):处理 BoN 对齐里静态参考分布的瓶颈,用 Beta-Binomial 共轭融合做自演化分位数 reward 再喂 GRPO。问题是 reward 的参考基准,不是 reward 的噪声;且仍重度依赖打分器。 - Mult-DPO Mult-DPO(UVA):把 DPO 从 pairwise 推广到 setwise 多正样本,root cause 是偏好结构的表达力,与日志 reward 的噪声/覆盖无关。

10 讨论与局限性

10.1 值得借鉴的设计

  • 「不引入 reward model」本身就是一种正则。论文最有价值的立场是把 reward hacking 的解法从「更好的 RM / 更聪明的 RL」转向「根本不给策略一个可 hack 的对象」。Table 2 与 Table 3 的组合把这个立场量化得极为干净:RM 打不过 Item Mean(Table 2),而 Avg Reward 越高排序越差(Table 3)。任何要在推荐里上 RLHF 的团队都应该先跑一遍 Table 2 这个检查。
  • 权重形式选指数而非线性有实质理由,不只是「效果更好」:线性 reward 加权在基于似然的目标里会出现负权重病态(Steck 2010;Schnabel et al. 2016),指数形式天然为正,且额外提供温度旋钮。
  • 工程改造成本极低。式 (5) 相对普通 SFT 只多一个逐样本标量系数,梯度形状不变、不需要 value network、不需要 rollout、不需要倾向性。对已有 HSTU/OneRec 类训练栈几乎是即插即用。
  • 覆盖代价的对数/加性结构(式 (10))是把方法从 $T=1$ 推到多步 session 级最重要的理论支撑。

10.2 局限性(作者自陈)

  1. regime 受限。分析聚焦于「用户只与大目录的一小部分交互、反馈以标量 reward 形式给出」的情形。在监督显著更丰富的场景(稠密偏好比较、广泛的用户反馈覆盖)下,其他后训练方法可能更有效。
  2. 没有消除偏好估计的根本困难。Exp-RSFT 只是绕开了 RM,并没有解决「稀疏交互下的偏好估计」。更精细的 reward 建模(不确定性感知 / 保守 reward model、纳入更多用户信号)可能缓解实验中观察到的部分局限;但当反馈只覆盖目录的一小部分时,把可靠偏好推广到未见物品仍然困难。
  3. 噪声模型假设。理论保证依赖 sub-Gaussian reward 噪声;真实反馈可能有更重的尾部或更复杂的依赖结构。把分析扩展到更广的噪声模型、以及研究「改进的 reward 建模」与「离线策略优化」之间的相互作用,是未来方向。

10.3 我认为更值得指出的问题

  • 理论与实验之间存在一道未被跨越的鸿沟:全部实验都是 $T=1$。论文最漂亮的理论结论——覆盖代价随 horizon 线性而非指数增长(式 (10))、噪声代价 $O(\sigma\sqrt{T\log|\mathcal{A}|})$——恰恰是唯一没有被实验触及的部分。$T=1$ 时式 (10) 退化为单项,$\sqrt{T}$ 因子消失。换句话说,被验证的只有「温度呈倒 U」这一条,而这一条在 contextual bandit 里就已成立,不需要轨迹级分析。理论中最有新意的多步部分完全缺乏实证。
  • $\lambda^\star$ 的闭式解不可用,理论的实践指导价值因此被削弱。作者自己承认式 (9) 需要未知的 $\sigma$ 与 $p^\star$,只能经验调 $\lambda$。但论文没有尝试任何代理估计——例如用 reward 的重复观测方差估 $\sigma$、用行为策略在日志上的对数似然估 $\log(1/p^\star)$。哪怕给出一个粗略的量级预测再和实测峰值 $\lambda\approx0.5$–$1.0$ 对照,理论的说服力都会强很多。目前理论对实践的贡献仅止于「存在内点最优、去扫一遍」。
  • 每个配置只跑一次训练,没有随机种子方差。附录 B.1 明确说明「each reported result corresponds to a single training run」,作者用「跨 5 指标 4 数据集一致」代替方差报告。ML-1M 的测试集只有 1,530 条,而 Exp-RSFT 相对 RSFT 的 NDCG@10 差距只有 0.0028(0.1437→0.1465,约 1.9%)——这个量级在单次运行 + 1,530 样本下很难说显著。ML-20M 的 +3.5% 与 Amazon Books 的 +2.0% 同理。真正拉开差距的只有 StreamCo(+106%),而它恰恰是无法复现、只报相对值的私有数据集。
  • StreamCo 的 +106.20% 缺乏机制解释。公开集上 Exp-RSFT vs RSFT 只有 2–3.5%,工业集上却是翻倍,跨度接近 50 倍。论文没有报告 StreamCo 上的 $\lambda$ 取值、reward 尺度、噪声水平,也没有解释为什么差距会放大到这个程度。按理论,差距应当与 $\epsilon=\sigma\sqrt{2\log(2|\mathcal{T}|/\delta)}$ 相关,但 Table 1 显示 StreamCo 的物品数只有 O(Thousands),比 Amazon Books 的 69.5 万小两个数量级——按 $\log|\mathcal{A}|$ 的依赖关系,StreamCo 的噪声代价反而应该更小。这个反差没有被讨论。
  • 没有线上 A/B。Netflix Research 的作者、拿到了私有流媒体数据集,却只报离线相对指标。对一篇主张「工业落地价值」的论文,缺少线上验证是明显短板——尤其考虑到本文的对照组 PPO/DPO 在离线指标上崩得如此彻底,一个线上实验能极大增强「离线排序指标确实代表用户满意度」这一隐含前提的可信度。
  • 对 DPO 的实现方式可能不够公平。论文用「reward model 打分构造偏好对」来实例化 DPO,然后论证它崩溃。但这本来就是论文自己在 §2 指出的「把同一个问题重新引入」的做法。如果用日志中天然存在的偏好信号(例如同一 session 内 rating 4.5 vs rating 2 的物品对)构造偏好对,DPO 就不再依赖 RM,结论可能不同。论文没有给这个更强的 DPO 变体。
  • Avg Reward 作为 reward hacking 证据存在循环性。Avg Reward 由同一个 reward model 打出,因此「RM 分高但排序差」在逻辑上只能说明 RM 与排序指标不一致,无法单独证明是策略在 hack RM 而非 RM 本身就与排序指标正交。不过 Table 2(RM 连 Item Mean 都打不过)在很大程度上补上了这个缺口。

10.4 方法论可扩展性

Exp-RSFT 在这一维度上表现良好:它不引入任何会固化的组件(无码本、无 value network、无独立的 RM、无两阶段解耦),只是在现有自回归目标上乘一个标量。式 (4) 的关键性质——「倾斜后的分布仍在同一自回归策略类内」——意味着骨干模型参数量 scaling 时,表征能力与序列建模能力可以一起增长,方法本身不构成瓶颈。反过来说,它的天花板也由骨干决定:它只能在行为策略的支撑内重新分配概率质量(式 (8) 第一项在 $p^\star\to0$ 时发散),永远无法发现日志中从未出现过的好轨迹——这是所有保支撑离线方法的共同上限,作者在 Theorem 4.4 的解读中已经诚实指出。