DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging¶
- 作者:Binglei Zhao、Xuanhua Yang、Xiwei Zhao、Sulong Xu(JD.com,北京)
- 会议:KDD 2026(V.2),2026-08-09~13,济州岛
- ArXiv:2608.04809v1(2026-08-05),cs.IR
- 部署:京东首页推荐(JD homepage recommendation),已上线承接主流量,7 天 A/B:UCTR +1.22%、PV +0.20%
研究动机与背景¶
在工业推荐系统里,重排(re-ranking)是离用户最近的一级。与 ranking 逐 item 建模 CTR / CVR 的 point-wise 范式不同,重排要在排列空间中找到上下文最优的序列:从模型结构看,它必须建模 item 之间的上下文依赖;从优化目标看,它要在 item 级准确性之外最大化序列价值,同时平衡业务目标与多样性。
现有重排方法被分为三类:
- 一阶段方法:以 PRM 为代表,先用 self-attention 建模列表上下文修正分值,再按修正分贪心排序。问题在于重排本身会改变 item 顺序,最终序列构成了一个全新的信息环境,训练时学到的上下文依赖与用户真实感知到的曝光上下文不一致。
- 两阶段方法(Generator-Evaluator, GE):生成器采样多条序列,评估器建模真实曝光上下文并挑出最优序列。由于穷举排列不可行,近期工作把重心放在高效的序列候选生成上——PRS 用 beam search、PIER 用 SimHash、GRN 用 pointer network;CMR 进一步用 hypernetwork 做效率与业务的多目标可控组合;NAR4Rec 用非自回归匹配模型加速;MG-E 用多生成器提升采样多样性以避免陷入局部最优。
- generator-only 方法:如 GReF,直接生成单条序列上线,由用户反馈或 reward model 指导训练。
论文指出,作为决定最终曝光结果的终端环节,重排始终受制于一个结构性上游约束:上游供给(候选集)是固定的,重排的解空间天然被限死,在低质供给下尤其严重。由此引出全文的核心问题——如何量化序列价值,才能把重排的效力放大?作者的答案是:重排应该主动权衡即时价值与探索价值,在低质供给下优先给出探索性曝光,通过更深的浏览去撬动潜在转化。

Figure 1 给的例子很直白:候选里矿泉水 pCTR=0.05 最高,网球拍 0.03,其余多在 0.01~0.02。Seq2 把高 pCTR 的水放在最前,短期看有效,但用户很快"有点无腻,停止浏览";Seq1 先给出探索性的低 pCTR 组合,维持了浏览动能(browsing momentum),从而可能在下一个请求里产生对羽毛球拍的点击。同一个 item(网球拍)在不同序列构成下会引发不同的用户行为——这正是上下文效应。
论文的三点贡献:(1) 提出 DEGR,自适应地平衡探索价值与即时价值,把重排做成跨请求的上下文桥梁;(2) 提出"双探索"——由探索型奖励模型引导的混合探索与优化范式;(3) 离线数据集与线上系统均验证有效,京东推荐系统 UCTR +1.22%、PV +0.20%,且线上只部署生成器。
问题定义¶
用户的连续浏览被归为一个 session,一个 session 含多个 request,每个 request 触发完整推荐链路。请求 $q$ 到来时,用户近期交互历史与画像特征(user ID、性别等)被用于推荐。重排从上游候选 $\mathcal{I}=[i_1, i_2, \dots, i_N]$ 中构造上下文最优的排列 $\tau^{*}=[g_1,g_2,\dots,g_M]$($M\le N$)曝光给用户。给定冷启、兴趣延迟、数据漂移、超时等导致的上游供给限制,目标是先训练一个由即时奖励与探索奖励构成的奖励模型 $R_\theta(\tau, q)$,再求解最优序列:
$$\tau^{*} = \arg\max_{\tau \in \Omega} \ \mathbb{E}\left[R_\theta(\tau, q)\right] \tag{1}$$
其中 $\Omega$ 是上游候选的全部排列空间($|\Omega| = A_N^M$),$\theta \in \Theta_R$ 是奖励模型的可学习参数。线上服务时生成器直接产出最终序列,而不是像 GE 框架那样先生成再评估。
核心方法:探索型奖励模型¶

在 DEGR 的范式里,奖励模型的地位相当于 GE 框架中的评估器,但职责不同:评估器负责最终选序列,而奖励模型负责综合效率、业务、多样性目标并引导生成器的探索轨迹。已有方法(PIER 等)只最大化即时效用(CTR/CVR),在刚性上游供给下必然次优——当所有候选的即时价值都低时,这类方法生成不出具有潜在探索价值的序列,落入 Figure 1 中 Seq2 的局部最优。
模型架构¶
如 Figure 3(B),奖励模型用 DIN 抽取 item embedding 以捕捉用户行为模式;item embedding 与正弦位置编码逐元素相加后,在序列内所有 item 上做 self-attention。在奖励模型训练阶段与生成器训练阶段,它分别对曝光日志和生成序列建模真实上下文感知。随后上下文感知的 embedding 驱动两个预测任务:item 级即时价值 $(R_{g_1}, R_{g_2}, \dots, R_{g_M})$ 由 MMoE 输出,序列级探索价值 $R_E$ 由聚合后接 MLP 输出。
为什么需要探索价值:JD 场景的实证¶

论文定义了四个量:Max-pCTR 是序列内上游 ranking 预测 pCTR 的最大值;sCTR 是序列级点击率(序列中至少一个 item 被点击的概率);NCR(Next Click Ratio) 是当前请求之后产生点击的概率;NER(Next Expo Ratio) 是当前请求之后继续浏览的概率。Max-pCTR 在当前请求即可获得,而 sCTR / NCR / NER 都是后验统计量。sCTR 会同时受上游供给质量和序列内顺序影响,Max-pCTR 则更纯粹地反映供给质量——Max-pCTR 越低代表供给质量越差。
作者按 Max-pCTR 做 15 个等频分组,结论有三条:sCTR 与 Max-pCTR 显著正相关(约从 0.02 单调升到 0.31);Max-pCTR 与 NCR 基本无关(第 4 组之后一路稳定在 0.30 附近);NER 随 Max-pCTR 单调下降(0.67 降到 0.25)。第二条是全文的关键 insight:既然"下一次点击"与当前供给质量解耦,那么当即时收益被低质供给锁死时,就可以战略性地优先提升 NER,鼓励更深的探索,从而为潜在转化保留曝光机会。这就是重排需要自适应权衡即时收益与个性化探索的理由。
优化目标¶
1. item 级即时奖励。 用 BCE 预测每个 item 的即时价值(点击 / 购买):
$$L_p = \sum_j -y_j \cdot \log(R_j) - (1-y_j)\cdot \log(1-R_j), \quad j \in \{g_1, g_2, \dots, g_M\} \tag{2}$$
其中 $y_j$ 是"是否点击 / 购买"的真值,$R_j$ 是 item $j$ 的预测即时分。
2. 序列级探索奖励。 $R_E$ 由聚合 embedding 后接 MLP 得到,用于捕捉全局序列特征。论文把探索奖励预测建成二分类任务,并采用五档采样策略(A~E),这些类别由"当前点击 + 当前滚动 + 后续点击"三种行为组合而成:
| 类别 | 描述 | Click | Scroll | Follow-up click | Label $y_e$ |
|---|---|---|---|---|---|
| A | Terminate(终止) | ✗ | ✗ | - | 0 |
| B | Invalid Explore(无效探索) | ✗ | ✓ | ✗ | 0 |
| C | Potential Interest(潜在兴趣) | ✗ | ✓ | ✓ | 1 |
| D | Instant Match(即时匹配) | ✓ | ✗ | - | 1 |
| E | Deep Explore(深度探索) | ✓ | ✓ | - | 1 |
注:类别 B 仅在 Max-pCTR > 0.01 时作为负样本,否则被 mask 掉以防噪声。
$$L_s = -w_{\{*\}}\cdot y_e \cdot \log(R_e) - w_{\{*\}} \cdot (1-y_e)\cdot \log(1-R_e) \tag{3}$$
其中 $w_{\{*\}}$ 是样本 A~E 各自的标签权重。D 和 E 表明用户对当前曝光序列有兴趣,E 进一步体现持续探索动机,因此设 $w_E > w_D$。B 和 C 虽然缺乏显式兴趣,但充当"桥梁"引导用户继续探索,其中 C 触发了后续探索交互中的参与行为。为了在低 Max-pCTR 的上游约束下鼓励进一步探索,作者对样本 C 的训练权重做自适应探索曝光提权:
$$w_C = \Big(4 - 3\log_2\big(1 + \max_{1\le i \le N} pCTR_j\big)\Big)\cdot w'_C, \quad pCTR_j \in [0,1] \tag{4}$$
Max-pCTR 越低,正样本权重越大,探索性曝光被优先。由于类别 B 的样本在供给受限条件下同样具有探索价值,训练时当 Max-pCTR ≤ 0.01 就把 B 掩掉,消除负向惩罚,隐式地鼓励滚动与后续行为。上述样本分档与动态加权共同实现了探索价值建模。最终序列 $\tau=[g_1,\dots,g_M]$ 对请求 $q$ 的复合奖励为:
$$R_\theta(\tau, q) = \alpha \cdot R_e + \sum_{j \in \{g_1, \dots, g_M\}} (1-\alpha)\cdot \delta_j \cdot R_j, \quad \delta_j = 1 - \log_{M+1}(j) \tag{5}$$
$\delta_j$ 是 item 位置权重,实践中单调递减。奖励模型训练完毕后参数被冻结,用于指导生成器训练。
核心方法:双探索驱动的生成器¶
高效 Encoder-Decoder¶
G-Encoder 用 DIN 得到用户兴趣表征,再用 self-attention 建模 item 候选之间的全局上下文依赖,输出上下文增强的候选 embedding 送入 decoder。
G-Decoder 把 G-Encoder 的输出 embedding 当作 key / value,把已生成的 embedding 当作 query,逐步扩张序列,直到生成 $M$ 个 embedding($\text{emb}'_1 \to \text{emb}'_M$)。自回归以一个预定义的固定 <start> embedding 作为初始 query 启动;同时把奖励模型里用的正弦位置编码也注入 query,使生成器在生成序列时获得真实的上下文感知。生成 embedding 后,G-Decoder 计算它们与 G-Encoder 输出 embedding 的点积相似度,得到相似度矩阵用于序列采样;按行 softmax 归一化得到概率分布 $P$,元素 $(i,j)$ 表示第 $i$ 个位置对应候选 $item_j$ 的似然。
多解码头 cohort。 受 MTP 与 MEDUSA 启发,用多个 FFN + 残差模块构成 decoding-head cohort,每步并行预测未来 $K$ 个位置的候选:
$$\text{emb}'_{i+k} = W^{(k)}_2 \cdot \mathrm{ReLU}\big(W^{(k)}_1 \cdot h'_i\big) + h'_i, \quad k \in \{1, \dots, K\} \tag{6}$$
其中 $h'_i$ 是由 $\text{emb}'_i$ 经注意力算出的当前隐状态。它把生成复杂度从 $O(M)$ 降到 $O(M/K)$,最高 $K$ 倍加速,使实时工业部署成为可能。但作者观察到:重排场景候选多样性天然有限,多解码头 cohort 倾向产出高度相关的 embedding,因此需要下面的组内正则作为结构约束。
混合探索与优化范式¶
生成器总损失由三项构成:
(1)监督学习(SL)——拟合线上分布、避免 RL 中的能力坍塌,用分类交叉熵:
$$L_{CE} = \sum_{i=1}^{M}\sum_{j=1}^{N} y_{ij}\cdot \log p_{ij}, \quad p_{ij} = P(y_i = j \mid y_{<i}, q) \tag{7}$$
其中 $y_{ij}\in\{0,1\}$ 表示线上真实序列中第 $i$ 位与候选 $item_j$ 是否匹配(ground-truth),$p_{ij}$ 是预测概率。
(2)探索多样性约束(EDC)——以组内正则(intra-cohort regularization)缓解语义冗余与表征坍塌,保证并行生成的 item 彼此有区分度:
$$L_{ICR} = \sum_{j=1}^{K-1}\left(\frac{1}{K-j}\sum_{k=j+1}^{K}\left(\frac{\text{emb}'^{\top}_{i+j}\ \text{emb}'_{i+k}}{\lVert \text{emb}'_{i+j}\rVert_2\ \lVert \text{emb}'_{i+k}\rVert_2}\right)^{2}\right) \tag{8}$$
即计算 cohort 内生成 embedding 两两余弦相似度的平方均值。
(3)自适应奖励加权 ORPO(AR-ORPO)——监督学习拟合的线上分布未必满足多目标,而 RL 能引导模型在序列空间中探索以最大化探索奖励。AR-ORPO 基于 ORPO,把成对偏好扩展成偏好列表,并把奖励动态地当作可信的软权重来精修优化轨迹。对请求 $q$ 的采样序列集合 $\mathcal{T}=\{\tau_1,\dots,\tau_N\}$,先算序列概率与探索奖励:
$$P(\tau \mid q) = \prod_{i=1}^{M} P(y_i = g_i \mid y_{<i}, q), \quad \tau = [g_1, g_2, \dots, g_M] \tag{9}$$
再按 $R_\theta(\tau,q)$ 降序排列,采样 $S$ 个分位点得到更具代表性的序列 $[\tau_1, \dots, \tau_K]$ 与对应奖励($R_\theta(\tau_1,q) > R_\theta(\tau_2,q) > \dots > R_\theta(\tau_K,q)$),最偏好与最不偏好的分别是 $\tau_1$ 和 $\tau_K$:
$$L_A = \sum_{i=1}^{S-1} \underbrace{\frac{e^{R_\theta(\tau_i,\,q)/t}}{\sum_{j=1}^{K} e^{R_\theta(\tau_j,\,q)/t}}}_{soft\ weights} \cdot \log \sigma\left(\log \frac{odds(\tau_i \mid q)}{\sum_{j=i+1}^{S} odds(\tau_j \mid q)}\right) \tag{10}$$
其中 $odds(\tau\mid q) = P(\tau\mid q) / (1 - P(\tau\mid q))$。软权重由奖励做 softmax 得到,借用重要性采样思想:它保证被偏好序列的 odds ratio 足够高,超过所有低排名序列 odds 之和。温度 $t$ 控制权重分布,$t \to 0$ 时权重趋近 1。生成器最终损失:
$$L_{gen} = \frac{1}{|Q|}\sum_{q \in Q}\left(L_{CE} + \beta \cdot L_{ICR} + \gamma \cdot L_A\right) \tag{11}$$
多机制概率采样¶
为增强 RL 阶段的探索能力,DEGR 融合 group beam search 与启发式采样,在概率空间中造出多样轨迹,避免同质化。多样的"轨迹-奖励"映射与更宽的奖励地形提升探索效率、防止陷入局部最优。线上服务时只用贪心采样生成一条概率最高的序列。
Group Beam Search(Algorithm 1):每步在 logits 上加 Gumbel 噪声后归一化:
$$g = -\log(-\log(u)), \quad u \sim \mathrm{Uniform}(0,1) \tag{12}$$
$$P(y_i \mid y_{<i}, q) = \mathrm{softmax}\big(logits(y_i \mid y_{<i}, p) + g\big), \quad i \le M \tag{13}$$
流程:先按 $P(y_1\mid q)$ 取 top-$g$ 个起始 item 得到 $g$ 个 group;对 $i = 2 \dots M$,每个 group 内把已选位置的概率置 0(MASK)后累乘得到序列概率,再各自保留 top-$b$ 条子序列;最后合并所有 group 的轨迹与概率。用分组维持不同起始 item,缓解 beam search 的多样性缺失与输出同质化问题。
Heuristic Sampling(Algorithm 2):沿用传统 GE 架构的启发式采样范式,先对 ranking 模型预测的 item 分数(CTR、CVR 等)做动态加权融合并注入随机扰动来采样序列,再把真实曝光序列并入得到 $\mathcal{T}_h$,然后逐步 gather + MASK 累乘算出这些序列在当前生成器下的概率 $P_h$。最终采样集合 $\mathcal{T} = \mathcal{T}_g \cup \mathcal{T}_h$。
AR-ORPO 的梯度分析(附录)¶
令软权重 $w_i = e^{R_\theta(\tau_i,q)/t} / \sum_j e^{R_\theta(\tau_j,q)/t}$,$g(\tau_i,\tau_j) = odds(\tau_i\mid q) / \sum_{j=i+1}^{S} odds(\tau_j\mid q)$,推导可得:
$$\nabla_\theta L_A = \sum_{i=1}^{S-1} \delta(d)\cdot h(d), \quad d = (\tau_i, \tau_j) \sim D \tag{14}$$
$$\delta(d) = w_i \cdot \left(1 + \frac{odds(\tau_i\mid q)}{\sum_{j=i+1}^{S} odds(\tau_j \mid q)}\right)^{-1} \tag{15}$$
$$h(d) = \frac{\nabla_\theta \log P(\tau_i\mid q)}{1-P(\tau_i \mid q)} - \sum_{j=i+1}^{S} \underbrace{\frac{odds(\tau_j\mid q)}{\sum_{k=i+1}^{S} odds(\tau_k\mid q)}}_{Odds\ normalized\ weight} \cdot \frac{\nabla_\theta \log P(\tau_j \mid q)}{1 - P(\tau_j\mid q)} \tag{16}$$
对比 ORPO 的梯度只有一对 $(\tau_w, \tau_l)$:
$$\delta'(d) = \left(1 + \frac{odds_\theta P(\tau_w\mid x)}{odds_\theta P(\tau_l \mid x)}\right)^{-1}, \quad h'(d) = \frac{\nabla_\theta \log P_\theta(\tau_w\mid x)}{1-P_\theta(\tau_w\mid x)} - \frac{\nabla_\theta \log P_\theta(\tau_l\mid x)}{1-P_\theta(\tau_l\mid x)} \tag{17}$$
假设 logit 噪声 i.i.d. $\epsilon \sim \mathcal{N}(0,\sigma^2)$,AR-ORPO 的方差满足:
$$\mathrm{Var}(\nabla L_A) \approx \frac{1}{S-1}\,\mathrm{Var}(\nabla L_{ORPO}) \tag{18}$$
即增大 $S$ 提升梯度方向的确定性;软权重把模型从静态对齐转为奖励感知的重要性加权,有效抑制低质量梯度噪声。但作者也说明:$S$ 增大后判别信号在高维空间中趋于相互抵消,简单负样本会稀释困难负样本的梯度权重;$t \to \infty$ 时 $w_i$ 趋于均匀,方差降低但判别性奖励信息被丢弃。故经验取 $S=3$、$t=0.2$。
实验设置¶
数据集:Public Taobao Dataset(Alimama 展示广告日志,8 天共 2600 万曝光日志,按 7:1 划分训练 / 测试;同一 user-timestamp 组合下最多 10 个 item 归为一个 request);JD Production Dataset(京东首页推荐,1 亿用户、10 亿请求,按 8:1 划分)。
离线指标:GAUC(按点击数加权的 AUC,衡量个性化区分能力,可直接由生成器输出的相对排序算出,不需要具体预测分)、NDCG(位置敏感的排序质量)、MAP@K(top-K 内全部相关项的整体排序质量)、Recall@K(top-K 的用户参与覆盖度,不看具体顺序)。Taobao 因部分请求交互 item 少,MAP / Recall 只取 $K=2$;JD 同时报 $K=2,4$。作者强调:由于历史数据存在曝光偏差,新推荐的 item 缺乏真实反馈,离线指标不保证与线上对齐。
对奖励模型的评估:AUC 之类的传统指标无法直接映射到线上,因此改用统一协议——用启发式采样基于 ranking 分数生成 16 条序列,再用奖励模型选最优的一条,从而与生成器在同一口径下比较。但由于启发式候选覆盖有限,奖励模型的表现通常略低于生成器。
线上指标:UCTR(点击 PV / 曝光 UV)与 PV(曝光 PV)。PV 越高代表用户探索更深、item 曝光更广。
Baselines:一阶段 DCN、PRM;两阶段 PIER、GRN、CMR、NAR4Rec 以及多生成器的 MG-E($G=4$);generator-only 的 GReF(用 OMTP 提效率、用 DPO 对齐用户真实反馈、无奖励模型)。
实现细节:$N=30$ 候选中选 $M=10$ 个曝光;transformer 只用 1 层 attention;奖励模型的 item 级打分含点击与购买两任务,MMoE 含 2 个专家、每个 128 单元;复合奖励中序列级探索价值权重 $\alpha=0.2$;G-Decoder 在 attention 层后接 $K=6$ 个 FFN 做并行生成——虽然理论上每步可出 6 个 item,但为性能考虑实际执行三次解码,分别产出 1、3、6 个 item(前两步限制生成数量,为最重要的头部 item 保留高保真上下文建模);多机制采样中 group beam search 取 $b=2, g=3$,启发式采样 7 条序列;损失权重 $\beta=2.0$、$\gamma=0.01$;AR-ORPO 温度 $t=0.2$。
主要实验结果(Q1)¶
Table 2:Taobao 公开数据集与 JD 生产数据集上的整体性能对比
| Method | Taobao GAUC | Taobao NDCG | Taobao MAP@2 | Taobao Recall@2 | JD GAUC | JD NDCG | JD MAP@2 | JD MAP@4 | JD Recall@2 | JD Recall@4 |
|---|---|---|---|---|---|---|---|---|---|---|
| DCN | 0.5870 | 0.1107 | 0.0835 | 0.0975 | 0.6255 | 0.7376 | 0.5748 | 0.6341 | 0.6673 | 0.8726 |
| PRM | 0.5983 | 0.1209 | 0.0847 | 0.0989 | 0.6380 | 0.7436 | 0.5850 | 0.6427 | 0.6756 | 0.8775 |
| PIER | 0.6004 | 0.1221 | 0.0851 | 0.1005 | 0.6387 | 0.7442 | 0.5863 | 0.6430 | 0.6765 | 0.8793 |
| GRN | 0.6015 | 0.1232 | 0.0859 | 0.1011 | 0.6385 | 0.7446 | 0.5879 | 0.6437 | 0.6766 | 0.8808 |
| CMR | 0.6025 | 0.1246 | 0.0863 | 0.1023 | 0.6393 | 0.7449 | 0.5883 | 0.6441 | 0.6772 | 0.8812 |
| NAR4Rec | 0.6016 | 0.1233 | 0.0858 | 0.1012 | 0.6364 | 0.7442 | 0.5875 | 0.6432 | 0.6770 | 0.8800 |
| MG-E(G=4) | 0.6031 | 0.1249 | 0.0865 | 0.1029 | 0.6392 | 0.7454 | 0.5891 | 0.6448 | 0.6784 | 0.8822 |
| GReF | 0.6037 | 0.1248 | 0.0866 | 0.1036 | 0.6403 | 0.7457 | 0.5901 | 0.6452 | 0.6791 | 0.8826 |
| DEGR | 0.6107 | 0.1287 | 0.0871 | 0.1082 | 0.6486 | 0.7493 | 0.5951 | 0.6505 | 0.6839 | 0.8871 |
DEGR 在两个数据集全部指标上都优于所有 baseline,MAP@2 / MAP@4 上尤其明显。相对最强 baseline GReF,Taobao GAUC 从 0.6037 提到 0.6107(+1.16%)、Recall@2 从 0.1036 提到 0.1082(+4.44%);JD GAUC 从 0.6403 提到 0.6486(+1.30%)、MAP@2 从 0.5901 提到 0.5951。
论文归纳三条优势:(1) 奖励模型自适应地平衡探索与即时收益,得以构造跨请求的上下文桥梁;(2) 混合探索与优化范式引导生成器产出最优序列——MG-E 靠显式损失拉大多个生成器之间的差异来提升序列间多样性,DEGR 则靠多机制概率采样提升多样性、并在训练时最大化最高奖励序列的概率;相比 MG-E 与 GReF,DEGR 额外设计了探索型奖励,并用组内正则作为探索多样性约束保证序列内 item 多样性;(3) 相比非自回归匹配模型(NAR4Rec)或 RNN pointer network(GRN / CMR),encoder-decoder 架构能更有效地捕捉并利用上下文信息。
值得注意的是,DEGR 的绝对提升幅度并不大(JD GAUC +0.0083、MAP@2 +0.0050),与最强 baseline 的差距和 baseline 彼此之间的差距处在同一量级,这一点在读结论时需要保持清醒。
在线 A/B 实验(Q1 & Q2)¶
在京东首页推荐系统上做 7 天 A/B,DEGR 已上线承接主流量:UCTR +1.22%、PV +0.20%。同时上线的 DEGR(w/o EDC) 版本(去掉探索多样性约束)只有 UCTR +0.72%、PV +0.20%,证明探索多样性约束的有效性。作者还发现:上游供给数量 $N$ 越大,探索多样性约束的效果越显著——候选越多,cohort 并行生成的语义冗余问题越突出。

Figure 5 分析了 DEGR 相对 base(PRM)在各 Max-pCTR 分组上的相对提升。DEGR 在 sCTR、NCR、NER 三项上全面改善:在低 Max-pCTR(上游受限)区间,NER 提升最大(第 3~4 组附近达 +0.5pp 左右),说明 DEGR 强化了探索性曝光,并进一步撬动潜在转化(NCR 同步走高);在高 Max-pCTR(上游模型表现好)区间,DEGR 直接抬升 NCR(第 10~11 组附近 +0.3pp 以上)而 NER 提升趋于平缓甚至归零。 这个"低质供给保浏览、高质供给收点击"的分段行为,正是"自适应平衡即时与探索收益、动态构造跨请求上下文桥梁"这一主张的直接证据,也是全文最有说服力的一张图。
消融实验(Q3)¶
Table 3:JD 生产数据集上的消融(M@K 与 R@K 分别表示 MAP 与 Recall)
| Method | GAUC | NDCG | M@2 | M@4 | R@2 | R@4 |
|---|---|---|---|---|---|---|
| ER(w/o E) | 0.6388 | 0.7334 | 0.5826 | 0.6348 | 0.6714 | 0.8671 |
| ER | 0.6393 | 0.7334 | 0.5834 | 0.6351 | 0.6718 | 0.8681 |
| DEGR(w/o E) | 0.6447 | 0.7475 | 0.5926 | 0.6481 | 0.6818 | 0.8849 |
| DEGR(w/ GBS) | 0.6453 | 0.7472 | 0.5913 | 0.6476 | 0.6803 | 0.8863 |
| DEGR(w/ ORPO) | 0.6463 | 0.7478 | 0.5924 | 0.6486 | 0.6817 | 0.8870 |
| DEGR(w/o EDC) | 0.6479 | 0.7486 | 0.5940 | 0.6497 | 0.6834 | 0.8874 |
| DEGR | 0.6486 | 0.7493 | 0.5951 | 0.6505 | 0.6839 | 0.8871 |
(1) 探索奖励的重要性。 对奖励模型,用 5.1.2 的统一协议比较 ER 与 ER(w/o E),二者只差是否引入探索价值,结果显示探索型奖励模型能选出更有效的序列(MAP@2 0.5826→0.5834)。对生成器,比较分别由 ER(w/o E) 与 ER 指导训练的 DEGR(w/o E) 与 DEGR:MAP@2 +0.25pp、Recall@2 +0.21pp。
作者特意解释了一个反直觉现象:奖励模型层面加不加探索奖励几乎没差别,但最终生成器层面差别显著。原因在于奖励模型的评估协议只在启发式采样产生的候选上考察选序列能力,这些候选覆盖度与多样性都很有限,探索奖励的作用在这种受限设定下被极大压抑;而生成器在训练时探索的序列空间宽得多,因而能更好地利用探索奖励。这个解释合理,但也反过来说明:论文缺少一个能直接验证奖励模型质量的独立证据。
(2) 多机制采样的重要性。 DEGR vs DEGR(w/ GBS)(只用 group beam search):多机制采样提供更多样的探索空间,所有指标均有提升(MAP@2 0.5913→0.5951)。
(3) 探索多样性约束(EDC)的重要性。 DEGR vs DEGR(w/o EDC):MAP@2 +0.11pp,线上 A/B 也验证其有效(UCTR +0.72% → +1.22%)。注意 Recall@4 上 DEGR(w/o EDC) 反而略高(0.8874 vs 0.8871)——这是全表唯一一处 DEGR 不是最优的位置。
(4) AR-ORPO 的重要性。 比较分别用 ORPO 与 AR-ORPO 优化的 DEGR(w/ ORPO) 与 DEGR(w/o EDC):AR-ORPO 带来 MAP@2 +0.16pp、Recall@2 +0.17pp。原因是它把成对偏好扩展为偏好列表,并用奖励作可信软权重,对比多条差异化序列的概率与奖励,从而最大化奖励效用并抑制噪声。

Figure 6 给出训练过程中 chosen / rejected 序列的对数概率曲线:AR-ORPO 与 ORPO 的 chosen 曲线基本重合(约 -25 附近缓慢上升),但 AR-ORPO 的 rejected 曲线被压得更低(收敛到 -40 附近),而 ORPO 的 rejected 一路回升到 -35 以上——AR-ORPO 对 chosen / rejected 的区分能力明显更强。
AR-ORPO 分位点数 $S$ 的敏感性(Figure 7):$S$ 越大探索的序列空间越广,但也会引入奖励评估的噪声而损害结果。实验中 $S=3$ 最优:
| Quantiles $S$ | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
|---|---|---|---|---|---|---|---|
| MAP@2 | 0.5924 | 0.5940 | 0.5931 | 0.5927 | 0.5921 | 0.5918 | 0.5919 |
| Recall@2 | 0.6817 | 0.6834 | 0.6831 | 0.6826 | 0.6820 | 0.6818 | 0.6818 |
(该扫描对应 DEGR(w/o EDC) 配置,$S=3$ 处的两项数值与 Table 3 中 DEGR(w/o EDC) 行完全一致;$S$ 从 3 起两项指标持续下滑,到 $S=7,8$ 才略微回稳。)
复杂度与时延分析(Q4)¶
Table 4:复杂度与时间效率汇总(G = Generator,E/R = Evaluator/Reward model,kw = 千万参数)
| Method | Param Count (G) | Param Count (E/R) | Batch Time (G) | Batch Time (E/R) | Online TP99 |
|---|---|---|---|---|---|
| PRM | 8.08kw | - | 0.925s | - | - |
| GRN | 24.84kw | 8.41kw | 1.444s | 0.726s | - |
| CMR | 24.72kw | 8.41kw | 1.448s | 0.715s | - |
| NAR4Rec | 11.39kw | 8.41kw | 1.034s | 0.721s | - |
| GReF | 13.60kw | - | 1.013s | - | - |
| DEGR(w/o PD) | 11.71kw | 8.41kw | 1.738s | 0.732s | +7.8ms |
| DEGR | 13.60kw | 8.41kw | 1.388s | 0.732s | +3.2ms |
各方法的奖励模型(评估器)参数量差别不大(均 8.41kw)。DEGR 生成器的参数量高于部分 baseline,源自底层架构差异(transformer vs pointer network);DEGR 比 DEGR(w/o PD) 参数略多是因为 G-Decoder 里多了 FFN cohort。所有实验在相同 GPU 上进行:并行解码(PD)让 batch 训练时间从 1.738s 降到 1.388s,线上 TP99 从 +7.8ms 降到 +3.2ms——对推荐系统而言可以接受,且还能通过算子融合等工程手段进一步优化。
核心贡献总结¶
- 重新定义了重排的序列价值:把"上游供给受限"这一结构性约束显式建模进奖励函数,用 Max-pCTR 作为供给质量的代理变量,动态调节探索样本的训练权重(式 4)与掩码策略,让重排在低质供给下主动放弃即时收益、换取浏览深度。Figure 4 的"Max-pCTR 与 NCR 解耦"是这一设计的实证基础,Figure 5 的分段收益是它的效果验证。
- 把 LLM 对齐的偏好优化范式适配到排列空间:AR-ORPO 把 ORPO 从成对偏好扩展到分位点偏好列表,并用奖励 softmax 作软权重,附录给出梯度推导与 $\mathrm{Var}(\nabla L_A)\approx \frac{1}{S-1}\mathrm{Var}(\nabla L_{ORPO})$ 的方差缩减论证。
- generator-only 的工程落地:多解码头 cohort 把解码复杂度从 $O(M)$ 降到 $O(M/K)$,配合"1+3+6"的三段式解码在头部位置保留高保真上下文建模;线上只部署生成器、单次贪心解码,TP99 仅 +3.2ms。
与已归档相关工作的对比¶
DeGRe DeGRe: Dense-supervised Generative Reranking for Recommendation(浙江大学 / 淘宝闪购,2026-05-25)¶
关系:独立并发(本文未引用 DeGRe,两者殊途同归)· 已加载对方精读
- 共同关注的问题:两篇都在追问同一个 root cause——generator-only 生成式重排的监督信号该从哪里来。GE 两阶段框架把"列表价值评估"放在线上,既有目标不一致问题又有延迟负担;一旦要把评估器请下线,生成器的训练信号就必须由某个离线的序列价值模型来提供。DeGRe 把这个缺口刻画为"启发式标签偏差 + 稀疏事后奖励的信用分配困难",DEGR 把它刻画为"序列价值定义只含即时消费效用、在低质供给下触顶"。角度不同,但指向的都是"生成器学的目标本身是错的/不完整的"。
- 相近的技术骨架:两者的方法流程图可以抽象重合——离线训一个冻结的序列价值模型 →(用搜索/采样在排列空间里造出多条候选序列并打分)→ 把打分转成生成器的训练信号 → 线上只部署轻量生成器、一次解码。DeGRe 用 Lookahead Evaluator(累积回归)+ beam search 挖掘未曝光高价值序列,再用混合蒸馏(硬标签 + 软标签 + 序列加权)灌 step-wise 稠密监督;DEGR 用探索型奖励模型 + group beam search / 启发式采样构造偏好列表,再用 AR-ORPO 的奖励软加权 odds-ratio 对比损失。连"线上单次贪心解码、评估器不上线"这个部署形态都完全一致。
- 本文的差异与推进:DeGRe 的价值函数仍然是即时效用的前瞻累积(期望累计点击数),本质上还在"当前序列能拿到多少点击"的框架内;DEGR 则把价值函数扩到跨请求——引入 NER / NCR 这类下一请求的后验行为,并用 Max-pCTR 做动态权重,明确接受"当前请求少收点击、换下一请求的浏览与转化"的交易。这是 DEGR 相对 DeGRe 最实质的推进。反过来,DeGRe 的 step-wise 稠密监督在信用分配的粒度上比 DEGR 的序列级偏好对比更细——DEGR 只用位置权重 $\delta_j$(式 5)做了一次静态的位置折扣,并没有真正解决"某一步选错"的归因。
- 可比的方法 / 实验差异:DeGRe 在淘宝闪购报 GMV +3.75%,DEGR 在京东首页报 UCTR +1.22% / PV +0.20%,两者的线上口径不同不可直接比。共同的方法论缺陷也一样:都是两阶段解耦,生成器的上限被冻结的评估器/奖励模型的估计质量卡死,无法端到端联合优化。两篇的消融也都显示"评估器/奖励模型自身的离线指标改进很小,但传导到生成器后放大",说明这条路线的瓶颈确实在价值模型一侧。
NSGR NSGR: Next-Scale Generative Reranking(Meituan,2026-04-07)¶
关系:独立并发(本文未引用 NSGR)· 已加载对方精读
- 共同关注的问题:NSGR 把问题命名为 Goal Inconsistency——生成器训练时优化"列表生成概率"(拟合曝光日志),评估器学的是 list-wise utility,两个目标错位,直接拿评估器当 reward 会出现"评估器给高分但真实体验差"。DEGR 在 §4.2.2 给出的诊断几乎是同一句话:"监督学习拟合线上分布,未必满足多目标;而强化学习可以引导模型探索序列空间以最大化探索奖励。" 两篇都认定:光靠拟合曝光日志的 SL 无法让生成器对齐列表价值目标。
- 相近的技术骨架:两者都是"冻结列表价值模型 → 用它给一组候选/邻居列表打分 → 构造对比式训练信号 → 反传给生成器"的两步训练。NSGR 的 Multi-Scale Neighbor Loss 用 MSE 对生成列表及其 neighbor lists 打分做多尺度对比;DEGR 的 AR-ORPO 用奖励模型对多机制采样得到的 13 条序列($g\times b=6$ 条 group beam search + 7 条启发式)打分排序、取分位点做偏好列表对比。都是"用价值模型在采样出的局部排列邻域上造对比信号",只是邻域的构造方式与对比损失形式不同。
- 本文的差异与推进:NSGR 的主攻方向是生成结构——用 tree-based next-scale 的 $\log_2 m$ 步粗到细扩张替代逐位自回归,让生成过程同时具备全局视野与局部精修;DEGR 保留标准自回归 encoder-decoder,只用多解码头 cohort 做并行加速,主攻方向落在价值定义(引入跨请求的探索价值)与优化目标(把 ORPO 从成对扩到列表 + 奖励软加权)。可以说 NSGR 在"怎么生成"上创新,DEGR 在"朝什么目标生成"上创新,两条路径正交,原则上可以叠加。
- 可比的方法 / 实验差异:两篇共用 Taobao Ad 公开数据集(2600 万条 / 8 天)与 PRM、GRN、NAR4Rec 三个 baseline,但指标口径不同(NSGR 报 AUC / GAUC / Loss,DEGR 报 GAUC / NDCG / MAP / Recall),且 NSGR 的 GAUC 是评估器指标而 DEGR 的 GAUC 是生成器排序指标,数值不可直接对比。线上收益 NSGR 报美团外卖 CTR +2.89% / GMV +3.15%,量级明显大于 DEGR 的 UCTR +1.22%。另外 NSGR 显式讨论了"评估器在未曝光排列上估值不可靠"这一风险并用 neighbor list 限制外推范围,而 DEGR 用 group beam search + Gumbel 噪声在更宽的空间里采样,对奖励模型的外推可靠性缺少对应的防护设计——这是 DEGR 相对 NSGR 的一处论证空白。
讨论与局限性¶
值得借鉴的设计。 第一,用一个当前请求即可获得的量(上游 ranking 的 Max-pCTR)作为"供给质量"的代理变量,去动态调节训练标签的权重与掩码,这是一种很轻量的自适应机制——不需要额外模型、不增加线上开销,却把"什么时候该探索"这个决策显式地编码进了损失函数。第二,Figure 4 的"Max-pCTR 与 NCR 解耦"是先做数据分析、再据此设计损失的典范,比直接堆结构更有说服力。第三,把 A~E 五档未来行为标签设计成"当前点击 × 当前滚动 × 后续点击"的组合,并对"未点击但滚动且后续有点击(C:潜在兴趣)"这一档单独提权,是把跨请求信号引入序列级监督的一个可复用做法。
局限与争议。
- 线上收益幅度偏小:UCTR +1.22%、PV +0.20%。PV 只涨 0.20% 而全文的核心主张是"提升探索、加深浏览",这两者之间存在张力——如果 DEGR 真的显著提升了 NER,PV 的增幅应该更明显。作者没有解释这个不一致。
- 奖励模型的验证不充分:ER vs ER(w/o E) 在 GAUC 上只差 0.0005(0.6388→0.6393),NDCG 完全相同。论文用"评估协议受启发式候选覆盖度限制"来解释,但这等于承认没有任何直接证据证明探索奖励模型本身学到了正确的探索价值;生成器端的提升也可能来自 AR-ORPO 训练信号本身的变化。缺少一个诸如"用探索奖励模型选序列做小流量 A/B"的独立验证。
- 超参与启发式过多:式 4 的 $4-3\log_2(1+\text{Max-pCTR})$、类别 B 的 0.01 掩码阈值、$w_E > w_D$ 的相对关系、$\alpha=0.2$、$\beta=2.0$、$\gamma=0.01$、$t=0.2$、$S=3$、"1+3+6"三段解码——这些 magic number 大多只给了结论没给敏感性分析(只有 $S$ 和 $t$ 有部分扫描)。式 4 的系数形式尤其像是拟合出来的,缺乏原理性论证。
- 三个组件更像工程叠加而非统一机制:SL、EDC、AR-ORPO 分别解决"别坍塌"、"别冗余"、"对齐奖励"三个问题,它们之间没有理论上的耦合,损失就是简单加权和(式 11)。这与论文标题中"Dual Exploration"暗示的统一框架之间存在落差。
- 方法论可扩展性存在瓶颈:奖励模型冻结后指导生成器,是典型的显式两阶段解耦——生成器的能力上限由奖励模型的价值估计质量决定,两者无法端到端联合优化。参数量 scaling 时,扩大生成器并不能自动改善奖励模型的估值精度,反而可能加剧 reward hacking(生成器更擅长找到奖励模型的估值误差)。论文用多机制采样"扩大探索空间",但探索得越广,奖励模型在未曝光排列上的外推误差被利用的风险越大,而论文对此没有任何防护设计或诊断实验。
- 上下文建模的一致性问题未闭环:论文开篇批评一阶段方法"训练时的上下文与用户真实感知的曝光上下文不一致",但 DEGR 的奖励模型在生成器训练阶段是对生成序列(未曝光)打分的,这些序列同样没有真实反馈——同一个批评在 DEGR 身上以另一种形式复现了。
工业落地价值。 DEGR 已在京东首页推荐承接主流量,工程细节相对完整:线上只部署 13.60kw 参数的生成器(奖励模型 8.41kw 完全留在离线),单次贪心解码,TP99 仅 +3.2ms;并行解码相对串行版本把训练 batch 时间从 1.738s 压到 1.388s、线上时延从 +7.8ms 压到 +3.2ms。"三段式解码 1+3+6"是一个很实际的折中:既拿到并行加速,又给最重要的头部位置保留了逐位建模的保真度,值得同类 generator-only 重排系统直接借鉴。