DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation¶
Canwei Huang*, Tiantian He*, Xiaoxiao Xu, Jun Zhang, Ziran Deng, Weike Pan, Chunjie Chen, Kaiqiao Zhan(Shenzhen University + Kuaishou Technology,* 共同一作),arXiv:2608.12778,2026-08-13。
研究动机与背景¶
融合排序阶段与 pxtr 的"双重角色"¶
工业短视频推荐系统普遍采用多阶段架构。在融合排序(ensemble ranking)阶段,模型需要把上游多任务模型输出的多维用户偏好预测融合成一个统一的排序分,以逼近用户的综合满意度。困难在于:用户真实满意度 $\mathrm{sat}_i$ 是潜变量,无法直接观测。论文指出后验反馈(点赞、评论、关注)作为监督有两个根本缺陷:
- 未曝光 item 没有任何真实反馈,而融合排序模型必须对所有候选一起比较;
- 后验信号稀疏,且只刻画满意度的特定切面,不足以支撑多维排序。
因此工业界的标准做法是两段式流水线:上游多任务模型产出用户在多个行为维度上的倾向预测(统称 pxtr,如 ltr / ftr / cmtr 等),下游融合排序模型把这些 pxtr 融合为统一排序分。在这条流水线里,pxtr 扮演了双重角色:它们的相对大小被用来构造代理监督(proxy supervision),它们的数值本身又作为输入特征参与排序推理。
核心问题:预测噪声的双侧传播¶
已有融合排序工作沿三条路线推进建模能力——可学习的融合权重(IntEL)、保留 pxtr 序信息与数值信息的无监督目标(UREM)、以及直接由 pxtr 比较导出的 pairwise 监督(EMER、EASQ)。但它们共享同一个假设:pxtr 是可靠信号,从而忽略了上游模型输出中固有的预测噪声。
论文的核心论断是:这一噪声会沿两条通路同时向下游传播:
- 监督侧(supervision side):带噪的 pxtr 可能翻转代理偏序(本该 $i \succ j$ 的 pair 被观测成 $j \succ i$),引入错误梯度;
- 特征侧(feature side):pxtr 噪声经模型输入传播,扰动排序打分的稳定性。
挑战:预测噪声的多维异质性¶
真正的挑战不是"有噪声",而是噪声的多维异质性——它跨 pxtr 任务不同、跨 item 不同,因而跨 pair 也不同。于是:
- 一个全局统一的去噪强度会对可靠 pair 过度纠正、对高噪 pair 纠正不足;
- 一个全局统一的扰动尺度会把高置信 item 过度平滑、把高不确定 item 保护不足。
论文逐条批评了现有稳健性方法为何无法容纳这种异质性:
| 方法族 | 代表 | 为何不适用 |
|---|---|---|
| 去噪方法 | UDT [6]、DCF [12] | pointwise 操作,不建模偏序翻转的概率 |
| 稳健损失 | BSL [28]、SSM [29]、PSL [31]、[32] | 对所有 pair 一致地套用有界函数,无 pair 级自适应 |
| 扰动方法 | APR [11]、VAT [36] | 优化的是损失平滑性而非建模预测误差 |
| 扰动方法 | LSPR [19] | 用全局噪声尺度,忽略 item 级异方差 |
而且这些方法都只覆盖一侧,另一侧完全裸奔。
论文的解决思路¶
要同时满足"两侧都做样本级区分"和"两侧的纠偏目标彼此对齐",需要:
- 监督侧做 pair 级区分:pxtr margin 小或预测噪声大的 pair 更容易翻转,应被更强纠正;
- 特征侧做 item 级区分:预测方差大的 item 需要更强扰动来提升鲁棒性,低方差 item 只应受轻微扰动以避免过度平滑;
- 两侧共享同一个噪声模型,使纠偏目标锚定在同一噪声源上。
而实现这个共享模型所需的噪声分布,恰好可以从融合排序场景已有的数据中估计出来:观测到的用户行为会系统性偏离预测的 pxtr,这个偏离的幅度就编码了预测噪声的信息;在大规模数据上做分桶聚合,就能反解出每个 item 的噪声方差。
主要贡献¶
- 明确识别出工业融合排序中由 pxtr 双重角色引发的预测噪声,并系统刻画它如何在监督侧与特征侧传播;
- 设计风险去噪稳健 pairwise 损失(risk-denoising robust loss),通过推导偏序翻转概率的近似解来纠正经验风险;
- 提出保序排序一致性正则(preference-preserving ranking consistency regularizer),扰动从预测噪声分布中采样,稳定模型输出;
- 在工业短视频平台上做大量离线实验与线上 A/B,验证方法在多任务上的鲁棒性与业务收益。
核心方法 / 模型架构¶

3.1 问题形式化与记号¶
考虑单次请求的候选 item 集合 $\mathcal{I}$。上游多任务模型对每个候选 $i \in \mathcal{I}$ 输出多维预测。设 $\mathcal{X}$ 为 pxtr 类型集合(即多任务模型预测的用户行为种类),例如 $\mathcal{X} = \{\mathrm{ltr}, \mathrm{ftr}, \mathrm{cmtr}, \dots\}$ 分别对应点赞、关注、评论的预测倾向。把所有候选 item 的 pxtr 组织成矩阵 $\mathbf{P} \in \mathbb{R}^{|\mathcal{I}| \times |\mathcal{X}|}$,元素 $p_{i,x} \in [0,1]$ 是 item $i$ 在 pxtr 类型 $x$ 上的预测值(如 $p_{i,\mathrm{ltr}}$ 是 item $i$ 的预测点赞率)。对应地,令 $\mathbf{R} \in \mathbb{R}^{|\mathcal{I}| \times |\mathcal{X}|}$ 为潜在的干净 pxtr 矩阵,元素 $r_{i,x}$ 是 $p_{i,x}$ 的无噪版本。
融合排序模型 $\mathrm{EM}_\theta(\cdot)$ 接收三类输入:候选 item 的 pxtr 矩阵 $\mathbf{P}$、用户侧特征(用户画像、历史行为序列)、上下文特征(请求场景、时间)。它输出排序分 $\mathbf{s} = (s_1, \dots, s_{|\mathcal{I}|})^\top \in \mathbb{R}^{|\mathcal{I}|}$,目标是让排序尽可能逼近真实满意度诱导的排序。定义偏好 pair 集合 $\mathcal{S} = \{(i,j) \in \mathcal{I} \times \mathcal{I} \mid \mathrm{sat}_i > \mathrm{sat}_j\}$,其中 $\mathrm{sat}_i$ 是用户对 item $i$ 的潜在真实满意度。优化目标为
$$\theta^* = \arg\max_\theta \frac{1}{|\mathcal{S}|} \sum_{(i,j) \in \mathcal{S}} \delta(s_i, s_j), \quad \delta(s_i, s_j) = \begin{cases} 1, & s_i > s_j, \\ 0, & s_i \le s_j, \end{cases} \tag{1}$$
其中 $\delta(s_i, s_j)$ 是 pairwise 一致性指示函数。
由于 $\mathrm{sat}_i$ 不可观测且没有统一标签,pxtr 作为多维用户行为的预测被用作代理监督信号。对每个 pxtr 类型 $x \in \mathcal{X}$,从对应 pxtr 的相对次序构造偏好 pair 集合 $\mathcal{P}_x = \{(i,j) \in \mathcal{I} \times \mathcal{I} \mid p_{i,x} > p_{j,x}\}$,用它替代不可得的 $\mathcal{S}$ 来引导模型学习排序分的相对次序。
全部推导在 logit 空间进行,因为在 4 节的假设 1 下预测噪声在 logit 空间呈现可加高斯形式。令 $z_{i,x} = \mathrm{logit}(p_{i,x})$、$z^*_{i,x} = \mathrm{logit}(r_{i,x})$ 分别为带噪与干净的 logit 分数,汇集成矩阵 $\mathbf{Z}, \mathbf{Z}^* \in \mathbb{R}^{|\mathcal{I}| \times |\mathcal{X}|}$。为简洁,后续推导略去类型下标 $x$,对单个 pxtr 类型使用列向量 $\mathbf{z} = (z_1, \dots, z_{|\mathcal{I}|})^\top$ 与 $\mathbf{p} = (p_1, \dots, p_{|\mathcal{I}|})^\top$。
3.2 监督侧:风险去噪稳健损失¶
方法遵循噪声感知的风险纠正原则 [5, 17](Provably Robust DPO / Natarajan et al. 的 Learning with Noisy Labels 一脉):当观测到的监督信号是潜在干净信号的带噪版本时,经验风险应当按对应的噪声机制被纠正。在本文场景中,监督信号是由上游 pxtr 诱导的 pairwise 偏好,因此噪声机制自然地表现为 pairwise 偏好的翻转。
设 $(i^*, j^*)$ 是由干净 pxtr 诱导的干净偏好 pair,即 $r_{i^*} > r_{j^*}$。由于训练用的监督来自带噪预测而非干净 pxtr,观测到的偏好 pair $(i,j)$ 可能相对干净 pair 发生翻转:它以概率 $1 - \varepsilon_{ij}$ 保持为 $(i^*, j^*)$,以翻转概率 $\varepsilon_{ij}$ 反转为 $(j^*, i^*)$(定理 2)。对翻转随机性与数据分布取期望,基础 pairwise 损失的风险为
$$\mathcal{R} = \mathbb{E}_{(i^*,j^*)}\Big[(1 - \varepsilon_{ij})\,\ell(s_{i^*}, s_{j^*}) + \varepsilon_{ij}\,\ell(s_{j^*}, s_{i^*})\Big]. \tag{2}$$
多出来的反向损失项 $\varepsilon_{ij}\,\ell(s_{j^*}, s_{i^*})$ 随翻转概率增长,驱使优化梯度系统性偏离干净目标——这正是 pxtr 预测噪声在监督侧损害排序质量的机制。
反向项的权重由翻转概率决定。直觉上,翻转概率取决于 logit margin 与噪声分布:margin 越大或噪声越小,翻转概率越低,因而翻转风险跨 pair 差异巨大。所以纠正必须逐对进行,依赖对每个 pair $(i,j)$ 的翻转概率估计 $\hat{\varepsilon}_{ij}$,而不是套用全局统一的去噪强度。翻转概率可由噪声分布算出(定理 2),其参数可从大规模后验用户反馈估计(定理 3)。
为纠正式 (2) 中的反向损失项,作者推导出稳健 pairwise 损失,形式为前向与反向 pairwise 损失的加权组合:
$$\mathcal{L}_{\mathrm{rob}} = \sum_{(i,j) \in \mathcal{P}} \frac{(1 - \hat{\varepsilon}_{ij})\,\ell(s_i, s_j) - \hat{\varepsilon}_{ij}\,\ell(s_j, s_i)}{1 - 2\hat{\varepsilon}_{ij}}. \tag{3}$$
当 $\hat{\varepsilon}_{ij} = \varepsilon_{ij}$ 时,该损失的风险恰好等于干净风险。实践中翻转概率只能估计而无法精确已知;论文证明只要 $\hat{\varepsilon}_{ij} \in (0, 1/2)$,稳健损失的风险就比基础 pairwise 损失更接近干净风险,且估计越准越接近(定理 1)。这一性质保证了方法在翻转概率估计不完美时仍然有效——这是它可以工业落地的前提。
3.3 特征侧:保序排序一致性正则¶
3.2 节的监督侧纠正缓解了 pxtr 噪声对监督信号的影响,但 pxtr 同时还是排序模型的输入特征,其预测噪声仍会导致模型输出不稳。为此论文显式模拟 pxtr 输入中可能存在的预测噪声,并据此约束模型输出。
对整个请求输入的 pxtr,从预测噪声的分布中采样扰动向量 $\boldsymbol{\epsilon} = (\epsilon_1, \dots, \epsilon_{|\mathcal{I}|})^\top$,其中 $\epsilon_i \sim \mathcal{N}(0, \sigma_i^2)$。在 logit 空间构造扰动后的 logit 分数 $\tilde{\mathbf{z}} = \mathbf{z} + \boldsymbol{\epsilon}$。$\boldsymbol{\epsilon}$ 每个分量的符号决定扰动方向、绝对值控制扰动强度。扰动后的 pxtr 再映回概率空间得到 $\tilde{\mathbf{p}} = \sigma(\tilde{\mathbf{z}})$,$\sigma(\cdot)$ 为逐元素 sigmoid。这个扰动采用与监督侧翻转概率推导完全相同的 logit 空间噪声模型和参数 $\sigma_i^2$(定理 3)——这是"双侧共享噪声模型"的落点。
构造扰动版请求输入:用 $\tilde{\mathbf{p}}$ 替换原始 pxtr,用户侧与上下文特征保持不变。原始输入与扰动输入分别经过融合排序模型,得到原始排序分 $\mathbf{s} \in \mathbb{R}^{|\mathcal{I}|}$ 与扰动排序分 $\tilde{\mathbf{s}} \in \mathbb{R}^{|\mathcal{I}|}$(两个前向共享同一套模型参数,见 Figure 1a 的 sharing 标注)。
保序过滤(preference-preserving filtering):pxtr 本身携带很强的排序信号,扰动可能改变它们表达的 pairwise 偏好。如果某个 pair 的次序在扰动前后翻转了,强行要求扰动后的打分保持原次序,会让模型无视扰动特征中合法的偏好变化,并与主排序目标冲突。因此只对扰动前后偏好一致的 pair 施加一致性约束。基于 1 节定义的 pairwise 偏好指示 $\delta(\cdot,\cdot)$,记扰动前后的偏好为 $\delta(p_i, p_j)$ 与 $\delta(\tilde{p}_i, \tilde{p}_j)$,定义有效 pair 指示:
$$m_{ij} = 1 - \big(\delta(p_i, p_j) \oplus \delta(\tilde{p}_i, \tilde{p}_j)\big), \tag{4}$$
其中 $\oplus$ 为异或。偏好在扰动前后一致时 $m_{ij} = 1$,否则 $m_{ij} = 0$。
基于保序过滤,定义 pairwise 排序一致性损失:
$$\mathcal{L}_{\mathrm{cons}} = \sum_{(i,j) \in \mathcal{P}} m_{ij}\Big(y_{ij}\,\ell(\tilde{s}_i, \tilde{s}_j) + (1 - y_{ij})\,\ell(\tilde{s}_j, \tilde{s}_i)\Big), \tag{5}$$
其中 $y_{ij} = \delta(s_i, s_j)$ 是原始输入下排序分表达的相对偏好,$\ell(\cdot,\cdot)$ 为基础 pairwise 损失。这个损失把原始输入下的排序分当作锚点(Figure 1a 中该路径带 sg 停梯度标记),仅在保序 pair 上约束扰动打分维持一致次序,从而在抵抗特征侧 pxtr 噪声的同时避免与主排序目标冲突。
3.4 总体优化目标与计算开销¶
结合式 (3) 的风险去噪稳健损失与式 (5) 的保序排序一致性正则:
$$\mathcal{L} = \mathcal{L}_{\mathrm{rob}} + \lambda_{\mathrm{cons}} \mathcal{L}_{\mathrm{cons}}, \tag{6}$$
$\mathcal{L}_{\mathrm{rob}}$ 从监督侧缓解 pxtr 预测噪声导致的代理 pair 翻转,$\mathcal{L}_{\mathrm{cons}}$ 从特征侧提升模型输出对 pxtr 预测噪声的稳定性。两者共享同一个 logit 空间噪声模型与参数,联合消除预测噪声在两侧的影响。
开销:相对基础 pairwise 损失,DrEM 的额外成本主要来自扰动前向传播(多一次 forward)。其余操作——翻转概率计算、保序过滤——都是标量运算,代价可忽略,且推理期零额外成本。虽然训练计算量增加,但训练可异步进行,与延迟敏感的推理管线解耦。
理论分析¶
两侧都依赖对预测噪声的具体刻画才能得到可解的结果。论文把预测噪声建模为 logit 空间的可加零均值高斯,理由有三:保持概率的有界性、契合参数模型的渐近正态性与复杂模型近似正态的残差 [39]、并可通过 probit 近似给出闭式解。
假设 1(可加高斯噪声模型):对每个 item $i$,令 $z_i = \mathrm{logit}(p_i)$、$z^*_i = \mathrm{logit}(r_i)$ 分别为带噪与干净 pxtr 的 logit,二者关系为
$$z_i = z^*_i + \xi_i, \tag{7}$$
其中 $\xi_i \sim \mathcal{N}(0, \sigma_i^2)$ 且 $\xi_i \perp \xi_j$($i \ne j$)。
定理 1:稳健 pairwise 损失的风险优越性¶
陈述:设翻转概率 $\varepsilon_{ij} \in (0, 1/2)$、其估计 $\hat{\varepsilon}_{ij} \in (0, 1/2)$。则稳健 pairwise 损失的去噪效果随 $|\hat{\varepsilon}_{ij} - \varepsilon_{ij}|$ 减小而单调改善,并严格强于基础 pairwise 损失;当 $\hat{\varepsilon}_{ij} = \varepsilon_{ij}$ 时,稳健损失的期望恰等于干净损失。
证明:考虑单个干净偏好 pair $(i^*, j^*)$,$r_{i^*} > r_{j^*}$。观测 pair 以概率 $\varepsilon_{ij}$ 翻转为 $(j^*, i^*)$、以 $1 - \varepsilon_{ij}$ 保持,故 pairwise 损失 $\ell$ 的期望为
$$\mathbb{E}_{(i^*,j^*)}[\ell] = (1 - \varepsilon_{ij})\,\ell(s_{i^*}, s_{j^*}) + \varepsilon_{ij}\,\ell(s_{j^*}, s_{i^*}). \tag{8}$$
代入稳健损失的定义,$\mathbb{E}_{(i^*,j^*)}[\mathcal{L}_{\mathrm{rob}}]$ 中干净项 $\ell(s_{i^*}, s_{j^*})$ 的系数为
$$c(\hat{\varepsilon}_{ij}) = 1 - \frac{\varepsilon_{ij} - \hat{\varepsilon}_{ij}}{1 - 2\hat{\varepsilon}_{ij}}, \tag{9}$$
反向项 $\ell(s_{j^*}, s_{i^*})$ 的系数为 $1 - c(\hat{\varepsilon}_{ij})$。任一损失的期望中两个系数之和都是 1,因此去噪效果直接由 $c(\hat{\varepsilon}_{ij})$ 决定,$c$ 越接近 1 去噪越强。基础 pairwise 损失对应 $\hat{\varepsilon}_{ij} = 0$,即 $c(0) = 1 - \varepsilon_{ij}$。
由于对所有 $\varepsilon_{ij}, \hat{\varepsilon}_{ij} \in (0, 1/2)$ 都有 $c(\hat{\varepsilon}_{ij}) - c(0) > 0$,稳健损失的干净项系数严格大于基础损失,去噪更强。又 $c'(\hat{\varepsilon}_{ij}) > 0$,故 $c$ 在 $(0, 1/2)$ 上严格递增且 $c(\varepsilon_{ij}) = 1$;$\hat{\varepsilon}_{ij}$ 越接近 $\varepsilon_{ij}$,$c$ 越接近 1、去噪越强。当 $\hat{\varepsilon}_{ij} = \varepsilon_{ij}$ 时 $c = 1$、反向项系数为零,$\mathbb{E}[\mathcal{L}_{\mathrm{rob}}] = \ell(s_{i^*}, s_{j^*})$ 恰为干净损失。∎
这条定理的实践含义很关键:只要 $\hat{\varepsilon}$ 落在 $(0, 1/2)$ 内(哪怕偏差不小),方法就单调优于不做纠正,不存在"估不准反而更差"的翻车区间。
定理 2:偏序翻转概率的近似解¶
陈述:在假设 1 下,代理 pair $(i,j) \in \mathcal{P}$ 的偏序翻转概率估计为
$$\hat{\varepsilon}_{ij} = \Phi\left(-\frac{z_i - z_j}{\sqrt{\sigma_i^2 + \sigma_j^2}}\right), \tag{10}$$
其中 $\Phi(\cdot)$ 是标准正态分布的累积分布函数。
证明:在假设 1 下,logit margin $d_{ij} := z_i - z_j$ 服从位置参数 $\mu_{ij}$、方差 $\sigma_i^2 + \sigma_j^2$ 的正态分布($\sigma_i^2, \sigma_j^2$ 由定理 3 估得)。代理 pair $(i,j)$ 翻转当且仅当噪声反转了 $d_{ij}$ 的符号,故翻转概率 $\varepsilon_{ij}$ 是标准化后 $\mu_{ij}$ 的标准正态尾概率,即 $\varepsilon_{ij}$ 是 $\mu_{ij}$ 的单调可测函数。给定观测 $d_{ij}$,$\mu_{ij}$ 的对数似然为
$$\ell(\mu_{ij}) = -\frac{(d_{ij} - \mu_{ij})^2}{2(\sigma_i^2 + \sigma_j^2)} + C. \tag{11}$$
由因子分解定理,$d_{ij}$ 是 $\mu_{ij}$ 的充分统计量。对 $\mu_{ij}$ 求导置零得 $\hat{\mu}_{ij} = d_{ij}$,二阶导 $-(\sigma_i^2 + \sigma_j^2)^{-1} < 0$ 确认是极大值,故 $d_{ij}$ 是 $\mu_{ij}$ 的 MLE。由 MLE 的不变性,参数任一可测函数的 MLE 等于该函数在参数 MLE 处的取值;$\varepsilon_{ij}$ 作为 $\mu_{ij}$ 的可测函数,其 MLE 即为该函数在 $\hat{\mu}_{ij} = d_{ij}$ 处的值,展开即得结论。∎
式 (10) 的物理含义非常清楚:pair 的 logit margin 越大、两个 item 的噪声方差之和越小,翻转概率越低——这正好实现了论文要的 pair 级差异化去噪强度。
定理 3:logit 空间噪声方差的 probit 估计¶
定理 2 的翻转概率仍依赖噪声方差 $\sigma_i^2$,而单次观测无法得到它。但 sigmoid 与高斯噪声的卷积会在后验行为与预测率之间产生系统性差异,这个差异编码了方差信息,可通过分桶聚合提取出来。
陈述:在假设 1 下,设桶 $B_k$ 内所有 item 共享同一 logit 空间噪声方差 $\sigma_k^2$,令 $\mathrm{diam}(B_k) = \max_{i,j \in B_k} |z_i - z_j|$。则当 $|B_k| \to \infty$ 且 $\mathrm{diam}(B_k) \to 0$ 时,
$$\hat{\sigma}_k^2 = \frac{1}{\lambda^2}\left[\left(\frac{\Phi^{-1}(\mathbb{E}_{B_k}[p_i])}{\Phi^{-1}(\mathbb{E}_{B_k}[y_i])}\right)^2 - 1\right] \to \sigma_k^2, \qquad \lambda = \sqrt{\pi/8}. \tag{12}$$
证明:由定义 $\mathbb{E}[r_i] = \mathbb{E}[\sigma(z_i + \xi_i)]$。当 $\sigma_i^2 = 0$ 时 $\mathbb{E}[r_i] = p_i$;当 $\sigma_i^2 > 0$ 时由 Jensen 不等式 $\mathbb{E}[r_i] \ne p_i$。用 sigmoid 的 probit 近似 $\sigma(x) \approx \Phi(\lambda x)$,
$$\mathbb{E}[r_i] \approx \Phi\left(\frac{\lambda z_i}{\sqrt{1 + \lambda^2 \sigma_i^2}}\right) = \Phi\left(\frac{\Phi^{-1}(p_i)}{\sqrt{1 + \lambda^2 \sigma_i^2}}\right). \tag{13}$$
$\mathbb{E}[y_i \mid z_i]$ 作为 $y_i$ 的条件期望无法由单次观测估计,需要桶内聚合。给定 $z_i$,各 $y_i$ 是独立的 $\mathrm{Bernoulli}(r_i)$,由大数定律当 $|B_k| \to \infty$ 时 $\mathbb{E}_{B_k}[y_i] = \mathbb{E}_{B_k}[r_i]$;当 $\mathrm{diam}(B_k) \to 0$ 时桶内 $p_i$ 趋于一致,于是
$$\mathbb{E}_{B_k}[y_k] = \Phi\left(\frac{\Phi^{-1}(p_k)}{\sqrt{1 + \lambda^2 \sigma_k^2}}\right). \tag{14}$$
解出 $\sigma_k^2$ 即得结论。∎
这一步是整套方法的工程可行性支点:它把"不可观测的上游模型预测方差"变成了"可从线上日志按 pxtr 分桶统计出来的量"——桶内预测率 $\mathbb{E}_{B_k}[p_i]$ 与桶内实际行为率 $\mathbb{E}_{B_k}[y_i]$ 的 probit 变换之比,直接给出方差估计(对应 Figure 1b 左侧的 Bucket 1/2/3/… 模块)。
实验设置¶
数据集¶
全部离线实验在一个数亿 DAU 的大规模工业短视频社交平台的真实数据上进行,上游多任务模型预测多种用户行为的 pxtr:点击、播放、长播、点赞、关注、评论、转发。
论文明确说明为什么不能用公开数据集:公开短视频数据集(KuaiRec [8]、[18]、KuaiSAR [21])只包含后验反馈标签、没有上游 pxtr 输出,而 DrEM 同时把 pxtr 用作 pairwise 监督信号和输入特征,因此无法使用。
扰动评估协议¶
为评估对 pxtr 预测噪声的鲁棒性,论文向输入 pxtr 注入高斯扰动构造不同强度的评估集:对每个 pxtr,扰动后的 logit 为 $\tilde{z}_i = z_i + \alpha \epsilon_i$,$\epsilon_i$ 为采样的高斯扰动、$\alpha$ 控制扰动强度。取 $\alpha \in \{0.5, 1.0, 2.0\}$,分别对应轻度、中度、重度的 pxtr 预测噪声。
评估指标¶
主指标为 Group AUC (GAUC)。在工业融合排序中模型对每个 item 输出单个标量分、最终排序由分数排序决定,因此与参考次序的排序一致性是模型质量的核心标准 [1, 10, 15]。GAUC 在全局 AUC 基础上计算逐用户 AUC 并按曝光数加权,消除跨用户混杂、更好反映个性化排序性能:
$$\mathrm{GAUC} = \frac{\sum_i^{\#\mathrm{user}} \#\mathrm{impression}_{u_i} \cdot \mathrm{AUC}_{u_i}}{\sum_i \#\mathrm{impression}_{u_i}}, \tag{15}$$
其中 $u_i$ 是第 $i$ 个用户。在每个扰动评估集上,用未扰动的 pxtr 次序作为参考来计算模型排序分的 GAUC;随扰动强度增大 GAUC 掉得越少,说明对 pxtr 预测噪声越鲁棒。
骨干与 baseline¶
用两个 SOTA 融合排序模型 EMER [10] 与 EASQ [15] 作骨干,对比四个稳健学习 baseline:
| Baseline | 侧别 | 机制 |
|---|---|---|
| SSM [29] | 监督侧 | 采样 softmax 损失,关联流行度去偏、难负例挖掘、排序指标优化与负样本分布漂移鲁棒性 |
| PSL [31] | 监督侧 | 用替代激活替换 pairwise softmax 损失中的指数函数,等价于负样本分布漂移下的分布鲁棒 BPR |
| GaussAug (GA) [27] | 特征侧 | 从高斯分布生成额外样本并对抗性选取最坏增广,等价于梯度正则 |
| LSPR [19] | 特征侧 | 对输入特征施加高斯扰动,把扰动样本作为降权的辅助监督,强调预测正确而非输出一致性 |
骨干说明:EMER 是端到端框架,用 Transformer 建模候选 item 间的交互,用定制损失应对满意度标签的缺失;EASQ 通过多任务学习与 LoRA 把排序与稀疏的满意度问卷对齐,同时把问卷监督与稠密行为信号分离。
消融变体:DrEM:S(仅监督侧)、DrEM:F(仅特征侧)。
实现细节¶
各方法使用相同设置以保证公平对比。遵循 [10],用户与 item 特征的 embedding 维度为 32、pxtr 的 embedding 维度为 8,用 Adam 优化器 [13]、学习率 $5 \times 10^{-6}$ 训练。式 (6) 的一致性权重 $\lambda_{\mathrm{cons}}$ 在 $\{0.1, 0.3, 0.6\}$ 中调优,以防一致性正则压过主排序损失。
七个 pxtr 任务¶
pctr(点击率)、pvtr(播放率)、plvtr(长播率)、pltr(点赞率)、pwtr(关注率)、pcmtr(评论率)、pftr(转发率)。
主要实验结果(RQ1)¶
在 $\alpha = 1.0$ 的固定扰动强度下,在 EMER 与 EASQ 两个骨干上对比所有方法。
Table 1:$\alpha = 1.0$ 下的整体对比(GAUC,所有值共享前缀 "0.";粗体最优、下划线次优)
| Backbone: EMER | pctr | pvtr | plvtr | pltr | pwtr | pcmtr | pftr |
|---|---|---|---|---|---|---|---|
| Base | .6530 | .6899 | .6851 | .6622 | .6775 | .6235 | .6853 |
| GA | .6506 | .6930 | .6833 | .6630 | .6787 | .6227 | .6876 |
| LSPR | .6549 | .6918 | .6863 | .6646 | .6789 | .6257 | .6860 |
| PSL | .6499 | .6895 | .6830 | .6673 | .6833 | .6287 | .6886 |
| SSM | .6516 | .6882 | .6832 | .6633 | .6781 | .6224 | .6853 |
| DrEM:F | .6570 | .6947 | .6877 | .6653 | .6814 | .6260 | .6870 |
| DrEM:S | .6531 | .6934 | .6863 | .6662 | .6936 | .6286 | .6931 |
| DrEM | .6563 | .6966 | .6876 | .6725 | .6871 | .6310 | .6965 |
| Backbone: EASQ | pctr | pvtr | plvtr | pltr | pwtr | pcmtr | pftr |
|---|---|---|---|---|---|---|---|
| Base | .6352 | .6615 | .6528 | .6693 | .6811 | .6621 | .6804 |
| GA | .6347 | .6622 | .6519 | .6700 | .6815 | .6633 | .6807 |
| LSPR | .6359 | .6619 | .6538 | .6704 | .6822 | .6630 | .6818 |
| PSL | .6348 | .6639 | .6531 | .6711 | .6826 | .6640 | .6828 |
| SSM | .6353 | .6663 | .6546 | .6741 | .6833 | .6644 | .6850 |
| DrEM:F | .6367 | .6654 | .6531 | .6719 | .6825 | .6646 | .6832 |
| DrEM:S | .6344 | .6690 | .6554 | .6725 | .6847 | .6673 | .6828 |
| DrEM | .6376 | .6742 | .6562 | .6749 | .6873 | .6661 | .6879 |
结论分析:
(1) 整体最优且跨骨干一致。 DrEM 在 EMER 上取得 4 项最优 + 3 项次优,在 EASQ 上取得 6 项最优 + 1 项次优。值得注意的是baseline 的增益跨骨干不一致:例如 SSM 在 EASQ 上改善 pvtr(.6615→.6663)却在 EMER 上劣化它(.6899→.6882),而 DrEM 在两个骨干上都稳定优于 Base。这说明 baseline 的有效性取决于各骨干具体的噪声条件,而 DrEM 处理的是 pxtr 预测噪声这一根本问题,因而能作为不修改骨干结构的插件模块在骨干间良好泛化。
(2) 单侧 baseline 的增益不稳定。 监督侧方法(SSM、PSL)与特征侧方法(GA、LSPR)都无法在所有任务上一致超过 Base。例如 PSL 在 EMER 上改善 pcmtr(.6235→.6287)和 pftr(.6853→.6886),却劣化 pctr(.6530→.6499)与 pvtr(.6899→.6895);GA 在 EMER 上劣化 pctr 与 pcmtr,却改善 pvtr 与 pftr。这表明单侧方法高度任务依赖——同一种干预会因各任务 pxtr 噪声特性不同而在某些任务上有益、某些任务上有害。
(3) DrEM:S 与 DrEM:F 的互补角色。 在 EMER 骨干上,DrEM:S 在稀疏任务(pcmtr、pftr)上增益更大(pwtr 甚至以 .6936 反超完整 DrEM 的 .6871),而 DrEM:F 在稠密任务(pctr、pvtr)上更有效(pctr .6570 与 plvtr .6877 均为该列最优)。这符合直觉:稀疏任务的监督更不可靠,监督侧纠正因此更有价值;稠密任务的监督已相对可靠,特征侧稳定性反而更关键。在 EASQ 上这一模式不那么明显,作者认为是因为 EASQ 的问卷信号对齐已经降低了监督侧噪声,从而缩小了两个变体的差距。
按 7 个任务取平均,$\alpha = 1.0$ 时 EMER 的平均 GAUC 从 Base 的 0.6681 提升到 DrEM 的 0.6754(+0.0073),EASQ 从 0.6632 提升到 0.6692(+0.0060)——这也解释了为何 EMER 上的绝对增益普遍大于 EASQ。
消融与扰动强度分析(RQ2)¶

在两个骨干上逐步移除监督侧稳健损失与特征侧一致性正则,在三个扰动强度 $\alpha \in \{0.5, 1.0, 2.0\}$ 下考察平均 GAUC(图中 Ours-sup = DrEM:S、Ours-fea = DrEM:F、Ours = DrEM)。
(1) 两侧的贡献都随扰动增大而增大,但增长模式不同。 监督侧纠正在低扰动下增益有限,但随扰动增长而显著上升——这与定理 1 一致:更高的翻转概率会拉大基础 pairwise 损失风险与干净风险的差距,给稳健损失留出更多恢复空间。特征侧正则同样在低扰动下增益有限,但在高扰动下变得关键,表明它保护的是超出模型固有容忍度的输入偏移。从图上可见:在 EMER 上 $\alpha=0.5$ 时四条曲线几乎重叠(均在 0.675 附近),到 $\alpha=2.0$ 时 Base 掉到 ~0.665 而 DrEM 仍守住 ~0.672,曲线的斜率差就是鲁棒性本身。
(2) 完整方法在所有扰动强度下都优于任一单侧变体,证明双侧干预的必要性。 同一份 pxtr 噪声同时污染监督信号与输入特征,DrEM 的两侧各处理其中一个效应,因此增益是可加的而非冗余的;即便两侧都开始生效,互补效应依然持续。
线上 A/B 测试(RQ3)¶
在工业短视频平台做线上 A/B。设置两组并行实验验证 DrEM 在两个代表性骨干上的泛化性,分别把 DrEM 加在生产级的 EMER 与 EASQ 骨干之上。实验运行 7 天,按用户级 hash 分流,每组随机分配 5.1% 主流量。对照组用线上基线模型,实验组用同一基线 + DrEM。评估指标覆盖长期留存(LT7)、隐式消费行为、显式正向交互。
Table 2:线上 A/B 结果(所有 $p$ 值 < 0.005)
| Metric | EMER w/ DrEM | EASQ w/ DrEM |
|---|---|---|
| LT7 | +0.017% | +0.020% |
| App Stay Time | +0.116% | +0.124% |
| Video View | +0.691% | +0.117% |
| Long View | +0.401% | +0.043% |
| Like | +0.625% | +0.048% |
| Follow | +1.197% | +0.460% |
| Forward | +0.683% | +0.181% |
| Comment | +1.388% | +0.178% |
结论分析:
(1) 稀疏行为的提升远大于稠密行为。 主动交互指标(Follow +1.197%、Comment +1.388%)的增益远超被动消费指标(Video View +0.691%、Long View +0.401%)。这与理论分析一致:稀疏行为任务(如 pcmtr、pftr)的预测方差更大,导致式 (2) 中的翻转概率 $\varepsilon_{ij}$ 更高、基础 pairwise 损失的风险偏离更严重,因而 DrEM 的稳健纠正在这些任务上有更大的恢复空间。离线实验中 DrEM:S 在稀疏任务上增益更大(Table 1)呈现同样模式,进一步印证了翻转概率驱动的自适应纠正对高噪任务的价值。
(2) EASQ 上的边际增益小于 EMER。 除 Video View 外,相对 EASQ 的改进全部小于相对 EMER 的改进(如 Follow +0.460% vs +1.197%、Comment +0.178% vs +1.388%)。作者强调这不表示 DrEM 在 EASQ 上更弱,而是因为 EASQ 的问卷信号对齐已经部分缓解了监督侧噪声,留给 DrEM 监督侧纠正的空间更少。
进一步分析:翻转概率分层(RQ4)¶

按估计的偏序翻转概率以步长 0.05 把 pair 分成十个桶:$[0, 0.05), [0.05, 0.10), \dots, [0.45, 0.50)$,报告每个桶、每个 pxtr 任务上 DrEM 相对 Base 的 GAUC 提升(热力图色标 $-0.0150$ 到 $+0.0150$)。
(1) 总体趋势:提升随翻转概率增大而增大。 两个骨干的热力图都呈现清晰的"左冷右暖"格局:低翻转概率处提升很小甚至略负,随翻转概率增大而增长。这与定理 1 一致——基础 pairwise 损失的风险偏离干净风险的幅度正比于 $\varepsilon_{ij}$,$\varepsilon_{ij}$ 越大稳健损失恢复空间越大。在 EMER 骨干上 pctr 与 plvtr 在最高翻转概率桶(pctr 的 $[0.40, 0.45)$、plvtr 的 $[0.45, 0.50)$)出现轻微负值;作者归因于这些桶样本极度稀缺——对稠密行为任务而言这么高翻转概率的 pair 极为罕见,得到的 GAUC 估计被统计噪声主导,而非系统性劣化。
(2) 稠密与稀疏任务呈现不同的增益剖面。 稠密行为任务(pctr、pvtr)在低翻转概率处提升接近零或略负,向高端急剧上升;稀疏行为任务(pcmtr、pftr)在低翻转概率处就已经是正增益,随后增长更平缓。原因是稀疏任务的 pxtr 预测方差更高,即便翻转概率低,其监督也更嘈杂、模型输出也更不稳定,因而留给方法的纠正空间更大;而稠密任务在低翻转概率下监督已经可靠、几乎无可纠正,只有当翻转概率大到足以造成显著标签污染时方法才开始受益。
核心贡献总结¶
- 问题识别:首次明确把工业融合排序中 pxtr 的双重角色(代理监督 + 输入特征)作为噪声传播的结构性根因,并把它拆解为监督侧的偏序翻转与特征侧的输出抖动两条通路,指出现有稳健方法都只覆盖单侧且缺乏样本级差异化。
- 监督侧的风险去噪稳健损失:把 Natarajan 式"噪声感知风险纠正"从 pointwise 标签翻转迁移到 pairwise 偏序翻转,用式 (3) 的前向/反向加权组合把经验风险逐对拉回干净风险,并用定理 1 给出"$\hat{\varepsilon} \in (0,1/2)$ 即严格优于不纠正"的安全性保证。
- 特征侧的保序排序一致性正则:扰动不再是"随便加点噪声",而是从估计出的预测噪声分布中采样(item 级异方差);配合基于异或的保序过滤(式 4),只在扰动未改变 pxtr 表达偏好的 pair 上施加一致性约束,从机制上避免与主排序目标冲突。
- 可落地的噪声参数估计:定理 3 用 sigmoid 的 probit 近似把不可观测的 logit 空间噪声方差转化为"桶内预测率 vs 桶内实际行为率"的可统计量,使双侧共享同一套噪声参数在工业系统中真正可行。
- 工业验证:在数亿 DAU 短视频平台上,DrEM 作为不改骨干结构的插件在 EMER/EASQ 两个生产级骨干上一致有效,7 天 5.1% 流量 A/B 全指标统计显著($p < 0.005$),且推理期零额外开销。
与已归档相关工作的对比¶
UAME UAME: Uncertainty as Remedy — Mitigating Satisfaction Label Bias in Short Video Multi-Objective Ensemble Ranking(Kuaishou Technology, 2026-07-19)¶
关系:显式引用但原文未展开对比(仅在引言 pxtr 双重角色处以引文号 [20] 一笔带过,既未进 related work 正文讨论、也未作为 baseline 进入实验表)· 已加载对方精读
-
共同关注的问题:两篇的 root cause 完全同构——工业短视频端到端多目标融合排序中,作为满意度代理的 pxtr 信号本身不可靠,而现有方法隐式地把它当作可靠监督、用等权 pairwise 损失优化,导致优化目标系统性偏离真实满意度。两篇甚至用同一套语言描述这个缺陷:UAME 称之为"固有的满意度标签偏差(satisfaction label bias)",DrEM 称之为"pxtr 预测噪声导致的代理偏序翻转"。两篇的作者团队高度重叠(Tiantian He、Xiaoxiao Xu、Kaiqiao Zhan 同时出现在两篇上),骨干也完全一样(EMER + EASQ),平台同为数亿 DAU 的快手短视频系统。
-
相近的技术骨架:两篇的数学核心是同一个高斯 CDF 表达式。UAME 的 pairwise 排序概率是 $P(\hat{y}_i > \hat{y}_j) = \Phi\big((\mu_i - \mu_j)/\sqrt{\sigma_i^2 + \sigma_j^2}\big)$,DrEM 的翻转概率是 $\hat{\varepsilon}_{ij} = \Phi\big(-(z_i - z_j)/\sqrt{\sigma_i^2 + \sigma_j^2}\big)$——形式上互为补概率,都是"均值差被两个方差之和归一化后过标准正态 CDF"。两篇也都用它驱动一个 pair 级的损失重加权,都强调线上服务零额外延迟、都用 GAUC 作离线主指标、都在 EMER/EASQ 上做双骨干 7 天 A/B。
-
本文的差异与推进:决定性差异在于"方差从哪来、加权往哪走"。
- 方差来源:UAME 的 $\sigma_i^2$ 是排序模型自己学出来的第二个输出头(权重共享双分支 MLP,隐式由概率化 pairwise loss 监督 + 辅助约束损失显式对齐"pxtr 排名标准差"),刻画的是下游模型对该样本的预测不确定性;DrEM 的 $\sigma_i^2$ 是从线上后验行为反解出来的上游模型噪声方差(定理 3 的分桶 probit 估计,$\hat{\sigma}_k^2 = \lambda^{-2}[(\Phi^{-1}(\mathbb{E}[p])/\Phi^{-1}(\mathbb{E}[y]))^2 - 1]$),刻画的是上游多任务模型自身的预测误差。前者是模型内生的、需要学;后者是数据外生的、可以统计。
- 加权方向相反:UAME 把高不确定 pair 升权($\omega_{ij} = \gamma \cdot \text{minmax}(U_{ij})$),理由是高冲突 pair 承载更大标签偏差、更值得优化;DrEM 则用 $\hat{\varepsilon}_{ij}$ 把反向损失项减掉,本质是对高翻转概率 pair 的原始监督降低信任并做符号级纠偏。同一个 $\Phi(\cdot/\sqrt{\sigma_i^2+\sigma_j^2})$,UAME 读作"这个 pair 有多值得学",DrEM 读作"这个 pair 的标签有多可能是错的"——这是两种截然不同的因果解读。
- 覆盖面:UAME 是纯监督侧方法(不确定性只进损失权重,输入特征不动);DrEM 明确指出 pxtr 还是输入特征,补上了 UAME 完全没有的特征侧(保序过滤的扰动一致性正则),并在消融中量化了两侧的可加性。从这个角度看,UAME 落在 DrEM 归纳的"只覆盖一侧"批评之内。
-
理论落点不同:UAME 的理论是"排序风险分解 $R = R_{proxy} + \Delta_{proxy}$ + 不确定性与代理偏差期望正相关",结论是加权合理;DrEM 的理论是"稳健损失系数 $c(\hat{\varepsilon})$ 单调",结论是纠偏在估计不准时仍严格更优。DrEM 的保证更强(给出了安全区间 $(0,1/2)$),UAME 的假设更弱但结论也更软(只到"期望正相关")。
-
可比的方法/实验差异:两篇的绝对数值不可直接对齐——UAME 在未扰动的原始评估集上报 GAUC(EMER Base pctr 0.706),DrEM 在注入 $\alpha=1.0$ 高斯扰动的评估集上、以未扰动 pxtr 次序为参考报 GAUC(EMER Base pctr 0.6530),协议不同;任务集也不同(UAME 8 个含 pcpr,DrEM 7 个不含)。超参也有分歧:同样"following EMER"的 emb 32/8,UAME 用 Adagrad + lr 0.001,DrEM 用 Adam + lr $5\times10^{-6}$。线上 A/B 侧,两篇都在 5% 量级流量跑 7 天、都是稀疏交互指标增益远大于时长类指标(UAME:Forward +1.325%/+1.598%、LT7 仅 +0.009%/+0.015%;DrEM:Comment +1.388%/+0.178%、LT7 +0.017%/+0.020%),并且都观察到 EASQ 上的边际增益小于 EMER,且都用同一句解释——EASQ 的问卷监督已经吃掉了一部分标签偏差/监督噪声。两篇合起来构成一条清晰的团队研究线:先用模型自学的不确定性做样本加权(UAME),再用从后验反推的上游噪声做双侧风险纠偏(DrEM)。遗憾的是 DrEM 未把 UAME 纳入 baseline,两者的直接高下无从判断。
讨论与局限性¶
核心贡献与借鉴价值。DrEM 最值得借鉴的是它把一个含糊的工程直觉("上游分不准,下游会被带偏")完整地形式化成了可计算的量:假设 1 给出噪声的函数形式 → 定理 3 让方差可从日志统计 → 定理 2 让方差变成 pair 级翻转概率 → 定理 1 让翻转概率变成有安全保证的损失系数。这条链路上每一环都是闭式的、无需额外模型,也没有引入新的可训练参数,这是它能作为插件挂在生产骨干上的根本原因。双侧共享同一套噪声参数的设计尤其干净——它避免了"监督侧按一个尺度去噪、特征侧按另一个尺度扰动"的目标错位,是本文相对既有单侧方法最有结构性的推进。工程上,把额外成本完全压到训练侧(多一次 forward)、推理侧零开销,也是典型的工业友好取舍。
局限与争议:
- 假设 1 是全部理论的地基,但它没有被验证。 "logit 空间可加零均值高斯 + item 间独立"是一个相当强的假设:真实的多任务模型输出在同一 item 的不同 pxtr 之间几乎必然相关(它们共享 backbone),同一请求的不同 item 之间也可能因共享用户表示而相关。论文给的辩护是"契合参数模型的渐近正态性 / 复杂模型近似正态的残差",但没有在自己的数据上做任何正态性或独立性的经验检验(例如残差 QQ 图、跨 pxtr 的残差相关矩阵),这是理论链条上最薄弱的一环。
- 定理 3 的两个极限条件在实践中互相冲突。 估计式要求 $|B_k| \to \infty$(桶内样本足够多)且 $\mathrm{diam}(B_k) \to 0$(桶足够窄),这两个条件在有限数据下是直接矛盾的;论文既没给分桶的具体粒度/数量,也没给估计出的 $\hat{\sigma}^2$ 的分布或稳定性分析。此外 $\mathbb{E}_{B_k}[y_i]$ 的估计本身会受曝光偏差污染——只有被曝光的 item 才有后验行为 $y_i$,而曝光正是由排序分决定的,这里存在一个未被讨论的反馈回路。
- "完整 DrEM 未必最优"没有被正面处理。 Table 1 中至少三处出现单侧变体反超完整方法:EMER 上 DrEM:S 的 pwtr(.6936 vs DrEM 的 .6871,差距 0.0065 并不算小)、DrEM:F 的 pctr(.6570 vs .6563)与 plvtr(.6877 vs .6876),EASQ 上 DrEM:S 的 pcmtr(.6673 vs .6661)。论文用"两侧互补、增益可加"作总结,但没有解释这些反例——尤其 pwtr 上的差距提示两侧在某些任务上可能存在相互干扰(例如特征侧扰动本身会制造新的偏序翻转,与监督侧的纠偏目标未必协同)。
- $\lambda_{\mathrm{cons}}$ 的敏感性分析缺失。 论文只说在 $\{0.1, 0.3, 0.6\}$ 中调优,既没报最终取值,也没给敏感性曲线;考虑到一致性正则可能压过主排序损失(论文自己承认这个风险),这个缺失让方法的可复现性打了折扣。
- 扰动评估协议与训练目标存在同源性。 离线评估用高斯扰动构造评估集,而 DrEM 的特征侧训练也正是从高斯噪声中采样扰动——评估噪声与训练假设同分布,等于在"自己假设正确"的条件下测自己,天然对 DrEM 有利,对假设不同的 baseline(如 LSPR 的全局尺度扰动)则未必公平。真正的检验应当是在非高斯或异分布扰动下比较。
- 评估全部依赖内部数据,且缺少最相关的 baseline。 论文自己论证了公开数据集因缺 pxtr 而不可用(这个论证是站得住的),但也因此完全无法外部复现。更明显的缺口是:同团队、同骨干、同平台、数学骨架高度重合的 UAME [20] 只被列为一个引文号,既未在 related work 中讨论也未进 baseline 表——这使得"DrEM 相对最接近的现有工作有多少净增益"这个最关键的问题在论文里没有答案。
- 收益量级需要按工业标准解读。 LT7 仅 +0.017%/+0.020%、App Stay Time +0.116%/+0.124%,绝对值都很小;增益主要集中在基数较小的交互类指标(Follow/Comment)。这在成熟大盘中是常态,但也意味着"缓解 pxtr 预测噪声"对核心时长指标的实际撬动有限。