← Back to list
OrDA

OrDA: Orthogonal Disentanglement of Access Habits Framework for Homepage Marketing Block Recommendations

判别式推荐 Ant Group
Abstract 7 │ Reading 6 │ Rating —
2026-07-15
Lingxiao Zhang, Xiaobo Li, Tao Xu
Ant Group
OrDA(蚂蚁芝麻)针对首页营销位『习惯性伪正样本』偏差,用门控双塔+余弦正交正则把用户内容兴趣与访问习惯在表示空间强制解耦,推理时以 do(H=0) 加性置零剥离习惯分量,线上 UCTR +5.64%。
评分原因
摘要评分:工业界真实部署(芝麻首页营销位线上 A/B +5.64% UCTR),针对营销位伪正样本偏差用正交解耦 + 因果干预,思路清晰但方法创新偏中等(正交正则 + do-calculus 组合),有工业验证故置于精读门槛。
精读评分:工业界真实全量部署(芝麻首页营销位租物专区,线上 A/B UCTR +5.64%),提出并形式化了『访问习惯偏差』这一新视角,加性 logit 融合 + do(H=0) 推理干预的组合优雅且工程零成本。但方法均由成熟积木(正交正则/do-calculus/ESMM双塔/MaskNet)组合而成,创新度中等,实验为5页短文、单场景、超参未搜、A/B仅一周,故给6分。
industrial multi-task feature-interaction

OrDA:用正交解耦 + 因果干预剥离"访问习惯偏差"的首页营销位推荐框架

Ant Group(蚂蚁集团,芝麻信用 Zhima),5 页工业短文,arXiv 2607.13420。面向支付宝/芝麻 App 首页营销位(Homepage Marketing Block) 的点击率预估,提出 OrDA(Orthogonal Disentanglement of Access habits)——通过双塔 + 正交正则把"用户对内容的真实兴趣"与"用户的访问习惯惯性"在表示空间强制解耦,并在推理阶段用 do-calculus 因果干预剥离习惯分量,只用净化后的兴趣分打分排序。线上 A/B 在芝麻"租物专区(rent-floor)"营销位取得 UCTR +5.64%。


1. 研究动机与背景

1.1 问题现象:首页营销位的"习惯性伪正样本"

一个互联网 App 的首页(Homepage)承担两个核心功能:精准导航(把用户送到目标页)和生态分发(把海量流量分配到不同垂直子场景)。首页营销位(Homepage Marketing Blocks)(图 1 中间的 "Marketing Block")就是承担生态分发角色的关键坑位——它引导巨大的用户流量流向不同的垂直子场景(如"租物专区")。

Figure 1: A demo of Zhima homepage marketing block recommendation

论文指出,这些营销位上的点击行为受双重机制(dual-mechanism)驱动:

  • 内容兴趣(content interest):用户对营销位所展示物料内容的真实偏好;
  • 访问习惯(access habit):用户在其主要访问通道(primary access channel)里形成的导航惯性(navigational inertia)。

问题在于:在显眼的营销位上——尤其是被"重度用户(heavy users)"作为日常数字旅程一部分而频繁访问的坑位——观测到的点击数据往往被 "伪正样本(Pseudo-Positives)" 污染。这类交互不是源于用户兴趣与物料内容的真实对齐,而仅仅是用户在其主访问通道内的习惯惯性导致的。作者把这种因位置优势掩盖了物料真实质量而产生的现象称为 "习惯性红利(habitual dividend)"。

1.2 因果视角下的根因:习惯是一个混淆变量(confounder)

从因果角度看,用户的通道亲和度(channel affinity) 是一个混淆因子(confounder):它单纯因为某些内容占据了用户的"最省力路径(path of least resistance)",就人为抬高了这些内容的感知效用(perceived utility)。

标准模型(standard models)把所有点击都当作等价的偏好信号,会误把这种"习惯红利"当成真实兴趣捕获进来,导致对用户兴趣的表示产生扭曲。其直接后果是:

  • 标准模型在冷启动用户(cold-start users) 上表现很差;
  • 无法泛化到更广的、非习惯性(non-habitual) 的上下文,因为它们分辨不出"跨通道访问习惯"与"用户-内容兴趣"。

作者据此把这个问题定义为一类新的偏差——习惯诱导偏差(habit-induced bias / access-habit bias),明确区别于传统的曝光偏差(exposure bias) / 位置偏差(position bias)。

1.3 三条主要贡献

  1. 问题建模(Problem Formulation of Access Habit Bias):首次形式化定义了首页营销位场景下的"习惯诱导伪正样本"——用户在主入口的导航惯性掩盖了真实内容偏好,提出偏差分析的新视角。
  2. 正交解耦架构(OrDA):多塔架构,通过正交正则化(orthogonal regularization) 把用户意图(intent)从习惯性访问模式(habitual access pattern)中解耦,并用 do-calculus 干预策略在推理时剥离习惯分量。
  3. 工业级效果:在芝麻首页营销位的大规模离线数据上达到 SOTA;线上 A/B 在"租物专区(rent-floor)"取得 UCTR +5.64%。

2. 相关工作

2.1 推荐系统去偏(Debiasing)

传统去偏方法主要包括:

  • 倾向性方法(propensity_based method):按曝光概率对样本重加权(如位置偏差感知的 PAL[3]);
  • 对偶学习(dual learning)[12,14,19]:训练一个辅助模型来估计偏差;
  • 解耦表示学习(disentangled representation learning)[16,17]:用对比学习分离"兴趣"与"从众(conformity)"——即 DICE 系列(WWW'21 "Disentangling User Interest and Conformity for Recommendation with Causal Embedding");
  • 伪标签方法(pseudo-label method)[4]:给未观测项赋估计标签来补全反事实空间。

OrDA 的差异:专门聚焦首页场景下的访问习惯,并且用几何正交约束(geometric orthogonal constraint) 强制一个清晰的因果边界,而不是简单的分值调整(score adjustment),从而保证对用户内在兴趣更鲁棒的表示。

2.2 多塔架构与因果推断的协同

多塔模型(ESMM[7]、MMOE[6]、PLE[9])在工业推荐里被广泛用于处理多任务,它们为任务/特征分解提供了结构基础[11,14,15,19]。但从因果角度看,传统多塔的一个显著局限是特征干扰(feature interference):由于各塔往往共享一个公共 embedding 底座,一个有偏信号(如访问习惯)的梯度会轻易污染(contaminate) 其它塔(如内容兴趣)的表示。

OrDA 的工作把这种结构分解往前推进一步:把多塔拓扑重新解释为一个结构因果模型(Structural Causal Model, SCM)的物理实现。


3. 方法

3.1 问题定义与因果图

为刻画"习惯诱导伪正样本"机制并给 OrDA 的架构提供正当性,作者用一张因果图描述首页营销位的数据生成过程,定义如下变量:

  • X:用户-内容对(user-content pair);
  • H:潜在的导航惯性 / 访问习惯偏差(access-habit bias);
  • I:用户对内容的潜在兴趣(interest);
  • Y:观测到的点击结果(click outcome);
  • u:用户特征(如人口统计学偏好 demographics);
  • c:内容特征(如类目、质量);
  • u2c:用户对内容的统计特征(user-to-content statistics)。

作者把"用户-通道访问习惯"与"用户-内容兴趣"定义为支配营销位点击行为的两个主因子。两个潜在空间的结构方程为:

$$ \begin{cases} I = f_I(u, c, u2c),\\ H = f_H(u). \end{cases} \tag{1} $$

其含义:兴趣 $I$ 由用户、内容、用户对内容的统计三者共同决定;访问习惯 $H$ 只由用户特征 $u$ 决定(一个用户是否有"进 App 就点第一个坑位"的惯性,只跟这个人有关,与具体展示什么内容无关)。目标是从混淆中拿到纯净的用户内容兴趣。

Figure 2: Causal graphs depicting training of ESMM-based Approach, Propensity-based Approach, OrDA. Hollow circles indicate latent variables, and shaded circles indicate observed variables.

图 2 用三张因果图对比了三种路线(空心圆=潜变量,实心圆=观测变量):

(a) ESMM-based 方法[7](图 2a):用两个塔分别预测访问习惯概率 $P(\hat h)=\sigma(H)$ 和用户-内容兴趣概率 $P(\hat i)=\sigma(I)$,再把两者相乘得到习惯诱导的用户兴趣概率 $P(\hat y)=\sigma(Y)$:

$$ P(\hat y) = P(\hat h)\cdot P(\hat i). \tag{2} $$

该方法不强制两塔之间清晰的因果边界或关系,因此引入了一个错误的"独立先验(false independent prior)"(即假设习惯与兴趣独立可乘,实则二者在共享底座上耦合)。

(b) 倾向性方法(Propensity-based)[11,14,15,19](图 2b):把反事实推理(counterfactual reasoning)引入多任务学习,用逆倾向加权(inverse propensity weighting, IPW) + do-calculus[10] 来缓解选择偏差。习惯诱导的用户兴趣概率定义为:

$$ P(\hat y) = P(\hat h)\cdot P\!\left(\hat i\,\middle|\,do(\hat h = 1)\right). \tag{3} $$

训练阶段它再加一个塔来预测习惯诱导的兴趣概率 $P(\hat i\mid do(\hat h=1)) = \dfrac{P(\hat y)}{P(\hat h)}$。问题:这种依赖数值重加权的除法形式会带来高方差和不稳定($P(\hat h)$ 很小时分母爆炸)。

(c) OrDA(图 2c):把因果哲学从"概率层"提升到表示层(representation level),扩展为:

$$ Y = H \oplus I, \tag{4} $$

其中 $\oplus$ 表示联合 logit 融合(joint logit fusion),代表用户-内容内在兴趣与其访问习惯在潜空间上的加性交互(additive interaction)。模型的核心假设是:$I$ 和 $H$ 是平行的因果驱动,一次点击发生在"内容满足了用户兴趣" 或(or) "坑位触发了用户访问习惯"时。因此作者施加 潜在正交约束(Latent Orthogonal Constraint),保证兴趣塔对习惯混淆因子天然不变(inherently invariant)。

3.2 训练与反事实推理

训练阶段定义两个损失——有偏 CTR 损失和习惯损失:

$$ \begin{cases} \mathcal{L}_{bCTR} = \mathcal{L}_{BCE}(y, \sigma(Y)) = \mathcal{L}_{BCE}(y, \sigma(H \oplus I)),\\ \mathcal{L}_{Habit} = \mathcal{L}_{BCE}(y, \sigma(H)), \end{cases} \tag{5} $$

其中 $\mathcal{L}_{BCE}$ 是二元交叉熵:

$$ \mathcal{L}_{BCE} = -\frac{1}{N}\sum_{i=1}^{N}\big[y_i \log(p_i) + (1-y_i)\log(1-p_i)\big], \tag{6} $$

$y$ 是 ground truth,$p$ 是正类概率。

关键设计——正交正则(Orthogonal Regularization)[1,5]:为保证严格分离,约束潜在流形,强制兴趣向量与习惯向量在几何上垂直:

$$ \mathcal{L}_{Orth} = \left(\frac{\mathbf{v}_{int}\cdot \mathbf{v}_{hab}}{\|\mathbf{v}_{int}\|\cdot\|\mathbf{v}_{hab}\|}\right)^2, \tag{7} $$

即兴趣塔向量 $\mathbf{v}_{int}$ 与习惯塔向量 $\mathbf{v}_{hab}$ 的余弦相似度平方——最小化它就是把两向量的夹角逼向 90°。用平方形式保证对正负相关都惩罚且梯度光滑。总损失为:

$$ \mathcal{L}_{total} = \mathcal{L}_{bCTR} + \alpha\cdot \mathcal{L}_{Habit} + \beta\cdot \mathcal{L}_{Orth}, \tag{8} $$

$\alpha, \beta$ 是控制习惯任务权重与正交任务权重的超参。

在线推理阶段的因果干预:对习惯变量做 do-calculus 干预以消除伪正样本效应。形式上,通过施加 $do(H=0)$ 计算净化后的用户-内容兴趣分 $S$:

$$ S = \mathbb{E}[Y \mid I, do(H=0)] = \sigma(I). \tag{9} $$

这是全文最漂亮的一步:因为 $Y = H \oplus I$ 是加性 logit 融合,把 $H$ 塔的 logit 强制置零($do(H=0)$,即 $logit_{hab}=0$)就能无缝地、代数地把习惯分量从打分里摘掉,直接得到 $\sigma(I)$——纯净兴趣分。排序只用 $S$。相比倾向性方法的除法(式 3),这里的减法/置零操作没有方差爆炸风险。

3.3 模型架构

Figure 3: Model architecture of OrDA. The entire components are used for the training stage, while components within the blue box are used for the online inference stage.

如图 3,OrDA 由三个核心组件构成:门控分配层(Gated Allocation Layer, GAL)、主干模型(Backbone Model, BM)、因果融合层(Causal Fusion Layer, CFL)。整个网络用于训练;蓝框内组件(兴趣塔 + $do(H=0)$)用于在线推理。

3.3.1 门控分配层(GAL)

解耦学习的一个潜在陷阱是信息压抑(information suppression):正交约束可能无意中把共享 embedding 里的通用用户信号也一起抹掉。为此引入 GAL 作为可学习路由器(learnable router),避免所有特征无差别地流入两个塔。

对输入 embedding $\mathbf{e}_i\in\mathbb{R}^d$,GAL 用 sigmoid 门控网络算一个路由分 $gate_i\in[0,1]$:

$$ gate_i = \sigma(\mathbf{w}_g^\top \mathbf{e}_i + b_g). \tag{10} $$

特征被自适应分配到两条不同的潜在流:

$$ \begin{cases} \mathbf{e}_{u,hab} = gate_A \cdot \mathbf{e}_u,\\ \mathbf{e}_{u,int} = gate_B \cdot \mathbf{e}_u. \end{cases} \tag{11} $$

其中 $gate_A$ 用于习惯塔、$gate_B$ 用于兴趣塔。注意 GAL 只作用在用户特征上——因为(§1 的假设)用户-通道访问习惯只由用户特征决定。这一机制保证正交约束只压抑冗余的干扰信号,同时允许多面向的信号(如用户人口统计学)通过不同投影同时存在于两个流形中。

3.3.2 主干模型(BM)

主干是一个正交双塔,把两条特征流分别喂给习惯塔 $\mathcal{F}_{hab}$ 和兴趣塔 $\mathcal{F}_{int}$,各自把过滤后的特征投影到各自的潜流形:

$$ \begin{cases} \mathbf{v}_{hab} = \mathcal{F}_{hab}(\mathbf{e}_{u,hab}),\\ \mathbf{v}_{int} = \mathcal{F}_{int}(\text{concat}(\mathbf{e}_{u,int}, \mathbf{e}_c, \mathbf{e}_{u2c})), \end{cases} \tag{12} $$

其中 $\mathbf{e}_c$、$\mathbf{e}_{u2c}$ 分别是内容特征与 user2content 特征的 embedding。$\mathcal{F}_{hab}$ 只处理用户特征(呼应式 1 中 $H=f_H(u)$);兴趣塔则融合用户、内容、u2c 三路(呼应 $I=f_I(u,c,u2c)$)。

为落实因果图里理论化的解耦,施加正交约束(式 7)保证 $\mathbf{v}_{int}\perp\mathbf{v}_{hab}$,把内容驱动信号与习惯驱动信号推入互不重叠的维度。

3.3.3 因果融合层(CFL)

最后一步是两塔的结构性组合。遵循因果图的加性形式(式 4),两塔的 logit 通过 $\oplus$ 相加:

$$ logit_{all} = logit_{hab}\oplus logit_{int} = \text{MLP}_{CFL}(\mathbf{v}_{hab}) + \text{MLP}_{CFL}(\mathbf{v}_{int}), \tag{13} $$

$\oplus$ 是联合 logit 融合,表示"内容相关性的拉力(pull)"($logit_{int}$)与"首页惯性访问模式的推力(push)"($logit_{hab}$)的叠加(superposition)。$\text{MLP}_{CFL}(\cdot)$ 是把向量映射到 logit 空间的映射函数;为保证两塔在 logit 空间的隔离与可加性,CFL 用 linear 作为激活函数(线性激活才能让 $do(H=0)$ 干净地对应 logit 相减/置零)。合并 logit 过 sigmoid 得最终点击概率:

$$ P(\hat y) = \sigma(logit_{all}). \tag{14} $$

训练时 $logit_{int}$ 与 $logit_{hab}$ 同时优化去拟合观测点击标签;推理时 $\oplus$ 允许通过令 $logit_{hab}=0$(式 9)无缝移除习惯分量,得到净化后的兴趣分。


4. 实验

4.1 实验设置

  • 数据集:芝麻(Zhima)首页营销位的大规模生产数据(15 天采集),> 30.2M 用户,108.9M 训练样本,7.9M 评估样本。
  • Baselines:
  • BASE:无去偏组件的标准模型;
  • ESMM[7]:多任务多塔模型;
  • USD[15]:倾向性/双去偏(user-intent-driven & dual-debiasing)模型;
  • Multi-IPW[14]:多任务逆倾向加权;
  • PAL[3]:位置偏差感知的分解式 CTR 模型。

  • 实现细节:兴趣塔 $\mathcal{F}_{int}$ 用 MaskNet[13],习惯塔 $\mathcal{F}_{hab}$ 用 MLP(式 12)。Adam 优化器,lr=1e-4,batch size=2048,损失权重 $\alpha=\beta=1$(式 8)。

  • 主指标 GAUC[18](分组 AUC,缓解类别不平衡):$\text{GAUC} = \dfrac{\sum_{u\in U} w_u\times \text{AUC}_u}{\sum_{u\in U} w_u}$,取 $w_u=1$。分三组:
  • $\text{GAUC}_{all}$:全体用户;
  • $\text{GAUC}_{cold}$:冷启动用户组(点击数 ≤1);
  • $\text{GAUC}_{active}$:活跃用户组(点击数 >1)。

4.2 总体性能对比

Table 1:生产数据上的性能对比

Model GAUC_all GAUC_cold GAUC_active
BASE 0.6122 0.6110 0.6497
ESMM 0.6299 0.6297 0.6366
USD 0.6241 0.6236 0.6401
Multi-IPW 0.6315 0.6314 0.6360
PAL 0.6314 0.6313 0.6345
OrDA 0.6412 0.6416 0.6304

结论分析(why,不只是 what):

  • BASE 在 $\text{GAUC}_{active}$ 上最高(0.6497)、在 $\text{GAUC}_{cold}$ 上最低(0.6110):这不是"BASE 好",恰恰印证了论文的核心论点——BASE 倾向于"记住"活跃用户长期、可预测的访问习惯,把这些习惯当成强正信号(如"用户永远进 App 就点第一个坑位"),因此在 active 组刷高分;但它没理解真正的用户-内容兴趣,一到 cold 组(没有习惯历史可背)就崩。
  • 所有去偏模型(含 OrDA)在 $\text{GAUC}_{cold}$ 上都更高:因为它们剥掉了"习惯噪声",学到的是可迁移的兴趣。
  • OrDA 在 $\text{GAUC}_{cold}$(0.6416)和 $\text{GAUC}_{all}$(0.6412)上都最优,同时 $\text{GAUC}_{active}$ 最低(0.6304)——这正是"去偏彻底"的应有代价与体现:OrDA 最不依赖习惯记忆,付出的是 active 组(充满习惯性点击)的 AUC,换来的是全局与冷启的泛化。这与工业目标(拉动生态分发、提升非习惯性场景效用)一致。

4.3 消融实验

Table 2:OrDA 消融

Model GAUC_all GAUC_cold GAUC_active
w/o GAL 0.6099 0.6108 0.5977
w/o HL 0.6344 0.6348 0.6234
w/o OL 0.6313 0.6311 0.6393
w/o doC 0.6237 0.6235 0.6313
OrDA 0.6412 0.6416 0.6304

逐项分析($\text{GAUC}_{all}$ 相对 OrDA 的降幅):

  • w/o GAL(移除门控分配,换成标准 shared-bottom)→ $\text{GAUC}_{all}$ 0.6099,降幅最大。作者归因于信息蒸发效应(information evaporation):严格的正交约束在没有 GAL 路由保护时,会把所有用户 embedding 逼向零或随机噪声(因为共享底座的通用信号也被正交惩罚抹掉)。说明 GAL 是让正交约束"只杀干扰、不杀通用信号"的关键护栏。
  • w/o HL(移除习惯辅助损失,$\alpha=0$)→ 0.6344:习惯塔失去监督,$do(H=0)$ 摘掉的东西不再是"习惯",解耦退化。
  • w/o OL(移除余弦正交正则,$\beta=0$)→ 0.6313,但 $\text{GAUC}_{active}$ 反而回升到 0.6393:没有正交约束时,兴趣塔与习惯塔重新耦合,模型又开始"背习惯",于是 active 组分数回涨——从反面证明了正交约束确实在剥离习惯信号。
  • w/o doC(推理时不做因果干预,直接用原始 $logit_{int}\oplus logit_{hab}$ 排序)→ 0.6237(降 2.72%,$\text{GAUC}_{all}$ 上降幅最大):不摘掉习惯 logit 就等于把伪正样本效应带进排序,验证了 do-calculus 干预(式 9)是把"训练时学到的解耦"变现为"推理时净化打分"的必要一环。

三项组件(GAL / HL / OL / doC)在 $\text{GAUC}_{all}$ 上分别造成 1.06%、1.54%、2.72% 等量级下降(原文表述),共同支撑 OrDA 的完整性。

4.4 潜空间可视化

Figure 4: Visualizing the orthogonality between interest and habit vectors. The color of the heatmap is predominantly white/light, indicating that the cosine similarity values are concentrated around 0.

为定量+可视化地评估解耦程度,作者在评估集的一个随机子集上计算兴趣向量 $\mathbf{v}_{int}$ 与习惯向量 $\mathbf{v}_{habit}$ 的余弦相似度矩阵(图 4)。热力图在对角线(同样本 intra-sample) 和非对角(跨样本 inter-sample) 元素上都呈近零分布(整张图以白/浅色为主,色标范围仅 ±0.0003 量级),表明两个向量空间被约束成互相正交——解耦既是样本级一致的(sample-wise consistent),也是全局鲁棒的(globally robust)。

4.5 线上 A/B 测试

在芝麻首页营销位 "租物专区(rent-floor)" 上跑了为期一周的线上 A/B。OrDA 相比线上基线(即 §4.1.2 的 BASE)UCTR(用户点击率)提升 5.64%。作者强调这一显著增益证明了 OrDA 的工业可用性。OrDA 已全量部署(fully deployed) 在芝麻首页营销位的租物专区推荐中。


5. 核心贡献总结

  1. 提出并形式化一类新偏差——访问习惯偏差(access-habit bias):区别于位置/曝光偏差,指出首页营销位的"习惯性伪正样本"由用户主入口导航惯性(一个只依赖用户的混淆因子 $H=f_H(u)$)产生,掩盖了物料真实质量。
  2. 把因果去偏从"概率层"抬到"表示层":用加性 logit 融合 $Y=H\oplus I$ 建模,配合余弦正交正则强制兴趣/习惯向量几何垂直,避免了倾向性方法除法重加权的高方差问题。
  3. 推理时 do-calculus 干预 $do(H=0)$ 的代数优雅性:因为融合是加性的,置零习惯 logit 即可无缝得到纯净兴趣分 $\sigma(I)$,工程上零额外代价、零方差风险。
  4. GAL 门控路由解决解耦副作用(信息蒸发):只对用户特征做自适应分配,让正交约束"只杀干扰不杀通用信号",消融证明其为最关键组件。
  5. 真实工业验证:>30M 用户生产数据 SOTA + 线上 A/B UCTR +5.64% + 全量部署。

6. 讨论与局限性

值得借鉴的设计:

  • "加性 logit 融合 + do 置零"的组合拳 是本文最巧的地方。相比 ESMM 的乘性(式 2,引入错误独立先验)和倾向性方法的除性(式 3,方差爆炸),加性结构让"训练时联合拟合、推理时代数摘除混淆"变得既稳定又零成本。任何做"多因子点击 = 真实偏好 + 某种可剥离偏差"的场景(位置偏差、诱导偏差、榜单曝光偏差等)都可复用这套"加性建模 → 干预置零"范式。
  • GAL 对"解耦导致信息蒸发"的显式补救 是一个容易被忽视但工业上很实际的洞见:强正交/强解耦正则若无路由保护,会连带抹掉共享的通用信号(消融里 w/o GAL 掉到 0.6099,甚至低于 BASE 的 0.6122)。这提醒所有用正交/解耦正则的工作都要防"过度分离"。
  • GAUC 分 cold/active 三组看 是评估去偏是否"真去偏"而非"换个方式背历史"的好透镜:真正的去偏应当 cold 涨、active 掉。

局限与争议:

  • 方法组件均为成熟积木的组合:正交正则[1,5]、do-calculus[10]、双塔 ESMM[7]、MaskNet[13] 都是已有工作,OrDA 的创新在于问题定义 + 组合方式 + 加性融合带来的推理优雅性,而非单点新算法。属于"清晰而中等创新度"的工业实践论文。
  • $H=f_H(u)$ 的强假设:把"访问习惯只由用户特征决定"写死进架构(GAL/习惯塔只吃用户特征)。现实中习惯可能与时段、坑位位置、场景上下文耦合(如"晚上习惯性刷某类"),这个纯用户级假设可能过简,论文未做敏感性分析。
  • 实验广度有限(5 页短文):只在芝麻单一场景(营销位/租物专区)验证;$\alpha,\beta$ 直接取 1 未做超参搜索;A/B 仅一周单坑位。缺少对"净化后兴趣分是否真的更贴合长期用户价值/留存"的下游验证——GAUC 提升与业务长期收益的桥接留白。
  • 正交=独立? 余弦正交只保证线性不相关,不等于统计独立;习惯与兴趣间的高阶依赖仍可能残留。图 4 的近零热力图是必要非充分证据。

工业落地价值:论文的核心卖点就是工业落地——已全量部署于芝麻首页营销位"租物专区",线上 UCTR +5.64%。推理阶段只保留兴趣塔 + $do(H=0)$(图 3 蓝框),在线成本与普通单塔打分相当(习惯塔仅训练期存在),这是该方案能上线的关键工程优势:解耦的复杂度全压在训练侧,推理侧零负担。