OrDA:用正交解耦 + 因果干预剥离"访问习惯偏差"的首页营销位推荐框架¶
Ant Group(蚂蚁集团,芝麻信用 Zhima),5 页工业短文,arXiv 2607.13420。面向支付宝/芝麻 App 首页营销位(Homepage Marketing Block) 的点击率预估,提出 OrDA(Orthogonal Disentanglement of Access habits)——通过双塔 + 正交正则把"用户对内容的真实兴趣"与"用户的访问习惯惯性"在表示空间强制解耦,并在推理阶段用 do-calculus 因果干预剥离习惯分量,只用净化后的兴趣分打分排序。线上 A/B 在芝麻"租物专区(rent-floor)"营销位取得 UCTR +5.64%。
1. 研究动机与背景¶
1.1 问题现象:首页营销位的"习惯性伪正样本"¶
一个互联网 App 的首页(Homepage)承担两个核心功能:精准导航(把用户送到目标页)和生态分发(把海量流量分配到不同垂直子场景)。首页营销位(Homepage Marketing Blocks)(图 1 中间的 "Marketing Block")就是承担生态分发角色的关键坑位——它引导巨大的用户流量流向不同的垂直子场景(如"租物专区")。

论文指出,这些营销位上的点击行为受双重机制(dual-mechanism)驱动:
- 内容兴趣(content interest):用户对营销位所展示物料内容的真实偏好;
- 访问习惯(access habit):用户在其主要访问通道(primary access channel)里形成的导航惯性(navigational inertia)。
问题在于:在显眼的营销位上——尤其是被"重度用户(heavy users)"作为日常数字旅程一部分而频繁访问的坑位——观测到的点击数据往往被 "伪正样本(Pseudo-Positives)" 污染。这类交互不是源于用户兴趣与物料内容的真实对齐,而仅仅是用户在其主访问通道内的习惯惯性导致的。作者把这种因位置优势掩盖了物料真实质量而产生的现象称为 "习惯性红利(habitual dividend)"。
1.2 因果视角下的根因:习惯是一个混淆变量(confounder)¶
从因果角度看,用户的通道亲和度(channel affinity) 是一个混淆因子(confounder):它单纯因为某些内容占据了用户的"最省力路径(path of least resistance)",就人为抬高了这些内容的感知效用(perceived utility)。
标准模型(standard models)把所有点击都当作等价的偏好信号,会误把这种"习惯红利"当成真实兴趣捕获进来,导致对用户兴趣的表示产生扭曲。其直接后果是:
- 标准模型在冷启动用户(cold-start users) 上表现很差;
- 无法泛化到更广的、非习惯性(non-habitual) 的上下文,因为它们分辨不出"跨通道访问习惯"与"用户-内容兴趣"。
作者据此把这个问题定义为一类新的偏差——习惯诱导偏差(habit-induced bias / access-habit bias),明确区别于传统的曝光偏差(exposure bias) / 位置偏差(position bias)。
1.3 三条主要贡献¶
- 问题建模(Problem Formulation of Access Habit Bias):首次形式化定义了首页营销位场景下的"习惯诱导伪正样本"——用户在主入口的导航惯性掩盖了真实内容偏好,提出偏差分析的新视角。
- 正交解耦架构(OrDA):多塔架构,通过正交正则化(orthogonal regularization) 把用户意图(intent)从习惯性访问模式(habitual access pattern)中解耦,并用 do-calculus 干预策略在推理时剥离习惯分量。
- 工业级效果:在芝麻首页营销位的大规模离线数据上达到 SOTA;线上 A/B 在"租物专区(rent-floor)"取得 UCTR +5.64%。
2. 相关工作¶
2.1 推荐系统去偏(Debiasing)¶
传统去偏方法主要包括:
- 倾向性方法(propensity_based method):按曝光概率对样本重加权(如位置偏差感知的 PAL[3]);
- 对偶学习(dual learning)[12,14,19]:训练一个辅助模型来估计偏差;
- 解耦表示学习(disentangled representation learning)[16,17]:用对比学习分离"兴趣"与"从众(conformity)"——即 DICE 系列(WWW'21 "Disentangling User Interest and Conformity for Recommendation with Causal Embedding");
- 伪标签方法(pseudo-label method)[4]:给未观测项赋估计标签来补全反事实空间。
OrDA 的差异:专门聚焦首页场景下的访问习惯,并且用几何正交约束(geometric orthogonal constraint) 强制一个清晰的因果边界,而不是简单的分值调整(score adjustment),从而保证对用户内在兴趣更鲁棒的表示。
2.2 多塔架构与因果推断的协同¶
多塔模型(ESMM[7]、MMOE[6]、PLE[9])在工业推荐里被广泛用于处理多任务,它们为任务/特征分解提供了结构基础[11,14,15,19]。但从因果角度看,传统多塔的一个显著局限是特征干扰(feature interference):由于各塔往往共享一个公共 embedding 底座,一个有偏信号(如访问习惯)的梯度会轻易污染(contaminate) 其它塔(如内容兴趣)的表示。
OrDA 的工作把这种结构分解往前推进一步:把多塔拓扑重新解释为一个结构因果模型(Structural Causal Model, SCM)的物理实现。
3. 方法¶
3.1 问题定义与因果图¶
为刻画"习惯诱导伪正样本"机制并给 OrDA 的架构提供正当性,作者用一张因果图描述首页营销位的数据生成过程,定义如下变量:
- X:用户-内容对(user-content pair);
- H:潜在的导航惯性 / 访问习惯偏差(access-habit bias);
- I:用户对内容的潜在兴趣(interest);
- Y:观测到的点击结果(click outcome);
- u:用户特征(如人口统计学偏好 demographics);
- c:内容特征(如类目、质量);
- u2c:用户对内容的统计特征(user-to-content statistics)。
作者把"用户-通道访问习惯"与"用户-内容兴趣"定义为支配营销位点击行为的两个主因子。两个潜在空间的结构方程为:
$$ \begin{cases} I = f_I(u, c, u2c),\\ H = f_H(u). \end{cases} \tag{1} $$
其含义:兴趣 $I$ 由用户、内容、用户对内容的统计三者共同决定;访问习惯 $H$ 只由用户特征 $u$ 决定(一个用户是否有"进 App 就点第一个坑位"的惯性,只跟这个人有关,与具体展示什么内容无关)。目标是从混淆中拿到纯净的用户内容兴趣。

图 2 用三张因果图对比了三种路线(空心圆=潜变量,实心圆=观测变量):
(a) ESMM-based 方法[7](图 2a):用两个塔分别预测访问习惯概率 $P(\hat h)=\sigma(H)$ 和用户-内容兴趣概率 $P(\hat i)=\sigma(I)$,再把两者相乘得到习惯诱导的用户兴趣概率 $P(\hat y)=\sigma(Y)$:
$$ P(\hat y) = P(\hat h)\cdot P(\hat i). \tag{2} $$
该方法不强制两塔之间清晰的因果边界或关系,因此引入了一个错误的"独立先验(false independent prior)"(即假设习惯与兴趣独立可乘,实则二者在共享底座上耦合)。
(b) 倾向性方法(Propensity-based)[11,14,15,19](图 2b):把反事实推理(counterfactual reasoning)引入多任务学习,用逆倾向加权(inverse propensity weighting, IPW) + do-calculus[10] 来缓解选择偏差。习惯诱导的用户兴趣概率定义为:
$$ P(\hat y) = P(\hat h)\cdot P\!\left(\hat i\,\middle|\,do(\hat h = 1)\right). \tag{3} $$
训练阶段它再加一个塔来预测习惯诱导的兴趣概率 $P(\hat i\mid do(\hat h=1)) = \dfrac{P(\hat y)}{P(\hat h)}$。问题:这种依赖数值重加权的除法形式会带来高方差和不稳定($P(\hat h)$ 很小时分母爆炸)。
(c) OrDA(图 2c):把因果哲学从"概率层"提升到表示层(representation level),扩展为:
$$ Y = H \oplus I, \tag{4} $$
其中 $\oplus$ 表示联合 logit 融合(joint logit fusion),代表用户-内容内在兴趣与其访问习惯在潜空间上的加性交互(additive interaction)。模型的核心假设是:$I$ 和 $H$ 是平行的因果驱动,一次点击发生在"内容满足了用户兴趣" 或(or) "坑位触发了用户访问习惯"时。因此作者施加 潜在正交约束(Latent Orthogonal Constraint),保证兴趣塔对习惯混淆因子天然不变(inherently invariant)。
3.2 训练与反事实推理¶
训练阶段定义两个损失——有偏 CTR 损失和习惯损失:
$$ \begin{cases} \mathcal{L}_{bCTR} = \mathcal{L}_{BCE}(y, \sigma(Y)) = \mathcal{L}_{BCE}(y, \sigma(H \oplus I)),\\ \mathcal{L}_{Habit} = \mathcal{L}_{BCE}(y, \sigma(H)), \end{cases} \tag{5} $$
其中 $\mathcal{L}_{BCE}$ 是二元交叉熵:
$$ \mathcal{L}_{BCE} = -\frac{1}{N}\sum_{i=1}^{N}\big[y_i \log(p_i) + (1-y_i)\log(1-p_i)\big], \tag{6} $$
$y$ 是 ground truth,$p$ 是正类概率。
关键设计——正交正则(Orthogonal Regularization)[1,5]:为保证严格分离,约束潜在流形,强制兴趣向量与习惯向量在几何上垂直:
$$ \mathcal{L}_{Orth} = \left(\frac{\mathbf{v}_{int}\cdot \mathbf{v}_{hab}}{\|\mathbf{v}_{int}\|\cdot\|\mathbf{v}_{hab}\|}\right)^2, \tag{7} $$
即兴趣塔向量 $\mathbf{v}_{int}$ 与习惯塔向量 $\mathbf{v}_{hab}$ 的余弦相似度平方——最小化它就是把两向量的夹角逼向 90°。用平方形式保证对正负相关都惩罚且梯度光滑。总损失为:
$$ \mathcal{L}_{total} = \mathcal{L}_{bCTR} + \alpha\cdot \mathcal{L}_{Habit} + \beta\cdot \mathcal{L}_{Orth}, \tag{8} $$
$\alpha, \beta$ 是控制习惯任务权重与正交任务权重的超参。
在线推理阶段的因果干预:对习惯变量做 do-calculus 干预以消除伪正样本效应。形式上,通过施加 $do(H=0)$ 计算净化后的用户-内容兴趣分 $S$:
$$ S = \mathbb{E}[Y \mid I, do(H=0)] = \sigma(I). \tag{9} $$
这是全文最漂亮的一步:因为 $Y = H \oplus I$ 是加性 logit 融合,把 $H$ 塔的 logit 强制置零($do(H=0)$,即 $logit_{hab}=0$)就能无缝地、代数地把习惯分量从打分里摘掉,直接得到 $\sigma(I)$——纯净兴趣分。排序只用 $S$。相比倾向性方法的除法(式 3),这里的减法/置零操作没有方差爆炸风险。
3.3 模型架构¶

如图 3,OrDA 由三个核心组件构成:门控分配层(Gated Allocation Layer, GAL)、主干模型(Backbone Model, BM)、因果融合层(Causal Fusion Layer, CFL)。整个网络用于训练;蓝框内组件(兴趣塔 + $do(H=0)$)用于在线推理。
3.3.1 门控分配层(GAL)¶
解耦学习的一个潜在陷阱是信息压抑(information suppression):正交约束可能无意中把共享 embedding 里的通用用户信号也一起抹掉。为此引入 GAL 作为可学习路由器(learnable router),避免所有特征无差别地流入两个塔。
对输入 embedding $\mathbf{e}_i\in\mathbb{R}^d$,GAL 用 sigmoid 门控网络算一个路由分 $gate_i\in[0,1]$:
$$ gate_i = \sigma(\mathbf{w}_g^\top \mathbf{e}_i + b_g). \tag{10} $$
特征被自适应分配到两条不同的潜在流:
$$ \begin{cases} \mathbf{e}_{u,hab} = gate_A \cdot \mathbf{e}_u,\\ \mathbf{e}_{u,int} = gate_B \cdot \mathbf{e}_u. \end{cases} \tag{11} $$
其中 $gate_A$ 用于习惯塔、$gate_B$ 用于兴趣塔。注意 GAL 只作用在用户特征上——因为(§1 的假设)用户-通道访问习惯只由用户特征决定。这一机制保证正交约束只压抑冗余的干扰信号,同时允许多面向的信号(如用户人口统计学)通过不同投影同时存在于两个流形中。
3.3.2 主干模型(BM)¶
主干是一个正交双塔,把两条特征流分别喂给习惯塔 $\mathcal{F}_{hab}$ 和兴趣塔 $\mathcal{F}_{int}$,各自把过滤后的特征投影到各自的潜流形:
$$ \begin{cases} \mathbf{v}_{hab} = \mathcal{F}_{hab}(\mathbf{e}_{u,hab}),\\ \mathbf{v}_{int} = \mathcal{F}_{int}(\text{concat}(\mathbf{e}_{u,int}, \mathbf{e}_c, \mathbf{e}_{u2c})), \end{cases} \tag{12} $$
其中 $\mathbf{e}_c$、$\mathbf{e}_{u2c}$ 分别是内容特征与 user2content 特征的 embedding。$\mathcal{F}_{hab}$ 只处理用户特征(呼应式 1 中 $H=f_H(u)$);兴趣塔则融合用户、内容、u2c 三路(呼应 $I=f_I(u,c,u2c)$)。
为落实因果图里理论化的解耦,施加正交约束(式 7)保证 $\mathbf{v}_{int}\perp\mathbf{v}_{hab}$,把内容驱动信号与习惯驱动信号推入互不重叠的维度。
3.3.3 因果融合层(CFL)¶
最后一步是两塔的结构性组合。遵循因果图的加性形式(式 4),两塔的 logit 通过 $\oplus$ 相加:
$$ logit_{all} = logit_{hab}\oplus logit_{int} = \text{MLP}_{CFL}(\mathbf{v}_{hab}) + \text{MLP}_{CFL}(\mathbf{v}_{int}), \tag{13} $$
$\oplus$ 是联合 logit 融合,表示"内容相关性的拉力(pull)"($logit_{int}$)与"首页惯性访问模式的推力(push)"($logit_{hab}$)的叠加(superposition)。$\text{MLP}_{CFL}(\cdot)$ 是把向量映射到 logit 空间的映射函数;为保证两塔在 logit 空间的隔离与可加性,CFL 用 linear 作为激活函数(线性激活才能让 $do(H=0)$ 干净地对应 logit 相减/置零)。合并 logit 过 sigmoid 得最终点击概率:
$$ P(\hat y) = \sigma(logit_{all}). \tag{14} $$
训练时 $logit_{int}$ 与 $logit_{hab}$ 同时优化去拟合观测点击标签;推理时 $\oplus$ 允许通过令 $logit_{hab}=0$(式 9)无缝移除习惯分量,得到净化后的兴趣分。
4. 实验¶
4.1 实验设置¶
- 数据集:芝麻(Zhima)首页营销位的大规模生产数据(15 天采集),> 30.2M 用户,108.9M 训练样本,7.9M 评估样本。
- Baselines:
- BASE:无去偏组件的标准模型;
- ESMM[7]:多任务多塔模型;
- USD[15]:倾向性/双去偏(user-intent-driven & dual-debiasing)模型;
- Multi-IPW[14]:多任务逆倾向加权;
-
PAL[3]:位置偏差感知的分解式 CTR 模型。
-
实现细节:兴趣塔 $\mathcal{F}_{int}$ 用 MaskNet[13],习惯塔 $\mathcal{F}_{hab}$ 用 MLP(式 12)。Adam 优化器,lr=1e-4,batch size=2048,损失权重 $\alpha=\beta=1$(式 8)。
- 主指标 GAUC[18](分组 AUC,缓解类别不平衡):$\text{GAUC} = \dfrac{\sum_{u\in U} w_u\times \text{AUC}_u}{\sum_{u\in U} w_u}$,取 $w_u=1$。分三组:
- $\text{GAUC}_{all}$:全体用户;
- $\text{GAUC}_{cold}$:冷启动用户组(点击数 ≤1);
- $\text{GAUC}_{active}$:活跃用户组(点击数 >1)。
4.2 总体性能对比¶
Table 1:生产数据上的性能对比
| Model | GAUC_all | GAUC_cold | GAUC_active |
|---|---|---|---|
| BASE | 0.6122 | 0.6110 | 0.6497 |
| ESMM | 0.6299 | 0.6297 | 0.6366 |
| USD | 0.6241 | 0.6236 | 0.6401 |
| Multi-IPW | 0.6315 | 0.6314 | 0.6360 |
| PAL | 0.6314 | 0.6313 | 0.6345 |
| OrDA | 0.6412 | 0.6416 | 0.6304 |
结论分析(why,不只是 what):
- BASE 在 $\text{GAUC}_{active}$ 上最高(0.6497)、在 $\text{GAUC}_{cold}$ 上最低(0.6110):这不是"BASE 好",恰恰印证了论文的核心论点——BASE 倾向于"记住"活跃用户长期、可预测的访问习惯,把这些习惯当成强正信号(如"用户永远进 App 就点第一个坑位"),因此在 active 组刷高分;但它没理解真正的用户-内容兴趣,一到 cold 组(没有习惯历史可背)就崩。
- 所有去偏模型(含 OrDA)在 $\text{GAUC}_{cold}$ 上都更高:因为它们剥掉了"习惯噪声",学到的是可迁移的兴趣。
- OrDA 在 $\text{GAUC}_{cold}$(0.6416)和 $\text{GAUC}_{all}$(0.6412)上都最优,同时 $\text{GAUC}_{active}$ 最低(0.6304)——这正是"去偏彻底"的应有代价与体现:OrDA 最不依赖习惯记忆,付出的是 active 组(充满习惯性点击)的 AUC,换来的是全局与冷启的泛化。这与工业目标(拉动生态分发、提升非习惯性场景效用)一致。
4.3 消融实验¶
Table 2:OrDA 消融
| Model | GAUC_all | GAUC_cold | GAUC_active |
|---|---|---|---|
| w/o GAL | 0.6099 | 0.6108 | 0.5977 |
| w/o HL | 0.6344 | 0.6348 | 0.6234 |
| w/o OL | 0.6313 | 0.6311 | 0.6393 |
| w/o doC | 0.6237 | 0.6235 | 0.6313 |
| OrDA | 0.6412 | 0.6416 | 0.6304 |
逐项分析($\text{GAUC}_{all}$ 相对 OrDA 的降幅):
- w/o GAL(移除门控分配,换成标准 shared-bottom)→ $\text{GAUC}_{all}$ 0.6099,降幅最大。作者归因于信息蒸发效应(information evaporation):严格的正交约束在没有 GAL 路由保护时,会把所有用户 embedding 逼向零或随机噪声(因为共享底座的通用信号也被正交惩罚抹掉)。说明 GAL 是让正交约束"只杀干扰、不杀通用信号"的关键护栏。
- w/o HL(移除习惯辅助损失,$\alpha=0$)→ 0.6344:习惯塔失去监督,$do(H=0)$ 摘掉的东西不再是"习惯",解耦退化。
- w/o OL(移除余弦正交正则,$\beta=0$)→ 0.6313,但 $\text{GAUC}_{active}$ 反而回升到 0.6393:没有正交约束时,兴趣塔与习惯塔重新耦合,模型又开始"背习惯",于是 active 组分数回涨——从反面证明了正交约束确实在剥离习惯信号。
- w/o doC(推理时不做因果干预,直接用原始 $logit_{int}\oplus logit_{hab}$ 排序)→ 0.6237(降 2.72%,$\text{GAUC}_{all}$ 上降幅最大):不摘掉习惯 logit 就等于把伪正样本效应带进排序,验证了 do-calculus 干预(式 9)是把"训练时学到的解耦"变现为"推理时净化打分"的必要一环。
三项组件(GAL / HL / OL / doC)在 $\text{GAUC}_{all}$ 上分别造成 1.06%、1.54%、2.72% 等量级下降(原文表述),共同支撑 OrDA 的完整性。
4.4 潜空间可视化¶

为定量+可视化地评估解耦程度,作者在评估集的一个随机子集上计算兴趣向量 $\mathbf{v}_{int}$ 与习惯向量 $\mathbf{v}_{habit}$ 的余弦相似度矩阵(图 4)。热力图在对角线(同样本 intra-sample) 和非对角(跨样本 inter-sample) 元素上都呈近零分布(整张图以白/浅色为主,色标范围仅 ±0.0003 量级),表明两个向量空间被约束成互相正交——解耦既是样本级一致的(sample-wise consistent),也是全局鲁棒的(globally robust)。
4.5 线上 A/B 测试¶
在芝麻首页营销位 "租物专区(rent-floor)" 上跑了为期一周的线上 A/B。OrDA 相比线上基线(即 §4.1.2 的 BASE)UCTR(用户点击率)提升 5.64%。作者强调这一显著增益证明了 OrDA 的工业可用性。OrDA 已全量部署(fully deployed) 在芝麻首页营销位的租物专区推荐中。
5. 核心贡献总结¶
- 提出并形式化一类新偏差——访问习惯偏差(access-habit bias):区别于位置/曝光偏差,指出首页营销位的"习惯性伪正样本"由用户主入口导航惯性(一个只依赖用户的混淆因子 $H=f_H(u)$)产生,掩盖了物料真实质量。
- 把因果去偏从"概率层"抬到"表示层":用加性 logit 融合 $Y=H\oplus I$ 建模,配合余弦正交正则强制兴趣/习惯向量几何垂直,避免了倾向性方法除法重加权的高方差问题。
- 推理时 do-calculus 干预 $do(H=0)$ 的代数优雅性:因为融合是加性的,置零习惯 logit 即可无缝得到纯净兴趣分 $\sigma(I)$,工程上零额外代价、零方差风险。
- GAL 门控路由解决解耦副作用(信息蒸发):只对用户特征做自适应分配,让正交约束"只杀干扰不杀通用信号",消融证明其为最关键组件。
- 真实工业验证:>30M 用户生产数据 SOTA + 线上 A/B UCTR +5.64% + 全量部署。
6. 讨论与局限性¶
值得借鉴的设计:
- "加性 logit 融合 + do 置零"的组合拳 是本文最巧的地方。相比 ESMM 的乘性(式 2,引入错误独立先验)和倾向性方法的除性(式 3,方差爆炸),加性结构让"训练时联合拟合、推理时代数摘除混淆"变得既稳定又零成本。任何做"多因子点击 = 真实偏好 + 某种可剥离偏差"的场景(位置偏差、诱导偏差、榜单曝光偏差等)都可复用这套"加性建模 → 干预置零"范式。
- GAL 对"解耦导致信息蒸发"的显式补救 是一个容易被忽视但工业上很实际的洞见:强正交/强解耦正则若无路由保护,会连带抹掉共享的通用信号(消融里 w/o GAL 掉到 0.6099,甚至低于 BASE 的 0.6122)。这提醒所有用正交/解耦正则的工作都要防"过度分离"。
- GAUC 分 cold/active 三组看 是评估去偏是否"真去偏"而非"换个方式背历史"的好透镜:真正的去偏应当 cold 涨、active 掉。
局限与争议:
- 方法组件均为成熟积木的组合:正交正则[1,5]、do-calculus[10]、双塔 ESMM[7]、MaskNet[13] 都是已有工作,OrDA 的创新在于问题定义 + 组合方式 + 加性融合带来的推理优雅性,而非单点新算法。属于"清晰而中等创新度"的工业实践论文。
- $H=f_H(u)$ 的强假设:把"访问习惯只由用户特征决定"写死进架构(GAL/习惯塔只吃用户特征)。现实中习惯可能与时段、坑位位置、场景上下文耦合(如"晚上习惯性刷某类"),这个纯用户级假设可能过简,论文未做敏感性分析。
- 实验广度有限(5 页短文):只在芝麻单一场景(营销位/租物专区)验证;$\alpha,\beta$ 直接取 1 未做超参搜索;A/B 仅一周单坑位。缺少对"净化后兴趣分是否真的更贴合长期用户价值/留存"的下游验证——GAUC 提升与业务长期收益的桥接留白。
- 正交=独立? 余弦正交只保证线性不相关,不等于统计独立;习惯与兴趣间的高阶依赖仍可能残留。图 4 的近零热力图是必要非充分证据。
工业落地价值:论文的核心卖点就是工业落地——已全量部署于芝麻首页营销位"租物专区",线上 UCTR +5.64%。推理阶段只保留兴趣塔 + $do(H=0)$(图 3 蓝框),在线成本与普通单塔打分相当(习惯塔仅训练期存在),这是该方案能上线的关键工程优势:解耦的复杂度全压在训练侧,推理侧零负担。