← Back to list
SAM

Learning to Forget: Satiation-Aware Long-Sequence Transducers for Mitigating Post-Purchase Redundancy

判别式推荐 Alibaba
Abstract 7 │ Reading 7 │ Rating —
2026-07-14
Yipin Dai, Ruocong Tang, Xing Fang, Yang Huang, Jing Wang, Zhentao Song, He Guo
Alibaba Group
SAM把购买视为意图终止信号,用双路交叉注意力(pointwise回溯抑制+个性化复购节奏检索)驱动的自适应饱和门控软掩码,配合Time-to-Next-Purchase自监督辅助任务,在Tmall电商CTR排序中把购后重复率降低60%以上同时保持SOTA精度。
评分原因
摘要评分:问题定义(Action-Intent Asymmetry / 兴趣退出)切中电商真实痛点,满足门控+时序遗忘机制有新意,工业数据集与线上 A/B 齐备,购后重复率降幅显著。
精读评分:问题定位精准(Action-Intent Asymmetry/购后冗余),方法组合优雅(pointwise抑制门+时间相位软掩码+TTNP自监督),线上A/B有实效(GMV+0.9%,Bad-Case-74.5%);扣分在实验仅工业私有数据无公开复现、PPRR为自定义指标、超参消融不足。
transformer negative-feedback industrial ad-rec

Learning to Forget: Satiation-Aware Long-Sequence Transducers for Mitigating Post-Purchase Redundancy

Yipin Dai, Ruocong Tang, Xing Fang, Yang Huang, Jing Wang, Zhentao Song, He Guo —— Alibaba Group, Hangzhou, China arXiv:2607.12714v1(2026-07-14,cs.IR)· SIGIR '26 收录

研究动机与背景

现代推荐系统与广告平台越来越依赖长行为序列来推断用户不断演化的意图。Transformer 式自注意力凭借捕捉长程依赖 + 并行计算的能力,成为主导范式(Vaswani et al., 2017):序列推荐里 SASRec / BERT4Rec 代表 next-item 预测的 SOTA,工业 CTR/ranking 里 DIN / DIEN 对 candidate-aware activation 与兴趣演化做建模,都在规模上证明了生产可行性。

但本文指出,在购买事件语义关键的电商场景里,现有系统忽略了用户意图生命周期里的一个根本阶段——Interest Exit(兴趣退出)。标准注意力模型擅长捕捉兴趣的演化与累积,却无法建模意图的终止。作者把这个缺陷命名为 Action-Intent Asymmetry(行为-意图不对称):

一次购买行为往往意味着一个更宽泛底层意图的满足与随之而来的关闭(这个意图外化为前面一串相关点击),然而标准自注意力只把这次购买当作又一个正信号去累积、供未来强化(Li et al., 2020)。

这种无法识别 "Interest Exit" 的能力缺失,导致了一个持续存在的痛点——post-purchase redundancy(购后冗余):已被满足的意图仍滞留在用户表征里,使系统在转化刚发生后立即继续推荐相同物品,既浪费了宝贵的优质推荐位,也损害了用户信任。

为什么建模 Interest Exit 很难? 关键在于 Satiation Dynamics(饱和动态)的内在复杂性——"退出" 很少是一个二元事件,而是受物品特定生命周期与用户习惯支配的连续过程:

  1. 饱和时长差异巨大:耐用品(如冰箱)的购买通常意味着该意图的永久/长期退出;而快消品(如纸巾)只意味着一次临时退出,带有潜在的、周期性的复现需求。
  2. 用户消费风格多样:从 "serial buying(连续购买)" 到 "single-transaction satisfaction(单次交易即满足)" 分布很广。

已有方案多依赖后处理重排规则——MMR(Carbonell & Goldstein, 1998)、DPP(Kulesza & Taskar, 2012),或在 repeat / explore 模式间做启发式概率切换(Ren et al., 2019, RepeatNet)。这些方法作用在表征学习之外,缺乏建模 item-level 饱和衰减以及预测兴趣复现所需 "lead-in(前置引导)" 效应的粒度。

本文提出 Satiation-Aware Mechanism(SAM),一个端到端框架显式建模用户兴趣的生命周期。三点核心贡献:

  • Satiation-Aware 范式:识别出 Action-Intent Asymmetry 问题,提出把购买当作意图终止信号(而非仅仅累积)的端到端表征学习框架。
  • Dual-path SAM 架构:结合 retroactive suppression(回溯定位过去的探索性点击)与 retrieval-based rhythm estimation(建模长期习惯)。
  • Adaptive Gating + TTNP 监督:设计带 "lead-in" 机制的 ASGU 平衡冗余抑制与复购召回,由 Time-to-Next-Purchase 辅助任务监督,无需人工标注即可学习潜在产品生命周期。

论文的一句话立意是:"knowing when to forget" 与 "knowing what to remember" 同等重要。

核心方法 / 模型架构

SAM 采用 multi-tower fusion(多塔融合)架构,由三个核心组件构成:(1) Dual-path Cross-Attention 模块做 intent localization + rhythm retrieval;(2) Adaptive Satiation Gating Unit(ASGU)做动态 mask 生成;(3) Satiation-aware Attention 层做 logit 级干预。

Figure 1: The overall architecture of the Satiation-Aware Mechanism (SAM).

如上图,输入层(Input Layer)接收 Candidate Item、User Profile、User Behavior Sequence、User Purchase Sequence;经 Embedding 层后进入 Dual-path Interest Modeling(左路 Pointwise Intent Gating 走 Behavior Sequence,右路 Cross Attention 走 Purchase Sequence + Time Interval);两路信号($a_j$ 与 $\Delta t$、$r_{u,g}$)汇入 ASGU 生成 satiation mask $m_{ij}$,喂给 Transformer×N 的 Satiation-aware Attention;最终 Fusion + MLP 输出 CTR 预测 $\hat{y}$,并与 Time-Interval Loss(TTNP 输出 $\hat{y}_{\Delta}$)在 Joint Optimization Layer 联合优化。

问题形式化(Problem Formulation)

工业推荐系统的 ranking 阶段,目标是为特定候选物品估计 CTR。给定用户 $u$,输入定义为:

  1. User Profile $P_u$:人口统计、长期偏好等静态特征;
  2. User Behavior Sequence $S = \{x_1, \ldots, x_L\}$:点击与购买的时序序列,每个交互 $x_j$ 含物品特征与品类 $g_j$;
  3. User Purchase Sequence $S_{\mathrm{buy}} = \{x_1^{(p)}, \ldots, x_H^{(p)}\}$:只保留购买事件的长期历史,用于捕捉消费节奏;
  4. Candidate Item $i$:待打分的目标物品,品类 $g_i$。

目标是学习打分函数 $f(P_u, S, S_{\mathrm{buy}}, i) \to \hat{y}$,其中 $\hat{y} \in [0, 1]$ 表示交互概率。核心焦点是:正确识别 $S$ 中的 "Interest Exit" 事件,当候选 $i$ 属于用户近期已满足的品类时,抑制打分 $\hat{y}$。

Dual-path Interest Modeling(双路兴趣建模)

为处理 Action-Intent Asymmetry,采用双路 cross-attention 同时识别 "what to suppress(抑制什么)" 与 "how long to suppress(抑制多久)"。为保证语义一致性与参数效率,两路共享同一组投影矩阵 $W_Q, W_K$。

2.2.1 Intent Localization(Retroactive Suppression,回溯抑制)

一次购买意味着整个 intent cluster(意图簇)的满足。为避免长序列(如 $L=500$)下 Softmax 固有的权重稀释,本文把 intent attribution weight $a_j$ 定义为一个 pointwise similarity gate(逐点相似度门):用购买物品的品类 embedding $\mathbf{e}_{g_{\mathrm{buy}}}$ 作为 probe query,对历史节点的品类 embedding $\mathbf{e}_{g_j}$ 打分:

$$a_j = \sigma\!\left(\frac{(W_Q \mathbf{e}_{g_{\mathrm{buy}}})^{\top}(W_K \mathbf{e}_{g_j})}{\sqrt{d}}\right) \tag{1}$$

其中 $\sigma$ 是 Sigmoid。与 Softmax 不同,这种 pointwise 形式允许 $a_j$ 对同一意图簇内的所有节点都维持高抑制强度(接近 1.0),与序列长度无关——这是设计的关键动机:Softmax 会在长序列上把注意力质量摊薄,而独立 Sigmoid gate 不会。

2.2.2 Personalized Rhythm Retrieval(个性化节奏检索)

同时,从长期购买历史 $S_{\mathrm{buy}} = \{(\mathbf{e}_{g_k}, \mathbf{e}_{\Delta T_k})\}_{k=1}^{H}$ 检索用户的消费节奏。用 target-aware cross-attention 计算 rhythm 表征 $\mathbf{r}_{u,g}$:

$$\mathbf{r}_{u,g} = \sum_{k=1}^{H} \beta_k \cdot (W_V \mathbf{e}_{\Delta T_k}), \quad \beta_k = \mathrm{Softmax}_k\!\left(\frac{(W_Q \mathbf{e}_{g_{\mathrm{buy}}})^{\top}(W_K \mathbf{e}_{g_k})}{\sqrt{d}}\right) \tag{2}$$

其中 $\mathbf{e}_{\Delta T_k}$ 是历史时间间隔的 embedding。$\mathbf{r}_{u,g}$ 是历史节奏的加权和,再经一个 MLP 解码成正标量:

$$c = \mathrm{Softplus}(\mathrm{MLP}(\mathbf{r}_{u,g}))$$

$c$ 表示预测的补货周期(天数),由 TTNP 辅助任务显式监督(§2.5)。共享 $W_Q, W_K$ 确保 rhythm retrieval 与 intent localization 两路运行在统一语义空间里。

注意两路的区别:Intent Localization 用 Sigmoid(pointwise)做抑制门(不需要归一化,要对整簇维持高强度);Rhythm Retrieval 用 Softmax(over $H$)做加权求和(需要归一化的注意力分布来聚合节奏)。

Adaptive Satiation Gating Unit(ASGU,自适应饱和门控单元)

ASGU 生成 satiation mask $m_{ij}$ 来调制历史节点。为平衡即时冗余抑制与未来需求预测,把 mask 设计成购后立即最深、随时间接近预测周期 $c$ 逐渐释放:

$$m_{ij} = 1 - a_j \cdot \underbrace{\sigma\!\left(k \cdot \left(\alpha - \frac{\Delta t_{ij}}{c}\right)\right)}_{\text{Satiety Function } \phi} \tag{3}$$

其中 $\Delta t_{ij}$ 是自购买以来的已流逝时间,$k$ 是可学习的陡峭度因子,$\alpha \in (0, 1]$ 是 Lead-in Offset(前置偏移,如 0.8)。三个阶段的行为:

  1. Satiety Phase(饱和期):当 $\Delta t_{ij} \to 0$,$(\alpha - \Delta t/c) \approx \alpha$,$\phi$ 保持高值 → $m_{ij} \approx 1 - a_j$。对同品类节点($a_j \approx 1$),节点被有效屏蔽($m_{ij} \to 0$)。
  2. Recovery Phase(复原期):当 $\Delta t_{ij}$ 接近阈值 $\alpha c$,$\sigma$ 内部项趋近 0,$\phi \to 0.5$,mask 淡出。
  3. Pre-purchase Recall(购前召回期):一旦 $\Delta t_{ij} > \alpha c$,$\phi$ 降向 0,$m_{ij} \to 1$。

这个 "lead-in" 机制确保模型能在预测周期 $c$ 结束前略微提前重新激活历史兴趣,以捕捉复购前的早期浏览行为。

Satiation-aware Attention(饱和感知注意力)

为保证数值稳定性,把门控信号作为 Logit-bias Mask 注入。对任意 query $i$ 和 key $j$,修改后的注意力 logit 为:

$$\ell_{ij} = \frac{\mathbf{q}_i^{\top} \mathbf{k}_j}{\sqrt{d}} + \log(\mathrm{clip}(m_{ij}, \epsilon, 1)) \tag{4}$$

这保证当 $m_{ij} \to 0$ 时,对应注意力权重 $\alpha_{ij} \to 0$。(相比直接乘性 mask,logit-bias 形式在 Softmax 前叠加对数偏置,避免数值下溢并保持梯度稳定。)

TTNP Auxiliary Task and Training(TTNP 辅助任务与训练)

为把潜在周期 $c$ 接地到物理时间,引入 Time-to-Next-Purchase(TTNP)辅助任务。对同一品类 $g$ 在时刻 $t_k$ 与 $t_{k+1}$ 的购买序列,模型最小化一个 censored regression loss(截尾回归损失):

$$\mathcal{L}_{\mathrm{aux}} = \sum \big\| \log(c + 1) - \log(\Delta t + 1) \big\|^2 \tag{5}$$

其中 $\Delta t = t_{k+1} - t_k$ 是到下次购买的目标间隔。关键处理 right-censored(右截尾)情况:若用户在观测窗内只有单次品类 $g$ 购买而无后续,用平台该品类的全局平均复购周期 $\bar{c}_g$ 做插补——具体设 $\Delta t = \max(T_{\mathrm{end}} - t_k, \bar{c}_g)$,$T_{\mathrm{end}}$ 是数据窗结束时刻。这确保即使对稀疏、长周期的耐用品,模型也能学到一个稳健的下界。

总损失为联合优化:

$$\mathcal{L} = \mathcal{L}_{\mathrm{CTR}} + \lambda \mathcal{L}_{\mathrm{aux}}$$

(对公式 (1)/(3) 直觉小结:$a_j$ 决定 "该不该抑制这个历史节点"(品类相关性),$\phi$ 决定 "现在抑制多深"(时间相位),二者相乘构成 mask;TTNP 让 $c$ 有物理含义,从而 $\phi$ 的相位切换点 $\alpha c$ 对齐真实复购节奏。)

实验设置

数据集

从 Tmall(天猫)电商平台采集 2025/06/07 - 2025/11/07 的在线服务日志构建实验数据集 $\mathcal{D}$,按时间时序切分为训练集(前 5 个月)与测试集(最后 1 个月)防止数据泄漏。过滤至少 20 次交互的活跃用户,序列截断到长度 $L = 500$。

Dataset #Users #Items #Actions #Purchases
$\mathcal{D}_{\mathrm{train}}$ 11.52M 7.82M 190.33M 9.06M
$\mathcal{D}_{\mathrm{test}}$ 6.13M 4.65M 52.74M 3.22M

(Table 2. 建立的工业日志统计。注意 test 集用户/物品与 train 部分重叠,反映真实线上分布。)

评估指标

聚焦 fine-ranking(CTR 预估)阶段,同时评估准确性与多样性:

  • Ranking Accuracy:AUC(全局排序能力)与 GAUC(Group AUC)(每个用户个性化列表内的排序质量,后者对工业线上表现更有指示性,Zhou et al., 2018)。
  • Redundancy Control(冗余控制,本文新引入):
  • PPRR(Post-Purchase Repeat Rate,购后重复率):追踪推荐物品与用户最近一次购买共享完全相同 leaf-category 的曝光占比,在一个品类特定的时间窗内计算(时间窗取自预建的复购周期查找表)。越低越好。
  • Bad-Case Ratio:直接的线上业务指标,衡量用户显式负反馈(如点 "dislike")事件中,"already purchased(已购买)" 这一原因所占比例。越低越好。

  • 线上 A/B:监控 complementary items 上的 CTR 与 GMV,确保均衡的业务增长。

Competitors(对比基线)

分三组:(1) Classic & Interaction Models:DNN(Cheng et al., 2016; Covington et al., 2016)、DCN-v2(Wang et al., 2021)、DIN(Zhou et al., 2018);(2) Efficient Sequence Models:HiFormer(Gui et al., 2023)、RankMixer(Zhu et al., 2025),用层次化机制提效;(3) Generative/Large-Scale Models:HSTU(Zhai et al., 2024)、MTGR(Han et al., 2025)、OneTrans(Zhang et al., 2025)、HHFT(Yu et al., 2025),面向超长历史建模的 SOTA 架构。此外还有一个启发式基线 DIN + Fixed-Window Filter(固定窗口硬过滤)。

离线在 $\mathcal{D}_{\mathrm{test}}$ 上重复 5 次;线上 A/B 按标准协议(Kohavi et al., 2009)部署到 1% 实时流量。工程实现基于 Alibaba PAI 团队的 TorchEasyRec 框架。

主要实验结果

SOTA Comparison

Table 1 汇总离线 + 线上对比结果(Mean ± Std,* 表示 $p < 0.05$)。线上 A/B 段所有指标为相对部署基线 DIN 的相对百分比变化。

Model AUC (↑) GAUC (↑) PPRR (↓) ΔCTR (↑) ΔGMV (↑) ΔBad-Case (↓)
Classic Models
DNN 0.741±0.001 0.665±0.002 10.5% – – –
DCN-v2 0.745±0.001 0.669±0.001 11.2% – – –
DIN (Baseline) 0.749±0.001 0.674±0.001 15.5% 0.00% 0.00% 0.00%
DIN + Fixed-Window Filter 0.745±0.001 0.670±0.002 7.7% −0.2% −0.3% −31.9%
Recent SOTA
HiFormer 0.753±0.002 0.679±0.002 14.5% – – –
RankMixer 0.754±0.001 0.680±0.001 13.8% – – –
HSTU 0.758±0.001 0.684±0.001 15.2% +0.8% +0.4% +11.0%
HHFT 0.759±0.002 0.685±0.002 14.9% – – –
MTGR 0.761±0.001 0.687±0.001 16.1% – – –
OneTrans 0.762±0.001 0.689±0.001 15.8% +1.1% +0.6% +10.2%
SAM (Ours) 0.763*±0.001 0.691*±0.001 4.1% +1.1% +0.9% −74.5%

结论分析(why,不只是 what):

  1. 传统模型(DNN / DCN-v2)GAUC 有限,因为无法捕捉序列依赖。
  2. DIN 通过引入注意力显著提升准确率,但反而加剧冗余——它显式 attend 购买物品,若候选相似就继续推荐(PPRR 高达 15.5%)。
  3. 现代 SOTA 序列模型(MTGR / OneTrans)取得最高 GAUC,证明其长期兴趣建模能力;但其高 PPRR(15.8%~16.1%)暴露了一个关键缺陷——它们把购后信号仅当作 "strong positive feedback",导致严重的购后冗余。这是本文最核心的观察:准确率的提升与冗余的加剧同时发生,模型越强越会 "记住" 已满足的意图。
  4. SAM 在所有指标上显著改进:AUC/GAUC 上与 OneTrans 统计打平或超越(0.763/0.691),同时把 PPRR 相对最强基线降低超过 60%(15.8%→4.1%)。这证明 SAM 正确 "退出" 已满足意图,而不损害对其他相关物品的预测准确率。
  5. 线上 A/B进一步验证:+1.1% CTR、+0.9% GMV,源于有效减少冗余曝光让用户去探索新品类;Bad-Case 降低 74.5%——直接反映用户 "已购买" 类抱怨的大幅下降。
  6. 量化的生命周期建模能力:SAM 对典型耐用品(如冰箱)预测超过 300 天的饱和周期,对高频快消品(如纸巾)正确推断约 15-30 天的短节奏。相比之下,刚性启发式基线 DIN + Fixed-Window Filter 虽把 PPRR 压到 7.7%,却因无差别的过度抑制把 GAUC 拉低到 0.670、线上 GMV 掉 0.3%、Bad-Case 只降 31.9%——说明固定窗口硬过滤会误伤合法复购需求,而 SAM 的动态个性化周期能在冗余抑制与复购需求之间取得平衡。

Ablation Study

Table 3 消融各组件(GAUC 为主准确率指标)。观察到的贡献排序为 Dual-path Retrieval > TTNP > ASGU Gating。

Variant GAUC (↑) PPRR (↓)
Full SAM 0.691 4.1%
w/o TTNP Task 0.688 (↓) 8.4% (↑)
w/o Dual-path Retrieval 0.682 (↓) 12.9% (↑↑)
w/o ASGU (Hard Mask) 0.685 (↓) 4.0% (≈)

逐项分析:

  • 移除 Rhythm Retrieval(w/o Dual-path Retrieval):GAUC 轻微下降但 PPRR 急剧上升到 12.9%——证实历史购买节奏是判断 "when to stop" 的首要信号,缺了它模型无法知道每个品类该抑制多久。
  • 移除 TTNP 辅助 loss(w/o TTNP Task):模型无法学到不同商品的多样饱和周期(区分冰箱 vs 纸巾),导致 GAUC 次优、PPRR 回升到 8.4%。TTNP 是把潜在周期 $c$ 校准到真实物理时间的关键监督。
  • 用 hard mask 替换自适应 ASGU(w/o ASGU):维持了低冗余(PPRR 4.0%)但 GAUC 受损(0.685)——因为硬掩码会误伤 "lead-in" 兴趣(如复购前的浏览),无法捕捉购前召回窗口。这解释了 ASGU 软掩码 + lead-in 机制相对硬过滤的价值。

与已归档相关工作的对比

TAPF TAPF: Beyond Positive Signals — Unlocking Implicit Negative Behaviors (Tencent, 2026-06-13)

关系:独立并发(本文未引用 TAPF,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇论文指向同一个 root cause——主流序列 CTR 建模默认 "行为序列只由正信号构成",把用户的每一次交互都当作偏好累积的正向证据。TAPF 称之为忽略了 "用户拒绝了什么",SAM 称之为 "Action-Intent Asymmetry / Interest Exit";两者都主张:只看正信号的用户表征是不完整的,会导致模型无法区分表面相似但真实响应完全不同的物品(TAPF)/ 无法退出已满足的意图(SAM)。
  • 相近的技术骨架:两者都不改造骨干,而是在行为序列注意力层注入一个 target-aware 的门控/校准信号,且都强调近乎零的额外在线推理代价、架构无关(可插入 DIN / Transformer / OneTrans 等任意 CTR 骨干)。TAPF 的 Target-Aware Interaction(公式 3-5,$\mathbf{h}_k \odot \mathbf{e}_v$ 门控)与 SAM 的 pointwise intent gate(公式 1,$W_Q \mathbf{e}_{g_{\mathrm{buy}}}$ 对历史品类打分)在 "用目标物品作 probe 对每个历史 token 做逐点条件化" 这一抽象层面高度重合。
  • 本文的差异与推进:TAPF 的负信号是通用的隐式 disengagement(划走 / 低完播 / skip),是静态极性;SAM 的抑制信号专门来自购买驱动的饱和,且引入了 TAPF 完全没有的时间维度——ASGU 的 satiety function(公式 3)随购后流逝时间动态调制 mask 深度,并通过 TTNP 学到每个品类的复购周期 $c$,实现 "先抑制、临近周期再 re-awaken" 的相位切换。换言之,TAPF 回答 "序列里该装什么负 token",SAM 回答 "一个正 token(购买)在何时应转为抑制、又在何时应解除抑制"。
  • 可比的方法/实验差异:TAPF 用 KuaiRec/KuaiRand/TAAC 短视频数据,报告 +1.9%~+9.6% 相对 AUC;SAM 用 Tmall 电商数据,报告 AUC 0.749→0.763、PPRR 降 60%+、线上 +1.1% CTR / +0.9% GMV。SAM 独有 PPRR / Bad-Case 这类冗余指标(电商购后冗余专属),TAPF 独有正负组成比例 $r$ 的 scaling 分析。两者互为佐证:给序列 CTR 注入 "负 / 抑制" 语义是一条独立被多个团队验证的有效方向。

讨论与局限性

核心贡献:SAM 把 "遗忘 / 兴趣退出" 提升为一等建模目标,用一个优雅的 pointwise 抑制门(抗长序列稀释)× 时间相位软掩码(satiety function)× 自监督周期回归(TTNP) 三件套,端到端解决了强序列模型 "越强越冗余" 的痛点。最值得借鉴的设计:

  1. 用 Sigmoid pointwise gate 替代 Softmax 做意图归因——针对 $L=500$ 长序列的权重稀释问题,是一个可迁移的技巧。
  2. satiety function 的 lead-in 机制——把 "抑制" 与 "复购召回" 统一进一个带可学习相位的软掩码,而非硬窗口,兼顾冗余压制与合法复购。
  3. TTNP 的截尾回归 + 全局周期插补——用自监督方式无标注地学习产品生命周期,对右截尾(长周期耐用品单次购买)做 $\bar{c}_g$ 下界插补,工程上务实。

局限 / 争议:

  • 实验完全基于工业私有数据(Tmall),无公开学术数据集复现,且未开源,外部难以验证;benchmark 里也没有可比的公开数据集指标。
  • 对比基线的 PPRR 是本文自定义指标,MTGR/OneTrans 等强基线并非为该指标设计,"降低 60%" 的对比某种程度上是在自己定义的赛道上竞争(不过 DIN+Fixed-Window Filter 作为启发式上界提供了合理参照)。
  • 论文对 Dual-path 里 $W_Q, W_K$ 共享的必要性、$\alpha / k / \lambda$ 等超参的敏感性缺少系统消融,Recovery/Pre-purchase 三相位的定量验证也主要靠文字描述。
  • 只覆盖 ranking(CTR)阶段,未讨论 retrieval 阶段的购后冗余。

工业落地价值:SAM 已在 Tmall 线上 A/B(1% 流量)验证,基于 Alibaba PAI 的 TorchEasyRec 实现,线上 +0.9% GMV、Bad-Case 降 74.5%(用户 "已购买" 抱怨大幅减少),对电商 ranking 系统有直接的部署价值——尤其是把优质推荐位从 "重复推销已购品" 释放给品类探索,兼顾短期 GMV 与长期用户信任。