← 返回报告列表

2026-08-18 日报

日报 📅 2026-08-15 ~ 2026-08-17
排序模型之外发力:上游候选过滤与跨域统一用户表征
industrial knowledge-distillation pretrained-lm cross-domain transformer
📊 共 11 篇 · 精读 2

2026-08-18 日报

主题: 排序模型之外发力:上游候选过滤与跨域统一用户表征

标签: industrial · knowledge-distillation · pretrained-lm · cross-domain · transformer

📊 统计: 共 11 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 9 · generative-rec 2 · other 2 · discriminative-rec 4 · llm 3

综述

本日 11 篇,属周末合并批次、覆盖三天投稿:判别式推荐 4 篇、LLM 3 篇、生成式推荐 2 篇、其他 2 篇,工业系统 3 篇,余者多为学术,2 篇精读。SDF(Google Discover)把「陈旧性」拆成机制不同的「取代」与「衰减」,分别用 PaLM 2-L 蒸馏的成对分类器与多模态流量比回归识别;两者均非个性化、在用户请求路径外算好、服务时只查表,于排序上游剪枝候选,故不产出 CTR/CVR,定位是候选集过滤层,两年部署使陈旧举报下降 54.9%,并回收 8.74% 算力。SAGA(PayPal AI)把六类触点行为归一到统一事件 schema,按字段轮转展开成 7 个 token 做自回归加事件级对比的双头预训练,冻结嵌入接 DCN-v2 排序器线上取得 +12.75%;但其创新更近于既有 tokenization 方案的组合式扩展,未与最近邻工作正面对照,37M 的规模亦限制后续扩展。GOD 以组件级嫁接蒸馏拆解序列推荐泛化瓶颈,UniDot 从点乘视角统一特征交叉与序列建模。趋势上,收益正从排序主模型移向上游:候选治理、跨域统一表征与采样蒸馏。

重点论文

SDF · ⭐ 8/10

Decomposing Staleness in Recommender Systems: A Dual-Filter Framework for Supersession and Decay

🏢 Google · 其他

SDF(Google Discover)把推荐系统的「陈旧性」拆成机制不同的两维——取代(关系性信号,必须成对比较)与相关性衰减(内在信号,系于物品寿命)——各配一个学习模型:关系型过滤器用 PaLM 2-L 教师合成 110 万标注对(聚类去冗余 + 相似度带加权采样、7 样本两阶段先类别后 rationale 投票)蒸馏出 T5-11B student,CoT 式 rationale 监督叠加 NLI 辅助训练取得离线 F1 84.79 与 550 对人工黄金集 83.5% 精确率/95% 召回率;内在型 PTR 以搜索点击日志(而非被出版方推广偏置的页面浏览日志)导出的终身流量为标签,用 early-fusion 多模态多任务网络回归物品在 7 个视界上累积的 30 天流量份额(early fusion 80% vs late fusion 76%,评分一致性收紧时精确率 88.04%→97.22%)。两者均非个性化且在用户请求路径外计算、服务时退化为查表,OR 融合后在排序阶段上游剪枝候选:互动中性约束下取得 −6.91% prevalence delta(年龄阈值 + engagement cliff 基线仅 −0.10% 且置信区间覆盖 0),两个月联合 holdback 下 dismissal rate −0.16%/feed 多样性 +0.13%/正向互动 +0.26%,服务 CPU/TPU 节省 8.74%,两年部署使用户陈旧举报下降 54.9%(取代 −64.0%、衰减 −34.4%)。

SAGA · ⭐ 6/10

SAGA: Structure-Attended Generative Action Embedding Model that encodes Multi-Surface User Action Sequences

🏢 PayPal · 生成式推荐

SAGA 是 PayPal 的多触点用户行为嵌入模型:把结账/P2P/App/推送/邮件/账户操作统一成六属性事件 schema,按 round-robin 把每个事件展开成 K=7 个字段级 token 做自回归建模(每字段独立词表与独立 LM 头、词表外 logits 掩负无穷实现约束解码),再叠加只在事件边界触发的 stop-gradient 组合式目标 InfoNCE 对比头;冻结末层隐状态作为通用用户嵌入喂给 DCN-v2+ESMM 下游 ranker,在等 token 预算下用 7 倍更少的事件匹配或超过 PinFM 式融合(K=1)与 HSTU 式交错(K=2)tokenization,线上 A/B 在 TP-B 取得 +12.75% 业务指标提升。

GOD · ⭐ 7/10

GOD: Enhancing Generalization via Deep Grafting for Sequential Recommendation

🎓 学术 · 判别式推荐

GOD 针对序列推荐中稀疏噪声历史导致的泛化不足,提出组件级蒸馏:常规蒸馏让教师与学生各自独立前向再对齐输出/表征,会把学生各组件的影响纠缠在一起,分不清弱泛化来自不可靠嵌入、过拟合编码还是对稀疏历史的共适应。嫁接指把冻结教师的部分组件替换为可训练学生组件构成混合源模型,用教师编码器评估学生嵌入、用教师嵌入评估学生编码器,从而给出组件级反馈;推理只用学生、无额外开销,三个真实数据集上最高超过 SOTA 13.92%。

UniDot · ⭐ 6/10

UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation

🎓 学术 · 判别式推荐

UniDot 面向点击后转化预测,主张嵌入内积(协同过滤泛化的原语)与注意力的 query 点乘 key 是同一运算,因而可用单一点乘同时支撑特征交叉与序列建模。它把非序列字段与多域行为序列 token 化到共享空间,堆叠单一宏块:token-mixing 总线与序列检索总线(物品 token 交叉注意历史)并行、每层经 MLP-Mixer 融合交换状态,FM Highway 把逐层显式点乘交互绕过残差栈直连分类器;序列侧每次前向只编码一次以约束推理时延,配合稀疏/稠密双优化器(Adagrad + Muon)、转化延迟辅助头与多路互学习训练,获 TAAC KDD Cup 2026 工业赛道亚军。

全部论文

模型 标题 类别 公司 摘要分 精读分
SDF Decomposing Staleness in Recommender Systems: A Dual-Filter Framework for Supersession and Decay 其他 🏢 Google 8 8
SAGA SAGA: Structure-Attended Generative Action Embedding Model that encodes Multi-Surface User Action Sequences 生成式 🏢 PayPal 7 6
GOD GOD: Enhancing Generalization via Deep Grafting for Sequential Recommendation 判别式 🎓 学术 7 —
DCR Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis LLM 🎓 学术 6 —
DTE Decoupled Temporal Encoding for Generative Recommendation 生成式 🎓 学术 6 —
UniDot UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation 判别式 🎓 学术 6 —
SAHC-NS SAHC-NS: Structure-Aware and Hardness-Calibrated Negative Sampling for Implicit Collaborative Filtering 判别式 🎓 学术 5 —
— Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation LLM 🎓 学术 5 —
— When Is Complex Chunking Worth It? A Multi-Objective Evaluation of Chunking Methods at Scale 其他 🎓 学术 4 —
LLM-MGCL POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment 判别式 🎓 学术 4 —
— Cross-Entropy Risk Estimation for Language Models: Inconsistency Must Be Dense, and the Holdout Method Is No Exception LLM 🎓 学术 4 —