2026-09-22 日报
主题: 工业推荐扎堆上线,收益难归因到所提机制
标签: industrial · inference-serving · semantic-id · quantization · pretrained-lm
📊 统计: 共 8 篇 · 精读 4 · 🏢 工业界 4 · 🎓 学术 4 · generative-rec 4 · discriminative-rec 3 · llm 1 · other 2
综述
今日 8 篇:4 篇精读、4 篇仅摘要,生成式 4 篇、判别式 3 篇,四篇精读全是工业论文(百度 ×2、Google、Netflix)。百度 UNIQUE 用同容量 16,384 单层平坦码本替换 128×128 分层 RQ 码本,工业码本资源方差 1510.85→389.57,三场景全量 A/B 时长 +0.96%,但四个消融中三个单独移除即跌破最强 baseline。百度 MuSeR 在 MGS 召回上叠加分层时间压缩与多兴趣抽取,报 DAU +0.26%,消融却显示去掉新增的 ERNIE+BGE 文本信号后 Recall@500 反低于 baseline NANN。Google 把 YouTube Music 发现位的 Gemini 推理整体离线化,位级互动 +22.43%,但自家 holdback 表明 LLM 提名对互动中性,增益来自理由文案。Netflix 的反事实可观测性框架给出 Irreplaceability×Universality 分解,却不报任何业务数字。四篇工业论文里三篇的头条增益都归不到标题所主张的机制上,读时须先核对消融;学术侧的 semantic ID 复现研究也给出“没有哪种设计通吃”的非单调结论。
重点论文
UNIQUE · ⭐ 7/10
UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation
🏢 Baidu · 生成式推荐 / 判别式推荐
百度把手机百度信息流召回里的 128x128 分层 RQ 码本换成同等容量 16,384 的单层平坦码本(用 batch 使用率 r_j^tau 缩放分配距离做均衡、用 DSSM 多目标反馈监督更新码本),并把用户前缀、候选 item target、候选 code target 放进同一个早融合 Transformer(target-attention split 禁止 target 互相 attend),一次前向同出码分类 logits 与多目标排序分;工业码本资源方差 1510.85→389.57、top-1 类目占比 65.43%→78.08%,三场景全量一周 A/B 时长 +0.96%、分发 +1.08%、留存 +0.70%,占候选池 22.5%,89ms P99 / 44.23% MFU;但公开实验只有 KuaiRand-Pure 一个 7.6k 物品数据集,且四个消融中三个单独移除即跌破最强 baseline。
MuSeR · ⭐ 5/10
MuSeR: Scalable Long-sequence Recommendation with Multi-interest Modeling
🏢 Baidu · 生成式推荐
MuSeR 在百度已部署的 MGS(NANN 风格 HNSW 多目标检索)之上集成分层时间压缩(近期 800 条原样、中期 16 倍池化、早期 64 倍池化压到 Lc=1000)、6 个可学习 query + 正交正则的解耦多兴趣抽取、以及 ERNIE-4.0-Turbo→ERNIE-Speed 蒸馏摘要经 BGE 编码的多模态语义对齐,配合长期表示离线缓存异步刷新与分层 beam-search 检索上线,百度 APP 首页信息流 A/B 报 DAU +0.26%、时长 +0.89%;但消融显示去掉多模态语义后 Recall@500 反低于其最强 baseline NANN,真正的收益来源是新引入的 LLM 文本信号而非标题主打的压缩与多兴趣设计。
Explainable Recommendations at Scale: LLM Rationales for YouTube Music Artist Discovery · ⭐ 5/10
🏢 Google · LLM / 生成式推荐
Google 把 YouTube Music「Your Daily Discovery」发现位的 Gemini 推理整体搬到离线:事件驱动地只为打开首页的活跃用户异步预计算 Discovery Profile(口味簇 + 未听过的新艺人候选 + 逐条自然语言理由),再经 Knowledge Graph 实体规范化剪除「组合式幻觉艺人」(如 Gavin DeBardeleben / Chhet Sokun 这类文本层面与真实长尾艺人不可区分的虚构名)、熟悉度过滤保证真正未发现、安全过滤兜底,在线层只做低延迟 fetch 与标注,两周 A/B 拿到位级互动 +22.43%(CI [16.93%, 27.93%])、发现/留存 +8.07%(CI [0.90%, 15.24%])、平均延迟仅 +0.3%;但其 multi-arm holdback 显示 LLM 候选提名对互动完全中性,收益全部来自把理由文案挂到既有 CF 检索 + 深度排序链路已选出的候选上,且该关键归因未给任何数字,唯一量化的离线指标(prompt 调优使达标率 64.8%→74.4%)由调 prompt 所依据的同一个 judge 打出。
Beyond Raw Engagement: A Counterfactual Observability Framework for Recommender Systems at Netflix · ⭐ 5/10
🏢 Netflix · 其他
Netflix 把推荐系统对内容创作者与模型开发者的可观测性形式化为反事实测量问题——估计「若移除某条内容或某次模型决策,推荐器会怎么出、互动会怎样」,以带 logged selection probability 的 Exploration & Exploitation 模块为基座,给出 SNIPS 去偏、策略级/物品级 position-adjusted relativity、单阶段 Leave-One-Out(match function 取「top pick 非被移除项」或「top pick 是被移除项时的次优项」)与级联场景的 Incrementality=Irreplaceability×Universality 分解(Horvitz-Thompson / Hájek 估计器 + 无放回序列的累计选中概率),上游诊断则把 match 放宽为候选池 Jaccard 相似度;验证仅有两条内容的合成仿真(量级失配:真值 0.048/0.012 对估计 0.0347/0.0240)与首页 row 上 11 次移除式 A/B 的 weighted R2=0.8212(无 baseline 对照、最大样本点符号判反),全文不报告任何可归因于该框架的业务收益。
What Makes a Good Semantic ID for Generative Recommendation? A Reproducibility Study · ⭐ 7/10
🎓 学术 · 生成式推荐
大规模复现研究,在统一框架下回答「什么样的 semantic ID 才算好」:比较不同 SID 构造策略的相对效果、码本利用率与推荐质量的关系、码长的影响,以及 SID 设计对局部语义保持的影响;结论是效应普遍非单调——没有哪种设计通吃,第一层码本最均衡的方法也不一定是最好的推荐器,不同设计在语义邻域保持上呈互补优势。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| UNIQUE | UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation | 生成式 / 判别式 | 🏢 Baidu | 8 | 7 |
| MuSeR | MuSeR: Scalable Long-sequence Recommendation with Multi-interest Modeling | 生成式 | 🏢 Baidu | 8 | 5 |
| — | Explainable Recommendations at Scale: LLM Rationales for YouTube Music Artist Discovery | LLM / 生成式 | 7 | 5 | |
| — | Beyond Raw Engagement: A Counterfactual Observability Framework for Recommender Systems at Netflix | 其他 | 🏢 Netflix | 7 | 5 |
| Inherit4Rec | Inherit4Rec: Parameter Inheritance for Efficient Scaling of Recommendation Models | 判别式 | 🎓 学术 | 7 | — |
| — | What Makes a Good Semantic ID for Generative Recommendation? A Reproducibility Study | 生成式 | 🎓 学术 | 7 | — |
| BT-SR | A Redundancy Reduction Approach for Controllable Sequential Recommendations | 判别式 | 🎓 学术 | 6 | — |
| — | What Can a Recurrent State Safely Forget? | 其他 | 🎓 学术 | 4 | — |