2026-09-15 日报
主题: 工业推荐的收益归因:对照组决定结论成色
标签: industrial · rl · pretrained-lm · parameter-scaling · semantic-id
📊 统计: 共 12 篇 · 精读 4 · 🏢 工业界 3 · 🎓 学术 9 · generative-rec 5 · discriminative-rec 2 · llm 4 · other 2
综述
当日 12 篇(4 精读):生成式推荐 5、LLM 4、判别式 2、其他 2,工业仅阿里、Netflix。淘天 VARG 的价值序 SID 绕开粗排,GMV +1.45%,但 Prefix-GRPO 仅占 RL 增益 11.7%,真价值在冻结槽位日更。阿里 LazFormer 的零初始化适配器:Direct/PreProj 对照证明融合方式比迁移与否关键;非对称多轮较 1 epoch 仅 +0.26pt。Netflix 把无害性改为阈值约束,逐样本合取优于组级边际,但不退化与约束设计无因果。UBC MoME 等参同槽位只换路由,把增益归因到上下文,唯一持平。主线即归因:真实增量取决于对照组选法。
重点论文
LazFormer · ⭐ 7/10
🏢 Alibaba · 判别式推荐
LazFormer(阿里 AIDC)把工业排序 Transformer 的「生成式预训练→判别式排序」迁移从 sparse-only 推进到 sparse+dense:用零初始化(W_up=0)的可迁移残差适配器把加购/下单等排序专属特征以函数保持的方式注入,使排序从预训练表示精确出发再渐进吸收(对照组 Direct/PreProj 与完全不迁稠密的 Sparse 不可区分,证明决定性的是融合方式而非是否迁移);配合由粗到细长序列压缩+滑窗/全局 token 混合稀疏注意力+跨层渐进剪枝+请求级样本组织(92.63% 稀疏、5.1× 注意力加速),以及「每 epoch 重置稀疏、跨 epoch 累积稠密」的非对称多轮训练;工业数据上 CTR AUC/GAUC 相对最强 baseline +0.74/+1.28pt(降配到 baseline 配置的 LazFormer* 只用 14G FLOPs 就全面胜出),线上 GMV +9.85% 而 A10 吞吐仅降 12.1%。
MoME · ⭐ 7/10
MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
🎓 学术 · LLM
MoME 指出 conditional memory 这一族(Per-Layer Embedding / Value Embedding / STEM / Engram / Bigram)的共同瓶颈不在注入位置而在寻址方式——记忆索引始终是 surface form 的确定性函数,迫使 bank、python 这类多义 token 的所有语境共用一行(容量按 token 而非按语义内容分配)——于是把每行拆成 M 个记忆槽位、用 hidden state 上的 per-head top-K 门(K>1 用 sigmoid-norm 只在选中槽位上归一)选并加权槽位,再经 γ=2σ(W_γh+b) 的 per-head value-residual 门注入 attention value 流(这个注入点让记忆分支可与标准 value 投影并行调度,qwen3_4b 上比 hidden-state 注入省一半延迟 0.509ms vs 0.996ms),并给出可选的离线 kNN 行分组把容量从 token 轴守恒地搬到上下文轴(c_grp=2 最优,=4 开始伤 CORE);在 nanochat / Llama-MobileLLM / Qwen3 三家骨干的受控预训练中,等参下 val bpb 0.8621 优于 Bigram 0.8636 与 VEmbedding 0.8633,三个规模上以更少记忆参数同时打赢 STEM 的 bpb 与 CORE(Qwen3 0.6B 用 470M 记忆对 STEM 的 1409M:0.7461/0.2737 vs 0.7564/0.2556),d12 上记忆 75.5M→604M 全程 bpb 低于 Bigram 且 run-to-run 方差明显更小,同训练 FLOPs 下还赢过延迟匹配与总参匹配的两个更大稠密骨干,WiC 上 144 个 layer-head 站点中 117 个异义对路由散度更大、110 个同义对槽位重叠更多;但 Qwen3 0.6B 等参下 bpb 反而不如 VE(靠 BoolQ 单任务 +15.8 点把 CORE 拉高)、d24/ClimbMix 上 Bigram 的 bpb 明显更好(0.6943 vs 0.6990)与 d12 结论相反且未解释,全部实验止于 sub-1B 骨干、100B-token 那格只有单种子,可解释性分析作者自陈为描述性、缺因果干预。
VARG · ⭐ 6/10
VARG: Value-Aware and Ranking-Aligned Generative Retrieval for Dynamic E-commerce Search
🏢 Alibaba · 生成式推荐
VARG 是天猫 App 搜索的「召回—粗排一体化」生成式检索系统:VARG-ID 用双向 Q2I 对比学习的两级语义前缀加 EB-CVR 平滑的簇内价值序第三位 token 做到初始 100% 无碰撞的 item 级寻址,配三阶段 SFT(Q2I 价值加权、层级加权、LO-SFT 局部序监督、上下文扩展)与 Prefix-GRPO(合法性门控下的行为/排序器优势/相关性多源奖励加前缀分支数 token 加权),生成候选经预留配额绕过粗排直通最终排序器,14 天 20% 流量 A/B GMV +1.45%;但消融显示 Prefix-GRPO 的两项署名创新只占 RL 增益的 11.7%(纯行为奖励 GRPO 占 88.3%),价值序 token 本身从未被单独消融,而 LO-SFT 近乎无效与「全量重排使完整 SID HR@100 崩 14.45pp」两条证据表明模型是把第三位 token 当绝对地址记忆而非学到价值序数语义——真正扎实的原创贡献是那组标识符稳定性诊断与冻结槽位式日更工程。
Constrained GRPO · ⭐ 6/10
Safety as a Constraint: Fine-Tuning a LLM Recommender to Explain Itself
🏢 Netflix · 生成式推荐 / LLM
Netflix 用 Lagrangian primal-dual 改造 GRPO,把无害性当成带阈值的约束而非加权奖励项,在同一个 in-house 8B 推荐 LLM 上微调出推荐解释生成能力,三准则全通过率 0.649→0.956(独立 judge 0.677→0.931),并报告推荐与通用语言能力未退化。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| LazFormer | LazFormer: Scaling Transformers for Industrial Recommendation via Transferable Generative Pre-training | 判别式 | 🏢 Alibaba | 8 | 7 |
| MoME | MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup | LLM | 🎓 学术 | 7 | 7 |
| VARG | VARG: Value-Aware and Ranking-Aligned Generative Retrieval for Dynamic E-commerce Search | 生成式 | 🏢 Alibaba | 8 | 6 |
| Constrained GRPO | Safety as a Constraint: Fine-Tuning a LLM Recommender to Explain Itself | 生成式 / LLM | 🏢 Netflix | 7 | 6 |
| LION | Self-Evolving Memory for Generative Recommendation | 生成式 | 🎓 学术 | 7 | — |
| TATK | TATK: Triple-Aware Top-K Learning with Knowledge-Grounded Verification for LLM-based Sequential Recommendation | 生成式 | 🎓 学术 | 6 | — |
| GESE | Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation | LLM | 🎓 学术 | 6 | — |
| SCRec | Addressing Cross-Stage Decoupling of Semantic and Collaborative Signals in Generative Recommendation | 生成式 | 🎓 学术 | 6 | — |
| P3Rec | P3Rec: Distilling Prior--Posterior Preference Reasoning for LLM-based Recommendation | 判别式 | 🎓 学术 | 6 | — |
| IROH | IROH: Insightful Ranking Of Humor using Multi-Stage Hybrid Retrieval with Rationale-Distilled LLM Judges for JOKER 2026 Track Task 1 English | 其他 | 🎓 学术 | 5 | — |
| — | When does a scaling result justify a different allocation? A critical review of resource-allocation evidence for AI systems | LLM | 🎓 学术 | 4 | — |
| JumpStart | JumpStart Your Policy Learning with Lessons from 160,000 Training Runs | 其他 | 🎓 学术 | 4 | — |