2026-08-04 日报
主题: 生成式推荐工业化:预训练刷新、离线后训练与服务加速
标签: industrial · rl · semantic-id · ad-rec
📊 统计: 共 13 篇 · 精读 5 · 🏢 工业界 5 · 🎓 学术 8 · generative-rec 7 · discriminative-rec 4 · other 3
综述
当日 13 篇,生成式推荐 7 篇、判别式 4 篇,5 篇精读清一色出自工业界。Shopee 与厦大的 KGD 把预训练知识与下游几何拆给两个参数所有者,读侧 stop-gradient、写侧用锚定预训练嵌入的正交低秩残差,让 encoder 每日刷新而不失效下游适配,线上单用户 GMV 提升 1.75%;反直觉的是共享参数下每日刷新是负收益,甚至低于完全不预训练。快手 HRPO 沿 SID 前缀树做残差信用分解得到 credit-to-go,无需 critic 与倾向性分数;Netflix 的 Exp-RSFT 按 exp(R/λ) 加权做 SFT,完全离线、不要奖励模型,并给出学出的奖励模型连 Item Mean 都打不过的负面证据。Meta 的 GRACE 以不物化子树的个性化 trie 加重排布注意力,把广告召回解码 P99 压进算力窗口;字节 STEPS 让推送系统自己生成下次唤醒时刻并全量部署于十亿用户,但算力削减主要来自朴素蒸馏剪枝。主线是把知识刷新、离线后训练与服务算力同时当作一等约束。
重点论文
KGD · ⭐ 9/10
Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
🏢 Shopee · 生成式推荐 / 判别式推荐
KGD 把预训练行为知识与下游任务几何拆给两个参数所有者——encoder 用 BMTP(只保留协同/语义相似度超阈的未来 item 作监督)去噪预训练并每日刷新,task learner 只经 stop-gradient 的 read-only 交叉注意力读取它、并用锚定在预训练 embedding 上的正交低秩残差 ACR 写自己的几何——使知识刷新与任务适配互不失效;8 个 Amazon-2023 基准上超最强 pretrain-transfer baseline 4-12%,90 天 Shopee 生产流上冻结迁移(GPSD)持续衰减而 KGD 保持(共享参数下每日刷新甚至低于不预训练),全量上线后 GMV/user +1.75%、广告收入 +1.53%。
GRACE · ⭐ 7/10
GRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval
🏢 Meta · 生成式推荐
GRACE 是 Meta 把生成式检索推上实时广告链路的服务系统:合规侧提出 Generative Target Matching,在 STATIC 式 catalog-valid 受限解码 trie 的每个节点预存 subtree-union 的 bitmask/Bloom matcher,解码每步把不可能含合格广告的 SID 前缀直接掩成 -inf,广告级定向通过率从 23.55% 升到 40.42%(收益主要来自高基数位置属性的 Bloom 级 40.74%→65.70%);算力侧针对宽 beam、短序列的 encoder-decoder 解码器重写 cross-attention beam-as-query 布局(纯 layout 变换,附等价性证明)、coalesced 短序列 self-attention Triton kernel、paged 自注意力 KV cache 与动态 per-step beam size,在 GH200 上相对 FA2/FA3 中更快者把 cross-attention 压到 1/68、self-attention 压到 1/23.4~1/25.8,解码器 P99 从 197.7ms 降到 17.8ms(11.1x),端到端 P99 53.6ms 落在 70ms 计算窗口内。
HRPO · ⭐ 7/10
Hierarchical Residual Policy Optimization for Generative Recommendations
🏢 Kuaishou · 生成式推荐
HRPO 把 SID 生成式推荐后训练的 item 级终端反馈,先用 cohort 分组+收缩估计出 SID prefix 效用,再沿 trie 做残差分解并累积成 credit-to-go(telescoping 到终端效用减前缀基线,从而同位置跨候选可比),最后用逐位置组内归一化+PPO 截断+KL trust region 的 RRPO 保守更新策略。
STEPS · ⭐ 7/10
A Self-Triggered Agentic Push Recommendation System
🏢 ByteDance · 其他
STEPS 把工业推送的"是否发、何时发"重构为自触发 agentic 闭环:系统不仅决定当下是否推送,还生成自己下一次被唤醒的时刻,从而摆脱离线预排频次(缺实时性)与定时轮询(算力与时机两难)两种被动范式。框架由三个 agent 组成——planning agent 用 Gated-RTG(乘性门控注入 return-to-go,解决条件被高维状态淹没)+ 100 个等频桶的序数回归生成下次唤醒间隔 Δt;execution agent 沿 GAVE 的价值引导结构但改用 Bellman 方程学 Q 值以纠正离线日志的次优行为,并用 advantage 权重重加权动作损失;filtering agent 是从 execution agent 蒸馏出的 3 层 MLP,刻意不含 item 特征以避免触发 10 倍开销的召回/粗排/精排级联。抖音(超 10 亿用户)14 天全随机 A/B:UAD +0.2843%、推送权限关闭率 -1.9089%、算力 -79.42%(其中 -74.88% 来自 filtering agent)。
Exp-RSFT · ⭐ 7/10
Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback
🏢 Meta · 生成式推荐
针对生成式推荐后训练中日志反馈稀疏且带噪、学出来的 reward model 无法泛化的问题,本文分析 Exp-RSFT——把每条日志轨迹按 exp(R(τ)/λ) 加权做监督微调,等价于 KL 约束下对行为策略的指数倾斜,因而完全离线、不需要 reward model 也不需要倾向性分数;理论上证明其次优性分解为随 log(1/p) 增长的覆盖代价与随 O(σ√(T·log|A|)) 增长的噪声代价,二者随温度反向移动并在闭式 λ=2√(R_max·ε/log(1/p*)) 处取最优,且覆盖代价随轨迹长度线性而非指数累积;HSTU 骨干上的实验在 ML-1M/ML-20M/Amazon Books 与私有 StreamCo 上复现了预测的倒 U 曲线,Exp-RSFT 五项排序指标全线最优(相对 BC NDCG@10 +8.5%~+12.3%,StreamCo 相对 RSFT +106.20%),而 PPO 与 DPO 因过优化一个连 Item Mean 都打不过的 reward model 而严重崩塌。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| KGD | Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation | 生成式 / 判别式 | 🏢 Shopee | 8 | 9 |
| GRACE | GRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval | 生成式 | 🏢 Meta | 8 | 7 |
| HRPO | Hierarchical Residual Policy Optimization for Generative Recommendations | 生成式 | 🏢 Kuaishou | 8 | 7 |
| STEPS | A Self-Triggered Agentic Push Recommendation System | 其他 | 🏢 ByteDance | 7 | 7 |
| Exp-RSFT | Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback | 生成式 | 🏢 Meta | 7 | 7 |
| SmartGR | SmartGR: Hierarchy and Beam-Aware Knowledge Distillation for Generative Recommendation | 生成式 | 🎓 学术 | 7 | — |
| LIME-Rec | Auditing Semantic Gains in Sequential Recommendation: A Lightweight Recovery Test | 判别式 | 🎓 学术 | 7 | — |
| UnpairGR | Unpaired Modality-Agnostic Generative Recommendation | 生成式 | 🎓 学术 | 6 | — |
| OMEGA | Collaborative Memory Augmentation for Generative Recommendation | 生成式 | 🎓 学术 | 6 | — |
| MODE | MODE: Mutual Optimality in Direct Effects of Reciprocal Recommendations in Matching Markets | 其他 | 🎓 学术 | 4 | — |
| — | Between-User Collapse Under Popularity-Biased Feedback: A Centered-Covariance Theorem and Computable Phase Boundary | 判别式 | 🎓 学术 | 4 | — |
| — | Scaling an Autoregressive Transformer for Single-Cell Generation | 其他 | 🎓 学术 | 4 | — |
| GARDRec | GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation | 判别式 | 🎓 学术 | 4 | — |