← 返回报告列表

2026-07-29 日报

日报 📅 2026-07-28
生成式检索路线之争与奖励侧判别信号注入
semantic-id pretrained-lm rl industrial parameter-scaling
📊 共 15 篇 · 精读 6

2026-07-29 日报

主题: 生成式检索路线之争与奖励侧判别信号注入

标签: semantic-id · pretrained-lm · rl · industrial · parameter-scaling

📊 统计: 共 15 篇 · 精读 6 · 🏢 工业界 5 · 🎓 学术 10 · generative-rec 8 · llm 6 · discriminative-rec 2 · other 2

综述

当日 15 篇,生成式推荐 8 篇、LLM 6 篇,判别式与其他各 2 篇,工业与学术近乎对半,其中 6 篇完成精读。最大看点是路线之争:Meta 的 The Case Against Generation for Retrieval 论证生成式检索在 web 规模属架构错配,改用 LLM 做判别式双塔,0.6B 学生反超 8B 的 OneRec-Think,结论与三天前 Snap 的 EGR 正相反。第三条路是保留生成、把判别信号从奖励侧注入:快手与中科院的 RGD 用 KL 正则奖励最大化的闭式解在每个 SID 解码步重加权,业务目标切换无需重训生成器;南开与快手的 RecoReward 让推荐器信号只进训练奖励、不进生成输入,物品描述保持全量可缓存。阿里 SPARC 先上下文化再压缩,一次交互只占一个 token;Spotify 以“货架假设”作为规划与履行的契约,并诚实披露负结果。Harvard 与 MIT 的 CD scaling law 把重复与改写数据折算成等效新鲜 token。趋势是生成能力正从解码通道退回监督与奖励通道。

重点论文

RecoReward · ⭐ 8/10

RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation

🏢 Kuaishou · 生成式推荐

RecoReward 把用户监督限制在「训练期奖励」这一条通道里——用行为训练的冻结双塔 DSSM 对 MLLM 生成的直播描述打分,以 RAS = 目标用户中心亲和 - λ×非目标用户中心亲和 剥离广泛共享的背景亲和,再用群体相对策略优化训练生成器,从而同时拿到 user-informed 训练与 content-only 服务(推理时不需任何用户信息、单条描述全量复用);RecoReward-9B 在快手直播召回 benchmark 的七个指标上全部第一,相对 Qwen3.5-9B 底座提升 31.7-40.4%,一周在线 A/B 关键页面有效用户渗透 +0.265%、外流曝光/用户 +0.791%/+0.740%。

Bridging Compute- and Data-Optimal Pretraining · ⭐ 8/10

🎓 学术 · LLM

提出 Compute-Data (CD) scaling law,用 token 有效性函数 η=(R/r)(1-e^{-r/R}) 把重复/改写产生的 derived token 折算成 fresh-token 等价物代入 Chinchilla,其饱和天花板 R*=K(D/N)^ρ N^σ 随模型规模与数据可得性双向收紧(改写衰减比重复陡约 3 倍),从而连续桥接 compute-optimal 与 data-optimal 两端、划出 compute/data/model-bound 三区间,并给出『4-epoch 法则只对约 3B/1× Chinchilla 成立、改写在 N≥7B 失效』的可查表处方。

RGD · ⭐ 7/10

Reward Guided Decoding for Generative Recommendation

🏢 Kuaishou · 生成式推荐

RGD 把生成式推荐的价值导向解码形式化为 KL 正则化 reward 最大化,导出闭式 Boltzmann 重加权分布 Q*∝P·exp(R/β)(等价于按 log P + R/β 排序),并用一个 stop-gradient 复用冻结 decoder 隐状态的链式 bottleneck-MLP reward head 在每个 SID 解码步注入奖励(pre/post/hybrid 三种注入模式),使业务目标切换无需重训基座生成器;三个 Amazon 数据集上全面超过 TIGER/HSTU/RPG/PROMISE(R@10 最高 +11.49%),并已部署于快手直播推荐,两周 A/B 页面 CTR +0.392%、直播观看时长 +0.689%。

LLM-Native TT · ⭐ 7/10

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

🏢 Meta · 生成式推荐

Meta 反对把生成用于检索:用 LLM 作判别式语义骨干复活经典双塔——cross-encoder 教师(verbalized yes/no logit 差 + user-conditioned NTP)经候选集分数分布 KL 蒸馏进共享 LLM 双塔学生(共享编码器 + EOS pooling + 跨数据集迁移 + user 塔单步 Coconut 隐式推理),在三个 Amazon benchmark 上以 Qwen3-0.6B 的 R@10 全面超过 Qwen3-8B 的 OneRec-Think,生产环境仅用 0.5% 训练数据即达 DLRM 平价且冻结三天不退化。

Hypothesis-Driven Shelf Generation for Personalised Recommendation · ⭐ 7/10

🏢 Spotify · 生成式推荐

Spotify 把 Home 首页的人工货架模板换成四阶段生成式流水线:LLM 从用户画像生成自然语言「货架假设」作为规划与检索之间的契约,再用内容类型特定 trie 约束的 Semantic ID 生成式检索接地到目录实体,再由 LLM 精选 item 并重写标题以兑现「整行承诺」,最后把离线预计算的货架作为候选注入 Home 排序竞争;离线生成式检索全面超过 BM25/稠密/混合基线(Overall 0.56→0.71),对齐阶段再把整体判官分抬到 1.27(+78%),但均匀随机曝光下 5 个内容池 3 负(节目 −41%)2 正(专辑 +36%)。

全部论文

模型 标题 类别 公司 摘要分 精读分
RecoReward RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation 生成式 🏢 Kuaishou 8 8
— Bridging Compute- and Data-Optimal Pretraining LLM 🎓 学术 7 8
RGD Reward Guided Decoding for Generative Recommendation 生成式 🏢 Kuaishou 8 7
LLM-Native TT The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers 生成式 🏢 Meta 8 7
— Hypothesis-Driven Shelf Generation for Personalised Recommendation 生成式 🏢 Spotify 7 7
SPARC SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation 生成式 🏢 Alibaba 7 6
TopoGR TopoGR: Revealing and Preserving Latent Structure of Semantic ID in Generative Recommendation 生成式 🎓 学术 7 —
Grevo Grevo: A Unified Generative Recommendation Framework with Evolutionary Item Indexing 生成式 🎓 学术 7 —
VaLiDRec VaLiDRec: Variable-Length LLM-Aligned Semantic IDs for Generative Recommendation 生成式 / LLM 🎓 学术 7 —
SharpRec Sharpness-aware Model Merging with Salience Recovery for LLM-based Cross-Domain Sequential Recommendation 判别式 / LLM 🎓 学术 6 —
— LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation 其他 🎓 学术 5 —
MARS MARS: Multi-Agent Re-ranking for Repeat-Order Food Delivery Recommendation 其他 / LLM 🎓 学术 5 —
TRWH TRWH: A Text-Driven Random Walk Heterogeneous GNN for Semantic-Aware Sparse Recommendation 判别式 🎓 学术 4 —
— A scaling law of contextual persistence in human language LLM 🎓 学术 4 —
TabRank TabRank: Chain-of-Thought Distillation for Table Re-Rankers LLM 🎓 学术 4 —