← 返回报告列表

2026-04-29 日报

日报 📅 2026-04-28
生成式推荐的动作空间与信息缺口修补
semantic-id rl training-stability cold-start academic
📊 共 3 篇 · 精读 2

2026-04-29 日报

主题: 生成式推荐的动作空间与信息缺口修补

标签: semantic-id · rl · training-stability · cold-start · academic

📊 统计: 共 3 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 1 · generative-rec 2 · llm 1

综述

当日仅 3 篇入库,是个很小的日子:生成式推荐 2 篇、LLM 推荐 1 篇,仅 1 篇有线上证据。两篇精读都出自快手系,且都在追问生成式推荐“该输出什么、缺了什么信息”。GloRank(快手 + 港城大 + UCSD)证明 list-wise 重排“选第 k 个候选”的局部动作空间,会给输出层注入与编码器无关的映射方差,遂改用 RQ Semantic ID 的 4×256 固定全局词表生成物品标识符,配反事实 SFT 目标、GRPO 与 Trie 约束解码,冷启动鲁棒性远优于 GoalRank;但全文零效率数据、局部动作空间消融近随机、工业数据口径自相矛盾,结论存疑。RecoChain(南理工 + 快手)把“能 beam 出候选却判不出优劣”归因为缺少 SIM 式目标感知检索,让同一 decoder 续写检索子序列出排序分;其价值在归因与检索长度归零的消融,实验只在公开数据集、模型仅 2 层,并非工业落地。第三篇审计 LLM 推荐的方言偏差,方言确实改变选择,模型规模则无一致趋势。目标感知信息如何进入生成链,值得继续跟踪。

重点论文

GloRank · ⭐ 7/10

From Local Indices to Global Identifiers: Generative Reranking for Recommender Systems via Global Action Space

🏢 Kuaishou · 生成式推荐

GloRank 证明 list-wise 重排「选局部下标」的动作空间会给输出层梯度引入一项与 encoder 无关、不可消除的 mapping-induced 方差,遂把动作空间换成 RQ Semantic ID 构成的固定全局词表(4x256),用「采样排列+代理评估器 argmax」构造反事实 SFT 目标、GRPO 后训练(KL beta=0 最优)与 Trie 约束解码,在 Amazon-Books/ML-1M/工业数据集全指标超越 GoalRank 等 SOTA,冷启动下 MAP 仅降 4.9% 而 GoalRank 崩塌 88.4%,快手 4 亿 DAU 线上 A/B 取得 Watch Time +0.095%、Comment +0.462%。

RecoChain · ⭐ 5/10

Harmonizing Generative Retrieval and Ranking in Chain-of-Recommendation

🏢 Kuaishou · 生成式推荐

RecoChain 把生成式推荐「能 beam 出候选却判不出优劣(从 beam-256 里选 top-10)」的能力鸿沟归因为 GR 骨干缺失 SIM/TWIN 那一支目标物品感知的检索式序列建模,于是让同一个 decoder-only 骨干在层次 beam search 生成四位 SID(RQ-Kmeans 三位语义码 + 随机第四位去重码)并确定性映射回 item ID 后,用该候选的多模态 embedding 在 >10000 条超长历史上做余弦 GSU 检索取 top-M 子序列、按原时序拼接为后续 token 以 KV-cache 增量续写,在最后的候选 item ID 位置过 RankHead 出点击概率,与生成 log-prob 相加得最终排序分,训练时 SID 的 NTP 损失与 beam 级 0/1 BCE 无权重相加;TAOBAO-MM(8.79M 用户 / 35.4M item / 99M 交互)上重排相对 beam 生成在 beam=40 时最高提升 Recall@5 +4.53%、NDCG@10 +2.80%,且检索长度为 0 时增益归零(+0.12%)证明收益来自 GSU 检索机制本身而非多挂一个排序头,但增益随输入序列变长而衰减(32→128 时 +3.14%→+0.92%),全文无任何外部 baseline、无线上 A/B、无工业部署数据。

An Investigation of Linguistic Biases in LLM-Based Recommendations · ⭐ 4/10

🎓 学术 · LLM

论文用 Yelp 开放数据集与 Walmart 商品评论,构造按菜系/品类平衡的餐厅与商品清单,在美国南方英语、印度英语和印地语-英语语码转换三种方言变体提示下零样本冷启动地让 LLM 选出 top-20 推荐,并跨 20 个随机种子聚合各菜系/品类的响应计数。随后按模型族与主题分别拟合混合效应回归,用似然比检验与边际均值事后成对比较来考察模型规模与方言类型带来的组间差异。结果显示方言确实影响餐厅选择,mistral-small-3.1 与两个 llama-3.1 模型对印度英语和语码转换更敏感;商品侧 llama-3.1-70B 在七个品类中的四个对语码转换尤其敏感,而模型规模本身没有一致趋势,其影响被方言类型所调节。

全部论文

模型 标题 类别 公司 摘要分 精读分
GloRank From Local Indices to Global Identifiers: Generative Reranking for Recommender Systems via Global Action Space 生成式 🏢 Kuaishou 8 7
RecoChain Harmonizing Generative Retrieval and Ranking in Chain-of-Recommendation 生成式 🏢 Kuaishou 8 5
— An Investigation of Linguistic Biases in LLM-Based Recommendations LLM 🎓 学术 4 —