2026-07-22 日报
主题: 生成式检索与推荐 tokenization:把业务价值与拓扑结构注入 Semantic ID
标签: semantic-id · search-ranking · industrial · contrastive-ssl
📊 统计: 共 5 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 4 · generative-rec 2 · discriminative-rec 2 · other 1
综述
当日主线:生成式检索 × 推荐 tokenization
今日共 5 篇(2 篇生成式推荐、2 篇判别式推荐、1 篇检索),工业 1 篇(阿里)、学术 4 篇,主线是「如何构造更好的物品 token / Semantic ID,并让检索与排序在同一框架里协同」。
精读代表作 TSGR(阿里淘宝搜索)是这条主线上最完整的工业落地:它把商业价值同时注入两端——用 Query-aware Parallel SID 按 query-item 点击统计构建并行码本,让高价值且 query 相关的物品占据靠前 token 索引;再用 Value-aware Ranking Module 复用生成骨干隐状态并 cross-attention 融合物品 side-info,产出 PV/CTR/CVR 三头分数与生成目标联合优化,使单模型同时充当检索器与预排序器。离线 HR@1000 相对 FORGE 提升 9.16%,线上 A/B 拿到 GMV +1.64%、成交单量 +1.12%。
学术侧从不同角度补齐同一问题:TopoTok 直指量化 tokenization 破坏预训练语义邻接(拓扑失真),用组间/组内/物品间多级蒸馏恢复拓扑;DDMSR 从特征与序列双层做去噪(拉普拉斯平滑 + FFT 频率滤波 + 多模态对比对齐);HiCore 以多通道超图和多兴趣自监督缓解会话推荐的马太效应;PLAID-PRF 则在多向量稠密检索上复用质心向量做低开销伪相关反馈。
值得关注的趋势:Semantic ID / tokenization 正从「怎么量化」走向「量化里该编码什么」——业务价值(TSGR)、语义拓扑(TopoTok)都开始被显式注入 token 空间;同时检索与排序的边界持续模糊,单模型统一化是工业界的明确方向。
重点论文
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| TSGR | TSGR: Taobao Search Generative Retrieval | 生成式 | 🏢 Alibaba | 8 | 8 |
| TopoTok | Topology-Aware Tokenization for Generative Recommendation | 生成式 | 🎓 学术 | 7 | — |
| DDMSR | Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation | 判别式 | 🎓 学术 | 6 | — |
| HiCore | Mitigating Matthew Effect: Multi-Hypergraph Boosted Multi-Interest Self-Supervised Learning for Conversational Recommendation | 判别式 | 🎓 学术 | 5 | — |
| PLAID-PRF | PLAID-PRF: Pseudo-Relevance Feedback with Centroid-like Tokens in PLAID | 其他 | 🎓 学术 | 5 | — |