2026-W28 周报
日期范围: 2026-07-06 ~ 2026-07-12
主题: 生成式推荐工业闭环与 LLM 效率:从算力扩展到毫秒级检索
标签: semantic-id · industrial · search-ranking · pretrained-lm · parameter-scaling · transformer
📊 统计: 共 16 篇 · 精读 4 · 覆盖 5 个工作日
周度综述
本周(07-06~07-12)聚合 5 个日报共 16 篇入选、4 篇精读;类别以生成式推荐与 LLM 效率为双主线,判别式推荐与系统方向为辅。工业界密集发声:腾讯、阿里、快手、字节多家大厂占据全部精读名额,学术工作则集中在时间建模、缓存压缩与联邦鲁棒性等精细化议题,整体呈现「工业收敛、学术发散」格局。
技术趋势有三。其一,Semantic ID 生成式推荐持续深化并走向工业闭环:阿里 Lazada 的 UniSGR 把 semantic-id 生成式检索与多目标排序统一进单个 MoE encoder-decoder,用价值加权多 token 预测把生成对齐到 click/atc/pay,STARK 树注意力提速 beam search 约 200%,线上 GMV +5.68%。其二,生成式检索与 LLM 推理的「提速与扩展」成为焦点:阿里 HUJING 的 DaV-Gen 借鉴投机解码,用「起草-验证」把视频搜索延迟压到约 70ms(2.5x 于级联)、在线 ATS +2.09%;腾讯 WeChat AI 的 Hidden Decoding 沿序列长度维度扩算力,首次在 100B+ MoE(WeLM-HD4-80B/617B)实现前沿规模的 test-time scaling。其三,重尾回归校准与偏置纠正走向可部署:快手 PIT-SUN 用经验边际 CDF 表为观看时长/GMV/LTV 等重尾零膨胀目标提供一致校准,线上观看时长 +0.318%;学术侧 LBR 双端纠正 LLM 推荐的长度偏置,Fractal KV-Cache 把量化 KV cache 无损压缩 36–54 倍。
值得关注的论文:UniSGR(检索-排序统一,当周分数最高的工业系统)、Hidden Decoding(序列长度维度的前沿规模算力扩展)、DaV-Gen(毫秒级生成式检索)、PIT-SUN(重尾目标一致校准)、From Raw IDs to Semantic Planning(提出「语义规划」这一 semantic-id 演进新方向的框架性立场文)。综合看,本周主线是工业界把 semantic-id 生成式推荐与 LLM 效率方法收敛为有 A/B 增益的可落地系统,学术界则在时间、缓存、偏置等维度补齐细节。
每日概览
2026-07-07
- 主题: 生成式推荐主导:Semantic ID 统一检索排序与 LLM 推荐偏置校正
- 论文数: 5 · 精读: 1
2026-07-08
- 主题: 小模型级联逼近前沿:低成本 KOL 检索重排推理
- 论文数: 1 · 精读: 0
2026-07-09
- 主题: LLM 推理效率、多模态智能体推荐与联邦学习鲁棒性
- 论文数: 3 · 精读: 0
2026-07-10
- 主题: 工业级推荐与 LLM 双线:算力扩展、生成式检索提速、回归校准
- 论文数: 6 · 精读: 3
2026-07-13
- 主题: 生成式推荐信息利用:从 raw ID 到 semantic ID 与语义规划
- 论文数: 1 · 精读: 0