2026-W32 周报
日期范围: 2026-08-03 ~ 2026-08-09
主题: 单模型替级联、重算力挪离线:生成式推荐工业化的收敛
标签: industrial · semantic-id · rl · knowledge-distillation · sequence-compression · parameter-scaling
📊 统计: 共 35 篇 · 精读 14 · 覆盖 5 个工作日
周度综述
本周 5 份日报共入库 35 篇论文,其中 14 篇精读;按类别计生成式推荐 13 篇、判别式推荐 11 篇、LLM 9 篇、其他 6 篇(含跨类重复计数),工业界 14 篇、纯学术 21 篇,但高分精读几乎被工业界成果垄断。本周有三条主线。其一,多阶段级联正被单模型收敛:快手 UniGD 把自回归 SID 生成与显式相关性打分统一进同一 decoder-only 骨干,用 CAGE 在梯度层面协调两个目标,线上以单模型替掉级联,一周 A/B 广告收入涨 5.78%、检索延迟从 13.0ms 降到 8.7ms;Yandex 的 Gryphon-v2 以训练期专用的 Teacher Ranker 对 on-policy rollout 做 Rollout Distillation,用一个 0.5B 模型替掉 15 个以上召回器与粗排精排,活跃用户 +1.41%、吞吐约 4 倍且时延持平。其二,最贵的那段算力被系统性地挪进离线或服务层:字节 TM20K 让教师保留 20K 全量 token 一次性训练并缓存 logits,学生用三种零参数 token merge 把平均长度从 8.8K 压到 1.8K,再靠蒸馏找回教师约 85% 的增益,线上 ADSS +1.036% 而延迟仅 +5.6%;快手 SITA 用 N 个并行码本把完整行为序列离线压成语义组织化的兴趣 token,让语义 ID 从读取端探针下沉为长序列压缩的组织骨架;Meta 的 GRACE 则改写解码布局与受限解码 trie,把广告召回解码器 P99 从 197.7ms 压到 17.8ms。其三,增量正从骨干选型转向后训练与奖励定义:快手 HRPO 沿 SID 前缀树做残差信用分解得到 credit-to-go,Netflix 与 Meta 的 Exp-RSFT 用 exp(R/λ) 加权做纯离线 SFT、完全不需要奖励模型,京东 DEGR 把重排的价值定义扩到跨请求探索,线上 UCTR +1.22% 而 TP99 仅增 3.2ms。其余重点包括本周最高分的 Shopee KGD(读写参数解耦让 encoder 每日刷新而不失效下游适配,GMV/user +1.75%)、Meta FAIR 的 Skaling(给 Chinchilla 加性律补上耦合外指数,插值与外推 MAPE 降低 1.5 到 3.9 倍)与蚂蚁 LLaDA MoE v2(首次系统刻画 MoE 扩散语言模型的 scaling 行为并实训 30B-A3B)。同时需警惕的是,评测口径自我设限与个性化声明缺乏对照在本周多篇论文中反复出现。
每日概览
2026-08-04
- 主题: 生成式推荐工业化:预训练刷新、离线后训练与服务加速
- 论文数: 13 · 精读: 5
2026-08-05
- 主题: 语义 ID 下沉为系统骨架,扩散 MoE 立 scaling 律
- 论文数: 6 · 精读: 3
2026-08-06
- 主题: 工业排序的价值定义之变:跨请求探索与延迟信号分离
- 论文数: 5 · 精读: 2
2026-08-07
- 主题: 统一模型与智能体重构推荐检索链路,兼论可审计性
- 论文数: 6 · 精读: 1
2026-08-10
- 主题: 把重计算挪到离线:超长序列蒸馏、标度律与后训练对齐
- 论文数: 5 · 精读: 3