← 返回报告列表

2026-08-26 日报

日报 📅 2026-08-25
语义 ID 残差量化的路线分歧与工业推荐对齐
semantic-id quantization normalizing-flow industrial
📊 共 10 篇 · 精读 6

2026-08-26 日报

主题: 语义 ID 残差量化的路线分歧与工业推荐对齐

标签: semantic-id · quantization · normalizing-flow · industrial

📊 统计: 共 10 篇 · 精读 6 · 🏢 工业界 6 · 🎓 学术 4 · llm 1 · generative-rec 4 · discriminative-rec 5

综述

今日 10 篇:生成式推荐 4 篇、判别式推荐 5 篇、LLM 1 篇,工业与学术各 5 篇,其中 6 篇精读。罕见的是一组三方对照:清华与腾讯的 Tlow 用 Glow 式可逆流把语义嵌入掰成标准正态,就此离开残差量化、改用最朴素的 PQ 并行解码;快手 PRQ-KMeans 把病根定在层间传递算子——全码字相减留下残差夹带,遂用带正交约束的投影残差留在层级里修;而 8 月 21 日快手的 Dynamic PV-S2 认定条件稀疏是层级结构的原罪,砍掉一层换单级大码本。三者诊断同一症状却开出互斥处方,且前两篇同日发布、互不引用。工业侧,快手 TAGR 把直播广告分钟级的目标漂移拆成 token、意图、对齐三层时序自适应,线上收入 +16.1%;阿里 NMRL 先证伪端到端联训多模态编码器,再以 Mine-Then-Train 挖干净三元组微调,线上 CTR +1.5%。北大与蚂蚁的 ELR 是纯学术工作,指出学习率与参数范数主要经比值支配 loss 轨迹。值得关注的是:语义 ID 的瓶颈正从量化算法移向被量化的表示空间。

重点论文

Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining · ⭐ 8/10

🏢 Ant Group · LLM

揭示并系统验证 ELR collapse:LLM 预训练中学习率与参数范数主要通过比值 ELR=η/‖W‖_F 支配 loss 动力学——跨 4 类架构/3 数据集/3 优化器/100M-1B 的 26 组对照中,ELR 逐步匹配即让整条 loss 轨迹以中位 2.5×10⁻³ 重合(比换种子的 1.11-1.62×10⁻² 抖动小 4.3-9.0 倍);坍缩精度由 QK-Norm、可学习 RMSNorm gain 与 LR-范数变化时间尺度决定(固定 gain 让参数化更尺度不变却使误差涨 3.5 倍,证否静态对称性解释);只调 LR 匹配 ELR 即可复现 weight decay(4.8×10⁻³)与 Hyperball(1.2×10⁻³)的目标 loss 轨迹;把 functional scaling law 的 LR 换成 ELR 后,仅用非 Hyperball 数据拟合的律可零重拟合外推到 Hyperball(RMSE 0.2508→0.0212,11.83×),并解释了 norm control 的 delayed acceleration 是「收益早获得、晚显现」,进而通过后期加快范数增长重塑 ELR 日程拿到比 weight decay 基线更低的最终 loss。

TAGR · ⭐ 8/10

TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising

🏢 Kuaishou · 生成式推荐

TAGR 把直播广告的"投放目标本身在分钟级漂移"识别为生成式推荐失效的共同根因,并沿 token/意图/对齐三层做时序自适应:LSID 保持层次化码本词表固定、仅按当前直播场景与带货商品每分钟重算并重分配 token(末层用主播 ID 哈希,Cpr 1.42→1.01、碰撞率 0.42→0.02,level-1 稳定性仍 ≥90%),IAG 用 stride {1,2,10} 的多尺度进房主序列加分通道辅助行为构造请求时意图,并以"post-request 反馈深度 × 用户价值 × eCPM 分位"加权 NTP,IOPO 则每 200 步做一小段当前策略 GRPO(行为对齐的 token 余弦 reward + 价值对齐的 RM reward)、其间穿插 NTP 维护步以保住已学行为分布;在快手 4 亿日活直播广告平台部署为生成式召回通道,进房率 +8.5%、加购点击率 +7.4%、收入 +16.1%,冷启动直播流 +18.4%、低价值用户 +28.8%,腰部主播召回占比 87.1% 对比判别式通道的 76.5%/54.8%。

Tlow · ⭐ 8/10

Tlow: Flow-based Item Tokenizer for Recommendation

🏢 Tencent · 生成式推荐

Tlow 用 Glow 式可逆流(ActNorm + Invertible Linear + Affine Coupling,4 block × 4 step)把物品语义嵌入变换到标准正态潜空间,一次拿到维度独立与分布简单两个性质,使最朴素的 PQ + K-means 独立量化就能产出语义清晰、可并行解码的 token ID,并用码本空间与 token embedding 空间的余弦相似度矩阵 MSE 对齐作码本引导;四个 Amazon 数据集 16 个指标全 SOTA,跨域/多模态/冷启动分组均有效,微信图片推荐线上 A/B 全局 UCTR +10.32%、新发布图片 UCTR +11.64%,部署只需 4096 个 token embedding 替代数千万物品 embedding。

NMRL · ⭐ 7/10

Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios

🏢 Alibaba · 判别式推荐

阿里淘宝展示广告先证伪了「端到端联训多模态编码器与 CTR 模型(E2EM)能在强预训练编码器之上继续涨点」这一业界直觉——GAUC 全程为负、9 组优化器/学习率无一例外低于冻结基线、梯度一致性从 SCL 的 0.144/0.849 崩到 0.016/0.006、序列侧联训显存 25.09×——归因为「点击只有部分可归因多模态语义(MM-Mean/Max GAUC 仅 0.541/0.536),原始 CTR 标签是含糊监督,而全共享参数的多模态编码器会被噪声梯度跨 item 传染(ID 特征因参数解耦而免疫)」,进而提出 Mine-Then-Train:先用 TaskRes 式残差标注模型(冻结 SCL 编码器 + RK-Means SID + 零初始化 3×8192 SID Decode Codebook,端到端接 CTR loss)学到与 ID 特征正交的点击偏好,再按「SCL 相似度差 < 0.05 且标注分差 > 0.15」双阈值从 CTR 日志挖出 3000 万条三元组(人工评测证实高置信组胜率 85% vs 低置信组 42%),最后用 triplet margin loss + SCL loss 防遗忘正则微调编码器,离线 GAUC/AUC 相对含 SCL 的强基线 +0.22%/+0.11%(优于直接接标注模型分数的 +0.13%/+0.08%),线上长期 A/B CTR +1.5%、RPM +0.5%,且因只改编码器可直接复用 SCL 已有部署管线。

PRQ-KMeans · ⭐ 7/10

PRQ-KMeans: Projection Residual Quantization for Semantic ID Tokenization

🏢 Kuaishou · 生成式推荐

PRQ-KMeans 把分层 SID 构造重新表述为「渐进共性剥离」,指出全码字相减会在所选质心方向留下实例特定的 residual carryover(工业 L1/L2 实测 9.89%/10.17%,显著高于 128 维各向同性基线 7.07%)让下一层码本重复表示已表达的变化,并利用 post-hoc 设定不受加性重构约束这一自由度,用「与所选质心正交的最小改动投影残差」替代相减,配合全局均值分量剥离与 Top-k 余弦软质心精炼,在快手 KuaiSearch 工业搜索上把 L2 前缀利用率从 47.88% 提到 57.78%、Order HitRate/MRR 较 RQ-KMeans 提升 7.4%/11.8%,并在四个公开 benchmark 上全面最优。

全部论文

模型 标题 类别 公司 摘要分 精读分
— Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining LLM 🏢 Ant Group 8 8
TAGR TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising 生成式 🏢 Kuaishou 8 8
Tlow Tlow: Flow-based Item Tokenizer for Recommendation 生成式 🏢 Tencent 8 8
NMRL Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios 判别式 🏢 Alibaba 8 7
PRQ-KMeans PRQ-KMeans: Projection Residual Quantization for Semantic ID Tokenization 生成式 🏢 Kuaishou 7 7
— From Gradient-Boosted Trees to Deep Recommenders: Practical Lessons from Migrating a Production Customer Support Recommender 判别式 🏢 Intuit 7 7
UniSpecRec Rethinking Semantic Alignment in LLM-Enhanced Collaborative Filtering: A Spectral Decoupling Approach 判别式 🎓 学术 6 —
CodeHID CodeHID: Learning an Addressable Hierarchical Code Index for Generative Code Retrieval 生成式 🎓 学术 5 —
RetrievalFormer RetrievalFormer: A Dual-Encoder Transformer for Efficient Approximate Nearest Neighbor Retrieval and Cold-Item Recommendation 判别式 🎓 学术 5 —
— Auditing Return Conditioning as a Control Knob: An Offline Diagnostic for Decision Transformer Recommendation 判别式 🎓 学术 4 —