2026-09-01 日报
主题: 语义 ID 与 ANN 双线会师:先修表示,不修量化器
标签: quantization · semantic-id · training-stability · inference-serving · industrial
📊 统计: 共 19 篇 · 精读 6 · 🏢 工业界 6 · 🎓 学术 13 · generative-rec 6 · llm 4 · other 3 · discriminative-rec 6
综述
今日 19 篇(覆盖 08-29~08-31):生成式 6、判别式 6、LLM 4、其他 3,6 篇精读,近一月最大一期。主线是量化线的罕见会师:高德 HF-SID 把 SID 的病根从码本设计移到送进量化器的那个嵌入本身——tokenizer 把经纬度切成数字子 token,连续性在量化之前就没了,下游网格或聚类都救不回;量化器零改动(三层 K-means、同码本、同长度),Hit@200 的 26.77 个点全部来自表征侧,线上 PV_CVR +6.74%。Google 的 RSLM 在 ANN 索引侧独立走到同处:正交变换整成各向同性后接朴素固定码本;而 MIPS 必须保内积,变换只能正交,免训练是约束的推论而非效率选择。两篇互不相关却都判定“先修表示,别修量化器”,与 8 月下旬的 Tlow 同构。本期最高分 Qwen3.8-Flash-Next:GDN 与全注意力 3:1 混合、微块稀疏注意力、四分支门控残差、n-gram 嵌入表卸载;稳定性一节证据最硬(只开关 GatedNorm,loss spike 率 32.0→3.2/10k 步),但头条的 1/9 训练 FLOPs 是算术推导,零 GPU-hours。Snap 内容探索上调到 8:共享语料的 SUTVA 违背被从偏倚重定性为估计量的改变,观众侧读到的是无偏 direct 效应,+8.55% 的创作者供给被标为上线效应上界。美团 CHAP 下调到 6:三个对齐损失全是 (query, item) 二元组、码本冻结,标题的因果主张无消融支撑,扎实的是单趟残差级联生成(QPS 39.2→78.9);SetMIR 同容量消融站得住,但 +44%/+51% 是臂内归因。其余 13 篇为 brief,散在多模态 item 嵌入、早期束剪枝与码本联合训练。
重点论文
Qwen3.8-Flash-Next · ⭐ 9/10
On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
🏢 Alibaba · LLM
Qwen 团队把 125B-A6B 旗舰 MoE 的每个候选架构改动都放在「loss+下游 / 训练与推理成本 / 最优超参与稳定性」三轴上联合评估,落地为 GDN 与全注意力 3:1 逐层混合、微块粒度压缩索引器的稀疏注意力 QSA、四分支逐元素门控残差 GR、以及卸载到主存的单层 n-gram 嵌入表,用约 1/9 训练 FLOPs 在 14 个基准上 8 项超过 397B-A17B 前代。
HF-SID · ⭐ 8/10
HF-SID: High-Fidelity Semantic IDs for Generative Retrieval in Location-Based Services
🏢 Alibaba · 生成式推荐
高德 AMap 把 LBS 生成式检索里 SID 的失效点从“码本设计”重新定位到“量化之前的嵌入保真度”:3D 笛卡尔坐标变换 + 进位连续的极坐标标量表示 + 冻结数值编码器 + 逐类型 Type Embedding,经两阶段 Geo-CPT/Num-CPT 内化进 LLM,并只在最后一层残差上做结构对比学习;量化算法与 3-token SID 长度一字未改,AMap-L 上 SID 内平均地理距离降 95.9%、Hit@200 +26.77 点,线上 A/B PV_CVR +6.74%、UV_CVR +6.03%,同时释出 AMap-S 公开数据集。
Content Exploration Beyond the Feed: Creator Supply and the Shared Corpus · ⭐ 8/10
🏢 Snapchat · 其他
Snap 用四组生产随机实验(8 个月创作者消融、一年多观众消融、两个共同分流实验)证明短视频冷启探索的价值主要走创作者供给通道——相对最小保底,人均发布 +8.55%、至少发布一次的创作者 +7.10%,而观众侧只看到 views +1.74% / view time −2.13% 的混合 direct 权衡;论文进一步证明这不是功效问题而是识别问题:共享语料在任何单侧 A/B 中恒被抵消(与视野和样本量无关),共同分流虽能保留该通道但换手率 ω 把 t 周期实验的可表达份额封在 ωt,曲率信噪比 C≤1 时任何一致覆盖的置信区间返回无穷上端点的概率≥1/2−α,因此三周探针如预测般无法给语料渐近效应定号。
RSLM · ⭐ 8/10
RSLM: Training-Free Vector Quantization for Approximate Nearest Neighbor Search
🏢 Google · 其他
RSLM 把免训练旋转量化器与 ANN 系统结构耦合起来:用两趟级联分块 FWHT(O(D)、任意维度免零填充)加固定标准正态 Lloyd-Max 码本(K≤16 以适配 VPSHUFB 寄存器查表),并把 L2 范数校正从残差提升到『IVF 粗近似向量 + 量化残差』的最终重建向量,以一个 2 字节标量取代 ScaNN 需要逐数据集调参的 anisotropic loss;相对量化下 4-bit 在 5 个数据集全部 100% Recall@20@30、2-bit 拿到 99%+ Recall@20@40,端到端 1-bit GloVe 全扫召回 54.0% 胜过 ScaNN AVQ 45.6% 与 Faiss PQ 42.1%。
SetMIR · ⭐ 7/10
SetMIR: Multi-Interest Retrieval as Set Prediction
🏢 Snapchat · 生成式推荐
SetMIR 把工业多兴趣召回重写成集合预测:transformer 编码用户历史后由 K 个可学习 query 解码出一组(兴趣向量, presence 分数),训练时用匈牙利匹配把高意图目标一对一指派给 query、未匹配 query 收到显式缺席监督,从而在训练目标层面消除兴趣坍缩;服务时用 presence 门控 + query 级余弦 NMS 把固定 K 路 ANN 变成动态 K̃ 路,在 Snap DPA 上全指标超过 MIND/ComiRec-SA/DCM/KuaiFormer 四个多兴趣基线且 ANN 调用少 33%,上线为新召回源后整体 CVR +3.11%。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability | LLM | 🏢 Alibaba | 9 | 9 |
| HF-SID | HF-SID: High-Fidelity Semantic IDs for Generative Retrieval in Location-Based Services | 生成式 | 🏢 Alibaba | 8 | 8 |
| — | Content Exploration Beyond the Feed: Creator Supply and the Shared Corpus | 其他 | 🏢 Snapchat | 7 | 8 |
| RSLM | RSLM: Training-Free Vector Quantization for Approximate Nearest Neighbor Search | 其他 | 7 | 8 | |
| SetMIR | SetMIR: Multi-Interest Retrieval as Set Prediction | 生成式 | 🏢 Snapchat | 8 | 7 |
| CHAP | Preference Shapes Relevance: Cross-component Hierarchical Semantic Alignment for Personalized Generative Retrieval | 生成式 | 🏢 Meituan | 8 | 6 |
| CAMIE | CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval | 判别式 | 🎓 学术 | 7 | — |
| TAAL | TAAL: Mitigating Early Beam Pruning in Generative Recommendation via Temporal Autoregressive Alignment | 生成式 | 🎓 学术 | 7 | — |
| — | Generative Retrieval for E-commerce: Jointly Learning Embedding and Codebook with Same Product Cluster | 生成式 | 🎓 学术 | 6 | — |
| PRIME | PRIME: Mitigating Subgroup Optimization Competition in Shared CTR Top Networks with Plug-in Residual Input-Conditioned Mixture of Expert | 判别式 | 🎓 学术 | 6 | — |
| — | The Edge Spectrum of Choice-Derived Item Graphs: Strong and Weak Edges Encode Different Relations in Collaborative Filtering | 判别式 | 🎓 学术 | 6 | — |
| — | When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models | LLM | 🎓 学术 | 5 | — |
| — | Beyond Ranking Accuracy: Evaluating LLM-Cited Feature Rationales for Next Basket Repurchase Recommendation | 判别式 | 🎓 学术 | 5 | — |
| — | A Hub of Short Rows Inflates Intrinsic Dimension Estimation of Token Embeddings | LLM | 🎓 学术 | 5 | — |
| AgentMMRec | Agents as Knowledge Integrator and Utilizer in Multimodal Recommendation | 判别式 | 🎓 学术 | 5 | — |
| SemPOI-RL | SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation | 生成式 | 🎓 学术 | 5 | — |
| REIGN | REIGN: Refurbished Embeddings with Integrated Guidance Networks for Efficient Context-Length Scaling | 其他 | 🎓 学术 | 5 | — |
| ADR | Adaptive Doubly Robust Off-Policy Evaluation for Ranking Policies under Diverse User Behavior | 判别式 | 🎓 学术 | 5 | — |
| Manacá-1B | Manacá-1B: An Open, Reproducible Brazilian-Portuguese Language Model and a Tokenizer-Aware, Paired Evaluation | LLM | 🎓 学术 | 4 | — |