2026-07-02 日报
主题: LLM 语义驱动的工业召回负采样,兼及大模型量化与在线对齐
标签: industrial · contrastive-ssl · quantization · rl
📊 统计: 共 4 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 3 · generative-rec 1 · llm 2 · other 1
综述
今日共 4 篇入选:生成式推荐 1 篇、LLM 2 篇、其他 1 篇;工业界 1 篇(Meta)领衔,余 3 篇为学术工作。重点是 Meta 的 Cluster GOOBS,从正样本所在的 LLM 多模态语义簇内实时采难负样本,并以 O(1) 哈希物品池 GOOBS 免除全局 ANN 索引,即可支撑十亿级双塔召回负采样;公开数据集全面超越 in-batch、DNS、CBNS、ANCE,线上 A/B 提升 53% CTR,并把前 100 物品曝光占比从 50% 压到 32%。GSRQ 针对亚 1-bit KV cache 量化,指出标准 ℓ2 K-means 质心收缩会削弱方向对齐,提出 Gain-Shape K-means 即插即用替代并构建残差量化,LLaMA-3-8B 在 1-bit LongBench 平均准确率由 11.34 升至 33.54。异步 RLHF 工作则推导陈旧 rollout 的梯度偏置 O(S·η) 与崩溃时间 scaling law,给出双约束稳定性条件。整体看,LLM 的语义与多模态能力正从打分下沉到召回负采样等系统底层,而 KV 量化与异步 RLHF 稳定性研究共同指向更省、更快、更稳的大模型训练与推理基础设施。
重点论文
Cluster GOOBS · ⭐ 7/10
Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval
🏢 Meta · 生成式推荐
提出 Cluster GOOBS:用 LLM 多模态聚类从正样本同簇实时采难负样本,配哈希物品池(GOOBS)实现十亿级、零全局索引的双塔召回负采样;公开数据集全面超越 in-batch/DNS/CBNS/ANCE,Meta 线上 A/B +53% CTR 且把前100物品曝光占比从 50% 压到 32%。
GSRQ · ⭐ 6/10
GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache
🎓 学术 · LLM
针对亚 1-bit KV cache 量化,指出标准 ℓ2 K-means 的质心收缩会削弱方向对齐,提出 Gain-Shape K-means 作即插即用替代,并构建 Gain-Shape 残差量化 GSRQ。在 LLaMA-3-8B 上大幅超越强量化基线,1-bit 下 LongBench 平均准确率从 11.34 提升到 33.54。
Staleness-Learning Rate Scaling Laws for Asynchronous RLHF · ⭐ 5/10
🎓 学术 · LLM
研究异步 GRPO/RLHF 中陈旧 rollout 的影响,推导每步代理梯度偏置为 O(S·η) 并给出条件性"崩溃时间"scaling law,得到双约束稳定性条件,解释了为何在有限 horizon 下最大稳定学习率对陈旧度依赖较弱。偏理论,无线上推荐验证。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| Cluster GOOBS | Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval | 生成式 | 🏢 Meta | 8 | 7 |
| GSRQ | GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache | LLM | 🎓 学术 | 6 | — |
| — | Staleness-Learning Rate Scaling Laws for Asynchronous RLHF | LLM | 🎓 学术 | 5 | — |
| PAPA | PAPA: Online Personalized Active Preference Alignment | 其他 | 🎓 学术 | 5 | — |