2026-08-12 日报
主题: 真实约束重塑最优解:单模型化、系统感知与分组校准
标签: industrial · semantic-id · knowledge-distillation · parameter-scaling · multi-task
📊 统计: 共 11 篇 · 精读 4 · 🏢 工业界 3 · 🎓 学术 8 · llm 3 · generative-rec 2 · discriminative-rec 5 · other 1
综述
今日 11 篇:判别式推荐 5、LLM 3、生成式推荐 2、其他 1;4 篇精读中 3 篇出自工业界(Yandex、Amazon、Meta),其余以学术工作为主。SONA 是 Yandex Music 的单模型生成式推荐器,也是已归档 Gryphon-v2 的系统级后继(后者的线上 A/B 即 SONA 的第 4 组实验),靠 History Compression 把 8192 事件历史塞进服务预算,一个模型替掉 15 个以上召回器加粗排精排,活跃用户 +4.53%、总收听时长 +6.30%,为 Argus 增量的 2.35 倍。Amazon 那篇稀疏 MoE 系统感知扩参(未提出命名模型)指出纯 model-FLOPs 预算下最优稀疏度只会贴在边界,换成集群“可交付 FLOPs”后内点最优才浮现,稀疏度落在 0.915–0.963、专家切分因子取 4。Meta 的 MARCO 用日志点击类型把 CTR/CVR 标量头拆成向量头,分组校准误差消除超 99%,每次点击转化 +2.80%。UC San Diego 的 SHE 立起 reward-SNR 地板,指出地板之下学逐样本获取策略只是拟合噪声。趋势清楚:把系统效率、分组校准与可检测性写进目标函数,而非事后修补。
重点论文
SONA · ⭐ 9/10
🏢 Yandex · 生成式推荐
SONA 是 Yandex Music 的单模型生成式推荐器,也是 Gryphon → Gryphon-v2 路线的系统级总报告:共享 encoder(8192 事件历史 + History Compression,深度只花在最近 2048 事件)一次编码后同时供 SID decoder 做约束 beam search(3×32k 码本,item 表征来自冻结 Qwen2.5-Omni + 协同精炼)与 item 级 Ranking Module 打分,后者唯一监督是从训练期专用、免特征、吃整年日志的 0.6B Teacher Ranker 蒸馏来的分数,候选同时取自当前 decoder 的 on-policy rollout 与 logged impressions;配 10 分钟权重同步、45 分钟端到端延迟的在线训练闭环,线上 A/B 用单模型整体替换 15+ 召回器 + 粗排 + 精排,活跃用户 +4.53%、总收听时长 +6.30%、点赞 +11.42%,为 Argus 增量的 2.35 倍。
Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts · ⭐ 8/10
🏢 Amazon · LLM
MOSAIC 把稀疏 MoE 的 scaling law 与一个算子级 MFU/显存性能模型耦合成单阶段离散优化:在 104M–2.7B 激活、最高 79B 总参的约 150 次从头训练上拟合含稀疏度 S 与专家切分因子 G 的四维联合定律(G 指数 η≈0.95 是唯一被数据钉住的系数之一),证明纯 model-FLOPs 预算下最优稀疏度只会落在数据支撑上边界、不存在内点解;把预算换成架构相关的「集群可交付 FLOPs」后内点最优才出现(S≈0.915–0.963、G=4),并在 32 节点 20 天包络下给出「产出 model FLOPs 最多的配置并非 loss 最低的那个」,最后用四个最高 250B 总参的实跑复现了预测 MFU 排序、以及 loss 排序在 model-FLOPs 轴与峰值等效硬件算力轴之间的翻转。
MARCO · ⭐ 8/10
MARCO: Click-Intent Decomposition for Calibrated Ads Conversion Prediction
🏢 Meta · 判别式推荐
MARCO 指出工业广告排序把异质点击压成单一 click 标签会造成被聚合校准掩盖的 per-intent 系统性偏差(CTA 点击转化率约为社交互动的 4 倍),并证明单标量输出在原理上不可能同时对各意图校准;解法是用日志点击类型作免费监督,把 CTR/CVR 的标量头扩成 K 维向量头分别在同质子群上训练与校准,serving 时按预测意图分布组合 Φ=Σλk·μk,配 last-impression/first-click 归因、四流水线一致性不变量与零延迟回退护栏,Meta K=2 部署把分组校准修到约 100%,组合后 post-impression NE +0.223%、每次点击转化 +2.80%、大盘累计 +0.98%。
SHE · ⭐ 7/10
Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition
🎓 学术 · LLM
本文区分「检测到昂贵 LLM 观测平均有用」与「学会逐样本何时该获取它」,给出 reward-SNR 可检测性地板 ρ*(N)≈2.8/√N,用匹配矩噪声安慰剂证明地板之下 in-sample oracle 的表面收益是噪声顺序统计量、用正对照排除流水线故障,并以 Structured Hypothesis Embeddings(冻结 LLM 产出 K 条排序、带置信度、有证据引用的意图假设)为载体,在 MIND/REES46/Amazon-Beauty 上显示逐样本获取策略在所有粒度上坍缩,处方是改用设计期 regime gate。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| SONA | Sona Technical Report | 生成式 | 🏢 Yandex | 9 | 9 |
| — | Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts | LLM | 🏢 Amazon | 8 | 8 |
| MARCO | MARCO: Click-Intent Decomposition for Calibrated Ads Conversion Prediction | 判别式 | 🏢 Meta | 8 | 8 |
| SHE | Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition | LLM | 🎓 学术 | 7 | 7 |
| — | Batch Size or Negatives? A Selection Rule for Memory-Constrained Recommender Training | 判别式 | 🎓 学术 | 6 | — |
| FedCGR | FedCGR: Federated Cross-Domain Generative Recommendation | 生成式 | 🎓 学术 | 6 | — |
| REAM | Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging | LLM | 🎓 学术 | 6 | — |
| VisGate | Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation | 判别式 | 🎓 学术 | 6 | — |
| TimeRoute | TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation | 判别式 | 🎓 学术 | 6 | — |
| — | Stay or Stray - A Dynamical Systems Viewpoint of Popularity Bias | 其他 | 🎓 学术 | 5 | — |
| MIJSR | Multi Interests for Joint Search-Recommendation Modeling | 判别式 | 🎓 学术 | 5 | — |