2026-W37 周报
日期范围: 2026-09-07 ~ 2026-09-13
主题: 精读评分系统性下调:对照组的选法决定收益成色
标签: industrial · academic · parameter-scaling · sequence-compression · inference-serving · moe
📊 统计: 共 40 篇 · 精读 12 · 覆盖 6 个工作日
周度综述
本周(09-07~09-13 提交,覆盖 6 期日报)入库 40 篇:其他 13、生成式推荐 10、LLM 9、判别式推荐 8;工业 13 篇、纯学术 27 篇,摘要均分 6.03,其中 12 篇进入精读。
周度最硬的量化事实是精读评分的系统性下调:12 篇精读中 8 篇下调、3 篇持平、仅 1 篇上调,均分由摘要阶段的 7.58 跌到 6.83,净变化 -0.75。作为对照,流水线启用以来 266 篇精读的均值是 +0.21、下调率仅 30%;第三季度均值已转负(-0.14、37%),按投稿周归并则 W34 起连续四周为负(-0.56、-0.25、-0.68、-0.80),本周最极端。分布也不随机:8 篇下调全部带工业背景,持平与上调的 4 篇里有 3 篇是学术或研究院口径的受控研究。
失效模式可归为三类。其一,对照臂被弱化或不等参:陌陌 MORE 把全消融折回主表口径后仅 +0.41%,低于 OneTrans 的 +0.54%,相对最强公开骨干的净增量约 0.2pp,却多带 21.5% 参数;阿里国际 LazFormer 反复强调的 +3.44pt,是相对一个被故意破坏的 naive 3-epoch 配置,与务实的只训 1 个 epoch 相比真实增量仅 +0.26pt;Meta MoEMB 的专家轴 +10.4 实为 E=256 剪枝出来的退化曲线;快手 OneLA 的 1.54-2.46x 也测在较弱的 FullState 基线上。其二,增量无法与新增通道分离:淘天 VARG 的 GMV +1.45% 证明的是新开一条带预留配额、绕过粗排的通道,其署名创新 Prefix-GRPO 只占 RL 增益的 11.7%;Netflix 的 Constrained GRPO 声称推荐能力不退化,约束集里却根本没有推荐能力这一项。其三,招牌卖点那条指标零实测:字节 SequenceO1 在抖音全流量替换 TWIN V2、双端跑满一个月 A/B,是本周精读最高分(8),但这篇以系统效率为卖点的论文全文没有任何延迟、吞吐与显存实测;腾讯 ChronicleRec 拿到广告 GMV +1.61%,核心卖点“可缓存”却零服务侧验证。
反例同样清晰:蚂蚁 Ling Team 用 1,800 次独立从零预训练,把激活参数量、总参数量、训练算力三种对齐口径逐一证伪;UBC MoME 用等参、同槽位、只改路由规则的一组对照,把增益干净地归因到上下文;Meta FAIR 的 End-Of-Token 以一个终止 token 吸收残余概率质量、单次前向精确转出字节分布,是本周唯一上调(7→8)。可信度不取决于主张有多大,而取决于对照组的选法。
每日概览
2026-09-08
- 主题: 机制被断言与机制被测量:统一排序骨干对照召回标度律
- 论文数: 8 · 精读: 2
2026-09-09
- 主题: 扩容三连:宣称扩的那根轴有没有被真正扫过
- 论文数: 7 · 精读: 3
2026-09-10
- 主题: 合成数据的两阶段课程与托攻击的骨干依赖
- 论文数: 2 · 精读: 0
2026-09-11
- 主题: 工业推荐发力模型之外:跨阶段融合层与实验流程自动化
- 论文数: 2 · 精读: 0
2026-09-14
- 主题: 三重压缩:长序列、解码状态与词表的开销重分配
- 论文数: 9 · 精读: 3
2026-09-15
- 主题: 工业推荐的收益归因:对照组决定结论成色
- 论文数: 12 · 精读: 4