2026-W36 周报
日期范围: 2026-08-31 ~ 2026-09-06
主题: 工业推荐的自我举证:消融、度量与机制断言撑不住主张
标签: industrial · semantic-id · quantization · multi-task · parameter-scaling
📊 统计: 共 59 篇 · 精读 17 · 覆盖 6 个工作日
周度综述
本周 6 份日报共入库 59 篇;日报口径下 LLM 20、判别式推荐 17、其他 13、生成式推荐 10,精读名额仍落在有线上系统的公司。罕见的是六期主题几乎全收敛到同一件事:工业推荐论文如何为主张举证。周窗口内 16 篇精读 9 降 5 平 2 升,平均 -0.72 分;下调由精读复核发现,理由全落在证据结构而非方法价值,评分标准本周只新增一条 09-08 才生效的 Agent 外壳规则。九篇失分同型,可归四类。一是消融幅度大过全部优势:华为 PTDG 三个退化变体全跌破最强公开基线 PMTRec,每项损失单独超过它对该基线的全部优势 +0.68%;陌陌 MORE 折回主表口径后全消融底座 +0.41% 低于 OneTrans 的 +0.54%,单组件归因之和达全消融的 2.21 倍,美团 UniCon 为 2.1 倍。二是度量与被优化的目标同源:阿里 LLM4AIGQ 的相关性与价值两个离线指标,分别就是奖励里的同族编码器与同一个 judge,唯一独立的 Gemini 对比反在 DPO 后从 57.53% 掉到 54.95%。三是机制被断言而非被测量:PTDG 的信号侵蚀断言 12 次却零测量、从未可视化学出的依赖图,MORE 的 information flow 出现 16 次而 gradient 仅 2 次且都是断言。四是归因错位或不可加:网易 AutoLR 把 9 次跨表面跨基线实验的提升逐列相加且未披露格补 0;高德 SPAR 的 TV-SFT 约 95% 增益来自顺带引入的 LoRA,而非它命名的防遗忘锚定;Meta CORAL 的两个战果分处不同服务、从未同时兑现。另一面是持平与上调的几篇恰恰证据最硬:腾讯 PCG 的 TGR 四个子系统各有生产 A/B 与全量记录,并自承仍是一摞耦合模型;Qwen3.8-Flash-Next 的稳定性一节有可操作定义与单变量隔离:只开关 GatedNorm 把 loss spike 率从 32.0 压到 3.2/万步;高德 HF-SID 量化器零改动,26.77 个点全来自表征侧,线上 PV_CVR +6.74%;字节 ReST 有一周 20% 流量 A/B。上调的两篇都在自曝口径:SMELT 整篇纠正只对齐参数量会把循环的重复前传记成架构优势,并完整计入该成本;RSLM 给出结构性理由——MIPS 必须保内积,变换只能正交,免训练是约束的推论而非效率选择。另有一条技术线索:HF-SID 与 Google RSLM 互不相关、领域不同(生成式推荐的语义 ID 对 ANN 索引的向量量化),却独立得出同一条方法论:先修表示,别修量化器。
每日概览
2026-09-01
- 主题: 语义 ID 与 ANN 双线会师:先修表示,不修量化器
- 论文数: 19 · 精读: 6
2026-09-02
- 主题: 工业规模化的三把尺子:替换边界、营收口径与算力匹配
- 论文数: 9 · 精读: 3
2026-09-03
- 主题: 工业署名不等于工业证据:大厂推荐论文的叙事与证据落差
- 论文数: 7 · 精读: 2
2026-09-04
- 主题: 度量自指:工业推荐用被自己优化的尺子做证明
- 论文数: 9 · 精读: 2
2026-09-07
- 主题: 工业推荐的自我举证难题:消融与算术加总撑不住主张
- 论文数: 7 · 精读: 2
2026-09-08
- 主题: 机制被断言与机制被测量:统一排序骨干对照召回标度律
- 论文数: 8 · 精读: 2