2026-09-07 日报
主题: 工业推荐的自我举证难题:消融与算术加总撑不住主张
标签: industrial · agent · multi-task · graph
📊 统计: 共 7 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 5 · discriminative-rec 1 · llm 5 · other 1
综述
今日 7 篇、2 篇精读,llm 占 5 篇,工业侧仅网易与华为。两篇精读栽在同一处:主张所依的数字经不起论文另一处的对照。华为 PTDG 把任务依赖改成实例级可学的低秩拓扑,日活过亿平台的 A/B 是真的;但相对最强公开基线 PMTRec 的全部优势仅 +0.68%,而去个性化、去 GCN、去因果掩码三个消融变体全部跌破 PMTRec,每项损失单独大过总优势;主打的信号侵蚀断言 12 次却从未测量。网易 AutoLR 把研究到上线评审交给 LLM 委员会,审计出 1,586 次评估、9 条 Launch Review;但摘要加粗的三个收益是把 9 次跨表面、跨基线实验的提升逐列相加、未披露格补 0,且零对照组,离线与线上血缘未留、互不可归因。它自曝噪声标定关闭、晋升阈值与候选 delta 的 IQR 同量级;正因改的是仓库主干而非 CORAL 式可逆控制面,才提出 KEEP 棘轮。余下 5 篇 brief 覆盖 agentic 记忆、scaling law 成本摊销、稠密检索局部更新与脉冲 LLM。机制越写越细、证据越拉越薄,能拿走的是工程配方而非因果解释。
重点论文
AutoLR · ⭐ 6/10
AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems
🏢 NetEase · LLM
网易 DASHEN 游戏社区 App 的 AutoLR 把工业推荐「研究 → Launch Review」这条路径的上游阶段交给自治 harness:多专家委员会先独立提案再圆桌综合、对抗评审与反驳产出带 file:symbol 编辑面的结构化候选,一个确定性的证据加权选择器按「过滤 → 多样性冻结窗口 → 委员会建议性重排 → top-1 执行 → 记忆门」分配试验预算(Beta(1,1) 平滑只作打分特征、明确不是 Thompson 采样),分层知识(外部研究 / 生产系统 / DASHEN 领域)加实验记忆做角色特化有界检索,LLM 只出提案、确定性控制器独占执行、指标提取、护栏与持久状态转移;几个月日志的路径感知审计从 4,250 条账本行还原出 1,586 次完整评估,九条 Launch Review 记录的相对提升算术加总为渗透率 +5.75% / 消费时长 +10.83% / VV +5.55%(论文声明为描述性、非合并处理效应),迭代成本迁移到 DeepSeek-V4-Pro/Flash 后约 RMB 3–4;论文同时命名了 KEEP 棘轮——一次单跑越过固定阈值即改写主干,而被审计配置里噪声标定是关闭的、参考下限 1e-3 与候选 delta 分布 IQR(1.20–1.26e-3)同量级。
PTDG · ⭐ 5/10
Personalized Task Dependency Graphs for Mitigating Signal Erosion in Multi-Task Recommendation
🏢 Huawei · 判别式推荐
华为 PTDG 把多任务转化漏斗的任务依赖从「全局统一的固定链」改成「实例级可学的低秩拓扑」:用两个骨干抽出的 item embedding 做 rank-q 分解生成 T×T 邻接矩阵、用用户/场景 MLP 产出的 γ 对 q 个隐因子做对角调制、乘上硬因果掩码剪掉语义回流后跑一层 GCN 建立跨任务捷径,再配 APM 按任务正样本率渐进 top-k 掩码解耦共享参数以化解梯度冲突;工业集平均 AUC 0.8878、KuaiRand1K 0.9081 均为最优,日活过亿的应用分发平台两周 10%/10% A/B 拿到 CVR +1.2% / eCPM +1.9%、延迟仅 +8ms;但相对最强已发表基线 PMTRec 的真实优势只有 +0.68%(其中 66% 集中在 7 个任务中的 2 个稀疏任务、稠密的 Task 4 上还低于 PLE 和 MoCoGrad),而三个退化变体全部跌破 PMTRec,且「信号侵蚀」这个 root cause 从未被直接测量。
AtomRec · ⭐ 6/10
AtomRec: Evolving Atomic Memory for Agentic Recommendation
🎓 学术 · LLM
把 agentic 推荐的用户与物品记忆从粗粒度摘要改成结构化的原子记忆单元,在相关记忆间建立语义链接,并在新交互到来时按字段级演化历史记忆。推荐时沿链接检索多跳证据路径而非孤立的邻居摘要,让协同信号以可解释的形式支撑排序,在四个公开基准上相对最强基线平均提升约 8.5%。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| AutoLR | AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems | LLM | 🏢 NetEase | 7 | 6 |
| PTDG | Personalized Task Dependency Graphs for Mitigating Signal Erosion in Multi-Task Recommendation | 判别式 | 🏢 Huawei | 7 | 5 |
| AtomRec | AtomRec: Evolving Atomic Memory for Agentic Recommendation | LLM | 🎓 学术 | 6 | — |
| — | Amortizing Scaling Law Construction Costs | LLM | 🎓 学术 | 5 | — |
| — | Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability | LLM | 🎓 学术 | 5 | — |
| Embedding Surgery | Embedding Surgery: Localized Updates for Adaptive Ranking Correction in Dense Retrieval | 其他 | 🎓 学术 | 5 | — |
| — | Large Language Models with At Most One Spike per Neuron | LLM | 🎓 学术 | 4 | — |