2026-09-21 日报
主题: 落地约束下的效率取舍:MoE 物化解耦与轻量化建模
标签: moe · inference-serving · industrial · academic
📊 统计: 共 6 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 5 · generative-rec 1 · discriminative-rec 2 · llm 2 · other 1
综述
今日 6 篇:生成式推荐 1、判别式推荐 2、LLM 2、其他 1;仅 1 篇来自工业界(阿里高德 DreamX),也是当日唯一精读。IntBMoE 把 MoE 拆成参与度、执行量、物化量三量,用学习码本与共享超网络把整池专家基组合成与输入无关的 block,离线缓存后请求时成本不随专家数增长,在高德首屏 POI 推荐以平均 19ms、P99 38ms 全量上线;但线上 +2.4% UVCTR 的对照组是不带 MoE 模块的生产模型,增益主要来自采用 MoE 本身,消融中撑起领先的也是乘性门控与两层 block 深度这类通用技巧。DSRec 以 Mamba 与时间调制 SSM 分离长短期兴趣;新闻推荐访谈研究显示个性化受用户追踪顾虑与编辑权制约、可解释性罕被优先;AutoRecLab 让智能体从自然语言直接产出可运行的推荐实验。主线是在固定时延预算下重排成本,而工业增益的归因仍缺等架构对照臂。
重点论文
IntBMoE · ⭐ 7/10
🏢 Alibaba · 生成式推荐
IntBMoE 把 MoE 拆成参与度/执行量/物化量三个可独立设定的量,用 K 条学习码本 + 共享超网络把整池专家基逐层线性组合(无 softmax、1/√E 保方差、允许负系数)成 K 个与输入无关的两层 block,再对每个 token 做 Top-k block 路由并用 Dual-Path Residual Gating 把 value/gate 两路乘性耦合,从而同时拿到全参与、稀疏执行与有界物化;因复合 block 与输入无关可离线物化缓存,请求时成本不随专家数 E 增长,在 ImageNet-1K 上以 73.76% Top-1 超最强 baseline SMEAR 1.98 点、MiniPile PPL 降 2.9%、IntTravel HR@1 0.6852,并在高德首屏地图 POI 推荐以 19ms/P99 38ms 通过 60ms 预算、线上 A/B 相对 UVCTR +2.4% 后全量上线。
DSRec · ⭐ 5/10
Dual-Interest Sequential Product Recommendation With Multi-Granular SSM
🎓 学术 · 判别式推荐
针对同一物品在不同用户上下文中语义角色会变化的多义性问题,DSRec 把序列物品解耦成两路兴趣嵌入:长期兴趣经历史聚合刻画稳定偏好,短期兴趣受点击时间间隔调制以突出会话内意图;两路分别用全序列 Mamba 与时间调制 SSM 编码,再以残差交叉融合在保持语义独立的前提下完成跨粒度对齐,公开基准上优于现有最优方法。
Do We Care About Personalization and Explainability? An Interview Study with News Recommendation Engineers · ⭐ 4/10
🎓 学术 · 判别式推荐
对九家新闻机构的 15 位工程师与技术相关方做半结构化访谈,考察新闻推荐中个性化与可解释性的真实落地情况;发现个性化常因用户追踪顾虑、编辑权与资源限制而并非必选,即便已上线个性化推荐的机构也极少优先做可解释性,各家对可解释性的定义差异很大,最后给出面向新闻工程师的实操指引。
AutoRecLab · ⭐ 4/10
AutoRecLab: Describe the Experiment, Get the Code!
🎓 学术 · LLM
AutoRecLab 是一个基于 Python 的自主推荐系统实验平台:从自然语言提示推导出显式的实验需求,先构建并验证一个原型,再迭代扩展成完整实验,流程里组合了 RAG 文档检索、静态类型校验与执行引导的树搜索;演示中自动完成了显式转隐式反馈的对照研究,6 算法 3 数据集的基线比较里 9 次运行成功 8 次,单次成本约 1 美元。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| IntBMoE | IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts | 生成式 | 🏢 Alibaba | 8 | 7 |
| DSRec | Dual-Interest Sequential Product Recommendation With Multi-Granular SSM | 判别式 | 🎓 学术 | 5 | — |
| — | Do We Care About Personalization and Explainability? An Interview Study with News Recommendation Engineers | 判别式 | 🎓 学术 | 4 | — |
| AutoRecLab | AutoRecLab: Describe the Experiment, Get the Code! | LLM | 🎓 学术 | 4 | — |
| CharBM25 | Evaluating In-Context Learning and Retrieval Strategies for Devanagari Post-OCR Correction | 其他 | 🎓 学术 | 4 | — |
| Samsone | Samsone: A Family of Open Small Audio Language Models for On-Device Inference | LLM | 🎓 学术 | 4 | — |