← 返回报告列表

2026-09-21 日报

日报 📅 2026-09-18
落地约束下的效率取舍:MoE 物化解耦与轻量化建模
moe inference-serving industrial academic
📊 共 6 篇 · 精读 1

2026-09-21 日报

主题: 落地约束下的效率取舍:MoE 物化解耦与轻量化建模

标签: moe · inference-serving · industrial · academic

📊 统计: 共 6 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 5 · generative-rec 1 · discriminative-rec 2 · llm 2 · other 1

综述

今日 6 篇:生成式推荐 1、判别式推荐 2、LLM 2、其他 1;仅 1 篇来自工业界(阿里高德 DreamX),也是当日唯一精读。IntBMoE 把 MoE 拆成参与度、执行量、物化量三量,用学习码本与共享超网络把整池专家基组合成与输入无关的 block,离线缓存后请求时成本不随专家数增长,在高德首屏 POI 推荐以平均 19ms、P99 38ms 全量上线;但线上 +2.4% UVCTR 的对照组是不带 MoE 模块的生产模型,增益主要来自采用 MoE 本身,消融中撑起领先的也是乘性门控与两层 block 深度这类通用技巧。DSRec 以 Mamba 与时间调制 SSM 分离长短期兴趣;新闻推荐访谈研究显示个性化受用户追踪顾虑与编辑权制约、可解释性罕被优先;AutoRecLab 让智能体从自然语言直接产出可运行的推荐实验。主线是在固定时延预算下重排成本,而工业增益的归因仍缺等架构对照臂。

重点论文

IntBMoE · ⭐ 7/10

IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts

🏢 Alibaba · 生成式推荐

IntBMoE 把 MoE 拆成参与度/执行量/物化量三个可独立设定的量,用 K 条学习码本 + 共享超网络把整池专家基逐层线性组合(无 softmax、1/√E 保方差、允许负系数)成 K 个与输入无关的两层 block,再对每个 token 做 Top-k block 路由并用 Dual-Path Residual Gating 把 value/gate 两路乘性耦合,从而同时拿到全参与、稀疏执行与有界物化;因复合 block 与输入无关可离线物化缓存,请求时成本不随专家数 E 增长,在 ImageNet-1K 上以 73.76% Top-1 超最强 baseline SMEAR 1.98 点、MiniPile PPL 降 2.9%、IntTravel HR@1 0.6852,并在高德首屏地图 POI 推荐以 19ms/P99 38ms 通过 60ms 预算、线上 A/B 相对 UVCTR +2.4% 后全量上线。

DSRec · ⭐ 5/10

Dual-Interest Sequential Product Recommendation With Multi-Granular SSM

🎓 学术 · 判别式推荐

针对同一物品在不同用户上下文中语义角色会变化的多义性问题,DSRec 把序列物品解耦成两路兴趣嵌入:长期兴趣经历史聚合刻画稳定偏好,短期兴趣受点击时间间隔调制以突出会话内意图;两路分别用全序列 Mamba 与时间调制 SSM 编码,再以残差交叉融合在保持语义独立的前提下完成跨粒度对齐,公开基准上优于现有最优方法。

Do We Care About Personalization and Explainability? An Interview Study with News Recommendation Engineers · ⭐ 4/10

🎓 学术 · 判别式推荐

对九家新闻机构的 15 位工程师与技术相关方做半结构化访谈,考察新闻推荐中个性化与可解释性的真实落地情况;发现个性化常因用户追踪顾虑、编辑权与资源限制而并非必选,即便已上线个性化推荐的机构也极少优先做可解释性,各家对可解释性的定义差异很大,最后给出面向新闻工程师的实操指引。

AutoRecLab · ⭐ 4/10

AutoRecLab: Describe the Experiment, Get the Code!

🎓 学术 · LLM

AutoRecLab 是一个基于 Python 的自主推荐系统实验平台:从自然语言提示推导出显式的实验需求,先构建并验证一个原型,再迭代扩展成完整实验,流程里组合了 RAG 文档检索、静态类型校验与执行引导的树搜索;演示中自动完成了显式转隐式反馈的对照研究,6 算法 3 数据集的基线比较里 9 次运行成功 8 次,单次成本约 1 美元。

全部论文

模型 标题 类别 公司 摘要分 精读分
IntBMoE IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts 生成式 🏢 Alibaba 8 7
DSRec Dual-Interest Sequential Product Recommendation With Multi-Granular SSM 判别式 🎓 学术 5 —
— Do We Care About Personalization and Explainability? An Interview Study with News Recommendation Engineers 判别式 🎓 学术 4 —
AutoRecLab AutoRecLab: Describe the Experiment, Get the Code! LLM 🎓 学术 4 —
CharBM25 Evaluating In-Context Learning and Retrieval Strategies for Devanagari Post-OCR Correction 其他 🎓 学术 4 —
Samsone Samsone: A Family of Open Small Audio Language Models for On-Device Inference LLM 🎓 学术 4 —