← 返回报告列表

2026-09-09 日报

日报 📅 2026-09-08
扩容三连:宣称扩的那根轴有没有被真正扫过
moe parameter-scaling sequence-compression inference-serving industrial
📊 共 7 篇 · 精读 3

2026-09-09 日报

主题: 扩容三连:宣称扩的那根轴有没有被真正扫过

标签: moe · parameter-scaling · sequence-compression · inference-serving · industrial

📊 统计: 共 7 篇 · 精读 3 · 🏢 工业界 3 · 🎓 学术 4 · llm 3 · discriminative-rec 1 · generative-rec 3

综述

今日 7 篇(llm 与 generative-rec 各 3、discriminative-rec 1;5 工业 2 学术),3 篇精读都在扩容,分野是宣称的那根轴有没有被真正扫过。字节 SequenceO1 是唯一扫过的:低秩 sketch 把 100K 历史压成目标无关的可缓存定长表示,抖音双端全流量替换 TWIN V2、跑满一个月 A/B,10k 到 85k 四个实测点未见饱和,同 1K×128 预算下以 +1.07% 压过五法最强的 +0.83%;但全程仅换 0.31 个基点,线上无置信区间与延迟护栏,缓存无增量更新、模型版本进键即推版冷启,瓶颈还转移到未优化的近期 10K 分支(6.5 倍于超长分支)。蚂蚁的 MoE 超参标度律方法论最干净:1,800 次独立从零预训练、三种对齐口径全部证伪;但复数的律只学习率那条成立,batch size 侧 scale-only 已达 0.71、加稀疏度仅改善 4.4%。Meta 的 MoEMB 一号卖点断链,专家轴 +10.4 实为 E=256 剪枝到 32 的退化曲线,全文无一例训练期加专家而正收益(唯一受控对照为负),+6.8 的 dense 对照还换了 17.5 倍总参骨干;但适配配方与自适应计算那半扎实。brief 里 REDSI 反直觉:atomic 标识符在所有 T5 规模上胜过 naive 与 semantic;A-MLE 属新增 Agent 外壳规则的适用对象,受控对照与失败披露优于同类。可信度不在主张,而在那根轴上被实测过的点。

重点论文

SequenceO1 · ⭐ 8/10

SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching

🏢 ByteDance · 判别式推荐

SequenceO1 把 100K 超长行为序列的瓶颈重新定义为「原始序列被反复存储/传输/计算」而非注意力复杂度,用可学习原型 + 原型维 softmax 的 Sketch Attention 把历史压成定长、目标无关(user-only)因而可跨候选跨请求缓存的 sketch,再用 STCA 分别在近期 10K 后缀与 sketch 上做目标条件推理,配 local KVCache(训练 3h TTL/命中 0.5、服务 1h TTL/命中 0.6)、MRLB、pipeline lift 与融合算子 FlashSA,把超长分支的解析 FLOPs 降低 49.9×(训练)/63.9×(推理),在抖音与抖音极速版全流量部署一个月,Finish +2.33%/+3.49%、Dislike -6.98%/-6.00%。

Hyperparameter Scaling Laws Across MoE Sparsity · ⭐ 8/10

🏢 Ant Group · LLM

蚂蚁百灵团队用 1,800 次独立预训练(六个激活参数规模 x 四档激活率、约 20T token、20 万等效 H800 卡时)证明最优学习率与 batch size 会随 MoE 激活率 A 系统性漂移,且激活参数量、总参数量与训练算力三种对齐口径都吸收不掉这个漂移,据此把 A 作为可分离的乘性幂律因子写进超参标度律,得到 eta=0.8343C^-0.1385A^0.1361 与 B=6.4765D^0.5181A^-0.0841(学习率的基准变量是算力 C 且对 M/D 分配不敏感,batch size 的基准变量是训练 token D,从而调和了 DeepSeek Law 与 Step Law 的矛盾),用 LOAO/LONO 分组交叉验证在 scale-only/additive/log-interaction/multiplicative 四个候选族中按参数更少选定乘性形式,并在冻结的 12B 总参、A=1/64、D=159B 联合外推留出目标上给出最接近实测最优的预测;但样本内 R^2 仅 0.72-0.78、bootstrap 区间互相重叠使候选形式间无统计显著差异,且 batch size 侧引入 A 的增量远弱于学习率侧。

MoEMB · ⭐ 6/10

MoEMB: Scaling Universal Multimodal Embeddings with Efficient Mixture-of-Experts Models

🏢 Meta · LLM

MoEMB 把通用多模态嵌入的扩容从表征维度/多向量/推理 token 转到「专家轴」,用预训练原生稀疏 MoE 骨干(Qwen3.5-35B-A3B/122B-A10B,E=256、top-8)配 pooling 与冻结 router 做对比微调,在仅用公开 MMEB-family 数据的口径下把 MMEB-V2 推到 70.4/72.4、MRMR 推到 51.6,并首次系统研究 MoE 嵌入器的六类自适应计算动作(含用 Gated DeltaNet 写入强度 β 作免注意力图的 token 显著性信号)与配套 kernel,省一半算力掉不到 1 点;但其宣称的「专家轴 +10.4」实为 REAP 剪枝退化曲线、「MoE 比 dense +6.8」混杂了换骨干,扩容归因缺乏受控证据。

全部论文

模型 标题 类别 公司 摘要分 精读分
SequenceO1 SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching 判别式 🏢 ByteDance 9 8
— Hyperparameter Scaling Laws Across MoE Sparsity LLM 🏢 Ant Group 8 8
MoEMB MoEMB: Scaling Universal Multimodal Embeddings with Efficient Mixture-of-Experts Models LLM 🏢 Meta 7 6
ReDSI REDSI: Addressing the Reproducibility and Evaluation Consistency of Differentiable Search Indexing for Document Retrieval 生成式 🎓 学术 7 —
PDMR PDMR: Passage-Driven Multi-ID Document Retrieval 生成式 🎓 学术 5 —
A-MLE Agentic ML Exploration (A-MLE) for Ads Ranking LLM 🎓 学术 5 —
— Exploring Bottom-Up Clustering for Creating Semantic IDs 生成式 🎓 学术 4 —