← Back to list

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

LLM Kakao
Abstract 8 │ Reading 7 │ Rating —
2026-08-20
Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim
Kakao Corp., Upstage AI
把超大规模 MoE 的最优学习率搜索从「模型规模 × token 预算」二维网格降到一维:用适配 MLA + Muon 的 μP(expert FC2 记为 vector-like、MLA 低秩投影维固定使其上投影 LR 缩放退化为 1)让最优 LR 在宽度与稀疏度耦合扩张(16→128 专家、激活专家数固定)时零样本迁移,再用「stable 阶段终止 + EMA 合并权重」从单次 proxy run 抽出几十个 token 预算点、对 log LR 拟合抛物线取顶点、在 log-log 空间线性回归(R²=0.95)外推出 10T token 的最优 LR 3.85×10⁻⁴,并由 Kakao 用它从零预训练 155B 总参/17B 激活基座模型、10T token 全程无 loss spike 完成验证,定 LR 的成本仅为全量训练的约 1%(98× 算力比)。
评分原因
摘要评分:通用性极强的 LLM 训练技术:给出 MoE + MLA + Muon 下的 μP 适配与 token 维外推的可复用配方,并在从零预训练 155B/17B 基础模型上真实验证,扩参与训练稳定性主线价值高,给 8。
精读评分:配方扎实且有罕见的真实工业验证(Kakao 自家 H200 集群从零预训练 155B/17B、10T token,全程无 loss spike,MMLU-Pro 落在算力-性能 Pareto frontier),μP 表与 EMA 替代 decay 两个工程细节可直接复用;但新颖性偏组合式(μP 迁移 + Bjorck 式 token 外推各有前作),核心主张「3.85e-4 是 10T 的最优 LR」无法直接验证、仅有「没有 loss spike」这条不对称的间接证据,附录 E 的 held-out 只跨 1.4x token 距离且 5 个点系统性偏高,稀疏度轴效应也无法与宽度轴分离,故给 7 而非 8。
moe parameter-scaling training-stability pretrained-lm industrial
目录

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

arXiv:2608.20061v1 · 2026-08-20 · Published as a conference paper at COLM 2026

作者:Nayeon Kim¹, Hojin Lee²†, Yunju Bak¹, Jaesun Park¹, Boseop Kim¹

机构:¹Kakao Corp.,²Upstage AI(†标注:"Work done at Kakao Corp.",即全部工作在 Kakao 完成)

一句话:把「超大规模 MoE 该用多大学习率」这个二维(模型规模 × token 预算)搜索问题拆成两个一维问题——用适配到 MLA + Muon 的 μP 消掉模型规模维,用 log-log 线性回归外推消掉 token 维——并用一次真实的 155B 总参 / 17B 激活基础模型、10T token 从零预训练把它验证掉。


一、研究动机与背景

1.1 MoE 让超参搜索变得不可承受

Mixture-of-Experts(Shazeer et al., 2017)已经是当代大模型扩容的默认路径:DeepSeek-V3、Qwen3-235B-A22B、Kimi-K2.5、GLM-5 全都是 MoE,因为它能在不成比例增加 per-token 激活参数和推理 FLOPs 的前提下把模型容量做大。但 MoE 同时引入了额外的超参(专家路由、负载均衡),把超参空间撑得比稠密模型大得多。

在这些超参里,学习率是决定训练成败的头号变量(Bengio, 2012;Smith, 2018;Kaplan et al., 2020;Yang et al., 2022;Li et al., 2025b),而它的最优值同时对模型规模和 token 预算敏感(Li et al., 2025b;Bjorck et al., 2025)。这意味着规模一变——不管是模型变大还是训练更久——就要重做一次昂贵的搜索。

论文用一张概念图把问题结构化:

Figure 1: (a) In conventional hyperparameter optimization, exhaustive 2D sweeps across both model scale (M) and token scale (D) are required to jointly predict the target scale; (b) Our approach decouples the two dimensions.

传统做法(图 1a)在 (模型规模 M, token 规模 D) 组成的二维网格上做穷举扫描,用网格上的点联合预测目标规模 ⋆ 处的最优配置。本文(图 1b)把两维解耦:μP 负责消掉 M 维(宽度方向零样本迁移),token scaling law 负责消掉 D 维(从少量 proxy run 外推),于是二维扫描退化成沿 token 方向的一次轻量一维搜索。

1.2 代价到底差多少:把「省下来的算力」量化

论文没有停在定性论述,而是把两条路线的算力直接算出来:

Figure 2: (a) 2D sweeps require scaling across model size, resulting in additional computation. (b) Total computation of the Target is approximately 98x larger than the sum of the Proxy runs.

  • 图 2a(1D vs. 2D 扫描):5 次 proxy 规模的 run 合计 64.8 ZFLOPs。如果还要沿模型规模方向扫(比 proxy 宽 1.5× 和 2× 的两档),分别再花 100.9 和 139.4 ZFLOPs,即额外 240.3 ZFLOPs——是 proxy 成本的 3.7 倍。二维扫描的开销主要不来自 token 方向,而来自模型规模方向。
  • 图 2b(Proxy vs. Target):目标模型(155B 总参 / 17B 激活,10T token)的训练算力约 6328.3 ZFLOPs,是全部 proxy run 之和的 98×。也就是说,用不到全量训练 1% 的算力去定学习率是完全值得的,前提是这个估计得准。

(FLOPs 口径遵循 Narayanan et al., 2021。)

1.3 已有工作留下的洞

μP(Yang & Hu, 2021)与 μ-Transfer(Yang et al., 2022)提供了零样本超参迁移的框架,但它们的设计对象是稠密模型,主要扩展轴是宽度。MoE 多了一条 稀疏度(sparsity) 轴——由激活专家数与总专家数之比决定。而对于总参超过 100B 的 MoE,单纯扩宽度会因为推理成本和硬件约束变得不现实;更实际的路径是固定激活专家数、增加总专家数,即在几乎不增加推理算力的前提下扩容量。问题是稀疏度有它自己的 scaling 行为(Clark et al., 2022;Tian et al., 2025a;Team et al., 2025),既有的、为宽度设计的迁移框架能否覆盖稀疏度维度,此前没有答案。

论文明确点名了前置工作的局限:Małaśnicki et al. (2025) 试过把 μP 用到 Switch Transformer 上,但只用 AdamW,且固定了总专家数与激活专家数、只缩放隐藏维——这些假设在使用大量细粒度专家(如 >128)的现代大规模 MoE 上不成立。

1.4 三条贡献

  1. MoE 架构的 μP 适配:在同时缩放模型宽度与总专家数(稀疏度扩张)的设定下研究零样本超参迁移,并把 Muon 优化器纳入进来;
  2. 两步框架里的 token 维外推:基于低成本小规模 proxy run 外推到未见过的超长 token horizon;
  3. 大规模验证:用该框架从零预训练 155B 总参 / 17B 激活的 MoE 基础模型,训练 10T token。

二、核心方法

框架由两个部件组成:(1) 为 MoE 架构写出 μP 形式;(2) 建立一条预测「最优学习率随 token 预算如何变化」的 scaling law。

2.1 把 μ-Parameterization 套到 MoE 上

2.1.1 参数按「对宽度的形状不变性」分类

沿用 μ-Transfer 的做法,把参数按宽度缩放时的膨胀行为分类。论文强调:因为它们的所有参数都没有形状与宽度无关的(即没有只绑定在词表大小、上下文长度这类固定常数上的),所以排除 scalar-like 参数,只剩两类:

Table 1: 按对模型宽度的形状不变性做参数分类

参数类型 定义 例子
Vector-like 恰好含一个可无限扩展的维度 Embeddings、biases、expert FC2 权重
Matrix-like 含两个可无限扩展的维度 FFN、attention、router、expert FC1 权重

这里最值得注意的是 MoE 层的归类:router 参数与 expert FC1 权重是 matrix-like,而 expert FC2 权重被当作 vector-like。理由是 FC2 的有效输入维被「固定的激活专家数」与「固定的 MoE 中间维」限住了,不随宽度无限膨胀。

2.1.2 初始化与学习率缩放因子

Table 2: 稠密与 MoE 模型的 μP 与学习率缩放因子

I/O Embeddings & 所有 Biases(Vector-like) Hidden Weights(Vector-like) Hidden Weights(Matrix-like)
初始化方差 Init. Var 0.04 $\mathrm{fan\_in}_{base}/\mathrm{fan\_in}$ $\mathrm{fan\_in}_{base}/\mathrm{fan\_in}$
学习率缩放因子 1 1 $\mathrm{fan\_in}_{base}/\mathrm{fan\_in}$

其中 $\mathrm{fan\_in}$ 与 $\mathrm{fan\_in}_{base}$ 分别是宽度缩放后模型与 base proxy 模型的 fan-in。学习率缩放因子在更新对应参数时乘到学习率上。

三个关键的工程简化,每一条都有出处:

  • 只对线性层缩放学习率:依据 Wortsman et al. (2024) 的结论——只缩放线性层学习率就足以保持 μP 的性质,因此学习率缩放只施加在 matrix-like hidden weights 上;
  • 不做深度缩放:深度方向的 μP 迁移已知高度不稳定(Yang et al., 2022;Wortsman et al., 2024),所以层数固定,只缩放宽度;
  • 注意力头维固定、头数随隐藏维等比增长(Yang et al., 2022;Wortsman et al., 2024)。

一个 MLA 特有的细节(Table 2 注):对 Multi-head Latent Attention,query 和 key-value 的低秩投影维在宽度缩放时保持固定。由于这些维度正是对应上投影矩阵的 fan-in,作用在这些矩阵上的学习率缩放因子退化为 1——也就是说这部分实际上不缩放。这是把 μP 套到 MLA 上时必须显式处理的一个边界情况。

2.1.3 缩放路径:宽度与稀疏度耦合前进

扩容 MoE 时,论文的做法是:固定 per-token 激活专家数与 MoE 中间维,同时增加总专家数与隐藏维。这反映了一条现实的 MoE 扩容策略——不是单纯加宽,而是靠提升稀疏度来抬容量、同时把 per-token 推理成本压住(Team et al., 2025)。

由此,稀疏度成为与宽度并列的一条 μP 迁移轴。作者的论证是:在这条路径下,总规模、激活规模与稀疏度是耦合而非独立的三个轴;从 μP 的谱条件(spectral condition)视角看(Yang et al., 2023),通过增加专家数来改变激活比率,并不会在「宽度缩放本身带来的变化」之外,给单个专家的 fan-in / fan-out 带来任何额外改变,因此仍然兼容同一条 μP 缩放规则。

还有一层实用动机:现代 MoE 越来越依赖低激活比率来高效扩容,但极高稀疏度在 proxy 规模上是硬件低效的(算术强度太低)。所以在低稀疏度下跑搜索、再迁移到高稀疏度目标,既保住了搜索本身的效率,又瞄准了想要的稀疏区间。

2.2 沿 token 维外推最优学习率

即便有了 μP,直接在数万亿 token 上搜学习率仍然不可承受(哪怕用小 proxy 模型)。所以第二步是:在受限 token 预算内找到最优学习率,再外推到完整 horizon。

2.2.1 一个刻意的取舍:只迁移学习率,不迁移 batch size

论文专门辩护了「为什么框架里没有 batch size」,理由不是图省事:

  1. batch size 不只是建模超参,还是系统级变量,训练中经常为了榨硬件吞吐而调整;
  2. 文献本身还没收敛——最优 batch size 到底依赖训练算力(Bi et al., 2024;Tian et al., 2025a)还是只依赖 token 预算(Li et al., 2025b),说法互相矛盾;critical batch size 那边同样分裂,有人认为只依赖 token 预算(Zhang et al., 2024),有人认为由训练 loss 动态驱动(Li et al., 2025a)。

因此他们固定 batch size 以最大化 GPU 效率,把学习率作为唯一迁移目标。这样得到的学习率 scaling law,在任何为吞吐而选定的 batch size 下都保持稳健。

2.2.2 短 token 预算下估计最优学习率:用 EMA 替代 decay

目标训练用的是 WSD(Warmup-Stable-Decay)调度器(Hu et al., 2024),proxy 实验匹配相同的 warmup 步数。但在 proxy 实验里跑 decay 阶段有两个致命问题:

  1. 太贵:即使提前 decay,每次 run 也只在最终 checkpoint 产出一个有效数据点;要覆盖多个 token 预算就得跑大量独立实验;
  2. 有偏:过早 decay 会给 loss 估计引入偏差(Li et al., 2025b)。

解法是:proxy run 在 stable 阶段直接终止、不做 decay,改用对模型权重做 EMA。这样可以从一次训练里按需在任意 token 间隔抽出多个 checkpoint,高效地生成覆盖大范围 token 预算的数据点。EMA 平滑参数轨迹的噪声、减缓参数更新,效果上近似学习率 decay(Morales-Brotons et al., 2024;Baidu-ERNIE-Team, 2025;Tian et al., 2025b;Li et al., 2026)。

论文引了两条支撑:Zhang et al. (2024) 证明常数学习率 + 指数权重平均(在本文设定下等价于 EMA)在大 batch 区间与 cosine decay 训练表现相当,且 batch 越小差距越大——而本文用的是 32M token 的超大全局 batch,正落在该结论最适用的区间;工程上,DeepSeek-V3(Liu et al., 2024b)用 EMA 近似 post-decay 模型质量,OLMo 3(Olmo et al., 2025)用 checkpoint 权重平均在预训练途中估计模型性能,都是同类做法。

记 $\theta^{(t)}$ 为第 $t$ 步的模型参数,EMA 参数按下式更新:

$$\theta^{(t)}_{\text{EMA}} = \alpha \cdot \theta^{(t-1)}_{\text{EMA}} + (1 - \alpha) \cdot \theta^{(t)} \tag{1}$$

平滑系数取 $\alpha = 0.6$——把大部分权重压在近期更新上,同时抑制训练早期不稳定动态的影响。EMA 每约 2B token 更新一次,取每 10B token 处的 checkpoint 用于后续分析。按 Baidu-ERNIE-Team (2025) 的有效 decay 窗口定义,该配置意味着最近 20B token 对合并权重保有 >1% 的影响。

给定 token 预算,用这些合并后的 checkpoint 在固定 batch 上评估验证 loss。参照 Bjorck et al. (2025),对每个 token 规模 $B$,把验证 loss $L$ 与对数化学习率 $\log \eta$ 用二次多项式建模:

$$L(\eta) = a(\log \eta)^2 + b(\log \eta) + c \tag{2}$$

抛物线的顶点 $\log \eta^* = -b/2a$ 给出该 token 预算下的最优学习率 $\eta^* = \exp(-b/2a)$。

2.2.3 外推到超长 token horizon

拿到各 token 预算下的 $\eta^*$ 后,在 log-log 空间对 $(\eta^*, B)$ 做线性回归:

$$\log(\eta^*) = \beta \cdot \log(B) + \gamma \tag{3}$$

$\beta, \gamma$ 为回归系数。有了它,就能零成本外推到 10T token 这种规模。

一个容易忽略但很关键的实践细节:当实验采用 batch size 调度(跑到预定步数后增大 batch)时,回归只用 batch size 提升后训练动态已稳定的数据点。这保证所有拟合点处在一致的优化 regime 下,避免 batch 切换瞬态引入的伪影。


三、实验设置

  • 优化器:Muon(Jordan et al., 2024)。为把 Muon 的 update RMS 对齐到 AdamW,学习率乘以 $0.2 \cdot \sqrt{\max(A, B)}$,其中 $A, B$ 是满秩矩阵参数的两个维度(fan-in 与 fan-out),做法follow Liu et al. (2025)。该调整使得调好的学习率与 weight decay 可以在 AdamW 与 Muon 之间直接迁移复用。
  • 固定常数:weight decay $= 1 \times 10^{-1}$,auxiliary z-loss(Chowdhery et al., 2022)系数 $= 5 \times 10^{-6}$,全部实验通用。
  • 调度器:§3.2 的小规模 μP 验证用 cosine 调度(Loshchilov & Hutter, 2016),最小学习率固定 $1 \times 10^{-5}$,只变最大学习率(follow Wortsman et al., 2024 与 Li et al., 2025b);其余全部实验用 WSD。WSD 的长 stable 阶段使得 batch size 调度可以在不扰动训练动态的前提下施加。
  • Batch size:§3.2 固定 0.5M token;§3.3.1 固定 8M token;§3.3.2 从 8M 提到 32M(在 200B token 之后)。
  • 硬件与框架:全部实验在 NVIDIA H200 上,使用 Megatron-LM 的内部 fork(Shoeybi et al., 2019)。
  • 注意力:所有模型均用 MLA(Liu et al., 2024a),把 KV cache 压到低维隐空间,显著降低推理期 KV 显存与长上下文扩展开销。

模型配置总表

Table 3: Model configurations for scaling width.

Table 3: 宽度缩放的模型配置($d_{ff} = k \times d_{expert}$,$k$ 为激活专家数;$\lambda_{routed}$ 为 MoE routed 缩放因子)

模型规模 总参 激活参数 $n_{layers}$ $d_{model}$ $d_{ff}$ $n_{heads}$ $n_{experts}$ $\lambda_{routed}$
§3.2 与附录 C 用
Dense Base proxy 0.24B 0.24B 48 384 1536 4 – –
Dense 2× 0.7B 0.7B 48 768 3072 8 – –
Dense 4× 2.27B 2.27B 48 1536 6144 16 – –
Dense 8× 8.02B 8.02B 48 3072 12288 32 – –
MoE Base proxy 0.6B 0.3B 48 256 6144 4 16 2.428
MoE 2× 2.2B 0.7B 48 512 6144 8 32 2.442
MoE 4× 8B 1.5B 48 1024 6144 16 64 2.446
MoE 8× 30.7B 3.6B 48 2048 6144 32 128 2.448
§3.3.1 用
MoE Base proxy 5.6B 1.8B 32 1024 11264 16 32 2.442
MoE 2× 20.7B 3.8B 32 2048 11264 32 64 2.446
Figure 2 / §3.3.2 / §3.3.3 用
MoE Base proxy 10.8B 3.3B 62 1024 12288 16 32 2.442
MoE 1.5× 23B 4.9B 62 1536 12288 24 48 2.445
MoE 2× 40.2B 6.9B 62 2048 12288 32 64 2.446
MoE 4×(目标模型) 155B 17B 62 4096 12288 64 128 2.448

关键读法:$d_{ff}$ 在每一组内跨规模完全不变(因为激活专家数 $k$ 和单专家中间维 $d_{expert}$ 都固定),变的是 $d_{model}$、$n_{heads}$、$n_{experts}$——这正是 §2.1.3 那条「宽度 + 稀疏度耦合扩张」的路径。层数在组内恒定。另外,§3.3.2 / §3.3.3 的模型把 MoE 的第一层替换成单个稠密层,其中间维等于 MoE 层的激活中间维($k \times d_{expert}$)。


四、主要实验结果

4.1 μP 让最优学习率跨宽度迁移(§3.2)

Base proxy MoE 设 $d_{model}=256$、$n_{experts}=16$、4 个注意力头,然后按 2×/4×/8× 等比放大隐藏维、总专家数与头数。随总专家数增加,MoE routed 缩放因子按 Liu et al. (2025) 的 gate 缩放因子公式逐档调整(见 Table 3 的 $\lambda_{routed}$:2.428 → 2.442 → 2.446 → 2.448)。所有模型在英文通用知识语料上训 1.3B token,最大学习率扫 $\{1,3,6\}\times10^{-4}$、$\{1,3,4,6\}\times10^{-3}$、$\{1,3\}\times10^{-2}$(共 9 档)。

Figure 3: Comparison of learning rate transferability under Standard Parameterization (SP) and Maximal Update Parameterization (μP) across MLA MoE models of increasing width.

结论非常干净:

参数化 0.6B/0.3B (base) 2.2B/0.7B 8B/1.5B 30.7B/3.6B
SP 最优 LR $3\times10^{-3}$ $3\times10^{-3}$ ~$3\times10^{-3}$ $1\times10^{-3}$
μP 最优 LR $4\times10^{-3}$ $4\times10^{-3}$ $4\times10^{-3}$ $4\times10^{-3}$
  • SP 下(图 3a):最优学习率随宽度漂移——8× 宽度的模型(30.7B 总参)的最优值掉到 $1\times10^{-3}$,从 base proxy 迁移失败;同时曲线右半支在大学习率区急剧发散,大模型比小模型更早崩。
  • μP 下(图 3b):四个模型的最优学习率全部落在同一条虚线(Transferred Optimal LR, $\approx 4\times10^{-3}$)上,且 loss 曲线随宽度单调下移、形状一致。

为什么重要:这条结果的价值不在「μP 有效」这个已知事实,而在于它是在宽度与稀疏度同时扩张(16→128 专家、激活专家数固定)的路径上验证的,且用的是 MLA + Muon 这组此前没被系统检验过的组合。它把 §2.1.3 的谱条件论证从理论落到了经验上。

附录 C(稠密对照):因为 MLA + Muon 在 μP 协议下也没被充分探索过,作者先在稠密模型上做了同样的对照。稠密 base proxy 为 $d_{model}=384$、$d_{ff}=1536$、4 头,扩到 $d_{model}\in\{768,1536,3072\}$、$d_{ff}\in\{3072,6144,12288\}$、头数 $\{8,16,32\}$,对应 0.24B / 0.7B / 2.27B / 8.02B,48 层、1.3B token。

Figure 9: Comparison of learning rate transferability under SP and μP across dense models of increasing width.

结果同构:SP 下最优学习率随宽度发散,μP 下从 0.24B 稳定迁移到 8.02B。这说明失效不是 MoE 特有的,而 μP 的修复在 MLA 稠密模型上同样成立。

4.2 最优学习率随 token 预算怎么变(§3.3.1)

定义 5.6B 总参 / 1.8B 激活的 MoE 为小规模 proxy,2× 宽度缩放的 20.7B 总参 / 3.8B 激活为 held-out 目标模型。两者都用 μP,都用贴近真实预训练的多样数据混合,训到 100B token。

Figure 4: Solid lines denote the base proxy model (5.6B total, 1.8B active), dashed lines the 2x width-scaled held-out model (20.7B total, 3.8B active), each trained on 40B, 60B, 80B, and 100B tokens.

图 4 对 $6\times10^{-4}$、$\{1,3,6\}\times10^{-3}$ 四个学习率做式 (2) 的二次拟合,得到两个发现:

  1. 随 token 预算增加,最优学习率呈轻微下降趋势——40B → 100B 时抛物线顶点缓慢左移;
  2. 同一 token 规模下,proxy(实线)与 2× 宽度模型(虚线)的抛物线曲率与顶点位置高度一致——也就是说,「某 token 规模下的最优学习率」这件事本身可以跨宽度可靠迁移。

论文还做了一个漂亮的自洽性检查:用其中四个学习率拟合抛物线,然后把没参与拟合的 $2\times10^{-3}$ 处的实测验证 loss(图中 × 标记)画上去,这些点直接落在拟合曲线上。这说明式 (2) 的二次假设在该区间内不是勉强的曲线拟合,而是真实反映了 loss 关于 $\log \eta$ 的局部结构。

4.3 外推到 10T token(§3.3.2)

先训 base proxy(10.8B 总参 / 3.3B 激活,恰好是目标模型 155B/17B 的 1/4 宽度)约 500B token,每 2B token 做一次 EMA、每 10B token 取一个 checkpoint 估最优学习率。

Figure 5: (a) Second-order polynomials fitted between log-transformed learning rate and validation loss at representative token scales. (b) Linear regression in log-log space over these optimal learning rates across token scales ranging from 255B to 502B.

  • 图 5a:在 265B / 304B / 344B / 383B / 423B / 463B / 502B 等代表性 token 规模上拟合二次曲线,⋆ 标记顶点即该规模的最优学习率。注意纵轴(loss)范围只有 1.85–1.91——在这么窄的 loss 区间里靠曲线顶点定位最优学习率,对拟合质量要求相当高,这也是必须用 EMA 平滑掉参数轨迹噪声的原因。
  • 图 5b:把 255B 之后(batch size 从 8M 提到 32M、动态已稳定)的最优学习率放进 log-log 空间做线性回归,$R^2 = 0.95$,外推得到 10T token 的最优学习率 $\eta^* = 3.85 \times 10^{-4}$。横轴刻度 255 → 430 → 727 → 1228 → 2074 → 3504 → 5919 → 10000(B),纵轴从 $3.8\times10^{-4}$ 到 $1.1\times10^{-3}$,也就是说从 255B 到 10T(约 40 倍 token),最优学习率大约降到 1/3。

附录 E:外推能力的 held-out 验证

作者很清楚「直接在 10T 上验证」是不可能的——即使用 1/10 目标规模的 proxy,扫 5 个学习率 × 10T token 也要烧掉 155B 模型完整训练约一半的算力。于是他们做了回溯式 held-out 验证:只用 255B–350B 区间的前 11 个 token 预算拟合式 (3),去预测 500B 附近 5 个未见预算的最优学习率,再与「在这些预算上独立拟合式 (2) 得到的最优学习率」比较。

Table 4: 学习率外推的 held-out 验证

Token 预算 预测最优 LR 实际最优 LR 比值
462.7B $9.57\times10^{-4}$ $9.26\times10^{-4}$ 1.033×
472.6B $9.53\times10^{-4}$ $9.22\times10^{-4}$ 1.034×
482.5B $9.49\times10^{-4}$ $8.97\times10^{-4}$ 1.058×
492.4B $9.45\times10^{-4}$ $8.99\times10^{-4}$ 1.052×
502.3B $9.41\times10^{-4}$ $9.01\times10^{-4}$ 1.045×

平均偏差约 4.4%,且系统性偏高(5 个点全部 >1,预测值一致偏保守地大一点)。作者指出这个 gap 显著小于 Bjorck et al. (2025) 报告的外推误差。诚实地说,这个验证只跨了约 1.4× 的 token 距离(350B → 500B),而真实使用场景要跨 20× 以上(500B → 10T);它证明的是回归形式在该区间内自洽,而非外推 20 倍仍然准确。

4.4 应用到自家基础模型(§3.3.3)——工业验证的核心

把预测出的 $3.85\times10^{-4}$ 直接用于从零预训练 155B 总参 / 17B 激活的 MoE 基础模型,10T token horizon。如图 2b,这次全量预训练的算力约为用于定学习率的全部 proxy run 之和的 98×。

Stage 1 数据配比:起始为 45% 英文 / 12.5% Math·STEM / 27.5% Code / 15.0% 多语;训到 6T token 处调整为 22.5% 英文 / 27.5% Math·STEM / 25.0% Code / 25.0% 多语,以增强欠表示领域的覆盖。batch size 调度在 200B token 后施加。

Figure 6: Training loss of our model (155B total, 17B active) during Stage 1 pretraining.

图 6(训练 loss):LM loss 从约 1.75 单调降到约 1.30,全程没有 loss spike。这是论文用来佐证「外推学习率有效」的第一条证据。曲线在 6T 附近能看到数据配比切换带来的轻微形变,但没有失稳。

Figure 7: Benchmark performance of our foundation MoE model (155B total, 17B active) after Stage 1 pretraining on 10T tokens.

图 7(Stage 1 后的 benchmark):论文只给了柱状图、未给数值表,以下为从图上读出的近似值(评测细节见附录 D):

域 Benchmark 近似分数
English MMLU (5-shot) ≈ 80
English MMLU-Pro (5-shot) ≈ 57
English BBH (3-shot) ≈ 83
Multilingual Global-MMLU Ko (5-shot) ≈ 74
Multilingual Global-MMLU Ja (5-shot) ≈ 73.5
Multilingual Global-MMLU Vi (5-shot) ≈ 73.5
Multilingual Global-MMLU Zh (5-shot) ≈ 74.5
Math MATH (4-shot) ≈ 59
Math GSM8K (8-shot) ≈ 84
Code MBPP (Pass@1, 3-shot) ≈ 64
Code HumanEval (Pass@1, 0-shot) ≈ 56

作者的措辞是克制的:鉴于 Stage 1 的数据配比优先考虑领域多样性而非严格质量过滤,这些评测结果确认模型训练成功且高效,而非声称 SOTA。

Figure 8: Estimated training compute vs. MMLU-Pro accuracy. Compute is estimated as 6ND with N set to active parameters.

图 8(算力-性能 Pareto):与同量级、同激活参数的开源 MoE base 模型对比——dots.llm1(Huo et al., 2025)、GLM-4.5-Air(Zeng et al., 2025)、Hunyuan-A13B(Tencent Hunyuan Team, 2025)、DeepSeek-V4-Flash(Xu et al., 2026)。训练算力按标准 $6ND$ 估算($N$ 取激活参数、$D$ 取报告的预训练 token 数),所有模型统一用作者自己的评测 harness 评。图上读数:

模型 训练算力 (ZFLOPs, 估算) MMLU-Pro
dots.llm1 ≈ 930 ≈ 60.3
Ours (155B/17B) ≈ 1020 ≈ 63.6
GLM-4.5-Air ≈ 1070 ≈ 58.4
Hunyuan-A13B ≈ 1580 ≈ 66.2
DeepSeek-V4-Flash ≈ 2500 ≈ 68.3

本文模型落在 Pareto frontier 上:在相当或更低的估算训练算力下,MMLU-Pro 高于 dots.llm1 与 GLM-4.5-Air。

一处需要读者留意的不一致:图 7(Stage 1 后)的 MMLU-Pro 目测约 57,而图 8 中 "Ours" 的 MMLU-Pro 约 63.6。正文对图 8 只说「our model」而未标注 stage。合理推断是图 8 用的是经过 Stage 2 高质量数据训练后的 checkpoint(附录 F 确认 Stage 1 之后确实做了 Stage 2),但论文没有明写,这是行文上的一个疏漏。

4.5 附录 F:分阶段预训练中的专家路由 bias

Stage 1 结束后作者在更小规模的高质量数据上做了 Stage 2,并观察到一个与专家路由动态相关的现象。背景:分阶段预训练(大规模通用域 → 小规模高质量域增强)已被广泛证明有效(Hu et al., 2024;Blakeney et al., 2024;Abdin et al., 2024;Walsh et al., 2025;Allal et al., 2025),但数据分布的切换可能让 MoE 的专家路由失稳。

由于采用 auxiliary-loss-free 负载均衡策略(Liu et al., 2024b),稳定路由的主因是 expert routing bias 与 sequence-level 负载均衡 loss;而后者对每条序列独立生效、与数据分布无关,所以作者只考察 bias。三种配置:

  1. init:stg1, update:on——用 Stage 1 末的 bias 初始化,Stage 2 继续更新;
  2. init:stg1, update:off——用 Stage 1 末的值初始化但冻结;
  3. init:0, update:off——完全去掉 bias(置零且不更新)。

评价指标是 MaxVio(Wang et al., 2024a),衡量专家利用率不均衡:

$$\text{MaxVio} = \frac{\max_i \text{Load}_i - \overline{\text{Load}_i}}{\overline{\text{Load}_i}} \tag{4}$$

其中 $\text{Load}_i$ 是路由到第 $i$ 个专家的 token 数,$\overline{\text{Load}_i}$ 是完美负载均衡下的期望值。MaxVio 在 global-batch 级别计算,分别报告跨 MoE 层的平均值与最大值。

Figure 10: MaxVio trends for three different expert routing bias settings during Stage 2 training.

结论:

  • 持续更新 bias(配置 1)带来最均衡的专家利用,平均与最大 MaxVio 都最低;
  • 有趣的是,当冻结 bias 更新时,零初始化(配置 3)反而比继承 Stage 1 的值(配置 2)更均衡——这说明为 Stage 1 数据分布优化出来的 bias 项,未必适配 Stage 2 的偏移分布,甚至是负资产。

Figure 11: All three expert routing bias settings exhibit nearly identical training loss trends.

但图 11 显示三种配置的训练 loss 轨迹几乎完全重合。这表明 bias 项对整体优化的影响可忽略,也意味着不论 bias 怎么配,Stage 2 出现严重路由坍缩的可能性都很低。

4.6 附录 G:均衡路由 ≠ 无专家分化

MaxVio 小会不会意味着「路由被压得过于均衡、专家没学到分工」?作者做了逐层分析来回答。评测取 4 个域族各 200 条 prompt(HumanEval 用全部 164 题),Code 域把 prompt 与参考解拼接以保证测到真实代码 token。三个互补指标:

(i) Aggregate MaxVio:式 (4) 在全部目标 benchmark 汇总后的评测集上计算,越低越均衡。

(ii) 归一化互信息 $I(E;D)/H(D)$:设 $E$ 为被选专家、$D$ 为域标签,采用均匀域先验 $p(d)=1/|D|$(与各域 token 数无关,避免大域主导),于是 $H(D)=\log|D|$,边际路由分布 $\bar{p}(e) = \frac{1}{|D|}\sum_{d} p(e\mid d)$:

$$I(E;D) = \frac{1}{|D|}\sum_{d \in D} D_{KL}\big(p(e\mid d) \,\|\, \bar{p}(e)\big) \tag{5}$$

$$I/H = \frac{I(E;D)}{H(D)} = \frac{I(E;D)}{\log|D|} \in [0,1] \tag{6}$$

$I/H = 0$ 表示所有域用同样的专家分布,$I/H = 1$ 表示专家选择能完美识别域。作者特别提醒中间值的读法:$I/H=0.15$ 意味着路由解释了约 15% 的域熵,不能读作域分类准确率。

(iii) 平均成对 Jensen–Shannon 散度:对任意两域 $a, b$,令 $m = \frac{1}{2}(p(e\mid a) + p(e\mid b))$,

$$\text{JSD}(a,b) = \frac{1}{2}D_{KL}\big(p(e\mid a)\,\|\,m\big) + \frac{1}{2}D_{KL}\big(p(e\mid b)\,\|\,m\big) \tag{7}$$

报告值是所有域对上的平均。用自然对数时上界为 $\log 2 \approx 0.693$。

Figure 12: Aggregate MaxVio (left axis) measures marginal expert-load imbalance, while normalized mutual information and mean pairwise JSD (right axis) measure domain-dependent routing specialization.

图 12 显示:Aggregate MaxVio 在多数 MoE 层保持平稳,只在浅-中层有局部抬升;而两个条件分化指标($I/H$、平均成对 JSD)随层深单调上升,在最后几个 MoE 层达到最高。结论是:边际负载均衡并不意味着专家分化被压制——专家可以在保持整体利用均衡的同时表现出明显的域相关路由偏好。(作者提醒:这里的 Aggregate MaxVio 在下游评测 benchmark 上算,与图 10 训练期 MaxVio 不可直接数值比较。)

Figure 13: Domain-conditioned expert routing divergence across MoE layers.

图 13 用热力图展示逐层的 $D_{KL}(p(e\mid d)\,\|\,\bar{p}(e))$,揭示了域间的分化节奏差异:Code 的路由在浅层就偏离边际分布,而多语(Global-MMLU 各语种)的路由直到最后几个 MoE 层才急剧分化。这个「代码早分、语言晚分」的模式本身就是一个有意思的观察。


五、核心贡献总结

  1. 把 MoE 大规模预训练的超参搜索从二维降到一维,并把省下来的算力量化到 ZFLOPs 级别(额外 240.3 ZFLOPs 的模型规模扫描被完全消掉);
  2. 给出 MLA + Muon + 细粒度 MoE 这组现代配置下可直接照抄的 μP 表(Table 1/2),包括 expert FC2 归为 vector-like、MLA 低秩投影维固定导致其上投影矩阵 LR 缩放退化为 1 这两个非平凡细节;
  3. 用 EMA 替代 decay 把「一次 run 一个数据点」变成「一次 run 几十个数据点」,这是让 token 维 scaling law 变得可负担的关键工程技巧;
  4. 在稀疏度与宽度耦合扩张的路径上验证 μP 迁移(16→128 专家,激活专家数固定),补上了前置工作(Małaśnicki et al., 2025 固定专家数)留下的洞;
  5. 真实工业验证:Kakao 用这套配方从零预训练 155B/17B 基础模型、10T token,训练全程无 loss spike,在 MMLU-Pro 上落在算力-性能 Pareto frontier。

六、与已归档相关工作的对比

本文与下列三篇在「用便宜的小规模 run 替代昂贵的大规模网格搜索」这一 root cause 上高度同构,但互不引用:本文 v1 于 2026-08-20 上线(且已是 COLM 2026 camera-ready,定稿更早),三篇候选分别为 2026-08-04 / 2026-08-07 / 2026-08-12,全部在两周半以内,属于典型的独立并发工作。

Small-Scale Experiments: Are We There Yet? Small-Scale Experiments: Are We There Yet? (FAIR at MSL Meta + NYU, 2026-08-12)

关系:独立并发(本文未引用,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇都把矛头指向「小规模 proxy 实验的结论能不能迁移到大规模」这件事,且都认定超参与规模的耦合是根因。本文的表述是「每次规模变化都要重做一次昂贵搜索」,Meta/NYU 那篇的表述是「小规模 scaling law 不可靠这条常识把超参这个混淆因子当成了本质」——同一枚硬币的两面。
  • 相近的技术骨架:两篇都建立在「验证 loss 关于超参在最优点附近是二次的」这一同一假设上。本文的式 (2) $L(\eta) = a(\log\eta)^2 + b\log\eta + c$ 与对方的 noisy quadratic limit $L(X) \approx y^* + (X-x^*)^T H_{x^*}(X-x^*) + E$ 是同一结构的一维特例与多维一般形式;两篇都靠「拟合抛物线取顶点」而非「网格上取最小值」来定位最优超参。
  • 本文的差异与推进:本文把这个二次结构沿 token 轴串起来(式 (3) 的 log-log 回归),得到一条可外推的规律,并且靠 μP 把模型规模轴整个消掉;对方则停在「刻画超参损失面本身」,用约 4000 次随机搜索 run 去估计 $Q_{\min}(\alpha,\beta,\gamma,\sigma)$ 的四个参数,重点是要搜多少配置才算搜够。本文的路线更工程化、成本低两个数量级(5 次 proxy run vs. 4000 次随机搜索),代价是它不检验「proxy 本身是否落在完全调优前沿上」。
  • 可比的方法/实验差异:对方最重要的发现——超参损失面的内蕴维度随参数量增长而下降、大模型的有效超参数个数掉到 1——恰好是本文两步框架能成立的隐含前提:正因为大模型的超参面几乎只有一个有效方向(就是学习率),只迁移学习率、固定 batch size 才是合理的简化。反过来,对方明确警告「纯外推会放大采样误差,不能只看谁外推的最终 loss 更低」,这正击中本文的软肋——本文对 10T 学习率的唯一直接证据是「loss 没有 spike」,附录 E 的 held-out 验证也只跨了约 1.4× token 距离。两篇合起来读,一篇给了配方,另一篇给了这套配方的统计边界。

LLaDA MoE v2 LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models (人大高瓴 + 蚂蚁集团, 2026-08-04)

关系:独立并发(本文未引用,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:「大规模 MoE 该用什么优化超参」在两篇里都是第一等问题,且两篇都不满足于给出一个数字,而是要给出随算力/预算变化的规律。本文问的是「最优 LR 如何随 token 预算变」,对方问的是「最优 batch size 与 LR 如何随算力变」。
  • 相近的技术骨架:流程图几乎可以叠在一起——在若干小模型尺度上扫超参 → 对每个预算拟合出最优点 → 在 log 空间拟合出规律 → 外推到目标规模 → 用一次真实的大规模从零预训练验证。连收尾动作都一样:本文用 155B/17B × 10T token 验证,对方用 30B-A3B × 23.5T token 验证,而且两篇都是「公司拿自家旗舰模型的预训练当实验的最后一步」。
  • 本文的差异与推进:分工恰好互补。本文刻意不碰 batch size(理由是它是系统级变量、且文献结论矛盾),把全部精力放在「用 μP 消掉模型规模维」这件对方没做的事上;对方则同时拟合 $B^*$ 与 $\eta^*$ 两条超参律,并进一步往下走到算力分配($M^*\propto C^{0.475}$、$D^*\propto C^{0.525}$)与 MoE 架构变量(激活比率、专家粒度 $G$、共享专家比 $S$)。换句话说,对方是「把 2D/3D 网格扫得更聪明」,本文是「用参数化理论把一个维度整个删掉」——这是两条不同的省算力哲学。
  • 可比的方法/实验差异:对方的结论「MoE dLLM 的最优 LR 随算力衰减比 AR 更快」与本文的「最优 LR 随 token 预算轻微下降」在方向上一致,但对方能给出跨范式的相对陡峭度比较,本文只有单一架构族内的一条回归线($R^2=0.95$)。另一方面,本文在稀疏度扩张路径上验证了 μP 迁移(16→128 专家、激活专家数固定),而对方的架构分析虽然覆盖了激活比率与粒度,却是通过重新拟合而非零样本迁移得到的。对想复用的人来说:要定 LR 用本文,要同时定 batch size 与架构配置得用对方。

Skaling: Chinchilla's Exponents Meet Kaplan's Coupling Skaling: Chinchilla's Exponents Meet Kaplan's Coupling (FAIR at Meta, 2026-08-07)

关系:独立并发(本文未引用,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇的 root cause 是同一个——在 $(N, D)$ 二维网格上做穷举 profiling 的代价随规模爆炸,必须找到结构性理由把它降到一维。本文图 1a/1b 与对方的「全网格 vs. L 形稀疏网格」讲的是同一件事的两个版本。
  • 相近的技术骨架:两篇都是「利用问题本身的结构,让二维网格退化成沿轴的一维采样」。对方发现耦合形式 $L(N,D) = (A/N^\alpha + B/D^\beta)^k + E$ 是由网格边界而非内部锚定的,因此只需在低算力的两条边上采样(L 形网格)就能用约 1/10 的拟合算力达到全网格 Chinchilla 的精度;本文则靠 μP 证明「沿 $N$ 轴最优 LR 不变」,于是只需沿 $D$ 轴采一条线。抽象层面,两者都是「先证明某个方向上目标量的行为是可预测/不变的,再只在另一个方向上花钱」。
  • 本文的差异与推进:被预测的量不同——对方预测的是 loss $L(N,D)$,本文预测的是 最优超参 $\eta^*(D)$;对方的工具是函数形式的重新设计(外指数 $k$),本文的工具是参数化的重新设计(μP)。一个更深的差异是证据强度:对方用无参数数值微分证明「加性 Chinchilla 律蕴含的混合偏导恒为零被数据证伪」,把函数形式之争变成了可证伪的假设检验;本文对「μP 在稀疏度轴上也成立」的论证则停在谱条件的定性推理 + 4 个宽度档的经验曲线,没有同等强度的判决性检验。
  • 可比的方法/实验差异:对方的 76% 配置更准、中位数 2.2× 优势、增益最大处恰在最便宜的边缘——这条结论对本文有直接的方法论提醒:本文的 log-log 回归只用了 255B–502B 这一小段区间的点去外推 20 倍,如果 $\eta^*(D)$ 的真实形式也存在类似的边界曲率(而非严格幂律),外推误差同样会集中在最外侧。附录 E 中 5 个 held-out 点的预测值系统性偏高 3.3%–5.8%,方向一致而非随机,恰是这种形式误设的典型信号。

七、讨论与局限性

值得借鉴的设计

  1. 「用 EMA 换 decay」是本文最可复用的一招。它把「一次 run 只产一个可用数据点」变成「一次 run 产几十个」,是让 token 维 scaling law 从「理论上可做」变成「实际上做得起」的关键。而且论文给出了它成立的边界条件(大 batch 区间,本文 32M token 全局 batch),不是拍脑袋。
  2. 拒绝把 batch size 塞进框架,并给出理由。这种「明确划定框架不管什么」的做法比强行大一统更诚实,也让结论对任何为吞吐选定的 batch size 都保持稳健。
  3. 参数分类表(Table 1/2)可以直接抄。特别是 expert FC2 归 vector-like、MLA 低秩投影维固定导致上投影矩阵 LR 缩放退化为 1 这两条,是把 μP 套到 DeepSeek 式架构上时最容易踩错的地方。
  4. batch size 切换后才开始拟合。式 (3) 的回归只用 255B 之后的点,避开 batch 切换瞬态——这类细节往往决定 $R^2$ 是 0.95 还是 0.6。

局限与争议

  1. 核心主张无法直接验证,这一点作者自己也承认。「$3.85\times10^{-4}$ 是 10T token 的最优学习率」这件事,在结论里的支撑只有两条间接证据:loss 轨迹异常平稳(图 6)+ benchmark 有竞争力(图 7)。但没有 loss spike 只能说明学习率没有大到失稳,不能说明它没有小到欠优化——把学习率再降一半大概率同样不会 spike。缺一个哪怕规模小一档的对照组(例如用 DeepSeek-V3 公开的 LR 训同样的 155B)。
  2. 附录 E 的 held-out 验证跨度太短。用 255B–350B 拟合、验证 500B 附近,实际外推距离约 1.4×;而生产使用时是 500B → 10T,约 20×。4.4% 的平均偏差在 1.4× 上取得,不能线性外推到 20× 上的可信度。更值得注意的是 5 个预测点全部偏高(1.033–1.058×),这是系统性偏差而非随机噪声,暗示式 (3) 的纯幂律形式可能在长 horizon 端有曲率。
  3. 稀疏度轴的效应无法与宽度轴分离。这是作者在 Conclusion 里主动列出的局限:他们的扩容路径是宽度与稀疏度耦合前进($d_{model}$ 与 $n_{experts}$ 同时翻倍),所以实验只能证明「沿这条耦合路径 μP 迁移成立」,无法回答「单独沿稀疏度轴扩张时会怎样」。而后者恰恰是超大 MoE 更现实的扩容方向。
  4. 宽度迁移实验的 token 预算过小。§3.2 的 μP 验证只训 1.3B token,最大模型 30.7B 总参。在这个 token 量下模型远未进入正常预训练区间,「最优学习率」很可能被早期优化动态主导。真正需要验证的是「在 500B+ token 下宽度迁移是否仍成立」——§3.3.1 用 5.6B → 20.7B、100B token 部分回答了这一点,但离目标规模(155B、10T token)仍有巨大距离。
  5. 图 7 与图 8 的 MMLU-Pro 数值不一致(≈57 vs ≈63.6)且未加说明。附录 F 透露 Stage 1 之后确实做了 Stage 2,因此图 8 很可能用的是 Stage 2 后的 checkpoint,但正文没有标注。这让「Pareto frontier」这个结论的比较口径变得模糊——如果对手模型都是 base 模型而本文是 Stage 2 后的模型,比较就不完全公平。
  6. Benchmark 结果只有柱状图,没有数值表。这在一篇 COLM 正会论文里是不必要的信息损失,也让第三方复现或引用变得困难。
  7. 方法论可扩展性上没有明显瓶颈,这是本文相对其他"先压缩再建模"类工作的优势:整个框架不引入任何会被固化的组件(码本、离散空间等),随着模型继续扩大,只需重新跑一次 proxy 与回归即可,成本随目标规模的相对占比还会继续下降。真正的扩展性风险来自第 3 条——如果未来的扩容主要沿稀疏度轴而非耦合路径进行,本文的验证覆盖不到。

工业落地价值

这不是一篇「有公司署名但实验在别处做」的论文。Kakao 用这套配方在自家 H200 集群 + 内部 Megatron-LM fork 上从零预训练了 155B 总参 / 17B 激活的基础模型,跑满 10T token,并在其上继续做了 Stage 2 与专家路由分析(附录 F/G)。图 2b 给出的 98× 算力比意味着:定学习率这件事的成本压到了全量训练的约 1%。对任何计划从零训练百 B 级 MoE 的团队来说,「花 1% 算力换一次不会中途炸掉的训练」是一笔极划算的账,这也是本文最实际的价值所在。

附录 F/G 的两个副产品同样有工程价值:分阶段预训练时继续更新 expert bias 是最优选择(若必须冻结,则零初始化优于继承 Stage 1 的值),以及边际负载均衡与专家域分化可以共存——后者可以打消「MaxVio 太小是不是把专家压平了」这类常见顾虑。