← Back to list

Hyperparameter Scaling Laws Across MoE Sparsity

LLM Ant Group
Abstract 8 │ Reading 8 │ Rating —
2026-09-08
Changxin Tian, Kunlong Chen, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou
Ling Team, Ant Group
蚂蚁百灵团队用 1,800 次独立预训练(六个激活参数规模 x 四档激活率、约 20T token、20 万等效 H800 卡时)证明最优学习率与 batch size 会随 MoE 激活率 A 系统性漂移,且激活参数量、总参数量与训练算力三种对齐口径都吸收不掉这个漂移,据此把 A 作为可分离的乘性幂律因子写进超参标度律,得到 eta*=0.8343*C^-0.1385*A^0.1361 与 B*=6.4765*D^0.5181*A^-0.0841(学习率的基准变量是算力 C 且对 M/D 分配不敏感,batch size 的基准变量是训练 token D,从而调和了 DeepSeek Law 与 Step Law 的矛盾),用 LOAO/LONO 分组交叉验证在 scale-only/additive/log-interaction/multiplicative 四个候选族中按参数更少选定乘性形式,并在冻结的 12B 总参、A=1/64、D=159B 联合外推留出目标上给出最接近实测最优的预测;但样本内 R^2 仅 0.72-0.78、bootstrap 区间互相重叠使候选形式间无统计显著差异,且 batch size 侧引入 A 的增量远弱于学习率侧。
评分原因
摘要评分:蚂蚁集团,1800 次预训练、约 20T token、20 万 H800 卡时的受控扫描,规模与严谨度都属稀缺:先证明激活参数量、总参数量、compute 三者都吸收不掉稀疏度带来的最优 LR/BS 漂移,再拆出「固定稀疏度下 B* 随 D、η* 随 C 各自幂律 + 激活率 A 作为乘性幂律修正前置因子」的统一形式,用分组 out-of-fold 与多种候选函数形式对比择优,并在 12B 总参、1/64 激活的留出模型上联合外推验证,还给了 gradient-noise 的机理解释(每专家只吃到 AB 个 token)。属于可直接迁移到推荐大模型 MoE 训练的通用技术;扣在 8 而非 9 是因为止于超参预测、未触及最终质量或线上收益。
精读评分:1,800 次彼此独立的从零预训练(6 个激活规模 x 4 档激活率、约 20T token、20 万等效 H800 卡时)撑起的受控扫描在同类超参标度工作里是稀缺的:把激活参数量、总参数量、训练算力三种对齐口径逐一证伪,用 LOAO/LONO 分组交叉验证在四个候选函数族之间做形式选择(bootstrap 重采样单位是损失面簇而非 checkpoint),冻结预测坐标后才检视留出损失,并给出自洽的 AB 个 token 梯度噪声机理;限制章节也诚实交代了组数不足与区间重叠。扣在 8 而非 9:batch size 那条律的自变量跨度只有约 1.4 个数量级却要支撑 0.5181 的指数,选定形式 R^2 仅 0.7188/0.7630,候选族之间无统计显著差异(LOAO 的 LR 上 log-interaction 反而更优),且加入 A 对 BS 的增量(LONO 0.295 -> 0.282)远弱于对 LR 的增量(0.316 -> 0.176),标题的复数「Laws」只有学习率那一条被强力支撑;同时止于超参预测,未触及最终模型质量或线上收益。
moe parameter-scaling training-stability pretrained-lm transformer industrial
目录

Hyperparameter Scaling Laws Across MoE Sparsity

arXiv:2609.08690v1 · 2026-09-08 · Ling Team, Ant Group(蚂蚁集团百灵团队)

作者:Changxin Tian, Kunlong Chen, Jia Liu, Ziqi Liu, Zhiqiang Zhang†, Jun Zhou†(†通讯)

一句话:用 1,800 次从零预训练(六个激活参数规模 × 四档激活率、约 20T token、20 万等效 H800 卡时)证明最优学习率与最优 batch size 会随 MoE 激活率 $A$ 系统性漂移,且激活参数量、总参数量、训练算力三者都吸收不掉这个漂移,进而把 $A$ 作为一个可分离的乘性幂律因子写进超参标度律,得到 $h^*(X,A)=k_h X^{\gamma_h}A^{\delta_h}$,并在一个 12B 总参 / $A=1/64$ 的冻结留出目标上做联合外推验证。

Figure 1 Sparsity-dependent hyperparameter shifts and our unified hyperparameter scaling laws for MoE. (a) At 80M activated parameters and 20B training tokens, the dense model and the A = 1/64 MoE prefer different learning rates and batch sizes. (b) Our laws predict the optimal learning rate from (C, A) and batch size from (D, A).


一、研究动机与背景

1.1 MoE 把「超参怎么迁移」这个老问题重新打开了

Mixture-of-Experts(Shazeer et al., 2017)已经是把 LLM 容量扩上去的主路径:每个 token 只激活一小部分专家,总参数量可以远超每 token 训练算力所对应的规模(Clark et al., 2022)。在这个范式里,学习率(LR)与 batch size(BS)对训练稳定性、收敛速度与最终性能的影响被进一步放大(McCandlish et al., 2018;Bjorck et al., 2025;Zhang et al., 2025),而在目标规模上穷举调参又贵到不可行。既有做法是建立经验标度律,把最优超参与模型规模 / 数据量 / 算力预算挂钩(Kaplan et al., 2020;Hoffmann et al., 2022;Bi et al., 2024),近期也有工作把这套律扩展到 MoE,但基本都停在常规稀疏度或者干脆固定稀疏度(Ludziejewski et al., 2025;Li et al., 2025;Wang et al., 2024;Tian et al., 2026)。

1.2 前人结论互相打架

论文把这个洞点得很明确:现有文献对「MoE 超参能不能从 dense 直接搬过来」给出的是互相矛盾的答案。

  • 一派认为超参在 dense 与 sparse MoE 之间迁移得很稳(Wang et al., 2024;Li et al., 2025 的 Step Law);
  • 另一派观察到 MoE 偏好更大的 batch size 与更低的学习率(Ludziejewski et al., 2025;Tian et al., 2026,即本文同一作者此前的 Ling 效率杠杆工作)。

更关键的是,没有任何一条现有的律刻画了「最优值如何随稀疏度连续变化」,尤其是在 $A=1/64$ 这种超稀疏区间——而这正是 Kimi K3、DeepSeek-V4 这一代前沿模型的工作区。

1.3 一张图先把结论摆出来

Figure 1(a) 是一次干净的受控实验:固定 80M 激活参数、固定 20B 训练 token,dense 模型($A=1$)与 $A=1/64$ 的 MoE 偏好的 LR 与 BS 明显不同——dense 的 LR 最优点在 $2\times10^{-3}$ 附近而 MoE 在 $10^{-3}$ 附近;BS 上 dense 最优在 1M token 而 MoE 移到了 2M token。激活参数量与训练数据都对齐了,最优点依然错开,说明激活率本身携带了额外的预测信息,必须显式进入标度律。

1.4 本文的三条贡献

  1. 在同一套实验框架下调和前人的矛盾结论:固定稀疏度时,$B^*$ 服从关于训练 token $D$ 的幂律,$\eta^*$ 服从关于训练算力 $C$ 的幂律;跨稀疏度时,激活率 $A$ 以乘性方式修正两者的前置因子。
  2. 给出跨 MoE 稀疏度的统一超参标度律,并用大规模实验数据与候选函数族比较来验证其形式。
  3. 联合外推验证:在一个超出拟合区间($A$、$D$、$C$ 三个维度同时越界)的冻结目标上给出最接近实测最优的预测,并验证该关系在不同专家粒度间可迁移。

二、问题形式化与受控实验设置

2.1 符号与定义

记 $N$ 为每 token 激活的非嵌入参数量,$N_{tot}$ 为总非嵌入参数量,$D$ 为训练 token 数,$M$ 为该架构解析计算的每 token 非嵌入 FLOPs。记每 token 激活专家数为 $E_{act}$、总专家数为 $E_{tot}$,定义

$$A \equiv \frac{E_{act}}{E_{tot}}, \qquad C \equiv MD, \tag{1}$$

$A$ 越小越稀疏。这里有一个必须注意的口径选择:本文沿用 DeepSeek-V3 与 Tian et al. (2026) 的做法,用解析的 $C = MD$ 而不是 Kaplan 的 $C \approx 6ND$ 近似;因此 $C$ 表示解析核算的非嵌入训练 FLOPs,而 $N$ 只是一个「参数规模描述量」和候选预测变量,不再兼任算力代理。

设 $\eta$ 为固定调度下的峰值学习率,$B$ 为每次优化器更新处理的全局 token 数。固定架构族、数据分布与其余训练选择后,把训练 $D$ 个 token 后的验证交叉熵写作

$$L(\eta, B \mid N, N_{tot}, M, D, A), \tag{2}$$

最优超参定义为候选搜索空间上的联合极小点

$$(\eta^*, B^*) \equiv \arg\min_{\eta, B} L(\eta, B \mid N, N_{tot}, M, D, A). \tag{3}$$

有限网格不会直接给出连续最优点,所以后续分析同时考虑观测最优点与近优集:沿用 Bi et al. (2024),预先指定 0.1% 阈值,把泛化误差不超过最小值 0.1% 的网格点全部计为近优,以此压噪。

幂律假设沿用既有超参标度研究:

$$h^*(X) = aX^b, \tag{4}$$

等价地 $\log h^* = \log a + b\log X$,在 log-log 空间是截距 $\log a$ 加斜率 $b$。

2.2 受控实验设置

为了把模型规模、训练长度、稀疏度三者的效应分离,作者构造了六个模型规模并系统变动 $N$、$N_{tot}$、$D$、$A \in \{1, 1/4, 1/16, 1/32\}$(留出目标另加 $A=1/64$)。

Table 5:全实验共享的训练控制

设置 取值
训练框架 Megatron
序列长度 4,096 token
Tokenizer Byte-level BPE,词表 157,184
归一化 RMSNorm + QK layer normalization
FFN 激活 SwiGLU
骨干 混合线性注意力 + MLA(Li et al., 2026,即 Ling/Ring 2.6)
位置编码 RoPE
初始化 标准差 0.006;chunk 初始化 $\alpha = 3.0$
优化器 Muon
LR 调度 WSD:1% warmup,末段 10% 指数衰减
Weight decay 0.1(含归一化参数)
梯度裁剪 全局范数 1.0
MoE 路由 Sigmoid 路由 + Auxiliary-Loss-Free 负载均衡(DeepSeek-AI, 2024)

Table 6:六个模型规模的架构控制("S/L" 为 MLA 层数 / 线性注意力层数;主网格每 token 激活两个路由专家)

规模 层数 Hidden size Heads 路由专家宽度 $h_{MoE}$ S/L
10M 10 256 4 384 2/8
20M 10 384 6 512 2/8
40M 12 512 8 640 3/9
80M 16 640 10 768 4/12
158M 20 768 12 1,024 4/16
324M 24 1,024 16 1,280 4/20

Table 7:系数拟合配置与最终联合外推留出目标(节选,$N_{tot}$ 随 $A$ 变化)

规模 $N$ $A$ $E_{act}$ $E_{tot}$ $N_{tot}$ $D$ Target FLOPs 角色
10M 1 / 1/4 / 1/16 / 1/32 2 2 / 8 / 32 / 64 10M / 27M / 98M / 193M 4.6B $3\times10^{17}$ Fit
20M 同上 2 同上 20M / 55M / 197M / 386M 7.8B $1\times10^{18}$ Fit
40M 同上 2 同上 40M / 111M / 395M / 772M 11.6B $3\times10^{18}$ Fit
80M 同上 2 同上 80M / 223M / 790M / 1.5B 19.6B $1\times10^{19}$ Fit
158M 同上 2 同上 158M / 442M / 1.6B / 3.1B 31.7B $3\times10^{19}$ Fit
324M 同上 2 同上 324M / 894M / 3.2B / 6.2B 52.9B $1\times10^{20}$ Fit
324M 1/64 2 128 12.2B 159.0B $\mathbf{3\times10^{20}}$ Holdout

关键细节:

  • 稀疏度是靠改 $E_{tot}$ 实现的——固定 top-2 路由,五档激活率分别对应 2 / 8 / 32 / 64 / 128 个总专家。
  • 主搜索网格:$\eta \in \{5, 7, 10, 14, 20, 28, 40, 56\}\times10^{-4}$(8 档),$B \in \{2^{17}, \dots, 2^{23}\}$(7 档)。所有拟合规模与激活率共享同一主网格。
  • 留出目标用独立网格:$\eta \in \{3.6, 5, 7, 10, 14, 20\}\times10^{-4}$,$B \in \{2^{19}, \dots, 2^{23}\}$。
  • 为省算力,明显落在近优区外的网格点会被提前中止。因此文中的「损失面」是每个配置的实际观测二维网格,不一定覆盖预设 LR–BS 的完整笛卡尔积。
  • 全部实验合计 1,800 次预训练、约 20T token、约 20 万等效 H800 GPU 小时。

三、核心发现一:稀疏度是参数量与算力都吸收不掉的维度

3.1 参数量对齐不管用

既有研究都同意模型规模影响最优学习率,但对「哪个规模」意见相左:Ludziejewski et al. (2025) 认为是激活参数量,Li et al. (2025) 认为是总参数量。作者固定 batch size 直接测。

Figure 2 Optimal hyperparameters still shift with sparsity at matched activated or total parameter count. Validation loss is shown against (a) learning rate at a fixed batch size and (b) batch size at a fixed learning rate. Within each subfigure, the left panel matches activated parameter count N, while the right panel matches total parameter count Ntot.

Figure 2(a) 左图在 $N \sim 158\mathrm{M}$、32B token、$B\sim2\mathrm{M}$ 下对比 $A = 1, 1/4, 1/32$,三条曲线的极小点仍然错开;右图改成对齐 $N_{tot}\sim158\mathrm{M}$、10B token、$B\sim1\mathrm{M}$,同样错开。两种参数量对齐都消不掉学习率漂移。

3.2 算力对齐也不管用

最优 batch size 的合适自变量同样有争议:一派用算力 $C$(Bi et al., 2024;Team et al., 2025),一派用训练 token 数 $D$(Li et al., 2025;Bergsma et al., 2026)。Figure 2(b) 显示,固定学习率时,即便 $D$、$N$ 与总训练算力 $C = MD$ 全部固定住,$B^*$ 仍然随 $A$ 变化;用 $N_{tot}$ 对齐结论相同。

Takeaway(原文):稀疏度为最优超参引入了一个额外的标度维度。参数量、训练 token 与算力都无法解释 $(\eta^*, B^*)$ 跨稀疏度的漂移,因此激活率 $A$ 必须被显式建模。


四、核心发现二:拆解算力、数据与稀疏度

4.1 最优学习率由训练算力组织

固定稀疏度下,既有工作对 $\eta^*$ 的基准变量有分歧:一派用 $N$ 与 $D$ 联合建模(Bjorck et al., 2025;Li et al., 2025),一派直接用 $C$(Bi et al., 2024)。在 $C=MD$ 的定义下,关键问题变成:固定 $C$ 时,$\eta^*$ 是否对「每 token 算力 $M$ 与训练时长 $D$ 之间的分配」敏感?

Figure 3 Training compute organizes the optimal learning rate at fixed sparsity. (a) Comparison of N, D, and C as candidate predictive variables. (b) Power-law relation between the optimal learning rate and C on the representative A = 1/32 slice.

Figure 3(a) 的三个面板给出直接证据:

控制条件 拟合式 读法
固定 $D\approx32\mathrm{B}$,扫 $N$ $\eta = 0.0051\,N^{-0.3400}$ 斜率陡,$N$ 单独看像有强关系
固定 $N\approx324\mathrm{M}$,扫 $D$ $\eta = 0.0016\,D^{-0.1878}$ $D$ 单独看也像有关系
固定 $C\approx10^{19}$,扫 $N$ $\eta = 0.0013\,N^{-0.0254}$ 指数几乎归零

第三行是决定性的:在算力固定的前提下,无论 $M$ 与 $D$ 怎么重新分配,最优学习率几乎不动(指数 $-0.0254$)。所以 $N$ 与 $D$ 各自表现出的关系,其实都是 $C$ 的投影。Figure 3(b) 在代表性的 $A=1/32$ 切片上给出稳定的幂律 $\eta = 0.4338\,C^{-0.1358}$。用 $C$ 取代 $N$、$D$ 两个自由度,既减少模型自由度也让拟合更稳。

4.2 最优 batch size 由训练 token 数组织

Figure 4 Training tokens organize the optimal batch size at fixed sparsity. (a) Comparison of N, C, and D as candidate predictive variables. (b) Power-law relation between the optimal batch size and D on the representative A = 1/32 slice.

对 batch size 做同样的控制比较:

控制条件 拟合式 读法
固定 $D\approx32\mathrm{B}$,扫 $N$ $B = 2.1\times10^{6}\,N^{-0.0000}$ 指数精确为零:给定 $D$,$N$ 完全无关
固定 $N\approx324\mathrm{M}$,扫 $D$ $B = 4.8\times10^{5}\,D^{0.4824}$ 强正相关
固定 $C\approx10^{19}$,扫 $N$ $B = 9\times10^{6}\,N^{-0.3764}$ 固定 $C$ 时 $B^*$ 仍在剧烈变动

第一行与第三行合起来是一个非常干净的判别:固定 $D$ 时 $N$ 的指数是 $0.0000$,而固定 $C$ 时 $N$ 的指数是 $-0.3764$——这直接否证了「$B^*$ 由 $C$ 决定」的形式,因为若 $B^*=f(C)$,固定 $C$ 扫 $N$ 应当得到零指数。Figure 4(b) 在 $A=1/32$ 切片上给出 $B = 13.2024\,D^{0.4982}$,指数接近 $1/2$。

4.3 稀疏度作为额外的标度维度

作者在四档 $A$ 上各拟合一条独立曲线,再比较系数。

Figure 5 Sparsity-dependent shifts in the optimal-learning-rate power law. Left: near-optimal learning rates and power-law fits versus C for four activation ratios; dashed extensions indicate extrapolation beyond each observed range. Middle: fitted exponent versus A. Right: near-optimal learning rates at matched FLOPs.

Figure 6 Sparsity-dependent shifts in the optimal-batch-size power law. Left: near-optimal batch sizes and power-law fits versus D for four activation ratios. Middle: fitted exponent versus A. Right: near-optimal batch sizes at matched training-token counts.

  • 指数在各 $A$ 上围绕均值波动(Figure 5、6 中图的水平虚线),支持一个「共享指数」模型;
  • 在固定 $C$ 处 $\log \eta^*$ 近似正比于 $\log_2 A$,即 $\eta^* \propto A^{\delta_\eta}$,且因为更稀疏对应更低的学习率,$\delta_\eta > 0$。Figure 5 右图在 $C=10^{19}$ 处拟合出 $\eta = 2.01\times10^{-3}A^{0.165}$;
  • batch size 方向相反:固定 $D$ 处 $\log B^*$ 也近似正比于 $\log_2 A$,$B^* \propto A^{\delta_B}$,且更稀疏对应更大 batch,故 $\delta_B < 0$。Figure 6 右图在 $D=7.8\times10^{9}$ 处拟合出 $B/10^{6} = 0.540\,A^{-0.212}$。

附录进一步把这两条关系推广到多个切片(Figure 10、11),说明这不是某个参考尺度的偶然:

Figure 10 Learning-rate dependence on sparsity across fixed-compute slices at C = 3e17, 3e18, and 2e19 FLOPs.

Figure 11 Batch-size dependence on sparsity across fixed-token slices at D = 4.7e9, 7.8e9, and 3.2e10 tokens.

切片 LR 拟合 切片 BS 拟合
$C=3\times10^{17}$ $\eta = 3.39\times10^{-3}A^{0.143}$ $D=4.7\times10^{9}$ $B/10^{6} = 0.472\,A^{-0.237}$
$C=3\times10^{18}$ $\eta = 2.41\times10^{-3}A^{0.144}$ $D=7.8\times10^{9}$ $B/10^{6} = 0.540\,A^{-0.212}$
$C=2\times10^{19}$ $\eta = 1.49\times10^{-3}A^{0.097}$ $D=3.2\times10^{10}$ $B/10^{6} = 3.220\,A^{-0.093}$

这张表其实自带一个警告信号:两侧的 $A$ 指数都随基准尺度单调衰减(LR:$0.143 \to 0.144 \to 0.097$;BS:$-0.237 \to -0.212 \to -0.093$,绝对值缩小到不足 40%)。若这不是噪声,就说明稀疏度指数并非常数,而是随 $C$ / $D$ 增长而减弱——即存在真实的交互项。作者自己在正文里承认「四个切片无法排除指数随 $A$ 变化的交互形式」,把裁决交给了 §5 的分组交叉验证。

4.4 梯度噪声的机理解释(附录 C)

作者给出一个局部模型来解释两条趋势的符号。在均衡路由下,每个专家每步只吃到约 $AB$ 个 token,独立样本近似下其梯度估计方差反比于这个有效 batch:

$$\mathrm{Var}(\hat{g}_e) \propto \frac{1}{AB}. \tag{5}$$

$A$ 变小 → 专家侧梯度噪声变大 → 偏好更大的全局 batch。但固定 token 预算 $D$ 时,加大 $B$ 会把优化器更新次数压到 $D/B$;同时共享参数仍然吃到全 batch 的梯度,不被稀疏路由稀释。三项权衡写作

$$\Delta L(B; D, A) \simeq c_{step}\left(\frac{B}{D}\right)^{p} + c_{shared}B^{-q} + c_{expert}(AB)^{-q}, \quad p, q > 0, \tag{6}$$

三项分别是「更新次数变少的惩罚」「共享参数梯度噪声」「专家参数梯度噪声」。对 $B$ 求极小得

$$B^*(D, A) = \left[\frac{q\left(c_{shared} + c_{expert}A^{-q}\right)}{p\,c_{step}}\right]^{\frac{1}{p+q}} D^{\frac{p}{p+q}}. \tag{7}$$

注意这个式子的结构性结论:token 指数 $\gamma_B = p/(p+q)$ 不依赖 $A$,这正是主文共享指数假设的理论依据。对 $A$ 的局部弹性为

$$\delta_B(A) \equiv \frac{\partial \log B^*}{\partial \log A} = -\frac{q}{p+q}\cdot\frac{c_{expert}A^{-q}}{c_{shared} + c_{expert}A^{-q}}, \qquad -1 < \delta_B(A) < 0. \tag{8}$$

即 $B^*$ 随 $A$ 减小而增大,但增长速度慢于 $A^{-1}$——更新次数惩罚与共享参数噪声两者都在削弱稀疏路由的影响。注意 $\delta_B(A)$ 是 $A$ 的函数而非常数,理论本身就预言了一个(弱的)交互效应。

学习率侧:专家侧噪声随有效专家 batch $AB$ 减小而增大,局部噪声尺度近似

$$T_e \propto \frac{\eta}{AB}, \tag{9}$$

用指数 $\rho$ 概括优化器响应与共享参数的缓冲作用:

$$\eta^* \propto (AB^*)^{\rho}, \qquad 0 < \rho \le 1. \tag{10}$$

由 (8) 可得

$$\frac{\partial \log(AB^*)}{\partial \log A} = 1 + \delta_B(A) > 0, \tag{11}$$

即 $B^*$ 的增长不足以抵消 $A$ 的下降,有效专家 batch 仍在缩小,因此

$$\delta_\eta(A) \equiv \frac{\partial \log \eta^*}{\partial \log A} = \rho\left(1 + \delta_B(A)\right) > 0. \tag{12}$$

这一整套推导只解释符号($\delta_B<0$、$\delta_\eta>0$)与 batch size 基准指数近似跨稀疏度共享,不推导拟合系数、也不要求稀疏度指数严格恒定;学习率对 $C$ 的基准标度仍完全由经验确定。作者对这一点交代得很诚实。


五、统一超参标度律

5.1 函数形式

三条经验观察——(1) 固定 $A$ 时 $\eta^*\sim C$、$B^*\sim D$ 各自幂律;(2) 跨 $A$ 时拟合指数围绕各自均值波动;(3) 固定 $C$/$D$ 时 $\log h^*$ 近似线性于 $\log_2 A$——共同支持用同一个函数族表达两条律:

$$h^*(X, A) = k_h X^{\gamma_h}A^{\delta_h}, \qquad (h, X) \in \{(\eta, C), (B, D)\}. \tag{13}$$

log 空间下

$$\log h^* = \log k_h + \gamma_h \log X + \delta_h \log A. \tag{14}$$

具体地

$$\eta^*(C, A) = k_\eta C^{\gamma_\eta}A^{\delta_\eta}, \tag{15}$$

$$B^*(D, A) = k_B D^{\gamma_B}A^{\delta_B}, \tag{16}$$

其中 $\delta_\eta > 0$、$\delta_B < 0$。这个形式把「固定稀疏度下的基准幂律」与「乘性稀疏度修正」干净地分开了。

Table 1:与既有标度律的自变量对比

方法 $\eta^*$ 的自变量 $B^*$ 的自变量
DeepSeek Law (Bi et al., 2024) $C$ $C$
Microsoft Law (Bjorck et al., 2025) $N_{tot}, D$ —
Joint MoE Scaling Law (Ludziejewski et al., 2025) $N, E_{tot}$ —
Step Law (Li et al., 2025) $N_{tot}, D$ $D$
本文 $C, A$ $D, A$

5.2 拟合协议与拟合结果

正式分析只用 $A \in \{1, 1/4, 1/16, 1/32\}$ 上六个激活规模的开发数据;函数族选择、分组交叉验证、最终系数拟合全部限制在这个集合内。近优集按 0.1% 阈值定义。把幂律在 log 空间线性化后用最小二乘拟合。

Table 2:统一标度律的拟合系数

超参 $h$ 输入变量 $k_h$ $\gamma_h$ $\delta_h$
学习率 $\eta$ $(C, A)$ 0.8343 $-0.1385$ $0.1361$
Batch size $B$ $(D, A)$ 6.4765 $0.5181$ $-0.0841$

其中 $C=MD$ 以非嵌入训练 FLOPs 计,$D$ 与 $B$ 以 token 计,系数值依赖这些单位。$\delta_\eta>0$、$\delta_B<0$ 意味着降低 $A$ 会压低最优学习率、抬高最优 batch size。

把系数换算成幅度:从 $A=1$ 到 $A=1/64$,$\eta^*$ 乘以 $64^{-0.1361}=0.568$(下降 43%),$B^*$ 乘以 $64^{0.0841}=1.42$(上升 42%)。作为对照,在拟合覆盖的 $C$ 全区间($3\times10^{17}\to10^{20}$,约 2.5 个数量级)上 $\eta^*$ 只变化 $10^{-2.52\times0.1385}=0.45$ 倍——也就是说,稀疏度这一条轴对学习率的影响,量级上与整个算力轴相当。这是本文最有说服力的一个量化论点。反过来,同样口径下 batch size 侧:$D$ 覆盖约 1.36 个数量级带来 $10^{1.36\times0.5181}=5.1$ 倍变化,而 $A$ 覆盖 1.81 个数量级只带来 1.42 倍——稀疏度对 batch size 的贡献远弱于对学习率的贡献,这一点在后面的候选族比较里会再次显形。


六、拟合质量与预测性验证

6.1 两套分组交叉验证

  • LOAO(leave-one-activation-ratio-out):留出四档激活率之一,删掉该激活率在所有激活规模上的全部 LR–BS 损失面,然后从剩余激活率上重新提取最优点并重新拟合所有系数;
  • LONO(leave-one-active-scale-out):留出六个激活参数规模之一,删掉该规模在所有激活率上的全部损失面,同样重新提取最优点并重拟合。

两者的目的是判断哪个候选函数族最好地刻画了「最优超参坐标」的标度,而不是预测验证损失。因此主指标是 LR 与 BS 的绝对 log-ratio 误差。为防信息泄漏,每个 fold 都在损失面层级构造,只用训练分片提取最优点与估计系数。总体误差定义为各组内中位绝对 $\log_2$ 比值误差的等权平均:

$$e_h = \frac{1}{|G|}\sum_{g\in G}\mathrm{median}_{s\in g}\left|\log_2(\hat{h}_s / h^*_s)\right|. \tag{17}$$

6.2 四个候选函数族的比较

Figure 7 Grouped prediction results for the multiplicative scaling laws. The left and middle columns show LOAO predictions with A = 1/32 held out and LONO predictions with the 158M scale held out. Solid lines denote equality, dashed lines mark factor-2^0.5 error bounds. The right column compares LOAO and LONO errors with conditional 95% paired surface-cluster bootstrap intervals.

Table 3:四个候选族的超参预测误差(每格依次为 LONO / LOAO 绝对 $\log_2$ 比值误差,$p$ 为参数个数)

候选族 函数形式 $p$ BS 误差 LR 误差
Scale only $kX^{\gamma}$ 2 0.295 / 0.271 0.316 / 0.355
Additive $k_XX^{\gamma} + k_AA^{\delta}$ 4 0.312 / 0.276 0.216 / 0.201
Log interaction $kX^{\beta_X + \beta_{XA}\log_2 A}A^{\beta_A}$ 4 0.307 / 0.238 0.205 / 0.150
Multiplicative(本文选定) $kX^{\gamma}A^{\delta}$ 3 0.282 / 0.221 0.176 / 0.153

结论分两半,作者写得很克制:

  • LR 侧:三个 A-aware 族在两套 CV 下都明显优于 scale-only(0.316/0.355 → 0.176~0.216 / 0.150~0.201),稀疏度项确实带来了实质增益;
  • BS 侧:各候选族之间差异小且随分组方案变化(0.282~0.312 / 0.221~0.276 对 scale-only 的 0.295/0.271)——LONO 下 multiplicative 只比 scale-only 好 4.4%,additive 甚至更差;LOAO 下最好也只好 18%。

multiplicative 在四个误差数字里三个取得最低点估计,只有 LOAO 的 LR 上被 log interaction 微弱超过(0.150 vs 0.153)。在预测表现相当的前提下,作者选 multiplicative 的理由是少一个参数、解释更简单——这是一个明说出来的奥卡姆剃刀选择,而不是统计显著性结论。Figure 7 右列给出了四个族的 out-of-fold 误差与条件 95% 配对 surface-cluster bootstrap 区间(重采样单位是损失面簇,不是单个网格点)。

Table 9:四个候选族的全开发集系数与样本内拟合指标(RMSE 与 $R^2$ 在 base-2 log 空间、目标对齐的开发损失面上计算)

候选族 目标 拟合系数 RMSE ↓ $R^2$ ↑
Scale only LR ($X=C$) $k=0.8704,\ \gamma=-0.1463$ 0.3634 0.3879
BS ($X=D$) $k=1.4827,\ \gamma=0.5894$ 0.3057 0.7104
Additive LR $k_X=1.7579\times10^{8},\ \gamma=-0.6362,\ k_A=1.9358\times10^{-3},\ \delta=0.1808$ 0.2358 0.7422
BS $k_X=0.0197,\ \gamma=0.7651,\ k_A=1.1802\times10^{5},\ \delta=-0.3412$ 0.2644 0.7834
Log interaction LR $k=0.3173,\ \beta_X=-0.1155,\ \beta_A=-0.1434,\ \beta_{XA}=0.0046$ 0.2452 0.7214
BS $k=0.1271,\ \beta_X=0.6896,\ \beta_A=-1.1308,\ \beta_{XA}=0.0319$ 0.2661 0.7805
Multiplicative(选定) LR $k=0.8343,\ \gamma=-0.1385,\ \delta=0.1361$ 0.2463 0.7188
BS $k=6.4765,\ \gamma=0.5181,\ \delta=-0.0841$ 0.2765 0.7630

这张表值得单独读三遍:

  1. 加入 $A$ 对 LR 的样本内解释力提升巨大:$R^2$ 从 0.3879 跳到 0.72~0.74。这是本文头条结论最硬的支撑。
  2. 对 BS 的提升则很有限:scale-only 已经有 $R^2=0.7104$,加了 $A$ 之后 multiplicative 是 0.7630、additive 0.7834——增量不到 0.07。
  3. 被选中的 multiplicative 在两个目标上都不是样本内最优(additive 全面更好),作者明确说明选择依据是分组预测表现相当 + 参数更少 + 解释更简单。

同时必须记住:即使是最好的拟合,$R^2$ 也只有 0.72~0.78,base-2 log 空间 RMSE 约 0.24~0.28——换算过来,典型预测误差约为 $2^{0.25}\approx1.19$ 倍。对一条被称为「律」的关系而言,这是相当大的残余散布,作者用 Figure 7 的 $2^{0.5}$ 误差带(即 1.41 倍)作为可视化基准,也侧面承认了这个精度量级。

6.3 联合外推到留出配置

留出目标:$N = 324\mathrm{M}$ 激活参数、$N_{tot} = 12\mathrm{B}$ 总参数、$A = 1/64$、$D = 159\mathrm{B}$ token,解析 $M$ 给出 $C = MD = 3\times10^{20}$ FLOPs。$N$ 恰好是拟合集里最大的规模(边界值,未越界),而 $A$、$D$、$C$ 三者都超出拟合区间。目标损失在预测坐标冻结之前完全不被检视,且不参与函数族选择、交叉验证与系数拟合中的任何一步。

基线协议分两种:

  • Published-coefficient transfer:直接套用原论文系数,测的是跨优化器、调度、架构、参数量定义的迁移性,不计入主排名;
  • Refitted-family comparison:用统一的最优点定义与相同分组 fold 在正式拟合集上选族,再在完整拟合集上重估系数。

联合精确点对比只纳入同时给出 LR 与 BS 的 DeepSeek Law 与 Step Law;Joint MoE Scaling Laws 与 Microsoft Law 因缺少联合 BS 律被排除。

Table 4:留出联合外推目标上的预测(全部在 $N=324\mathrm{M}$、$N_{tot}=12\mathrm{B}$、$D=159\mathrm{B}$、$A=1/64$、$C=3\times10^{20}$ 处评估;相对差距以本文预测点为基准,单位 ‰)

方法 模式 公式 预测 LR 预测 BS 相对损失差距
DeepSeek Law Published $\eta^*=0.3118C^{-0.1250}$,$B^*=0.2920C^{0.3271}$ $8.59\times10^{-4}$ $1.46\times10^{6}$ 7.22 ‰
DeepSeek Law Refitted $\eta^*=1.6763C^{-0.1619}$,$B^*=182.9951C^{0.2038}$ $8.11\times10^{-4}$ $2.73\times10^{6}$ 1.37 ‰
Step Law Published $\eta^*=1.7900N_{tot}^{-0.7130}D^{0.3070}$,$B^*=0.5800D^{0.5710}$ $3.20\times10^{-4}$ $1.44\times10^{6}$ 9.02 ‰
Step Law Refitted $\eta^*=0.0638N_{tot}^{-0.1743}D^{-0.0084}$,$B^*=5.2828D^{0.5345}$ $8.99\times10^{-4}$ $5.13\times10^{6}$ 1.03 ‰
本文 — $\eta^*=0.8343C^{-0.1385}A^{0.1361}$,$B^*=6.4765D^{0.5181}A^{-0.0841}$ $\mathbf{6.92\times10^{-4}}$ $\mathbf{5.84\times10^{6}}$ —

Figure 8 Training and validation loss surfaces for the held-out joint-extrapolation target. The left panel shows the training loss used for the grid search, and the right panel shows the validation loss. All predictions are frozen before inspection of the held-out losses: the star marks our prediction, and the other markers show predictions from the comparison laws.

Figure 8 上,本文的预测点(星号)落在最内层等值线(训练 1.783 / 验证 1.434)之内,Step (refitted) 的方框在其右上方紧邻,DeepSeek (refitted) 空心圆在下方,两个 published 点则明显偏离——published 系数的迁移差距(7.22‰ / 9.02‰)比 refitted 差距(1.37‰ / 1.03‰)大 5~9 倍,说明既有律的失效更多来自「系数没有在同一优化器 / 调度 / 架构下重估」,而不是函数形式本身完全不能用。

这里必须把数字读准:refitted 基线与本文的损失差距只有 1‰ 量级(1.03‰ 与 1.37‰)。在只有一个留出目标、且明确无法重复多种子的条件下,这个量级的差距是描述性点估计而不是显著性结论——作者自己在 §6 中就是这么写的。

6.4 专家粒度与稀疏度对照

两组受控对比用于分离「专家粒度」与「稀疏度」的效应,全部基于约 10M 激活参数的骨干配置、$D = 4.56\mathrm{B}$ token:

Table 8:留出的专家粒度与稀疏度对照

配置 $(E_{act}, E_{tot})$ $h_{MoE}$ $A$ 激活路由容量 总路由容量 角色
Reference (2, 64) 384 1/32 $2\times384$ $64\times384$ Holdout
粒度对照 (4, 128) 192 1/32 $4\times192$ $128\times192$ Holdout
稀疏度对照 (4, 64) 384 1/16 $4\times384$ $64\times384$ Holdout

三行都不参与系数估计与模型选择。

Figure 9 Expert-granularity and sparsity controls using the 10M-activated-parameter backbone configuration. Each cell shows validation loss at one LR–BS grid point; stars mark near-optimal points.

Figure 9 的三张验证损失网格(LR 取 $\{0.0010, 0.0014, 0.0020, 0.0028, 0.0040\}$,全局 batch 取 $\{32, 64, 128, 256, 512\}$):

Reference($A=1/32$,$E_{act}=2$,$E_{tot}=64$,$h_{MoE}=384$)

$B \backslash \eta$ 0.0010 0.0014 0.0020 0.0028 0.0040
32 2.2892 2.3010 2.3113 2.3321 2.3649
64 2.2314 2.2221 2.2308 2.2410 2.2542
128 2.1999 2.1957 2.1907 2.1994 2.2024
256 2.2048 2.1995 2.1873 2.1894 2.1912
512 2.2698 2.2315 2.2201 2.2093 2.2070

粒度对照($A=1/32$,$E_{act}=4$,$E_{tot}=128$,$h_{MoE}=192$)

$B \backslash \eta$ 0.0010 0.0014 0.0020 0.0028 0.0040
32 2.2661 2.2774 2.2874 2.3083 2.3420
64 2.2082 2.1982 2.2083 2.2185 2.2305
128 2.1752 2.1757 2.1677 2.1770 2.1790
256 2.1821 2.1765 2.1638 2.1661 2.1674
512 2.2472 2.2093 2.1987 2.1863 2.1841

稀疏度对照($A=1/16$,$E_{act}=4$,$E_{tot}=64$,$h_{MoE}=384$)

$B \backslash \eta$ 0.0010 0.0014 0.0020 0.0028 0.0040
32 2.2282 2.2261 2.2528 2.2819 2.2822
64 2.1400 2.1611 2.1678 2.1602 2.1621
128 2.1129 2.0953 2.1189 2.1261 2.1261
256 2.1221 2.0973 2.0962 2.1113 2.1143
512 2.1502 2.1492 2.1224 2.1381 2.1385

结论一(粒度可迁移):左中两张在固定 $A=1/32$ 下把激活专家数与总专家数同时翻倍、专家宽度减半,激活容量与总容量都对齐——两张网格的近优区域与最优点位置几乎一致(都在 $B=256,\ \eta=0.0020$)。所以在测试到的粒度范围内,激活率关系可以迁移,最优超参不因粒度而变。

结论二(稀疏度确实在动最优点):左右两张保持总专家数、专家宽度、$N_{tot}$ 与总路由容量不变,仅把 top-$n$ 从 2 提到 4 使 $A$ 从 1/32 升到 1/16——最优点从 $(B=256, \eta=0.0020)$ 移到 $(B=128, \eta=0.0014)$,LR 与 BS 双双下移,方向与 $\delta_\eta>0$、$\delta_B<0$ 的预测一致($A$ 变大 → $\eta^*$ 变大、$B^*$ 变小;此处 $A$ 变大反而最优点下移,需注意这是相对于第三张网格自身近优平台读取的观测最优格点,原文表述为「与我们标度律预测的方向一致」)。两组对照合起来说明:$A$ 捕捉到的稀疏度效应不能归因于任何单一的绝对专家数或总容量。


七、核心贡献总结

  1. 把「稀疏度」从架构属性升级为超参选择的显式预测变量。以往的超参标度律只在 $(N, D, C)$ 里打转,本文用受控实验证明这三者都吸收不掉激活率带来的漂移,从而给标度律加了第四个维度。
  2. 调和了前人的矛盾:$B^*$ 的基准变量是 $D$ 而非 $C$(固定 $D$ 时 $N$ 指数为 0.0000,固定 $C$ 时为 $-0.3764$,这是一个干净的判别),$\eta^*$ 的基准变量是 $C$ 而非 $(N, D)$(固定 $C$ 时 $N$ 指数只有 $-0.0254$)。
  3. 给出可用的封闭形式:$\eta^* = 0.8343\,C^{-0.1385}A^{0.1361}$,$B^* = 6.4765\,D^{0.5181}A^{-0.0841}$,可以直接拿去为超稀疏 MoE 预训练开学习率与 batch size。
  4. 方法论上把「函数形式选择」当成一个要验证的对象,用同一套 fold 比较 scale-only / additive / log-interaction / multiplicative 四个族,而不是从切片图上直接挑一个。
  5. 给出一个虽简化但自洽的机理解释:每个专家只吃到 $AB$ 个 token,这一条就同时解释了 $\delta_B<0$、$\delta_\eta>0$ 与 batch size 基准指数跨稀疏度近似共享。

八、与已归档相关工作的对比

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale MoE (Kakao Corp., 2026-08-20)

关系:独立并发(本文未引用,且两者给出的是互相冲突的判断)· 已加载对方精读

  • 共同关注的问题:两篇都在解「超大规模 MoE 的最优学习率不能在目标规模上直接搜」这同一个 root cause,而且都把稀疏度当成 MoE 相对 dense 多出来的那条轴。两者甚至连训练栈都高度重合——MLA 系骨干 + Muon 优化器 + WSD 调度,连「扩容靠固定 $E_{act}$、增加 $E_{tot}$」这条稀疏度扩张路径都完全一致。
  • 相近的技术骨架:都是「用低成本 proxy 实验把目标规模的超参搜索坍缩掉」。Kakao 把二维(模型规模 × token 规模)搜索拆成两个一维问题:μP 消掉模型规模维,log-log 线性回归 $\log\eta^* = \beta\log B + \gamma$ 消掉 token 维;本文则完全走经验路线,用 $h^* = kX^\gamma A^\delta$ 一次性覆盖算力、数据与稀疏度三维。本文的 related work 恰好把这两条路线对立起来命名为 theory-driven(μP 系)与 empirically driven(Bi/Bjorck/Li 系)——Kakao 属前者,本文属后者。
  • 本文的差异与推进——一个可以直接对撞的结论冲突:Kakao 为「μP 在稀疏度轴上仍然成立」给出的论证是谱条件视角下的一句话:通过增加专家数来改变激活比率,并不会在宽度缩放本身带来的变化之外,给单个专家的 fan-in / fan-out 带来任何额外改变,因此假定超参可以从低稀疏度 proxy 零样本迁移到高稀疏度目标(它甚至把「在低稀疏度下搜、迁到高稀疏度」当成一条效率优势,理由是极高稀疏度在 proxy 规模上算术强度太低、硬件低效)。本文的 Figure 2 与 $\delta_\eta = 0.1361$ 正是对这一假定的直接经验否证:在 $N$ 或 $N_{tot}$ 对齐的前提下,最优学习率依然随 $A$ 系统性漂移。按本文的律,若 Kakao 从 proxy 到目标把 $A$ 降低 4 倍,最优学习率应当再乘 $4^{-0.1361} = 0.83$,即比 μP 迁移给出的值低约 17%——这是一条 μP 框架结构上看不见的修正。反过来说,Kakao 的 155B 总参 / 17B 激活、10T token 的真实大规模验证是本文没有的证据等级;两篇合起来才构成完整图景。
  • 可比的方法 / 实验差异(拟合单元这一条尤其关键):Kakao 的 token 维数据点来自同一条 proxy run 的 EMA checkpoint——它刻意不跑 decay 阶段,改用 $\theta^{(t)}_{EMA} = \alpha\theta^{(t-1)}_{EMA} + (1-\alpha)\theta^{(t)}$($\alpha=0.6$,每约 2B token 更新、每 10B token 取点)从一次训练里抽出覆盖多个 token 预算的点,理由是跑 decay 太贵且过早 decay 有偏。这在成本上极其划算,但同一条 run 的多个 checkpoint 不是独立观测单元,沿 $D$ 方向的回归误差条会被系统性低估。本文走的是相反的极端:1,800 次彼此独立的完整预训练,每个 LR–BS 网格点都是一次独立 run,bootstrap 的重采样单位是损失面簇。代价是 20 万 H800 卡时——Kakao 的全部 proxy 只花 64.8 ZFLOPs,两者不在一个量级。另一处刻意的分工:Kakao 明确拒绝把 batch size 纳入迁移框架,理由正是「文献没收敛——最优 batch size 到底依赖训练算力(Bi et al., 2024)还是只依赖 token 预算(Li et al., 2025)说法互相矛盾」,于是固定 batch size 只迁移学习率。本文的 §3.2 恰恰就是对这个悬案的裁决(答案是 $D$),一篇搁置的问题被另一篇在三周后回答,而两边互不知情。

LLaDA MoE v2 LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models (Renmin University of China + Ant Group, 2026-08-04)

关系:独立并发(本文未引用,且两者的 batch-size 基准变量互相冲突)· 已加载对方精读

  • 共同关注的问题:两篇都在做「MoE 预训练的最优 LR 与 BS 如何随预算变化」的经验标定,都不满足于把 AR / dense 的既有律直接搬过来,都把结论表述成可外推的幂律,也都用同一套 $C = MD$($M$ 为激活非嵌入 FLOPs/token)的算力口径。两篇甚至共享同一个机构标签(LLaDA MoE v2 的作者单位含 Ant Group),却互不引用。
  • 相近的技术骨架:LLaDA MoE v2 的第一阶段与本文几乎是同一件事——在 158M / 1B / 3.6B 三个规模、$10^{18}\sim3\times10^{20}$ FLOPs 上联合搜 $(B, \eta)$,拟合 $B^* = 0.374\,C^{0.3481}$ 与 $\eta^* = 64.8\,C^{-0.2447}$,并与 DeepSeek Law 的 $B = 0.2920\,C^{0.3271}$、$\eta = 0.3118\,C^{-0.1250}$ 对照;随后把预算推到 $6\times10^{20}$ FLOPs 做一次外推验证,看拟合点是否落在实测最优附近。这条「拟合—对照 DeepSeek—单点外推验证」的流程与本文 §5–§6 结构完全同型。
  • 本文的差异与推进:两处实质性分歧。其一是 batch size 的基准变量:LLaDA MoE v2 沿用 DeepSeek 的 $B^*(C)$ 形式,而本文的 Figure 4a 给出了对该形式的直接否证——固定 $C\approx10^{19}$ 扫 $N$ 时 $B$ 仍按 $N^{-0.3764}$ 剧烈变动,若 $B^*$ 真是 $C$ 的函数,这个指数应当为零(对照:固定 $D$ 扫 $N$ 时指数恰为 $-0.0000$)。也就是说,一条以 $C$ 为自变量的 batch size 律,其系数会随 $M/D$ 分配而漂移,只在标定时使用的那条 $M(C)$ 轨迹上成立。其二是稀疏度的位置:LLaDA MoE v2 是严格串行的三段式——先标定超参律,再定 $M/D$ 分配,最后才在给定激活预算内分解激活比率、专家粒度与共享容量;换言之它的超参律是在固定架构下拟合的,激活比率进入的是后一阶段(结论是「更大尺度上更低的激活比率越发有利」)。本文则证明这个串行假设本身有风险:如果最优超参本来就随 $A$ 漂移,那么在第三阶段比较不同激活比率时,各配置并不都处在自己的最优超参上。
  • 可比的方法 / 实验差异:LLaDA MoE v2 把 dLLM 与 AR 的超参差异归因于「掩码去噪目标下每个名义 token 的有效监督被削减(均匀 timestep 采样下期望只有一半 token 被预测)」,据此解释它更陡的 batch size 指数(0.3481 vs 0.3271)与 3.4 倍更大的最优 batch。这个机理与本文附录 C 的「每个专家只吃到 $AB$ 个 token」是同一个梯度信噪比论证的两个实例:一个把有效监督量按掩码率打折,一个按路由稀疏度打折,两者都推出「有效样本变少 → 需要更大的名义 batch」。把两篇的机理并列,会自然引出一个双方都没做的实验:MoE dLLM 的 $\delta_B$ 是否等于 AR MoE 的 $\delta_B$,还是掩码率与激活率的效应会相乘。规模上,本文六个规模最大到 324M 激活 / 6.2B 总参,LLaDA MoE v2 的标定最大到 3.6B、并有 30B-A3B / 23.5T token 的实跑落地——后者的验证规模更高,前者的稀疏度覆盖更广($A$ 跨 1 到 1/64)。

Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse MoE (Amazon AGI Foundations, 2026-08-11)

关系:独立并发(本文未引用;两者从相反方向处理同一个「算力口径」问题)· 已加载对方精读

  • 共同关注的问题:两篇都认定「稀疏度必须作为一个显式维度进入标度律,否则律会给出错误处方」,也都指出既有 MoE 标度分析在稀疏度上留了洞。MOSAIC 的表述是稀疏度 $S$ 引入了 $(N,D)$-only 定律看不见的额外最优点,本文的表述是激活率 $A$ 引入了 $(N, N_{tot}, C)$ 都吸收不掉的超参漂移——同一句话的两个版本。
  • 相近的技术骨架:都是「在一个跨规模的从零预训练网格上拟合一条多维幂律,并证明少了那一维就会错」。MOSAIC 用约 150 次 from-scratch run(104M–2.7B 激活、最高 79B 总参)拟合四维联合律 $L(N_{tot}, S, D, G)$;本文用 1,800 次 run 拟合 $h^*(X, A)$。两者都用「留出 + 冻结预测 + 事后检视」的协议做外推验证。
  • 本文的差异与推进(因变量不同,但正好互为对方的盲区):MOSAIC 的因变量是 loss,产出是架构与 token 预算的选择;本文的因变量是最优超参坐标,产出是 LR / BS 的处方。二者在流水线上是前后相邻的两步:MOSAIC 选完架构,本文告诉你用什么 LR/BS 训它。更有意思的是,MOSAIC 的核心批判恰好打在本文的算力口径上。本文把 $C = MD$ 定义为解析的非嵌入 model FLOPs,$M$ 逐配置精算——这比 $6ND$ 严格得多,但路由所需的 all-to-all 通信、专家并行的流水线气泡、随专家数增长而恶化的算术强度,全都在账外。MOSAIC 恰恰证明了这笔账不能不算:它把可交付算力写成 $C_{deliverable} = C_{peak}\cdot\mathrm{MFU}\cdot\eta_{good}$,并给出结论——在纯 model-FLOPs 预算下稀疏度不存在内点最优(拟合 loss 随稀疏度单调下降,最优永远贴在数据上边界),稀疏度的最优点只有在集群约束下才出现。
  • 可比的方法 / 实验差异:把 MOSAIC 的口径代回本文的律,会得到一条本文没有讨论的推论。设集群侧 MFU 随稀疏度衰减近似为 $\mathrm{MFU}(A)\propto A^{\varepsilon}$($\varepsilon>0$),并把律改写在墙钟等效算力 $C_{wall} = C/\mathrm{MFU}(A)$ 上,则 $\eta^* = k_\eta (C_{wall}\mathrm{MFU}(A))^{\gamma_\eta}A^{\delta_\eta} = k_\eta C_{wall}^{\gamma_\eta}A^{\gamma_\eta\varepsilon + \delta_\eta}$。因为 $\gamma_\eta = -0.1385 < 0$,有效的稀疏度指数会比 0.1361 更小——也就是说,本文测到的 $A$ 效应里有一部分是「选择 model FLOPs 作为算力单位」这个记账选择的产物,换一个集群感知的算力单位就会被部分吸收回去。这不否定 $A$ 必须显式建模的结论(Figure 2 在固定 $N$ / $N_{tot}$ 下的漂移与算力单位无关),但确实说明 $\delta_\eta$ 的数值是口径依赖的,跨集群搬运时应当重估而非照抄。反过来,MOSAIC 的性能模型(MFU 预测 MAPE < 15%)正好提供了估计 $\varepsilon$ 所需的工具。

九、讨论与局限性

9.1 拟合到底够不够称一条「律」

按标度律论文的常规判据逐条核:

独立格点数与跨度。 这一条本文表现相当好:每个 LR–BS 网格点都是一次独立的从零预训练,而不是同一条 run 的多个 checkpoint——1,800 次 run 撑起的是名副其实的独立观测;bootstrap 的重采样单位写明是「surface cluster」(损失面簇,即一个 $(N, A, D)$ 配置),也就是格点级而非 checkpoint 级。正式拟合覆盖 6 个激活规模 × 4 档激活率 = 24 个 $(N, A)$ 单元,外加 Figure 3a/4a 里在固定 $N$ 扫 $D$、固定 $C$ 变 $M/D$ 分配的额外配置。分组 CV 只有 4 组(LOAO)与 6 组(LONO),组数偏少,作者自己也承认。

跨度就没那么理想:$C$ 覆盖 $3\times10^{17}\to10^{20}$,约 2.5 个数量级;$D$ 从 4.6B 到约 106B,约 1.4 个数量级;$A$ 从 1 到 1/32,约 1.5 个数量级。作为对照,Kaplan / Chinchilla 系的 loss 律通常跨 5–8 个数量级。batch size 那条律的自变量跨度只有 1.4 个数量级,却要支撑一个 $0.5181$ 的指数——这是全文最薄的一处。

$R^2$ 与置信区间。 两项都有,这一点应当肯定:Table 9 明确给出 base-2 log 空间的 RMSE 与 $R^2$,Figure 7 右列给出条件 95% 配对 surface-cluster bootstrap 区间。但数字本身要正视:选定的 multiplicative 形式 $R^2$ 只有 0.7188(LR)/ 0.7630(BS),RMSE 0.2463 / 0.2765,对应约 1.19 倍的典型预测误差;而 Figure 7 用的误差带宽度是 $2^{0.5}=1.41$ 倍。更麻烦的是bootstrap 区间互相重叠——作者在 §6 明说「当前证据既不能确立无交互模型的显著优势,也不能排除标度指数随激活率变化」。换句话说,Table 3 里 multiplicative 对 log-interaction 的 0.176 vs 0.205(LONO LR)并不是一个统计显著的胜出,选定 multiplicative 是奥卡姆剃刀而非数据裁决。附录 Figure 10/11 里 $A$ 指数随基准尺度单调衰减(LR $0.143\to0.097$,BS $-0.237\to-0.093$)也在同一个方向上提示交互项可能真实存在。

「律」这个词配不配得上,要分开看两条:LR 那条是站得住的——加入 $A$ 把 $R^2$ 从 0.3879 抬到 0.7188,分组 CV 误差从 0.316/0.355 降到 0.176/0.153,增益幅度是两倍量级。BS 那条则明显更弱:scale-only 已经有 $R^2 = 0.7104$,加了 $A$ 只到 0.7630;LONO 下分组误差只从 0.295 改善到 0.282(4.4%),additive 族甚至更差;作者自己也写了「for BS, the differences among candidate families are smaller and vary with the grouping scheme」。因此标题里的「Hyperparameter Scaling Laws」(复数)里,真正被数据强力支撑的其实只有学习率那一条。

9.2 口径是否严格:算力匹配还是参数匹配

这一点本文做得比同类工作都干净,值得单独表扬:它不是二选一,而是把三种对齐口径全部测了一遍并全部证伪。Figure 2 左右两栏分别对齐激活参数量 $N$ 与总参数量 $N_{tot}$,Figure 3a/4a 又在固定 $C\approx10^{19}$ 下变动 $M/D$ 分配。结论是「$N$、$N_{tot}$、$C$ 三种匹配都消不掉稀疏度效应」——这比只做参数匹配或只做算力匹配的做法要严格一个层级。而且论文的交付物是超参预测而不是「MoE 更优」的架构主张,所以它并不需要「加专家数换来的收益是否被记账」这个通常最容易翻车的判据。

但通信与路由开销确实在账外。$M$ 是「该架构每 token 的非嵌入前反向 FLOPs」,路由门控的 FLOPs 微不足道且已包含在内,而 all-to-all 通信、专家并行的气泡、随 $E_{tot}$ 增长的显存与调度成本都不是 FLOPs、自然不进 $C$。本文的主稀疏度扫描又恰恰是靠把 $E_{tot}$ 从 2 加到 128 来降低 $A$ 的:在 324M 那一档,$A=1$ 时 $N_{tot}=324\mathrm{M}$,$A=1/32$ 时 $N_{tot}=6.2\mathrm{B}$——总参数量涨了 19 倍而 $C$ 记账几乎不变。这在超参预测的语境下不构成结论偏差(因为没有人声称这 19 倍参数是免费的),但它意味着 §8 第三节推出的那条修正是真实的:$\delta_\eta = 0.1361$ 的数值部分依赖于「用 model FLOPs 而非集群可交付算力作为 $C$」这一选择。此外,附录 A.2 提到为省算力会提前中止「明显落在近优区外」的网格点,损失面因此不是完整笛卡尔积——这是合理的工程取舍,但它让「近优集」的边界带上了一点由中止规则决定的成分。

还有一条独立于口径的局限:证据全部来自单一骨干(混合线性注意力 + MLA)、单一数据混合、单一优化器(Muon)、单一路由方案(sigmoid + auxiliary-loss-free);粒度与稀疏度对照只有三个配置。$\gamma_\eta = -0.1385$ 与 DeepSeek 在 AdamW 下的 $-0.1250$ 接近,但 Muon 与 AdamW 的学习率量纲本就不可直接比较,跨优化器迁移仍未验证。

9.3 外推是否被克制

总体克制,只有一处presentational 上的伸手。正面的:留出目标只在 $A$($1/32\to1/64$,2 倍)、$D$(52.9B $\to$ 159B,3 倍)、$C$($10^{20}\to3\times10^{20}$,3 倍)三个方向各越界不到半个数量级,$N$ 则保留在观测边界上不外推;预测坐标在检视留出损失前冻结;Figure 5/6 的外推段用虚线明确标注;§6 明说只有一个越界目标、无法沿单变量分离外推、无法重复多种子、因此「每个精确预测只被对着一组含噪网格观测的极小值评估一次,观测到的损失差距是描述性点估计」。论文没有把拟合外推到远超实验范围的规模再当结论用——这一点与很多标度律论文形成对比。

唯一可议之处是 Figure 1(b) 这张 teaser:它把拟合曲面画到 $C = 10^{25}$ FLOPs 与 $D = 10^{13}$ token,即比 $10^{20}$ 的拟合上限高出五个数量级,虽然图上有一小块深色区标出实测覆盖范围,但视觉重心完全落在外推区。这属于展示层面的夸张而非结论层面的越界,正文与结论都没有引用这块区域的任何数字。

9.4 「引入新信号 ≠ 收益来源」与退化变体的核验

本文没有传统意义上的组件消融,候选函数族比较(Table 3、Table 9)就是它的消融:Scale only 就是「w/o $A$」的退化变体。按新核法要求,把这个退化变体先跟同表最强外部基线比:

  • LR 侧:Scale only 的形式 $kC^\gamma$ 正是 DeepSeek Law 的 LR 形式;本文用同一套 fold 重拟合它得到 0.316/0.355,而完整形式是 0.176/0.153——「w/o $A$」不仅输给本文,其绝对水平也就是外部基线的水平,说明 $A$ 项带来的是真实增量而不是重参数化的假象。Table 4 的 refitted DeepSeek($\eta^*=1.6763C^{-0.1619}$)在留出点给出 $8.11\times10^{-4}$ 对本文 $6.92\times10^{-4}$,方向也一致(缺了 $A$ 的修正就会把学习率开高)。
  • BS 侧则要打折:Scale only 的 $kD^\gamma$ 正是 Step Law 的 BS 形式,重拟合后 0.295/0.271,而本文 0.282/0.221。LONO 下只领先 4.4%,且 additive 族(同样含 $A$)反而更差(0.312)——这说明在 batch size 上,「引入 $A$ 这个新信号」并没有稳定地转化为收益,收益的来源仍主要是 $D$。Table 4 里 refitted Step Law 的 BS 预测 $5.13\times10^{6}$ 与本文 $5.84\times10^{6}$ 也只差 14%,远小于 LR 侧 published 系数的偏离幅度。这与 §9.1 的判断闭合:两条律里只有 LR 那条真正通过了「新信号即收益来源」的核验。

9.5 把这条律反过来用在库里的其他论文上

一个即时可做的应用:库里刚归档的 SMELT SMELT(清华 + ByteDance Seed,2026-09-01,本文未引用)用 MoE 同时锁死 per-token FLOPs、总参数量与 KV cache 三个预算来公平评估循环 Transformer,其匹配手段正是增加专家数。以文中给出的 200M / $S\approx94.7\%$ 实例为例:Baseline 每层 192 个专家、SMELT 每层 288 个,两侧均为 top-8 路由,因此 $A_{base} = 1/24$ 而 $A_{SMELT} = 1/36$。代入本文的律,SMELT 那一臂的最优学习率应当比 Baseline 低 $(2/3)^{0.1361} = 0.946$(约 $-5.4\%$),最优 batch size 应当高 $(2/3)^{-0.0841} = 1.035$(约 $+3.5\%$)。SMELT 的配对训练在完全相同的 token 序列与相同优化器设置下进行,也就是说两臂共用一组超参,更稀疏的 SMELT 臂系统性地略微偏高于自己的最优学习率。幅度不大(5% 量级,远小于 SMELT 报告的 6.8–18.0% FLOPs 节省),且方向上不利于 SMELT,因此 SMELT 的头条结论不受威胁、甚至偏保守——但这恰好演示了本文这条律的一个非显然用途:任何「靠加专家数来做预算匹配」的对照实验,两臂的最优超参在原理上就不相等,共用一组超参会给更稀疏的一臂带来一个可量化的系统性惩罚。

同类的方法论呼应还有 Skaling: Chinchilla's Exponents Meet Kaplan's Coupling Skaling(FAIR at Meta,2026-08-07)——它用无参数数值微分证明 Chinchilla 加法律隐含的零交叉导数被数据否证(实测混合导数非零且为负),必须补交互项。本文在超参律上面对的是同一个岔路口:multiplicative 形式在 log 空间等价于「$\log X$ 与 $\log A$ 无交互」,log-interaction 族则允许交互。本文的数据既不能确立前者、也不能排除后者(bootstrap 区间重叠,LOAO 的 LR 上后者反而更优),而附录切片里 $A$ 指数的单调衰减又指向交互。Skaling 在 loss 律上的经验提示:这类「先假定可加/可分离、后被更细的数值证据推翻」的模式在标度律里反复出现,本文选定的无交互形式很可能是一个待修正的一阶近似——作者自己把这写进了限制章节,是诚实的。

9.6 值得借鉴的设计

  1. 候选变量的判别方式:不是比谁的拟合更好看,而是设计「固定 $C$ 扫 $N$」这类指数应当为零的控制实验($-0.0254$ 与 $-0.0000$ 两个数字比任何 $R^2$ 都更有说服力)。这套判别法可以直接搬到推荐系统的 scaling 研究里——比如判断序列长度与参数量哪个才是某条增益曲线的真正自变量。
  2. 函数形式作为被验证对象:把 scale-only / additive / log-interaction / multiplicative 放在同一套 fold 上比,且在选定时明说依据是参数更少而非误差显著更低。
  3. 冻结预测协议:留出目标的损失在预测坐标冻结前完全不检视,published 与 refitted 两种基线模式分开报告,把「函数形式不行」与「系数没在同一栈下重估」两种失效原因分离开。
  4. 诚实的限制章节:明说组数不足、区间重叠、无法多种子、无法沿单变量分离外推。这在标度律论文里并不常见。

9.7 工业价值

对训练超稀疏 MoE 的团队,本文的直接交付物就是两个可以立刻代入的公式。以 $A = 1/64$、$C = 3\times10^{20}$、$D = 159\mathrm{B}$ 为例,得到 $\eta^* = 6.92\times10^{-4}$、$B^* = 5.84\times10^{6}$ token。用 20 万 H800 卡时换一套超参处方,在动辄十万卡时量级的前沿预训练里是划算的——这也是本文能存在的前提(作者是 Ling / Ring 2.6 万亿参数模型的同一批人,这套律显然服务于自家的 trillion-scale MoE 预训练)。但要注意三条使用边界:(1) 系数与优化器(Muon)、调度(WSD)、骨干(混合线性注意力 + MLA)、路由(sigmoid + ALF)绑定,换栈需重估;(2) 律的目标是验证损失,而验证损失的改善不一定均匀传导到下游能力——作者引 Gadre et al. (2025)、Isik et al. (2025) 自陈这一点;(3) 若集群侧 MFU 随稀疏度显著衰减,$\delta_\eta$ 需按 §8 第三节的推论重估。

综合看:实验规模与受控严谨度是稀缺的(1,800 次独立预训练、三种对齐口径全部证伪、冻结外推协议),机理解释自洽,限制交代诚实;扣分项是拟合跨度偏窄(BS 侧仅 1.4 个数量级)、$R^2$ 只有 0.72–0.78、候选形式之间无统计显著差异、batch size 那条律的增量证据明显弱于标题所暗示的强度,且止于超参预测、未触及最终模型质量或下游收益。