← Back to list
SZP

When is Warmstarting Effective for Scaling Language Models?

LLM 学术
Abstract 7 │ Reading 7 │ Rating —
2026-05-13
Neeratyoy Mallik, Maciej Janowski, Johannes Hog, Herilalaina Rakotoarison, Josif Grabocka, Frank Hutter, Aaron Klein
University of Freiburg, Zuse School ELIZA, University of Technology Nuremberg, University of Helsinki, Prior Labs, ELLIS Institute Tübingen
系统回答「热启动(从小 checkpoint 生长出大模型)何时真的划算」:把生长算子解耦成 growth×shrink×perturb 三轴得到架构无关的 SZP,证伪「初始化时函数保持是必要条件」,用 IsoFLOP 扫描确立生长因子上界 g_upper(超过即不如从头训、且该上界只取决于架构比而非绝对尺寸),再用 Chinchilla 式 scaling law 的差值等值线预测 WS 与 Scratch 的交叉边界,给出 g=2、≤20 tokens/param、µP 迁移三条实践准则。
评分原因
摘要评分:系统回答「模型生长/热启动何时真的划算」:指出不必保留小模型的生长后初始性能、简单且架构无关的生长策略可胜过复杂 warmstart 算子,并给出增长因子 g 的经验上界(超过即不如从头训)、2× 最稳、收益在 20 tokens/param 预算下最大且随预算增大而衰减,还拟合了 scaling law 供实践决策;结论可操作、可迁移到推荐大模型扩容,但纯学术、规模有限,给 7。
精读评分:方法论扎实:用 µP 消除超参混淆、39k–50k GPU-hours 的受控扫描、R²>0.99 的 Chinchilla 拟合,外加有效秩/径向-角向位移的机制层证据;g_upper 与「函数保持非必要」两个结论对实践直接可用。但只做宽度生长(无深度)、只比 SZP 与 Net2Net 两个算子、规模上限 1.2B 且最大档仅 2 次 run、下游评测是单 checkpoint sanity check、且没有「按处方训一次」的验证闭环,创新度更偏向对 Du et al. 2024 已隐含结论的重新框定而非全新发现。
parameter-scaling pretrained-lm transformer training-stability academic

When is Warmstarting Effective for Scaling Language Models?

Neeratyoy Mallik、Maciej Janowski、Johannes Hog(共同一作)、Herilalaina Rakotoarison、Josif Grabocka、Frank Hutter、Aaron Klein University of Freiburg / Zuse School ELIZA / University of Technology Nuremberg / University of Helsinki / Prior Labs / ELLIS Institute Tübingen arXiv 2605.13405v1,2026-05-13,cs.LG

研究动机与背景

训练前沿模型的算力成本逐年攀升,一个非常自然的诉求是:当我们把模型从几百 M 扩到几 B 时,能不能把此前投在小模型上的算力回收利用? 这条路线被称为 model growth 或 warmstarting(WS)——用一个训练好的小 checkpoint 去初始化更大的模型,而不是从随机初始化重新开始。

这个想法从 Net2Net(Chen et al., 2016)和 Network Morphisms(Wei et al., 2016)起就存在,二十余篇后续工作把它推广到了 BERT(progressive stacking、bert2BERT)、CLIP(GrowCLIP)乃至现代 decoder-only LLM。但作者观察到一个尴尬的事实:WS 至今没有进入任何一条主流的生产训练流水线,它更像是一个学术话题。

论文把"为什么没人用"归因到两个被系统性忽略的因素:

  1. 对"函数保持"(function-preservation, FP)的过度执念。FP 要求生长后模型在第一次前向传播时的输出与基模型完全一致。自 Chen et al. (2016) 起,FP 主导了整个宽度生长范式。但 FP 的代价是:每遇到一种新架构组件(RoPE、RMSNorm、Mamba 的选择性状态空间……)就要重新推导一套保持函数不变的规则,算子设计被死死绑住。
  2. 对"生长如何与超参、scaling 行为交互"的分析严重不足,而且各篇论文用的生长因子 $g$(目标模型参数量 / 基模型参数量)互不一致——有人用 2×,有人用 4×,导致横向比较根本不成立。

由此作者归纳出三条阻碍 WS 落地的具体障碍:(1) 实现复杂度(算子需要架构特化,难以泛化到新组件);(2) 生长上限不明(实践者不知道一个 checkpoint 最多能长多大才不至于反受其害);(3) scaling 下的超参不透明(WS 方法 × 超参 × 模型/数据预算的三方交互没被研究,重调超参的开销可能把 WS 省下的算力全吃掉)。

本文把研究范围收缩得非常明确:给定一个可用的基模型 checkpoint,把它 WS 到更大规模。作者假设我们知道基模型训练用的数据集、可能知道部分超参,但把基模型投入的训练算力当作黑箱——这与 Liew & Kato (2025) 假设完全掌握基模型训练历史的设定不同,作者认为黑箱假设更贴近真实世界(公开发布的往往只有 checkpoint 本身)。

论文的三条贡献是:

  1. 把 WS 生长归纳为 shrink-zero-perturb(SZP) 这一简单、架构无关的操作,并证明精确的函数保持并非有效 WS 的必要条件;
  2. 经验性地确立了生长比的上界 $g_{\text{upper}}$——超过这个界,从头训练(Scratch)的收敛速度就追平甚至超过 WS;
  3. 用 scaling law 拟合证明:对给定的 WS 方法与基模型规模,WS 相对 Scratch 的收敛优势只在一个有界的 token 预算内成立,并能预测这个交叉点在哪。

核心方法:Warmstarting 的三轴设计空间与 SZP

从 Shrink-and-Perturb 到生长算子

FP 类方法通常混合了三种成分:克隆已有权重、缩放生长后的权重、注入噪声,而且这三者常常通过架构特化的规则耦合在一起。本文的做法是把这三个设计维度解耦,并对所有权重(1D 与 2D)一视同仁地施加。

出发点是持续学习(Continual Learning)领域的 shrink-and-perturb(SnP,Ash & Adams, 2020)。SnP 原本用于同尺寸模型的重初始化:

$$\theta^{l}_{\text{target}} = \lambda_{\text{shrink}} \cdot \theta^{l}_{\text{base}} + \mathcal{N}(0, \sigma_{\text{perturb}}^{2}) \tag{1}$$

其中 $\lambda_{\text{shrink}}$ 调节继承权重的影响力,$\sigma_{\text{perturb}}$ 是加在所有神经元上的高斯噪声标准差,$l$ 为层索引。

为了适配"目标模型比基模型大"的生长场景,本文引入一个生长函数 $G$:

$$\theta^{l}_{\text{target}} = \lambda_{\text{shrink}} \cdot G(\theta^{l}_{\text{base}}, p, q) + \mathcal{N}(0, \sigma_{\text{perturb}}^{2}) \tag{2}$$

其中 $G : \mathbb{R}^{m\times n} \times \mathbb{N} \times \mathbb{N} \to \mathbb{R}^{p\times q}$ 把基权重 $\theta^{l}_{\text{base}} \in \mathbb{R}^{m\times n}$ 映射到更大的目标形状 $p \times q$($p \ge m$,$q \ge n$),$\lambda_{\text{shrink}} \in \mathbb{R}_{>0}$,$\sigma_{\text{perturb}} \in \mathbb{R}$。

三个轴各自的物理含义(作者的原话值得保留):

  • Growth($G$) 决定从基模型继承哪些结构;
  • Perturbation($\sigma_{\text{perturb}}$) 负责打破对称性——它确保新增神经元能学到不同的特征,而不是单纯复制继承来的行为;
  • Shrinking($\lambda_{\text{shrink}}$) 降低继承权重的幅值,抑制基表征的支配地位,让新神经元能有意义地参与学习。

作者明确指出,式 (2) 通过对每个架构组件选择合适的 $G$、$\lambda_{\text{shrink}}$、$\sigma_{\text{perturb}}$,形式上可以表示 Net2Net 这类更复杂的算子,但推导这种映射本身不在本文范围内。

为什么默认选 SZP

Figure 1: Comparing the simplest set of realizations of Equation (2), for different target scale runs, given the base checkpoint; Zeros and Clone represent the choices for G, the growth function; G+Perturb represents λshrink = 1, or no shrinking; SnP-G represents λshrink = 1; For each choice of G, we observe: SnP-G ≥ G + Perturb ≥ G, in terms of convergence rates.

Figure 1 在四组 width 生长(64→128、64→256、128→512、256→768)上比较了设计空间的最简实例化:

  • Zeros(新位置补零)与 Clone(复制已有权重)单独使用时没有显著差异;
  • 各自加上扰动噪声(Zeros+Perturb、Clone+Perturb)后都有提升;
  • 再加上收缩(Shrink+Zeros+Perturb、Shrink+Clone+Perturb)后进一步提升,且这个序关系在各生长比下都成立:$\text{SnP-}G \ge G + \text{Perturb} \ge G$。

值得注意的是:所有 WS 变体都能在几步之内恢复到基模型的损失水平,并且在训练早期都比 Scratch 收敛更快。差异要到"持续收敛"阶段才显现出来——而 SZP(Shrink+Zeros+Perturb)是唯一在所有模型宽度上都稳定占优的变体。

作者非常克制地声明了 SZP 的定位:SZP 并非被提出为新的 SOTA warmstarting 算法,而是一个「原则性的 baseline」,用来研究 WS 的 scaling 行为。它的价值在于:结构上对齐了标准 FP 算法(也是 clone/scale/noise 三件套),但放松了"初始化时保持基模型输出"这一硬约束,因而对任意架构都能直接实现。

理论直觉:零填充、扰动、收缩为何互补

考虑 $\phi(0)=0$ 的前馈网络 $h_{\ell+1} = \phi(W_\ell h_\ell + b_\ell)$。令 $P(\theta)$ 表示从宽度 $n$ 到宽度 $m > n$ 的零填充扩展(所有触及新神经元的参数置零),并把隐状态嵌入为 $\tilde h_\ell = [h_\ell;\, 0]$,则

$$\tilde{h}_{\ell+1} = \phi\left(\begin{bmatrix} W_\ell & 0 \\ 0 & 0\end{bmatrix}\begin{bmatrix} h_\ell \\ 0\end{bmatrix} + \begin{bmatrix} b_\ell \\ 0\end{bmatrix}\right) = \begin{bmatrix} h_{\ell+1} \\ 0 \end{bmatrix} \tag{3}$$

按层归纳可得 $f_{P(\theta)}(x) = f_\theta(x)$ 对所有 $x$ 成立——在这个理想化的无归一化设定里,零填充本身就精确保持了预训练函数。(对含 LayerNorm / RMSNorm 的 Transformer,精确 FP 还需要对归一化参数或相邻权重做协同缩放;因此零填充只应被视为一种"嵌入直觉"而非严格的 FP 操作。)

但这个精确嵌入同时也是束缚。令 $\mathcal{M} := \{P(\theta) : \theta \in \Theta_{\text{small}}\}$ 为嵌入的小模型流形。在 $\mathcal{M}$ 上,每个新增神经元的激活为零、出边权重也为零;由反向传播的链式法则,传回这些新神经元的误差信号恰好为零,于是

$$\nabla_{\Theta_{\text{new}}} \mathcal{L}(P(\theta)) = 0 \tag{4}$$

也就是说,纯零填充会把优化永久锁死在小模型流形上,更宽的模型根本用不上多出来的容量。

SZP 的初始化写作 $\Theta_0 = \lambda_{\text{shrink}} P(\theta^\star) + E$($0 < \lambda_{\text{shrink}} \le 1$,$E$ 为扰动)。把某一层的输入按旧(o)/新(n)坐标分块,扰动矩阵与偏置分块为 $E = \begin{bmatrix} E_{oo} & E_{on} \\ E_{no} & E_{nn}\end{bmatrix}$、$e = [e_o; e_n]$,则预激活为

$$\tilde{z} = \begin{bmatrix} \lambda_{\text{shrink}}(Wh+b) \\ 0 \end{bmatrix} + \begin{bmatrix} E_{oo}h + e_o \\ E_{no}h + e_n \end{bmatrix} + O(\|E\|^2) \tag{5}$$

下分块 $E_{no}h + e_n$ 是新增神经元能拿到的第一个非零信号:若 $E = 0$,新坐标永远静默。这就是扰动把模型推离流形 $\mathcal{M}$、激活新自由度的作用。

收缩则起互补作用。新旧通路的相对影响力(一阶近似)为

$$\frac{\|(\tilde{z})_{\text{new}}\|}{\|(\tilde{z})_{\text{old}}\|} = \frac{\|E_{no}h + e_n + O(\|E\|^2)\|}{\|\lambda_{\text{shrink}}(Wh+b) + E_{oo}h + e_o + O(\|E\|^2)\|} \tag{6}$$

当继承通路信号支配旧块扰动($\lambda_{\text{shrink}}\|Wh+b\| \gg \|E_{oo}h+e_o\|$)时简化为 $\|E_{no}h+e_n\| / (\lambda_{\text{shrink}}\|Wh+b\|)$。取 $\lambda_{\text{shrink}} < 1$ 让新神经元更容易与被复制的子网络竞争;更大的相对预激活意味着新权重在反传时产生更大的梯度,主动把优化轨迹拉离受限流形 $\mathcal{M}$。

一句话总结三者分工:零填充保存预训练模型,扰动激活新维度,收缩通过打破继承窄解的优化支配地位来加速适应。

关键技术细节

对照基线:Net2Net 宽度扩展

作者选 Net2Net 作为主要 FP baseline,理由是它 (1) 面向宽度扩展(与本文范围一致)、(2) 初始化时近似函数保持、(3) 不需要改训练目标或增加优化阶段;而且在 Du et al. (2024) 的大规模生长基准里,Net2Net 式的 direct widening 是最强的宽度扩展基线。

Figure 12: Net2Net-style matrix expansion. A width expansion can be implemented by duplicating columns (fan-in growth) and rows (fan-out growth), corresponding to adding new hidden units.

对隐藏宽度 $n$ 的 MLP 块 $h = \phi(W_{\text{in}}x)$、$y = W_{\text{out}}h$,把宽度从 $n$ 增到 $q$ 时,Net2Net 定义映射 $\pi \in \{1,\dots,n\}^q$ 将每个新单元 $j$ 指派给源单元 $\pi(j)$,令 $c_i = |\{j : \pi(j) = i\}|$ 为基单元 $i$ 的复制计数,则函数保持的加宽为

$$(W'_{\text{in}})_{j,:} = (W_{\text{in}})_{\pi(j),:} \tag{7}$$

$$(W'_{\text{out}})_{:,j} = \frac{1}{c_{\pi(j)}} (W_{\text{out}})_{:,\pi(j)} \tag{8}$$

扩展后所有副本产生相同激活,而出边权重的 $1/c$ 重缩放保证了副本贡献之和等于原单元,即 $W'_{\text{out}}\phi(W'_{\text{in}}x) = W_{\text{out}}\phi(W_{\text{in}}x)$。矩阵形式为

$$W' = L\, W\, R \tag{9}$$

其中 $R$ 复制输入维(列)、$L$ 复制输出维(行),并在其中包含 $1/c$ 重缩放。

Transformer 上的实现细节:由于本文保持 head size 固定、通过增加 head 数来扩宽,复制在完整 head 的粒度上进行——复制的 $W_q$、$W_k$、$W_v$ 行不做缩放,只对相应的 $W_o$ 列施加复制计数重缩放,这样既保留了复制 head 的 softmax 计算,又通过输出投影对其合并贡献做了平均。此外按 Net2Net 惯例对新建参数注入小高斯噪声以打破对称。

µP 超参迁移

WS 实验有一个隐蔽的混淆项:如果每个目标宽度都独立重调超参,改进可能来自更好的目标尺度超参,而不是生长算子本身。作者用 µP(Yang et al., 2021)解决它。µP 使用的迁移规则如下:

参数组 前向 / 初始化 Adam 学习率
Input / vector-like $\mathrm{Var}(W) \propto 1/n$ constant
Hidden / matrix-like $\mathrm{Var}(W) \propto 1/n$ $\propto 1/n$
Output / readout multiplier $\propto 1/n$ constant
Attention logits $q^\top k / d_{\text{head}}$ –
Scalar-like constant constant

其中 $n$ 是随模型宽度增长的 fan-in/fan-out 维度;attention logits 用的是每头维度 $d_{\text{head}}$,在本文的宽度扩展设定里固定为 64。除学习率外,batch size 也按宽度平方根缩放:

$$B_{\text{target}} \approx B_{\text{base}} \cdot \sqrt{\frac{n_{\text{embd@target}}}{n_{\text{embd@base}}}} \tag{10}$$

实验设置

合成回归 testbed(MLP)。沿用 Qiu et al. (2025) 的构造:目标函数具有幂律 Fourier 谱。每个回归 token 为输入向量 $x \in \mathbb{R}^d$ 与标量目标

$$y = f^\star(x) + \epsilon \tag{11}$$

其中 $f^\star$ 的 Fourier 系数按幂律衰减:

$$\mathbb{E}\left[|\hat{f}(\omega)|^2\right] \propto \|\omega\|^{-\alpha} \tag{12}$$

MLP 深度固定 $L = 3$,只缩放隐藏宽度 $n_{\text{embd}}$。这些 MLP 沿用了 Transformer FFN 块的参数化与归一化惯例(只是去掉了注意力),因此被当作 "Transformer MLP-only" 模型而非通用全连接网络。

Width 48 68 96 136 192 272 384
Params (M) 0.1 0.1 0.2 0.4 0.9 1.8 3.5

训练时长由 tokens/parameter 预算 $\tau$ 决定:$T = \tau \cdot P$,MLP 实验取 $\tau \in \{20, 35, 50\}$。超参网格是固定种子的确定性笛卡尔积:base grid(在 width=48 上评估,$8\times3\times5\times3\times2 = 720$ 组)与 main grid(用于各目标宽度,$4\times3\times3\times3\times2 = 216$ 组):

超参 Base grid (width=48) Main grid (目标宽度)
Learning rate {6e-4, 8e-4, 1e-3, 1.4e-3, 1.8e-3, 3e-3, 4e-3, 5e-3} {6e-4, 1e-3, 3e-3, 4e-3}
Weight decay {0, 1e-5, 1e-2} {0, 1e-5, 1e-2}
Batch size {256, 512, 1024, 2048, 4096} {256, 512, 1024}
Warmup fraction {0.01, 0.03, 0.05} {0.01, 0.03, 0.05}
Cooldown fraction {0, 0.2} {0, 0.2}

语言模型设置。全部使用 LITGPT 实现的 decoder-only GPT-2 风格模型,语料 SLIMPAJAMA,只做宽度扩展(保持 head size = 64,靠加 head 数扩宽),所有模型 8 层、序列长度 1024:

$d_{\text{model}}$ 128 256 512 768 1280 2048 3072
$n_{\text{head}}$ 2 4 8 12 20 32 48
Params (M) 14 32 77 134 286 610 1200

优化器 AdamW,$(\beta_1,\beta_2) = (0.9, 0.95)$,$\epsilon = 10^{-8}$,梯度全局范数裁剪 1.0,weight decay 全程为零(以隔离 WS 与显式 $\ell_2$ 正则的交互)。学习率采用 warmup-stable-decay(WSD)梯形调度,warmup 分数 $w = 0.01$、衰减分数 $d = 0.20$:

$$\eta_t = \begin{cases} \eta_{\max}\dfrac{t}{wT}, & 0 \le t < wT \\[4pt] \eta_{\max}, & wT \le t < (1-d)T \\[4pt] \eta_{\max}\dfrac{T-t}{dT}, & (1-d)T \le t \le T \end{cases} \tag{13}$$

训练预算取 10 / 20 / 30 tokens per parameter,其中 20 tokens/param 对应 Chinchilla 计算最优参考预算。基尺度选中的超参(用于 µP 迁移):

Params (M) Selected $\eta_{\max}$ Effective batch size
14 $3\times10^{-3}$ 64
32 $5\times10^{-3}$ 128
77 $2.5\times10^{-3}$ 256

算力开销:语言模型部分共 182 次 run(32M×25、77M×40、134M×49、286M×53、610M×13、1.2B×2),合计约 39,000–50,000 GPU-hours(主要为 NVIDIA L40S 48GB,1.2B 用 H200);合成 MLP 部分约 10,143 CPU-hours(423 CPU-days)。

主要实验结果

超参迁移:µP 才是可用的迁移策略

Figure 2: Final validation loss under MLP-width scaling from a fixed base width of 48. For each target width, each triplet of violins shows Scratch, Net2Net, and SZP from left to right.

Figure 2 在 base width = 48 出发,对目标宽度 68/96/136/192/272 比较三种做法:目标宽度上的稠密网格搜索(小提琴分布)、静态迁移(空心圆,直接沿用基宽度最优配置)、µP 迁移(星号)。结论有三条:

  1. 预算允许时,在目标宽度上做稠密调参通常仍是最好的;
  2. 迁移的有效性取决于初始化方式——静态迁移随生长因子增大而变差(Scratch 与 SZP 都如此),而 Net2Net 因为函数保持的性质对静态迁移更鲁棒;
  3. µP 迁移在所有 run 类型上都稳定接近稠密网格的最优,并一致优于静态迁移。

这直接决定了后续所有重算力实验(尤其是 LLM run)统一采用 µP 迁移。

另一个重要观察在这里已经埋下伏笔:随着生长因子增大,Scratch / Net2Net / SZP 三者在稠密网格下能达到的最优损失开始收敛——这正是 §4.2 要展开的 WS 实践上限。

Figure 6: Hyperparameter importance (fANOVA via Optuna), aggregated across all target widths. LR = learning rate, WD = weight decay, BS = batch size, W = warmup fraction, C = cooldown fraction.

fANOVA 的超参重要性分析显示:学习率在所有设定下都是绝对主导项,其次是学习率调度形状(主要是 cooldown 分数,其次是 warmup 分数),而 weight decay 的重要性在所有实验里都接近零。作者把这归因于本基准的小模型 regime——显式 $\ell_2$ 正则相比优化与调度选择影响甚微。

SZP 的收敛表现

Figure 3: Warmstarting from a base→target model size, trained for 20 tokens/parameter. Top row: Scratch vs SZP up to 1.2B parameters. Bottom row: Net2Net vs SZP up to 610M parameters.

Figure 3 上排(32M→135M、77M→287M、610M→1.2B,以及多尺度汇总)显示 SZP 比 Scratch 收敛更快、最终损失更低;下排(32M→135M、77M→287M、77M→610M)显示 SZP 一致优于 FP 基线 Net2Net。最右列汇总了 10/20/30 tokens/param 三种预算下所有 base-target 配对的学习曲线(学习率调度相同),确认更快收敛在各尺度上都成立。

但本文的核心观察是那个"变化量":WS 操作(Net2Net 与 SZP)的相对收益随生长因子 $g$ 增大而递减。作者给出的机制解释是:基模型通常训练得很充分,其学到的函数占据权重空间的一个子空间,WS 的效率收益正来自对这个子空间的利用(信号保持);而对依赖 clone 的 FP 方法,由于生长权重中固有的对称性,这个子空间很难逃离。Appendix 的 Figure 7(右)用更低的 Net2Net 有效秩印证了这一点:把权重位移分解为径向(沿初始化方向)与角向(正交方向)两个分量后,SZP 的注意力层同时表现出旋转与缩放,而 Net2Net 的径向分量要稳定得多、权重调整以旋转为主。

核心发现:有界的有效生长因子 $g_{\text{upper}}$

Figure 4: IsoFLOPs on Language Models and MLPs for 20 tokens/parameter. Blue lines mark the optimal growth factor g_opt at each IsoFLOP line, while red lines mark g_upper, the upper bound on the growth factor at which WS matches the loss of training from Scratch.

先前工作(Du et al., 2024)用 $g_{\text{opt}}$(对 IsoFLOP 损失做二次拟合后取极小值)来刻画 WS 与生长因子的关系。本文对此提出了明确的方法论批评:$g_{\text{opt}}$ 这种基于优化的刻画很难从稀疏采样中得到可靠支撑——要可靠识别 $g_{\text{opt}}$ 需要在 $g \in (1, g_{\text{opt}})$ 区间做密得多的测量。而且 Appendix H.1 补充了一个更根本的质疑:由于 $g = 1$ 对应的是"从头训"而非"从同尺寸模型 WS",二次拟合假设的那个极小值可能本身就是这个概念错位造成的假象。

作者转而提出 $g_{\text{upper}}$:WS 仍能改善 Scratch 最终验证损失的最大生长因子。读取方式极简:从 $g=1$ 处画一条水平线,交抛物线于某个 $g > 1$,那就是 $g_{\text{upper}}$。

Figure 4 在 LLM(134.6M、287.2M 目标)与 MLP(width 272、384)两套设定上重现了这个量,$g_{\text{upper}}$ 在所有设定下都被观察到。唯一的例外是 LLM 设定下的 Net2Net,其 $g_{\text{upper}} = 1$——也就是说,在完整调度预算跑完(含学习率衰减)后,Scratch 最终反超了 Net2Net。这与 Du et al. (2024) 的报告一致,也凸显了函数保持方法在更复杂架构上的短板。

作者对这一现象的解释:WS 把目标模型放进了一个由基模型学到的表征塑造的损失景观区域。$g$ 小时这个初始化提供了一个有利于高效收敛的盆地;$g$ 增大时基模型在目标架构中所占的比例递减,初始化越来越像随机初始化;超过 $g_{\text{upper}}$,继承结构施加的约束就压倒了它的收益,把 warmstarted 模型锚死在次优区域。

Figure 13: Mechanistic Interpretability for varying growth factors g for a 286M parameter LLM trained with 20 tokens/parameter. At higher growth factors, Warmstarting increasingly resembles Scratch.

机制可解释性分析支持了这个解释:在 286M 模型上追踪输入嵌入、中层注意力/MLP、输出解嵌入的 L2 范数、有效秩与相邻 checkpoint 的余弦相似度,$g$ 越大,WS 的各项指标越趋近 Scratch,即基模型结构被逐渐稀释。作者还强调了一个重要推论:$g_{\text{upper}}$ 在不同模型规模上是稳定的——warmstarted 表征收敛到 Scratch 式行为的速率主要取决于架构比 $g$,而非绝对模型尺寸。

实践建议:当预算不允许探查 $g_{\text{upper}}$ 时,推荐 $g = 2$ 作为保守默认值。作者顺带批评了文献惯例:大量 WS 工作(Samragh et al., 2024;Ma et al., 2026)就固定用 2× 生长,却从不讨论 $g_{\text{upper}}$。

Scaling law 拟合与"何时该从头训"的等值线

Figure 5: Isolines for loss difference showing where Warmstarting achieves lower loss than training from Scratch for growth factor g ≈ 2 (blue = Warmstarting better; red = Scratch better; green line = boundary).

作者取 $g \approx 2$ 的子集数据,按 Hoffmann et al. (2022) 的 Approach 3 拟合幂律参数形式:

$$L(N, D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}} \tag{14}$$

其中 $E, A, \alpha, B, \beta$ 通过在 $\log L$ 上以 L-BFGS-B 优化 Huber loss($\delta = 10^{-3}$)拟合。对 Scratch、SZP、Net2Net 在 LLM 与 MLP 两套设定上各拟合一条,拟合参数与质量如下:

LLM SZP LLM Net2Net LLM Scratch MLP SZP MLP Net2Net MLP Scratch
$A$ 1038 1739 18807 10484 424 1437
$\alpha$ 0.439 0.474 0.629 1.027 0.737 0.908
$B$ 68 194 96 774 427 87
$\beta$ 0.257 0.311 0.267 0.578 0.555 0.424
$E$ 1.278 1.377 1.395 0.075 0.074 0.065
$R^2$ 0.9999 0.9929 0.9922 0.9994 0.9929 0.9922

所有 $R^2$ 均超过 0.99。这里有一处值得单独指出的信号:LLM 设定下 SZP 的不可约损失项 $E = 1.278$ 明显低于 Scratch 的 $1.395$ 与 Net2Net 的 $1.377$,而 SZP 的参数指数 $\alpha = 0.439$ 又小于 Scratch 的 $0.629$——即 WS 拉低了地板但也压平了参数缩放的斜率,这正是"优势随规模递减"在参数层面的体现。

把 WS 与 Scratch 两张拟合曲面相减、画出等损失差的等值线(绿线为零差边界),Figure 5 给出两条结论:

  1. 零差边界在 MLP 与 LLM 上都存在,即确实存在 Scratch 优于 WS 的区域;
  2. 边界相对 Chinchilla 最优 tokens/param 前沿(黑实线)的位置表明:训练 tokens/param 越少,越可能保住 WS 的收益。固定模型尺寸时,tokens/parameter 越多,越应该偏向 Scratch。

分方法看:MLP 设定下 Net2Net 给出了清晰的 WS 收益前沿(符合预期,FP 本就是为 MLP 设计的),但 SZP 的有效区间更大,损失差前沿被推得离 Chinchilla 最优前沿更远;LLM 设定下 Net2Net 只剩一小块预测收益区,而 SZP 仍给出一个像样的前沿。

下游任务 sanity check

作者用 LIGHTEVAL 在 1.2B checkpoint 上评了六个多选基准(ARC-Challenge 25-shot、HellaSwag 10-shot、MMLU 5-shot、WinoGrande 5-shot 遵循 Open LLM Leaderboard v1 设定;OpenBookQA 与 PIQA 为 0-shot):

Method ARC-C HSwag MMLU OBQA PIQA WinoG.
Scratch 17.7 27.4 26.0 13.4 60.2 51.0
SZP 20.1 29.4 26.4 15.8 64.6 53.0

六项全面改善,说明预训练曲线上的优化优势确实传导到了下游行为。但作者自己也诚实标注:每个方法只有单一 checkpoint、没有多种子、没有显著性检验,因此只能当 sanity check 而非确定性的下游性能结论。

消融与分析

扰动尺度 $\sigma_{\text{perturb}}$

Figure 8: Effect of perturbation scale σperturb on a 32M → 286M transfer.

在 32M→286M 的迁移上扫描扰动尺度(其余 SZP 设置固定),默认取 $\sigma_{\text{perturb}} = 1/\sqrt{\text{width}}$:

$\sigma_{\text{perturb}}$ 0 $10^{-4}$ $10^{-3}$ $10^{-2}$ $10^{-1}$ SZP ($1/\sqrt{\text{width}}$)
Final validation loss 2.76 2.50 2.50 2.49 2.46 2.46

无扰动时性能显著更差(2.76 vs 2.46),印证了理论部分的判断:纯零填充无法激活新增容量。非零扰动同时改善收敛与最终损失,默认的 $1/\sqrt{\text{width}}$ 匹配了扫描中的最佳最终性能,且学习曲线显示它比多数固定尺度更早进入低损失区。作者的额外观察:噪声尺度对收敛速率的影响大于对最终泛化损失的影响。

收缩因子 $\lambda_{\text{shrink}}$

Figure 9: Ablation for shrinking factor (λshrink) for SZP. The rows represent a base checkpoint (15M / 32M / 77M); each line represents a target model scale.

在三个基 checkpoint(15M / 32M / 77M)× 三种 token 预算(10/20/30)× 多个目标尺度上扫描 $\lambda_{\text{shrink}}$:最优值集中在低到中等收缩区间,典型为 $\lambda_{\text{shrink}} \in \{0.2, 0.4\}$。$\lambda_{\text{shrink}}$ 太接近 1 相当于不收缩,生长后模型被继承通路支配;太接近 0 又抹掉了太多预训练信号,退化成"只有扰动的生长"。0.2–0.4 附近的宽平最小值说明收缩有用但不需要精调。主实验统一取 $\lambda_{\text{shrink}} = 0.4$。

作者把这一设计与持续学习文献做了对接:DASH(Shin et al., 2024)同样用收缩缓解可塑性损失,但采用方向感知的方式——与有用特征相关的权重保留得更多,被归因为记忆噪声的分量收缩得更狠。SZP 刻意只用一个全局收缩因子,代价是不够精细,收益是架构无关、可与任意生长算子自由组合。它也可以被看作 weight clipping(Elsayed et al., 2024)这类范数控制原则的一次性初始化时刻的类比。

权重统计的机制分析

Figure 7: Looking inside WS for 14M → 77M. (left) Zeros+Perturb vs SZP: Effective Rank, operator norm, and ||W_t − W_0||. (right) Net2Net vs SZP: Effective Rank, radial and angular components.

在 14M→77M 上追踪输入嵌入、中层注意力/MLP、输出解嵌入的权重统计。作者用 RMS→$L_\infty$ 算子范数(行 $L_2$ 范数最大值除以输入宽度平方根)作为比 $L_1$/$L_2$ 更有信息量的代理,理由是它对跨尺度迁移学习动力学至关重要(Filatov et al., 2025;Pethick et al., 2025)。结论:收缩不仅通过权重范数钳制保住了学到的函数(与可塑性提升相关),还提高了注意力层的有效秩(新神经元利用率更好),并允许模型从初始化处移动更远($\|W_t - W_0\|_2$ 更大)。这一点很关键——单靠零填充或克隆并不能充分打破新旧神经元之间的对称性,会把生长后模型在函数空间里困在离基模型太近的位置,表现为 Figure 1 里的损失饱和。

Figure 10: L1 norm of the layer activations across model sizes, for µP, SZP, Net2Net and the naive baselines.

激活范数分析显示:在较大宽度上多数情况的激活会变得稳定且随宽度近似恒定(SZP 在 $\lambda_{\text{shrink}} = 0.2$ 时尤其明显),满足稳定超参迁移的条件。唯一出现随宽度增长而失控的不稳定的是把 Clone 单独作为 $G$ 的情形。

架构泛化:LLaMA 风格解码器

Figure 11: Comparing SZP with Scratch on a LLaMA-style decoder architecture, trained for 20 tokens/parameter.

为验证 SZP 的行为不是 GPT-2 风格架构特有,作者在 LLaMA 风格解码器上重跑对比(77M→135M、77M→290M、77M→620M),保持相同的 20 tokens/param 预算与相同的基尺度超参选择协议,两者唯一的差别就是初始化。结果显示 SZP 在所有目标尺寸上都一致改善早期收敛,说明收益不绑定于特定的 decoder 实现。

用 scaling law 比较两种 WS 方法

Figure 18: Isolines for loss difference comparing SZP and Net2Net for growth factor g ≈ 2 (blue = SZP better; red = Net2Net better).

同一套拟合方法还能用来比较两种 WS 方法。LLM 设定下 SZP 被预测在所有配置上都优于 Net2Net;MLP 设定下 Net2Net 在低 token 预算处有竞争力(此时其函数保持性质收益最大),但 SZP 在更大的 token 预算下被预测更优。这与两者的设计取向完全吻合:Net2Net 保持基模型函数,因而有即时优势;SZP 让新神经元真正投入使用,随着训练预算增大、模型有更多空间去适应,这一优势才逐渐兑现。作者由此强调:scaling law 拟合能提供比"单一训练预算下的评测"丰富得多的方法间比较。

核心贡献总结

  1. 把 WS 生长算子解构成 growth × shrink × perturb 三个独立轴,用一个统一公式 (2) 覆盖了 FP 类算子的三大成分,并且对所有权重(1D/2D)一视同仁——从而摆脱了架构特化规则。
  2. 证伪了"初始化时函数保持是 WS 有效的必要条件":架构无关的 SZP 在 LLM 设定下一致胜过 FP 代表 Net2Net,后者在 LLM 上甚至 $g_{\text{upper}} = 1$(完全失去优势)。
  3. 提出并系统测量 $g_{\text{upper}}$,取代此前不可靠的 $g_{\text{opt}}$,并指出这个界在先前已发表的结果中其实早已存在,只是从未被报告。
  4. 用 Chinchilla 式 scaling law 把"何时该 WS"变成可预测的问题:两条拟合曲面之差的零等值线,就是 WS 与 Scratch 的分界。
  5. 给出四条可直接执行的实践准则:只能跑一次就取 $g = 2$;WS 应在 $\le 20$ tokens/param(即 compute-optimal 或以下)时优先;µP 是 WS 场景下的原则性超参迁移策略;未来 WS 文献应显式报告 $g_{\text{upper}}$ 并考虑收益递减的 scaling 模式。

与已归档相关工作的对比

Parcae Parcae: Scaling Laws For Stable Looped Language Models(UC San Diego + Together AI,2026-04-14)

关系:独立并发(本文投稿于 2026-05-13,Parcae 早约一个月;本文正文与参考文献中均无 Parcae、looping、recurrence 相关条目,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇都在追问同一个 root cause——除了"堆参数 + 堆数据"这两条 Chinchilla 正统轴之外,还存在一条「复用已有计算/结构」的扩展轴,它到底值不值得用、该用多少。本文复用的是一个训练好的小 checkpoint 的权重(沿宽度方向生长);Parcae 复用的是同一组层在深度方向的重复执行(layer looping,参数量不变而 FLOPs 线性增长)。两者都指出这条轴此前"经验上有人试、但缺乏可预测的定量刻画",因而进不了生产流水线。
  • 相近的技术骨架:方法流程图几乎可以抽象重合——引入一个复用旋钮(本文的 $g$ / Parcae 的循环次数 $\mu_{\text{rec}}$)→ 在固定 FLOP 预算下做 IsoFLOP 扫描并对损失做二次拟合 → 从抛物线上读出这条轴的最优点或饱和点 → 再套 Chinchilla 参数形式 $L = E + A N^{-\alpha} + B D^{-\beta}$ 拟合出可外推的预测律 → 把律翻译成给实践者的分配建议。连细节都撞上了:本文的 $g_{\text{opt}}$/$g_{\text{upper}}$ 与 Parcae 的 $\mu_{\text{rec}}^\star$ 都是从 IsoFLOP 抛物线极值读出的量,两篇的拟合都用 Huber loss + L-BFGS,两篇的 $R^2$/外推误差都被单列为可信度证据(本文 $R^2 > 0.99$;Parcae 外推误差 0.8%–1.3%)。
  • 本文的差异与推进:结论方向相反且互补。Parcae 论证的是"循环这条轴是一条正交且有效的扩展轴"——IsoFLOP 曲线存在明确的内部极小值,最优循环次数随算力遵循幂律 $\mu_{\text{rec}}^\star \propto C^{0.40}$,因此值得沿这条轴投入。本文论证的是"checkpoint 复用这条轴有一个硬上界"——超过 $g_{\text{upper}}$ 后 Scratch 反超,且优势窗口随 token 预算增大而收缩。一正一反恰好构成同一方法论的两个可能结局:同样是 IsoFLOP + 参数律,Parcae 拿到的是"该投多少",本文拿到的是"最多能投到哪"。
  • 可比的方法/实验差异:Parcae 直接把复用旋钮并入了参数律(把 $N$ 换成展开循环后的有效参数量 $N(\mu_{\text{rec}})$,并进一步与 test-time 衰减项合成 8 参数统一律 $\hat L = E + X N(\mu_{\text{rec}})^{-x} + Y D^{-y} + Z e^{-zT/\mu_{\text{rec}}}$);本文则是把 $g$ 固定在 $\approx 2$ 之后,对 WS 与 Scratch 分别拟合两条律再作差,靠等值线而不是单一律来定位边界。本文在 Appendix H.1 的 "Toward a Unified Scaling Law" 里把"拟合一条同时涵盖 $N, D, g$ 的统一律"列为 future work——而这正是 Parcae 在循环轴上一个月前已经做完的事,这是两篇并发工作之间最直接的一处方法论落差。另一处差异是规模:本文最大到 1.2B / 182 次 LLM run / 39k–50k GPU-hours,Parcae 最大到 1.3B / 100B token,量级相当。

Prescriptive Scaling Laws for Data Constrained Training Prescriptive Scaling Laws for Data Constrained Training(Cornell University,2026-05-02)

关系:独立并发(Cornell 论文早 11 天,本文未引用,两者对"复用的边际收益何时转负"给出结构相同的答案)· 已加载对方精读

  • 共同关注的问题:两篇的 root cause 是同一个形状——某种"复用"在小剂量时省算力,剂量过大后不但递减、还会反过来变差;而既有的 Chinchilla 框架无法表达这个转折点,导致实践者拿不到可执行的阈值。本文复用的是训练好的权重(warmstarting 一个 checkpoint);Cornell 复用的是训练数据(数据受限下的多 epoch 重复)。两篇都明确指出既有工作只描述了"递减回报"而没有刻画"何时该停":本文批评 $g_{\text{opt}}$ 这一优化式刻画不可靠、且文献普遍固定 2× 生长却从不讨论上界;Cornell 批评 Muennighoff 的 effective-data 公式从不建议停止重复,最多趋于平台。
  • 相近的技术骨架:都是 「控制变量的大网格 → 在 Chinchilla 形式上做拟合 → 读出一个交叉阈值 → 把阈值翻译成分配处方」。两篇的基座公式完全相同(本文式 (14),Cornell 精读式 (1):$L(N,D) = E + A/N^\alpha + B/D^\beta$);两篇都刻意把结论浓缩成一个可跨配置横向对比的单一标量——本文是 $g_{\text{upper}}$,Cornell 是过拟合惩罚系数 $P$;两篇都呼吁社区把这个标量当作标准报告项。规模上也接近:Cornell 训了 300+ 模型(15M–1B 参数、50M–6B unique token、最高 16 epoch),本文 182 次 LLM run(14M–1.2B)加 2934 次 MLP run。
  • 本文的差异与推进:处理转折点的技术手段不同。Cornell 走的是"改写律本身"的路线——在 Chinchilla 上加一个显式的加性过拟合惩罚项,并按 1p/2p/4p 的复杂度阶梯给出 Pareto 前沿,最完整的形式是 $L = E + A/N^\alpha + B/(U_D(1+R_D))^\beta + P \cdot R_D^\delta \cdot (N/U_D^\gamma)^\kappa$,单参数版本就把多 epoch 的 $R^2$ 从 0.58 抬到 0.95。本文则不改律的形式,而是走"拟合两条律再作差"的路线:对 WS 与 Scratch 各拟合一条标准 Chinchilla 式,用差值曲面的零等值线定位边界。Cornell 的做法能把转折点封装进单一闭式、便于外推与解释(例如把强 weight decay 削减 $P$ 约 70% 直接量化为"配置鲁棒性");本文的做法更保守但门槛更低——不需要为每种复用机制猜一个惩罚项的函数形式,代价是无法从单一律里解析地解出边界位置。
  • 可比的方法/实验差异:Cornell 做了本文没做的一步处方验证——把每条 law 推荐的最优配置真的训出来做对比(例如 $U_D = 500$M、$C = 2\times10^{19}$ 时,本文 law 推荐 2.2B × 3 epoch,perplexity 17.73,明显优于 Chinchilla 推荐的 670M × 10 epoch 的 18.90),这是"prescriptive"三个字的实证兑现。本文的处方($g = 2$、$\le 20$ tokens/param)只由拟合与 IsoFLOP 观测支撑,没有"按处方训一次以验证"的闭环实验——这是本文可以直接借鉴 Cornell 的地方。反过来,本文有 Cornell 没有的机制层证据(有效秩、径向/角向权重位移、跨 $g$ 的可解释性追踪),能解释为什么复用的收益会衰减,而不只是拟合出它衰减。另外两篇的分配建议方向恰好呼应:Cornell 说"算力过阈值后应放大模型、减少 epoch",本文说"token 预算越大越该改从头训"——都是在建议超过某点后放弃复用、把算力投向"新鲜"的那一侧。

讨论与局限性

核心贡献的价值在于它是一篇罕见的、把方法论批评落到可执行数字上的实证研究。$g_{\text{upper}}$ 这个量本身不算全新发现(作者自己承认 Du et al., 2024 的结果里已经隐含了它),但把它从"隐含在图里"提升为"必须报告的标准量",并论证 $g_{\text{opt}}$ 的不可靠性,是实打实的方法论贡献。同样值得借鉴的是"用 scaling law 曲面之差来比较两个训练范式"这一套工具——它把"A 比 B 好吗"这个在单点预算下无从回答的问题,变成了一张可读的边界图。

几处明确的局限:

  1. 只做宽度生长,没有深度。作者自己在 Limitations 里承认这一点,理由是超参迁移与 scaling 行为的研究需要在宽度、训练时长、迁移设定上做大量扫描,加上深度会让算力不可承受。但真实的模型扩容几乎总是宽度与深度联动,而 Du et al. (2024) 已经指出联合缩放需要独立选择宽度与深度生长算子——SZP 在深度轴上是否同样有效、$g_{\text{upper}}$ 在复合缩放下是否还稳定,完全是未知数。
  2. 只比了两个生长算子。SZP vs Net2Net 的对比虽然干净,但 Net2Net 是 2016 年的方法;learned growth(Wang et al., 2023a 的 Kronecker 算子)、GradMax、以及需要 warmstart 优化器状态的 full-state 方法都被排除在外。"简单方法胜过复杂算子"这个结论的强度,因此只在"简单方法 vs 一个经典 FP 算子"的范围内成立。
  3. 规模上限 1.2B,且 1.2B 只有 2 次 run。作者辩称 sub-1B 的趋势与文献中 1B+ 的报告一致,暗示可迁移到更大 regime,但这终究是外推。考虑到本文的核心论点恰恰是"收益随规模递减",在最大规模上样本最稀疏是一个结构性的尴尬。
  4. 下游评测只是 sanity check。单 checkpoint、无多种子、无显著性检验,作者标注得很诚实,但这也意味着"WS 的优势能传导到下游"这个说法目前只有 1.2B 上一次观测的支撑。
  5. 黑箱基模型假设是双刃剑。把基模型的训练算力当未知量确实更贴近现实,但代价是无法分析"基模型规模 × 目标模型规模 × 两阶段各自投入的 token"这个联合 compute-optimal 前沿——而这恰恰是一个真正想省算力的团队最关心的问题。Liew & Kato (2025) 走的是另一条路(假设完全掌握基模型历史),两条路线目前谁也没覆盖对方。
  6. $\lambda_{\text{shrink}} = 0.4$ 与 $\sigma_{\text{perturb}} = 1/\sqrt{\text{width}}$ 是固定值而非可预测规则。消融显示它们不敏感(0.2–0.4 是宽平最小值),但作者在 Future Directions 里也承认,能否用固定规则或 scaling law 拟合来预测性地缩放这两个量仍是开放问题。

工业落地价值方面,这篇论文没有任何线上部署或 A/B 数据,是纯学术研究。但它的结论有相当直接的工程可迁移性:任何计划"把线上的小模型扩容到大模型"的团队,都可以直接拿走三条:(a) 保守取 $g = 2$;(b) 若目标训练预算显著超过 20 tokens/param,先怀疑 WS 是否还划算;(c) 跨宽度迁移超参统一走 µP,不要静态照搬。对推荐/广告场景的大模型扩容(例如把一个已上线的排序骨干从 1B 扩到 4B)而言,"$g_{\text{upper}}$ 随架构比而非绝对尺寸稳定"这个观察尤其有用——它意味着在小规模上花少量算力测出的 $g_{\text{upper}}$,有希望直接外推到生产规模。

方法论可扩展性上,本文的框架本身是良性的:设计空间 (2) 对任意架构开放,scaling law 差值等值线的工具可以套到任何"新范式 vs 旧范式"的比较上。真正的天花板不在框架,而在只做宽度、只比两个算子、$g$ 被固定后才拟合律这三处实验层面的收缩——其中第三点作者已在 Appendix H.1 列为下一步(拟合统一的 $L(N, D, g)$),而这一步在并发的 Parcae 上已经被证明是可行的。