← Back to list
Bridging Compute- and Data-Optimal Pretraining
LLM
学术
Abstract 7
│
Reading 8
│
Rating —
2026-07-28
Tian Qin, Kimia Hamidieh, David Alvarez-Melis
Harvard University, MIT CSAIL
提出 Compute-Data (CD) scaling law,用 token 有效性函数 η=(R*/r)(1-e^{-r/R*}) 把重复/改写产生的 derived token 折算成 fresh-token 等价物代入 Chinchilla,其饱和天花板 R*=K(D/N)^ρ N^σ 随模型规模与数据可得性双向收紧(改写衰减比重复陡约 3 倍),从而连续桥接 compute-optimal 与 data-optimal 两端、划出 compute/data/model-bound 三区间,并给出『4-epoch 法则只对约 3B/1× Chinchilla 成立、改写在 N≥7B 失效』的可查表处方。
评分原因
摘要评分:数据受限时代的通用扩参决策框架,η 与三分区间的结论可直接迁移到推荐大模型的算力/数据配比判断;但实验规模只到 600M、纯学术无工业验证,给 7。
精读评分:用 token 有效性函数 η 把 compute-optimal / data-optimal 两端统一进一条定律并把 Hoffmann/Muennighoff/Kim 收编为特例,形式选择经 9 候选 LOO 排名 + 逐项消融验证(常数-R* 基线被拒 40%),拟合流程(Huber+LSE+残差裁剪 sweep+bootstrap CI)与跨尺度外推、loss→downstream 充分统计量验证都很扎实,且给出可直接查表的 epoch/pass 处方。减分项:η∈[0,1] 的乘性形式结构上无法表达过度重复导致 loss 回升;改写生成的 FLOPs 不计入训练算力,使『小模型该改写』结论口径存疑;实证止步 600M,7B 论断全靠外推,且未做 Lovelace 式『按处方训练』的闭环验证。
transformer
pretrained-lm
parameter-scaling
academic