← 返回报告列表

2026-05-14 日报

日报 📅 2026-05-13
扩展律牵引的训练方法论,与生成式推荐的系统级提速
parameter-scaling moe transformer industrial
📊 共 14 篇 · 精读 4

2026-05-14 日报

主题: 扩展律牵引的训练方法论,与生成式推荐的系统级提速

标签: parameter-scaling · moe · transformer · industrial

📊 统计: 共 14 篇 · 精读 4 · 🏢 工业界 1 · 🎓 学术 13 · llm 7 · generative-rec 2 · other 6 · discriminative-rec 1

综述

今日 14 篇:LLM 7 篇、生成式推荐 2 篇、判别式推荐 1 篇、其他 6 篇(含跨类);仅华为 TurboGR 一篇标有公司归属,其余为学术工作;四篇精读中三篇属 LLM 扩展律与训练方法论。Duke 等四校的理论工作(2605.13687)用树上广播过程造出分布已知的层次化语言,论证忠实采样长度 n 的序列需 Ω(n) 上下文,而仅 Θ(log n) 位工作记忆的推理模型即可精确采样,惟硬约束定理阈值与着色实验参数不严格相容。USC-ISI 与 MBZUAI 的 EMO 视专家池为可扩展记忆,用稀疏度扩展律差分出各阶段 token 预算,专家数由 8 渐进扩到 128,省下约一成 GPU 小时,但该律标定于更小网格、外推使用未经交叉验证。弗莱堡等的 SZP 以收缩、零填充与扰动,说明函数保持并非热启动有效的必要条件,并给出生长比上界。华为 TurboGR 面向昇腾 NPU 重做 jagged 算子与分层稀疏并行,把 GR 训练的算力利用率与扩展线性度拉高,惟对照全为自家朴素实现。扩展律正从“选配置”转向“排时间表”。

重点论文

A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning · ⭐ 8/10

🎓 学术 · LLM

用树上广播过程构造分布已知且可解析的层次化合成语言,以 exact k-gram ansatz 替代有界上下文 transformer,证明 Ising(软约束)下生成和的归一化方差按上下文深度 w 呈 log 线性 w·log(dρ²) 且峰度收敛到高斯、coloring(硬约束)冻结相下有界上下文几乎必然生成与任何合法着色都不相容的序列,二者共同给出忠实采样长度 n 序列所需的 Ω(n) 上下文下界;反之仅 Θ(log n) 位工作记忆的自回归推理模型即可精确采样真语言(DFS 式记忆构造,与广播信道无关),并用从零训练的 nanochat transformer 在很宽上下文范围内定量复现全部预测。

EMO · ⭐ 7/10

EMO: Frustratingly Easy Progressive Training of Extendable MoE

🎓 学术 · LLM

EMO 把 MoE 专家池视作可扩展的参数化记忆,在预训练中分五阶段将总专家数从 8 倍增到 128(激活数 k 固定为 8),并用系数与指数都显式依赖 E 的稀疏度 scaling law 解出每个专家数下的 compute-optimal 累计 token 数、差分归一化成各阶段预算(23.5%/9.5%/16.5%/21.8%/28.6%);在 1.92T token、9.6B-A1.1B、32×H200 上最终 loss 1.017 对比固定 E=128 的 0.994,省 10% GPU 小时并明显优于固定 E=16/32,代价是 GSM8K 落后 7.64 点且推理成本毫无节省。

SZP · ⭐ 7/10

When is Warmstarting Effective for Scaling Language Models?

🎓 学术 · LLM

系统回答「热启动(从小 checkpoint 生长出大模型)何时真的划算」:把生长算子解耦成 growth×shrink×perturb 三轴得到架构无关的 SZP,证伪「初始化时函数保持是必要条件」,用 IsoFLOP 扫描确立生长因子上界 g_upper(超过即不如从头训、且该上界只取决于架构比而非绝对尺寸),再用 Chinchilla 式 scaling law 的差值等值线预测 WS 与 Scratch 的交叉边界,给出 g=2、≤20 tokens/param、µP 迁移三条实践准则。

TurboGR · ⭐ 6/10

TurboGR: An Accelerated Training System for Large-Scale Generative Recommendation

🏢 Huawei · 生成式推荐

TurboGR 是华为面向 Ascend NPU 的生成式推荐训练系统,把 GR 训练的三大瓶颈——jagged 变长序列的 padding 冗余与设备间负载倾斜、稀疏 embedding 与稠密主干耦合导致的 all-to-all 通信瓶颈、token 级负采样的 HBM 爆炸——分别用 Ascend 亲和的 jagged 融合算子(显存 −70%、延迟 2.2×)加按 token 数排序贪心再分配(设备间负载不均 47.01%→2.40%)、分层稀疏并行 HSP(all-to-all −75.9%,靠重构反向算子让各组 AdaGrad 二阶矩同步演化从而与集中式训练数学等价)加带 O(αLτ/T) 收敛界的稀疏异步/稠密同步解耦(未掩盖通信 24.12%→2.19%)加六批次细粒度流水线(NPU 计算占比 94%、空闲 <1%)、以及负样本 embedding 的 CPU 分段卸载加双缓冲预取加 FP16 量化加批内 logit 共享(HBM −24.59%,精度损失 ≤0.05%)逐一化解,在 KuaiRand-27K 上把 0.2B 参数的 FuXi-long 做到 54.71% MFU 与 0.97 近线性扩展,是首个面向 Ascend 开源的 GR 训练系统;但全部对比基线均为 Ascend 上的朴素实现,既无 GPU 横向对照也无线上部署数据。

全部论文

模型 标题 类别 公司 摘要分 精读分
— A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning LLM 🎓 学术 7 8
EMO EMO: Frustratingly Easy Progressive Training of Extendable MoE LLM 🎓 学术 7 7
SZP When is Warmstarting Effective for Scaling Language Models? LLM 🎓 学术 7 7
TurboGR TurboGR: An Accelerated Training System for Large-Scale Generative Recommendation 生成式 🏢 Huawei 8 6
F-GRPO F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking 生成式 / LLM 🎓 学术 7 —
Granite Embedding R2 Granite Embedding Multilingual R2 Models 其他 🎓 学术 6 —
— A Standardized Re-evaluation of Conversational Recommender Systems on the ReDial Dataset 判别式 🎓 学术 6 —
— Provable Quantization with Randomized Hadamard Transform LLM / 其他 🎓 学术 6 —
PGR Thinking Ahead: Prospection-Guided Retrieval of Memory with Language Models LLM 🎓 学术 6 —
ArcVQ-VAE ArcVQ-VAE: A Spherical Vector Quantization Framework with ArcCosine Additive Margin 其他 🎓 学术 5 —
APG4RecSim Task-Aware Automated User Profile Generation for Recommendation Simulation Using Large Language Models 其他 🎓 学术 5 —
PRISM-VQ Vector-Quantized Discrete Latent Factors Meet Financial Priors: Dynamic Cross-Sectional Stock Ranking Prediction for Portfolio Construction 其他 🎓 学术 4 —
— Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling LLM 🎓 学术 4 —
CLMT Compact Latent Manifold Translation: A Parameter-Efficient Foundation Model for Cross-Modal and Cross-Frequency Physiological Signal Synthesis 其他 🎓 学术 4 —