← 返回报告列表

2026-08-13 日报

日报 📅 2026-08-12
训练信号精细化:超参调优前沿与 token 级信用分配
parameter-scaling rl process-supervision transformer academic
📊 共 6 篇 · 精读 1

2026-08-13 日报

主题: 训练信号精细化:超参调优前沿与 token 级信用分配

标签: parameter-scaling · rl · process-supervision · transformer · academic

📊 统计: 共 6 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 5 · llm 2 · discriminative-rec 2 · generative-rec 2

综述

今日 6 篇:LLM 2、判别式推荐 2、生成式推荐 2,无一涉及线上系统。评分最高的 Small-Scale Experiments 出自 FAIR at MSL Meta 与纽约大学,它把“小规模 scaling law 不可靠”的病因从规模改判为超参:约 4000 次 run 表明律一直延伸到 4M 有效参数,却只在完全调优前沿显形——每规模 4 个配置时测试 MSE 为 1.30e-2,到 256 个配置才降至 3.70e-6;并给出机制解释,超参损失面的有效维度随参数增长掉到 1,最后以 pre-norm 与 post-norm 之争复原大规模结论。HCGRec 对生成器够不到正确物品的难样本注入最小目标前缀提示,把 GRPO 零优势样本从七成压到两成以下;生成式文档检索的 token 级信用分配按每步对期望检索质量的改变估计步进奖励;PRISM 用多视角透镜校准点积注意力的相似性偏置。三者共同指向让训练信号更细:粗粒度的超参网格与轨迹级奖励正是当前的主要瓶颈。

重点论文

Small-Scale Experiments: Are We There Yet? · ⭐ 8/10

🏢 Meta · LLM

论证「小规模实验 scaling law 不可靠」的混淆因子是超参而非规模——scaling law 一直延伸到 4M 有效参数,只是仅在完全调优前沿显形(每规模 4 个配置时完全不可见,256 个配置才拿到准确的律,测试 MSE 1.30e-2 → 3.70e-6,而参数计数方式与 LR 衰减等方法学细节只是精修);进一步用 noisy quadratic limit 估出超参损失面的内蕴维度 γ 随参数增长掉到 1(数据影响甚微),解释了为什么大模型好调,并把 noisy quadratic limit、scaling law、perplexity-capability 对应三件工具打包成一套「每条强假设都对应一个廉价诊断」的小规模实验方法论,在 pre-norm vs post-norm 这个曾耗费领域三年的问题上以约等于几次 1B run 的开销复原了大规模结论。

HCGRec · ⭐ 7/10

HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs

🎓 学术 · 生成式推荐

提出 HCGRec:用检查点 rollout 诊断难样本,仅在当前生成器够不到正确物品时补一段最小目标前缀「提示」,让模型在被提示的语义分支下生成后缀,从而把零奖励组转成有信息量的比较;并按 token 身份做提示感知信用分解——提示前缀用监督学习保持物品语义与前缀结构对齐,采样后缀用 GRPO 优化,零优势样本从 70% 以上降到 20% 以下。

PRISM · ⭐ 6/10

From Overlooked to Explored: Recovering Item Relations via Mixture of Perspectives for Sequential Recommendation

🎓 学术 · 判别式推荐

实证发现基于 Transformer 的序列推荐普遍存在「相似性偏置」——点积注意力过度偏好相似物品,系统性忽略携带偏好信号的异质关系;据此提出 PRISM,用 K 个「视角透镜」从不同视角校准注意力,其中亲和视角细化同质关系、对比视角暴露被相似性偏置压制的异质关系,在七个真实基准上稳定超过 SOTA。

Token-Level Credit Assignment Optimization for Generative Document Retrieval · ⭐ 6/10

🎓 学术 · 生成式推荐

针对生成式文档检索中「文档级相关性只在整个 DocID 生成完才能评估」导致的奖励粗粒度问题,提出 token 级相关性奖励的强化学习框架:按每一步 token 决策对轨迹期望检索质量的改变来估计步进奖励,从而实现精确信用分配,并给出适配 DocID 生成的实用奖励估计策略。

全部论文

模型 标题 类别 公司 摘要分 精读分
— Small-Scale Experiments: Are We There Yet? LLM 🏢 Meta 8 8
HCGRec HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs 生成式 🎓 学术 7 —
PRISM From Overlooked to Explored: Recovering Item Relations via Mixture of Perspectives for Sequential Recommendation 判别式 🎓 学术 6 —
— Token-Level Credit Assignment Optimization for Generative Document Retrieval 生成式 🎓 学术 6 —
GALLM Making Collaborative Signals Count: Graph-Aware Large Language Models for Sequential Recommendation 判别式 🎓 学术 6 —
— Epiplexity Guided Data Selection and Generation for Out-of-Distribution Generalization LLM 🎓 学术 6 —