← 返回报告列表

2026-08-10 日报

日报 📅 2026-08-07
把重计算挪到离线:超长序列蒸馏、标度律与后训练对齐
parameter-scaling knowledge-distillation industrial rl semantic-id
📊 共 5 篇 · 精读 3

2026-08-10 日报

主题: 把重计算挪到离线:超长序列蒸馏、标度律与后训练对齐

标签: parameter-scaling · knowledge-distillation · industrial · rl · semantic-id

📊 统计: 共 5 篇 · 精读 3 · 🏢 工业界 3 · 🎓 学术 2 · discriminative-rec 2 · llm 1 · generative-rec 3

综述

今日入库 5 篇,3 篇精读、2 篇仅摘要归档;生成式推荐 3 篇、判别式推荐 2 篇、LLM 1 篇,工业 3 篇、学术 2 篇。ByteDance 的 TM20K 把电商广告行为序列推到 20K:教师保留全量 token 一次性训练并缓存 logits,学生用 LITM、PATM、LPTM 三种零参数 token merge 把平均长度从 8.8K 压到 1.8K,再靠蒸馏找回教师约 85% 的增益,线上 ADSS +1.036% 而延迟仅 +5.6%。Meta FAIR 的 Skaling 标度律用无参数数值微分证伪 Chinchilla 加性律隐含的零混合偏导,把内层和式整体抬到一个自由外指数 k(拟合值 0.31–0.45),四个网格上把插值与外推 MAPE 降低 1.5–3.9 倍,并支持只扫两条低算力边的 L 形网格、约 1/10 的 profiling 算力。NAVER WEBTOON 的 LP→FFT→RFT 三阶段后训练,把六级漏斗序数回归学出的 reward 当作 GRPO 对齐信号而非线上打分,Rank NDCG 从 0.437 升到 0.463,线上 LastPaid/Imp 相对非基础模型的 CTCVR 生产模型 +13.4%。三篇的共同思路是把最贵的那段算力压进一次性离线阶段,线上服务或曲线拟合只留最省的形式;两篇学术短文则聚焦语义 ID 的量化容量与跨域路由。

重点论文

TM20K · ⭐ 8/10

Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling

🏢 ByteDance · 判别式推荐

字节电商广告把行为序列推到 20K:教师保留全量 token 一次性训练并缓存 logits,学生用 LITM(同商品 ID 局部合并)+ PATM(按位置分段设压缩因子)+ LPTM(逐层金字塔减半)三种零参数 token merge 把有效长度压到 1.8K,再靠蒸馏找回教师约 85% 的增益,线上 ADSS +1.036% 而延迟仅 +5.6%。

Skaling: Chinchilla's Exponents Meet Kaplan's Coupling · ⭐ 8/10

🏢 Meta · LLM

Skaling 用无参数数值微分证明 Chinchilla 加性律隐含的混合偏导为零被数据否定(实测为负、存在 N-D 协同),据此把内层和式整体抬到一个自由外指数 k 上(L=(A/N^α+B/D^β)^k+E),仅加一个参数就在 4 个标度网格上把插值与外推 MAPE 降低 1.5-3.9 倍,并因耦合形式由边界锚定而支持只扫两条低算力边的 L 形稀疏网格,用约 1/10 的 profiling 算力复原全网格律。

LP-FFT-RFT · ⭐ 6/10

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

🏢 Naver · 生成式推荐

NAVER WEBTOON 把 LLM 的后训练范式移植到推荐基础模型,拆成 LP→FFT→RFT 三阶段:前两阶段用冻结骨干热身下游头 + 判别式学习率完成稳定适配,第三阶段用「六级漏斗序数回归 + 截断自归一化 IPS 去偏」学出的 reward model 作 GRPO 对齐信号(而非直接当 serving 打分),离线 Rank NDCG 0.437→0.463 且 Funnel NDCG 追平 reward 模型本身,线上相对非 FM 的 CTCVR 生产模型 LastPaid/Imp +13.4%。

全部论文

模型 标题 类别 公司 摘要分 精读分
TM20K Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling 判别式 🏢 ByteDance 8 8
— Skaling: Chinchilla's Exponents Meet Kaplan's Coupling LLM 🏢 Meta 8 8
LP-FFT-RFT Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training 生成式 🏢 Naver 7 6
HD-Rec Hierarchical Quantization with Domain-Adaptive Sparse Routing for Generative Cross-Domain Recommendation 生成式 🎓 学术 6 —
— From Classification to Recommendation: Empirical Analysis of Audio Embedding Models Application for Content-Based Music Recommendation 生成式 / 判别式 🎓 学术 5 —