← 返回报告列表

2026-08-21 日报

日报 📅 2026-08-20
训练与检索降本:廉价结构化信号替代大模型计算
parameter-scaling semantic-id rl pretrained-lm industrial
📊 共 8 篇 · 精读 2

2026-08-21 日报

主题: 训练与检索降本:廉价结构化信号替代大模型计算

标签: parameter-scaling · semantic-id · rl · pretrained-lm · industrial

📊 统计: 共 8 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 6 · llm 2 · generative-rec 3 · discriminative-rec 4

综述

今日 8 篇:llm 2 篇、generative-rec 3 篇、discriminative-rec 4 篇(有交叠),其中仅 2 篇出自工业界并做了精读,其余 6 篇为学术工作。Kakao 的超参迁移框架用适配 MLA 与 Muon 的 μP 消掉模型规模维、以 log-log 回归外推 token 维,把二维学习率搜索降为一维,并用外推值从零预训练 155B 总参/17B 激活 MoE、全程无 loss spike 跑满 10T token,定学习率的成本仅约全量训练的 1%;但评测只给柱状图不给数值表,算力-性能对比的 checkpoint 口径未写明。阿里 SSR-GRPO 把 RQ-VAE 的层级 Semantic ID 同时用作 GRPO 的稀疏裁判与难负样本挖掘器,仅靠一次前缀比对的奖励就追平 42B-MoE 裁判,天猫 3 亿日志训练、TmallAPP 两周线上 A/B 取得 GMV +1.40%,但正文在绝对百分点与相对提升间反复横跳。学术侧 PCTM 以近因加权成对探针质疑序列推荐基准是否真需高阶建模,RecPFN 以合成先验做零样本推荐,DASO 按前缀匹配深度重分配 rollout。共同趋势是以廉价的离散结构与先验替代昂贵的大模型裁判和穷举搜索,工业论文的数值口径则仍需读者自行核对。

重点论文

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts · ⭐ 7/10

🏢 Kakao · LLM

把超大规模 MoE 的最优学习率搜索从「模型规模 × token 预算」二维网格降到一维:用适配 MLA + Muon 的 μP(expert FC2 记为 vector-like、MLA 低秩投影维固定使其上投影 LR 缩放退化为 1)让最优 LR 在宽度与稀疏度耦合扩张(16→128 专家、激活专家数固定)时零样本迁移,再用「stable 阶段终止 + EMA 合并权重」从单次 proxy run 抽出几十个 token 预算点、对 log LR 拟合抛物线取顶点、在 log-log 空间线性回归(R²=0.95)外推出 10T token 的最优 LR 3.85×10⁻⁴,并由 Kakao 用它从零预训练 155B 总参/17B 激活基座模型、10T token 全程无 loss spike 完成验证,定 LR 的成本仅为全量训练的约 1%(98× 算力比)。

SSR-GRPO · ⭐ 7/10

SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

🏢 Alibaba · 生成式推荐

SSR-GRPO 把 RQ-VAE 生成的层级 Semantic ID 同时用作 GRPO 的稀疏相关性裁判(与稠密嵌入内积双视角融合,替代同源训练因而有偏且昂贵的 42B TaoSR1 奖励模型)和难负样本挖掘器(共享前两级、第三级不同),挖出的难负样本一物两用——既当质量基准 mask 掉组内 reward 更低的易负样本,又构造 Retrieval-DPO 的 pair-wise 监督,两条 loss 以不确定性动态加权联合优化,在天猫 3 亿日志上把 HR@4k 从 R-GRPO 的 0.8158 推到 0.8218,TmallAPP 两周线上 A/B 取得 GMV +1.40%、UCTCVR +0.99%。

PCTM · ⭐ 7/10

Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?

🎓 学术 · 判别式推荐

用两个不学习高阶序列表征的近因加权成对探针(Sequential Rules 与本文提出的概率式协同转移模型 PCTM)复核序列推荐基准:在 eSASRec 评测协议下,探针在三个 Amazon 数据集上比 eSASRec 复现高 15%-38%、MovieLens-1M 高 4.4%,仅在 MovieLens-20M 落后 27.3%,说明常用基准难以真正衡量高阶序列建模带来的收益。

RecPFN · ⭐ 7/10

RecPFN: Prior-Fitted Networks for In-Context-Based Recommendations

🎓 学术 · 判别式推荐

RecPFN 把先验拟合网络引入序列推荐:完全在结构因果先验采样出的合成点击流环境上预训练,推理时轻量 decoder-only Transformer 以少量领域序列为上下文、一次前向即给出 next-item 预测,无需任何权重更新。八个公开基准上取得零样本 SOTA,在低算力/低数据场景下与有监督方法可比,且对域漂移稳健。

DASO · ⭐ 7/10

Difficulty-Aware Semantic-ID Optimization for Generative Recommendation

🎓 学术 · 生成式推荐

提出 DASO,把语义 ID 生成式推荐的 GRPO 后训练视作在线 rollout 分配问题:按前缀匹配深度剖析每个 rollout 组、定位候选偏离目标路径的瓶颈 SID 层级,把有限比例的 rollout 换成前缀引导补全并保留原始 rollout 作对照,再配 SID 前缀分级奖励与 SFT 锚定项抑制回退。公开基准 12 项指标中 11 项优于 MiniOneRec 式 GRPO。

全部论文

模型 标题 类别 公司 摘要分 精读分
— Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts LLM 🏢 Kakao 8 7
SSR-GRPO SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce 生成式 🏢 Alibaba 7 7
PCTM Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling? 判别式 🎓 学术 7 —
RecPFN RecPFN: Prior-Fitted Networks for In-Context-Based Recommendations 判别式 🎓 学术 7 —
DASO Difficulty-Aware Semantic-ID Optimization for Generative Recommendation 生成式 🎓 学术 7 —
SCoRD SCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based Recommendation 判别式 🎓 学术 6 —
UniLang When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models 生成式 / LLM 🎓 学术 6 —
CoRRe Training-Free LLM-Based Recommendation with Post-LLM Item Refinement Using Collaborative Signals 判别式 🎓 学术 5 —