← 返回报告列表

2026-09-02 日报

日报 📅 2026-09-01
工业规模化的三把尺子:替换边界、营收口径与算力匹配
parameter-scaling industrial transformer inference-serving sequence-compression
📊 共 9 篇 · 精读 3

2026-09-02 日报

主题: 工业规模化的三把尺子:替换边界、营收口径与算力匹配

标签: parameter-scaling · industrial · transformer · inference-serving · sequence-compression

📊 统计: 共 9 篇 · 精读 3 · 🏢 工业界 3 · 🎓 学术 6 · llm 5 · discriminative-rec 3 · generative-rec 1 · other 1

综述

今日 9 篇、3 篇精读,推荐 4 / LLM 5,工业居多。三篇精读都在做规模化,共同点是「口径」而非结论。腾讯 PCG 的 TGR 以 CCFormer、BARGE、HiGR、TGR-Reason 四块逐块替换级联,均有生产 A/B,但首条局限自承「仍是一摞耦合模型,还不是一个模型」;对照 Yandex SONA 用单模型替掉 15+ 召回器与粗精排,两者却收敛到同一句:省下的成本来自容量花在哪里,而非丢弃历史。其消融里去掉序列压缩的纯 AUC 反更高,收益实落在 GAUC,而分组口径未定义。字节 ReST 把「一份历史对 N 个候选」的算力不对称拆成重编码器 + 轻解码器,TikTok Shop Ads 一周 20% 流量 A/B 得 AUC +1.31%、Advertiser Value +11.93%(广告主价值,单一广告产品切片);同厂 TM20K 同类改动只报 ADVV +0.780%,差约 15 倍且未引用;它也诚实报告加 MoE 参数 +500% 而 AUC +0.00%。字节 Seed 的 SMELT 专治口径:只对齐参数量会把循环的重复前传算力记成架构优势,它完整计入并锁死 FLOPs/参数/KV,前沿省 6.8–18.0% 算力;但 MoE 路由通信在账外,144 端点仅 12 个独立格点、未报标度面 R²,还不够称「律」。另 6 篇 brief 涉超参标度律、LLM 推荐前提批判、冷启交换与多模态检索;分歧已从做不做转向拿什么尺子量,自曝缺口者更可信。

重点论文

TGR · ⭐ 9/10

TGR: Advancing Industrial Recommendation from Generative-Paradigm Ranking toward Unified Generation and Reasoning

🏢 Tencent · 生成式推荐 / 判别式推荐

腾讯 PCG 的 TGR 技术报告在「一块一块替换级联、每块都必须从第一天起就是工业级」的纪律下把推荐推向生成式范式:TGR-GenRank 的 CCFormer 用特征域分离有向交叉注意力 + 长序列子空间 token 混合 + 分层卷积序列压缩把排序做成亚二次且在序列长度与容量两轴上可预测 scaling(工业 4B 集 AUC 77.66→77.94 / GAUC 70.86→71.36,约半数 GFLOPs、2.21× 训练吞吐,因目标 token 互不注意而能单次前向打分全候选把峰值 QPS 抬 30%,五场景 A/B、两场景全量,视频场景 CTR +3.57%、广告场景收入 +1.71%);TGR-GenRec 每个生成范式各上线一个模型——BARGE 用 ICA 恢复物品边界、HPR 按路径全局一致性重排、OSQ-VAE 正交双路解码互补救回,在参数/beam/延迟零增长下工业 Hit@5 较 OneRec +10.2~16.9%、线上 CTR +0.60% 且全量后收益反而变大;HiGR 用 PCRQ-VAE 前缀对比 tokenizer(约束只加在前 D−1 层、叶层保身份)+ 粗到细分层 slate 解码器(14:2 层分配)+ ORPO listwise 三目标对齐把整版当生成单位,工业 NDCG@5 +21.2%、>5× 解码加速、P99<50ms、GPU −60%、观看时长 +1.22%;TGR-Reason 则用 LatentRec 的 soft token selection 与逐步推理损失把多步 latent 推理压进 LoRA,使离线 Think 模型以 K=0 普通解码导出 semantic-ID reason token,经 Personal-Memory 条件化的 DRI 与 reason-token 引导的 Group Memory 检索注入生成器,请求路径零推理 rollout,冷启新用户 Hit@1 0.0451→0.2606、线上有效消费率 +1.75% / 新用户曝光转化率 +13.09%。

ReST · ⭐ 8/10

From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs

🏢 ByteDance · 判别式推荐

ReST 把工业排序中行为序列 scaling 的障碍拆成信号质量(噪声/不规则时间/被 DLRM 分支短路的稀疏监督)与算力不对称(一份历史对 N 个候选),用双门控注意力+RoPE/多粒度 RoTE+稳定化残差归一化改造编码器块,把排序分解为每用户算一次的重编码器与每候选算一次的轻量 cross decoder(projection-free KV + token-specific 参数化),再用 user-level 与 request-level shared-prefix 把结构不对称兑现为训练 5.8×、服务 20× 的算力复用,使 AUC 沿 16k 长度/深度/宽度三轴在 LLaMA 与 HSTU 饱和之后继续增长,TikTok Shop Ads 一周 20% 流量 A/B 拿到 AUC +1.31%、Advertiser Value +11.93%(p<0.01)并在 50ms P99 内全量上线。

SMELT · ⭐ 8/10

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

🏢 ByteDance · LLM

SMELT 指出既有 looped Transformer 评测普遍只对齐参数量、把重复前传的额外 FLOPs 误记为架构优势,改用 MoE 同时锁死 per-token FLOPs、总非嵌入参数与 KV cache 三重预算(收窄隐藏维偿还额外访问、加专家补回容量、调 head size 与 GQA 比例找平 KV),经三组消融锁定「循环中间一半层两次 + 更大有效深宽比 + 1/r 残差缩放」的配方,在 100M/200M/600M/1.6B 四档 × 四个稀疏度的 4×4 网格(最高 54B 非嵌入参数)上为两种架构各拟合一条独立的 Chinchilla 式标度面,得到前沿指数 γ 0.237→0.250、算力最优前沿上省 6.8-18.0% 训练 FLOPs,且下游增益超出验证损失所能预测的部分(DCLM Completion 96/96 全胜、残差随规模单调增长)、Code 领域收益最大(20.4%)、增益随样本长度(长/短桶 1.52×)与 in-context 示例数增长;机制探针显示第二次访问复用检索坐标(Q/K 余弦 0.89-0.93)而改变读取内容(V 0.65-0.74)、残差写入放大 1.2-3.5× 且方向一致(余弦 0.56),并把注意力汇聚从 BOS 0.60 压到 0.02、质量转移到示例答案(0.24→0.85)。

全部论文

模型 标题 类别 公司 摘要分 精读分
TGR TGR: Advancing Industrial Recommendation from Generative-Paradigm Ranking toward Unified Generation and Reasoning 生成式 / 判别式 🏢 Tencent 9 9
ReST From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs 判别式 🏢 ByteDance 8 8
SMELT SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers LLM 🏢 ByteDance 7 8
PLES Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search LLM 🎓 学术 6 —
RPCBench RPCBench: A Benchmark for Proactive Premise Critique in LLM-based Recommendation LLM 🎓 学术 5 —
DREAMS Towards Effective Structured Context Modeling for Conversational Recommender Systems via Dual-node Monte Carlo Tree Search LLM 🎓 学术 5 —
SwapRec SwapRec: Warming Up Cold Items Through Training-Time Swaps 判别式 🎓 学术 5 —
MIDR MIDR: Enrichment-Augmented Indexing for Multimodal Document Retrieval 其他 🎓 学术 4 —
ISO-RAG ISO-RAG: Isoperimetric Noise Control for Retrieval-Augmented Generation LLM 🎓 学术 4 —