2026-07-31 日报
主题: 工业界两条战线:算力效率与决策可解释
标签: industrial · transformer · feature-interaction · semantic-id · ad-rec
📊 统计: 共 11 篇 · 精读 6 · 🏢 工业界 6 · 🎓 学术 5 · generative-rec 4 · discriminative-rec 4 · other 1 · llm 2
综述
当日共 11 篇,其中 6 篇精读且全部出自工业界,无一纯学术;类别上判别式与生成式推荐各 4 篇,另有 2 篇 LLM 训练与 1 篇近邻检索。腾讯 PCG 的 CCFormer 把特征交互拆成特征域分离的定向交叉注意力与子空间 token 混合,再用 Conv1D 逐层压缩序列,训练较 HSTU 快 2.21 倍,0.5k token 即打平其 2k 效果,CTR 提升 3.57% 并已全量部署。Meta 的 ROCS 把与候选无关的计算用块下三角掩码抽出来按请求复用,回放 QPS 提升 47% 至 196%。快手 FGPD 提出“理解—行动鸿沟”,把纠缠的意图与决策策略拆开再蒸馏进轻量 SID 生成器,线上收入涨 4.5%。谷歌 HA-MoE 将异构性信号同时注入门控与专家输出的仿射调制,并附带可迁移的评估与专家坍缩诊断工具。工业界正沿两条战线推进:一条压算力,一条把决策结构显式化——快手 LGRID 让 SID 每一位绑定具名属性,阿里 LoopMemGR 补上系统对自身推荐决策的记忆,可解释与自省正成为新的竞争点。
重点论文
ROCS · ⭐ 8/10
ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation
🏢 Meta · 判别式推荐
ROCS 用块下三角掩码把「request 侧输出不依赖 candidate」变成一条在复合下封闭的算子级依赖契约(GLM),覆盖线性/LCB/group-local norm/逐点算子/FM,从而让整条 request 侧通路在任意深度都能每请求只算一次、跨 N 个候选精确复用;DCA 以共享 request-only 序列编码器加逐层双组 cross-attention 把契约延伸到序列模块,RRR 把省下的算力再投资为 request 侧容量,IKBO 则在 GEMM epilogue 与 FlashAttention kernel 内部解析 request-candidate 索引映射、完全不物化 broadcast;公开数据集上在 DCNv2/FinalMLP/Wukong 上同预算超越 vanilla,Meta 数十个生产模型 replay QPS 提升 47%~196%,在线拿到 topline 增益加 29%~38% 容量节省。
CCFormer · ⭐ 8/10
🏢 Tencent · 判别式推荐
腾讯 PCG 的 CCFormer 把工业排序 Transformer 的特征交互拆成两个正交分量——user/target 紧凑 token 域分离地有向 cross-attend 全长行为序列(复杂度线性于 Ls),以及用子空间 token mixing + Per-channel FFN 替代序列内自注意力,再叠 Conv1D 逐层下采样做分层压缩(感受野 3→7→15→31,压缩但保留全序列可达性),相对 HSTU 训练加速 2.21×、GFLOPs 减半、0.5k token 即打平 HSTU 2k token,视频推荐 CTR +3.57% / 广告收入 +1.71% 并已全量部署。
FGPD · ⭐ 8/10
From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation
🏢 Kuaishou · 生成式推荐
把 SID 生成式推荐里纠缠在一起的「理解需求」与「决定如何行动」拆成 intent/policy 两类知识(Understanding–Action Gap),用 LLM 双 agent 生成 K 条候选决策规则、以「相对 intent-only 基线的语义相似度 advantage」做结果导向筛选与 target-blind 群体反思迭代,再经一阶+高阶双空间关系蒸馏压成轻量 SID 生成器的两个隐 token,线上零 LLM 调用,快手本地生活广告 A/B 取得 Revenue +4.506% / ADVV +4.621%。
HA-MoE · ⭐ 7/10
Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study
🏢 Google · 判别式推荐
Google Discover 把显式异构信号 h 同时注入 MoE 门控输入(HA-Gating)与专家输出的 FiLM 式仿射调制(HDLM),在模型体积 +5%、延迟 +0.5% 的固定预算内破解异构 feed 的负迁移与少数类坍塌;配套提出抗 gaming 的 DL-AUC(λ·Micro-AUC + (1-λ)·unweighted Macro-xAUC)作为自动化上线闸门,以及基于 JSD + 匈牙利匹配的 label-free 专家特化诊断 PIEM,线上把 Vid⁺/Web⁻ 跨类型 xAUC gap 从 0.141 收窄到 0.060。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| ROCS | ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation | 判别式 | 🏢 Meta | 9 | 8 |
| CCFormer | CCFormer: Efficient Cross-Field Interaction and Hierarchical Sequence Compression for Industrial Recommendation at Tencent | 判别式 | 🏢 Tencent | 9 | 8 |
| FGPD | From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation | 生成式 | 🏢 Kuaishou | 8 | 8 |
| HA-MoE | Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study | 判别式 | 8 | 7 | |
| LGRID | Interpretable Representation via LLM-Driven Generative Disentanglement for Local-Life Service Recommendation | 判别式 | 🏢 Kuaishou | 8 | 7 |
| LoopMemGR | LoopMemGR: From Behavior Logs to Evolving Memory for Generative Recommendation | 生成式 | 🏢 Alibaba | 7 | 6 |
| — | Restoring Collaborative Signals in Semantic-ID Generative Recommendation via Personalized Natural Language | 生成式 | 🎓 学术 | 6 | — |
| HiLaR | Hierarchical Latent Reasoning for LLM-based Recommendation | 生成式 | 🎓 学术 | 6 | — |
| — | Towards joint scaling laws with optimal batch size schedules | LLM | 🎓 学术 | 6 | — |
| — | Harnessing the Potential of Optimizing Data Mixtures via Bayesian Domain Reweighting | LLM | 🎓 学术 | 5 | — |
| DEG | Dynamic Exploration Graph: A Novel Approach for Efficient Nearest Neighbor Search in Evolving Multimedia Datasets | 其他 | 🎓 学术 | 4 | — |