← 返回报告列表

2026-07-10 日报

日报 📅 2026-07-09
工业级推荐与 LLM 双线:算力扩展、生成式检索提速、回归校准
industrial parameter-scaling semantic-id search-ranking transformer
📊 共 6 篇 · 精读 3

2026-07-10 日报

主题: 工业级推荐与 LLM 双线:算力扩展、生成式检索提速、回归校准

标签: industrial · parameter-scaling · semantic-id · search-ranking · transformer

📊 统计: 共 6 篇 · 精读 3 · 🏢 工业界 3 · 🎓 学术 3 · discriminative-rec 2 · llm 3 · generative-rec 1

综述

今日共 6 篇,精读 3 篇、略读 3 篇;类别上 LLM 3 篇、判别式推荐 2 篇、生成式推荐 1 篇,工业界主导(腾讯、快手、阿里三家大厂占据全部精读名额)。腾讯 WeChat AI 的 Hidden Decoding(2607.08186)在固定 Transformer 骨干上沿序列长度维度扩算力,把每个 token 展成 n 条独立 embedding 流并配合 Stream-Factorized Attention 把注意力开销压到近线性,首次在 100B+ MoE(WeLM-HD4-80B/617B)实现前沿规模的序列长度扩展并超同规模非-HD 基线。阿里 HUJING 的 DaV-Gen(2607.08365)借鉴投机解码,用「起草-验证」范式重构端到端生成式检索——ANN 向量非生成式起草候选、再以一次并行前向的融合打分替代自回归逐 token 解码,视频搜索延迟降至约 70ms(2.5x 于级联),在线 ATS +2.09%。快手 PIT-SUN(2607.08202)用单张经验边际 CDF 表同时承载有界 PIT 学习坐标、逆分位恢复基与漂移监控,再以 stop-gradient 隔离的 SUN 乘性恢复把预测映回原始空间条件期望,为观看时长/GMV/LTV 等重尾零膨胀回归目标提供可部署的期望一致校准,线上观看时长 +0.318%。趋势上,三篇精读共同指向「可部署工程闭环」:无论是把 test-time-scaling 推到前沿规模、把生成式检索做到毫秒级低延迟,还是把重尾回归目标做成一致校准,工业界正把学术方法收敛为线上可落地、有 A/B 增益的系统设计,值得持续关注。

重点论文

Hidden Decoding · ⭐ 8/10

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

🏢 Tencent · LLM

Hidden Decoding 在固定 Transformer 骨干下沿序列长度维度扩算力,把每个 token 展成 n 条独立 embedding 流并保留其 KV 缓存作上下文,配合 Stream-Factorized Attention 把注意力开销降到近线性,在 100B+ MoE(WeLM-HD4-80B/617B)上首次实现前沿规模的序列长度扩展并超过同规模非-HD 基线。

PIT-SUN · ⭐ 8/10

PIT-SUN: A Deployable Empirical Marginal Transform Framework with Expectation-Consistent Recovery for Regression in Recommender Systems

🏢 Kuaishou · 判别式推荐

PIT-SUN 用一张经验边际 CDF 表同时定义有界 PIT 学习坐标、逆分位恢复基与漂移监控,再用带 stop-gradient 隔离的 SUN 乘性恢复把预测映回原始空间条件期望,为观看时长/GMV/LTV 等重尾零膨胀回归目标提供可部署的期望一致校准,快手线上观看时长 +0.318%。

DaV-Gen · ⭐ 7/10

DaV-Gen: End-to-End Generative Retrieval via Draft-and-Verify

🏢 Alibaba · 生成式推荐

DaV-Gen 用「起草-验证」重构端到端生成式检索:以 ANN 向量检索非生成式地起草候选、再用融合打分在一次并行前向中验证,取代自回归逐 token 解码,在视频搜索上把延迟降到约 70ms(2.5x 于级联)并带来 ATS +2.09% 的在线收益。

全部论文

模型 标题 类别 公司 摘要分 精读分
Hidden Decoding Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models LLM 🏢 Tencent 8 8
PIT-SUN PIT-SUN: A Deployable Empirical Marginal Transform Framework with Expectation-Consistent Recovery for Regression in Recommender Systems 判别式 🏢 Kuaishou 7 8
DaV-Gen DaV-Gen: End-to-End Generative Retrieval via Draft-and-Verify 生成式 🏢 Alibaba 7 7
BACH BACH: A Bayesian Admixture of Contrastive Heads for Multi-Interest Two-Tower Retrieval 判别式 🎓 学术 7 —
UltraX UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing LLM 🎓 学术 5 —
— Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment LLM 🎓 学术 4 —