LLM 学术
7 │ 6 │ —
X-MoD X-MoD: Practical Scaling Laws for Sparse-Depth Routing Beyond Mixture-of-Depths
X-MoD 把 Mixture-of-Depths 的一稀疏一稠密交替推广为「稠密前缀 +(AK 个 top-1/K 稀疏层 + 1 个稠密锚点)×N1」,用 token 稀疏度 K 与锚点步长 A 解耦总参数与激活等效参数(161/298 物理层、总参为激活的 4.8–8.8 倍),配合整层残差门控方差缩放、深度方向 token-choice bias 与稠密前缀使深层稀疏堆叠可训(412 层仍稳定),并在 109 个配置上拟合相对等 FLOPs 稠密基线的残差律(容量奖励 + 稀疏上下文修正 + A–K 交互,R²=0.985,预设外推 RMSE 0.0196,推出 K̂∝L^0.55 且几乎与规模无关);在 L=32k、等激活规模等训练 FLOPs 下六组对 MoE 全胜但仅领先 0.008–0.025 loss,且其每 token FLOPs 减半几乎全部来自稀疏层只在路由子集内做注意力、从而多吃约 2 倍 token——同 token 的 Routed-FFN 对照反输 MoE 0.06–0.07,A3K16 实测训练吞吐还低于 Dense。
transformer parameter-scaling sparse-attention training-stability academic
2026-09-28
判别式 Google
7 │ 5 │ —
FLVM Mend the Measurement Gap: Latent User Preference Modeling for Short-Form Video Recommendation
Google/YouTube 提出因子化潜在价值模型 FLVM,把短视频的观看时长、完播、点赞、点踩、问卷等异构反馈视为低维潜在价值 z=[z_p 消费, z_a 主动互动, z_s 情感极性] 的带噪测量:每个反馈头的 logit 由一条只看时长/用户倾向/会话上下文、以独立损失训练且被 stop-gradient 的受限基线,加上一条经硬稀疏路由与正增益的 VIB 潜在优势组成,serving 时只用 σ(z_s) 与 softplus(z_p) 标量化打分并替换生产多任务 pre-scorer;YouTube Shorts 14 天 A/B 主观看享受指标 +2.67%,但无组件消融、对照为整体系统替换、去混杂未经问卷等外部标尺验证。
multi-task negative-feedback industrial
2026-09-26
生成式 LLM Tencent
8 │ 7 │ —
KuaFu KuaFu: Compressing Long User Behavior into Understanding at Billion Scale
腾讯 KuaFu 以单个行为 item 为压缩单元,用 LoRA LLM 编码器 + 两轴投影器把每个 item 压成 2–4 个 128–256 维 token 离线缓存跨用户复用,配长度课程、压缩-生成联合训练与按危害加权的幻觉感知 DAPO,支撑十亿用户周更的 LLM 画像挖掘,decoder 侧省 190 卡、十个月 holdout GMV +1.37%(但对照同时延长了历史并加快了刷新)。
pretrained-lm sequence-compression rl inference-serving ad-rec
2026-09-25
生成式 LinkedIn
7 │ 6 │ —
ESP Embedding Subspace Partitioning for Dynamic Multi-Objective Retrieval
LinkedIn 的 ESP 把召回 embedding 切成每目标一个 L2 归一化子空间、用请求侧权重的加权点积在 GPU 穷举 KNN 单索引上合分,使同一模型在服务期扫出多目标 Pareto 前沿(Transformer 版用 EOS 分段 + 段感知掩码 + 位置重置零参数实现),7 天 A/B 中 4 个权重点 revenue +0.91%~+7.36%、选定点 +4.01% revenue / +3.95% 申请;但线上只比较了调权重而非 ESP 对单 embedding,生产离线 MTSH 仅两个极端点且容量未匹配,开源基准的实体目标近乎字符串匹配。
multi-task contrastive-ssl pretrained-lm inference-serving industrial
2026-09-24
生成式 Shopify
8 │ 6 │ —
T-RoPE T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation
T-RoPE 把 RoPE 的旋转坐标从交互索引换成绝对 Unix 时间戳,配几何间隔频率库(10^2~10^8 秒)与逐维可学习 q/k 系数、query 旋转到下一事件时间(推理时用当前时间)、key 施加转置旋转使相位依赖 t_q+t_k 以打破时间平移不变性;在 HSTU+Time RAB 骨干上五个公开数据集全指标最优(+1%~+28%),60 亿交互 Shop 数据 +13%~+82%,Shop app 线上 CVR +0.33%(p=0.037),但主要增益来自多尺度时间戳旋转本身,非平稳 key 等独有部件贡献有限且缺外部时间 RoPE 对照。
transformer industrial
2026-09-24
生成式 Alibaba
8 │ 6 │ —
CMRec Cross-Country Code-Mixing for Generative Recommendation
CMRec(阿里国际)借鉴多语 NLP 的 code-switching 语料,在用户/物品零重叠的多国 GR 中,用内容+跨国 i2i 行为对齐的共享 RQ-VAE 码本(Hamming 距离)与按国分位数分桶的市场属性(余弦相似)双约束挑选跨国替换品合成混国序列,并用 stop-gradient 的原始上下文相对似然 P(y'|x)/(P(y|x)+P(y'|x)) 逐样本加权,在同替换预算对照下 Industrial R@100 Avg6 +5.27%(小国 +6.96%),线上六国汇总广告收入 +1.77%、订单 +2.64%(对照组未说明)。
cross-domain semantic-id ad-rec industrial
2026-09-24
生成式 ByteDance
9 │ 8 │ —
X-Rec X-Rec Technical Report
X-Rec(字节 TikTok)用黎曼流匹配在超球面物品向量空间直接建模推荐分布、采样 20 个触发器接 ANN 召回,配合 anchor 粗分类条件与只在最后一层去噪的 late-interaction DiT,在同骨干下以 3.46× 触发器生成吞吐追平 SID 自回归(R@20 10.76 vs 10.23,但 R@50 反输),作为新召回源在 TikTok 垂类两次上线累计垂类互动 +4.15%。
diffusion normalizing-flow transformer industrial inference-serving
2026-09-24
生成式 判别式 ByteDance
8 │ 7 │ —
OneTrans-V2 OneTrans-V2: Unifying Retrieval, Pre-rank, and Fine-rank with One Transformer in Industrial Recommender
OneTrans-V2 把召回、粗排、精排作为一个因果 Transformer 的三个任务联合训练,共享一次编码的用户序列上下文并保留各阶段原生候选特征,辅以决策前缀+业务偏置的 DCGR 召回、fine→pre 模型内蒸馏、MoE/μP scaling 与 SNT 训练组织,线上替换三模型级联 GMV/u +9.74%、同硬件 3.2x QPS。
transformer moe semantic-id knowledge-distillation multi-task
2026-09-23
LLM StepFun
7 │ 6 │ —
KITE KITE: KV-Invariant Transformer Expansion for Efficient Agentic LLM Scaling
StepFun 的 KITE 在训练中途把小模型扩成两塔:源模型保留为唯一产 KV 的 Prefiller,复制出只读逐层 KV 的 Decoder 联合续训,使 bulk prefill 保持源模型尺寸;SST 实例(33.8B→67B MoE)在等理论训练 FLOPs 下训练 loss 1.5900 优于 47B/63B 从头训练(1.6006/1.5921)、7 项下游全领先而 held-out NLL 与 63B 持平,75:25 P:D 下参数量代理推理代价低 6.7%/31.6%,但无实测 serving、无生长/KV 复用基线、无消融。
transformer moe parameter-scaling inference-serving industrial
2026-09-23
LLM 生成式 Google
7 │ 5 │ —
Explainable Recommendations at Scale: LLM Rationales for YouTube Music Artist Discovery
Google 把 YouTube Music「Your Daily Discovery」发现位的 Gemini 推理整体搬到离线:事件驱动地只为打开首页的活跃用户异步预计算 Discovery Profile(口味簇 + 未听过的新艺人候选 + 逐条自然语言理由),再经 Knowledge Graph 实体规范化剪除「组合式幻觉艺人」(如 Gavin DeBardeleben / Chhet Sokun 这类文本层面与真实长尾艺人不可区分的虚构名)、熟悉度过滤保证真正未发现、安全过滤兜底,在线层只做低延迟 fetch 与标注,两周 A/B 拿到位级互动 +22.43%(CI [16.93%, 27.93%])、发现/留存 +8.07%(CI [0.90%, 15.24%])、平均延迟仅 +0.3%;但其 multi-arm holdback 显示 LLM 候选提名对互动完全中性,收益全部来自把理由文案挂到既有 CF 检索 + 深度排序链路已选出的候选上,且该关键归因未给任何数字,唯一量化的离线指标(prompt 调优使达标率 64.8%→74.4%)由调 prompt 所依据的同一个 judge 打出。
pretrained-lm industrial inference-serving
2026-09-20
生成式 Baidu
8 │ 5 │ —
MuSeR MuSeR: Scalable Long-sequence Recommendation with Multi-interest Modeling
MuSeR 在百度已部署的 MGS(NANN 风格 HNSW 多目标检索)之上集成分层时间压缩(近期 800 条原样、中期 16 倍池化、早期 64 倍池化压到 Lc=1000)、6 个可学习 query + 正交正则的解耦多兴趣抽取、以及 ERNIE-4.0-Turbo→ERNIE-Speed 蒸馏摘要经 BGE 编码的多模态语义对齐,配合长期表示离线缓存异步刷新与分层 beam-search 检索上线,百度 APP 首页信息流 A/B 报 DAU +0.26%、时长 +0.89%;但消融显示去掉多模态语义后 Recall@500 反低于其最强 baseline NANN,真正的收益来源是新引入的 LLM 文本信号而非标题主打的压缩与多兴趣设计。
sequence-compression transformer pretrained-lm inference-serving industrial
2026-09-20
生成式 判别式 Baidu
8 │ 7 │ —
UNIQUE UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation
百度把手机百度信息流召回里的 128x128 分层 RQ 码本换成同等容量 16,384 的单层平坦码本(用 batch 使用率 r_j^tau 缩放分配距离做均衡、用 DSSM 多目标反馈监督更新码本),并把用户前缀、候选 item target、候选 code target 放进同一个早融合 Transformer(target-attention split 禁止 target 互相 attend),一次前向同出码分类 logits 与多目标排序分;工业码本资源方差 1510.85→389.57、top-1 类目占比 65.43%→78.08%,三场景全量一周 A/B 时长 +0.96%、分发 +1.08%、留存 +0.70%,占候选池 22.5%,89ms P99 / 44.23% MFU;但公开实验只有 KuaiRand-Pure 一个 7.6k 物品数据集,且四个消融中三个单独移除即跌破最强 baseline。
semantic-id quantization transformer multi-task cold-start
2026-09-20
other Netflix
7 │ 5 │ —
Beyond Raw Engagement: A Counterfactual Observability Framework for Recommender Systems at Netflix
Netflix 把推荐系统对内容创作者与模型开发者的可观测性形式化为反事实测量问题——估计「若移除某条内容或某次模型决策,推荐器会怎么出、互动会怎样」,以带 logged selection probability 的 Exploration & Exploitation 模块为基座,给出 SNIPS 去偏、策略级/物品级 position-adjusted relativity、单阶段 Leave-One-Out(match function 取「top pick 非被移除项」或「top pick 是被移除项时的次优项」)与级联场景的 Incrementality=Irreplaceability×Universality 分解(Horvitz-Thompson / Hájek 估计器 + 无放回序列的累计选中概率),上游诊断则把 match 放宽为候选池 Jaccard 相似度;验证仅有两条内容的合成仿真(量级失配:真值 0.048/0.012 对估计 0.0347/0.0240)与首页 row 上 11 次移除式 A/B 的 weighted R2=0.8212(无 baseline 对照、最大样本点符号判反),全文不报告任何可归因于该框架的业务收益。
industrial
2026-09-19
判别式 LinkedIn
7 │ 6 │ —
CC Retriever Connected Content Retriever: Dense Graph Edge Features Powering Pre-Ranking at LinkedIn
LinkedIn 把 Connected Content 粗排从 CPU 上 O(10^5) 参数浅模型整体迁到 GPU-RAR:服务时用 sort+searchsorted 在 GPU 上把 viewer-author 稠密亲密度边特征 join 到数万候选(5-10 ms),拼接 MLP 多任务打分,配合 CPU 并行哈希 ID 解析(10× 吞吐)与每秒数万更新的十亿级 GPU 常驻索引,整体替换带来内容时长 +2.5%;但对照为整套旧模型+旧系统,边特征只有离线同尺寸消融(-7.86% recall@10)支撑,且新模型上扩 75× 仅 +0.20% recall。
industrial inference-serving graph multi-task
2026-09-18
生成式 Alibaba
8 │ 7 │ —
IntBMoE IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts
IntBMoE 把 MoE 拆成参与度/执行量/物化量三个可独立设定的量,用 K 条学习码本 + 共享超网络把整池专家基逐层线性组合(无 softmax、1/√E 保方差、允许负系数)成 K 个与输入无关的两层 block,再对每个 token 做 Top-k block 路由并用 Dual-Path Residual Gating 把 value/gate 两路乘性耦合,从而同时拿到全参与、稀疏执行与有界物化;因复合 block 与输入无关可离线物化缓存,请求时成本不随专家数 E 增长,在 ImageNet-1K 上以 73.76% Top-1 超最强 baseline SMEAR 1.98 点、MiniPile PPL 降 2.9%、IntTravel HR@1 0.6852,并在高德首屏地图 POI 推荐以 19ms/P99 38ms 通过 60ms 预算、线上 A/B 相对 UVCTR +2.4% 后全量上线。
moe transformer inference-serving industrial
2026-09-18
LLM Q Labs
7 │ 7 │ —
Untied-Grow How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents
为 8 种 prelude–core–coda 变体逐架构拟合算力最优配方并在 FineWeb 上训练 1e18–1e20 FLOPs 阶梯,发现训练中途把 core pass 从 2 翻到 4 的模型生长(解绑 Untied-Grow 指数 0.111→0.117、1e20 处 1.55× 算力倍数;绑定 Loop-Grow 1.36×)与在 coda 前也做『归一化 + 注入 prelude 输出』的边界算子(1.25×)让 compute multiplier 随规模上升、而解绑权重只改常数,7.4B Untied-Grow 留出外推落在预测线上并以约 1/19 算力在 CORE 上追平 GPT-3 13B(非受控比较),多 epoch 下最优循环次数随算力增长且扩循环比扩尺寸省 2.2× 算力;但指数差仅 0.003–0.006、共享 Vanilla 的不可约损失、单种子,与换优化器或换配方引起的指数变化同量级。
transformer recursive-depth parameter-scaling academic
2026-09-16
生成式 判别式 Meta
8 │ 6 │ —
LIGE-GR LIGE-GR: A Smooth Leap from Ranking to Generative Recommendation in the LLM Era
Meta 的 LIGE-GR 不替换现有 pointwise 排序栈,而是在 CF 排序模型的缓存候选表示上加 4 头 4 层因果 Transformer,做前缀条件的多任务重预测,再用续看生存概率加权的 listwise VM 和带闭式时长感知未来价值估计的 beam 解码器(Palette)逐位构造列表;三处改动都可配置回退到原贪心系统。线上 IG Reels / FB Video 时长 +1.14% / +0.72%,但头条收益来自 b=1 前缀条件贪心,训练仍是逐物品监督,加宽 beam 对时长几乎没有贡献(+0.05%,不显著),也没有同容量去上下文对照和公开基线。
transformer inference-serving industrial
2026-09-16
生成式 Tencent
8 │ 5 │ —
ANGLE One-Step Retrieval Framework for Real-Time Sponsored Search Ads Using Hierarchical Text Representations
ANGLE 是腾讯搜索广告的一步式 LLM 生成召回:离线用 Hunyuan-13B 为每条广告生成「商业意图(约 70 万类目内约束生成)× 广告摘要(品牌/核心服务)」两级文本标识并建倒排索引,在线用 Hunyuan-1B 的 GDR-LLM(生成交叉熵 + [CLS] 点击判别头 + 按消耗排序的 DPO)在按用户可投放广告动态重建的约束树上 beam 64 解码,取回广告跳过相关性与粗排直送精排,作为补充通道上线 WTS/QBS(消耗 +1.81%/+6.57%);但全文没有任何 SID 对照,消融显示对 110M BERT 等基线的优势几乎全部来自约束解码(去掉后 HR@100、MAP、ACR 跌破基线),线上曝光涨幅大于消耗与点击说明收益来自增量供给,实时性只有预算口径而无测量。
pretrained-lm multi-task rl search-ranking ad-rec
2026-09-16
判别式 Kuaishou
7 │ 6 │ —
SARA Scaling Articulated Rationales for MLLM-based Recommendation
快手 SARA 用问卷数据引擎采集用户「为什么喜欢/讨厌」直播的理由(18.75 万条 HQ),以 SFT+Quality-Refining DPO 对齐 Qwen2.5-VL-7B 为 1000 万主播按日生成正/负理由,正理由经 MIM 软对比约束用户-主播交互表示、负理由量化成 SID 挂到 Hate 历史做 target attention,线上观看时长 +0.99%、Hate −8.16%,但排序侧无消融,收益未与新增结构分离。
pretrained-lm rl semantic-id contrastive-ssl negative-feedback
2026-09-15
LLM 学术
7 │ 7 │ —
MoME MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
MoME 指出 conditional memory 这一族(Per-Layer Embedding / Value Embedding / STEM / Engram / Bigram)的共同瓶颈不在注入位置而在寻址方式——记忆索引始终是 surface form 的确定性函数,迫使 bank、python 这类多义 token 的所有语境共用一行(容量按 token 而非按语义内容分配)——于是把每行拆成 M 个记忆槽位、用 hidden state 上的 per-head top-K 门(K>1 用 sigmoid-norm 只在选中槽位上归一)选并加权槽位,再经 γ=2σ(W_γh+b) 的 per-head value-residual 门注入 attention value 流(这个注入点让记忆分支可与标准 value 投影并行调度,qwen3_4b 上比 hidden-state 注入省一半延迟 0.509ms vs 0.996ms),并给出可选的离线 kNN 行分组把容量从 token 轴守恒地搬到上下文轴(c_grp=2 最优,=4 开始伤 CORE);在 nanochat / Llama-MobileLLM / Qwen3 三家骨干的受控预训练中,等参下 val bpb 0.8621 优于 Bigram 0.8636 与 VEmbedding 0.8633,三个规模上以更少记忆参数同时打赢 STEM 的 bpb 与 CORE(Qwen3 0.6B 用 470M 记忆对 STEM 的 1409M:0.7461/0.2737 vs 0.7564/0.2556),d12 上记忆 75.5M→604M 全程 bpb 低于 Bigram 且 run-to-run 方差明显更小,同训练 FLOPs 下还赢过延迟匹配与总参匹配的两个更大稠密骨干,WiC 上 144 个 layer-head 站点中 117 个异义对路由散度更大、110 个同义对槽位重叠更多;但 Qwen3 0.6B 等参下 bpb 反而不如 VE(靠 BoolQ 单任务 +15.8 点把 CORE 拉高)、d24/ClimbMix 上 Bigram 的 bpb 明显更好(0.6943 vs 0.6990)与 d12 结论相反且未解释,全部实验止于 sub-1B 骨干、100B-token 那格只有单种子,可解释性分析作者自陈为描述性、缺因果干预。
transformer moe parameter-scaling academic
2026-09-14
判别式 Alibaba
8 │ 7 │ 8
LazFormer LazFormer: Scaling Transformers for Industrial Recommendation via Transferable Generative Pre-training
LazFormer(阿里 AIDC)把工业排序 Transformer 的「生成式预训练→判别式排序」迁移从 sparse-only 推进到 sparse+dense:用零初始化(W_up=0)的可迁移残差适配器把加购/下单等排序专属特征以函数保持的方式注入,使排序从预训练表示精确出发再渐进吸收(对照组 Direct/PreProj 与完全不迁稠密的 Sparse 不可区分,证明决定性的是融合方式而非是否迁移);配合由粗到细长序列压缩+滑窗/全局 token 混合稀疏注意力+跨层渐进剪枝+请求级样本组织(92.63% 稀疏、5.1× 注意力加速),以及「每 epoch 重置稀疏、跨 epoch 累积稠密」的非对称多轮训练;工业数据上 CTR AUC/GAUC 相对最强 baseline +0.74/+1.28pt(降配到 baseline 配置的 LazFormer* 只用 14G FLOPs 就全面胜出),线上 GMV +9.85% 而 A10 吞吐仅降 12.1%。
transformer parameter-scaling sparse-attention sequence-compression training-stability
2026-09-14
生成式 Alibaba
8 │ 6 │ —
VARG VARG: Value-Aware and Ranking-Aligned Generative Retrieval for Dynamic E-commerce Search
VARG 是天猫 App 搜索的「召回—粗排一体化」生成式检索系统:VARG-ID 用双向 Q2I 对比学习的两级语义前缀加 EB-CVR 平滑的簇内价值序第三位 token 做到初始 100% 无碰撞的 item 级寻址,配三阶段 SFT(Q2I 价值加权、层级加权、LO-SFT 局部序监督、上下文扩展)与 Prefix-GRPO(合法性门控下的行为/排序器优势/相关性多源奖励加前缀分支数 token 加权),生成候选经预留配额绕过粗排直通最终排序器,14 天 20% 流量 A/B GMV +1.45%;但消融显示 Prefix-GRPO 的两项署名创新只占 RL 增益的 11.7%(纯行为奖励 GRPO 占 88.3%),价值序 token 本身从未被单独消融,而 LO-SFT 近乎无效与「全量重排使完整 SID HR@100 崩 14.45pp」两条证据表明模型是把第三位 token 当绝对地址记忆而非学到价值序数语义——真正扎实的原创贡献是那组标识符稳定性诊断与冻结槽位式日更工程。
semantic-id rl contrastive-ssl pretrained-lm search-ranking
2026-09-13
生成式 LLM Netflix
7 │ 6 │ —
Constrained GRPO Safety as a Constraint: Fine-Tuning a LLM Recommender to Explain Itself
Netflix 用 Lagrangian primal-dual 改造 GRPO,把无害性当成带阈值的约束而非加权奖励项,在同一个 in-house 8B 推荐 LLM 上微调出推荐解释生成能力,三准则全通过率 0.649→0.956(独立 judge 0.677→0.931),并报告推荐与通用语言能力未退化。
rl pretrained-lm multi-task industrial
2026-09-12
LLM Meta
7 │ 8 │ —
End-Of-Token Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models
Meta FAIR + UW 提出两种单次前向的 token→byte logit 转换方法——Marginalize-It(对前缀匹配 token 重归一化,近似)与 End-Of-Token(向词表加 <eot> 吸收残余概率质量,精确),并首次沿 tokenization 方案(Tokens / Bytes / Bytes w/ <eot>)与训练目标(蒸馏 vs 交叉熵)两轴做层参数对齐的 ≈1B 参数、最高 1T bytes 过训练标度扫描:token 模型在低算力区领先但快速饱和,byte 模型起步更差却持续改善,外推预测蒸馏 End-Of-Token-1B 渐近超过蒸馏 Token-1B 达 4%、超 Llama-3.2-1B / Gemma-3-1B-pt / Gemma 2B 分别 6.5% / 8.1% / 2.1%,且只需六分之一的独特文本与五分之一的 logit 存储(词表仅 ≈261,无需 top-k 截断);同时给出一个重要负面结论——BPB 无法跨 tokenization 方案与训练目标公平比较,因为它只约束目标 token 的概率值而对残余质量的排序完全盲视,低 BPB 的模型可能下游更差。
parameter-scaling knowledge-distillation transformer academic
2026-09-11
判别式 Tencent
8 │ 7 │ —
ChronicleRec ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling
ChronicleRec 把终身用户建模重构为 target-independent 表征预训练:recency-aware 近细远粗多粒度合并 + 可学习 query token 交织进历史 + 因果编码,使每个 Chronicle Token 拥有良定义的时间感受野;多分支 mask 掉不同长度近期历史覆盖多时间视野,再用 mask-and-predict 的 Chronicle Alignment 把压缩的过去对齐到近present 意图;token 与候选无关故可每用户算一次并异步写回 KV cache,把超长序列编码移出在线打分路径,KuaiRand 上以 55 个 token 恢复 full-attention 增益的 92.9%,微信朋友圈广告 pCVR 七天 A/B GMV +1.61%。
sequence-compression transformer linear-attention process-supervision ad-rec
2026-09-11
生成式 Kuaishou
7 │ 6 │ —
OneLA OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation
OneLA 指出线性注意力(GDN)把生成式推荐的序列长度瓶颈换成了新的 beam 宽度瓶颈,用“一份共享 prefill 状态 + 只追加的紧凑转移记录 GTR(α,δ,k) + 轻量祖先索引 + 融合共享上下文 kernel”取代逐 beam 状态物化——因为 GDN 层只通过右乘消费状态,就把右乘推穿整条祖先链、全程只维护两个 d_v 维投影累加器,循环状态矩阵从不重建——在离线实验上取得 1.54-2.46x 端到端解码提速与 20-56x 持久状态容量下降,但头条加速比测在较弱的 FullState 基线上,且无任何组件消融与线上部署。
linear-attention inference-serving semantic-id transformer industrial
2026-09-11
LLM Meta
7 │ 6 │ —
MoEMB MoEMB: Scaling Universal Multimodal Embeddings with Efficient Mixture-of-Experts Models
MoEMB 把通用多模态嵌入的扩容从表征维度/多向量/推理 token 转到「专家轴」,用预训练原生稀疏 MoE 骨干(Qwen3.5-35B-A3B/122B-A10B,E=256、top-8)配 <emb> pooling 与冻结 router 做对比微调,在仅用公开 MMEB-family 数据的口径下把 MMEB-V2 推到 70.4/72.4、MRMR 推到 51.6,并首次系统研究 MoE 嵌入器的六类自适应计算动作(含用 Gated DeltaNet 写入强度 β 作免注意力图的 token 显著性信号)与配套 kernel,省一半算力掉不到 1 点;但其宣称的「专家轴 +10.4」实为 REAP 剪枝退化曲线、「MoE 比 dense +6.8」混杂了换骨干,扩容归因缺乏受控证据。
moe contrastive-ssl parameter-scaling linear-attention inference-serving
2026-09-08
LLM Ant Group
8 │ 8 │ —
Hyperparameter Scaling Laws Across MoE Sparsity
蚂蚁百灵团队用 1,800 次独立预训练(六个激活参数规模 x 四档激活率、约 20T token、20 万等效 H800 卡时)证明最优学习率与 batch size 会随 MoE 激活率 A 系统性漂移,且激活参数量、总参数量与训练算力三种对齐口径都吸收不掉这个漂移,据此把 A 作为可分离的乘性幂律因子写进超参标度律,得到 eta*=0.8343*C^-0.1385*A^0.1361 与 B*=6.4765*D^0.5181*A^-0.0841(学习率的基准变量是算力 C 且对 M/D 分配不敏感,batch size 的基准变量是训练 token D,从而调和了 DeepSeek Law 与 Step Law 的矛盾),用 LOAO/LONO 分组交叉验证在 scale-only/additive/log-interaction/multiplicative 四个候选族中按参数更少选定乘性形式,并在冻结的 12B 总参、A=1/64、D=159B 联合外推留出目标上给出最接近实测最优的预测;但样本内 R^2 仅 0.72-0.78、bootstrap 区间互相重叠使候选形式间无统计显著差异,且 batch size 侧引入 A 的增量远弱于学习率侧。
moe parameter-scaling training-stability pretrained-lm transformer
2026-09-08
判别式 ByteDance
9 │ 8 │ —
SequenceO1 SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching
SequenceO1 把 100K 超长行为序列的瓶颈重新定义为「原始序列被反复存储/传输/计算」而非注意力复杂度,用可学习原型 + 原型维 softmax 的 Sketch Attention 把历史压成定长、目标无关(user-only)因而可跨候选跨请求缓存的 sketch,再用 STCA 分别在近期 10K 后缀与 sketch 上做目标条件推理,配 local KVCache(训练 3h TTL/命中 0.5、服务 1h TTL/命中 0.6)、MRLB、pipeline lift 与融合算子 FlashSA,把超长分支的解析 FLOPs 降低 49.9×(训练)/63.9×(推理),在抖音与抖音极速版全流量部署一个月,Finish +2.33%/+3.49%、Dislike -6.98%/-6.00%。
transformer sequence-compression inference-serving linear-attention industrial
2026-09-08
LLM 学术
7 │ 7 │ —
On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing
特拉维夫大学用机制可解释性逆向出 Mamba 做联想召回的最小电路——Conv1D 复制移位构造键值对、SSM 外积写入、键查询内积读出,本质是一张由 JL 投影实现的隐式线性哈希表——并据此推出闭式 Recall Scaling Laws:召回概率 ≈ Φ(√(ND/(aN_f+N)) − √(2log V)),配一条对任意固定状态循环模型成立的信息论下界 ND = Ω(N_f log V),并扩展到多层(有效状态 N_eff = ΛN)与多头(MQA=MKA ≤ 单头=MVA ≤ MHA),在设计模型、训练线性模型与完整 Mamba 上均得到验证。
linear-attention parameter-scaling academic
2026-09-07
判别式 Hello Group
8 │ 6 │ —
MORE Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones
陌陌(Hello Group)的 MORE 把多任务信息流从后置塔搬进统一排序骨干:Shared/Private Anchor Token 贯穿所有 block,逐层以 per-task cross-attention 读用户级序列流、在 task-boundary mask 下与非序列 token 做 RankMixer 式混合、再经 FiLM 式 per-task 增强,陌陌 Nearby Feed 七任务全胜、两周 A/B 六项 p<0.05 已上线、P99 打分延迟降约 30%;但把 Table 2 的 BaseArch 折回 Table 1 口径只有 +0.41%,低于 OneTrans/HyFormer 的约 +0.54%,相对最强公开统一骨干的真实增量仅约 0.2 个点,且「任务盲」这一 root cause 全文断言 16 次却从未被直接测量。
multi-task transformer feature-interaction parameter-scaling inference-serving
2026-09-07
判别式 Huawei
7 │ 5 │ —
PTDG Personalized Task Dependency Graphs for Mitigating Signal Erosion in Multi-Task Recommendation
华为 PTDG 把多任务转化漏斗的任务依赖从「全局统一的固定链」改成「实例级可学的低秩拓扑」:用两个骨干抽出的 item embedding 做 rank-q 分解生成 T×T 邻接矩阵、用用户/场景 MLP 产出的 γ 对 q 个隐因子做对角调制、乘上硬因果掩码剪掉语义回流后跑一层 GCN 建立跨任务捷径,再配 APM 按任务正样本率渐进 top-k 掩码解耦共享参数以化解梯度冲突;工业集平均 AUC 0.8878、KuaiRand1K 0.9081 均为最优,日活过亿的应用分发平台两周 10%/10% A/B 拿到 CVR +1.2% / eCPM +1.9%、延迟仅 +8ms;但相对最强已发表基线 PMTRec 的真实优势只有 +0.68%(其中 66% 集中在 7 个任务中的 2 个稀疏任务、稠密的 Task 4 上还低于 PLE 和 MoCoGrad),而三个退化变体全部跌破 PMTRec,且「信号侵蚀」这个 root cause 从未被直接测量。
multi-task graph ad-rec industrial
2026-09-04
LLM NetEase
7 │ 6 │ 4
AutoLR AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems
网易 DASHEN 游戏社区 App 的 AutoLR 把工业推荐「研究 → Launch Review」这条路径的上游阶段交给自治 harness:多专家委员会先独立提案再圆桌综合、对抗评审与反驳产出带 file:symbol 编辑面的结构化候选,一个确定性的证据加权选择器按「过滤 → 多样性冻结窗口 → 委员会建议性重排 → top-1 执行 → 记忆门」分配试验预算(Beta(1,1) 平滑只作打分特征、明确不是 Thompson 采样),分层知识(外部研究 / 生产系统 / DASHEN 领域)加实验记忆做角色特化有界检索,LLM 只出提案、确定性控制器独占执行、指标提取、护栏与持久状态转移;几个月日志的路径感知审计从 4,250 条账本行还原出 1,586 次完整评估,九条 Launch Review 记录的相对提升算术加总为渗透率 +5.75% / 消费时长 +10.83% / VV +5.55%(论文声明为描述性、非合并处理效应),迭代成本迁移到 DeepSeek-V4-Pro/Flash 后约 RMB 3–4;论文同时命名了 KEEP 棘轮——一次单跑越过固定阈值即改写主干,而被审计配置里噪声标定是关闭的、参考下限 1e-3 与候选 delta 分布 IQR(1.20–1.26e-3)同量级。
agent pretrained-lm industrial
2026-09-04
LLM Alibaba
7 │ 6 │ —
LLM4AIGQ LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining
阿里淘天把 AI 导购引导词(AIGQ)的生产链路从「多路召回主搜 query + 规则泛化」的判别式级联换成 LLM 端到端「多兴趣切分 → 意图推断 → 引导词生成」,中间表示由 query 改为 interest;训练用 SFT(单兴趣只学风格)→ GRPO(think/query/interest/global 四级奖励 + 最优有序匹配 DP 对齐教师兴趣切分)→ DPO(把 think 模式答案作正样本、non-think 作负样本,再剔除最相似 30% 偏好对)三段后训练;部署用近线按 N 次交互触发生成、在线只读 user_id→queries 映射表的架构把 LLM 挡在实时路径外;天猫导购/搜索/详情页多场景 A/B 10% 流量 uCTR +4.46%、放量 40% 后六天 +2.53%,但离线两个指标与训练奖励同源、线上无坑位与转化口径、放量衰减未解释。
pretrained-lm rl knowledge-distillation process-supervision search-ranking
2026-09-03
判别式 Meituan
8 │ 7 │ —
UniCon UniCon: A Unified Context-Centric Modeling Paradigm for CTR Prediction
UniCon 把工业 CTR 统一建模的基本单位从 token 换成"上下文单元"(一次曝光内共同展示的 item 加意图/环境与用户 token),历史侧填 logged click、目标侧由候选集初始化成"目标潜在上下文单元"并用可学习 placeholder 对齐 feedback 分量,由堆叠 UniConBlock 交替做 intra-context(Locality)与 inter-context(Dynamics)变长注意力、块间用 target-aware Gumbel-TopK 上下文压缩把注意力开销从 O(LN^2) 压到 O(N^2/(1-r^2)),在美团搜索广告一年期生产数据上离线 AUC 0.8558→0.8697、7 天 20% 流量 A/B 拿到 RPM +3.09%/CTR +2.07%/营收 +2.95%(p<=0.01);但其命名主张的净贡献存疑——直接检验上下文中心化的两项消融合计仅 +0.0017,小于正交的曝光/位置辅助损失 +0.0034,而论文未说明基线是否同样开启该辅助监督。
search-ranking ad-rec transformer feature-interaction sparse-attention
2026-09-03
LLM Meta
8 │ 6 │ 4
CORAL CORAL: An LLM-Native Harness for Production Recommender Systems
Meta AI 的 CORAL 把通用 LLM 放到生产推荐系统的控制面而非请求路径上:每 3 天一轮,agent 观测逐控制单元的运行统计、回忆最近 3 轮自己的配置与归因结果、提出有界的逐单元调整,再由一个约束优化器把提案投影到预算可行集后直接下发线上,A/B 实测结果写回记忆闭合回路,全程不做参数更新;两个大规模社交平台上分别取得 watch time +0.15% / sessions +0.16%(成本持平)与年化数百万美元服务成本节省(第二轮再扩 44%、engagement 不变),而由于 LLM 调用数由控制面划分而非流量决定,整次部署推理成本仅数十美元。
agent pretrained-lm industrial inference-serving cold-start
2026-09-02
生成式 Alibaba
8 │ 7 │ —
SPAR SPAR: Enhancing Industrial-Scale Generative POI Recommendation via Real-World Spatial Perception
高德 AMAP 把『空间感知』从 tokenizer 一个点扩展到整条训练生命周期:SI-SID 用 NeRF 式正弦地理编码(平移不变核 + Lipschitz 连续,Pearson r=0.893)在 RQ-Kmeans 之前与文本嵌入拼接,使 L0 码本按地理划分、L1 按语义精修;MG-CPT 在 25 个自建地理数据集(含路网与约 5 万条真实导航轨迹,三层递增复杂度)上继续预训练,使 4B 模型在无坐标方向推理上超过 Qwen3-32B 三倍以上;TV-SFT 把 MG-CPT 的参数增量冻结为 task vector 并叠加 LoRA 以抗灾难性遗忘。四座城市一个月高德日志上相对 PLUM 平均 +38.32%(8B),公开 NYC/TKY 相对最强 baseline +11.91%~19.29%,但全文无线上 A/B、无部署,且 TV-SFT 的增益经复核几乎全部来自 LoRA 而非 task-vector 锚定。
semantic-id quantization pretrained-lm industrial cold-start
2026-09-02
LLM ByteDance
7 │ 8 │ —
SMELT SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
SMELT 指出既有 looped Transformer 评测普遍只对齐参数量、把重复前传的额外 FLOPs 误记为架构优势,改用 MoE 同时锁死 per-token FLOPs、总非嵌入参数与 KV cache 三重预算(收窄隐藏维偿还额外访问、加专家补回容量、调 head size 与 GQA 比例找平 KV),经三组消融锁定「循环中间一半层两次 + 更大有效深宽比 + 1/r 残差缩放」的配方,在 100M/200M/600M/1.6B 四档 × 四个稀疏度的 4×4 网格(最高 54B 非嵌入参数)上为两种架构各拟合一条独立的 Chinchilla 式标度面,得到前沿指数 γ 0.237→0.250、算力最优前沿上省 6.8-18.0% 训练 FLOPs,且下游增益超出验证损失所能预测的部分(DCLM Completion 96/96 全胜、残差随规模单调增长)、Code 领域收益最大(20.4%)、增益随样本长度(长/短桶 1.52×)与 in-context 示例数增长;机制探针显示第二次访问复用检索坐标(Q/K 余弦 0.89-0.93)而改变读取内容(V 0.65-0.74)、残差写入放大 1.2-3.5× 且方向一致(余弦 0.56),并把注意力汇聚从 BOS 0.60 压到 0.02、质量转移到示例答案(0.24→0.85)。
transformer moe recursive-depth parameter-scaling industrial
2026-09-01
判别式 ByteDance
8 │ 8 │ —
ReST From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs
ReST 把工业排序中行为序列 scaling 的障碍拆成信号质量(噪声/不规则时间/被 DLRM 分支短路的稀疏监督)与算力不对称(一份历史对 N 个候选),用双门控注意力+RoPE/多粒度 RoTE+稳定化残差归一化改造编码器块,把排序分解为每用户算一次的重编码器与每候选算一次的轻量 cross decoder(projection-free KV + token-specific 参数化),再用 user-level 与 request-level shared-prefix 把结构不对称兑现为训练 5.8×、服务 20× 的算力复用,使 AUC 沿 16k 长度/深度/宽度三轴在 LLaMA 与 HSTU 饱和之后继续增长,TikTok Shop Ads 一周 20% 流量 A/B 拿到 AUC +1.31%、Advertiser Value +11.93%(p<0.01)并在 50ms P99 内全量上线。
transformer parameter-scaling training-stability inference-serving ad-rec
2026-09-01
生成式 判别式 Tencent
9 │ 9 │ —
TGR TGR: Advancing Industrial Recommendation from Generative-Paradigm Ranking toward Unified Generation and Reasoning
腾讯 PCG 的 TGR 技术报告在「一块一块替换级联、每块都必须从第一天起就是工业级」的纪律下把推荐推向生成式范式:TGR-GenRank 的 CCFormer 用特征域分离有向交叉注意力 + 长序列子空间 token 混合 + 分层卷积序列压缩把排序做成亚二次且在序列长度与容量两轴上可预测 scaling(工业 4B 集 AUC 77.66→77.94 / GAUC 70.86→71.36,约半数 GFLOPs、2.21× 训练吞吐,因目标 token 互不注意而能单次前向打分全候选把峰值 QPS 抬 30%,五场景 A/B、两场景全量,视频场景 CTR +3.57%、广告场景收入 +1.71%);TGR-GenRec 每个生成范式各上线一个模型——BARGE 用 ICA 恢复物品边界、HPR 按路径全局一致性重排、OSQ-VAE 正交双路解码互补救回,在参数/beam/延迟零增长下工业 Hit@5 较 OneRec +10.2~16.9%、线上 CTR +0.60% 且全量后收益反而变大;HiGR 用 PCRQ-VAE 前缀对比 tokenizer(约束只加在前 D−1 层、叶层保身份)+ 粗到细分层 slate 解码器(14:2 层分配)+ ORPO listwise 三目标对齐把整版当生成单位,工业 NDCG@5 +21.2%、>5× 解码加速、P99<50ms、GPU −60%、观看时长 +1.22%;TGR-Reason 则用 LatentRec 的 soft token selection 与逐步推理损失把多步 latent 推理压进 LoRA,使离线 Think 模型以 K=0 普通解码导出 semantic-ID reason token,经 Personal-Memory 条件化的 DRI 与 reason-token 引导的 Group Memory 检索注入生成器,请求路径零推理 rollout,冷启新用户 Hit@1 0.0451→0.2606、线上有效消费率 +1.75% / 新用户曝光转化率 +13.09%。
transformer semantic-id industrial sequence-compression parameter-scaling
2026-09-01
other Google
7 │ 8 │ —
RSLM RSLM: Training-Free Vector Quantization for Approximate Nearest Neighbor Search
RSLM 把免训练旋转量化器与 ANN 系统结构耦合起来:用两趟级联分块 FWHT(O(D)、任意维度免零填充)加固定标准正态 Lloyd-Max 码本(K≤16 以适配 VPSHUFB 寄存器查表),并把 L2 范数校正从残差提升到『IVF 粗近似向量 + 量化残差』的最终重建向量,以一个 2 字节标量取代 ScaNN 需要逐数据集调参的 anisotropic loss;相对量化下 4-bit 在 5 个数据集全部 100% Recall@20@30、2-bit 拿到 99%+ Recall@20@40,端到端 1-bit GloVe 全扫召回 54.0% 胜过 ScaNN AVQ 45.6% 与 Faiss PQ 42.1%。
quantization inference-serving academic
2026-08-31
生成式 Alibaba
8 │ 8 │ —
HF-SID HF-SID: High-Fidelity Semantic IDs for Generative Retrieval in Location-Based Services
高德 AMap 把 LBS 生成式检索里 SID 的失效点从“码本设计”重新定位到“量化之前的嵌入保真度”:3D 笛卡尔坐标变换 + 进位连续的极坐标标量表示 + 冻结数值编码器 + 逐类型 Type Embedding,经两阶段 Geo-CPT/Num-CPT 内化进 LLM,并只在最后一层残差上做结构对比学习;量化算法与 3-token SID 长度一字未改,AMap-L 上 SID 内平均地理距离降 95.9%、Hit@200 +26.77 点,线上 A/B PV_CVR +6.74%、UV_CVR +6.03%,同时释出 AMap-S 公开数据集。
semantic-id quantization pretrained-lm contrastive-ssl search-ranking
2026-08-31
生成式 Snapchat
8 │ 7 │ —
SetMIR SetMIR: Multi-Interest Retrieval as Set Prediction
SetMIR 把工业多兴趣召回重写成集合预测:transformer 编码用户历史后由 K 个可学习 query 解码出一组(兴趣向量, presence 分数),训练时用匈牙利匹配把高意图目标一对一指派给 query、未匹配 query 收到显式缺席监督,从而在训练目标层面消除兴趣坍缩;服务时用 presence 门控 + query 级余弦 NMS 把固定 K 路 ANN 变成动态 K̃ 路,在 Snap DPA 上全指标超过 MIND/ComiRec-SA/DCM/KuaiFormer 四个多兴趣基线且 ANN 调用少 33%,上线为新召回源后整体 CVR +3.11%。
transformer contrastive-ssl ad-rec industrial inference-serving
2026-08-31
生成式 Meituan
8 │ 6 │ —
CHAP Preference Shapes Relevance: Cross-component Hierarchical Semantic Alignment for Personalized Generative Retrieval
CHAP(美团+中科大)针对生成式检索 SID 仅由 item 内容训练导致的 query-item 语义鸿沟,在冻结的 RQ-VAE 码本上用「输入-目标对调的重建/承诺损失 + 逐层累积量化对比 + 软码字 KL 蒸馏」把 query 编码器拉进 item 量化流形,再以稀疏 SID 与稠密向量双视图交错建模用户行为,并用单趟 Residual Cascading Generation 把 L 步重型解码压成一趟(QPS 2.0-2.4x),四数据集 SOTA 且本地生活线上 A/B 取得 UV-CTR +0.77%/UV-CXR +2.09%/支付单量 +2.98%;但标题主张的「偏好塑造相关性」因果方向并未被消融支撑——偏好信号从未进入对齐目标,分段消融四段全部次可加。
search-ranking semantic-id contrastive-ssl knowledge-distillation inference-serving
2026-08-31
LLM Alibaba
9 │ 9 │ —
Qwen3.8-Flash-Next On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
Qwen 团队把 125B-A6B 旗舰 MoE 的每个候选架构改动都放在「loss+下游 / 训练与推理成本 / 最优超参与稳定性」三轴上联合评估,落地为 GDN 与全注意力 3:1 逐层混合、微块粒度压缩索引器的稀疏注意力 QSA、四分支逐元素门控残差 GR、以及卸载到主存的单层 n-gram 嵌入表,用约 1/9 训练 FLOPs 在 14 个基准上 8 项超过 397B-A17B 前代。
transformer moe linear-attention sparse-attention training-stability
2026-08-31
other Snapchat
7 │ 8 │ —
Content Exploration Beyond the Feed: Creator Supply and the Shared Corpus
Snap 用四组生产随机实验(8 个月创作者消融、一年多观众消融、两个共同分流实验)证明短视频冷启探索的价值主要走创作者供给通道——相对最小保底,人均发布 +8.55%、至少发布一次的创作者 +7.10%,而观众侧只看到 views +1.74% / view time −2.13% 的混合 direct 权衡;论文进一步证明这不是功效问题而是识别问题:共享语料在任何单侧 A/B 中恒被抵消(与视野和样本量无关),共同分流虽能保留该通道但换手率 ω 把 t 周期实验的可表达份额封在 ωt,曲率信噪比 C≤1 时任何一致覆盖的置信区间返回无穷上端点的概率≥1/2−α,因此三周探针如预测般无法给语料渐近效应定号。
cold-start industrial
2026-08-29
判别式 Kuaishou
8 │ 6 │ —
HubMixer HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation
HubMixer 用一小组可学习 latent hub 把异构特征 token 的全对全混合折成 induction–interaction–readout 三段式(hub 跨注意力归纳 token、hub 空间自注意力做高阶交互、每个 token 条件读出并以 LayerScale 残差写回以保住 field 身份),在快手招聘 10 亿样本上四目标 AUC 全胜且参数更少(142.4M vs 155.1M),线上简历投递 CVR +5.48% 已全量部署;但其消融暴露收益实际来自 hub 空间重新引入的完整自注意力而非 hub 组织范式本身。
feature-interaction transformer multi-task industrial
2026-08-28
生成式 Alibaba
7 │ 7 │ —
PailitaoGR PailitaoGR: Latent Think-with-Images for Generative Image Retrieval
阿里拍立淘把「看图思考」内化进生成式图像检索:用只看裁剪图的 Crop Teacher 和额外吃 OCR 的 OCR Teacher 作特权输入教师,通过 on-policy JSD 蒸馏 + ROT/熵注意力引导让只吃整图的学生实现「不裁剪的放大」,再用效用×可及性双门控的增量对比蒸馏只迁移 OCR 教师相对 Crop 教师的可用增量,实现「不 OCR 的读字」,推理时教师全部移除,线上图搜日志上比同骨干 SFT 基线平均高 13.8 个百分点并反超两位教师。
semantic-id knowledge-distillation contrastive-ssl pretrained-lm search-ranking
2026-08-27
判别式 VK
8 │ 8 │ —
VK-GNN Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling
AI VK 在 194M 用户 / 28B 边的生产社交好友图上给出 GNN 排序系统的完整落地配方:把 multi-hash ID embedding 提升为 GNN 的一等输入层(k=3 个哈希索引 B=2^21 共享表,把 202.88GB 的完整 |V|×d 表压到 2GB、<1%,ROC-AUC 反而 0.6246→0.6278,作者归因于有界共享带来的隐式正则),并用按时间戳排序的 CSR + lower_bound 二分把时序邻居采样从 O(deg(v)+K) 降到 O(log deg(v)+K)(每 batch 1473ms→595ms,≈2.5×,且与朴素扫描产出同分布、ROC-AUC 均为 0.6278);编码器是 2 层 GATv2 加 query/candidate 双头内积,225GB CSR 常驻单台 8×A100 主机、63h 收敛、6.57h 刷新全量 194M 用户 embedding,离线 ROC-AUC 0.6278 对比上一代生产系统 WalkGNN 0.5572(+12.7%),两周生产流量 A/B 好友添加 +16.0%、独立添加用户 +11.5%、feed 停留 +0.28%(均 p<0.01)且 ranker p50/p90/p99 无回退,框架已开源。
graph industrial inference-serving
2026-08-27
判别式 Alibaba
8 │ 8 │ —
TransRetrieval TransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial Recommendation
阿里淘天在展示广告召回侧提出 TransRetrieval:用加权平均聚合修复异构字段导致的 token 范数发散(用户侧最高 10× 目标侧)、把目标侧全部特征压成 1 个 token 省 85% 每候选 FLOPs 并将算力回投到更深更宽骨干、再以位置式 domain embedding 无条件共享参数统一 4 个业务域,在 400 亿交互工业数据集与公开 KuaiRand 上得到 R²=0.82/0.88 的对数线性 scaling(32D1L→128D5L,Recall@2000 +19.3/+22.2 pt),一个月 5% 生产流量线上 A/B 平台收入 +2.53%(95% CI [2.22,2.70],p<0.0001)、RPM +1.28%,P99<40ms 与生产基线持平。
transformer parameter-scaling feature-interaction cross-domain ad-rec
2026-08-26
生成式 判别式 Meta
9 │ 9 │ 9
AMBER An Event is Worth One Token: Event Tokenization for Industrial-scale LLM Recommendation
Meta 提出 AMBER,用一个共享的双向 Transformer Event Tokenizer 通过角色掩码把每个交互事件的数百个异构特征(user/item/context/outcome)压成 1-2 个连续 Event Token,与预训练 1B Llama User LLM 端到端联合训练;serving 时 tokenizer 按事件异步触发、token 缓存进特征库,从而把新提出的 scaling 维度 snapshot resolution 与实时服务算力解耦,并证明在总(训练+服务)算力口径下事件侧 scaling 比 User LLM scaling 更划算。
industrial transformer pretrained-lm parameter-scaling feature-interaction
2026-08-26
判别式 Intuit
7 │ 7 │ —
From Gradient-Boosted Trees to Deep Recommenders: Practical Lessons from Migrating a Production Customer Support Recommender
Intuit 复盘了把一套支撑约 3.6 亿美元营收组合的线上客服会话推荐系统从 CatBoost 多分类迁移到 pairwise-binary 深度推荐器的全过程:在'线上质量不得回退'的硬约束下,用固定 16709 正例 contact 群体、对齐已部署 CatBoost 基线(CL 0.4985 / ER 0.5310 / GZ 0.5676)的 micro-F1 评估器逐步验证——显式/隐式×硬/软的负样本分类学与 K 扫描(发现 PR-AUC 改善不传导到 contact 级指标)、50:50 批次组成与 InfoNCE 对比损失被证明可加而非冗余(CL 0.4981 / ER 0.5510 / GZ 0.5354)、36 配置 double-descent 网格显示 72× 更小的 17.2M 模型加 15% 标签噪声注入是唯一打败 CatBoost CL 的配置(0.5003)而单纯训 200 epoch 无恢复(空结果),最终 nomic-embed 逐 utterance 嵌入上的 attention pooling 成为首个直接超越 CatBoost 的方案(ER 0.5630 / GZ 0.5943,CL 仅差 1.2pp),two-tower 侧则用零初始化残差修正路径加 DIN 式候选条件 target attention 拿到最佳 GZ 0.6195;服务侧实测文本特征化是两系统最贵的一步,正确攒批带来 19×/34× 吞吐(17→323/575 req/s)但仍远不及 CatBoost 的 9954 req/s,INT8 量化仅 +11% 吞吐且 ER/PR-AUC 掉约 2 点故不采纳;论文自我定位为生产迁移案例研究而非 benchmark 结果,且新模型尚无线上 A/B。
feature-interaction contrastive-ssl transformer negative-feedback inference-serving
2026-08-25
生成式 Kuaishou
7 │ 7 │ —
PRQ-KMeans PRQ-KMeans: Projection Residual Quantization for Semantic ID Tokenization
PRQ-KMeans 把分层 SID 构造重新表述为「渐进共性剥离」,指出全码字相减会在所选质心方向留下实例特定的 residual carryover(工业 L1/L2 实测 9.89%/10.17%,显著高于 128 维各向同性基线 7.07%)让下一层码本重复表示已表达的变化,并利用 post-hoc 设定不受加性重构约束这一自由度,用「与所选质心正交的最小改动投影残差」替代相减,配合全局均值分量剥离与 Top-k 余弦软质心精炼,在快手 KuaiSearch 工业搜索上把 L2 前缀利用率从 47.88% 提到 57.78%、Order HitRate/MRR 较 RQ-KMeans 提升 7.4%/11.8%,并在四个公开 benchmark 上全面最优。
semantic-id quantization search-ranking industrial
2026-08-25
LLM Ant Group
8 │ 8 │ —
Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining
揭示并系统验证 ELR collapse:LLM 预训练中学习率与参数范数主要通过比值 ELR=η/‖W‖_F 支配 loss 动力学——跨 4 类架构/3 数据集/3 优化器/100M-1B 的 26 组对照中,ELR 逐步匹配即让整条 loss 轨迹以中位 2.5×10⁻³ 重合(比换种子的 1.11-1.62×10⁻² 抖动小 4.3-9.0 倍);坍缩精度由 QK-Norm、可学习 RMSNorm gain 与 LR-范数变化时间尺度决定(固定 gain 让参数化更尺度不变却使误差涨 3.5 倍,证否静态对称性解释);只调 LR 匹配 ELR 即可复现 weight decay(4.8×10⁻³)与 Hyperball(1.2×10⁻³)的目标 loss 轨迹;把 functional scaling law 的 LR 换成 ELR 后,仅用非 Hyperball 数据拟合的律可零重拟合外推到 Hyperball(RMSE 0.2508→0.0212,11.83×),并解释了 norm control 的 delayed acceleration 是「收益早获得、晚显现」,进而通过后期加快范数增长重塑 ELR 日程拿到比 weight decay 基线更低的最终 loss。
parameter-scaling training-stability transformer moe academic
2026-08-25
判别式 Alibaba
8 │ 7 │ —
NMRL Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios
阿里淘宝展示广告先证伪了「端到端联训多模态编码器与 CTR 模型(E2EM)能在强预训练编码器之上继续涨点」这一业界直觉——GAUC 全程为负、9 组优化器/学习率无一例外低于冻结基线、梯度一致性从 SCL 的 0.144/0.849 崩到 0.016/0.006、序列侧联训显存 25.09×——归因为「点击只有部分可归因多模态语义(MM-Mean/Max GAUC 仅 0.541/0.536),原始 CTR 标签是含糊监督,而全共享参数的多模态编码器会被噪声梯度跨 item 传染(ID 特征因参数解耦而免疫)」,进而提出 Mine-Then-Train:先用 TaskRes 式残差标注模型(冻结 SCL 编码器 + RK-Means SID + 零初始化 3×8192 SID Decode Codebook,端到端接 CTR loss)学到与 ID 特征正交的点击偏好,再按「SCL 相似度差 < 0.05 且标注分差 > 0.15」双阈值从 CTR 日志挖出 3000 万条三元组(人工评测证实高置信组胜率 85% vs 低置信组 42%),最后用 triplet margin loss + SCL loss 防遗忘正则微调编码器,离线 GAUC/AUC 相对含 SCL 的强基线 +0.22%/+0.11%(优于直接接标注模型分数的 +0.13%/+0.08%),线上长期 A/B CTR +1.5%、RPM +0.5%,且因只改编码器可直接复用 SCL 已有部署管线。
ad-rec industrial contrastive-ssl semantic-id knowledge-distillation
2026-08-25
生成式 Tencent
8 │ 8 │ —
Tlow Tlow: Flow-based Item Tokenizer for Recommendation
Tlow 用 Glow 式可逆流(ActNorm + Invertible Linear + Affine Coupling,4 block × 4 step)把物品语义嵌入变换到标准正态潜空间,一次拿到维度独立与分布简单两个性质,使最朴素的 PQ + K-means 独立量化就能产出语义清晰、可并行解码的 token ID,并用码本空间与 token embedding 空间的余弦相似度矩阵 MSE 对齐作码本引导;四个 Amazon 数据集 16 个指标全 SOTA,跨域/多模态/冷启动分组均有效,微信图片推荐线上 A/B 全局 UCTR +10.32%、新发布图片 UCTR +11.64%,部署只需 4096 个 token embedding 替代数千万物品 embedding。
semantic-id normalizing-flow quantization cold-start cross-domain
2026-08-25
生成式 Kuaishou
8 │ 8 │ —
TAGR TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising
TAGR 把直播广告的"投放目标本身在分钟级漂移"识别为生成式推荐失效的共同根因,并沿 token/意图/对齐三层做时序自适应:LSID 保持层次化码本词表固定、仅按当前直播场景与带货商品每分钟重算并重分配 token(末层用主播 ID 哈希,Cpr 1.42→1.01、碰撞率 0.42→0.02,level-1 稳定性仍 ≥90%),IAG 用 stride {1,2,10} 的多尺度进房主序列加分通道辅助行为构造请求时意图,并以"post-request 反馈深度 × 用户价值 × eCPM 分位"加权 NTP,IOPO 则每 200 步做一小段当前策略 GRPO(行为对齐的 token 余弦 reward + 价值对齐的 RM reward)、其间穿插 NTP 维护步以保住已学行为分布;在快手 4 亿日活直播广告平台部署为生成式召回通道,进房率 +8.5%、加购点击率 +7.4%、收入 +16.1%,冷启动直播流 +18.4%、低价值用户 +28.8%,腰部主播召回占比 87.1% 对比判别式通道的 76.5%/54.8%。
semantic-id rl contrastive-ssl transformer ad-rec
2026-08-25
判别式 Alibaba
7 │ 6 │ —
CRRN Cascading Relevance-driven Recommendation Network for CTR Prediction in Trigger-Introduced Recommendation
CRRN 指出 TIR(触发式推荐)谱系此前只解决“trigger 意图强度”而忽略了“trigger 相关性”本身,用 coaction 门控的显式-隐式混合交互层、级联注意力配合“意图分数×余弦相似度”的 AND 型软门控、以及把“点击且相关>点击不相关>曝光相关>曝光不相关”写进损失的类目辅助 pairwise loss 三件套,在 Tmall 4.5 亿样本与 Alimama 公开数据上分别取得 0.6752/0.6448 AUC,并已全量上线带来 +3.87% CTR 与同类目推荐占比 40.51%→67.45% 的结构性位移。
feature-interaction transformer process-supervision industrial
2026-08-24
判别式 生成式 Meituan
7 │ 6 │ —
SA-RSQ SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems
SA-RSQ 把工业多模态特征压缩的病灶归因为「存储占用与表征维度强耦合」+「硬赋值不可微」,用残差级联里的 Top-K 掩码 softmax 稀疏路由替换 arg min,只落盘 4LK 字节的 (Index, Prob) 元组从而让每 item 存储与码本维度/大小彻底解耦、固定支撑集下全链路免 STE 可导,配以课程稀疏退火、正交码本正则与互信息正则三件套防坍塌,在美团外卖广告 8/32/48 字节预算下均优于 RQ-VAE/R-Kmeans/R3-VAE/VQ-VAE/SoftVQ-VAE(48 字节 AUC 64.913、gAUC 63.013、重建损失 0.1553),并给出 Next-Distribution Prediction 生成式雏形与一周 10% 流量线上 A/B(CTR +2.51%、CPM +3.66%)。
semantic-id quantization contrastive-ssl industrial ad-rec
2026-08-24
生成式 Spotify
7 │ 7 │ —
The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness
Spotify 用共享 Qwen3-1.7B 骨干、同一份 SIDReasoner teacher 轨迹在三个 Amazon 域上做 item 表示(SID vs Title) x 显式推理(有 vs 无)的 2x2 受控实验,发现加显式推理在所有设定下 reasoning delta 非负即零(Title 在 Games/Office 显著退化 -20%/-11% R@10,SID 退化反而更小且不显著),复现 SIDReasoner 八任务对齐(SID-A)把轨迹质量推到最高 3.51 却把 R@10 打到最差(.0519/.1239/.1134),而纯前缀匹配 GRPO 因 70-96% 的 prompt 全组零奖励零优势而无法恢复(Games/Title 上推理坍缩到平均 1.1 词的空 <think>);换成 0.5*R_acc+0.25*R_trace+0.25*R_rel 的复合 LLM-judge 奖励后 SID 在 Office/Industrial 反超无推理基线 +3.2%/+2.9% 而轨迹质量纹丝不动(2.22→2.23),且零 LLM 调用的 E5 embedding 稠密奖励几乎追平 judge,证明 reward density 而非 trace 语义才是操作变量;结论在 Spotify O(10^6) 歌单 / O(10^8) 曲库的生产级多任务共享骨干(目录对齐持续预训练 + 全参 SFT)上复现(HR@30 0.6337 vs 0.6343,rank aggregation 融合两路才拿到 0.6515),说明描述性推理轨迹质量、LLM 判定的推荐相关性与传统离线效果刻画的是推荐系统的三种不同属性。
semantic-id pretrained-lm rl knowledge-distillation process-supervision
2026-08-24
生成式 SK Telecom
8 │ 8 │ —
DuELRec A Dual-Expert Strategy Integrating LLMs to Mitigate Negative Transfer in Cross-Domain Sequential Recommendation
DuELRec 指出 LLMRec 在跨域序列推荐中负迁移比 IDRec 更严重的根因是 token 级自回归压过 item 级协同信号,于是在冻结 LLM 骨干之上用块级 item 因果掩码派生单域/跨域双专家并以 item 级门控(附偏差-方差最优解)自适应融合,配合单域+跨域双池负采样的 token-to-item 对比学习,在十个域超过 26 个 baseline,并在 SK Telecom 个人助手 App 线上 A/B 把 CTR 从 0.90% 提到 1.33%。
cross-domain moe pretrained-lm contrastive-ssl cold-start
2026-08-24
判别式 DoorDash
7 │ 7 │ —
One Hierarchy, Two Systems: Semantic Product IDs for Discovery-Surface Ranking and Search-Page Query Reformulation
DoorDash 把一次性从商品内容(gemini-embedding-001 + RQ-KMeans,L=3、K=512)学出的三层 Semantic ID 层次当作介于 merchant-scoped listing ID 与专家 taxonomy 之间的共享概念单元,在两个不共享参数/目标/serving 架构的生产系统里各自复用:排序侧用 L1–L3 前缀作为消费者与 submarket 行为统计的聚合键、并用 SentencePiece BPE 子词做 item/consumer 共享 embedding 的序列特征(FC vs 只删 SID 特征的 FC-A:MRR@5 +6.98% vs +2.10%、NDCG@5 +6.76% vs +2.92%),21 天线上 A/B 使 carousel 加购率 +5.5%、首位加购率 +8%、subtotal +0.31%,同时首位商品历史平均热度下降 18.1%、blockbuster 首位曝光份额下降 2.1pp;查询改写侧按业务垂类把 query 经关联 ATC 事件接地到 dominant L2(否则回退 L1、再否则保留原始 query 节点),在概念之间用 NPMI 建转移图,并加一条 L2→L3 下降路径补回被自环丢弃的同父细化,LLM 只负责把内部 SID 渲染成消费者可读 query,最后按商家在售品类过滤,意图坍缩率从 taxonomy 的 18.8% 降到 10.9%、rank-one 判定质量从字符串图的 0.522 升到 0.734,线上 purchase MRR +0.558%、ATC 位置 −1.571%、搜索滚动深度 −1.866%(95% CI 均不跨零)。
semantic-id quantization search-ranking cross-domain industrial
2026-08-21
生成式 Kuaishou
8 │ 7 │ —
Dynamic PV-S2 From a Static Multi-Level Small Semantic Codebook to a Dynamic Single-Level Large Semantic Codebook for Generative Recommendation
快手把线上三级 SID(两级语义残差 + 一级协同消歧)中条件利用率仅 2.48% 的第二级语义码砍掉,改用单层大语义码本 [1024,512] 加一个跨码本版本恒定的确定性哈希消歧码,把自回归解码从 3 步降到 2 步;再用对数压缩的曝光加权 k-means、EMA 中心更新与曝光加权换码惩罚做按天动态更新,并配套重构/利用率/簇负载/碰撞/时间稳定性五维码本级离线评测框架;公开集上 OneRec-V1/V2 的 Recall@10 提升 5.0%–8.8%,工业七日重构相似度由衰减转为回升(相对静态 PV-S2 +1.50%,仅改动 0.4288% 物品的 SID1),解码 FLOPs 降 47.93%–48.70%、单卡 QPS 升 28.57%–47.0%,5 天 2.5% 流量线上 A/B 主消费指标 +0.792%。
semantic-id quantization inference-serving industrial
2026-08-21
生成式 Alibaba
7 │ 7 │ —
SSR-GRPO SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce
SSR-GRPO 把 RQ-VAE 生成的层级 Semantic ID 同时用作 GRPO 的稀疏相关性裁判(与稠密嵌入内积双视角融合,替代同源训练因而有偏且昂贵的 42B TaoSR1 奖励模型)和难负样本挖掘器(共享前两级、第三级不同),挖出的难负样本一物两用——既当质量基准 mask 掉组内 reward 更低的易负样本,又构造 Retrieval-DPO 的 pair-wise 监督,两条 loss 以不确定性动态加权联合优化,在天猫 3 亿日志上把 HR@4k 从 R-GRPO 的 0.8158 推到 0.8218,TmallAPP 两周线上 A/B 取得 GMV +1.40%、UCTCVR +0.99%。
rl semantic-id contrastive-ssl pretrained-lm search-ranking
2026-08-20
LLM Kakao
8 │ 7 │ —
Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
把超大规模 MoE 的最优学习率搜索从「模型规模 × token 预算」二维网格降到一维:用适配 MLA + Muon 的 μP(expert FC2 记为 vector-like、MLA 低秩投影维固定使其上投影 LR 缩放退化为 1)让最优 LR 在宽度与稀疏度耦合扩张(16→128 专家、激活专家数固定)时零样本迁移,再用「stable 阶段终止 + EMA 合并权重」从单次 proxy run 抽出几十个 token 预算点、对 log LR 拟合抛物线取顶点、在 log-log 空间线性回归(R²=0.95)外推出 10T token 的最优 LR 3.85×10⁻⁴,并由 Kakao 用它从零预训练 155B 总参/17B 激活基座模型、10T token 全程无 loss spike 完成验证,定 LR 的成本仅为全量训练的约 1%(98× 算力比)。
moe parameter-scaling training-stability pretrained-lm industrial
2026-08-20
判别式 Xiaohongshu
8 │ 7 │ —
GateDiffInt GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling
GateDiffInt 把 CVR 行为序列中噪声与意图的互相劣化命名为 Noise-Intent Coupling(拆成噪声诱导意图扭曲 NID 与意图无关去噪失败 IDF 两个可测子现象),用行为可靠性差异化掩码驱动的可控前向扩散加双门控融合做序列去噪、并把去噪器的位置重要性门 g_i 反哺给 LLM teacher 作提示,再由冻结 Gemini teacher 蒸馏出长期/短期/潜在/转化四类结构化意图、经 2D 注意力掩码与 per-intent LoRA 路由压进冻结 Qwen3-1.7B 学生,最后两阶段(先分别预训练,再冻结主干仅用 LoRA 联合微调 + teacher-anchoring 正则)让去噪与意图抽取朝转化目标共同对齐;在 Taobao/Amazon-Electronics/生产数据集上全指标超过 DIN/DIEN/DSIN/BST/DMIN/HSTU(生产集相对 HSTU AUC +3.00%),小红书首页信息流 14 天 A/B GMV +1.13%、场景累计 +5.13% 并已服务主流量。
diffusion knowledge-distillation pretrained-lm contrastive-ssl industrial
2026-08-19
生成式 Meituan
7 │ 7 │ —
TTP Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval
TTP(美团 + 中科大)把电商个性化稠密检索的瓶颈定位为『改写器按语言建模目标训练、与检索效用脱节』,用单个 LLM 在一次前向里输出 <think>意图增强 query</think><embed>、以 <embed> 的 hidden state 直接作为 ANN 检索向量,Stage 1 用 NTP+InfoNCE 联合损失冷启动、Stage 2 用 GRPO 对齐,其中把冻结的 SFT 副本同时当作 KL reference 与检索 reward model(ΔS_pos + ΔS_margin),并用 Dynamic Positive Selection 只让检索增益为正的最佳 rollout 进入对比学习;在自建 General/Broad/LongTail 上 R@20 达 47.52/48.74/38.65,比同数据同监督的脱节 pipeline Decoupled-Stage 高 1.63~3.47 个点,公开的 Amazon-PersonalWAB 与 KuaiSearch 上同样最优,线上以『离线缓存 10.59% QV + 305M 蒸馏双编码器』的混合架构接入并行召回通道,7 天 A/B 订单量 +0.46%、端到端延迟仅 +0.15ms。
search-ranking pretrained-lm rl contrastive-ssl knowledge-distillation
2026-08-19
判别式 Xiaohongshu
8 │ 7 │ —
OneModel OneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking
小红书 OneModel 把自然推荐/广告/商家三条业务流的异构行为经场景私有线性投影 + 场景/动作/Δt/位置上下文注入统一成共享 event-token 序列,过一个 GenRank 式 action-oriented 因果 Transformer(候选掩码阻断同请求候选间注意力、ALiBi 相对时序偏置),在 FFN 内插入仅由场景 ID 嵌入决定的 sigmoid 逐通道门控 SAIM 以单张共享计算图换取流特化,配 α 衰减/β 增长的自监督-任务两阶段调度、λ_k 反比于验证 AUC、交叉流批采样与早期梯度隔离(单项 +1.6‰);统一训练让低资源的 Ads/Merchant 各 +3.0‰ 而主流量 Rec 仅 -0.1‰,掩掉 Rec 子序列使 Ads AUC 掉 0.36pp 坐实跨流迁移,服务侧用户状态增量缓存 + 特征分解/预取/共享用户塔/图级优化让稠密参数 173M→230M 的同时延迟 270ms→90ms,线上三场景全正向(Engagement +1.25% / ADVV +3.43% + CTR +8.18% / GPM +2.1585%)。
transformer multi-task cross-domain ad-rec inference-serving
2026-08-19
生成式 Kuaishou
8 │ 7 │ —
OGR Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs
快手 OGR 把 slate 推荐做成端到端生成「一次生成即有序」:TUSID 以 MLLM 语义为骨干、用交叉注意力门控残差融合品牌/类目/B-tags/C-tags 高层属性,再用共享签名 CountSketch 编码距离加权局部共现得到协同嵌入、按 distinct-user 支持度做置信度加权保范数拼接后由 RQ-KMeans 量化成 4 级 SID;GL2P 用 list-wise 偏好规划器逐展位自回归产出连续偏好向量并与位置级 SID 解码重叠,把串行深度从 O(KD) 压到 O(K+D)(实测吞吐 2.43×/2.49× 于 TIGER-Beam/OneRec-Beam);SPA 再用主/辅奖励符号一致性门控校准加 clip+KL+监督回放的保守策略优化做 slate 级对齐,KuaiRec NDCG@5 达 0.1303(较最强 baseline PRM +27.2%)、工业集 +48.2%,快手线上有效播放 +1.120%、评论 +2.954%。
semantic-id rl transformer industrial inference-serving
2026-08-18
判别式 Meta
7 │ 7 │ —
UniDot UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation
UniDot(Meta 团队,TAAC × KDD Cup 2026 工业赛道亚军方案)从因子分解机视角主张嵌入内积与注意力的 query·key 打分是同一原语,因而在信号跨越 user–item 与 candidate–history 边界处刻意把点积保持为显式运算、只用深层机器精炼其操作数:非序列多字段特征与四个行为域被 token 化进同一 d 维空间,单一可堆叠宏块内并行跑 token-mixing 总线(默认 Wukong 的 LCB+FMB)与序列检索总线(T_ih 个物品 token 交叉注意各域序列视图),两者每层通过零初始化门控的 MLP-Mixer(FuseFFN)交换残差增量,而 FM Highway 把逐层的逐序列点积、融合域点积、聚合 Gram 与跨总线 user–item 点积跨层拼接后绕过融合器直送分类器;序列侧每次前向只编码一次并被所有消费者共享以约束推理时延,配合 Adagrad+Muon 稀疏/稠密双优化器、覆盖约 8 倍于正样本行的转化延迟辅助头、每 epoch embedding 冷重启与共享 embedding 上的多路互学习,取得最终榜 AUC 0.83217(单路径 0.83184 亦足以排名第二)。自家消融显示 FM Highway 是贡献最大的单一组件(−0.127%),但作为头号卖点的 FuseFFN 被移除后 AUC 反而上升 0.022%,且全文无线上部署、无公开 benchmark、无架构级等配对比。
feature-interaction transformer knowledge-distillation multi-task ad-rec
2026-08-17
other Google
8 │ 8 │ —
SDF Decomposing Staleness in Recommender Systems: A Dual-Filter Framework for Supersession and Decay
SDF(Google Discover)把推荐系统的「陈旧性」拆成机制不同的两维——取代(关系性信号,必须成对比较)与相关性衰减(内在信号,系于物品寿命)——各配一个学习模型:关系型过滤器用 PaLM 2-L 教师合成 110 万标注对(聚类去冗余 + 相似度带加权采样、7 样本两阶段先类别后 rationale 投票)蒸馏出 T5-11B student,CoT 式 rationale 监督叠加 NLI 辅助训练取得离线 F1 84.79 与 550 对人工黄金集 83.5% 精确率/95% 召回率;内在型 PTR 以搜索点击日志(而非被出版方推广偏置的页面浏览日志)导出的终身流量为标签,用 early-fusion 多模态多任务网络回归物品在 7 个视界上累积的 30 天流量份额(early fusion 80% vs late fusion 76%,评分一致性收紧时精确率 88.04%→97.22%)。两者均非个性化且在用户请求路径外计算、服务时退化为查表,OR 融合后在排序阶段上游剪枝候选:互动中性约束下取得 −6.91% prevalence delta(年龄阈值 + engagement cliff 基线仅 −0.10% 且置信区间覆盖 0),两个月联合 holdback 下 dismissal rate −0.16%/feed 多样性 +0.13%/正向互动 +0.26%,服务 CPU/TPU 节省 8.74%,两年部署使用户陈旧举报下降 54.9%(取代 −64.0%、衰减 −34.4%)。
industrial inference-serving knowledge-distillation pretrained-lm multi-task
2026-08-16
生成式 PayPal
7 │ 6 │ —
SAGA SAGA: Structure-Attended Generative Action Embedding Model that encodes Multi-Surface User Action Sequences
SAGA 是 PayPal 的多触点用户行为嵌入模型:把结账/P2P/App/推送/邮件/账户操作统一成六属性事件 schema,按 round-robin 把每个事件展开成 K=7 个字段级 token 做自回归建模(每字段独立词表与独立 LM 头、词表外 logits 掩负无穷实现约束解码),再叠加只在事件边界触发的 stop-gradient 组合式目标 InfoNCE 对比头;冻结末层隐状态作为通用用户嵌入喂给 DCN-v2+ESMM 下游 ranker,在等 token 预算下用 7 倍更少的事件匹配或超过 PinFM 式融合(K=1)与 HSTU 式交错(K=2)tokenization,线上 A/B 在 TP-B 取得 +12.75% 业务指标提升。
transformer contrastive-ssl cross-domain industrial
2026-08-15
判别式 Kuaishou
7 │ 7 │ —
DrEM DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation
DrEM 指出工业短视频融合排序中上游 pxtr 的双重角色会让预测噪声双侧传播(监督侧翻转代理偏序、特征侧抖动排序分),用 logit 空间可加高斯噪声模型统一两侧:分桶 probit 反解 item 级噪声方差、由此算出 pair 级偏序翻转概率做风险去噪稳健 pairwise 损失,并从同一噪声分布采样扰动配合保序过滤做排序一致性正则,在快手数亿 DAU 平台的 EMER/EASQ 双骨干上离线 GAUC 一致提升、7 天 5.1% 流量 A/B 全指标 p<0.005 显著且推理零额外开销。
industrial multi-task training-stability
2026-08-13
other 学术
8 │ 8 │ —
NQF Neural Quadratic Forms: A Unified Minimal Model for Sudden Learning and Scaling Laws
用层内单元的置换对称性作 Landau 式展开,证明任何有宽度概念的模块在近零初始化附近的领头非常数项唯一地是 Tr[WW^T A(x)](神经二次型 NQF),架构差异全部压进结构矩阵 A(x)(并显式算出 MLP/CNN/MoE/多头注意力的 A,其中注意力只有 value 与读出块在二阶出现、query/key 要到四阶);其 SGD 动力学无论宽度多大都闭合在序参量 (M=WW^T, μ) 上且可压缩到 k_V+1 个神经元,在共同本征基下化为广义 Lotka-Volterra 方程并在四个区制下精确可解,各模式按 logistic 曲线逐个点火于 t*_k ~ (1/aζ_k)ln(1/ε),ε→0 是让平台期变尖锐的奇异极限,而当 ζ_k ∝ k^-α2、V_k ∝ k^-α1 时同一动力学叠加出 E(τ)=Θ(τ^-(α1-1)/α2) 的幂律并预测指数,跨优化器(含 Adam)与跨架构数值验证。
parameter-scaling training-stability academic transformer moe
2026-08-13
LLM Meta
8 │ 8 │ —
Small-Scale Experiments: Are We There Yet?
论证「小规模实验 scaling law 不可靠」的混淆因子是超参而非规模——scaling law 一直延伸到 4M 有效参数,只是仅在完全调优前沿显形(每规模 4 个配置时完全不可见,256 个配置才拿到准确的律,测试 MSE 1.30e-2 → 3.70e-6,而参数计数方式与 LR 衰减等方法学细节只是精修);进一步用 noisy quadratic limit 估出超参损失面的内蕴维度 γ 随参数增长掉到 1(数据影响甚微),解释了为什么大模型好调,并把 noisy quadratic limit、scaling law、perplexity-capability 对应三件工具打包成一套「每条强假设都对应一个廉价诊断」的小规模实验方法论,在 pre-norm vs post-norm 这个曾耗费领域三年的问题上以约等于几次 1B run 的开销复原了大规模结论。
parameter-scaling transformer academic
2026-08-12
LLM Amazon
8 │ 8 │ —
Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts
MOSAIC 把稀疏 MoE 的 scaling law 与一个算子级 MFU/显存性能模型耦合成单阶段离散优化:在 104M–2.7B 激活、最高 79B 总参的约 150 次从头训练上拟合含稀疏度 S 与专家切分因子 G 的四维联合定律(G 指数 η≈0.95 是唯一被数据钉住的系数之一),证明纯 model-FLOPs 预算下最优稀疏度只会落在数据支撑上边界、不存在内点解;把预算换成架构相关的「集群可交付 FLOPs」后内点最优才出现(S*≈0.915–0.963、G*=4),并在 32 节点 20 天包络下给出「产出 model FLOPs 最多的配置并非 loss 最低的那个」,最后用四个最高 250B 总参的实跑复现了预测 MFU 排序、以及 loss 排序在 model-FLOPs 轴与峰值等效硬件算力轴之间的翻转。
moe parameter-scaling transformer pretrained-lm training-stability
2026-08-11
LLM 学术
7 │ 7 │ —
SHE Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition
本文区分「检测到昂贵 LLM 观测平均有用」与「学会逐样本何时该获取它」,给出 reward-SNR 可检测性地板 ρ*(N)≈2.8/√N,用匹配矩噪声安慰剂证明地板之下 in-sample oracle 的表面收益是噪声顺序统计量、用正对照排除流水线故障,并以 Structured Hypothesis Embeddings(冻结 LLM 产出 K 条排序、带置信度、有证据引用的意图假设)为载体,在 MIND/REES46/Amazon-Beauty 上显示逐样本获取策略在所有粒度上坍缩,处方是改用设计期 regime gate。
pretrained-lm agent cold-start academic
2026-08-11
判别式 Meta
8 │ 8 │ —
MARCO MARCO: Click-Intent Decomposition for Calibrated Ads Conversion Prediction
MARCO 指出工业广告排序把异质点击压成单一 click 标签会造成被聚合校准掩盖的 per-intent 系统性偏差(CTA 点击转化率约为社交互动的 4 倍),并证明单标量输出在原理上不可能同时对各意图校准;解法是用日志点击类型作免费监督,把 CTR/CVR 的标量头扩成 K 维向量头分别在同质子群上训练与校准,serving 时按预测意图分布组合 Φ=Σλk·μk,配 last-impression/first-click 归因、四流水线一致性不变量与零延迟回退护栏,Meta K=2 部署把分组校准修到约 100%,组合后 post-impression NE +0.223%、每次点击转化 +2.80%、大盘累计 +0.98%。
ad-rec multi-task industrial
2026-08-11
生成式 Yandex
9 │ 9 │ —
SONA Sona Technical Report
SONA 是 Yandex Music 的单模型生成式推荐器,也是 Gryphon → Gryphon-v2 路线的系统级总报告:共享 encoder(8192 事件历史 + History Compression,深度只花在最近 2048 事件)一次编码后同时供 SID decoder 做约束 beam search(3×32k 码本,item 表征来自冻结 Qwen2.5-Omni + 协同精炼)与 item 级 Ranking Module 打分,后者唯一监督是从训练期专用、免特征、吃整年日志的 0.6B Teacher Ranker 蒸馏来的分数,候选同时取自当前 decoder 的 on-policy rollout 与 logged impressions;配 10 分钟权重同步、45 分钟端到端延迟的在线训练闭环,线上 A/B 用单模型整体替换 15+ 召回器 + 粗排 + 精排,活跃用户 +4.53%、总收听时长 +6.30%、点赞 +11.42%,为 Argus 增量的 2.35 倍。
semantic-id knowledge-distillation transformer multi-task sequence-compression
2026-08-11
LLM Alibaba
8 │ 7 │ —
DREAM DREAM Technical Report
DREAM 是淘宝把 agentic 元控制叠加在既有召回-排序-重排级联管线之上的工业架构报告:一个管线模型都不替换,只加一层可感知、可编排、可审计的策略层。感知端是三层 Intent Engine,端云 F1-F4 漏斗用单层 GRU 做变点检测(端上仅放行约 15% 行为、端到端上报量约 8.7%),0.8B Main Agent 同步吐出 insert/update 增量意图与路由决策,约 6.3% 困难请求升级到 4B context subagent/expert 异步精修再经 on-policy 反向 KL 蒸馏回灌,夜间闲置 GPU 上的 Dreaming 用 keep/correct/enrich/merge/add/kill 六种原子操作在全天轨迹上重建完整意图列表。决策端是基于 Qwen3 的 MetaModel,M1 定取向、M2 出受 schema 约束的枚举化策略 bundle、M3 确定性编译成分阶段参数,经 JSON/schema/白名单/范围四道校验门以局部 override 方式作用在原 LTR 分数上(LLM 从不产出 item ID 或最终排列)。频控被形式化为带预算约束的选择性计算,经拉格朗日退化为按用户组/时间桶/场景/日级漂移调整的分数阈值。策略用 production-path replay 离线训练,二元 Evaluator 奖励只问是否胜过默认管线。淘宝首页 A/B 中仅控重排即 IPV +2.06%、GMV +0.88%,扩展到精排后升至 +2.71% 与 +1.31%,而 PV 基本持平。
agent pretrained-lm rl knowledge-distillation inference-serving
2026-08-10
生成式 Alibaba
8 │ 8 │ —
MetaStrategy MetaStrategy: Generative Ranking with Executable LLM Strategies
MetaStrategy 让 LLM 以请求上下文为条件生成一份 schema 受约束的类型化 JSON「可执行排序策略」(目标权重/卡片类型/类目偏好/体验约束/头部 CTR 开关)而非 item 序列,由确定性 validator+compiler 编译成生产参数挂到隔离 Generator,在 GE 架构里与约十个存量 Generator 原子竞争;用不曝光用户的生产链路 replay 产出 selection/rank/lift 三重奖励做 RL,自竞争课程把高频策略模式冻成新竞争者防坍缩(4B Top-1 集中度 76.8%→41.2%),Evaluator 路由的 reward-augmented OPD 把两个 4B Teacher 蒸成 0.8B Student 并反超 Teacher(ΔGE +0.73% vs +0.45%/+0.57%);淘宝首页猜你喜欢 nearline diff 触发部署零 RT 增长,7 天 A/B 赢下 27.93% 的 GE 调用,点击 PV +2.11%、IPV +3.12%、成交额 +2.83%。
pretrained-lm rl knowledge-distillation industrial
2026-08-10
生成式 Alibaba
8 │ 8 │ —
IntHQ IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation
IntHQ 把多任务生成式推荐的病因诊断为 source/relational/hierarchical 三重坍缩,用双流解耦(任务 token 独立成参数不共享的第二条流)、任务交互建模(因果掩码的跨任务自注意力替代预定义漏斗)和分层查询(每个任务按深度注意力自适应选层)分别对治,在高德 IntTravel 的 4 编码器 × 4 多任务头网格上十项指标全优,线上全量部署拿到 UVCTR 相对 +1.60% 且 FLOPs 低于所有 baseline。
multi-task transformer industrial
2026-08-10
LLM Netflix
7 │ 7 │ —
LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing
Netflix 在四个生产主观审核 rubric 上系统检验显式推理与 RLVR 的可迁移性,发现显式推理/高 effort 推理模型普遍低于零样本基线(self-consistency K=8 还会放大差距),标准 GRPO/Dr. GRPO/GSPO 在数学推理强的 Qwen 上反而掉点并触发「推理坍缩」——约 70 步后平均终止长度从 ~300 断崖跌到 ~150 token,策略改为直接猜标签;论文提出以答案正确性为门控、以 L_target 封顶的条件长度奖励(正确才给 λL,且 L<L_target),把 Query Sensitivity 从坍缩后的 0.749 拉到 0.851、最难的 ID: Response Quality 从 0.519 恢复到 0.572 并同时超过带/不带推理两个基线;进一步用 1500 个人格证明判定 macro-F1 在 0.416~0.792 间波动近 0.38,说明大量「校验错误」其实是推理风格错配,据此提出 synthesis → SFT → 强化路由的人格路由中训练蓝图(RLVR 从教「怎么推理」改为教「用哪种推理偏置」)。
rl pretrained-lm training-stability industrial
2026-08-09
LLM Cognizant
7 │ 7 │ —
RotaryQuant RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention
RotaryQuant 用「4-bit dense / 2-bit routed expert / Q8_0 shared expert 的按角色混合精度权重量化 + IsoQuant KV 压缩 + LRU 专家换页」三轴组合把 26B–120B MoE 塞进消费级内存,其中 IsoQuant 以 Walsh–Hadamard 变换复合分块 SO(4) 旋转把旋转代价降到 O(d log d)、每 head 仅存 256 参数(稠密方案为 O(d²) 与 16,384),并用四 kernel Metal 流水线直接在打包 3-bit 数据上算注意力、反旋转只对聚合输出施加一次,从而彻底取消张量物化;Nemotron-H 120B 在 32 GB M4 Max 上峰值 17.2 GB、14.85 tok/s,ΔPPL ≤ +0.0012、32K NIAH 100%。
quantization moe inference-serving industrial
2026-08-08
生成式 Kuaishou
7 │ 6 │ —
PushDualGen PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation
快手 PushDualGen 把生成式推荐里的解释从 SID 之前挪到之后:用 Qwen2.5-Omni-3B 的 8 个可学习压缩 token 得到并行 embedding、逐槽独立 K-means(M=8/K=512)构造并行 SID 以规避残差量化的误差累积,再用 Text2SID/SID2Text 对称任务把 SID 装进冻结原始词表的 Qwen3-0.6B;生成器先输出目标视频 SID、遇 <id2text_sep> 后才继续输出可跳过的 push 文案作为事后解释,Top-20 SID 编码成 e_s 后以 α=β=1 加性融进在线用户向量做 <10ms 的 ANN 检索;在近 10 亿用户、约 100K QPS 的快手 Push 上,1.5 亿用户 14 天 CUPED 校正 A/B 取得有效播放率 +8.50%、不满意率 -37.70%,并把头部曝光让渡 1.8pp 给腰尾内容。
semantic-id pretrained-lm industrial sequence-compression inference-serving
2026-08-08
判别式 ByteDance
8 │ 8 │ —
TM20K Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling
字节电商广告把行为序列推到 20K:教师保留全量 token 一次性训练并缓存 logits,学生用 LITM(同商品 ID 局部合并)+ PATM(按位置分段设压缩因子)+ LPTM(逐层金字塔减半)三种零参数 token merge 把有效长度压到 1.8K,再靠蒸馏找回教师约 85% 的增益,线上 ADSS +1.036% 而延迟仅 +5.6%。
knowledge-distillation transformer industrial ad-rec parameter-scaling
2026-08-07
生成式 Naver
7 │ 6 │ —
LP-FFT-RFT Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training
NAVER WEBTOON 把 LLM 的后训练范式移植到推荐基础模型,拆成 LP→FFT→RFT 三阶段:前两阶段用冻结骨干热身下游头 + 判别式学习率完成稳定适配,第三阶段用「六级漏斗序数回归 + 截断自归一化 IPS 去偏」学出的 reward model 作 GRPO 对齐信号(而非直接当 serving 打分),离线 Rank NDCG 0.437→0.463 且 Funnel NDCG 追平 reward 模型本身,线上相对非 FM 的 CTCVR 生产模型 LastPaid/Imp +13.4%。
rl transformer multi-task industrial
2026-08-07
LLM Meta
8 │ 8 │ —
Skaling: Chinchilla's Exponents Meet Kaplan's Coupling
Skaling 用无参数数值微分证明 Chinchilla 加性律隐含的混合偏导为零被数据否定(实测为负、存在 N-D 协同),据此把内层和式整体抬到一个自由外指数 k 上(L=(A/N^α+B/D^β)^k+E),仅加一个参数就在 4 个标度网格上把插值与外推 MAPE 降低 1.5-3.9 倍,并因耦合形式由边界锚定而支持只扫两条低算力边的 L 形稀疏网格,用约 1/10 的 profiling 算力复原全网格律。
parameter-scaling transformer academic
2026-08-07
生成式 Yandex
8 │ 8 │ —
Gryphon-v2 Gryphon-v2: One Model in Place of a Cascade - Generate-and-Rank Recommender with Rollout Distillation
Gryphon-v2 在 Gryphon 的共享 encoder 架构上,用一个只在训练期存在的高容量 Teacher Ranker(8,000 事件上下文、免特征、ARGUS 式自回归训练)蒸馏出 item 级 Ranking Module,蒸馏候选同时取自当前 decoder 每步同步生成的 on-policy rollout(占去重候选 90%+)与 logged impressions,两者各按候选数归一化的逐任务 MAE 等权相加并与 NTP 联合训练;离线 TeacherRecall@10 从 0.0392(next-item 监督)跃升到 0.5654、WPA 0.5528→0.5892(收回到 Teacher Ranker 54% 的 gap)且 R@1000 不降,线上单模型替掉 15+ 召回器 + 粗排 + 精排后活跃用户 +1.41%、时延与级联持平、吞吐约 4×。
semantic-id knowledge-distillation transformer multi-task industrial
2026-08-06
判别式 Amazon
7 │ 6 │ —
FSM-MMoE-VST Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting
Twitch 把直播多目标排序按信号性质拆成两路——处理稠密即时目标(SMP)的 Fresh Signal Model 与用 14 天延迟窗口把 chat/follow/spend 稀疏正标签放大约 12 倍的 Delayed Signal Model(最终与 LMP 一起并入 4 专家 MMoE)——再在推理时按 Early/Dedicated 观众分层施加零参数的条件标量化权重(VST),替代无效的训练时样本加权;离线证明 MMoE/Shared-Bottom/CGC 三种骨干配上独立 FSM 后表现几乎相同(LMP NDCG@6 0.2462-0.2463)而任一单一统一 MTL 模型都把 LMP 打垮 4.2%-4.6%,说明「新鲜/延迟信号分离」而非骨干选型才是主导增益来源;三次 14 天线上 A/B 累计 DAV +0.09%、高活观众 capped ARPU +0.56%、低活观众 DAV +0.15%、关注 +0.27%,MMoE 整合把延迟目标建模参数从 2670 万降到约 1550 万(-41.9%),p99 排序延迟 <110ms,并在移动 live feed 上泛化取得 +1.12% 正向交互。
multi-task moe industrial
2026-08-05
生成式 JD
7 │ 7 │ —
DEGR DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging
DEGR 指出重排受上游固定供给约束、只优化即时价值在低质供给下必然触顶,并用京东 15 等频分组数据证明 Max-pCTR 与「下一请求点击率」基本解耦,据此训练一个以上游 Max-pCTR 为动态权重的探索型奖励模型(item 级即时奖励 MMoE + 序列级探索奖励 MLP,未来行为分 A~E 五档、对「未点击但滚动且后续有点击」按 4-3log2(1+Max-pCTR) 提权、低供给时掩掉无效探索负样本),冻结后以监督学习 + 组内正则多样性约束 + 自适应奖励加权 ORPO(把成对偏好扩成分位点偏好列表、用 softmax(R/t) 作软权重)三项混合损失驱动 encoder-decoder 生成器,配合 group beam search 与启发式采样扩大探索空间、多解码头 cohort 把解码复杂度从 O(M) 降到 O(M/K);线上只部署生成器单次贪心解码,京东首页 7 天 A/B 取得 UCTR +1.22%、PV +0.20%,TP99 仅 +3.2ms。
industrial transformer rl
2026-08-05
生成式 判别式 Kuaishou
9 │ 8 │ —
UniGD UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval
UniGD 把自回归 SID 生成与显式 query-广告相关性打分统一进同一个 decoder-only 骨干,用 CAGE(余弦冲突检测 + 正交投影 + 生成优先自适应加权)协调两目标梯度、用 CAM(把 SID 索引到的冻结多模态 RQ 码字求和重建广告表征,仅需 T 次查表、无需在线广告侧编码器)解决占日流量 36.9% 的新广告冷启表征、用 HAM(短视频/商品/直播各自码本与生成 head、共享骨干并行 beam search)吸收素材异构性,三阶段训练后在线上以单模型替掉「GR + 外部相关性模型」级联;快手搜索广告一周 A/B 广告收入 +5.78%、检索延迟 13.0→8.7 ms(-33.1%)、新广告曝光 +24.60%、不相关率 6.79%→5.81%,NQ320K/MS300K 上 Recall@10 比最强复现基线 GenRRL 高 8.44%/3.19%。
semantic-id quantization multi-task cold-start ad-rec
2026-08-04
判别式 Kuaishou
7 │ 7 │ —
SITA SITA: Semantic Interest Tokens for Target-Aware Compression in Long-Sequence Recommendation
SITA 把语义 ID 从“读取端探针”升级为“压缩结构的组织骨架”:用 N 个并行均衡量化码本定义 N 个语义组,堆叠 SIC 块把完整行为序列离线压成 N×K 个语义组织化兴趣 token,在线按 target item 的 SID 逐组硬索引取 N 个 token 做 target attention,以 O(|U|NK) 存储和 O(BNd) 推理同时实现目标感知与全局兴趣建模。
semantic-id quantization transformer industrial
2026-08-04
LLM Ant Group
8 │ 8 │ —
LLaDA MoE v2 LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
首次系统刻画 MoE 扩散语言模型的 scaling 行为,给出 dLLM 专属的超参律(B*=0.374C^0.3481、η*=64.8C^-0.2447)、偏数据侧的分配律(M*∝C^0.475 / D*∝C^0.525)与架构律(尺度越大越偏好稀疏激活、G=8-16 稳健、共享专家比 S=33.3% 跨尺度恒定),并据此从头训练 30B-A3B 的 LLaDA MoE v2(23.5T token),以 Qwen3 的 65% 预训练 token 在多项知识/推理/代码 benchmark 上逼近之,仅 SFT 无 RL 即在 8 项任务的 7 项超越 SDAR Chat。
moe diffusion parameter-scaling transformer industrial
2026-08-04
other ByteDance
7 │ 7 │ —
STEPS A Self-Triggered Agentic Push Recommendation System
STEPS 把工业推送的"是否发、何时发"重构为自触发 agentic 闭环:系统不仅决定当下是否推送,还生成自己下一次被唤醒的时刻,从而摆脱离线预排频次(缺实时性)与定时轮询(算力与时机两难)两种被动范式。框架由三个 agent 组成——planning agent 用 Gated-RTG(乘性门控注入 return-to-go,解决条件被高维状态淹没)+ 100 个等频桶的序数回归生成下次唤醒间隔 Δt;execution agent 沿 GAVE 的价值引导结构但改用 Bellman 方程学 Q 值以纠正离线日志的次优行为,并用 advantage 权重重加权动作损失;filtering agent 是从 execution agent 蒸馏出的 3 层 MLP,刻意不含 item 特征以避免触发 10 倍开销的召回/粗排/精排级联。抖音(超 10 亿用户)14 天全随机 A/B:UAD +0.2843%、推送权限关闭率 -1.9089%、算力 -79.42%(其中 -74.88% 来自 filtering agent)。
industrial agent rl transformer knowledge-distillation
2026-08-03
生成式 判别式 Shopee
8 │ 9 │ —
KGD Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
KGD 把预训练行为知识与下游任务几何拆给两个参数所有者——encoder 用 BMTP(只保留协同/语义相似度超阈的未来 item 作监督)去噪预训练并每日刷新,task learner 只经 stop-gradient 的 read-only 交叉注意力读取它、并用锚定在预训练 embedding 上的正交低秩残差 ACR 写自己的几何——使知识刷新与任务适配互不失效;8 个 Amazon-2023 基准上超最强 pretrain-transfer baseline 4-12%,90 天 Shopee 生产流上冻结迁移(GPSD)持续衰减而 KGD 保持(共享参数下每日刷新甚至低于不预训练),全量上线后 GMV/user +1.75%、广告收入 +1.53%。
transformer graph search-ranking industrial
2026-08-03
生成式 Meta
8 │ 7 │ —
GRACE GRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval
GRACE 是 Meta 把生成式检索推上实时广告链路的服务系统:合规侧提出 Generative Target Matching,在 STATIC 式 catalog-valid 受限解码 trie 的每个节点预存 subtree-union 的 bitmask/Bloom matcher,解码每步把不可能含合格广告的 SID 前缀直接掩成 -inf,广告级定向通过率从 23.55% 升到 40.42%(收益主要来自高基数位置属性的 Bloom 级 40.74%→65.70%);算力侧针对宽 beam、短序列的 encoder-decoder 解码器重写 cross-attention beam-as-query 布局(纯 layout 变换,附等价性证明)、coalesced 短序列 self-attention Triton kernel、paged 自注意力 KV cache 与动态 per-step beam size,在 GH200 上相对 FA2/FA3 中更快者把 cross-attention 压到 1/68、self-attention 压到 1/23.4~1/25.8,解码器 P99 从 197.7ms 降到 17.8ms(11.1x),端到端 P99 53.6ms 落在 70ms 计算窗口内。
semantic-id ad-rec industrial transformer inference-serving
2026-08-02
生成式 Meta
7 │ 7 │ —
Exp-RSFT Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback
针对生成式推荐后训练中日志反馈稀疏且带噪、学出来的 reward model 无法泛化的问题,本文分析 Exp-RSFT——把每条日志轨迹按 exp(R(τ)/λ) 加权做监督微调,等价于 KL 约束下对行为策略的指数倾斜,因而完全离线、不需要 reward model 也不需要倾向性分数;理论上证明其次优性分解为随 log(1/p*) 增长的覆盖代价与随 O(σ√(T·log|A|)) 增长的噪声代价,二者随温度反向移动并在闭式 λ*=2√(R_max·ε/log(1/p*)) 处取最优,且覆盖代价随轨迹长度线性而非指数累积;HSTU 骨干上的实验在 ML-1M/ML-20M/Amazon Books 与私有 StreamCo 上复现了预测的倒 U 曲线,Exp-RSFT 五项排序指标全线最优(相对 BC NDCG@10 +8.5%~+12.3%,StreamCo 相对 RSFT +106.20%),而 PPO 与 DPO 因过优化一个连 Item Mean 都打不过的 reward model 而严重崩塌。
rl industrial transformer training-stability
2026-08-01
生成式 Kuaishou
8 │ 7 │ —
HRPO Hierarchical Residual Policy Optimization for Generative Recommendations
HRPO 把 SID 生成式推荐后训练的 item 级终端反馈,先用 cohort 分组+收缩估计出 SID prefix 效用,再沿 trie 做残差分解并累积成 credit-to-go(telescoping 到终端效用减前缀基线,从而同位置跨候选可比),最后用逐位置组内归一化+PPO 截断+KL trust region 的 RRPO 保守更新策略。
rl semantic-id process-supervision industrial ad-rec
2026-08-01
生成式 判别式 Karrot
8 │ 8 │ —
RCBS Don't Contrast the Impossible: Region-Constrained Batching for Contrastive User Modeling on a Local Community Platform
RCBS 按地理区域构造同质 mini-batch,使对比用户建模主要使用现实中可曝光的物品作为负样本;它将不可能负样本比例从 0.98 降至 0.30,并在 Karrot 首页、召回和展示广告线上取得一致收益。
contrastive-ssl search-ranking ad-rec industrial
2026-07-31
判别式 Alibaba
8 │ 8 │ —
GALA GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System
GALA 以搜索购买三元组预训练多模态表示,再用候选内 next-shop 生成任务和购买奖励 GRPO 将行为目标写回冻结商家 embedding,最后通过 ID-dependent gate 接入淘宝闪购 CTR/CVR 排序器。
pretrained-lm rl contrastive-ssl feature-selection cold-start
2026-07-31
生成式 判别式 Kuaishou
8 │ 8 │ —
RecHarness RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems
RecHarness 以 Thompson Sampling 根据跨轮验证反馈路由推荐模型的编辑方向,再由 Experiment Skill 条件化的 LLM 生成可执行修改,并在局部停滞时开放结构跳跃;跨八种骨干稳定提升,线上广告 A/B 实现 ADVV +2.084%。
agent pretrained-lm rl ad-rec industrial
2026-07-31
判别式 LinkedIn
9 │ 9 │ —
TransX TransX: Scaling Transformer-based Recommendation via Behavioral and Serving Stream Crossings
TransX 将长期行为流与实时服务流解耦,以可缓存的行为编码和候选特定稀疏交叉注意力并行转导 action,在 LinkedIn 线上实现 CTR +6.0%、转化 +4.4% 且在线计算约降低 80%。
transformer sparse-attention feature-interaction industrial
2026-07-31
判别式 Kuaishou
8 │ 7 │ —
LGRID Interpretable Representation via LLM-Driven Generative Disentanglement for Local-Life Service Recommendation
快手提出 LGRID,把本地生活 SID 生成从「先单一表示后量化」重构为「先生成式解耦再量化」:联合 LLM 编码保留 geo-content 依赖,SD-Block 用语义锚 + 组内自回归/组间独立掩码把隐状态路由进 4 地理槽 + 4 语义槽,PGD 七任务课程式解码 + 结构化难负例对比使槽可验证且有判别力,最后地理流与语义流分别残差量化成 4-token 可解释 SID;Kuaishou/Foursquare 上跨 10 个骨干最高 +5.44% 相对 AUC,粗粒度地理属性解码 >99%,全 SID 碰撞率从 LGSID 的 97.0% 降到 39.9%。
semantic-id quantization contrastive-ssl pretrained-lm industrial
2026-07-30
判别式 Meta
9 │ 8 │ —
ROCS ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation
ROCS 用块下三角掩码把「request 侧输出不依赖 candidate」变成一条在复合下封闭的算子级依赖契约(GLM),覆盖线性/LCB/group-local norm/逐点算子/FM,从而让整条 request 侧通路在任意深度都能每请求只算一次、跨 N 个候选精确复用;DCA 以共享 request-only 序列编码器加逐层双组 cross-attention 把契约延伸到序列模块,RRR 把省下的算力再投资为 request 侧容量,IKBO 则在 GEMM epilogue 与 FlashAttention kernel 内部解析 request-candidate 索引映射、完全不物化 broadcast;公开数据集上在 DCNv2/FinalMLP/Wukong 上同预算超越 vanilla,Meta 数十个生产模型 replay QPS 提升 47%~196%,在线拿到 topline 增益加 29%~38% 容量节省。
feature-interaction transformer parameter-scaling industrial ad-rec
2026-07-30
判别式 Google
8 │ 7 │ —
HA-MoE Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study
Google Discover 把显式异构信号 h 同时注入 MoE 门控输入(HA-Gating)与专家输出的 FiLM 式仿射调制(HDLM),在模型体积 +5%、延迟 +0.5% 的固定预算内破解异构 feed 的负迁移与少数类坍塌;配套提出抗 gaming 的 DL-AUC(λ·Micro-AUC + (1-λ)·unweighted Macro-xAUC)作为自动化上线闸门,以及基于 JSD + 匈牙利匹配的 label-free 专家特化诊断 PIEM,线上把 Vid⁺/Web⁻ 跨类型 xAUC gap 从 0.141 收窄到 0.060。
moe multi-task cross-domain industrial
2026-07-30
判别式 Tencent
9 │ 8 │ —
CCFormer CCFormer: Efficient Cross-Field Interaction and Hierarchical Sequence Compression for Industrial Recommendation at Tencent
腾讯 PCG 的 CCFormer 把工业排序 Transformer 的特征交互拆成两个正交分量——user/target 紧凑 token 域分离地有向 cross-attend 全长行为序列(复杂度线性于 Ls),以及用子空间 token mixing + Per-channel FFN 替代序列内自注意力,再叠 Conv1D 逐层下采样做分层压缩(感受野 3→7→15→31,压缩但保留全序列可达性),相对 HSTU 训练加速 2.21×、GFLOPs 减半、0.5k token 即打平 HSTU 2k token,视频推荐 CTR +3.57% / 广告收入 +1.71% 并已全量部署。
transformer feature-interaction industrial ad-rec parameter-scaling
2026-07-30
生成式 Kuaishou
8 │ 8 │ —
FGPD From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation
把 SID 生成式推荐里纠缠在一起的「理解需求」与「决定如何行动」拆成 intent/policy 两类知识(Understanding–Action Gap),用 LLM 双 agent 生成 K 条候选决策规则、以「相对 intent-only 基线的语义相似度 advantage」做结果导向筛选与 target-blind 群体反思迭代,再经一阶+高阶双空间关系蒸馏压成轻量 SID 生成器的两个隐 token,线上零 LLM 调用,快手本地生活广告 A/B 取得 Revenue +4.506% / ADVV +4.621%。
semantic-id knowledge-distillation agent pretrained-lm industrial
2026-07-30
生成式 Alibaba
7 │ 6 │ —
LoopMemGR LoopMemGR: From Behavior Logs to Evolving Memory for Generative Recommendation
LoopMemGR 指出生成式推荐的 history-as-context 范式只记录用户行为、却在每次请求后丢弃系统侧推荐决策(asymmetric memory),因此额外维护一条 append-only 推荐经验日志,用共享的余弦 cross-attention 读取算子(门控 + 幅度封顶,保证更新只减不增)从 recency/frequency/global 三视图抽取证据,经近期锚定门控融合压成固定 16 个经验 token 注入 RankGR 骨干,形成 read-recommend-reflect-write 闭环;工业 Taobao 上 Click HR@20 从 11.64% 提升到 20.43%,16 token 保住了序列化 1000 条原始经验 74.3%-90.9% 的增益。
semantic-id transformer pretrained-lm negative-feedback industrial
2026-07-30
生成式 Google
8 │ 8 │ —
ClockRoPE ClockRoPE: Random Fourier Rotations for Temporal Routine Modeling
ClockRoPE 指出 RoPE 的 log-linear 频率调度把注意力调制锁死为单调长程衰减,用 Bochner/Herglotz 定理证明任意归一化连续正定调制核都能被「从其自身傅里叶变换采样频率」的随机旋转无偏逼近(Random Fourier Rotations,收敛速率关于特征维度 d 指数快),据此从周期高斯先验的离散谐波 PMF 采样得到 ClockRoPE,并用折叠频率分布额外换取方向感知(区分周期标记点前后一天);前向实现与标准 RoPE 逐行一致、零新增参数与输入特征,在某大型视频平台生产级生成式召回上离线 MAP@1 +3.61%,与 RoPE 特征对半组合后线上 valued engagement +0.08%,且主页浏览量 -0.51%、TPU 服务成本 -0.63%、延迟中性,已部署于主页与观看页。
transformer industrial
2026-07-29
生成式 Kuaishou
9 │ 8 │ —
Multi-Decoder OneRec Multi-Decoder OneRec: Controllable Generative Retrieval for Multi-Objective Industrial Recommendation
Multi-Decoder OneRec 用「共享表征 / 梯度路由隔离 / 配额协同解码」三段式替换工业多路召回:共享 user-context 与全参数化 General Decoder 之上,每个业务目标只挂一个隔离的 LoRA 专家(含独立 BOS 与 SID embedding 残差,仅 +20% 参数),曝光 NTP 更新共享基座、目标损失在 sg(θ₀) 处截断梯度,Watch-time 专家用用户内标准化连续奖励做 L-GBPO 并以 General Decoder 的 stop-gradient 分布做 KL 参考;推理侧 MD-CBS 按优先级执行各路线并屏蔽已被占用的 SID 前缀、General Decoder 最后回填固定预算,实测不协同会让 512 预算去重后只剩 207.67 个候选。同预算下四项 Recall@512 相对单 decoder OneRec 提升 1.69%–5.62%,Kwai Brazil 七天 A/B 十一项指标全正(人均使用时长 +0.37%、Cold-Start +2.09%),并开源十亿级多目标基准 Kwai26。
semantic-id multi-task rl cold-start transformer
2026-07-29
生成式 Kuaishou
8 │ 8 │ —
DIRECTOR DIRECTOR: Dynamic Index-based Recommendation with Transport-Optimized Retrieval
DIRECTOR(快手)把生成式重排的逐位自回归解码整体换成「一次并行生成 n 个连续动态检索索引 + 全局硬匹配」,训练时用熵正则容量约束最优传输显式耦合各位置对候选容量的竞争、推理时用矩形最短增广路直接产出去重列表,并用前缀锚定的混合列表路径把黑盒 Evaluator 的单个标量奖励精确 telescoping 分解为逐位置信用,在 ML-1M/Amazon-Books/RecFlow 上 NDCG@6 较最强基线提升 2.80%-3.69%,快手主 App 线上 VV +0.519% 且同等 QPS/延迟/可用性约束下 CPU 消耗降低 66.7%。
industrial transformer diffusion process-supervision rl
2026-07-29
LLM Instacart
7 │ 6 │ —
Improving Item Discoverability in e-Commerce Search via Related Intent Generation
Instacart 把电商/生鲜搜索的"发现"形式化为 substitute/complement/thematic 三类隐式意图生成:闭权重 LLM 为头部约 1 万条 query 离线生成"carousel 标题 + 意图词"并缓存,长尾由 GPT-5.1 教师蒸馏出的 LoRA 微调 Qwen3-30B 学生实时承接,生成与检索刻意解耦(意图词交回遗留检索引擎 hydrate 商品,幻觉因此退化为检索空结果的静默失效),再以会话共同购买派生(剔除精确匹配与 top-10)的端到端购买预测 benchmark + 人工校准的双层级 LLM-as-a-judge 双轨评测,把发现覆盖率从约 60% 提到 80% 的 query 流量而推理成本仅为教师约 30%,头部 F1 0.173→0.192/0.184 且学生在长尾三项指标上匹配或超过教师;论文自陈无在线 A/B、无非 LLM 基线。
search-ranking pretrained-lm knowledge-distillation industrial cold-start
2026-07-29
生成式 Kuaishou
8 │ 7 │ —
PSG PSG: Pair-Space Generation for Efficient Generative Reranking
PSG 把生成式重排的生成原子从单个 item 提升到有序 item 对,用现场组合的 pair encoder 撑起 n(n-1) 的每请求动态词表,把自回归解码 horizon 从 L 压到 L/2,并证明该重参数化与 item-space 分布族严格等价(双射 + 望远镜相消)、在 outcome-only reward 下次优性上界因二次复合而降 4x、把串行 KV-cache 读取换成并行 output projection 从而理论加速 2-4x,在快手 4 亿 DAU 单列 feed 上取得 1.83x 生成器加速、单容器 QPS +79.8% 与人均停留时长 +0.178%。
industrial transformer rl
2026-07-29
判别式 Yandex
7 │ 6 │ —
Embedding Items at Scale: Comparing GNN-Based and ID-Based Item Embeddings in the Yandex Ecosystem
Yandex 把预训练 GNN item embedding(TwHIN / MultiBiSage)与端到端 multihash ID embedding 插进同一套生产 two-tower ranker 的 item tower 做单变量对照,发现大规模数据下端到端 ID embedding 全面胜出(Market 相对 nDCG +1.238% vs TwHIN +0.790%,Music pair accuracy +0.699% vs +0.524%)且连微调 GNN 也追不上,只在 3315 用户 / 25833 item 的开源 Lavka 低资源数据集上预训练才带来一致提升,据此判定额外的 embedding 预训练阶段在大规模场景不值其成本。
graph transformer contrastive-ssl industrial
2026-07-29
生成式 Alibaba
7 │ 6 │ —
SPARC SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation
SPARC 在生成式推荐骨干前置一个轻量上下文条件压缩器:FCM 沿字段维建模序列上下文,CAR 把 SID 字段旁路保留、把 7 个 side 字段按上下文相关的 softmax 权重路由进 2 个可学习 slot,STC 用门控残差做跨交互精炼后合并,使每次多字段历史交互只占骨干一个 token;在工业 Taobao 与 Amazon Beauty/Toys 上全面超过 RankGR 等 baseline,并用静态压缩对照证明收益来自上下文条件化而非压缩模块容量,但缺少线上 A/B 与任何效率分析。
semantic-id transformer feature-interaction industrial
2026-07-28
LLM 学术
7 │ 8 │ —
Bridging Compute- and Data-Optimal Pretraining
提出 Compute-Data (CD) scaling law,用 token 有效性函数 η=(R*/r)(1-e^{-r/R*}) 把重复/改写产生的 derived token 折算成 fresh-token 等价物代入 Chinchilla,其饱和天花板 R*=K(D/N)^ρ N^σ 随模型规模与数据可得性双向收紧(改写衰减比重复陡约 3 倍),从而连续桥接 compute-optimal 与 data-optimal 两端、划出 compute/data/model-bound 三区间,并给出『4-epoch 法则只对约 3B/1× Chinchilla 成立、改写在 N≥7B 失效』的可查表处方。
transformer pretrained-lm parameter-scaling academic
2026-07-28
生成式 Meta
8 │ 7 │ —
LLM-Native TT The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers
Meta 反对把生成用于检索:用 LLM 作判别式语义骨干复活经典双塔——cross-encoder 教师(verbalized yes/no logit 差 + user-conditioned NTP)经候选集分数分布 KL 蒸馏进共享 LLM 双塔学生(共享编码器 + EOS pooling + 跨数据集迁移 + user 塔单步 Coconut 隐式推理),在三个 Amazon benchmark 上以 Qwen3-0.6B 的 R@10 全面超过 Qwen3-8B 的 OneRec-Think,生产环境仅用 0.5% 训练数据即达 DLRM 平价且冻结三天不退化。
pretrained-lm knowledge-distillation contrastive-ssl cross-domain parameter-scaling
2026-07-28
生成式 Kuaishou
8 │ 7 │ —
RGD Reward Guided Decoding for Generative Recommendation
RGD 把生成式推荐的价值导向解码形式化为 KL 正则化 reward 最大化,导出闭式 Boltzmann 重加权分布 Q*∝P·exp(R/β)(等价于按 log P + R/β 排序),并用一个 stop-gradient 复用冻结 decoder 隐状态的链式 bottleneck-MLP reward head 在每个 SID 解码步注入奖励(pre/post/hybrid 三种注入模式),使业务目标切换无需重训基座生成器;三个 Amazon 数据集上全面超过 TIGER/HSTU/RPG/PROMISE(R@10 最高 +11.49%),并已部署于快手直播推荐,两周 A/B 页面 CTR +0.392%、直播观看时长 +0.689%。
semantic-id process-supervision test-time-scaling multi-task transformer
2026-07-28
生成式 Spotify
7 │ 7 │ —
Hypothesis-Driven Shelf Generation for Personalised Recommendation
Spotify 把 Home 首页的人工货架模板换成四阶段生成式流水线:LLM 从用户画像生成自然语言「货架假设」作为规划与检索之间的契约,再用内容类型特定 trie 约束的 Semantic ID 生成式检索接地到目录实体,再由 LLM 精选 item 并重写标题以兑现「整行承诺」,最后把离线预计算的货架作为候选注入 Home 排序竞争;离线生成式检索全面超过 BM25/稠密/混合基线(Overall 0.56→0.71),对齐阶段再把整体判官分抬到 1.27(+78%),但均匀随机曝光下 5 个内容池 3 负(节目 −41%)2 正(专辑 +36%)。
pretrained-lm semantic-id knowledge-distillation industrial
2026-07-28
生成式 Kuaishou
8 │ 8 │ —
RecoReward RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation
RecoReward 把用户监督限制在「训练期奖励」这一条通道里——用行为训练的冻结双塔 DSSM 对 MLLM 生成的直播描述打分,以 RAS = 目标用户中心亲和 - λ×非目标用户中心亲和 剥离广泛共享的背景亲和,再用群体相对策略优化训练生成器,从而同时拿到 user-informed 训练与 content-only 服务(推理时不需任何用户信息、单条描述全量复用);RecoReward-9B 在快手直播召回 benchmark 的七个指标上全部第一,相对 Qwen3.5-9B 底座提升 31.7-40.4%,一周在线 A/B 关键页面有效用户渗透 +0.265%、外流曝光/用户 +0.791%/+0.740%。
rl pretrained-lm contrastive-ssl industrial
2026-07-28
LLM Moonshot AI
— │ 9 │ —
Kimi K3 Kimi K3: Open Frontier Intelligence
Kimi K3 把 LLM scaling 显式拆成序列/深度/宽度三个正交维度并各给一个机制——3:1 的 Kimi Delta Attention 与 Gated MLA 混合(用 scaled-sigmoid lower-bounded decay 把累积衰减倒数压进 BF16 范围,从而让对角 tile 也走稠密 Tensor Core、消掉 position-pair 路径)、Block Attention Residuals(每层对所有前序 block 表示做 softmax 检索,把内存/通信从 O(Ld) 降到 O(Nd))、以及 Stable LatentMoE(latent 空间路由 896 experts/top-16,配 RMSNorm、有界 SiTU-GLU、和从最优均衡分配 LP 对偶推出的 Quantile Balancing),构成 2.8T 总参/104B 激活/1M 上下文的原生多模态 MoE,相对 Kimi K2 取得约 2.5 倍 scaling 效率;后训练用三域×三 reasoning-effort 的 9 个 RL expert 经 Multi-Teacher On-Policy Distillation 合并为单模型,并由 MoonEP(证明每 rank 至多 E/R 个冗余 expert 即保证完美负载均衡且界紧)、KDA Context Parallelism、AgentENV microVM sandbox(133ms checkpoint/49ms resume,共创建 5122 万个 sandbox)支撑;权重全量开源,整体落后 Claude Fable 5 与 GPT-5.6 Sol 但一致领先其余所有模型,WebDev Arena 首个登顶的开源模型,BrowseComp 以 $2.03/task 拿到最佳 91.2%。
linear-attention moe transformer pretrained-lm rl
2026-07-27
判别式 Alibaba
8 │ 8 │ —
SpecFormer SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation
SpecFormer 把「推荐 Transformer 堆层就崩」归因为数据异质性与长尾诱发的谱坍缩,并证明它在前向(低秩注意力当低通滤波器)与反向(梯度只喂主谱方向)构成恶性循环;对症提出可学习幂律谱软化 + 谱软化注意力(Q/K 用软化谱、Value 保持原始) + 奇异值 Taylor 展开的谱残差位置编码,使注意力有效秩随深度单调上升,三数据集 SOTA 并在阿里电商广告全量 A/B 取得 CTR +1.34% / Order +16.72%,延迟仅 +5ms。
transformer feature-interaction parameter-scaling industrial ad-rec
2026-07-27
判别式 Meta
8 │ 7 │ —
Mosaic Mosaic: A Fleet of User Embedding Specialists for Recommendation at Meta
Meta 的 Mosaic 把用户表征层组织成一支架构异构的专家舰队(memorization-driven / dense-heavy / sequential / CoTrain),各自独立训练产出可复用嵌入供多个下游 ranker 消费,并用 MRM 复合标签 + 余弦冗余损失最大化每个新专家的边际信息、CoEval + User Tower Zero-Out 做免打点评估(迭代提速 3-5×)、三路径混合 CPU/GPU 服务栈削减 79% GPU 用量,在 6 个 surface 上取得一致离线 NE 下降与线上 topline 正向。
transformer feature-interaction multi-task moe cross-domain
2026-07-27
生成式 判别式 Kuaishou
9 │ 8 │ —
UniR2 Unifying Generative Recall and Multi-Objective Ranking in a Single Decoder-Only Sequence
UniR² 把用户上下文、SID 生成轨迹与物品排序特征拼成一条 decoder-only 异构序列,用双查询前缀因果注意力(DQ-PCA)给召回/排序不同可见性、用 stop-gradient + ranking-only LoRA 做优化隔离,在一次前向内统一生成式召回与多目标排序,端到端推理时间降低 54.29%,快手直播双端两周 A/B 播放量 +1.177%、送礼金额 +2.569%。
transformer semantic-id multi-task sparse-attention industrial
2026-07-27
生成式 JD
9 │ 8 │ —
OxygenREC-v2 OxygenREC-v2: Internalizing Discrimination into Generative Recommendation
JD.com 的 OxygenREC-v2 把判别式行为信号从「生成之后交给外部排序模型打代理奖励」内化进生成器自身:预训练期把行为指令 I_b 送进 decoder prefix,从第一个解码步就条件化 SID 生成并按行为价值加权损失;后训练期用 EA-TOSD(命中率可验证奖励做 best-of-G 轨迹选择 + 同骨干加近未来 SID 前缀构成的特权 teacher + 低熵 advantage 自蒸馏/高熵前向 KL 的熵门双路)彻底移除奖励模型;离线七项指标六项超过 v1 与 Proxy-RM 基线,3B-A1B MoE 上线 JD 六个生产 surface 取得 UCTCVR +1.6~4.4%、GMV +2.8~6.8%。
industrial semantic-id rl knowledge-distillation moe
2026-07-27
判别式 Google
7 │ 7 │ —
Breaking the Loop: An Empirical Comparison of Strategies for Novelty and Freshness in YouTube Music
Google 在 YouTube Music 首页上把反馈闭环干预按施加层(serving / 训练数据 / 架构 / 探索)组织成分层框架,用六个单例+一个组合臂、每臂只改一层的两周线上 A/B 给出跨层对照:serving 层 recency boost 的 day-1 增益会被持续训练的学习闭环在几天内中和;架构去偏(bias tower)把 bottom-20% 曝光抬 9.2%、Novel-music engagement +4.70%、艺人多样性 +0.79%,却让 7 天新发行 engagement 下降 3.39%,因为新发行正是它所移除的流行度偏差的受益者;SNGP 不确定性驱动探索产生最大的新发行 lift(serving boost 1-day +7.75% / 7-day +3.30%,训练损失重加权 +4.33% 但增益集中在 day-0 并随 item age 衰减);把 bias tower 与不确定性损失堆叠在流行度重分配上超加性、却抵消了新发行 lift——核心结论是「干预处理反馈闭环的哪个症状、付出什么成本,主要由它的施加层决定」。
cold-start industrial multi-task
2026-07-26
生成式 Snapchat
— │ 7 │ —
EGR EGR: Embedding-Native Generative Retrieval with a Shared LLM
EGR(Snap)提出 embedding-native 生成式检索:用单一共享 LLM/MLLM backbone 加同一个投影头,同时把 item 元数据编码成直接写入 ANN 索引的稠密向量、把用户交互历史编码成稠密 query 向量,以 IRL(item-pair 对称 InfoNCE)+ NIP(history-to-target InfoNCE,目标侧 stop-gradient)在 IRL 全程在场的调度下联合训练,从而彻底删除 SID 路线的量化器/可变 ID 词表/grounding 层与 embedding 路线的 item-encoder 冻结割裂,推理退化为标准 MIPS 检索;Amazon Reviews 三类目 R@10 全面最优,Snap DPA 上数据 scaling 无饱和(+27%)、冷启动仅退化 5.1%、多模态 +6.9%,线上 A/B CVR +2.91% 并已全量服务 100% 用户。
pretrained-lm contrastive-ssl industrial ad-rec cold-start
2026-07-25
other Pinterest
7 │ 7 │ —
PinEqualizer PinEqualizer: Full Funnel Content Exploration and Debiasing System at Pinterest
PinEqualizer 是 Pinterest 部署两年的全漏斗内容冷启动去偏系统,横跨 corpus selection→retrieval→ranking→utility 四阶段,以'去偏优先于显式探索'的立场配合 Thompson/UCB/Neural-Linear-UCB 探索与 feature dropout/校准/纯内容 embedding 去偏,并用长期 fresh-content holdout→content graduation→under-explored engagement 三层度量框架量化长期价值,累计带来 350% 新鲜内容曝光增长与成功内容提供者 +99%。
cold-start industrial search-ranking feature-interaction graph
2026-07-24
生成式 Tencent
8 │ 9 │ —
BARGE Bridging the Structural Gap: Adapting Autoregressive Generation for Recommendation
BARGE(腾讯)把生成式推荐相对推荐任务的结构性错配形式化为编码器侧item-boundary gap与解码器侧semantic-drift两个正交鸿沟,用ICA(item上下文注意力)、HPR(per-layer路径重排序)、DPD(OSQ-VAE正交双通道+OR-fusion)三个轻量正交模块分别弥合,Amazon全指标SOTA且腾讯线上A/B CTR+0.60%。
semantic-id transformer quantization industrial contrastive-ssl
2026-07-23
LLM Amazon
7 │ 7 │ —
Efficient Clustering with Provable Guardrails for LLM Inference at Scale
为把 LLM 应用扩到千万级用户,提出带「可证明护栏」的两阶段聚类:先 Mini-batch K-Means 生成初始簇,再在每簇内贪心选代表(等价于 Set Cover 的 Johnson-Chvátal 启发式,把问题 reframe 为 embedding 空间 α-ball 覆盖),只对簇代表调 LLM、其余成员继承输出,并按构造精确保证簇内最小相似度 ≥ α 与类别属性完全匹配,复杂度在 K=Θ(n) 时对 n 线性;在 3800 万客户的 persona 推荐流水线部署,下游 LLM 成本与延迟降低约 50 倍($1.13M→$22K 量级)且端到端质量仅降 0.7%,解锁了生产上线。
industrial pretrained-lm
2026-07-22
生成式 Alibaba
8 │ 8 │ —
TSGR TSGR: Taobao Search Generative Retrieval
TSGR 是淘宝搜索的统一生成式检索框架,把商业价值同时注入 Semantic ID 构造(Query-aware Parallel SID:按 query-item 点击统计构建并行码本,让高价值且 query 相关的物品占据靠前 token 索引)与候选排序(Value-aware Ranking Module:复用生成骨干隐状态 + cross-attention 融合物品 side-info,产出 PV/CTR/CVR 三头分数并与生成目标联合优化),使单模型同时充当检索器与预排序器;离线 HR@1000 相对 FORGE 提升 9.16%,线上 A/B 带来 GMV +1.64%、成交单量 +1.12%、IPV +0.43%。
semantic-id search-ranking industrial transformer rl
2026-07-21
判别式 Kuaishou
7 │ 7 │ —
UAME Uncertainty as Remedy: Mitigating Satisfaction Label Bias in Short Video Multi-Objective Ensemble Ranking
UAME 把端到端多目标集成排序的预测建模为高斯打分变量(均值=满意度、方差=不确定性),用概率化 pairwise 排序损失 + 不确定性感知样本级加权把冲突驱动的不确定性作为纠偏工具嵌入核心优化管线以缓解满意度标签偏差,在 Kuaishou 数亿 DAU 短视频系统上一致改进 EMER/EASQ 两个 SOTA 骨干、线上零额外延迟且统计显著。
industrial multi-task
2026-07-19
判别式 Meta
8 │ 8 │ —
WHALE WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture
Meta 的 WHALE 在每一层内同时保持 Wukong(非序列高阶特征交互)与 HSTU(长行为序列)两个可扩展骨干活跃,用「Wukong 交互表示 query HSTU 序列表示」的跨分支注意力做逐层加深的渐进式融合,配 shared-KV/非对称反向/shared-gate SwiGLU 等系统协同优化,离线三方向 scaling 一致领先且在线 A/B 主指标 +0.113% 已部署。
transformer feature-interaction parameter-scaling recursive-depth industrial
2026-07-19
LLM IQuest Research
— │ 8 │ —
Loopie Loop the Loopies!
Loopie 把循环 Transformer 从「省参数的手段」重新定义为「算力匹配的扩展轴」:用 layer-loop(每层就地循环两次而非整模型循环)让一层的所有循环调用留在同一个 pipeline stage 内,消除 model-loop 的环形依赖;再按「存储深度减半 → 激活显存降至 0.633× → per-device microbatch 翻倍 → 吞吐 189.65→261.53 TFLOPS/s → 把增益回投为更大 width/depth」的 Loopie Recipe,按实测 optimizer-step 墙钟时间(而非理论 FLOPs,名义算力实为 1.424×)选出 D=2304/L=27/R=2 的 20B-A2B;该模型在 600B token 后反超算力匹配的 Qwen3-30B-A3B,0.15B–1B 四级扩展阶梯上增益(+1.1/+0.6/+1.7/+2.2)不随规模消失;后训练引入 supervised pre-training(SFT 掩码 + 预训练规模 batch/128K 序列,2T token、10 epoch 无过拟合且推理与通用指标同步上升)再接 GSPO+DAPO 的数学与代码 RL,使仅用 3.5T 预训练 token 的 Loopie-20B-A2B 在同数据源下追平或超过 25T token 的两个 Nemotron 模型(BBH 82.28 vs 68.76/75.86,IFEval 84.72 vs 77.05/79.21)。
transformer moe recursive-depth parameter-scaling pretrained-lm
2026-07-17
生成式 LLM Alibaba
9 │ 9 │ —
RecGPT-V3 RecGPT-V3 Technical Report
RecGPT-V3 是阿里淘宝 RecGPT 系列第三代 LLM 工业推荐器,针对 V1/V2 暴露的三大瓶颈(无状态行为建模、tag→item 信息瓶颈、低效显式推理)分别给出 Memory Hub(结构化压缩+演化维护的有状态记忆,planner 算力降 55.8%)、Hybrid-modal Foundation Model(Qwen3-14B 扩 65536 个两级 RQ-VAE SID token、文本+SID 双模态)、Latent Intent Reasoning(把 teacher CoT 掩码重建压进≤10 个可解码 latent token、200:1 压缩、RLRF 从生产 ranker 读 CTRScore 作奖励),淘宝首页 1% 流量 A/B 对 V2 取得 Feed +1.28% IPV/+1.00% CTR/+1.97% TC/+3.97% GMV、端到端算力降 52.4%。
pretrained-lm semantic-id rl knowledge-distillation quantization
2026-07-17
LLM QuintoAndar
7 │ 6 │ —
LLM-Based Re-Ranking for Real Estate Search
QuintoAndar 在其对话式房产助手 Concierge 中引入 zero-training、prompt-only 的 point-wise LLM 重排器——用自然语言用户画像 + 结构化过滤器 + 房源元数据 + 候选集聚合统计量对召回候选独立打 affinity 分,只改重排不动召回栈,配套用 LLM-as-a-Judge 构建 96 万对离线评测集,线上 A/B 取得 +5.3% CTR / +4.8% 预约看房。
search-ranking pretrained-lm industrial
2026-07-16
判别式 Alibaba
8 │ 8 │ —
TMallGS TMallGS: Scaling Unified Feature and Sequence Modeling for Generative E-commerce Search
TMallGS 是天猫搜索精排的统一特征+序列 Transformer 架构,通过层次化校准 tokenization、Per-Field QKV 门控骨干、Decoupled FiLM 后融合与正交 Bias Net,专门修复 LLM 式一体化架构在搜索场景的异构性鸿沟与信号稀释,遵循 scaling law 并在天猫搜索线上取得 +1.52% GMV。
search-ranking transformer feature-interaction parameter-scaling training-stability
2026-07-15
判别式 Ant Group
7 │ 6 │ —
OrDA OrDA: Orthogonal Disentanglement of Access Habits Framework for Homepage Marketing Block Recommendations
OrDA(蚂蚁芝麻)针对首页营销位『习惯性伪正样本』偏差,用门控双塔+余弦正交正则把用户内容兴趣与访问习惯在表示空间强制解耦,推理时以 do(H=0) 加性置零剥离习惯分量,线上 UCTR +5.64%。
industrial multi-task feature-interaction
2026-07-15
判别式 Pinterest
8 │ 8 │ —
MESH MESH: Scaling Up Retrieval with Heterogeneous Content Unification
提出 MESH——统一异构内容检索的扩展框架,针对「异构 Scaling Bias」(模型容量增益在不同内容层级上不均等)用模块化架构+门控偏置校正:将特征空间划分为独立域以减少稀疏物品信号与高频互动特征间的干扰,为稀疏内容开辟受保护梯度路径,使新鲜物品的幂律 scaling 指数提升 14 倍;在 Pinterest 十亿级 Related Pins 上线上新鲜物品 repin +5.5%、漏斗效率 +55%、留存 +0.46%,异步服务吞吐 +2.87 倍。
parameter-scaling feature-interaction cold-start industrial
2026-07-14
生成式 Meituan
7 │ 7 │ —
NONTP Not Only NTP: Extending Training Signal Coverage for Generative Recommendation
提出 NONTP——指出 NTP 训练信号有「时间局部性」(只优化单步预测)与「空间局部性」(目标物品 embedding 只从紧邻隐状态收梯度)两大结构缺陷,用两个可推理期丢弃、零开销的辅助目标扩展信号覆盖:TCL 用 BYOL 式 EMA teacher+InfoNCE 把隐状态对齐到 K 步未来轨迹,TDL 均值池化跨域隐状态并经共享预测头预测、开辟第二条无参数梯度通路;四域美团工业数据集全量排序 HR@10 较 NTP +34.3%、较 MBGR +18.3%,公开 Amazon 数据 HR@10 +2.8%,线上 A/B CTR +1.8%、GMV +2.1%。
contrastive-ssl cross-domain semantic-id transformer industrial
2026-07-14
判别式 Alibaba
7 │ 7 │ —
SAM Learning to Forget: Satiation-Aware Long-Sequence Transducers for Mitigating Post-Purchase Redundancy
SAM把购买视为意图终止信号,用双路交叉注意力(pointwise回溯抑制+个性化复购节奏检索)驱动的自适应饱和门控软掩码,配合Time-to-Next-Purchase自监督辅助任务,在Tmall电商CTR排序中把购后重复率降低60%以上同时保持SOTA精度。
transformer negative-feedback industrial ad-rec
2026-07-14
判别式 Meta
7 │ 8 │ —
SlimPer SlimPer: Make Personalization Model Slim and Smart
SlimPer 把工业判别式排序重构为对定长 <user,item> 知识库的迭代 Select-Match-Refine 精炼,每层直连原始用户侧 token、以 O(N) 每层成本把模型深度与用户历史长度解耦,并把 ROO 扩展到全部用户侧模态,在 Instagram Reels/Feed 全量部署同时提质提效。
transformer linear-attention feature-interaction multi-task industrial
2026-07-14
判别式 JD
8 │ 7 │ —
MMRM MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search
京东 MMRM 用一个共享 MLLM 骨干加任务专用 token 一次前向对齐 q2i_click/i2i_click/cart/order 四路异质协同信号,生成多路复用 item 表示,再用其做任务专用行为序列软检索派生用户表示喂多任务排序塔,搜索全量部署千万级日活线上 UCTR/UACR/UCVR +0.42%/+0.37%/+0.35%。
search-ranking multi-task contrastive-ssl pretrained-lm industrial
2026-07-13
生成式 Alibaba
8 │ 8 │ —
CRID Beyond Semantic IDs: Encoding Business-Value Ranking into Document Identifiers for Generative Retrieval
CRID 把 DocID 解耦为语义聚类前缀 + 簇内业务价值序数排名,用替换最后一级码本的极简改动同时消除碰撞、对齐业务目标并支持簇内重排增量更新,在 300M 淘宝搜索语料上超越含最强 EBR 的所有基线并全流量部署带来 +1.06% GMV。
semantic-id search-ranking industrial quantization
2026-07-13
LLM Alibaba
7 │ 7 │ —
Prompt Generation Technical Report
淘宝搜索团队提出配置驱动的特征工程框架 Prompt Generation(PG),用两份声明式 JSON 把 LLM 生成式检索的特征处理逻辑从模型结构里解耦、作为离线训练与在线服务的单一事实源,配合 event tracking 消除训练-服务偏差,并靠 merger 做 token 压缩,已在淘宝搜索线上取得 +0.47% 成交、+0.51% GMV。
search-ranking semantic-id pretrained-lm feature-selection industrial
2026-07-13
LLM Tencent
8 │ 8 │ —
Hidden Decoding Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
Hidden Decoding 在固定 Transformer 骨干下沿序列长度维度扩算力,把每个 token 展成 n 条独立 embedding 流并保留其 KV 缓存作上下文,配合 Stream-Factorized Attention 把注意力开销降到近线性,在 100B+ MoE(WeLM-HD4-80B/617B)上首次实现前沿规模的序列长度扩展并超过同规模非-HD 基线。
transformer moe parameter-scaling sparse-attention test-time-scaling
2026-07-09
判别式 Kuaishou
7 │ 8 │ —
PIT-SUN PIT-SUN: A Deployable Empirical Marginal Transform Framework with Expectation-Consistent Recovery for Regression in Recommender Systems
PIT-SUN 用一张经验边际 CDF 表同时定义有界 PIT 学习坐标、逆分位恢复基与漂移监控,再用带 stop-gradient 隔离的 SUN 乘性恢复把预测映回原始空间条件期望,为观看时长/GMV/LTV 等重尾零膨胀回归目标提供可部署的期望一致校准,快手线上观看时长 +0.318%。
industrial
2026-07-09
生成式 Alibaba
7 │ 7 │ —
DaV-Gen DaV-Gen: End-to-End Generative Retrieval via Draft-and-Verify
DaV-Gen 用「起草-验证」重构端到端生成式检索:以 ANN 向量检索非生成式地起草候选、再用融合打分在一次并行前向中验证,取代自回归逐 token 解码,在视频搜索上把延迟降到约 70ms(2.5x 于级联)并带来 ATS +2.09% 的在线收益。
semantic-id pretrained-lm contrastive-ssl search-ranking industrial
2026-07-09
生成式 Alibaba
8 │ 8 │ —
UniSGR UniSGR: Unified Framework for Semantic ID Generation and Ranking
UniSGR(阿里 Lazada)把 semantic-ID 生成式检索与多目标排序统一进一个 MoE encoder-decoder:排序模块直接长在生成 decoder 上、共享 semantic-ID/encoder/decoder 状态表示,用价值加权并行多 token 预测(VA-PMTP)、Task-Aware Tokens 与漏斗感知对比学习(FACL)把生成对齐到 click/atc/pay 业务价值,并用 STARK 序列维树注意力 KV cache 把 beam search 推理吞吐提升约 200%,线上 GMV +5.68%。
semantic-id moe transformer multi-task contrastive-ssl
2026-07-05
生成式 Kuaishou
8 │ 7 │ —
HGenPush HGenPush: A Heterogeneous Generative Recommendation Architecture for Industrial Push Notification Systems
HGenPush 用一条 decoder-only 主干融合 feed 长短期与 push click/send 多视角行为,在序列尾部挂 [cls]_a / [cls]_v 两个锚点驱动作者与视频双分支异构生成(作者侧用 InfoNCE 对齐用户兴趣后经 SimVQ 稳定的 RQ-Kmeans 离散化,并与目标视频首层 SID 拼成混合语义 ID 直接产出可下发候选),并用 Chained-MTP——以兴趣锚点为稳定上下文、加上前序语义 ID 的累加 embedding、每层独立 FFN 头并行出 token——取代自回归解码,HitRate@100 仅比 DeepSeek-MTP 低 0.99%(0.3915 vs 0.3954)而单卡最大 QPS 高 33.86%(1.70k vs 1.27k),再以点击后 session 消费奖励经 GSISPO(GSPO 序列级重要性采样 + CISPO 权重裁剪、不加 KL)做偏好对齐,代价 1.24% HitRate 换来线上转发率 +7.57%,全量部署于快手推送系统取得 DAU +0.181%(p=0.04)、CTR +1.577%(p=0.11)、App 使用时长 +0.148%(p=0.75)。
semantic-id rl quantization multi-task inference-serving
2026-07-03
生成式 Meta
8 │ 7 │ —
Cluster GOOBS Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval
提出 Cluster GOOBS:用 LLM 多模态聚类从正样本同簇实时采难负样本,配哈希物品池(GOOBS)实现十亿级、零全局索引的双塔召回负采样;公开数据集全面超越 in-batch/DNS/CBNS/ANCE,Meta 线上 A/B +53% CTR 且把前100物品曝光占比从 50% 压到 32%。
contrastive-ssl pretrained-lm industrial
2026-07-01
生成式 Meta
8 │ 8 │ —
GR2 GR2 Technical Report
Meta 的 GR2 首次把 LLM 的显式 CoT 推理系统性地带入工业重排:语义 ID mid-training + teacher 推理链蒸馏(定向/拒绝采样)+ 可验证奖励 RL(DAPO),并用 OPD 替代崩溃的 SFT、条件奖励封堵 reward hacking、推理内化削减 serving 成本,工业流量 +18.7% R@1 且 serving ROI 约 15×。
semantic-id pretrained-lm rl knowledge-distillation process-supervision
2026-06-30
生成式 Netflix
8 │ 8 │ —
GenPage GenPage: Towards End-to-End Generative Homepage Construction at Netflix
Netflix 用单个 decoder-only Transformer 把用户/请求上下文当 prompt、自回归生成整张结构化多行首页,以 LLM 化的 NTP 预训练 + WBC/RL 后训练替代多阶段推荐栈,线上 A/B 核心互动 +0.24%、延迟 −20%。
transformer rl industrial cold-start parameter-scaling
2026-06-30
生成式 Kuaishou
8 │ 7 │ —
POEM POEM: Partial-Order Enhanced Real-Time Sequential Modeling for Recommendation
POEM 把召回阶段被忽视的下游多目标实时排序分(CTR/CVR/观看时长)用逆排名加权融合成偏序、分组随机采样构造动态序列,与历史序列双编码器融合,配合系统偏好正样本蒸馏与 Swing 图硬负采样,实现每请求实时刷新的用户兴趣表征,在快手全量上线人均时长 +0.249%/+0.213%。
industrial transformer contrastive-ssl graph knowledge-distillation
2026-06-29
生成式 Kuaishou
7 │ 7 │ —
IID-Nav From Extraction to Navigation: Progressive Retrieval with Indirectly Infinite Depth
提出 IID-Nav,把工业推荐召回从静态相似度抽取重构为有状态的目标驱动图导航:用跨请求状态接力(间接无限深度 IID)突破单请求跳数/延迟的深度上限,用 target-aware 判别器主动意图路由替代被动近邻扩展,并用图硬负采样的轨迹对齐训练抑制搜索漂移,亿级工业集 Recall@500 提升 +36.35%。
graph contrastive-ssl pretrained-lm transformer industrial
2026-06-29
判别式 Meta
8 │ 7 │ —
CMSL CMSL: Constructive Multi-Sequence Learning for Recommendation Systems
Meta 提出 CMSL,把序列推荐从「读取一条单调用户历史」转变为「主动构造 K 条主题一致的隐子序列」以对抗 context pollution(上下文污染),每条子序列用近似 HSTU 的线性时间注意力单独建模,已在排序与 U2U 召回、跨 5 个 surface 部署。
transformer linear-attention sparse-attention multi-task industrial
2026-06-26
LLM Kuaishou
7 │ 8 │ —
AgentX AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems
快手 AgentX 是生产部署的多 agent 系统,把工业推荐的 idea-to-launch 闭环(Brainstorm 提案 → Developing 双轨编码 → Evaluation guardrail-veto A/B → SGPO 语义梯度自进化)整体自动化,三周三 worker 把 374 想法转 10 个上线、主 feed +0.561% app 时长、生活服务年化收入超 1 亿元。
agent pretrained-lm industrial ad-rec
2026-06-25
生成式 学术
7 │ 7 │ —
MO-DiT+HPPO Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization
提出 MO-DiT+HPPO 解决 pattern-preserving attribute retrieval:用球面 flow-matching 的扩散 transformer 读 item embedding 序列生成连续 query 做最近邻检索,以 metric-ordered 序列把稀疏在线检索标签变成同模式低→高密度轨迹训练 CPT+tail-centroid SFT,再用 HPPO(在线 Joint@K 作 reward 的 DPO 式偏好优化+混合候选池+反 reward-hacking 的 Pareto pair filter)对齐真实在线交集指标,在四个内部域上把 Joint@K 显著推高。
diffusion normalizing-flow transformer rl search-ranking
2026-06-25
LLM Tencent
7 │ 8 │ —
NOVA NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems
NOVA 是腾讯提出的'验证感知'LLM 多智能体框架,把工业推荐架构演进形式化为受 SGD 启发的'架构梯度'搜索 + 多阶段验证级联(训练前拦截'能跑但结构无效'的静默失败并转为禁止方向)+ L1-L4 分级与 AutoRun/Copilot 管控,在腾讯广告 L3 文献到生产任务上 EPR 达 60%、人工耗时缩短 13.5×,线上 A/B GMV +1.25%~+2.02% 且 pCVR bias 同步下降。
ad-rec search-ranking pretrained-lm agent industrial
2026-06-25
判别式 Kuaishou
8 │ 8 │ —
UniFormer UniFormer: Efficient and Unified Model-Centric Scaling for Industrial Recommendation
提出 UniFormer,把工业推荐的建模空间显式拆为特征空间(FIM)与任务空间(TIM)分别堆叠扩参,配语义化 tokenization 做用户-物品解耦加速、多序列 cross-attention 防偏好坍塌、多视角 FFN 灵活分配容量,将 scaling 范式从组件级/特征空间协同推进到 model-centric。
transformer feature-interaction multi-task parameter-scaling industrial
2026-06-25
生成式 Kuaishou
8 │ 8 │ —
RaG Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale
快手提出 Recommendation-as-Generation(RaG),用解耦语义 ID(D-SIDs)统一生成式推荐与个性化视频生成:GRM 预测的兴趣 D-SIDs 不再用于检索固定库存,而是解码生成全新个性化视频,配合多智能体 VGAs 与跨域奖励学习 GDPO,在 4 亿用户广告场景相比强 GRM 基线提升广告收入 1.87%。
semantic-id quantization rl pretrained-lm ad-rec
2026-06-24
生成式 Meta
8 │ 8 │ —
G2Rec Structuring and Tokenizing Distributed User Interest Context for Generative Recommendation
提出 G2Rec:消去 user 节点构造稀疏 item 共参与图(O(M log M) 边,谱稀疏化有保证),在图上做可微软模块度聚类得到每个 item 的兴趣原型软成员,把连续兴趣画像 token 与 item 嵌入交替成序列喂 Llama2-13B 自回归推荐器,在 Meta 多场景上线。
semantic-id graph pretrained-lm transformer industrial
2026-06-18
判别式 Zalando
7 │ 6 │ —
VCG VCG: A Multimodal Retrieval Framework for E-Commerce Video Feeds under Extreme Cold-Start Conditions
Zalando 提出 VCG——一套 zero-shot 双塔多模态召回引擎,用领域适配 CLIP 把用户(商品交互聚合)与视频(帧均值)映射到同一流形做点积召回,攻克电商短视频流的极端冷启动,并实证生成式 LLM embedding 因表征坍塌不适合检索、判别式 CLIP 才适合,线上 A/B 深度完播 +50%。
cold-start contrastive-ssl pretrained-lm industrial
2026-06-17
生成式 Kuaishou
7 │ 8 │ —
DIF Denoising Implicit Feedback for Cold-start Recommendation
快手提出模型无关的冷启动隐式反馈去噪方法 DIF:用内容相似暖物品的协同表征为冷启动物品生成置信度加权伪标签,再以相对熵+冷启动状态估计样本不确定性自适应修正噪声标签,十亿级线上部署显著提升冷启动商业指标。
cold-start industrial
2026-06-17
LLM 学术
7 │ 7 │ —
Arch-Warmup Taming Curvature: Architecture Warm-Up for Stable Transformer Training
提出 warm-started 幂迭代(复用上一步顶特征向量 + HVP,每步<5次)实现十亿参数级 Transformer 的在线(预条件)Hessian 最大特征值追踪,并基于 Edge-of-Stability 理论提出'架构 warm-up'——用零初始化逐步解锁网络深度把有效曲率约束在稳定边界内,在不拖慢收敛的前提下减少 loss spike 并拓宽可用学习率范围。
transformer training-stability pretrained-lm parameter-scaling
2026-06-15
判别式 Shopee
8 │ 8 │ —
OneRank OneRank: Unified Transformer-Native Ranking Architecture for Multi-Task Recommendation
提出 OneRank,把多任务推理内化进 Transformer 栈以消除编码器-预测器分离:任务 token 互不可见实现早期特化、候选感知上下文化弥合训练-服务 gap、带策略性梯度解耦的跨任务注意力做受控知识迁移、动态匹配打分替代静态 MLP head,在 Shopee 线上取得 GMV/UU +1.01%。
transformer multi-task search-ranking industrial
2026-06-15
判别式 NetEase
7 │ 6 │ —
PIANO PIANO: Personalized Reranking via Information Aggregation Node for Music Search Optimization
网易云音乐提出 PIANO 音乐搜索个性化重排框架:QDIR 以当前 query 对历史 query 序列做 cross-attention 精炼长期偏好,IAN([CLS] 式聚合节点)受真实 per-list CTR/CVR 监督做 listwise 多目标优化,线上 A/B 取得 CTR +0.62%、CVR +4.45%。
transformer search-ranking industrial pretrained-lm contrastive-ssl
2026-06-15
判别式 Tencent
7 │ 8 │ 5
TAPF Beyond Positive Signals: Unlocking Implicit Negative Behaviors for Enhanced Sequential User Modeling
提出混合极性行为序列(固定长度预算内按时序交错正负反馈 token、替换部分正向 token,零额外在线推理成本)+ 轻量 Target-Aware Polarity Fusion 目标条件极性门控,在 DIN/Transformer/OneTrans/HyFormer/MixFormer 五种 CTR 架构、三个数据集上一致取得 +1.9%~+9.6% 相对 AUC 提升。
negative-feedback transformer industrial ad-rec
2026-06-13
生成式 Kuaishou
8 │ 8 │ —
OneBar OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds
提出 OneBar,面向短视频电商信息流底栏的端到端内容接地生成式查询推荐框架,用单个 BART encoder-decoder 取代多阶段检索级联,并通过 PIOPD(偏好内化 on-policy 蒸馏)免奖励模型地内化后验点击偏好,在快手主信息流在线 A/B 取得 Guided GMV +21.67%。
search-ranking pretrained-lm knowledge-distillation rl industrial
2026-06-13
生成式 Meta
7 │ 7 │ —
ChronoID ChronoID: Infusing Explicit Temporal Signals into Semantic IDs for Generative Recommendation
ChronoID 指出生成式推荐的语义 ID 是时间无关的,把'如何将显式时间注入 SID'拆解为时间编码(绝对/相对)、融合顺序(早/晚)、量化机制(残差/并行)三个正交维度并系统评测,发现相对时间+并行量化最优,同时贡献了一个杜绝未来信息泄漏的时间显式生成推荐基准。
semantic-id quantization transformer pretrained-lm academic
2026-06-12
生成式 Snapchat
8 │ 8 │ —
PauseRec Implicit Reasoning for Large Language Model-based Generative Recommendation
PauseRec 诊断出显式 CoT 在 SID 生成式推荐中失败的三大根因(世界知识难言语化、文本-SID 嵌入错位、rationale 脆弱),提出用可训练 <pause> token 做隐式 latent 推理替代显式 rationale,无需教师 CoT 与 RL,在三个 Amazon 数据集上 10/12 指标超过 RL-based 的 OneRec-Think,同时训练省 65% GPU 时、推理快约 3.5x。
pretrained-lm semantic-id test-time-scaling industrial
2026-06-12
生成式 Kuaishou
8 │ 8 │ —
OneRetrieval OneRetrieval: Unifying Multi-Branch E-commerce Retrieval with an Editable Generative Model
快手提出 OneRetrieval,首个可编辑的生成式电商检索:用 Keyword-Aligned Encoding 把每个 SID 位置绑定到可解释属性词并预留空槽,运营无需重训即可注入新词;深召回与最强生成式 baseline OneSearch 打平、干预命中率高出闭码本一个数量级,线上替换倒排/稠密双分支转化不降而 CTR 显著提升。
semantic-id search-ranking industrial pretrained-lm
2026-06-11
生成式 Google
8 │ 7 │ —
LLM-Based User Personas for Recommendations at Scale
Google 在十亿级视频推荐平台上用 LLM 实时生成自然语言用户兴趣画像(总结兴趣+探索兴趣),经知识蒸馏(Gemini Pro→Nano)+异步生成+量化压进工业服务链路,线上观看时长 +0.04%、活跃用户 +0.03%,增益主要来自轻度用户。
pretrained-lm knowledge-distillation quantization industrial
2026-06-10
生成式 Kuaishou
8 │ 8 │ —
AIR Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations
把 LLM 跨域意图推理离线化为'原子行为-意图对'缓存,在线只做意图树检索 + 目标感知检索 + MHA 融合,以约 400x 吞吐换取实时 LLM 语义,在快手电商取得 +3.446% GMV。
cross-domain pretrained-lm industrial cold-start
2026-06-09
判别式 Meta
7 │ 7 │ —
DUET DUET -- Dual User Embedding Transformers for Offsite Conversion Prediction
Meta DUET 把站外转化预估的上游用户嵌入预训练按统计机制分流——稠密点击流用多层自注意力(ClickAUE)、稀疏转化流用交叉+自注意力锚定(ConvAUE),两个互补嵌入冻结后经事件触发推理(ETI)异步 serving 喂给下游 ranker,训练 NE 降 0.38%、线上 CVR +0.66%/+0.15%。
transformer cross-domain quantization semantic-id ad-rec
2026-06-08
生成式 Netflix
7 │ 8 │ —
Mult-DPO Mult-DPO: Multinomial Direct Preference Optimization for Recommender Systems
把 DPO 从成对偏好推广到推荐系统的 set-wise 多正样本偏好:用同一奖励权重空间上的多项式(multinomial)代理事件替代难处理的边缘化 Plackett-Luce 似然,导出闭式 DPO 目标并证明其为 PL-DPO 损失的可处理上界(并以正/负累积权重比刻画紧致性),进一步扩展到多偏好层级 Mult²-DPO。
pretrained-lm rl academic
2026-06-08
生成式 OPPO
7 │ 7 │ —
ToolRec ToolRec: Calibrated Preference Alignment for Query Recommendation in On-Device Assistants
ToolRec(OPPO 小布)把端侧 LLM 查询推荐的偏好对齐拆为「锚定可执行动作」与「校准点击信号可信度」两步:用 708 工具的 SysToolkit + 上下文感知检索把推荐锚定到系统工具,再以用户活跃度 + 工具频率的双层样本重加权校准点击噪声并融入加权 KTO,在 1.5 亿 MAU 在线 A/B 上 CTR +3.32%、点击 +4.74% 且相关性几乎无损。
search-ranking rl pretrained-lm industrial
2026-06-07
生成式 JD
8 │ 8 │ —
AdaGRPO Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation
JD.com 的 AdaGRPO 把生成式推荐的 RL 对齐从『均匀施加奖励』改为『选择性准入』:保留监督 NLL 作静止锚,用两个 rank-based rollout 诊断(policy 侧困难度 × reward 侧可判别性)合取出一个 detached 二值 sample-level clip,只在『策略不确定且曝光偏置的 production ranker 局部可信』的样本上放行 GRPO 梯度,把 PPO 的 clip 从 ratio 域抬到 sample 域;offline HR@10 11.01%→12.18%(幻觉≤0.22%),线上 A/B effective IPV +0.43% 等显著提升。
industrial semantic-id rl pretrained-lm training-stability
2026-06-07
生成式 Yandex
8 │ 7 │ —
Gryphon Gryphon: A Unified Architecture for Semantic-ID Generation and Item-Level Scoring in Industrial Recommendations
Gryphon 在 encoder-decoder 语义 ID 生成式检索之上联合训练一个 item 级打分模块(ILSM),复用共享 encoder 的用户表征对 beam 生成 SID 解析出的具体 item 重打分,把最终 item 选择与失准的 beam 似然解耦并解决 SID 碰撞;工业音乐场景取得最高 item 级 Recall@1000(较 vanilla GR +3.7%),并在 7 天 A/B 中作为唯一召回源替换 15+ 召回器与 preranking 阶段且收听时长无显著变化。
semantic-id transformer quantization industrial
2026-06-07
判别式 学术
8 │ 8 │ —
DeRes DeRes: Decoupling Residual Stability and Adaptivity for Scalable CTR Prediction
DeRes 用"恒等残差(稳)+块注意力残差(变)"双路径 + 逐维向量门控重做 CTR Transformer 的层间连接,并用 SiLU 替 Softmax(Pointwise AttnRes)支持并行多兴趣与负权遗忘,在 <5% 额外 FLOPs 下让 8 层匹配 16 层 OneTrans(scaling 指数 γ=0.118 vs 0.071)。
transformer feature-interaction parameter-scaling industrial ad-rec
2026-06-06
判别式 Alibaba
8 │ 8 │ —
SSRLive SSRLive: Live Streaming Recommendation with Dynamic Semantic ID
淘宝提出 SSRLive,生成式-判别式混合的直播粗排:给每个直播间同时生成刻画主播稳定属性的静态 SID(历史多模态+Swing 协同对比)和追踪实时人气的动态 SID(实时特征经 RQ-KMeans+EMA 在线码本量化),用 task query 与用户-直播 cross-attention 把 SID 和用户-主播交互特征喂进多任务预测,全量服务数亿用户,线上观看时长 +3.38%、GMV +0.72%。
semantic-id quantization feature-interaction contrastive-ssl transformer
2026-06-05
生成式 Yandex
8 │ 7 │ —
GBLA Gated Bidirectional Linear Attention for Generative Retrieval
提出 Gated Bidirectional Linear Attention (GBLA)——训练与推理均为线性时间的双向注意力层(核化线性注意力 + Conv1D + key gating + gated RMSNorm);以 [SA,LA,LA] 混合编码器在 Yandex Music 上匹配双向自注意力的检索质量,并在 H100、长度 32768 下相对 FlashAttention-v3 取得最高 8.2× 单层加速。
transformer linear-attention semantic-id industrial
2026-06-05
生成式 Tubi
— │ 6 │ —
Shallow-RHS Bridging the Semantic-Collaborative Gap: An Asymmetric Graph Architecture for Cold-Start Item Recommendation
Tubi×Kumo 把物品冷启动重述为时序二部图上的归纳式图补全,提出非对称双塔 Shallow-RHS——内容塔刻意无 ID 无图、仅凭内在特征被图链接预测训练进 CF 感知空间,配合暖代理邻居 ANN 检索实现隐式图补全,并以人口统计 cohort 把同一原则推广到设备冷启动,线上 A/B 提升 TVT 与冷内容晋升速度。
cold-start industrial transformer contrastive-ssl pretrained-lm
2026-06-04
生成式 Kuaishou
9 │ 9 │ —
OneReason OneReason Technical Report
快手 OneRec 团队的推理基础模型 OneReason:通过四粒度感知预训练 + 三层认知 CoT 的 SFT + 专精后统一的 RL(域内 GRPO→RFT/MOPD),首次让生成式推荐的思考模式稳定超越非思考模式,已在快手本地生活广告线上部署(ROI>5)。
semantic-id pretrained-lm rl knowledge-distillation process-supervision
2026-06-04
other 学术
8 │ 8 │ —
Scaling Laws for Behavioral Foundation Models over User Event Sequences
用约600次iso-FLOP训练(10^15-10^19 FLOPs)系统标定行为基础模型(特征事件嵌入器+decoder-only Transformer预测下一事件)的scaling law:计算最优嵌入器仅约2%参数、行为模型低算力下数据偏多(D/N约340)并随算力向Chinchilla收窄(到36)、且评测指标本身是scaling law的一部分——sampled-softmax训练loss不是full-catalogue排序质量的可靠代理,换指标会改变计算最优配方。
parameter-scaling transformer academic
2026-06-03
判别式 Alibaba
8 │ 7 │ —
DSIRM DSIRM: Learning Query-Bridged Discrete Semantic Identifiers for E-commerce Relevance Modeling
DSIRM 把语义 ID 从生成式检索目标重新定位为电商排序的离散相关性特征——用 query 桥接对比 RQ-VAE(类目感知首层码本)学相关性感知的 item SID、微调 Qwen 生成 query SID,二者层级前缀匹配分增强排序 DNN,天猫离线 AUC +1.54%、线上 UCTR/UCTCVR +0.13%/+0.25%。
semantic-id quantization contrastive-ssl pretrained-lm search-ranking
2026-06-03
生成式 Kuaishou
8 │ 8 │ —
RGCD-Rep Bridging Short Videos and Live Streams: Reasoning-Guided Multimodal LLMs for Cross-Domain Representation Learning
快手 RGCD-Rep 用冻结大教师 MLLM 生成结构化跨域推理并蒸馏进轻量学生 MLLM,经 transferable-residual 查询感知聚合 + 行为/语义双信号路由学出可离线落库的短视频→直播跨域可迁移表征,全量部署服务 4 亿+ 日活。
cross-domain cold-start knowledge-distillation contrastive-ssl pretrained-lm
2026-06-03
LLM IBM
7 │ 7 │ —
Dynamic Short Convolutions Improve Transformers
提出动态短卷积作为 Transformer 的新原语——从隐藏状态生成输入依赖的深度卷积滤波器,在保留局部性归纳偏置的同时增强表达力;跨 150M–2B 稠密及 7B MoE 持续优于带/不带静态卷积的 Transformer,scaling law 显示 QKV 放置 1.33×、全线性放置 1.60× 的算力优势,并以自研 Triton 内核把训练额外开销控制在约 8%。
transformer parameter-scaling moe academic
2026-06-02
生成式 Kuaishou
8 │ 8 │ —
Taiji Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation
Taiji 是快手广告的工业级 LLM-as-Enhancer 框架,用逆向工程 CoT(RUPR)+PPL 拒绝采样(ORFT)提升推理数据质量,再以 POPO 在 GRPO 中动态做 LLM 语义奖励与推荐协同(CTCVR)奖励的 Pareto 最优加权,7B 模型离线多数指标超过 32B 教师,线上 A/B 提升 +2.83% ADVV/+3.30% Revenue,已部署服务 4 亿日活。
rl pretrained-lm knowledge-distillation cross-domain ad-rec
2026-06-02
生成式 Shopee
7 │ 7 │ —
DRQ Decoupled Residual Quantization for Robust Semantic IDs in Recommendation
提出诊断 Semantic ID tokenizer 失效的量化框架(期望重叠率 O_π / 有效码本容量 K_eff,把失效拆成分布惩罚与几何惩罚),并以解耦残差量化 DRQ(无 STE 的 VAE 连续重塑 + 事后层次 K-Means)作为概念验证,在 1500 万物品的工业短视频数据上揭示 tokenizer 质量是符号容量/重构保真/软匹配三者的多目标权衡。
semantic-id quantization contrastive-ssl industrial
2026-06-01
判别式 Kuaishou
7 │ 8 │ —
FlowTime FlowTime: Towards Continuous Generative Watch Time Prediction via Flow-based Personalized Priors
提出连续生成式回归(Continuous Generative Regression)新范式与 FlowTime——用一步式 VAE 学连续潜空间、再用基于用户/物品观看时长分位数历史的条件 Normalizing Flow 把高斯先验 warp 成个性化多峰流形,建模观看时长的多峰异质分布,避免点回归均值坍缩与离散化量化误差;快手线上 A/B 视频播放时长 +1.044%,并开源 WTP 基准库 TimeRec。
industrial normalizing-flow transformer
2026-05-31
判别式 Bilibili
7 │ 7 │ —
LeAP LeAP: Learnable Adaptive Permutation for Feature Selection in Heterogeneous and Sparse Recommender Systems
LeAP 把传统 O(N) 的置换特征重要性改造成 O(1) 批内可微门控,并用置换散度自适应正则化解异构维度与极端稀疏的评估偏差,在 Bilibili 十亿级请求、12000+ 维搜索排序模型上无损剪掉 3600+ 冗余维度。
feature-selection search-ranking industrial
2026-05-31
判别式 LinkedIn
8 │ 7 │ —
RQ-FSQ Quantizing Intent: Cross-Domain Semantic IDs from Organic Activity for Industrial Ranking
LinkedIn 首次实证跨域 viewer Semantic ID:把 organic feed 行为派生的预训练用户 embedding 用 RQ-FSQ(残差 VAE + 逐维有限标量量化)离散成 30-280× 更小的 SID,经 prefix n-gram 的 HDE 模块端到端注入广告 CTR 排序器,确立'行为活跃度丰富性决定跨域迁移质量',最冷启动用户段 +1.522% AUC。
semantic-id quantization cross-domain cold-start ad-rec
2026-05-31
判别式 Meta
7 │ 6 │ —
SCALR Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems
Meta 提出 SCALR,把跨域事件迁移重铸为合成数据生成:用重叠用户共现统计估计 item 翻译分布、从中采样把源域事件翻译成目标域格式的合成训练样本,再用加权损失做数据层、模型无关的跨域增强,在线 A/B 一致提升转化率。
cross-domain industrial ad-rec
2026-05-29
生成式 Pinterest
8 │ 8 │ —
PrefixMem LLMs Need Encoders for Semantic IDs Too
Pinterest 提出 PrefixMem——把 Semantic ID 当作像图像/音频一样需专用编码器的模态,用前缀 n-gram 哈希记忆表为每个 SID token 注入前缀条件表征,可独立预训练并跨 LLM 家族迁移,匹配算力下最深层 SID 准确率相对提升达 46%、硬样本上达 77%、稀有物品上达 115%。
semantic-id quantization pretrained-lm industrial cold-start
2026-05-29
生成式 判别式 Pinterest
9 │ 9 │ —
UniPinRec UniPinRec: Unifying Generative Retrieval and Ranking at Pinterest Scale
Pinterest 提出 UniPinRec——首个全栈统一检索与排序的生产系统(单输入格式/单共享骨干/单阶段联训), 靠 Masked Action Modeling 把动作监督加到非交错用户序列、靠跨进程 KV-cache 共享让排序复用检索的历史编码, 线上互动 +~1%、e2e 延迟 -11.1%、QPS +63.6%。
transformer search-ranking industrial sparse-attention quantization
2026-05-29
判别式 Coupang
7 │ 7 │ —
On the Practice of Scaling Search Conversion Rate Prediction
Coupang 关于工业搜索 CVR 预测缩放的经验研究:把缩放拆成 backbone/embedding/data 三维并实测各自的 log-linear 规律,证明三者收益 largely 独立可加,从而'小数据搜架构、全量训部署';配合 warmstart 重训与解耦 CPU-GPU 执行+动态批处理,最终以 8x 推理算力换来线上搜索转化率 +2.6% 且延迟近乎不变。
parameter-scaling feature-interaction search-ranking industrial
2026-05-28
判别式 ByteDance
8 │ 8 │ —
Rec-Distill Rec-Distill: An Industrial Distillation Pipeline for Large-Scale Recommendation Models
ByteDance 提出 Rec-Distill:把蒸馏收益分解为「教师 scaling 收益 × 可迁移性 η」,用解耦双塔学生 + 黑盒 CE 蒸馏 + 学生侧重校正去偏 + 批流混合流水线,把 24B 稠密参数/20K 序列教师的 scaling 收益迁移给轻量部署学生,峰值可迁移性 >60%,多场景在线 A/B 取得 GMV/时长等显著提升。
knowledge-distillation parameter-scaling industrial ad-rec search-ranking
2026-05-28
生成式 LUCID
7 │ 7 │ —
AMRS Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization
LUCID 真实部署的情感音乐推荐系统:用因果 Transformer 世界模型联合预测 engagement/rating/valence/arousal 作离线仿真器,先行为克隆生产策略再用世界模型打分的 DPO 做多目标偏好优化(KL锚定保安全),规避脆弱临床人群在线情感实验的伦理禁区。
industrial transformer rl cold-start
2026-05-27
判别式 Pinterest
8 │ 7 │ —
Fine-Tuned LLM as a Complementary Predictor Improving Ads System
Pinterest 把微调开源 LLM 当作'广告主预测器'(而非排序器)的互补信号源,从用户画像/转化历史预测高意图广告主并同时注入召回与排序,线上 U.S. Shopping RoAS 提升 4.94%/6.69%
ad-rec industrial pretrained-lm rl semantic-id
2026-05-27
LLM Meta
7 │ 8 │ —
MobileMoE MobileMoE: Scaling On-Device Mixture of Experts
Meta 提出首个面向端侧的 sub-billion 激活 MoE 模型族 MobileMoE,用一条联合内存+算力约束的端侧 MoE 扩展律推出'适中稀疏度+细粒度+共享专家'甜点架构(E=8,g=8,1 共享专家),经四阶段配方(PT→MT→SFT→INT4 QAT)在 14 个 benchmark 上以 2-4x 更少推理 FLOPs 匹配/超过稠密小模型,并首次在商用手机上以自定义 fused MoE kernel 实现 1.8-3.8x prefill、2.2-3.4x decode 加速。
moe quantization parameter-scaling pretrained-lm transformer
2026-05-26
判别式 Alibaba
7 │ 6 │ —
Uniboost Uniboost: Global Coordination with Value Alignment for Fair and Efficient Traffic Allocation
淘宝混排(重排)阶段的统一流量分配框架:先把抽象混排分线性对齐到稳定锚定指标(有效完播率)赋予业务语义,再用带偏置项的统一线性 Boosting 收编 PID 保量(w=0)与冷启 Boost(b=0)两套机制并保证线性可加归因,支持按计划的成本/ROI 分析,线上 A/B 在淘宝内容流取得一致提升。
search-ranking ad-rec cold-start industrial
2026-05-26
LLM Ant Group
7 │ 7 │ —
PowLU PowLU: An Activation Function for Stable Pre-Training of LLMs
提出 PowLU 激活函数,用有理幂指数 1+m/(√x+1) 把 SwiGLU 正区间的二次增长平滑压到近线性以抑制激活/梯度 outlier,在 7.9B/124B Ling LLM 上消除 FP8 低精度训练的 loss spike,同时保持与 SwiGLU 相当的性能。
transformer moe parameter-scaling training-stability industrial
2026-05-25
判别式 Tencent
8 │ 8 │ —
SIREN SIREN: Unified Multi-Granularity Semantic Interaction for Multi-Modal Lifelong User Interest Modeling
SIREN 把多模态信号从'晚融合'改为 item 级'早融合':用 prefix-encoded SemID(刻画语义)+ target-aware 相似度桶(刻画相关性)两路互补边信息,与 ID 协同特征在 target-conditioned 注意力内统一交互;GSU 另提供 SemID 硬检索把在线成本降 90%+。腾讯微信广告全量上线,三场景 GMV +1.61%~+3.87%。
semantic-id industrial ad-rec cold-start transformer
2026-05-25
生成式 Alibaba
8 │ 8 │ —
DeGRe DeGRe: Dense-supervised Generative Reranking for Recommendation
提出 DeGRe:基于累积回归的前瞻评估器用 beam search 离线挖掘未曝光排列空间的高价值序列,再以混合蒸馏(硬标签+软标签+序列加权)把 step-wise 稠密监督灌入轻量在线生成器,离线-在线解耦下仅需一次贪心解码即可逼近全局最优,解决生成式重排的启发式标签偏差与信用分配两大问题,淘宝闪购线上 GMV +3.75%。
industrial transformer knowledge-distillation process-supervision
2026-05-25
判别式 Taboola
7 │ 7 │ —
rDCN Context Features Are Cheap: Rank-Aware Decomposition for Efficient Feature Interaction in Recommender Systems
提出 rank-aware 分解:利用上下文(rank-2,跨候选共享)与目标(rank-3,逐候选)特征的秩不对称,把上下文-only 计算从每候选一次降到每请求一次,对 FM/FC/DCNv2/attention 精确等价,Taboola 生产 DLRM 排序器单 pod 吞吐 +87.5%(p99 -33%);并提出贯穿全深度的架构变体 rDCN(省 67% FLOPs)。
feature-interaction industrial ad-rec
2026-05-24
判别式 Alibaba
8 │ 7 │ —
HeteGenCTR Self-Balancing Gradient Allocation for Heterogeneity-Aware Feature Generation in Click-Through Rate Prediction
提出 HeteGenCTR:用一组 per-field 可学难度标量(源自不确定性加权)同时驱动自平衡损失与难度引导注意力,纠正离散扩散生成式 CTR 预训练中易域主导梯度、难域(ID/序列)欠拟合的不均衡;五基准+7天线上A/B(+4.7% CTR,冷启动+9.2%)验证。
diffusion feature-interaction transformer cold-start ad-rec
2026-05-24
判别式 Alibaba
8 │ 8 │ —
UTTSI Selective Test-Time Compute Scaling for Click-Through Rate Prediction via Uncertainty-Triggered Feature Path Exploration
UTTSI 是首个免训练、模型无关的测试时计算扩展框架,用双信号(logit置信+频率先验attribution加权)估计 per-instance 不确定性并按比例分配 K(x) 条特征探索路径,把 LLM 的 test-time scaling 迁移到工业 CTR,7 天线上 A/B 取得 +5.3% CTR。
test-time-scaling feature-interaction ad-rec industrial
2026-05-24
判别式 Tencent
8 │ 7 │ —
RankElastor Expand More, Shrink Less: Shaping Effective-Rank Dynamics for Dense Scaling in Recommendation
从有效秩动力学视角诊断 RankMixer 的嵌入坍缩(token mixing 扩张、P-FFN 收缩的阻尼振荡轨迹),提出 RankElastor 用参数化全混合 + GLU 改进 P-FFN 实现'多扩张、少收缩',在 Criteo/Avazu 上 AUC 提升达 0.001 并展现更优稠密参数 scaling。
feature-interaction parameter-scaling transformer industrial
2026-05-22
判别式 Alibaba
8 │ 7 │ —
AKT-Rec From Head to Tail: Asymmetric Knowledge Transfer in Long-tail Recommendation with Generative Semantic IDs
阿里天猫提出 AKT-Rec,用高碰撞 RQ-VAE 把 LLM/MLLM 语义表示聚成语义簇,通过 stop-gradient 非对称 InfoNCE 实现头→尾单向知识迁移 + 活跃度双层门控,在不损头部精度下提升长尾 CTR,线上 GMV +3.47%。
semantic-id cold-start contrastive-ssl quantization pretrained-lm
2026-05-22
生成式 Netflix
8 │ 7 │ —
Towards Generalizable and Efficient Large-Scale Generative Recommenders
Netflix 把生成式推荐骨干从 2M 缩放到 1B,把模型规模降格为生产迁移问题里的一个变量:提出任务相关的 offset 幂律 scaling law 作为'哪些任务还有剩余空间'的诊断,并用采样 softmax+投影 d/8 解码头(降重训成本)、多 token 预测(对齐缓存服务的标签错配)、语义物品塔+协同 embedding 掩码(冷启动)把规模红利传导到下游;1M 用户一周生产 shadow 中 1B 全面优于 2M,冷启动 +28.1%。
transformer parameter-scaling cold-start industrial pretrained-lm
2026-05-22
生成式 Kuaishou
8 │ 8 │ —
RPORec Reinforced Preference Optimization for Reasoning-Augmented Recommendations
RPORec 用文本接口解耦「生成显式 CoT 的 LLM backbone」与「检索式推荐头 Rechead」:Stage I 冻结 backbone 训 Rechead,Stage II 冻结 Rechead 当稠密 verifiable 奖励 + CoT 质量奖励用 GRPO 精炼 backbone,同时规避隐状态扭曲推理与文本→item 语义鸿沟;3 个 Amazon 数据集超 SOTA,工业广告 A/B Revenue +1.348%。
rl pretrained-lm process-supervision ad-rec industrial
2026-05-21
判别式 Meta
8 │ 5 │ —
LLM Retrieval for Stable and Predictable Ad Recommendations
Meta 提出量化广告系统稳定性/可预测性的 A/A'(StatSigDiff)度量框架,并用微调 LLM 从广告创意抽取层级语义属性、构建 ad-to-ad 语义图做图遍历召回,在线上 A/B 中同时改善可预测性(A/A' -8.62%、MAD +45%)与传统性能(顶线 +0.45%、召回 +1.2%)。
ad-rec industrial pretrained-lm cold-start
2026-05-21
判别式 ByteDance
8 │ 8 │ —
FLUID FLUID: From Ephemeral IDs to Multimodal Semantic Codes for Industrial-Scale Livestreaming Recommendation
提出 FLUID,首个在生产级直播排序中彻底退役候选侧 item ID 的框架:用跨域多模态编码器(SigLIP2+Qwen3,联合短视频与直播训练)经 RQ-KMeans 生成离散分层语义码 LUCID(区分瞬态 slice 级与持久 room 级),通过 prefix n-gram embedding 后融合进排序器,并用 slice add-on→item ID phase-out→room add-on 三阶段 warmup 绕开 item ID 的捷径与优化非对称性;在十亿级直播平台线上取得 Quality Watch Duration +0.55%、Cold-Start Room Views +2.05% 等一致收益。
semantic-id cold-start quantization industrial pretrained-lm
2026-05-20
判别式 ByteDance
7 │ 8 │ —
PEARL PEARL: Unbiased Percentile Estimation via Contrastive Learning for Industrial-Scale Livestream Recommendation
PEARL 把工业直播 watch-time 预测重构为非参数的每用户分位数估计,证明'当前样本是否大于一个随机历史样本'的对比指示其期望即真分位(无偏 CDF 估计),并扩展出多样本降方差、价值加权、自举与回归协同训练;十亿级上线带来 +2.10% 观看时长,且对低活跃用户 UAUC 大幅提升。
industrial contrastive-ssl
2026-05-20
other 学术
7 │ 8 │ —
BlockQuant Block-Sphere Vector Quantization
BlockQuant 把 rotation-based 向量量化的码本从 coordinate-wise scalar 推广到 block-on-sphere——按球面均匀分布解析推导的精确块边缘分布做 K-means,在 MSE/IP 失真两个准则上严格优于 EDEN/RabitQ/TurboQuant,p=d 时达到本文修正后的 Shannon 下界;在 Llama-3.1-8B KV-cache 3.5-bit 量化下 LongBench-E 平均 44.03 接近 full cache 44.15。
quantization academic
2026-05-19
生成式 学术
8 │ 8 │ —
VarLenRec Learning Variable-Length Tokenization for Generative Recommendation
VarLenRec 首次实证发现生成式推荐中的 Popularity-Length Paradox(热门 item 适合短 SID、长尾 item 需要长 SID),提出 PIBA 闭式定理 L*∝p^(-α/γ)、Hyperbolic Adaptive Residual Quantization、可微 Soft Length Controller 与下游碰撞/length-bias/hallucination 三件套,在 Amazon Beauty/Sports/Toys/Yelp 上一致超越 TIGER/LC-Rec/LETTER/ETEGRec,碰撞率从 12.7% 降至 3.2%,且训练/推理更快。
semantic-id quantization academic
2026-05-18
判别式 Kuaishou
8 │ 8 │ —
DADF DADF: A Distribution-Aware Debiasing Framework for Watch-Time Regression in Recommender Systems
DADF 是 Kuaishou 提出的二阶 watch-time 残差去偏框架,通过 group-specific Box–Cox 变换稳定长尾乘性校正因子、按 duration 分专家建模异质残差、并复用首阶段 engagement 头的 logits/tower 表征作为推理时信号,在 7 个 backbone 上一致提升 MAE/XAUC 并在 Kwai 线上获得 +0.347% 人均时长。
industrial moe
2026-05-18
生成式 Alibaba
9 │ 9 │ —
GrowthGR Towards Sustainable Growth: A Multi-Value-Aware Retrieval Framework for E-Commerce Search
GrowthGR 把新品冷启拆成 ItemLTV(counterfactual uplift 估计)+ MultiGR/MoPO(多价值 GRPO 变体 + CIW 抵消 popularity bias)的两阶段框架,在 Taobao 主搜索上线 2 月获得新品 GMV +5.39%、整体 GMV +0.31%、TI@30 +20.0% 的工业级长期增长收益。
semantic-id rl cold-start search-ranking industrial
2026-05-18
生成式 Huawei
7 │ 8 │ —
RAGR RAGR: Review-Augmented Generative Recommendation
RAGR 把生成式推荐的统一 RQ-VAE tokenizer 同时用在 user review 文本上得到 review SID,与 item SID 按时间交错构成行为-语义混合序列同时训练 next-item / next-review SID 生成,再用 DPO 把 next-item 设为 chosen、next-review 设为 rejected 维持 item-centric 任务边界,在 Amazon Beauty/Toys/Sports 上对 TIGER 和 LETTER 两个 backbone 均带来 7%-26% 的 HIT/NDCG 提升。
semantic-id transformer pretrained-lm rl academic
2026-05-17
生成式 Nokia
8 │ 8 │ —
SAPO SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation
SAPO 把 reasoning-based 生成式推荐的 RL credit-assignment 单元从 rollout 下沉到「thinking block + 配对 SID token」这一 reasoning step,配套 per-step verifiable match reward、per-step group-relative advantage 与 step-normalized token aggregation,在三个 Amazon 类目上稳住稀疏 exact-match RL 训练并一致领先 NDCG。
rl semantic-id process-supervision pretrained-lm academic
2026-05-17
生成式 学术
7 │ 8 │ —
Ghost Echoes in Filter Bubble: Diagnosing and Curing Popularity Bias in Generative Recommenders
Ghost 把生成式推荐流行度偏差归因于 MLE 下 tail token 的梯度饥饿与未差异化 tokenization 导致的多步几何 bias 放大,分别用 Skeleton-Founded Tokenization (head 训骨架、tail 继承前缀+加 tail-specific token) 和 Asymmetric Unlikelihood Optimization (对高文本相似度但 SID 分叉的 head 干扰集施加非对称 unlikelihood 损失) 治理,在 3 个 Amazon 数据集上 Tail HR/NDCG +63.91%/+70.66%、MGU -55.76%、CNS +16.81%。
semantic-id quantization pretrained-lm academic
2026-05-16
生成式 Tencent
7 │ 8 │ —
AsymRec Asymmetric Generative Recommendation via Multi-Expert Projection and Multi-Faceted Hierarchical Quantization
AsymRec 识别 GenRec 中对称 SID 表示导致的输入端 popularity-bias / 输出端 dimensional-collapse 双瓶颈,提出非对称连续-离散框架:MSP 用 MoE 投影直接消化连续 embedding 作为输入,MHQ 在 M 个正交子空间内做 EMA 残差量化提供高保真离散监督,在 4 个 Amazon 子集 NDCG@10 平均 +15.8%、广告 pCVR 在线 A/B +1.9% GMV。
semantic-id quantization moe industrial transformer
2026-05-14
生成式 Alibaba
— │ 8 │ —
CQ-SID Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL
阿里 TmallAPP 把生成式检索定位为多级漏斗的召回补充而非端到端替代,提出 CQ-SID(类目约束 + Query-Item 对比的语义簇 SID)+ 4 阶段渐进 SFT + EG-GRPO(向 GRPO group 注入 K 条 ground-truth SID 缓解稀疏奖励坍塌),离线 hitrate 相对 RQ-VAE +26.76%、beam size -53.85%、线上 GMV +1.15%,单链路贡献全平台 72.63% 购买。
semantic-id rl contrastive-ssl pretrained-lm search-ranking
2026-05-14
生成式 判别式 Meituan
8 │ 8 │ —
DIG Discrimination Is Generation: Unifying Ranking and Retrieval from a Tokenizer Perspective
DIG 把 RQ tokenizer 嵌入 DIN+DCNv2+MoE 判别式排序器内部,用 BCE ranking loss 端到端驱动 SID codebook 构造,通过 feature assignment taxonomy + MLP_u2t 蒸馏让同一模型既做排序又通过 beam search 做生成式检索,相对 SOTA SID baseline 在 5 数据集上取得 +52%~+220% R@10 gain 且同步改进排序 AUC。
semantic-id quantization feature-interaction knowledge-distillation industrial
2026-05-14
LLM 学术
7 │ 7 │ —
EMO EMO: Frustratingly Easy Progressive Training of Extendable MoE
EMO 把 MoE 专家池视作可扩展的参数化记忆,在预训练中分五阶段将总专家数从 8 倍增到 128(激活数 k 固定为 8),并用系数与指数都显式依赖 E 的稀疏度 scaling law 解出每个专家数下的 compute-optimal 累计 token 数、差分归一化成各阶段预算(23.5%/9.5%/16.5%/21.8%/28.6%);在 1.92T token、9.6B-A1.1B、32×H200 上最终 loss 1.017 对比固定 E=128 的 0.994,省 10% GPU 小时并明显优于固定 E=16/32,代价是 GSM8K 落后 7.64 点且推理成本毫无节省。
moe parameter-scaling transformer academic
2026-05-13
生成式 Huawei
8 │ 6 │ —
TurboGR TurboGR: An Accelerated Training System for Large-Scale Generative Recommendation
TurboGR 是华为面向 Ascend NPU 的生成式推荐训练系统,把 GR 训练的三大瓶颈——jagged 变长序列的 padding 冗余与设备间负载倾斜、稀疏 embedding 与稠密主干耦合导致的 all-to-all 通信瓶颈、token 级负采样的 HBM 爆炸——分别用 Ascend 亲和的 jagged 融合算子(显存 −70%、延迟 2.2×)加按 token 数排序贪心再分配(设备间负载不均 47.01%→2.40%)、分层稀疏并行 HSP(all-to-all −75.9%,靠重构反向算子让各组 AdaGrad 二阶矩同步演化从而与集中式训练数学等价)加带 O(αLτ/T) 收敛界的稀疏异步/稠密同步解耦(未掩盖通信 24.12%→2.19%)加六批次细粒度流水线(NPU 计算占比 94%、空闲 <1%)、以及负样本 embedding 的 CPU 分段卸载加双缓冲预取加 FP16 量化加批内 logit 共享(HBM −24.59%,精度损失 ≤0.05%)逐一化解,在 KuaiRand-27K 上把 0.2B 参数的 FuXi-long 做到 54.71% MFU 与 0.97 近线性扩展,是首个面向 Ascend 开源的 GR 训练系统;但全部对比基线均为 Ascend 上的朴素实现,既无 GPU 横向对照也无线上部署数据。
industrial transformer parameter-scaling quantization training-stability
2026-05-13
LLM 学术
7 │ 8 │ —
A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning
用树上广播过程构造分布已知且可解析的层次化合成语言,以 exact k-gram ansatz 替代有界上下文 transformer,证明 Ising(软约束)下生成和的归一化方差按上下文深度 w 呈 log 线性 w·log(dρ²) 且峰度收敛到高斯、coloring(硬约束)冻结相下有界上下文几乎必然生成与任何合法着色都不相容的序列,二者共同给出忠实采样长度 n 序列所需的 Ω(n) 上下文下界;反之仅 Θ(log n) 位工作记忆的自回归推理模型即可精确采样真语言(DFS 式记忆构造,与广播信道无关),并用从零训练的 nanochat transformer 在很宽上下文范围内定量复现全部预测。
transformer parameter-scaling academic
2026-05-13
LLM 学术
7 │ 7 │ —
SZP When is Warmstarting Effective for Scaling Language Models?
系统回答「热启动(从小 checkpoint 生长出大模型)何时真的划算」:把生长算子解耦成 growth×shrink×perturb 三轴得到架构无关的 SZP,证伪「初始化时函数保持是必要条件」,用 IsoFLOP 扫描确立生长因子上界 g_upper(超过即不如从头训、且该上界只取决于架构比而非绝对尺寸),再用 Chinchilla 式 scaling law 的差值等值线预测 WS 与 Scratch 的交叉边界,给出 g=2、≤20 tokens/param、µP 迁移三条实践准则。
parameter-scaling pretrained-lm transformer training-stability academic
2026-05-13
other Ant Group
7 │ 8 │ —
MaskTab MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification
MaskTab 是面向工业级表格分类的统一预训练框架:用专用 [MASK]/[MISS] token 编码'缺失即信号',孪生双路混合监督同时学重建与分类避免 train-test mismatch,MoE 重建头实现高维特征自适应分组扩容,在 TabReD 8 任务平均排名 2.3、CreditRisk 上 +5.04% AUC 与 +8.28% KS,蒸馏到 500 可解释特征仍 +2.55%/+4.85% 且推理快 9.3×。
industrial transformer moe parameter-scaling knowledge-distillation
2026-05-12
生成式 学术
7 │ 8 │ —
ComeIR Conditional Memory Enhanced Item Representation for Generative Recommendation
ComeIR 把 Engram 风格静态稀疏记忆外置到生成式推荐的表征构造接口,用 MM-guided token scoring 解决身份保持、dual-level intra/inter Engram 解决 SID 结构保持、Memory-restoring Prediction Head 在解码端复用同套记忆打通输入-输出粒度错配,在 Yelp/Industrial/Instrument 上 H@5 平均提升 8% 并实现 2.5× 推理加速。
semantic-id transformer quantization pretrained-lm sparse-attention
2026-05-12
生成式 学术
— │ 8 │ —
TwiSTAR TwiSTAR: Think Fast, Think Slow, Then Act, Generative Recommendation with Adaptive Reasoning
TwiSTAR 提出一种 agentic 生成式推荐框架:训练一个 planner 自适应地为每条用户历史调用三种工具之一(fast SID 检索、ranking、slow CoT 推理),通过把 I2I 共现转写为自然语言注入协同常识、并仅在 hard 样本上 GRPO 训练 slow 模型,在 Amazon Beauty/Sports/Toys 上 NDCG@10 全面超过 OneRec-Think 且推理延迟比 uniform slow reasoning 降低 3.3x。
semantic-id pretrained-lm rl academic test-time-training
2026-05-12
LLM 学术
— │ 7 │ —
The Geometric Wall: Manifold Structure Predicts Layerwise Sparse Autoencoder Scaling Laws
用 pullback 信息几何把 SAE 重构误差的层级差异归因于激活流形的内禀维度与多尺度曲率:在 844 个 Gemma Scope checkpoints 上拟出几何条件 scaling law,在 2B↔9B 之间几何回归系数迁移 R²>0.92,识别 SAE 遭遇的不是有限算力天花板而是流形几何决定的几何墙。
pretrained-lm parameter-scaling academic
2026-05-11
other Xiaohongshu
— │ 8 │ —
CCD-Level and Load-Aware Thread Orchestration for In-Memory Vector ANNS on Multi-Core CPUs
针对 chiplet 时代多 CCD CPU 上向量 ANNS 加核不加吞吐的瓶颈,提出 hot-cold 均衡映射 + CCD 拓扑感知任务窃取 + 快照重映射的统一线程编排框架,在 RedNote 生产环境 HNSW/IVF 服务上取得 1.4–3.7× 吞吐和 30–90% P50/P999 延迟改善。
industrial
2026-05-11
生成式 Baidu
8 │ 8 │ —
LASAR LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation
把 Coconut 风格递归 hidden-state feedback latent reasoning 首次完整移植到主流 decoder-only 生成式推荐:两阶段解耦(先 SID alignment 再 latent loop)+ 每步 bidirectional KL 对齐到 explicit CoT 段 + Policy Head + REINFORCE 做样本级自适应推理步数,在 Amazon 三数据集上几乎全 SOTA,比生成显式 CoT 快约 20×。
pretrained-lm rl semantic-id recursive-depth process-supervision
2026-05-11
LLM 学术
— │ 7 │ —
Language Models Without a Trainable Input Embedding Table: Learning from Fixed Minimal Binary Token Codes
用 K=⌈log₂V⌉ 比特的固定二元 token 码 + 零参数 tile lift 替换 67.1M 的可训练输入嵌入表,在 32 层 17B tokens 训练下 PPL 不退化 (2.36 vs 2.44,差距在 4.8% seed 区间内),构造性地证明 LLM 输入侧的 trainable embedding table 不是架构必要项。
transformer academic
2026-05-10
LLM 学术
8 │ 9 │ —
Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World
提出 8 参数闭合形式扩展 L(N,D,T)=E+(L₀−E)h/(1+h),把 loss 分解为 undercapacity、undertraining、overfitting 三项并用饱和包装器限定在 [E, L₀];跨 4 个架构域和 5 个公开 LLM grid 取得 SOTA 外推,并给出 data-vs-compute 价格比驱动的 closed-form 成本最优分配。
parameter-scaling transformer academic
2026-05-09
判别式 Kuaishou
8 │ 9 │ —
UxSID UxSID: Semantic-Aware User Interests Modeling for Ultra-Long Sequence
UxSID 提出 ULSM 的第三条范式:用 target SID 作为语义路由键,按 (UID, SID) 索引离线压缩用户兴趣 memory,online O(1) 拉取,在快手 4 亿用户广告平台一周 A/B 实现 +0.337% Revenue 且仅增加 +0.16 ms 延迟。
semantic-id industrial ad-rec quantization sparse-attention
2026-05-09
生成式 Tencent
7 │ 8 │ —
NewsRec-Chat Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation
腾讯 NewsRec-Chat 用 Generate-then-Match 范式将对话式新闻推荐从 retrieve-first 转为 LLM 直接生成 3 层 SID prefix + fuzzy match,结合 PADR 自适应 warm/hybrid/cold 推理路径,7B 模型在 152K SID 空间架构级保证 0% 幻觉,冷启动 L1 18.0% 反超 warm 11.9%。
semantic-id cold-start pretrained-lm knowledge-distillation industrial
2026-05-08
生成式 学术
7 │ 8 │ —
TGH An Embarrassingly Simple Graph Heuristic Reveals Shortcut-Solvable Benchmarks for Sequential Recommendation
用故意设计极简的免训练图启发式 TGH 审计 87% 生成式推荐论文使用的 Amazon Review benchmark,揭示三种数据集 shortcut 结构(低分叉局部转移 / 特征平滑 / 短历史足够),TGH 在 14 个数据集中 10 个 best/second-best,呼吁 capability-aware evaluation。
industrial pretrained-lm
2026-05-08
生成式 Snapchat
8 │ 8 │ —
Latte Expressiveness Limits of Autoregressive Semantic ID Generation in Generative Recommendation
Latte 把目标 SID 前预置一个随机 latent token,把单棵 SID 解码树展开成森林,松弛由 tree-distance 强加的概率耦合,从而打破 GR 在 rank-reversal 与 forced-transitivity 两类基本场景上的表达力极限,在 Amazon Reviews 三类目带来 NDCG@10 +3.45% 的相对提升。
semantic-id transformer academic
2026-05-07
生成式 Tencent
— │ 8 │ —
UniVA Unified Value Alignment for Generative Recommendation in Industrial Advertising
UniVA 在腾讯微信视频号广告平台上提出统一价值对齐的生成式推荐框架,通过 Commercial SID 分词器、Generation-as-Ranking 双头解码器和 eCPM-aware 强化学习实现 SID 构造、解码和服务三层的商业价值对齐,离线 HR@100 提升 37.04%,线上 GMV +1.50%。
transformer moe pretrained-lm rl recursive-depth
2026-05-07
LLM 学术
7 │ 7 │ —
AIR-MoE Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts
AIR-MoE 把 IVF 倒排索引思想搬进端到端可训练的 MoE 路由:用 gradient-free 自适应球面 k-means 学一个 codebook 做 coarse shortlisting,再在短名单内做精确 top-K 打分,在 65k experts 设定下持续优于 PEER/Hierarchical 基线,PPL 改善最高 10% 而无需对专家中心施加结构约束。
moe transformer quantization academic
2026-05-06
生成式 学术
7 │ 7 │ —
BLADE Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation
把 LLM4Rec 的 BoN alignment 中静态参考导致的 high-reward CDF 饱和与梯度衰减形式化为两大瓶颈, 用 Beta-Binomial 共轭闭式融合 static prior 与 dynamic batch evidence 构造自演化 quantile 目标, 与 GRPO 共享 sampling 实现 zero-overhead, 在 3 个数据集 8 个 baseline 一致领先并可推广到 fairness/diversity 复合目标.
pretrained-lm rl academic
2026-05-06
生成式 Alibaba
7 │ 6 │ —
RecGPT-Mobile RecGPT-Mobile: On-Device Large Language Models for User Intent Understanding in Taobao Feed Recommendation
RecGPT-Mobile 把 LLM 下沉到 Mobile Taobao 客户端做 next-query 意图预测:用 LoRA+Quant 把 Qwen3-0.6B 压到端侧,4 阶段自适应 prompt 构建严守 token 预算,熵+Jaccard+JS 三信号意图漂移触发把推理频率降到 21%、电量降到 40%,4 场景一个月 A/B 平均 +1.8% CLICK / +2.7% PAY / +2.5% GMV。
pretrained-lm quantization industrial search-ranking
2026-05-06
other Alibaba
8 │ 8 │ —
HLEM One Pool, Two Caches: Adaptive HBM Partitioning for Accelerating Generative Recommender Serving
HLEM 把 GR serving 中 EMB cache 与 KV cache 争抢同一块 HBM 的零和问题建模为 MDP,用 PPO+OnlineAdapter+RecoveryController 三层控制器以 32μs 决策开销追踪在线最优分配,配 paged KV pool/contiguous EMB slab 实现非干扰式调整和 EMB-KV-aware 路由,在 32 节点 A100 集群上比最强静态基线降低 P99 24-38%,达成 93.5-99.6% SLO 满足率
industrial transformer rl
2026-05-06
生成式 学术
8 │ 9 │ —
CapsID CapsID: Soft-Routed Variable-Length Semantic IDs for Generative Recommendation
CapsID 用 capsule 软路由替代 RQ-VAE 的硬 argmax 分配,配合置信驱动变长 SID 与语义 + 频率双门控的 SemanticBPE 子词合并,在 3 个 Amazon 数据集上相对最强 single-rep baseline R@10 提升 8.9–11.0%,并在 35M item 工业目录上以 51% 的 COBRA 推理延迟追平或超越其指标。
semantic-id quantization transformer industrial
2026-05-06
other 学术
7 │ 7 │ —
ReClaim Foundation Models to Unlock Real-World Evidence from Nationwide Medical Claims
Yale 团队在 MarketScan 200M 入组人 43.8B 理赔事件上从零训练 1.7B Qwen3 风格 healthcare foundation model ReClaim,1208 病发生预测平均 AUC 75.57% 显著超越 LightGBM 和 Delphi,instruct token post-training 用 100K 样本带来 +13.76pp 单步跃升,并将 foundation model embedding 引入倾向得分使 RWE 因果推断 EASE 偏差降低 72%。
transformer parameter-scaling academic
2026-05-04
LLM ByteDance
8 │ 9 │ —
InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
InfoLaw 把 LLM 训练重新刻画为信息累积过程,引入 quality density f_d=e^{-θd} 与 log(K) 归一化的指数衰减 1-e^{-λ(N)R/log(K)},把不同 mixture × scale × repetition 的 loss 坍缩到一条 L=α·info^{-β} 的统一幂律;从 252M-1.2B + 3 mixture 拟合,外推到 7B + 425B token mean error 0.15%/max 0.96%,并能在 100k 候选中选出 prescriptive 最优 recipe(小模型偏 quality、大模型偏 diversity)。
transformer parameter-scaling industrial
2026-05-04
判别式 Tencent
7 │ 7 │ —
FEDIN FEDIN: Frequency-Enhanced Deep Interest Network for Click-Through Rate Prediction
FEDIN 通过实证发现用户兴趣谱在目标物品条件下呈现低熵集中模式,提出 target-aware 复值 MLP 频谱滤波 + 双分支(时域 patch Transformer + 频域)+ Top-k Target Attention 融合,在三个公开 CTR 数据集上一致超越 DIN/DIEN/SASRec/DIFF 等基线。
transformer sparse-attention academic
2026-05-03
LLM Meta
8 │ 8 │ —
Compute Optimal Tokenization
本文用 988 个 BLT + 320 个 subword 模型系统研究 tokenizer 压缩率对 scaling law 的影响,把 Chinchilla 的 '20 token/param' 推广为 '~60 byte/param 跨 tokenizer 不变',并发现最优压缩率随 compute budget 下降、随语言 parity 上升。
parameter-scaling transformer academic
2026-05-02
LLM 学术
8 │ 8 │ —
Prescriptive Scaling Laws for Data Constrained Training
在 Chinchilla scaling law 上加一个简单的加性过拟合惩罚项 P·R_D^δ·(N/U_D)^κ,1 个自由参数即让 multi-epoch R² 从 0.58 跃至 0.95,给出 'compute 超过阈值后扩大模型而非加 epoch' 的反直觉但实测最优的分配建议,并把过拟合代价孤立为单一系数 P 解释 strong weight decay 在数据受限场景下削减 P 70% 的现象。
transformer parameter-scaling academic
2026-05-02
生成式 学术
7 │ 7 │ —
PAD-Rec Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation
PAD-Rec 通过在 speculative decoding 草稿模型中注入 within-item slot 与 draft-step 位置嵌入并加门控融合,针对生成式推荐的 SID 结构与多步不确定性进行结构感知加速,在四个公开数据集上取得最高 3.1× wall-clock 加速且基本不损失推荐质量。
semantic-id transformer pretrained-lm knowledge-distillation academic
2026-04-30
生成式 学术
7 │ 7 │ —
CARD CARD: Non-Uniform Quantization of Visual Semantic Unit for Generative Recommendation
CARD 通过把文本/视觉/协同信号渲染为统一卡牌图像并由 SigLIP2 编码、再用可学习可逆的非均匀变换(Kumaraswamy CDF 或 scaled logistic)在残差量化前将 latent 矫正到近似均匀空间,同时解决生成式推荐中 SID 异质融合监督不足与 codebook 利用不均两大瓶颈。
semantic-id quantization transformer academic
2026-04-29
LLM Naver
7 │ 7 │ —
RRK Efficient Listwise Reranking with Compressed Document Representations
RRK 把 PISCO 风格的多 token soft compression 引入 listwise reranking,每文档压缩为 8 个 memory token 后由 LoRA 微调的 8B Qwen2.5 reranker 单次前向 + 余弦打分,蒸馏 jina-v3 教师;BEIR 上比 0.6–4B reranker 快 3×–18×,长文档场景效率优势放大到 10×–58×。
pretrained-lm search-ranking knowledge-distillation academic
2026-04-29
生成式 Meituan
7 │ 7 │ —
FLR Factorized Latent Reasoning for LLM-based Recommendation
FLR 把 LLM 推荐里的 latent reasoning 从单一向量分解为 K 个互相解耦的偏好因子,配合多因子注意力+正交/多样/稀疏正则与重新设计的 GRPO(噪声扰动探索+token confidence/exact match 混合奖励+L2 归一 advantage),在 Amazon 四子集上稳定优于 LatentR³。
pretrained-lm rl transformer academic
2026-04-29
生成式 Kuaishou
8 │ 5 │ —
RecoChain Harmonizing Generative Retrieval and Ranking in Chain-of-Recommendation
RecoChain 把生成式推荐「能 beam 出候选却判不出优劣(从 beam-256 里选 top-10)」的能力鸿沟归因为 GR 骨干缺失 SIM/TWIN 那一支目标物品感知的检索式序列建模,于是让同一个 decoder-only 骨干在层次 beam search 生成四位 SID(RQ-Kmeans 三位语义码 + 随机第四位去重码)并确定性映射回 item ID 后,用该候选的多模态 embedding 在 >10000 条超长历史上做余弦 GSU 检索取 top-M 子序列、按原时序拼接为后续 token 以 KV-cache 增量续写,在最后的候选 item ID 位置过 RankHead 出点击概率,与生成 log-prob 相加得最终排序分,训练时 SID 的 NTP 损失与 beam 级 0/1 BCE 无权重相加;TAOBAO-MM(8.79M 用户 / 35.4M item / 99M 交互)上重排相对 beam 生成在 beam=40 时最高提升 Recall@5 +4.53%、NDCG@10 +2.80%,且检索长度为 0 时增益归零(+0.12%)证明收益来自 GSU 检索机制本身而非多挂一个排序头,但增益随输入序列变长而衰减(32→128 时 +3.14%→+0.92%),全文无任何外部 baseline、无线上 A/B、无工业部署数据。
semantic-id transformer quantization multi-task academic
2026-04-28
生成式 Kuaishou
8 │ 7 │ —
GloRank From Local Indices to Global Identifiers: Generative Reranking for Recommender Systems via Global Action Space
GloRank 证明 list-wise 重排「选局部下标」的动作空间会给输出层梯度引入一项与 encoder 无关、不可消除的 mapping-induced 方差,遂把动作空间换成 RQ Semantic ID 构成的固定全局词表(4x256),用「采样排列+代理评估器 argmax」构造反事实 SFT 目标、GRPO 后训练(KL beta=0 最优)与 Trie 约束解码,在 Amazon-Books/ML-1M/工业数据集全指标超越 GoalRank 等 SOTA,冷启动下 MAP 仅降 4.9% 而 GoalRank 崩塌 88.4%,快手 4 亿 DAU 线上 A/B 取得 Watch Time +0.095%、Comment +0.462%。
semantic-id rl transformer cold-start training-stability
2026-04-28
other Apple
7 │ 7 │ —
Scaling Properties of Continuous Diffusion Spoken Language Models
Apple 首次给出连续扩散语音语言模型(CD SLM)的完整 scaling law,提出 pJSD 评估扩散模型的语言性,通过 fused two-stage 拟合分析 isoFLOP 曲率与下游指标,并将模型 scale 到 16B 参数
diffusion transformer parameter-scaling
2026-04-27
LLM Kuaishou
9 │ 9 │ —
KSA Kwai Summary Attention Technical Report
Kuaishou 提出 Kwai Summary Attention(KSA),通过在序列中插入可学习 summary token 实现 O(n/k) 语义级 KV cache 压缩,与 GQA/MLA 完全正交可叠加 8× 进一步压缩,在 RULER-128K 上 hybrid-KSA 比 Hybrid-GDN 高 +5.48 分(from-scratch)/+3.69 分(CPT)
transformer sparse-attention knowledge-distillation pretrained-lm industrial
2026-04-27
判别式 学术
7 │ 7 │ —
SUIN Similar Users-Augmented Interest Network
SUIN 把 RAG 思想引入 CTR:为目标用户检索 top-k 相似用户的整段行为序列做拼接增强,通过 UTPE 三性质位置编码与 UTA 双相关性目标注意力同时建模 item-item 和 user-user 信号,在 4 个公开数据集稳定击败短/长序列 baselines。
transformer academic
2026-04-26
生成式 Kuaishou
9 │ 8 │ —
AdaSID Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale
AdaSID 把 SID 碰撞处理从'固定治疗'升级为'两阶段自适应过程':语义自适应豁免良性重叠、负载与训练进度自适应分配剩余压力,在 Amazon Toys/Beauty 全部指标超越 QuaSID 等强 baseline,并在快手电商 A/B 实测取得 GMV +0.98%、Orders +0.91%、GPM +1.16% 的业务收益。
semantic-id quantization contrastive-ssl industrial
2026-04-26
生成式 Meituan
7 │ 8 │ —
Pro-GEO Birds of a Feather Cluster Nearby: a Proximity-Aware Geo-Codebook for Local Service Recommendation
Pro-GEO 把 RoPE 从序列位置外推到空间域,通过 geo-centroid 局部坐标系 + 双向 Geo-RoPE 把地理邻近性以正交旋转的方式嵌入 SID 第三层码本,在 Meituan 量级本地服务数据上把平均聚类距离降低 45.6% 同时 Hit@50 提升 1.87%。
semantic-id industrial pretrained-lm transformer
2026-04-25
other 学术
7 │ 7 │ —
PAMT A Parametric Memory Head for Continual Generative Retrieval
提出 PAMT,先正常微调 GenIR 主干,再冻结主干并通过一个 product-key 参数化记忆头做稀疏 value-only 校准,在 MS MARCO 与 NQ 上将持续 GenIR 的 BWT± 拉到与索引型检索器同量级。
transformer pretrained-lm semantic-id search-ranking academic
2026-04-25
LLM Alibaba
7 │ 8 │ —
ResRank ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression
ResRank 用 Encoder-LLM 把每段压成单 embedding 直接喂给 Reranker-LLM,配合残差连接和余弦相似度打分消除生成瓶颈,通过 dual-stage multi-task 端到端联合训练统一检索与列表式重排,在 BEIR/TREC DL 上以零生成 token 接近 GPT-4 效果
pretrained-lm search-ranking contrastive-ssl industrial
2026-04-24
生成式 Meta
— │ 8 │ —
TAWin Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders
形式化证明 GRPO+二值奖励=AUC、+beam-search=OPAUC,提出 WPAUC 与 Recall@K 的精确双边界以及可微 soft 窗口重加权方法 TAWin,在四个公开数据集上跨 backbone/optimizer/encoding 一致 SOTA
rl pretrained-lm academic
2026-04-24
生成式 Huawei
8 │ 8 │ —
ReCast ReCast: Recasting Learning Signals for Reinforcement Learning in Generative Recommendation
提出 ReCast——一个 repair-then-contrast 的 within-group 信号设计:先用 ground-truth-derived anchor 修复 all-zero group 恢复可学性,再以 hardest 正负对边界对比更新替代全组 reward 归一化,把生成式推荐 RL 的瓶颈从「奖励稀疏」推前到「group 可学性退化」
rl contrastive-ssl pretrained-lm industrial
2026-04-24
判别式 Alibaba
8 │ 8 │ —
LoopCTR LoopCTR: Unlocking the Loop Scaling Power for Click-Through Rate Prediction
提出 LoopCTR,将共享层递归复用作为正交的第四种 scaling 维度引入 CTR 预估,配合 Hyper-Connected Residuals、MoE 与多深度 process supervision,实现 train-multi-loop / infer-zero-loop——单次前向(甚至完全跳过 Loop Block)即超过所有 Transformer baseline。
transformer moe recursive-depth process-supervision industrial
2026-04-21
判别式 学术
7 │ 7 │ —
CAST CAST: Modeling Semantic-Level Transitions for Complementary-Aware Sequential Recommendation
提出 CAST 框架,通过 LLM 验证的互补关系先验 + 可学习的子空间语义转移张量,在离散语义码空间直接建模细粒度 code-level 转移,在三个 Amazon 数据集上 Recall/NDCG 最高提升 17.66%,相对最强 baseline 训练加速 65x。
transformer semantic-id pretrained-lm academic
2026-04-21
判别式 Kuaishou
8 │ 8 │ —
CS3 CS3: Efficient Online Capability Synergy for Two-Tower Recommendation
提出 CS3 即插即用三模块框架(CAS 循环自适应结构、CTS 跨塔同步、CMS 级联模型共享),在在线学习约束下增强双塔召回,Kuaishou 广告系统三场景一致增益,Scenario A 广告收入 +8.36%
ad-rec industrial recursive-depth knowledge-distillation
2026-04-21
判别式 Tencent
9 │ 8 │ —
RankUp RankUp: Towards High-rank Representations for Large Scale Advertising Recommender Systems
RankUp 通过随机置换分片、多嵌入表、全局 token、跨域嵌入融合与任务专属 token 五个机制提升工业排序器的 Effective Rank,在微信三大广告场景 100% 部署并带来 3.41–4.81% GMV 提升。
industrial ad-rec transformer parameter-scaling
2026-04-20
生成式 Kuaishou
7 │ 7 │ —
On the Equivalence Between Auto-Regressive Next Token Prediction and Full-Item-Vocabulary Maximum Likelihood Estimation in Generative Recommendation--A Short Note
形式化证明 k-token AR-NTP 在 bijective 分词下严格等价于全词表 MLE,首次给出工业 GR 范式的严格理论基础,并推广到级联与并行两种分词。
semantic-id industrial transformer
2026-04-17
判别式 Meituan
9 │ 8 │ 6
SIF Sample Is Feature: Beyond Item-Level, Toward Sample-Level Tokens for Unified Large Recommender Models
通过离线 HGAQ 把每条历史交互的完整 Raw Sample 压缩为紧凑 Token Sample,再用 token-level+sample-level 分解注意力的 SIF-Mixer 建模跨时序交互,把工业排序模型的序列 token 从 item-level 升级到 sample-level。
ad-rec quantization transformer feature-interaction industrial
2026-04-17
生成式 JD
9 │ 8 │ 7
GenRec GenRec: A Preference-Oriented Generative Framework for Large-Scale Recommendation
JD.com 推出的偏好对齐生成式推荐框架,以 Page-wise NTP 解决分页场景的标签歧义,Token Merger 将 SID prompt 压缩 2× 不损精度,GRPO-SR 用 hybrid rewards 抑制 reward hacking,JD App 首页 feed 全量上线后点击数 +9.5%、成交数 +8.7%。
industrial semantic-id rl pretrained-lm transformer
2026-04-16
other Naver
— │ 8 │ —
AuthGR From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines
首个将文档权威性融入生成式检索的框架AuthGR,通过VLM多模态评分和CPT-SFT-GRPO三阶段训练,3B模型匹配14B性能并在Naver搜索A/B测试中提升20%+用户参与度
pretrained-lm rl process-supervision industrial transformer
2026-04-15
判别式 Tencent
9 │ 8 │ 8
TokenFormer TokenFormer: Unify the Multi-Field and Sequential Recommendation Worlds
提出 TokenFormer 统一推荐架构,通过 BFTS 注意力分层和 NLIR 非线性门控解决多域特征与序列统一建模中的 Sequential Collapse Propagation 问题
transformer feature-interaction industrial ad-rec
2026-04-15
判别式 Meituan
7 │ 7 │ —
DSAIN Deep Situation-Aware Interaction Network for Click-Through Rate Prediction
DSAIN 提出 situation(情境)概念把行为类型与时空副信息统一起来,用 Gumbel-Softmax 重参数化对曝光噪声做可微软采样去噪,把情境特征 embedding 重解释为 micro-MLP 的权重偏置以乘性作用于 item 表征(而非加性污染),再用 behavior/channel/feature 三向 MLP-Mixer 一致捕捉跨行为、跨通道、跨情境特征相关性,在美团外卖 40% 主流量 7 天 A/B 取得 CTR +2.70% / CPM +2.62% / GMV +2.16% 并已全量部署于列表广告推荐系统。
ad-rec feature-interaction industrial
2026-04-14
生成式 Shopee
8 │ 8 │ —
UniRec UniRec: Bridging the Expressive Gap between Generative and Discriminative Recommendation via Chain-of-Attribute
UniRec 用贝叶斯定理把生成式推荐相对判别式的表达力差距归因为 SID 压缩导致的 item 侧特征覆盖不全,提出 Chain-of-Attribute 在 SID 前先解码类目属性以降低每步条件熵,配合曝光加权容量约束 SID、Task-Conditioned BOS 与哈希 Content Summary 及 RFT+DPO 对齐,在 Shopee 离线 HR@50 相对最强 baseline +22.6%、线上 GMV +5.60%。
semantic-id feature-interaction transformer moe rl
2026-04-14
LLM Together AI
8 │ 8 │ —
Parcae Parcae: Scaling Laws For Stable Looped Language Models
把层循环的前向过程精确改写为残差流上的动力系统并线性化到 LTI 稳定判据,指出既有循环架构的残差爆炸源于注入矩阵 A 的谱半径无约束;Parcae 用负对角参数化加 ZOH 离散化强制 rho(A)<1,配合 prelude 归一化与逐序列深度采样,在参数与数据对齐下相对 RDM 降低 6.2% 困惑度、相对 1.3B Transformer 提升 2.99 Core 分,并给出最优循环次数与 token 数的幂律以及测试时循环的饱和指数衰减律,二者可合并为一条统一律。
recursive-depth training-stability parameter-scaling transformer academic
2026-04-14
生成式 判别式 Meta
8 │ 6 │ —
HILL Efficient Retrieval Scaling with Hierarchical Indexing for Large Scale Recommendation
Meta 提出 HILL,用 cross-attention 软分配加残差量化把一棵分层索引与基础检索模型 MoNN 联合训练出来,在线沿树 beam search 剪枝把大模型的算力摊到 O(1000) 个粗层索引节点上(基建成本 24.6x→3.9x,线上广告指标 +2.57%),并发现索引中间节点回溯出的 <user, index node> 配对是一小批高质量新数据,可用于 test-time 微调。
industrial ad-rec inference-serving test-time-training quantization
2026-04-14
生成式 判别式 ByteDance
8 │ 7 │ —
R3-VAE R3-VAE: Reference Vector-Guided Rating Residual Quantization VAE for Generative Recommendation
R3-VAE 用可学习参考向量剥离语义中心做初始残差锚定、用点积 rating 的 softmax 全码本加权和替代 STE 硬查表以消除码本坍塌与初始化敏感,并把 Semantic Cohesion / Preference Discrimination 两个 SID 质量指标做成可微正则项兼廉价代理,六个公开数据集 Recall@10 平均 +14.5%,今日头条 GR 线上 StayTime/U +0.83%、CTR 侧新用户冷启点击 +15.36% 并已全量部署。
semantic-id quantization training-stability industrial cold-start
2026-04-13
判别式 Walmart
8 │ 7 │ —
LLM-HYPER LLM-HYPER: Generative CTR Modeling for Cold-Start Ad Personalization via LLM-Based Hypernetworks
LLM-HYPER 把多模态大模型当作免训练超网络,为零标签的严格冷启动广告直接生成线性 CTR 预估器的逐特征权重:用 CLIP 检索内容相似的暖广告、把它们已训练的权重作为 5-shot CoT 示例喂进 prompt,再以 L2 归一化加不依赖标签的截距校准对齐线上 CTR 分布;权重在广告上线前离线生成并缓存,在线只做线性点积(0.157ms,比 LLM 推荐器快约四个数量级),离线 AUC 0.6722 / NDCG@10 0.0792 较最强冷启动基线 LRcold 提升 20.2% / 55.9%(暖启动上界 0.7005 / 0.0871),消融显示去掉图片信息会跌回基线水平、零样本即可超基线 33.3%,人工标注特征重要性上 HR@5 0.81 且推理-权重一致性 >0.95,反事实语义扰动方向准确率最高 0.88,30 天线上 A/B 达到暖启动模型 92% 的相对 CTR(p=0.62 无显著差异),已在美国头部电商平台首页广告生产部署。
cold-start pretrained-lm ad-rec industrial inference-serving
2026-04-13
判别式 Meta
8 │ 7 │ —
SOLARIS SOLARIS: Speculative Offloading of Latent-bAsed Representation for Inference Scaling
SOLARIS 把投机解码搬进推荐 serving:用线上垂直模型自身的打分当轻量 verifier,投机预测未来请求会需要哪些 <user, item> 对,后台异步跑基础模型并把最后共享层表征经 autoencoder 压缩后写入数小时 TTL 的分布式缓存,垂直模型在推理期当普通特征消费——把知识迁移率从 soft-label 蒸馏的 20-25% 提到 42-44% 且零在线时延开销;pair 级仅 40% 的覆盖缺口靠两条正交回退补全(24h 同用户跨物品聚合抬到约 90%、KNN 近邻同物品插补抬到 70%,后者仅值真嵌入 40% 的 headroom),已在 Meta 广告日均十亿级请求上全量部署,10+ 生产模型最高 0.2% RLL 改善、全球广告营收 +0.67%(约 $100M 量级)。
knowledge-distillation inference-serving cross-domain ad-rec industrial
2026-04-13
判别式 Kuaishou
8 │ 6 │ —
SID-Coord SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search
快手在短视频搜索排序中把离散可训练的 Semantic ID 直接嵌进 HID 类判别式排序模型,用 radix-B 相邻层级复合 SID 的注意力融合、以物品热度统计驱动的 target-aware HID–SID 门控(g 随曝光十分位从 0.30 单调升至 0.73)、以及经 AutoDis 分布化的 target-history 余弦相似度对齐三件套,把「HID 记忆」与「SID 泛化」显式协调起来;不改主干即可接入生产,整体/长尾 AUC 相对基线 +0.33%/+0.42%,线上 A/B 长播率 +0.664%、播放时长 +0.369%,平均搜索延迟变化仅 +0.005%(CI 跨零)。
semantic-id search-ranking industrial
2026-04-12
判别式 ByteDance
9 │ 8 │ —
IAT IAT: Instance-As-Token Compression for Historical User Sequence Modeling in Industrial Recommender Systems
提出 Instance-As-Token 两阶段框架,将用户历史训练样本压缩为紧凑嵌入作为序列 token,突破手工序列特征的信息瓶颈,在字节跳动多个广告场景获得显著线上收益
industrial ad-rec transformer parameter-scaling
2026-04-10
LLM 学术
— │ 8 │ —
ReRec ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning
ReRec 以双图奖励塑形、段落级推理感知优势估计与在线课程调度,把 RFT 推进到复杂查询驱动的 LLM 推荐助手场景,在 RecBench+ 全面刷新 RFT baseline 并保持通用推理/指令/世界知识能力。
rl process-supervision pretrained-lm academic
2026-04-09
判别式 Zalando
— │ 7 │ —
LTE Long-Term Embeddings for Balanced Personalization
提出固定语义基底的长期嵌入 LTE,用加滞后窗口的 CLIP 内容向量加权平均作为 prefix token 注入 SASRec 排序器,Zalando 25 市场在线 A/B 获 engagement +0.61% / revenue +0.42% 显著提升,并用不对称自编码器在保持高惯性的前提下行为微调。
transformer industrial ad-rec pretrained-lm
2026-04-09
判别式 Alibaba
— │ 8 │ —
SSR Beyond Dense Connectivity: Explicit Sparsity for Scalable Recommendation
SSR 通过显式稀疏过滤 + 多视角稠密融合打破稠密 CTR 骨干的 scaling 饱和瓶颈,在 AliExpress 亿级工业场景线上 A/B 取得 CTR +2.1%、GMV +3.5%。
ad-rec industrial feature-interaction parameter-scaling
2026-04-09
LLM ByteDance
8 │ 8 │ —
In-Place TTT In-Place Test-Time Training
提出 In-Place TTT 框架,将 MLP block 的 W_down 作为 fast weights 原地更新,配合 NTP 对齐的目标函数和 chunk-wise 更新,实现预训练 LLM 的 drop-in 长上下文增强
transformer pretrained-lm industrial parameter-scaling test-time-training
2026-04-08
判别式 学术
7 │ 7 │ —
Pay Attention to Sequence Split: Uncovering the Impacts of Sub-Sequence Splitting
系统性审计研究揭示 Sub-Sequence Splitting(SSS)在 2022-2026 年 17 篇 SR 论文中大量未披露地启用,导致新模型提升被错误归因于架构创新;移除 SSS 后 8/10 的 SOTA 模型回退 40% 并输给 2018 年的 SASRec;提供 Single-target+CE+Prefix/Suffix 作为 SR 评测的推荐配置。
academic transformer
2026-04-07
生成式 学术
7 │ 7 │ —
LGCD From Clues to Generation: Language-Guided Conditional Diffusion for Cross-Domain Recommendation
LGCD 用 LLM 为单域用户生成目标域的 pseudo-overlapping 交互,再通过 cross-attention 条件扩散模型 + MoE 融合从源域生成目标域用户偏好表征,解决 inter-domain 跨域推荐中 overlapping users 稀缺的冷启动问题。
diffusion pretrained-lm cold-start transformer academic
2026-04-07
生成式 Meituan
8 │ 8 │ —
NSGR Next-Scale Generative Reranking: A Tree-based Generative Rerank Method at Meituan
NSGR 提出 tree-based 的 next-scale 生成式重排框架,用 log2(m) 步粗到细二分替代逐位自回归或一次性生成,并通过 Multi-Scale Evaluator 与 Multi-Scale Neighbor Loss 解决生成器-评估器目标错位,在美团食品配送线上 A/B 取得 CTR +2.89% / GMV +3.15% 的提升。
industrial transformer semantic-id process-supervision
2026-04-07
生成式 Alibaba
8 │ 8 │ —
STAMP STAMP: Semantic Trimming and Auxiliary Multi-step Prediction for Generative Recommendation
针对 Semantic ID 生成式推荐的训练加速框架:SAP 依据语义显著性与注意力中心性在 Transformer 中层剪枝冗余 token,MAP 通过多步前瞻预测增稠监督信号,在 T5 与 Qwen 双架构上实现 1.23-1.38x 加速与 17-55% VRAM 节省,同时保持甚至提升推荐精度。
semantic-id transformer pretrained-lm industrial process-supervision
2026-04-07
生成式 学术
7 │ 7 │ —
FAVE FAVE: Flow-based Average Velocity Establishment for Sequential Recommendation
FAVE 通过 semantic anchor prior 与 average velocity + JVP 曲率约束,将生成式序列推荐压缩为单步 flow,在三个基准上同时实现精度提升与一个数量级的推理加速。
diffusion academic transformer knowledge-distillation
2026-04-06
生成式 Walmart
7 │ 7 │ —
CRAB CRAB: Codebook Rebalancing for Bias Mitigation in Generative Recommendation
CRAB 通过正则化 K-means 拆分过热门 token 并配合层次语义对齐正则器,在不损失精度的前提下显著降低生成式推荐的流行度偏差。
semantic-id industrial pretrained-lm academic
2026-04-06
判别式 Google
7 │ 6 │ —
RAR_GPT Retrieval Augmented Conversational Recommendation with Reinforcement Learning
提出RAR框架,通过两阶段检索增强(retriever + LLM generator)和在线强化学习偏好优化,对齐检索与生成阶段,在多个对话推荐基准上超越SOTA
rl pretrained-lm academic cold-start
2026-04-06
生成式 Snapchat
7 │ 7 │ —
Semantic IDs for Recommender Systems at Snapchat: Use Cases, Technical Challenges, and Design Choices
Snapchat 大规模部署 Semantic IDs 作为推荐系统的辅助特征和生成式检索目标,提出 STE 优化和多模态 embedding 融合解决 codebook collapse,并通过 intra-bucket 消歧和 depth-优先策略解决 SID-to-Item 解析问题
semantic-id quantization industrial ad-rec
2026-04-05
other Baidu
7 │ 6 │ —
DebiasFirst LLM-based Listwise Reranking under the Effect of Positional Bias
提出DebiasFirst方法,通过逆倾向评分的位置校准和位置感知数据增强,在微调阶段缓解LLM列表式重排序中的位置偏差
search-ranking pretrained-lm academic
2026-04-04
生成式 Tencent
8 │ 7 │ 5
TencentGR Tencent Advertising Algorithm Challenge 2025: All-Modality Generative Recommendation
腾讯广告算法大赛 2025 发布 TencentGR-1M/10M 两个工业级全模态生成式推荐 benchmark:百万到千万级真实脱敏广告用户序列,同时包含曝光/点击/转化信号与多模态 embedding,提供 baseline Transformer 与加权 HitRate/NDCG 评估协议。
ad-rec industrial transformer pretrained-lm
2026-04-04
生成式 Meituan
7 │ 7 │ —
MBGR MBGR: Multi-Business Prediction for Generative Recommendation at Meituan
提出首个面向多业务场景的生成式推荐框架MBGR,通过BID、MBP和LDR三个模块解决跨业务跷跷板效应和表征混淆问题,在美团线上CTCVR提升3.98%
ad-rec industrial moe semantic-id transformer
2026-04-03
生成式 LinkedIn
8 │ 7 │ —
GTI Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
揭示均值初始化导致新词汇token坍缩至退化子空间,提出GTI在微调前通过语言监督grounding新token,在工业级和公开生成式推荐基准上一致优于均值初始化和LC-Rec
semantic-id pretrained-lm ad-rec industrial
2026-04-02
判别式 Kuaishou
8 │ 7 │ —
UniMixer UniMixer: A Unified Architecture for Scaling Laws in Recommendation Systems
提出UniMixer统一架构,通过参数化TokenMixer建立attention、TokenMixer和FM三大推荐Scaling模块的理论联系,并设计轻量UniMixing-Lite模块实现最优Scaling效率
transformer feature-interaction parameter-scaling ad-rec industrial
2026-04-01
生成式 Microsoft
7 │ 7 │ —
DACT Drift-Aware Continual Tokenization for Generative Recommendation
提出 DACT 框架,通过协同漂移识别模块和分层编码重分配策略,在生成式推荐持续学习中平衡 tokenizer 的可塑性与稳定性
semantic-id transformer pretrained-lm contrastive-ssl cold-start
2026-03-31
判别式 Google
6 │ 6 │ —
Zero-shot CDKD Zero-shot Cross-domain Knowledge Distillation: A Case study on YouTube Music
提出零样本跨域知识蒸馏(CDKD)方法,将大规模 YouTube 视频推荐教师模型的知识迁移至低流量的 YouTube Music 学生模型,无需共享训练数据即可显著提升音乐推荐性能
knowledge-distillation cold-start industrial ad-rec
2026-03-30
生成式 Kuaishou
9 │ 9 │ —
OneSearch-V2 OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework
在 OneSearch 基础上提出思维增强查询理解、推理内化自蒸馏和 TPMA-GRPO 偏好对齐,在快手商城搜索实现 Item CTR +3.98%、订单量 +2.11%,无需额外推理开销
semantic-id knowledge-distillation rl industrial search-ranking
2026-03-25
other 学术
7 │ 7 │ —
SumRank SumRank: Aligning Summarization Models for Long-Document Listwise Reranking
提出 SumRank,通过三阶段训练将轻量摘要模型与下游列表式重排序目标对齐,在 TREC DL 19-23 上实现 SOTA 排序性能并大幅降低延迟
search-ranking pretrained-lm rl academic
2026-03-25
判别式 学术
6 │ 6 │ —
SELLER Sequence-aware Large Language Models for Explainable Recommendation
提出 SELLER 框架,通过双路径序列编码器和 MoE 适配器将用户行为序列信息注入 LLM 以生成序列感知的个性化推荐解释,并设计基于解释增强推荐器的统一评估框架来衡量解释的实际效用
academic transformer moe pretrained-lm
2026-03-25
判别式 Alibaba
8 │ 8 │ —
HHSFT UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking
提出数据与模型架构协同缩放框架UniScale,通过ES3全空间采样系统扩展高质量训练信号,并设计HHSFT异构层次化融合Transformer有效建模复杂异构分布,在淘宝搜索排序中实现GMV 2.04%提升。
search-ranking transformer moe feature-interaction industrial
2026-03-25
生成式 Google
8 │ 7 │ —
GEM-Rec One Model, Two Markets: Bid-Aware Generative Recommendation
提出 GEM-Rec 框架,通过控制 token 和竞价感知解码机制,将广告变现目标统一集成到基于 Semantic ID 的生成式推荐序列中
ad-rec semantic-id transformer academic
2026-03-23
判别式 学术
8 │ 7 │ —
AgenticRec AgenticRec: End-to-End Tool-Integrated Policy Optimization for Ranking-Oriented Recommender Agents
提出AgenticRec框架,通过List-wise GRPO和渐进式偏好精炼两阶段训练,端到端优化推荐智能体的推理、工具调用和排序列表生成的完整决策轨迹
ad-rec rl pretrained-lm academic
2026-03-23
生成式 学术
7 │ 7 │ —
GenRecEdit Bringing Model Editing to Generative Recommendation in Cold-Start Scenarios
提出GenRecEdit框架,首次将模型编辑技术应用于生成式推荐的冷启动问题,在仅需9.5%重训练时间下显著提升冷启动物品推荐性能
cold-start semantic-id transformer academic
2026-03-15
生成式 Kuaishou
7 │ 7 │ —
RecoGEM Quantized Inference for OneRec-V2
通过分布分析证明 OneRec-V2 的权重和激活统计特性接近 LLM,据此设计 FP8 后训练量化框架并集成推理基础设施优化,在生产环境实现 49% 延迟降低和 92% 吞吐提升,线上 A/B 测试无指标退化
quantization moe industrial transformer ad-rec
2026-03-12
生成式 LinkedIn
8 │ 7 │ —
AttnMVP Beyond Interleaving: Causal Attention Reformulations for Generative Recommender Systems
揭示生成式推荐中交错 item-action token 的注意力机制本质是基于相似度的隐式 pooling,提出 AttnLFA 和 AttnMVP 两种因果注意力架构显式编码 item->action 因果关系,消除交错带来的注意力噪声和计算冗余
transformer ad-rec industrial feature-interaction
2026-03-11
LLM 学术
— │ 8 │ —
How Far Can Unsupervised RLVR Scale LLM Training?
系统证明所有 intrinsic URLVR 奖励本质都在锐化模型先验、必然 rise-then-fall 崩溃,提出 Model Collapse Step 指标并论证 external reward 才能突破置信度-正确性天花板。
rl academic parameter-scaling pretrained-lm
2026-03-09
生成式 学术
8 │ 7 │ —
MLLMRec-R1 MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation
提出 MLLMRec-R1,通过文本化视觉信号、高质量多模态 CoT 构建和混合粒度数据增强,实现首个面向多模态序列推荐的高效稳定 GRPO 训练框架
pretrained-lm rl process-supervision academic
2026-03-06
生成式 判别式 Tencent
9 │ 8 │ —
OneRanker OneRanker
提出 OneRanker,通过价值感知多任务解耦、粗细协同目标感知和双侧一致性保障,实现生成与排序的架构级深度融合,在微信视频号广告系统全量上线
ad-rec industrial transformer semantic-id knowledge-distillation
2026-03-03
生成式 学术
7 │ 7 │ —
APAO APAO: Adaptive Prefix-Aware Optimization for Generative Recommendation
提出自适应前缀感知优化框架 APAO,通过引入前缀级别的优化目标和自适应最差前缀加权策略,解决生成式推荐中 beam search 解码带来的训练-推理不一致性问题
academic transformer semantic-id pretrained-lm
2026-03-03
判别式 Xiaohongshu
7 │ 7 │ —
IDProxy IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs
提出 IDProxy,利用多模态大语言模型为冷启动物品生成代理 ID embedding,通过两阶段粗到细对齐机制无缝集成到现有 CTR 排序模型中,已部署于小红书内容推荐和展示广告场景
cold-start ad-rec industrial pretrained-lm contrastive-ssl
2026-03-02
生成式 Huawei
8 │ 7 │ —
HPGR Beyond the Flat Sequence: Hierarchical and Preference-Aware Generative Recommendations
提出 HPGR 框架,通过 Session Enhancement Module 建模用户行为层次结构和 Preference-Guided Sparse Attention 实现偏好驱动的稀疏注意力,在两阶段训练范式下显著超越 HSTU 和 MTGR 等生成式推荐基线
transformer industrial ad-rec sparse-attention
2026-03-01
生成式 Kuaishou
8 │ 7 │ —
QuaSID Stop Treating Collisions Equally: Qualification-Aware Semantic ID Learning for Recommendation at Industrial Scale
提出QuaSID框架,通过Hamming引导的边距排斥和冲突感知有效对掩码区分有害碰撞与良性重叠,实现资质感知的语义ID学习
semantic-id contrastive-ssl quantization industrial ad-rec
2026-02-28
生成式 Kuaishou
9 │ 9 │ —
GR4AD Generative Recommendation for Large-Scale Advertising
提出GR4AD,一个面向大规模实时广告场景的生产级生成式推荐系统,通过UA-SID、LazyAR、VSL和RSPO的协同设计,在快手4亿用户广告系统上实现4.2%的广告收入提升
ad-rec industrial semantic-id transformer rl
2026-02-26
判别式 Meta
9 │ 9 │ 9
ULTRA-HSTU Bending the Scaling Law Curve in Large-Scale Recommendation Systems
Meta 提出 ULTRA-HSTU,通过输入序列优化、Semi-Local Attention、动态拓扑设计和混合精度系统优化,实现 5x 训练和 21x 推理 scaling efficiency 提升,部署服务数十亿用户并带来 4%-8% 消费指标增益
transformer industrial parameter-scaling quantization sparse-attention
2026-02-23
判别式 ByteDance
8 │ 8 │ —
MixFormer MixFormer: Co-Scaling Up Dense and Sequence in Industrial Recommenders
提出统一的 Transformer 架构 MixFormer,将序列建模和特征交互融合到单一参数空间中,解决工业推荐系统中密集特征与序列长度的协同扩展问题
ad-rec transformer feature-interaction industrial parameter-scaling
2026-02-15
判别式 ByteDance
8 │ 8 │ —
TokenMixer-Large TokenMixer-Large: Scaling Up Large Ranking Models in Industrial Recommenders
提出TokenMixer-Large架构,通过Mixing-Reverting操作、Inter-layer残差、Sparse-Pertoken MoE等设计系统性解决TokenMixer在深层扩展中的瓶颈,成功将推荐排序模型扩展到150亿参数并在字节跳动多个在线场景取得显著业务收益
transformer moe feature-interaction parameter-scaling industrial
2026-02-06
判别式 ByteDance
8 │ 8 │ —
HyFormer HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction
提出 HyFormer 统一混合 Transformer 架构,通过 Global Tokens + Query Decoding/Boosting 交替机制实现长序列建模与特征交互的紧密集成,在抖音搜索全量部署
transformer feature-interaction industrial ad-rec search-ranking
2026-01-23
生成式 LLM Alibaba
8 │ 8 │ —
RecGPT-V2 RecGPT-V2 Technical Report
RecGPT-V2 用分层多智能体做意图推理、原子化实体压缩把上下文约 7× 压缩(GPU -60%)、约束式奖励塑形(CRS)解多目标 RL 梯度冲突、Agent-as-a-Judge 飞轮做评估,淘宝首页线上 A/B CTR +3%、NER +11.5%。
pretrained-lm rl agent knowledge-distillation quantization
2025-12-16
判别式 Alibaba
— │ 8 │ —
FAT From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction
FAT 把 CTR 模型 scaling 迅速衰减的根因诊断为「结构性错配」——标准 Transformer 假设序列组合性,而 CTR 数据要求跨异构语义域的组合推理,全局共享的 QKV 投影在极端稀疏下放大噪声——并用 Field-Decomposed Attention 把不可承受的 O(F²d²) 域对变换因子分解为「每域独立 QKV 投影做内容对齐(O(Fd²))+ 域对标量 w_{fi,fj} 做交互调制(O(F²))」,配 Field-Aware FFN 与 Basis-Composed Hypernetwork(M=64 基矩阵 Top-K=3 稀疏合成,训练后离线物化缓存故推理零开销),把参数复杂度压到 O(Fd²+F²)(典型场景从 150B 降到 0.5B);理论上以 Rademacher 复杂度证明泛化界只依赖域数量 F 而非可超 10⁹ 的词表规模 n,实验上 ΔAUC 在 50M→1.5B 三个数量级上遵循 ΔAUC=1.16×10⁻⁴·N^0.405 且无饱和,Taobao 78.20 / MovieLens-20M 84.50(较 DeepCTR 基线 +0.58% / +4.38%,同为 0.5B 时超过 Wukong/HSTU/HiFormer/RankMixer),淘宝赞助搜索线上 A/B 在 P99 仅 45ms→48ms(MFU 5%→34%,未缓存则 133ms 不可服务)下取得 +2.33% CTR 与 +0.66% RPM。
transformer feature-interaction parameter-scaling ad-rec industrial
2025-11-15
LLM Meta
— │ 8 │ —
MobileLLM-Pro MobileLLM-Pro Technical Report
Meta 推出的 1B 端侧基座 LLM,通过四阶段预训练(语言习得 + 隐式位置蒸馏扩窗到 128k + 专家模型合并 + 4-bit QAT)在 11 项预训练 benchmark 上同时超越 Gemma 3-1B 与 Llama 3.2-1B,量化后体积压到 590 MB 仅回退 0.7%。
transformer quantization knowledge-distillation industrial
2025-11-10
判别式 ByteDance
8 │ 9 │ —
STCA Make It Long, Keep It Fast: End-to-End 10k-Sequence Modeling at Billion Scale on Douyin
提出 STCA+RLB+Extrapolation 三位一体方案,将端到端长序列推荐从 500 扩展到 10k,在抖音全流量上线并观测到类 scaling law 增益
transformer industrial parameter-scaling
2025-11-08
判别式 ByteDance
8 │ 8 │ —
OneTrans OneTrans: Unified Feature Interaction and Sequence Modeling with One Transformer in Industrial Recommender
提出OneTrans,用统一的因果Transformer骨干网络同时完成用户行为序列建模和特征交互,通过混合参数化、金字塔裁剪和跨请求KV缓存实现高效扩展,在线A/B测试中GMV/u提升5.68%
transformer ad-rec industrial parameter-scaling feature-interaction
2025-10-30
生成式 Kuaishou
9 │ 9 │ —
OneRec-Think OneRec-Think: In-Text Reasoning for Generative Recommendation
提出 OneRec-Think 框架,通过三阶段(Itemic Alignment、Reasoning Activation、Reasoning Enhancement)将显式推理引入生成式推荐,取得公开 benchmark SOTA 及快手 APP 停留时长 +0.159%
ad-rec industrial transformer pretrained-lm rl
2025-10-13
生成式 Alibaba
8 │ 8 │ —
FORGE FORGE: Forming Semantic Identifiers for Generative Retrieval in Industrial Datasets
提出首个工业级语义标识符基准FORGE,包含淘宝140亿交互和2.5亿商品的多模态数据,系统优化SID生成、碰撞缓解与在线收敛策略,并引入无需GR训练的SID质量评估指标
semantic-id ad-rec industrial contrastive-ssl pretrained-lm
2025-09-25
生成式 Kuaishou
8 │ 8 │ —
OneSearch OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search
提出首个工业部署的端到端生成式电商搜索框架 OneSearch,通过关键词增强层次化量化编码、多视角行为序列注入和偏好感知奖励系统,在快手商城搜索上线后 Item CTR +1.67%、订单量 +3.22%,OPEX 节省 75.40%
search-ranking industrial transformer semantic-id rl
2025-09-03
other Google
— │ 9 │ —
LIMIT On the Theoretical Limitations of Embedding-Based Retrieval
从高维几何证明固定维度单向量 embedding 检索必然存在无法返回的 top-k 组合,并构造极简却让所有 SOTA 模型集体失败的 LIMIT 数据集加以印证。
academic contrastive-ssl pretrained-lm
2025-08-28
生成式 Kuaishou
9 │ 9 │ —
OneRec-V2 OneRec-V2 Technical Report
提出 Lazy Decoder-Only 架构将计算集中于目标 item 解码,并引入基于用户真实反馈的 GBPO 强化学习方法,在快手/快手极速版上实现 App Stay Time 分别提升 0.467%/0.741%
ad-rec transformer moe parameter-scaling rl
2025-08-28
生成式 LLM Alibaba
— │ 8 │ —
RecGPT RecGPT Technical Report
RecGPT 是阿里淘宝 RecGPT 系列开篇 V1,用三个推理 LLM 把工业推荐从「learn clicks from clicks」重构为「显式挖掘用户意图」——兴趣挖掘→item tag 预测→User-Item-Tag 三塔检索→解释生成闭环,配可靠行为压缩、多阶段训练与 Human-LLM 协同评审,全量部署淘宝首页猜你喜欢,一个月 A/B CTR +6.33%、IPV +9.47%、CICD +6.96%。
pretrained-lm knowledge-distillation multi-task moe industrial
2025-07-30
判别式 ByteDance
8 │ 8 │ —
RankMixer RankMixer: Scaling Up Ranking Models in Industrial Recommenders
提出硬件感知的推荐排序模型 RankMixer,通过多头 Token Mixing 和逐 Token FFN 替代自注意力机制,在抖音全量部署 1B 参数模型,MFU 从 4.5% 提升至 45%,活跃天数增长 0.3%
transformer moe parameter-scaling industrial feature-interaction
2025-07-21
判别式 ByteDance
6 │ 6 │ —
Next-User Retrieval Next-User Retrieval: Enhancing Cold-Start Recommendations via Generative Next-User Modeling
提出 Next-User Retrieval 框架,利用冷启动物品的历史交互用户序列生成式预测下一个潜在交互用户,在抖音线上 A/B 测试中取得 DAU +0.0142%、发布量 +0.1144% 的显著提升
cold-start transformer contrastive-ssl industrial ad-rec
2025-06-18
生成式 Kuaishou
9 │ 9 │ —
OneRec OneRec Technical Report
提出端到端生成式推荐系统 OneRec,采用 encoder-decoder 架构统一检索与排序,通过 RQ-Kmeans tokenizer、MoE 解码器和 ECPO 强化学习,在快手部署后 App Stay Time 提升 0.54%/1.24%,OPEX 仅为传统系统 10.6%
transformer moe semantic-id rl industrial
2025-06-16
生成式 Kuaishou
7 │ 7 │ —
OneSug OneSug: The Unified End-to-End Generative Framework for E-commerce Query Suggestion
提出首个面向电商搜索查询建议的端到端生成式框架OneSug,通过prefix2query表示增强、统一编码器-解码器架构和奖励加权排序策略,替代传统多阶段级联架构,在快手电商搜索引擎全量部署并取得显著业务提升
search-ranking semantic-id rl transformer industrial
2025-06-07
生成式 Tencent
— │ 7 │ —
RecGPT RecGPT: A Foundation Model for Sequential Recommendation
RecGPT 用 MPNet+FSQ 把 item 文本描述统一量化成 domain-invariant 离散 token,配双向-因果混合注意力和 Trie 约束的 catalog-aware beam search,做成真·零样本跨域序列推荐基础模型,零样本即超对手 few-shot(10%-50% 下游数据)。
semantic-id quantization cross-domain cold-start parameter-scaling
2025-06-06
判别式 Alibaba
8 │ 7 │ —
GPSD Scaling Transformers for Discriminative Recommendation via Generative Pretraining
GPSD(阿里国际,KDD'25,AliExpress 上线)把 Transformer 排序模型无法 scale 诊断为稀疏 embedding 的 one-epoch 与 within-one-epoch 过拟合,先用 4K 均匀负样本的 sampled-softmax 自回归 next-item 目标预训练,再把 embedding 迁入判别式模型并冻结、只训稠密参数:工业 CTR/CVR/CART 上 24 组冻结对比 22 组胜(L4H256A4 AUC 0.6340→0.6940),稠密参数 13K→327M 呈幂律提升,可即插即用增强 DIN/DIEN/HSTU/Wukong,线上 GMV +7.03%;但「生成式」目标在 item 维度实为对比式分类且从未与判别式预训练对照,预训练收益与数据量未分离,scaling 无从零训练对照。
transformer parameter-scaling contrastive-ssl industrial
2025-06-04
判别式 Meituan
8 │ 8 │ —
MTGR MTGR: Industrial-Scale Generative Recommendation Framework in Meituan
提出 MTGR 框架,结合 DLRM 的交叉特征与 GRM 的 Transformer 可扩展性,通过用户聚合、GLN 和动态掩码实现工业级排序模型的高效扩展
transformer industrial ad-rec feature-interaction parameter-scaling
2025-05-24
other Kuaishou
7 │ 7 │ —
GAVE Generative Auto-Bidding with Value-Guided Explorations
提出 GAVE 框架,通过 score-based RTG、基于 RTG 评估的动作探索和可学习价值函数三大创新,增强 Decision Transformer 的离线广告自动竞价能力,NeurIPS 2024 竞赛第一名并在快手线上部署
ad-rec rl transformer industrial
2025-04-20
判别式 ByteDance
8 │ 8 │ —
HLLM HLLM: Enhancing Sequential Recommendations via Hierarchical Large Language Models for Item and User Modeling
提出层次化大语言模型架构HLLM,用两个独立LLM分别建模物品特征提取和用户兴趣序列,在多个大规模数据集上显著超越传统ID-based和文本-based推荐方法
transformer pretrained-lm parameter-scaling industrial ad-rec
2024-09-19
生成式 判别式 Meta
10 │ 10 │ —
HSTU Actions Speak Louder than Words
提出 Generative Recommenders (GRs) 范式和 HSTU 架构,将推荐系统重新建模为序列转换任务,在工业规模下显著超越传统 DLRM,并展示推荐系统中的 scaling law
transformer industrial ad-rec parameter-scaling
2024-02-27
判别式 Google
7 │ 7 │ —
HiFormer Hiformer: Heterogeneous Feature Interactions Learning with Transformers for Recommender Systems
提出异构注意力层和Composite投影机制,使Transformer架构能感知特征语义差异,首次在工业级推荐系统中超越SOTA特征交互模型
transformer feature-interaction industrial ad-rec
2023-11-10
判别式 Kuaishou
8 │ 7 │ —
MEDA KuaiShou MultiEpoch
提出 MEDA:每个 epoch 开始时重置 embedding 层,在保留稀疏度的同时阻断 embedding 过拟合,使工业 CTR 模型首次得以多轮训练并在 Kuaishou 取得 +4.6% 收入提升、训练数据需求减半。
ad-rec industrial
2023-05-31
生成式 Google
9 │ 9 │ —
TIGER TIGER: Towards Generating Semantic IDs with Transformer for Scalable and Transferable Recommendation
提出TIGER框架,首次将生成式检索范式引入推荐系统,通过RQ-VAE为物品生成层次化Semantic ID并用Transformer自回归预测,在多个数据集上显著超越SOTA
semantic-id transformer pretrained-lm cold-start academic
2023-05-08
判别式 Meta
— │ 8 │ —
DHEN DHEN: A Deep and Hierarchical Ensemble Network for Large-Scale Click-Through Rate Prediction
DHEN 提出异质交互模块的分层集成 + 递归堆叠架构,捕捉不同交互算子(DCN/self-attention/FM 等)的非重叠信息与层级相关性,并配套 HSDP 训练范式,在 Meta 工业 CTR 数据上相比 AdvancedDLRM 取得最高 0.27% NE 增益。
feature-interaction transformer parameter-scaling ad-rec industrial
2022-03-11
判别式 Google
9 │ 9 │ —
DCNv2 DCN V2: Improved Deep & Cross Network and Practical Lessons for Web-scale Learning to Rank Systems
将 DCN 的秩1权重矩阵升级为全秩矩阵并引入低秩混合专家机制,在保持简洁公式的同时大幅提升特征交叉表达力,已在 Google 多个大规模排序系统部署
feature-interaction industrial moe ad-rec
2020-08-31
判别式 学术
— │ 10 │ —
SASRec Self-Attentive Sequential Recommendation
首次将纯self-attention架构引入序列推荐,自适应关注历史行为中的相关物品,在稀疏和稠密数据集上均超越MC/CNN/RNN方法,且训练效率提升一个数量级
transformer academic
2018-08-29
other Google
10 │ 10 │ —
Transformer Attention Is All You Need
提出完全基于注意力机制的Transformer架构,摒弃循环和卷积,在机器翻译任务上以更低训练成本达到SOTA
transformer academic
2017-06-12