2026-08-20 日报
主题: 推荐排序工业落地三线:统一底座、LLM 蒸馏与延迟预算
标签: industrial · pretrained-lm · knowledge-distillation · inference-serving
📊 统计: 共 7 篇 · 精读 3 · 🏢 工业界 3 · 🎓 学术 4 · generative-rec 2 · discriminative-rec 3 · other 1 · llm 1
综述
今日 7 篇:判别式推荐 3 篇、生成式推荐 2 篇、LLM 与其他各 1 篇;3 篇精读全部是已上线的工业系统,且两篇同出小红书。OneModel(小红书)用场景私有投影把推荐、广告、商家三条流并成一条事件序列,配场景门控与用户状态增量缓存,稠密参数增三成而延迟由 270ms 降到 90ms;但其“scaling”主张只有单点邻域敏感性支撑,论文本身仍是模板占位符状态的未评审预印本。GateDiffInt(小红书 + 复旦)提出“噪声-意图耦合”,以可控扩散去噪加冻结 LLM 教师蒸馏四类意图,线上 GMV +1.13%,惜全文未给任何服务时延,batch size 也未与基线对齐。TTP(美团 + 中科大)把意图改写与稠密检索压进同一次前向,冻结 SFT 副本兼任奖励模型,7 天 A/B 订单 +0.46% 而端到端延迟仅 +0.15ms,工业证据最扎实。共同趋势是把 LLM 语义留在离线、用蒸馏与缓存换毫秒级预算,而服务成本是否披露,正成为衡量这类工业工作的分水岭。
重点论文
OneModel · ⭐ 7/10
OneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking
🏢 Xiaohongshu · 判别式推荐
小红书 OneModel 把自然推荐/广告/商家三条业务流的异构行为经场景私有线性投影 + 场景/动作/Δt/位置上下文注入统一成共享 event-token 序列,过一个 GenRank 式 action-oriented 因果 Transformer(候选掩码阻断同请求候选间注意力、ALiBi 相对时序偏置),在 FFN 内插入仅由场景 ID 嵌入决定的 sigmoid 逐通道门控 SAIM 以单张共享计算图换取流特化,配 α 衰减/β 增长的自监督-任务两阶段调度、λ_k 反比于验证 AUC、交叉流批采样与早期梯度隔离(单项 +1.6‰);统一训练让低资源的 Ads/Merchant 各 +3.0‰ 而主流量 Rec 仅 -0.1‰,掩掉 Rec 子序列使 Ads AUC 掉 0.36pp 坐实跨流迁移,服务侧用户状态增量缓存 + 特征分解/预取/共享用户塔/图级优化让稠密参数 173M→230M 的同时延迟 270ms→90ms,线上三场景全正向(Engagement +1.25% / ADVV +3.43% + CTR +8.18% / GPM +2.1585%)。
GateDiffInt · ⭐ 7/10
🏢 Xiaohongshu · 判别式推荐
GateDiffInt 把 CVR 行为序列中噪声与意图的互相劣化命名为 Noise-Intent Coupling(拆成噪声诱导意图扭曲 NID 与意图无关去噪失败 IDF 两个可测子现象),用行为可靠性差异化掩码驱动的可控前向扩散加双门控融合做序列去噪、并把去噪器的位置重要性门 g_i 反哺给 LLM teacher 作提示,再由冻结 Gemini teacher 蒸馏出长期/短期/潜在/转化四类结构化意图、经 2D 注意力掩码与 per-intent LoRA 路由压进冻结 Qwen3-1.7B 学生,最后两阶段(先分别预训练,再冻结主干仅用 LoRA 联合微调 + teacher-anchoring 正则)让去噪与意图抽取朝转化目标共同对齐;在 Taobao/Amazon-Electronics/生产数据集上全指标超过 DIN/DIEN/DSIN/BST/DMIN/HSTU(生产集相对 HSTU AUC +3.00%),小红书首页信息流 14 天 A/B GMV +1.13%、场景累计 +5.13% 并已服务主流量。
TTP · ⭐ 7/10
Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval
🏢 Meituan · 生成式推荐
TTP(美团 + 中科大)把电商个性化稠密检索的瓶颈定位为『改写器按语言建模目标训练、与检索效用脱节』,用单个 LLM 在一次前向里输出
意图增强 query
PILOT · ⭐ 6/10
PILOT Technical Report
🎓 学术 · LLM
PILOT 把推荐系统的线上实验优化从“看到指标变化再调参”的被动模式改成主动模式:Experiment Manager 只在规则生成的合法命令包络内驱动实验全生命周期(任务接入、观测治理、异常恢复、复盘),Search Planner 按需提出人群级个性化的候选决策树,Memory Curator 异步把实验结果蒸馏成带溯源的策略知识且与主循环故障隔离。淘宝 5 个实验桶部署,相比无生命周期治理的自由探索 agent ROAM,IPV +1.40%、成交额 +1.50%,搜索效率从 53.3% 提到 93.3%,全程无人干预。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| OneModel | OneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking | 判别式 | 🏢 Xiaohongshu | 8 | 7 |
| GateDiffInt | GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling | 判别式 | 🏢 Xiaohongshu | 8 | 7 |
| TTP | Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval | 生成式 | 🏢 Meituan | 7 | 7 |
| SIDScope | SIDScope: A Diagnostic Resource for Semantic-ID Interfaces in Generative Recommendation | 生成式 | 🎓 学术 | 6 | — |
| ERASE | ERASE: EaRly bAckpropagation SchEdule for Faster Training of Modern Recommendation Systems | 判别式 | 🎓 学术 | 6 | — |
| PILOT | PILOT Technical Report | LLM | 🎓 学术 | 6 | — |
| — | Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson | 其他 | 🎓 学术 | 5 | — |