2026-09-28 日报
主题: 工业推荐服务侧改造:真实收益多不在标题部件
标签: industrial · inference-serving · multi-task · sequence-compression · pretrained-lm
📊 统计: 共 22 篇 · 精读 5 · 🏢 工业界 5 · 🎓 学术 17 · generative-rec 5 · llm 9 · discriminative-rec 7 · other 3
综述
今日 22 篇(精读 5),含一批 arXiv 延迟公告、此前漏收的 9 月 13–24 日提交;LLM 9、判别式 7、生成式 5、其他 3,工业学术各半。五篇工业精读读后均下调:腾讯 KuaFu 的 item 级可缓存压缩扎实,但 GMV +1.37% 来自腾出的更长历史与更快刷新;Shopify T-RoPE 在带时间 RAB 的 HSTU 上仍有增益,但主要来自多尺度时间戳 RoPE,独有部件仅约 2–11%;LinkedIn ESP 的服务期权重旋钮经线上验证,却只与自身其他权重对比;快手 SARA 的 A/B 基线已含 MLLM 特征,但理由与新结构未拆开,“scaling”实为覆盖率;LinkedIn CC Retriever 的 +2.5% 来自整体替换旧 CPU 系统,扩参 75 倍仅 +0.20% Recall@10。趋势:工业贡献多在服务侧工程,线上增益需与标题部件分开看。
重点论文
KuaFu · ⭐ 7/10
KuaFu: Compressing Long User Behavior into Understanding at Billion Scale
🏢 Tencent · 生成式推荐 / LLM
腾讯 KuaFu 以单个行为 item 为压缩单元,用 LoRA LLM 编码器 + 两轴投影器把每个 item 压成 2–4 个 128–256 维 token 离线缓存跨用户复用,配长度课程、压缩-生成联合训练与按危害加权的幻觉感知 DAPO,支撑十亿用户周更的 LLM 画像挖掘,decoder 侧省 190 卡、十个月 holdout GMV +1.37%(但对照同时延长了历史并加快了刷新)。
T-RoPE · ⭐ 6/10
T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation
🏢 Shopify · 生成式推荐
T-RoPE 把 RoPE 的旋转坐标从交互索引换成绝对 Unix 时间戳,配几何间隔频率库(10^2~10^8 秒)与逐维可学习 q/k 系数、query 旋转到下一事件时间(推理时用当前时间)、key 施加转置旋转使相位依赖 t_q+t_k 以打破时间平移不变性;在 HSTU+Time RAB 骨干上五个公开数据集全指标最优(+1%~+28%),60 亿交互 Shop 数据 +13%~+82%,Shop app 线上 CVR +0.33%(p=0.037),但主要增益来自多尺度时间戳旋转本身,非平稳 key 等独有部件贡献有限且缺外部时间 RoPE 对照。
CC Retriever · ⭐ 6/10
Connected Content Retriever: Dense Graph Edge Features Powering Pre-Ranking at LinkedIn
🏢 LinkedIn · 判别式推荐
LinkedIn 把 Connected Content 粗排从 CPU 上 O(10^5) 参数浅模型整体迁到 GPU-RAR:服务时用 sort+searchsorted 在 GPU 上把 viewer-author 稠密亲密度边特征 join 到数万候选(5-10 ms),拼接 MLP 多任务打分,配合 CPU 并行哈希 ID 解析(10× 吞吐)与每秒数万更新的十亿级 GPU 常驻索引,整体替换带来内容时长 +2.5%;但对照为整套旧模型+旧系统,边特征只有离线同尺寸消融(-7.86% recall@10)支撑,且新模型上扩 75× 仅 +0.20% recall。
ESP · ⭐ 6/10
Embedding Subspace Partitioning for Dynamic Multi-Objective Retrieval
🏢 LinkedIn · 生成式推荐
LinkedIn 的 ESP 把召回 embedding 切成每目标一个 L2 归一化子空间、用请求侧权重的加权点积在 GPU 穷举 KNN 单索引上合分,使同一模型在服务期扫出多目标 Pareto 前沿(Transformer 版用 EOS 分段 + 段感知掩码 + 位置重置零参数实现),7 天 A/B 中 4 个权重点 revenue +0.91%~+7.36%、选定点 +4.01% revenue / +3.95% 申请;但线上只比较了调权重而非 ESP 对单 embedding,生产离线 MTSH 仅两个极端点且容量未匹配,开源基准的实体目标近乎字符串匹配。
SARA · ⭐ 6/10
Scaling Articulated Rationales for MLLM-based Recommendation
🏢 Kuaishou · 判别式推荐
快手 SARA 用问卷数据引擎采集用户「为什么喜欢/讨厌」直播的理由(18.75 万条 HQ),以 SFT+Quality-Refining DPO 对齐 Qwen2.5-VL-7B 为 1000 万主播按日生成正/负理由,正理由经 MIM 软对比约束用户-主播交互表示、负理由量化成 SID 挂到 Hate 历史做 target attention,线上观看时长 +0.99%、Hate −8.16%,但排序侧无消融,收益未与新增结构分离。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| KuaFu | KuaFu: Compressing Long User Behavior into Understanding at Billion Scale | 生成式 / LLM | 🏢 Tencent | 8 | 7 |
| T-RoPE | T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation | 生成式 | 🏢 Shopify | 8 | 6 |
| CC Retriever | Connected Content Retriever: Dense Graph Edge Features Powering Pre-Ranking at LinkedIn | 判别式 | 7 | 6 | |
| ESP | Embedding Subspace Partitioning for Dynamic Multi-Objective Retrieval | 生成式 | 7 | 6 | |
| SARA | Scaling Articulated Rationales for MLLM-based Recommendation | 判别式 | 🏢 Kuaishou | 7 | 6 |
| — | Learned Cross-Task Relationships in Multi-Task Models | 判别式 | 🎓 学术 | 6 | — |
| NarraLite | Efficient Multimodal Generative Recommendation with Latent Narrative Reasoning | 生成式 | 🎓 学术 | 6 | — |
| UA-TWM | Recommendation World Models for Future-State Control | 判别式 | 🎓 学术 | 6 | — |
| Light Heads | Lightweight Ranking Heads: Accelerating Multi-Task Experimentation in Production Recommender Systems | 判别式 | 🎓 学术 | 6 | — |
| — | Generative Query Suggestion via Intent Coverage and Query-Level Credit Assignment | 生成式 / LLM | 🎓 学术 | 6 | — |
| — | Retail Product Search: A Practical Approach at Target | 判别式 | 🎓 学术 | 6 | — |
| — | Where Post-Training Quantization Breaks Text Embedders: A Measured Map Across Four Embedder Families | LLM | 🎓 学术 | 5 | — |
| — | Bootstrapping Conversational Recommendation Agents At Spotify: Synthetic Data Generation and Self-Improvement Loops | LLM | 🎓 学术 | 5 | — |
| — | Enriching Sequential Recommendation with Graph Laplacian Positional Embeddings | 判别式 | 🎓 学术 | 5 | — |
| — | RecToolBench: Benchmarking Recommendation-Specific Tool Orchestration under Fuzzy User Intent | LLM | 🎓 学术 | 5 | — |
| Component Benchmark | Component Benchmark: Hierarchical Model Profiling for Large-scale Recommendation Systems | 其他 | 🎓 学术 | 5 | — |
| — | Reinforcement Learning with Verifiable Rewards for Small Search Agents | LLM | 🎓 学术 | 4 | — |
| — | SPADE: Escaping the Popularity-Similarity Frontier to Measure Serendipitous Recommendations | 其他 | 🎓 学术 | 4 | — |
| — | Tie Handling Is Part of the Evaluation Protocol: An Order-Invariance Audit for Tie-Heavy Recommender Scores | 其他 | 🎓 学术 | 4 | — |
| — | How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach? | LLM | 🎓 学术 | 4 | — |
| AgentRecommender | AgentRecommender: LLM Agents Enable Customizable Recommender Systems on the User Side | LLM | 🎓 学术 | 4 | — |
| — | Evaluating Brand Retrieval and Ranking in Large Language Model Recommendations | LLM | 🎓 学术 | 4 | — |