← 返回报告列表

2026-09-28 日报

日报 📅 2026-09-25
工业推荐服务侧改造:真实收益多不在标题部件
industrial inference-serving multi-task sequence-compression pretrained-lm
📊 共 22 篇 · 精读 5

2026-09-28 日报

主题: 工业推荐服务侧改造:真实收益多不在标题部件

标签: industrial · inference-serving · multi-task · sequence-compression · pretrained-lm

📊 统计: 共 22 篇 · 精读 5 · 🏢 工业界 5 · 🎓 学术 17 · generative-rec 5 · llm 9 · discriminative-rec 7 · other 3

综述

今日 22 篇(精读 5),含一批 arXiv 延迟公告、此前漏收的 9 月 13–24 日提交;LLM 9、判别式 7、生成式 5、其他 3,工业学术各半。五篇工业精读读后均下调:腾讯 KuaFu 的 item 级可缓存压缩扎实,但 GMV +1.37% 来自腾出的更长历史与更快刷新;Shopify T-RoPE 在带时间 RAB 的 HSTU 上仍有增益,但主要来自多尺度时间戳 RoPE,独有部件仅约 2–11%;LinkedIn ESP 的服务期权重旋钮经线上验证,却只与自身其他权重对比;快手 SARA 的 A/B 基线已含 MLLM 特征,但理由与新结构未拆开,“scaling”实为覆盖率;LinkedIn CC Retriever 的 +2.5% 来自整体替换旧 CPU 系统,扩参 75 倍仅 +0.20% Recall@10。趋势:工业贡献多在服务侧工程,线上增益需与标题部件分开看。

重点论文

KuaFu · ⭐ 7/10

KuaFu: Compressing Long User Behavior into Understanding at Billion Scale

🏢 Tencent · 生成式推荐 / LLM

腾讯 KuaFu 以单个行为 item 为压缩单元,用 LoRA LLM 编码器 + 两轴投影器把每个 item 压成 2–4 个 128–256 维 token 离线缓存跨用户复用,配长度课程、压缩-生成联合训练与按危害加权的幻觉感知 DAPO,支撑十亿用户周更的 LLM 画像挖掘,decoder 侧省 190 卡、十个月 holdout GMV +1.37%(但对照同时延长了历史并加快了刷新)。

T-RoPE · ⭐ 6/10

T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation

🏢 Shopify · 生成式推荐

T-RoPE 把 RoPE 的旋转坐标从交互索引换成绝对 Unix 时间戳,配几何间隔频率库(10^2~10^8 秒)与逐维可学习 q/k 系数、query 旋转到下一事件时间(推理时用当前时间)、key 施加转置旋转使相位依赖 t_q+t_k 以打破时间平移不变性;在 HSTU+Time RAB 骨干上五个公开数据集全指标最优(+1%~+28%),60 亿交互 Shop 数据 +13%~+82%,Shop app 线上 CVR +0.33%(p=0.037),但主要增益来自多尺度时间戳旋转本身,非平稳 key 等独有部件贡献有限且缺外部时间 RoPE 对照。

CC Retriever · ⭐ 6/10

Connected Content Retriever: Dense Graph Edge Features Powering Pre-Ranking at LinkedIn

🏢 LinkedIn · 判别式推荐

LinkedIn 把 Connected Content 粗排从 CPU 上 O(10^5) 参数浅模型整体迁到 GPU-RAR:服务时用 sort+searchsorted 在 GPU 上把 viewer-author 稠密亲密度边特征 join 到数万候选(5-10 ms),拼接 MLP 多任务打分,配合 CPU 并行哈希 ID 解析(10× 吞吐)与每秒数万更新的十亿级 GPU 常驻索引,整体替换带来内容时长 +2.5%;但对照为整套旧模型+旧系统,边特征只有离线同尺寸消融(-7.86% recall@10)支撑,且新模型上扩 75× 仅 +0.20% recall。

ESP · ⭐ 6/10

Embedding Subspace Partitioning for Dynamic Multi-Objective Retrieval

🏢 LinkedIn · 生成式推荐

LinkedIn 的 ESP 把召回 embedding 切成每目标一个 L2 归一化子空间、用请求侧权重的加权点积在 GPU 穷举 KNN 单索引上合分,使同一模型在服务期扫出多目标 Pareto 前沿(Transformer 版用 EOS 分段 + 段感知掩码 + 位置重置零参数实现),7 天 A/B 中 4 个权重点 revenue +0.91%~+7.36%、选定点 +4.01% revenue / +3.95% 申请;但线上只比较了调权重而非 ESP 对单 embedding,生产离线 MTSH 仅两个极端点且容量未匹配,开源基准的实体目标近乎字符串匹配。

SARA · ⭐ 6/10

Scaling Articulated Rationales for MLLM-based Recommendation

🏢 Kuaishou · 判别式推荐

快手 SARA 用问卷数据引擎采集用户「为什么喜欢/讨厌」直播的理由(18.75 万条 HQ),以 SFT+Quality-Refining DPO 对齐 Qwen2.5-VL-7B 为 1000 万主播按日生成正/负理由,正理由经 MIM 软对比约束用户-主播交互表示、负理由量化成 SID 挂到 Hate 历史做 target attention,线上观看时长 +0.99%、Hate −8.16%,但排序侧无消融,收益未与新增结构分离。

全部论文

模型 标题 类别 公司 摘要分 精读分
KuaFu KuaFu: Compressing Long User Behavior into Understanding at Billion Scale 生成式 / LLM 🏢 Tencent 8 7
T-RoPE T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation 生成式 🏢 Shopify 8 6
CC Retriever Connected Content Retriever: Dense Graph Edge Features Powering Pre-Ranking at LinkedIn 判别式 🏢 LinkedIn 7 6
ESP Embedding Subspace Partitioning for Dynamic Multi-Objective Retrieval 生成式 🏢 LinkedIn 7 6
SARA Scaling Articulated Rationales for MLLM-based Recommendation 判别式 🏢 Kuaishou 7 6
— Learned Cross-Task Relationships in Multi-Task Models 判别式 🎓 学术 6 —
NarraLite Efficient Multimodal Generative Recommendation with Latent Narrative Reasoning 生成式 🎓 学术 6 —
UA-TWM Recommendation World Models for Future-State Control 判别式 🎓 学术 6 —
Light Heads Lightweight Ranking Heads: Accelerating Multi-Task Experimentation in Production Recommender Systems 判别式 🎓 学术 6 —
— Generative Query Suggestion via Intent Coverage and Query-Level Credit Assignment 生成式 / LLM 🎓 学术 6 —
— Retail Product Search: A Practical Approach at Target 判别式 🎓 学术 6 —
— Where Post-Training Quantization Breaks Text Embedders: A Measured Map Across Four Embedder Families LLM 🎓 学术 5 —
— Bootstrapping Conversational Recommendation Agents At Spotify: Synthetic Data Generation and Self-Improvement Loops LLM 🎓 学术 5 —
— Enriching Sequential Recommendation with Graph Laplacian Positional Embeddings 判别式 🎓 学术 5 —
— RecToolBench: Benchmarking Recommendation-Specific Tool Orchestration under Fuzzy User Intent LLM 🎓 学术 5 —
Component Benchmark Component Benchmark: Hierarchical Model Profiling for Large-scale Recommendation Systems 其他 🎓 学术 5 —
— Reinforcement Learning with Verifiable Rewards for Small Search Agents LLM 🎓 学术 4 —
— SPADE: Escaping the Popularity-Similarity Frontier to Measure Serendipitous Recommendations 其他 🎓 学术 4 —
— Tie Handling Is Part of the Evaluation Protocol: An Order-Invariance Audit for Tie-Heavy Recommender Scores 其他 🎓 学术 4 —
— How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach? LLM 🎓 学术 4 —
AgentRecommender AgentRecommender: LLM Agents Enable Customizable Recommender Systems on the User Side LLM 🎓 学术 4 —
— Evaluating Brand Retrieval and Ranking in Large Language Model Recommendations LLM 🎓 学术 4 —