← 返回报告列表

2026-04-14 日报

日报 📅 2026-04-11 ~ 2026-04-13
重算力移出在线路径:语义 ID 与离线表征的工业落地
industrial semantic-id inference-serving cold-start ad-rec
📊 共 11 篇 · 精读 4

2026-04-14 日报

主题: 重算力移出在线路径:语义 ID 与离线表征的工业落地

标签: industrial · semantic-id · inference-serving · cold-start · ad-rec

📊 统计: 共 11 篇 · 精读 4 · 🏢 工业界 4 · 🎓 学术 7 · discriminative-rec 6 · generative-rec 3 · other 3

综述

本期 11 篇:判别式推荐 6 篇、生成式推荐 3 篇,另有 3 篇偏检索与重排;4 篇来自 Meta、Walmart、快手、字节且均已上线,也是仅有的精读对象,其余 7 篇为纯学术工作。Meta 的 SOLARIS 借投机解码思路,用线上垂直模型打分当 verifier,后台异步算好基础模型表征写入带 TTL 的缓存,推理期当普通特征消费,但覆盖率数字前后不一、后台算力成本未披露。Walmart 的 LLM-HYPER 把多模态大模型当免训练超网络,离线为冷启动广告生成线性 CTR 权重、在线只做点积,其线上 A/B 只说明未检测到与暖启动模型的差异,不宜读成“等价”。快手 SID-Coord 用热度门控协调 HID 记忆与 SID 泛化,字节 R3-VAE 用参考向量与打分量化替代硬查表以缓解码本坍塌,两者或缺公开数据集,或存在口径与实测偏差,结论宜留余地。学术侧集中在 agentic 推荐、对话推荐与重排去偏。把重算力挪出请求、线上只消费其产物是本期最一致的路线,瓶颈也转向覆盖率与成本披露。

重点论文

SOLARIS · ⭐ 7/10

SOLARIS: Speculative Offloading of Latent-bAsed Representation for Inference Scaling

🏢 Meta · 判别式推荐

SOLARIS 把投机解码搬进推荐 serving:用线上垂直模型自身的打分当轻量 verifier,投机预测未来请求会需要哪些 对,后台异步跑基础模型并把最后共享层表征经 autoencoder 压缩后写入数小时 TTL 的分布式缓存,垂直模型在推理期当普通特征消费——把知识迁移率从 soft-label 蒸馏的 20-25% 提到 42-44% 且零在线时延开销;pair 级仅 40% 的覆盖缺口靠两条正交回退补全(24h 同用户跨物品聚合抬到约 90%、KNN 近邻同物品插补抬到 70%,后者仅值真嵌入 40% 的 headroom),已在 Meta 广告日均十亿级请求上全量部署,10+ 生产模型最高 0.2% RLL 改善、全球广告营收 +0.67%(约 $100M 量级)。

R3-VAE · ⭐ 7/10

R3-VAE: Reference Vector-Guided Rating Residual Quantization VAE for Generative Recommendation

🏢 ByteDance · 生成式推荐 / 判别式推荐

R3-VAE 用可学习参考向量剥离语义中心做初始残差锚定、用点积 rating 的 softmax 全码本加权和替代 STE 硬查表以消除码本坍塌与初始化敏感,并把 Semantic Cohesion / Preference Discrimination 两个 SID 质量指标做成可微正则项兼廉价代理,六个公开数据集 Recall@10 平均 +14.5%,今日头条 GR 线上 StayTime/U +0.83%、CTR 侧新用户冷启点击 +15.36% 并已全量部署。

LLM-HYPER · ⭐ 7/10

LLM-HYPER: Generative CTR Modeling for Cold-Start Ad Personalization via LLM-Based Hypernetworks

🏢 Walmart · 判别式推荐

LLM-HYPER 把多模态大模型当作免训练超网络,为零标签的严格冷启动广告直接生成线性 CTR 预估器的逐特征权重:用 CLIP 检索内容相似的暖广告、把它们已训练的权重作为 5-shot CoT 示例喂进 prompt,再以 L2 归一化加不依赖标签的截距校准对齐线上 CTR 分布;权重在广告上线前离线生成并缓存,在线只做线性点积(0.157ms,比 LLM 推荐器快约四个数量级),离线 AUC 0.6722 / NDCG@10 0.0792 较最强冷启动基线 LRcold 提升 20.2% / 55.9%(暖启动上界 0.7005 / 0.0871),消融显示去掉图片信息会跌回基线水平、零样本即可超基线 33.3%,人工标注特征重要性上 HR@5 0.81 且推理-权重一致性 >0.95,反事实语义扰动方向准确率最高 0.88,30 天线上 A/B 达到暖启动模型 92% 的相对 CTR(p=0.62 无显著差异),已在美国头部电商平台首页广告生产部署。

SID-Coord · ⭐ 6/10

SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search

🏢 Kuaishou · 判别式推荐

快手在短视频搜索排序中把离散可训练的 Semantic ID 直接嵌进 HID 类判别式排序模型,用 radix-B 相邻层级复合 SID 的注意力融合、以物品热度统计驱动的 target-aware HID–SID 门控(g 随曝光十分位从 0.30 单调升至 0.73)、以及经 AutoDis 分布化的 target-history 余弦相似度对齐三件套,把「HID 记忆」与「SID 泛化」显式协调起来;不改主干即可接入生产,整体/长尾 AUC 相对基线 +0.33%/+0.42%,线上 A/B 长播率 +0.664%、播放时长 +0.369%,平均搜索延迟变化仅 +0.005%(CI 跨零)。

全部论文

模型 标题 类别 公司 摘要分 精读分
SOLARIS SOLARIS: Speculative Offloading of Latent-bAsed Representation for Inference Scaling 判别式 🏢 Meta 8 7
R3-VAE R3-VAE: Reference Vector-Guided Rating Residual Quantization VAE for Generative Recommendation 生成式 / 判别式 🏢 ByteDance 8 7
LLM-HYPER LLM-HYPER: Generative CTR Modeling for Cold-Start Ad Personalization via LLM-Based Hypernetworks 判别式 🏢 Walmart 8 7
SID-Coord SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search 判别式 🏢 Kuaishou 8 6
CoARS Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems 生成式 🎓 学术 7 —
HARPO HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation 生成式 🎓 学术 6 —
CapCal Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration 其他 🎓 学术 6 —
ARHN ARHN: Answer-Centric Relabeling of Hard Negatives with Open-Source LLMs for Dense Retrieval 其他 🎓 学术 5 —
MOSAIC MOSAIC: Multi-Domain Orthogonal Session Adaptive Intent Capture for Prescient Recommendations 判别式 🎓 学术 5 —
BlockNK From Recency Bias to Stable Convergence Block Kaczmarz Methods for Online Preference Learning in Matchmaking Applications 判别式 🎓 学术 4 —
RECIPER RECIPER: A Dual-View Retrieval Pipeline for Procedure-Oriented Materials Question Answering 其他 🎓 学术 4 —