← 返回报告列表

2026-08-28 日报

日报 📅 2026-08-27
在线延迟约束下的重活外挪:离线刷新与权重内化
graph knowledge-distillation inference-serving semantic-id industrial
📊 共 9 篇 · 精读 2

2026-08-28 日报

主题: 在线延迟约束下的重活外挪:离线刷新与权重内化

标签: graph · knowledge-distillation · inference-serving · semantic-id · industrial

📊 统计: 共 9 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 7 · discriminative-rec 4 · generative-rec 2 · other 2 · llm 1

综述

今日 9 篇:判别式推荐 4 篇、生成式 2 篇、其他 2 篇、LLM 1 篇,仅 2 篇精读且都来自工业界。两篇不同源——一个社交好友召回、一个电商图搜生成式检索——却撞上同一条约束:离线可以很重,在线必须很轻;分歧只在把重活挪去哪。AI VK 的 VK-GNN 挪到离线刷新:194M 用户 / 28B 边的好友图上,multi-hash 把 ID 嵌入表从 202.88GB 压到 2GB 且 ROC-AUC 不降反升(0.6246→0.6278),时序邻居采样改成时间戳排序 CSR 上的二分,1473ms 降到 595ms 且与朴素扫描同分布,两周生产流量 A/B 好友添加 +16.0%、延迟无回退;代价是 GNN 表示在线算不出来,被钉死在离线刷新、分数喂下游 GBDT 的两阶段形态,刷全量 194M 用户一次要 6.57 小时。阿里拍立淘的 PailitaoGR 则挪进权重:教师吃裁剪图与 OCR、学生只吃整图,推理期把教师整个丢掉,离线比同骨干 SFT 高 13.88 个绝对百分点并反超两位教师;但全文 0 次 A/B、0 次延迟实测——以在线延迟为全部动机,却从未量过延迟。其余 7 篇多为学术,散在多域序列建模、agentic 向量记忆与低成本预训练。VK 也与一月前 Yandex 的 multi-hash 结论互补:被否掉的是冻结的预训练图嵌入,不是图信号本身。

重点论文

VK-GNN · ⭐ 8/10

Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling

🏢 VK · 判别式推荐

AI VK 在 194M 用户 / 28B 边的生产社交好友图上给出 GNN 排序系统的完整落地配方:把 multi-hash ID embedding 提升为 GNN 的一等输入层(k=3 个哈希索引 B=2^21 共享表,把 202.88GB 的完整 |V|×d 表压到 2GB、<1%,ROC-AUC 反而 0.6246→0.6278,作者归因于有界共享带来的隐式正则),并用按时间戳排序的 CSR + lower_bound 二分把时序邻居采样从 O(deg(v)+K) 降到 O(log deg(v)+K)(每 batch 1473ms→595ms,≈2.5×,且与朴素扫描产出同分布、ROC-AUC 均为 0.6278);编码器是 2 层 GATv2 加 query/candidate 双头内积,225GB CSR 常驻单台 8×A100 主机、63h 收敛、6.57h 刷新全量 194M 用户 embedding,离线 ROC-AUC 0.6278 对比上一代生产系统 WalkGNN 0.5572(+12.7%),两周生产流量 A/B 好友添加 +16.0%、独立添加用户 +11.5%、feed 停留 +0.28%(均 p<0.01)且 ranker p50/p90/p99 无回退,框架已开源。

PailitaoGR · ⭐ 7/10

PailitaoGR: Latent Think-with-Images for Generative Image Retrieval

🏢 Alibaba · 生成式推荐

阿里拍立淘把「看图思考」内化进生成式图像检索:用只看裁剪图的 Crop Teacher 和额外吃 OCR 的 OCR Teacher 作特权输入教师,通过 on-policy JSD 蒸馏 + ROT/熵注意力引导让只吃整图的学生实现「不裁剪的放大」,再用效用×可及性双门控的增量对比蒸馏只迁移 OCR 教师相对 Crop 教师的可用增量,实现「不 OCR 的读字」,推理时教师全部移除,线上图搜日志上比同骨干 SFT 基线平均高 13.8 个百分点并反超两位教师。

CoVeMem · ⭐ 6/10

When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems

🎓 学术 · 判别式推荐

提出 CoVeMem,用冻结的 LightGCN 用户/物品状态构成记忆库替代 agentic 推荐中的文本记忆:候选集自身检索最相关的历史状态,作为 soft token 与轻量文本画像一起进入 LLM 上下文,再经语义锚点对比对齐与掩码候选的 listwise 协同训练,让模型学会“读”这些状态并据此排序。

MaskRec · ⭐ 6/10

Topology-Masked Unified Backbone for Joint Feature Interaction and Multi-Domain Sequence Modeling

🎓 学术 · 判别式推荐

提出 MaskRec,把异构特征、多域行为序列和上下文信号统一成 token,并引入全局/域级记忆 token 作为聚合节点;核心的 TopoMask 结构化注意力掩码按信息源的结构差异选择性开闭注意力连接,使特征交叉与多域序列建模在同一拓扑约束的注意力过程中完成,另配候选条件化的双路 query 生成模块。

PrismRec · ⭐ 6/10

Preference Flow Matching with Spectral Factorization for Micro-video Recommendation

🎓 学术 · 生成式推荐

提出 PrismRec,用谱语义分解(SSF)通过时域频率上的先验引导可学习频率掩码,把帧级表征拆成互补的静态语义因子与动态因子;再用上下文校准偏好匹配(CPM)按用户敏感度对二者加权,把校准后的上下文作为结构化条件注入 flow matching 轨迹,使视频内容成为偏好形成的内在驱动而非附属信息。

全部论文

模型 标题 类别 公司 摘要分 精读分
VK-GNN Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling 判别式 🏢 VK 8 8
PailitaoGR PailitaoGR: Latent Think-with-Images for Generative Image Retrieval 生成式 🏢 Alibaba 7 7
CoVeMem When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems 判别式 🎓 学术 6 —
MaskRec Topology-Masked Unified Backbone for Joint Feature Interaction and Multi-Domain Sequence Modeling 判别式 🎓 学术 6 —
PrismRec Preference Flow Matching with Spectral Factorization for Micro-video Recommendation 生成式 🎓 学术 6 —
Puro-2B Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 LLM 🎓 学术 5 —
MOSAIC Beyond a Single Story: Meta-Reviewing Sparse and Incomplete User-generated Contents for Recommendation 判别式 🎓 学术 5 —
OmniUE Omni-Interactive Universal Embedder 其他 🎓 学术 5 —
— Conversational Recommendation over Live E-Commerce Catalogues with Self-Refreshing Retrieval 其他 🎓 学术 4 —