2026-08-28 日报
主题: 在线延迟约束下的重活外挪:离线刷新与权重内化
标签: graph · knowledge-distillation · inference-serving · semantic-id · industrial
📊 统计: 共 9 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 7 · discriminative-rec 4 · generative-rec 2 · other 2 · llm 1
综述
今日 9 篇:判别式推荐 4 篇、生成式 2 篇、其他 2 篇、LLM 1 篇,仅 2 篇精读且都来自工业界。两篇不同源——一个社交好友召回、一个电商图搜生成式检索——却撞上同一条约束:离线可以很重,在线必须很轻;分歧只在把重活挪去哪。AI VK 的 VK-GNN 挪到离线刷新:194M 用户 / 28B 边的好友图上,multi-hash 把 ID 嵌入表从 202.88GB 压到 2GB 且 ROC-AUC 不降反升(0.6246→0.6278),时序邻居采样改成时间戳排序 CSR 上的二分,1473ms 降到 595ms 且与朴素扫描同分布,两周生产流量 A/B 好友添加 +16.0%、延迟无回退;代价是 GNN 表示在线算不出来,被钉死在离线刷新、分数喂下游 GBDT 的两阶段形态,刷全量 194M 用户一次要 6.57 小时。阿里拍立淘的 PailitaoGR 则挪进权重:教师吃裁剪图与 OCR、学生只吃整图,推理期把教师整个丢掉,离线比同骨干 SFT 高 13.88 个绝对百分点并反超两位教师;但全文 0 次 A/B、0 次延迟实测——以在线延迟为全部动机,却从未量过延迟。其余 7 篇多为学术,散在多域序列建模、agentic 向量记忆与低成本预训练。VK 也与一月前 Yandex 的 multi-hash 结论互补:被否掉的是冻结的预训练图嵌入,不是图信号本身。
重点论文
VK-GNN · ⭐ 8/10
🏢 VK · 判别式推荐
AI VK 在 194M 用户 / 28B 边的生产社交好友图上给出 GNN 排序系统的完整落地配方:把 multi-hash ID embedding 提升为 GNN 的一等输入层(k=3 个哈希索引 B=2^21 共享表,把 202.88GB 的完整 |V|×d 表压到 2GB、<1%,ROC-AUC 反而 0.6246→0.6278,作者归因于有界共享带来的隐式正则),并用按时间戳排序的 CSR + lower_bound 二分把时序邻居采样从 O(deg(v)+K) 降到 O(log deg(v)+K)(每 batch 1473ms→595ms,≈2.5×,且与朴素扫描产出同分布、ROC-AUC 均为 0.6278);编码器是 2 层 GATv2 加 query/candidate 双头内积,225GB CSR 常驻单台 8×A100 主机、63h 收敛、6.57h 刷新全量 194M 用户 embedding,离线 ROC-AUC 0.6278 对比上一代生产系统 WalkGNN 0.5572(+12.7%),两周生产流量 A/B 好友添加 +16.0%、独立添加用户 +11.5%、feed 停留 +0.28%(均 p<0.01)且 ranker p50/p90/p99 无回退,框架已开源。
PailitaoGR · ⭐ 7/10
PailitaoGR: Latent Think-with-Images for Generative Image Retrieval
🏢 Alibaba · 生成式推荐
阿里拍立淘把「看图思考」内化进生成式图像检索:用只看裁剪图的 Crop Teacher 和额外吃 OCR 的 OCR Teacher 作特权输入教师,通过 on-policy JSD 蒸馏 + ROT/熵注意力引导让只吃整图的学生实现「不裁剪的放大」,再用效用×可及性双门控的增量对比蒸馏只迁移 OCR 教师相对 Crop 教师的可用增量,实现「不 OCR 的读字」,推理时教师全部移除,线上图搜日志上比同骨干 SFT 基线平均高 13.8 个百分点并反超两位教师。
CoVeMem · ⭐ 6/10
When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems
🎓 学术 · 判别式推荐
提出 CoVeMem,用冻结的 LightGCN 用户/物品状态构成记忆库替代 agentic 推荐中的文本记忆:候选集自身检索最相关的历史状态,作为 soft token 与轻量文本画像一起进入 LLM 上下文,再经语义锚点对比对齐与掩码候选的 listwise 协同训练,让模型学会“读”这些状态并据此排序。
MaskRec · ⭐ 6/10
Topology-Masked Unified Backbone for Joint Feature Interaction and Multi-Domain Sequence Modeling
🎓 学术 · 判别式推荐
提出 MaskRec,把异构特征、多域行为序列和上下文信号统一成 token,并引入全局/域级记忆 token 作为聚合节点;核心的 TopoMask 结构化注意力掩码按信息源的结构差异选择性开闭注意力连接,使特征交叉与多域序列建模在同一拓扑约束的注意力过程中完成,另配候选条件化的双路 query 生成模块。
PrismRec · ⭐ 6/10
Preference Flow Matching with Spectral Factorization for Micro-video Recommendation
🎓 学术 · 生成式推荐
提出 PrismRec,用谱语义分解(SSF)通过时域频率上的先验引导可学习频率掩码,把帧级表征拆成互补的静态语义因子与动态因子;再用上下文校准偏好匹配(CPM)按用户敏感度对二者加权,把校准后的上下文作为结构化条件注入 flow matching 轨迹,使视频内容成为偏好形成的内在驱动而非附属信息。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| VK-GNN | Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling | 判别式 | 🏢 VK | 8 | 8 |
| PailitaoGR | PailitaoGR: Latent Think-with-Images for Generative Image Retrieval | 生成式 | 🏢 Alibaba | 7 | 7 |
| CoVeMem | When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems | 判别式 | 🎓 学术 | 6 | — |
| MaskRec | Topology-Masked Unified Backbone for Joint Feature Interaction and Multi-Domain Sequence Modeling | 判别式 | 🎓 学术 | 6 | — |
| PrismRec | Preference Flow Matching with Spectral Factorization for Micro-video Recommendation | 生成式 | 🎓 学术 | 6 | — |
| Puro-2B | Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 | LLM | 🎓 学术 | 5 | — |
| MOSAIC | Beyond a Single Story: Meta-Reviewing Sparse and Incomplete User-generated Contents for Recommendation | 判别式 | 🎓 学术 | 5 | — |
| OmniUE | Omni-Interactive Universal Embedder | 其他 | 🎓 学术 | 5 | — |
| — | Conversational Recommendation over Live E-Commerce Catalogues with Self-Refreshing Retrieval | 其他 | 🎓 学术 | 4 | — |