← 返回报告列表

2026-09-03 日报

日报 📅 2026-09-02
工业署名不等于工业证据:大厂推荐论文的叙事与证据落差
industrial semantic-id agent pretrained-lm training-stability
📊 共 7 篇 · 精读 2

2026-09-03 日报

主题: 工业署名不等于工业证据:大厂推荐论文的叙事与证据落差

标签: industrial · semantic-id · agent · pretrained-lm · training-stability

📊 统计: 共 7 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 5 · generative-rec 1 · llm 2 · discriminative-rec 3 · other 1

综述

今日 7 篇、2 篇精读:判别式推荐 3、LLM 2、生成式推荐与其他各 1,仅高德与 Meta 两篇工业署名。两篇都自称有工业价值,精读却双双下调其证据强度:看点在「工业署名不等于工业证据」。SPAR(高德)把空间感知贯穿 SID 构造、CPT 与 SFT,空间信号整体贡献 23%–37% 属实;但它与同团队两天前的 HF-SID 五作者重叠却互不引用,两条空间编码路线相反,且只有 HF-SID 上线并有 A/B,SPAR 全离线,不比 HF-SID 也不比自家 GeoGR;其 TV-SFT 约 95% 的增益来自顺带引入的 LoRA,而非它命名的防遗忘锚定。CORAL(Meta AI)把 LLM 放在控制面而非请求路径,成本按决策周期而非按流量计费的论证扎实;但两个战果分处不同服务、从未同时兑现:一处质量微增而成本仅持平,一处只省钱、质量不变,质量用相对百分比、成本用无分母的美元,又零消融零基线,对照组是久未修订的陈旧配置。5 篇 brief 里,训练种子研究指出不同 seed 会产出几乎不重叠的 top-k 列表,OrthoRec 等亦有增益与标题主张错位。

重点论文

SPAR · ⭐ 7/10

SPAR: Enhancing Industrial-Scale Generative POI Recommendation via Real-World Spatial Perception

🏢 Alibaba · 生成式推荐

高德 AMAP 把『空间感知』从 tokenizer 一个点扩展到整条训练生命周期:SI-SID 用 NeRF 式正弦地理编码(平移不变核 + Lipschitz 连续,Pearson r=0.893)在 RQ-Kmeans 之前与文本嵌入拼接,使 L0 码本按地理划分、L1 按语义精修;MG-CPT 在 25 个自建地理数据集(含路网与约 5 万条真实导航轨迹,三层递增复杂度)上继续预训练,使 4B 模型在无坐标方向推理上超过 Qwen3-32B 三倍以上;TV-SFT 把 MG-CPT 的参数增量冻结为 task vector 并叠加 LoRA 以抗灾难性遗忘。四座城市一个月高德日志上相对 PLUM 平均 +38.32%(8B),公开 NYC/TKY 相对最强 baseline +11.91%~19.29%,但全文无线上 A/B、无部署,且 TV-SFT 的增益经复核几乎全部来自 LoRA 而非 task-vector 锚定。

CORAL · ⭐ 6/10

CORAL: An LLM-Native Harness for Production Recommender Systems

🏢 Meta · LLM

Meta AI 的 CORAL 把通用 LLM 放到生产推荐系统的控制面而非请求路径上:每 3 天一轮,agent 观测逐控制单元的运行统计、回忆最近 3 轮自己的配置与归因结果、提出有界的逐单元调整,再由一个约束优化器把提案投影到预算可行集后直接下发线上,A/B 实测结果写回记忆闭合回路,全程不做参数更新;两个大规模社交平台上分别取得 watch time +0.15% / sessions +0.16%(成本持平)与年化数百万美元服务成本节省(第二轮再扩 44%、engagement 不变),而由于 LLM 调用数由控制面划分而非流量决定,整次部署推理成本仅数十美元。

Training seeds and model-selection stability in recommender-system evaluation · ⭐ 6/10

🎓 学术 · 判别式推荐

论文固定数据划分、只变训练随机种子,从三个层面检验推荐评测的稳定性:用户级指标敏感性(Friedman 检验)、基于验证集的模型选择稳定性、以及 top-k 列表一致性(Jaccard/AO@k)。结论是种子效应常常统计显著,但实际后果取决于配置之间是否拉得开、验证结论能否传递到测试集;在 Amazon All Beauty 上不同种子甚至产出几乎不重叠的推荐列表,即聚合指标相近也不代表列表相同。作者主张把训练种子当作评测协议的一部分而非实现噪声。

DS-Frame · ⭐ 6/10

Recommender System as Slow and Fast Thinkers

🎓 学术 · 判别式推荐

DS-Frame 为序列推荐设计快慢双系统:Fast System 走一遍推理直接出 logits,Slow System 把可学习的 reasoning token 追加到序列上、用共享参数的 Transformer 块做 K 步隐式 latent refinement 并对每一中间步做深监督,另有一个受预算正则约束的学习型选择器决定每个样本走哪条路。五个数据集上对两种骨干平均提升 6-7%,在长历史/冷门画像等困难人群上增益更大。消融显示学习型路由确实优于随机路由,但随机路由本身已优于全量走慢系统,说明相当一部分收益来自「有慢通道 + 混合」本身。

全部论文

模型 标题 类别 公司 摘要分 精读分
SPAR SPAR: Enhancing Industrial-Scale Generative POI Recommendation via Real-World Spatial Perception 生成式 🏢 Alibaba 8 7
CORAL CORAL: An LLM-Native Harness for Production Recommender Systems LLM 🏢 Meta 8 6
— Training seeds and model-selection stability in recommender-system evaluation 判别式 🎓 学术 6 —
DS-Frame Recommender System as Slow and Fast Thinkers 判别式 🎓 学术 6 —
— Unfolding the Leech Lattice: Fused Multi-Shell Decoding and VRAM Layouts for 2-Bit LLM Weights LLM 🎓 学术 5 —
— Momentum in large-batch training: Polyak enlarges the critical batch size, Nesterov improves data efficiency 其他 🎓 学术 5 —
OrthoRec Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation 判别式 🎓 学术 5 —