← 返回报告列表

2026-08-07 日报

日报 📅 2026-08-06
统一模型与智能体重构推荐检索链路,兼论可审计性
semantic-id knowledge-distillation agent industrial academic
📊 共 6 篇 · 精读 1

2026-08-07 日报

主题: 统一模型与智能体重构推荐检索链路,兼论可审计性

标签: semantic-id · knowledge-distillation · agent · industrial · academic

📊 统计: 共 6 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 5 · generative-rec 1 · llm 4 · discriminative-rec 1 · other 1

综述

今日 6 篇:生成式推荐 1、判别式推荐 1、LLM 4;仅 Yandex 有公司署名,精读只有 Gryphon-v2,另 5 篇止于速览。Gryphon-v2 在共享 encoder 的 generate-and-rank 架构上提出 Rollout Distillation:训练期专用的 Teacher Ranker(8,000 事件上下文、免特征)为当前 decoder 同步生成的 on-policy rollout(占去重候选 90% 以上)与 logged impressions 打分,逐任务 MAE 与 NTP 联合训练,TeacherRecall@10 由 0.0392 升至 0.5654、WPA 0.5528 升到 0.5892;线上以单个 0.5B 模型替掉 15+ 召回器与粗排精排,活跃用户 +1.41%,时延持平、吞吐约 4 倍。2608.05655 评分 7,但被 deep_read_rec_requires_industry 闸门拦下只做速览:它把六种“按用户加权模态”实现归一到同一骨干,单一全局权重即拿走几乎全部内容增益(+1.9/+3.6/+3.5pp),逐用户加权无一致收益。SYF 用三流架构做工业信息流的 agentic 重排,对齐打分模块离线准确率 98.85%;READ 以确定性词法检索与结构导航替掉 top-k,51 题答对 58.8%,稠密检索仅 15.7%。趋势是把级联与黑盒检索收敛为单模型或可审计的智能体操作,并抬高个性化声明的证据门槛。

重点论文

Gryphon-v2 · ⭐ 8/10

Gryphon-v2: One Model in Place of a Cascade - Generate-and-Rank Recommender with Rollout Distillation

🏢 Yandex · 生成式推荐

Gryphon-v2 在 Gryphon 的共享 encoder 架构上,用一个只在训练期存在的高容量 Teacher Ranker(8,000 事件上下文、免特征、ARGUS 式自回归训练)蒸馏出 item 级 Ranking Module,蒸馏候选同时取自当前 decoder 每步同步生成的 on-policy rollout(占去重候选 90%+)与 logged impressions,两者各按候选数归一化的逐任务 MAE 等权相加并与 NTP 联合训练;离线 TeacherRecall@10 从 0.0392(next-item 监督)跃升到 0.5654、WPA 0.5528→0.5892(收回到 Teacher Ranker 54% 的 gap)且 R@1000 不降,线上单模型替掉 15+ 召回器 + 粗排 + 精排后活跃用户 +1.41%、时延与级联持平、吞吐约 4×。

Is Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders · ⭐ 7/10

🎓 学术 · 判别式推荐

论文审计了多模态推荐里「按用户加权模态」的普遍主张:把用户模态强度向量、注意力门控、元权重超网络、低秩引导权重等六种实现统一到同一协同过滤骨干,用效用差(对比单一全局模态权重)与可识别性差(对比评测期打乱用户-权重绑定)两组对照度量。三个短视频语料上单一全局权重就拿到了几乎全部内容增益(+1.9/+3.6/+3.5pp),按用户加权没有一致收益(正向差距均 ≤0.9pp 且会翻转);作者进一步把虚高的 shuffle 对照归因于门控读取了共享协同嵌入,并主张把 real-GM 与 real-shuf 同时上报作为个性化声明的最低证据标准。

SYF · ⭐ 6/10

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

🎓 学术 · LLM

SYF 提出面向工业信息流的 LLM 智能体推荐框架:用感知流从文本/语音/UI 交互抽取细粒度意图,服务流基于持久化「语义画像」做实时 agentic 重排与剪枝,自进化流用 DPO 与 LLM-as-a-Judge 集成对齐人类判断。离线对齐打分模块准确率 98.85%,线上 A/B 显示信息流相关性与用户情感均有提升。

READ · ⭐ 6/10

Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations

🎓 学术 · LLM

论文指出在财报、审计等表格密集长文档上,「切块+向量 top-k」的检索范式结构性失效——单位表头常与数字被切块边界分开,造成两个数量级误差;提出 READ 用归一化词法检索、结构导航与有界片段读取三个确定性操作经 MCP 暴露给智能体,使轨迹成为可重放的审计链。51 题上 READ 答对 58.8% 对比稠密检索 15.7%,同一循环换成 top-k 工具只有 27.5%,说明增益来自检索接口而非迭代;但作者亦承认 BM25 与 READ 统计上不可区分。

全部论文

模型 标题 类别 公司 摘要分 精读分
Gryphon-v2 Gryphon-v2: One Model in Place of a Cascade - Generate-and-Rank Recommender with Rollout Distillation 生成式 🏢 Yandex 8 8
— Is Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders 判别式 🎓 学术 7 —
SYF Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation LLM 🎓 学术 6 —
— Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs LLM 🎓 学术 6 —
READ Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations LLM 🎓 学术 6 —
Cleo Cleo: A Transparent and Controllable Chatbot for Conversational Commerce 其他 / LLM 🎓 学术 4 —