← 返回报告列表

2026-09-18 日报

日报 📅 2026-09-17
三篇简读:agent 选数据、几何图 RAG 与画像推荐复现
agent graph pretrained-lm academic
📊 共 3 篇 · 精读 0

2026-09-18 日报

主题: 三篇简读:agent 选数据、几何图 RAG 与画像推荐复现

标签: agent · graph · pretrained-lm · academic

📊 统计: 共 3 篇 · 精读 0 · 🏢 工业界 0 · 🎓 学术 3 · llm 2 · discriminative-rec 1

综述

今日仅 3 篇,全部为简读、无精读:LLM 类 2 篇、判别式推荐 1 篇,均为学术工作,是偏轻的一天。AutoData(学术)让 LLM agent 在可执行的打分与采样程序空间中搜索预训练数据筛选配方,借小代理模型反馈迭代,一夜所得配方超过人工清洗流水线并可迁移到更大规模。G3RAG(学术)零 LLM 调用、仅用文档嵌入建图,以几何增益兼顾相关性与新颖性,在三个多跳 QA 基准上较图类 RAG 基线平均 F1 最高提升 4.26。UPR 复现研究确认画像推荐在重排协议下有竞争力,但扰动画像只均匀平移评分、不改变排序,作者归因于评分回归目标。三篇方向分散,无统一主线;可留意 G3RAG 省去建图 token 开销的思路,及“画像可编辑未必能改排序”的提醒。

重点论文

AutoData · ⭐ 5/10

AutoData: Agentic Search for Pre-training Data Selection

🎓 学术 · LLM

AutoData 将预训练数据筛选视为基于逐文档特征(词法统计、类别标签、困惑度)的启发式工程,让 LLM agent 直接在可执行的打分、分层与随机采样程序空间中搜索,并以小代理模型的验证反馈迭代改写算法。一夜搜索得到的筛选配方超过人工设计的数据清洗流水线,且能迁移到更大规模并提升下游 CORE 指标。

G3RAG · ⭐ 4/10

Beyond Similarity through Zero-Token Geometric Graphs for Multi-Hop RAG

🎓 学术 · LLM

提出 G3RAG:离线仅用文档嵌入建图(零 LLM 调用、零生成 token),以 cosθ·sinθ 几何增益同时刻画方向一致性与正交新颖性,配合密度感知的枢纽惩罚和从过滤后查询种子出发的单步受控扩散,为多跳问答补全互补证据。在 MuSiQue、2WikiMultiHopQA、HotpotQA 上优于图类 RAG 基线,平均 F1 最高提升 4.26,并消除了实体抽取式建图的 token 开销。

Reproducing Transparent and Scrutable Recommendations: Exploring Open-Weight Models via Natural-Language User Profiles · ⭐ 4/10

🎓 学术 · 判别式推荐

复现了基于自然语言用户画像的推荐方法 UPR(从评论文本合成画像,支持用户纠正偏好与冷启动干预),确认其在测试集重排协议下性能有竞争力且更透明。扩展实验发现:扰动画像会均匀平移各类别的预测评分、无类别选择性,即便直接做激活干预也不改变排序,作者将其归因于评分回归目标而非画像接口本身,排序目标的模型明显更优。

全部论文

模型 标题 类别 公司 摘要分 精读分
AutoData AutoData: Agentic Search for Pre-training Data Selection LLM 🎓 学术 5 —
G3RAG Beyond Similarity through Zero-Token Geometric Graphs for Multi-Hop RAG LLM 🎓 学术 4 —
— Reproducing Transparent and Scrutable Recommendations: Exploring Open-Weight Models via Natural-Language User Profiles 判别式 🎓 学术 4 —