← 返回报告列表

2026-09-16 日报

日报 📅 2026-09-15
改模型的没上线,上了线的没改模型:本期零精读
agent inference-serving parameter-scaling industrial academic
📊 共 6 篇 · 精读 0

2026-09-16 日报

主题: 改模型的没上线,上了线的没改模型:本期零精读

标签: agent · inference-serving · parameter-scaling · industrial · academic

📊 统计: 共 6 篇 · 精读 0 · 🏢 工业界 0 · 🎓 学术 6 · discriminative-rec 2 · generative-rec 1 · llm 2 · other 1

综述

当日 6 篇(判别式 2、LLM 2、生成式 1、其他 1;工业 2),零精读:唯一够线的 QueryFormer(7 分)被 deep_read_rec_requires_industry 拦下。它以交叉注意力取代投影 MLP 生成 query,夺 UniRec 工业赛道第一,但 H 扫到 8 验证 AUC 仅 +0.00075,无线上。ReliGRec 的提示路由靠评论代理标签,LimiX-2 的机制建模止于表格基准。上线的两篇反封顶 5 分:FlashVector 在 Unity 调服务栈取 2 倍吞吐,AURA 读百万会话日志提改码方案,产物却只是语义等价的代码与诊断。评分只认模型改动,收益却在模型之外。

重点论文

QueryFormer · ⭐ 7/10

QueryFormer: Winning Solution for KDD Cup 2026 Tencent UniRec Challenge

🎓 学术 · 判别式推荐

QueryFormer 针对现有统一架构只用投影 MLP 生成 query token、缺少 token 到 query 的显式注意力精修这一问题,提出可堆叠的统一 field-sequence 块:用交叉注意力生成 query,并把序列 query 打包进共享参数注意力,配套给出按视图宽度 H、模型宽度、深度、数据与算力的时延感知 scaling 研究;该方案拿下 KDD Cup 2026 腾讯 UniRec 挑战赛工业赛道第一(测试 AUC 0.83254),H=8 的推理时延仅为 H=1 的 1.89 倍。

ReliGRec · ⭐ 6/10

ReliGRec: Reliability-Oriented LLM-Based Generative Recommendation via User-Risk-Aware Prompt Routing

🎓 学术 · 生成式推荐

ReliGRec 用行为 Token 与时序图 Token 融合出用户级弱风险分,在推理时据此在“简单提示”和“谨慎提示”之间路由,把风险估计从辅助预测任务变成生成式推荐的生成期控制信号,再由聚合图 Token 提供协同上下文完成下一物品的 Semantic ID 生成。

LimiX-2 · ⭐ 6/10

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

🎓 学术 · 其他

LimiX-2 提出上下文机制网络(CMN)范式与上下文条件掩码建模(CCMM)预训练,把表格 PFN 的组织原则从以目标为中心的 p(y|x,D) 预测转为面向数据生成机制的联合建模 p(x,y|D),预训练数据由覆盖多种图结构与函数机制的结构因果模型合成;在 TabArena、TALENT、BCCO 上超过数据集专用模型与现有表格基础模型,且其特征注意力可编码直接因果关系、支持因果骨架恢复。

FlashVector · ⭐ 5/10

FlashVector: Agent for Hierarchical Model Serving Stack Optimization

🎓 学术 · LLM

FlashVector 把单一 GPU kernel 优化 agent 的范式推广到异构技术栈,提出可扩展框架以跨层优化模型服务栈(GPU kernel、计算图、模型服务器、按需特征处理);在 Unity 的 Vector 广告平台部署后,模型服务器最高取得 2 倍吞吐与 1.98 倍时延加速、特征存储最高 1.6 倍吞吐,优化点覆盖 Triton 的 C++ 代码与 Python 特征变换服务。

AURA · ⭐ 5/10

AURA: Agentic Diagnosis and Refinement for Production Recommender Systems at Scale

🎓 学术 · LLM

AURA 是套在生产推荐系统外侧的端到端 agentic 诊断与改进系统:专用 agent 批量读取数十万至百万级会话的互动日志,归纳推荐在何处、为何让真实用户失望,再结合推荐系统自身代码、数据与训练流水线的上下文提出并落地代码级修改,论文报告了系统设计、安全护栏与在某媒体流媒体公司两个平台上的早期结果。

全部论文

模型 标题 类别 公司 摘要分 精读分
QueryFormer QueryFormer: Winning Solution for KDD Cup 2026 Tencent UniRec Challenge 判别式 🎓 学术 7 —
ReliGRec ReliGRec: Reliability-Oriented LLM-Based Generative Recommendation via User-Risk-Aware Prompt Routing 生成式 🎓 学术 6 —
LimiX-2 LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence 其他 🎓 学术 6 —
ASC Efficient Swing Computation for Retrieval in Large-Scale Recommender Systems 判别式 🎓 学术 5 —
FlashVector FlashVector: Agent for Hierarchical Model Serving Stack Optimization LLM 🎓 学术 5 —
AURA AURA: Agentic Diagnosis and Refinement for Production Recommender Systems at Scale LLM 🎓 学术 5 —