← 返回报告列表

2026-09-04 日报

日报 📅 2026-09-03
度量自指:工业推荐用被自己优化的尺子做证明
industrial search-ranking pretrained-lm rl semantic-id
📊 共 9 篇 · 精读 2

2026-09-04 日报

主题: 度量自指:工业推荐用被自己优化的尺子做证明

标签: industrial · search-ranking · pretrained-lm · rl · semantic-id

📊 统计: 共 9 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 7 · llm 3 · discriminative-rec 1 · other 3 · generative-rec 2

综述

今日 9 篇、2 篇精读:判别式推荐 1、生成式推荐 2、LLM 3、其他 3,工业署名仅 2 篇。两篇工业论文的问题落在同一处:证明主张的那把尺子,本身就是被优化的目标。美团 UniCon 把 CTR 统一建模的单位从 token 换成“上下文单元”,一年期生产数据、7 天 20% 流量 A/B(RPM +3.09%、CTR +2.07%)与编译式 C++ 运行时都很扎实;但直接检验命名主张的两项消融合计仅 0.0017,小于正交的曝光/位置辅助损失 0.0034,全部消融之和更是相对最强基线全部空间的 2.1 倍,自洽性检查缺席。干净的正面证据反在附录 B:其余全固定、只把同时打分的候选数从 16 加到 300,AUC 单调涨 0.0027,剂量—反应比开关式消融更硬。阿里 LLM4AIGQ 用 SFT→GRPO→DPO 生成导购引导词,天猫 A/B uCTR +4.46%,四级奖励的 leave-one-out 方向可分离也少见;但离线“相关性”“价值”两个指标分别就是奖励里的同族编码器与同一个 judge,度量与奖励同源,唯一独立的 Gemini 对比反而在 DPO 后从 57.53% 掉到 54.95%。学术侧 EPIC 值得一提:把语义 ID 的病根定在解码侧,冻结骨干只训 0.391M 适配器,并用“目标不在对照候选池里”的救回案例,给出重排器原理上拿不到的证据。

重点论文

UniCon · ⭐ 7/10

UniCon: A Unified Context-Centric Modeling Paradigm for CTR Prediction

🏢 Meituan · 判别式推荐

UniCon 把工业 CTR 统一建模的基本单位从 token 换成"上下文单元"(一次曝光内共同展示的 item 加意图/环境与用户 token),历史侧填 logged click、目标侧由候选集初始化成"目标潜在上下文单元"并用可学习 placeholder 对齐 feedback 分量,由堆叠 UniConBlock 交替做 intra-context(Locality)与 inter-context(Dynamics)变长注意力、块间用 target-aware Gumbel-TopK 上下文压缩把注意力开销从 O(LN^2) 压到 O(N^2/(1-r^2)),在美团搜索广告一年期生产数据上离线 AUC 0.8558→0.8697、7 天 20% 流量 A/B 拿到 RPM +3.09%/CTR +2.07%/营收 +2.95%(p<=0.01);但其命名主张的净贡献存疑——直接检验上下文中心化的两项消融合计仅 +0.0017,小于正交的曝光/位置辅助损失 +0.0034,而论文未说明基线是否同样开启该辅助监督。

LLM4AIGQ · ⭐ 6/10

LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining

🏢 Alibaba · LLM

阿里淘天把 AI 导购引导词(AIGQ)的生产链路从「多路召回主搜 query + 规则泛化」的判别式级联换成 LLM 端到端「多兴趣切分 → 意图推断 → 引导词生成」,中间表示由 query 改为 interest;训练用 SFT(单兴趣只学风格)→ GRPO(think/query/interest/global 四级奖励 + 最优有序匹配 DP 对齐教师兴趣切分)→ DPO(把 think 模式答案作正样本、non-think 作负样本,再剔除最相似 30% 偏好对)三段后训练;部署用近线按 N 次交互触发生成、在线只读 user_id→queries 映射表的架构把 LLM 挡在实时路径外;天猫导购/搜索/详情页多场景 A/B 10% 流量 uCTR +4.46%、放量 40% 后六天 +2.53%,但离线两个指标与训练奖励同源、线上无坑位与转化口径、放量衰减未解释。

EPIC · ⭐ 7/10

EPIC: Explicit Posterior Item Conditioning for Semantic ID Diffusion Recommendation

🎓 学术 · 生成式推荐

在 semantic ID 掩码扩散推荐的每一步去噪中引入显式的完整物品级竞争:用当前生成上下文与用户近期交互构造个性化的候选物品后验,再把该分布投影回未确定的 SID 位来引导后续 token 决策,骨干冻结且不增加解码器前向。四个 Amazon 基准 16 项指标全部最优,诊断实验证明增益来自去噪过程中保留住了有希望的物品假设而非事后重排。

全部论文

模型 标题 类别 公司 摘要分 精读分
UniCon UniCon: A Unified Context-Centric Modeling Paradigm for CTR Prediction 判别式 🏢 Meituan 8 7
LLM4AIGQ LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining LLM 🏢 Alibaba 7 6
EPIC EPIC: Explicit Posterior Item Conditioning for Semantic ID Diffusion Recommendation 生成式 🎓 学术 7 —
SelfDR SelfDR: Self-Distillation from Reasoning for LLM-Based Recommendation LLM 🎓 学术 6 —
HypRQ-VAE HypRQ-VAE: Hyperbolic Item Indexing for Long-Tail-Aware Generative Recommender Systems 生成式 🎓 学术 6 —
Xiaomi-TabLDM Xiaomi-TabLDM: A Tabular Foundation Model Technical Report 其他 🎓 学术 5 —
WIDE WIDE: Wildcard Inference with Dynamic Expansion for Cross-Modal Generative Retrieval 其他 🎓 学术 5 —
Spruce Spruce: Scalable Private Outsourced Retrieval Using Compact Embeddings 其他 🎓 学术 4 —
— Coupled Scaling: A Representational Accessibility Framework for Neural Scaling Laws LLM 🎓 学术 4 —