2026-08-06 日报
主题: 工业排序的价值定义之变:跨请求探索与延迟信号分离
标签: industrial · rl · multi-task · moe · agent
📊 统计: 共 5 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 3 · generative-rec 1 · discriminative-rec 1 · llm 2 · other 1
综述
今日入库 5 篇,2 篇精读、3 篇仅存摘要;类别上生成式推荐与判别式推荐各 1 篇、LLM 2 篇、其他 1 篇,工业色彩浓厚,仅 1 篇纯学术。京东的 DEGR 把重排的价值定义从即时收益扩到跨请求探索:以上游 Max-pCTR 作为供给质量代理,实证它与“下一请求点击率”基本解耦,据此训练探索型奖励模型,再用自适应奖励加权 ORPO 驱动生成器,线上只部署生成器做单次贪心解码,京东首页 7 天 A/B 拿到 UCTR +1.22%、PV +0.20%,TP99 仅 +3.2ms。Twitch 的 FSM-MMoE-VST 则按信号性质拆模型:稠密即时目标走 Fresh Signal Model,chat/follow/spend 用 14 天延迟窗口把稀疏正标签放大约 12 倍后并入 4 专家 MMoE,推理时再对 Early/Dedicated 观众分层加权;三次 14 天 A/B 累计 DAV +0.09%、高活观众 capped ARPU +0.56%,延迟目标建模参数降 41.9%。A/B Agent 则用分层经验树加 Tree-RAG 做策略自演化,短视频电商场景 GMV +4.829%。三者共同指向同一趋势:工业排序的增量正从骨干选型转向优化目标与训练信号的定义方式,跨请求探索、延迟标签构造与实验闭环自动化值得持续跟踪。
重点论文
DEGR · ⭐ 7/10
DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging
🏢 JD · 生成式推荐
DEGR 指出重排受上游固定供给约束、只优化即时价值在低质供给下必然触顶,并用京东 15 等频分组数据证明 Max-pCTR 与「下一请求点击率」基本解耦,据此训练一个以上游 Max-pCTR 为动态权重的探索型奖励模型(item 级即时奖励 MMoE + 序列级探索奖励 MLP,未来行为分 A~E 五档、对「未点击但滚动且后续有点击」按 4-3log2(1+Max-pCTR) 提权、低供给时掩掉无效探索负样本),冻结后以监督学习 + 组内正则多样性约束 + 自适应奖励加权 ORPO(把成对偏好扩成分位点偏好列表、用 softmax(R/t) 作软权重)三项混合损失驱动 encoder-decoder 生成器,配合 group beam search 与启发式采样扩大探索空间、多解码头 cohort 把解码复杂度从 O(M) 降到 O(M/K);线上只部署生成器单次贪心解码,京东首页 7 天 A/B 取得 UCTR +1.22%、PV +0.20%,TP99 仅 +3.2ms。
FSM-MMoE-VST · ⭐ 6/10
🏢 Amazon · 判别式推荐
Twitch 把直播多目标排序按信号性质拆成两路——处理稠密即时目标(SMP)的 Fresh Signal Model 与用 14 天延迟窗口把 chat/follow/spend 稀疏正标签放大约 12 倍的 Delayed Signal Model(最终与 LMP 一起并入 4 专家 MMoE)——再在推理时按 Early/Dedicated 观众分层施加零参数的条件标量化权重(VST),替代无效的训练时样本加权;离线证明 MMoE/Shared-Bottom/CGC 三种骨干配上独立 FSM 后表现几乎相同(LMP NDCG@6 0.2462-0.2463)而任一单一统一 MTL 模型都把 LMP 打垮 4.2%-4.6%,说明「新鲜/延迟信号分离」而非骨干选型才是主导增益来源;三次 14 天线上 A/B 累计 DAV +0.09%、高活观众 capped ARPU +0.56%、低活观众 DAV +0.15%、关注 +0.27%,MMoE 整合把延迟目标建模参数从 2670 万降到约 1550 万(-41.9%),p99 排序延迟 <110ms,并在移动 live feed 上泛化取得 +1.12% 正向交互。
A/B Agent · ⭐ 6/10
A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
🎓 学术 · LLM
提出面向工业推荐策略迭代的闭环智能体 A/B Agent,由历史策略知识组织、自主目标感知策略生成、实验引导的策略自演化三部分构成:把历史实验组织成按业务场景、推荐阶段、优化目标、实验上下文分层的经验树,用多路 Tree-RAG 检索可迁移证据来生成可执行策略,再持续分析线上 A/B 反馈进行自主调参并回写经验树。真实短视频电商推荐系统上 GMV 提升 4.829%,且所有护栏指标保持正向。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| DEGR | DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging | 生成式 | 🏢 JD | 7 | 7 |
| FSM-MMoE-VST | Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting | 判别式 | 🏢 Amazon | 7 | 6 |
| A/B Agent | A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing | LLM | 🎓 学术 | 6 | — |
| — | Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains | LLM | 🎓 学术 | 4 | — |
| — | WatchLens: A Configurable Platform for Online Video Recommendation Experiments | 其他 | 🎓 学术 | 4 | — |