← 返回报告列表

2026-08-11 日报

日报 📅 2026-08-08 ~ 2026-08-10
工业推荐的控制层转向:LLM 生成可执行策略而非物品序列
industrial pretrained-lm rl agent inference-serving
📊 共 14 篇 · 精读 6

2026-08-11 日报

主题: 工业推荐的控制层转向:LLM 生成可执行策略而非物品序列

标签: industrial · pretrained-lm · rl · agent · inference-serving

📊 统计: 共 14 篇 · 精读 6 · 🏢 工业界 6 · 🎓 学术 8 · generative-rec 6 · llm 5 · other 2 · discriminative-rec 2

综述

本批合并 8 月 8 日至 10 日三天共 14 篇,6 篇精读、8 篇仅存摘要;生成式推荐 6 篇、LLM 5 篇,精读名额全部被有线上验证的工业论文占据。高德 IntHQ 把多任务生成式推荐诊断为来源、关系、层级三重坍缩,以双流解耦与分层查询对治,全量上线 UVCTR 相对提升 1.60% 且 FLOPs 低于所有基线。淘宝 MetaStrategy 让 LLM 生成受 schema 约束的可执行排序策略而非物品序列,蒸馏到 0.8B 后点击 PV 增 2.11%、成交额增 2.83%;同组 DREAM 把 agentic 控制层叠在既有级联管线之上,联控重排与精排后 IPV 增 2.71%、GMV 增 1.31%。快手 PushDualGen 把解释挪到 SID 之后做成可跳过文案,有效播放率增 8.50%、不满意率降 37.70%。Netflix 与杜克发现主观审核任务上显式推理普遍掉点、GRPO 会触发推理坍缩,正确性门控的条件长度奖励把最难 rubric 从 0.519 救回 0.572;Cognizant 的 RotaryQuant 在压缩空间直接算注意力,把 1200 亿参数 MoE 塞进 32GB 消费级硬件。当日趋势是解耦:LLM 退到可审计、可回滚的配置层,增益来自结构与护栏而非更大的模型。

重点论文

IntHQ · ⭐ 8/10

IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation

🏢 Alibaba · 生成式推荐

IntHQ 把多任务生成式推荐的病因诊断为 source/relational/hierarchical 三重坍缩,用双流解耦(任务 token 独立成参数不共享的第二条流)、任务交互建模(因果掩码的跨任务自注意力替代预定义漏斗)和分层查询(每个任务按深度注意力自适应选层)分别对治,在高德 IntTravel 的 4 编码器 × 4 多任务头网格上十项指标全优,线上全量部署拿到 UVCTR 相对 +1.60% 且 FLOPs 低于所有 baseline。

MetaStrategy · ⭐ 8/10

MetaStrategy: Generative Ranking with Executable LLM Strategies

🏢 Alibaba · 生成式推荐

MetaStrategy 让 LLM 以请求上下文为条件生成一份 schema 受约束的类型化 JSON「可执行排序策略」(目标权重/卡片类型/类目偏好/体验约束/头部 CTR 开关)而非 item 序列,由确定性 validator+compiler 编译成生产参数挂到隔离 Generator,在 GE 架构里与约十个存量 Generator 原子竞争;用不曝光用户的生产链路 replay 产出 selection/rank/lift 三重奖励做 RL,自竞争课程把高频策略模式冻成新竞争者防坍缩(4B Top-1 集中度 76.8%→41.2%),Evaluator 路由的 reward-augmented OPD 把两个 4B Teacher 蒸成 0.8B Student 并反超 Teacher(ΔGE +0.73% vs +0.45%/+0.57%);淘宝首页猜你喜欢 nearline diff 触发部署零 RT 增长,7 天 A/B 赢下 27.93% 的 GE 调用,点击 PV +2.11%、IPV +3.12%、成交额 +2.83%。

DREAM · ⭐ 7/10

DREAM Technical Report

🏢 Alibaba · LLM

DREAM 是淘宝把 agentic 元控制叠加在既有召回-排序-重排级联管线之上的工业架构报告:一个管线模型都不替换,只加一层可感知、可编排、可审计的策略层。感知端是三层 Intent Engine,端云 F1-F4 漏斗用单层 GRU 做变点检测(端上仅放行约 15% 行为、端到端上报量约 8.7%),0.8B Main Agent 同步吐出 insert/update 增量意图与路由决策,约 6.3% 困难请求升级到 4B context subagent/expert 异步精修再经 on-policy 反向 KL 蒸馏回灌,夜间闲置 GPU 上的 Dreaming 用 keep/correct/enrich/merge/add/kill 六种原子操作在全天轨迹上重建完整意图列表。决策端是基于 Qwen3 的 MetaModel,M1 定取向、M2 出受 schema 约束的枚举化策略 bundle、M3 确定性编译成分阶段参数,经 JSON/schema/白名单/范围四道校验门以局部 override 方式作用在原 LTR 分数上(LLM 从不产出 item ID 或最终排列)。频控被形式化为带预算约束的选择性计算,经拉格朗日退化为按用户组/时间桶/场景/日级漂移调整的分数阈值。策略用 production-path replay 离线训练,二元 Evaluator 奖励只问是否胜过默认管线。淘宝首页 A/B 中仅控重排即 IPV +2.06%、GMV +0.88%,扩展到精排后升至 +2.71% 与 +1.31%,而 PV 基本持平。

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing · ⭐ 7/10

🏢 Netflix · LLM

Netflix 在四个生产主观审核 rubric 上系统检验显式推理与 RLVR 的可迁移性,发现显式推理/高 effort 推理模型普遍低于零样本基线(self-consistency K=8 还会放大差距),标准 GRPO/Dr. GRPO/GSPO 在数学推理强的 Qwen 上反而掉点并触发「推理坍缩」——约 70 步后平均终止长度从 ~300 断崖跌到 ~150 token,策略改为直接猜标签;论文提出以答案正确性为门控、以 L_target 封顶的条件长度奖励(正确才给 λL,且 L<L_target),把 Query Sensitivity 从坍缩后的 0.749 拉到 0.851、最难的 ID: Response Quality 从 0.519 恢复到 0.572 并同时超过带/不带推理两个基线;进一步用 1500 个人格证明判定 macro-F1 在 0.416~0.792 间波动近 0.38,说明大量「校验错误」其实是推理风格错配,据此提出 synthesis → SFT → 强化路由的人格路由中训练蓝图(RLVR 从教「怎么推理」改为教「用哪种推理偏置」)。

RotaryQuant · ⭐ 7/10

RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention

🏢 Cognizant · LLM

RotaryQuant 用「4-bit dense / 2-bit routed expert / Q8_0 shared expert 的按角色混合精度权重量化 + IsoQuant KV 压缩 + LRU 专家换页」三轴组合把 26B–120B MoE 塞进消费级内存,其中 IsoQuant 以 Walsh–Hadamard 变换复合分块 SO(4) 旋转把旋转代价降到 O(d log d)、每 head 仅存 256 参数(稠密方案为 O(d²) 与 16,384),并用四 kernel Metal 流水线直接在打包 3-bit 数据上算注意力、反旋转只对聚合输出施加一次,从而彻底取消张量物化;Nemotron-H 120B 在 32 GB M4 Max 上峰值 17.2 GB、14.85 tok/s,ΔPPL ≤ +0.0012、32K NIAH 100%。

全部论文

模型 标题 类别 公司 摘要分 精读分
IntHQ IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation 生成式 🏢 Alibaba 8 8
MetaStrategy MetaStrategy: Generative Ranking with Executable LLM Strategies 生成式 🏢 Alibaba 8 8
DREAM DREAM Technical Report LLM 🏢 Alibaba 8 7
— LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing LLM 🏢 Netflix 7 7
RotaryQuant RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention LLM 🏢 Cognizant 7 7
PushDualGen PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation 生成式 🏢 Kuaishou 7 6
TSPORec TSPORec: Token Selection via Preference Optimization for LLM-Based Sequential Recommendation 生成式 🎓 学术 6 —
AgentCom Personalized Communication Skills for Agentic Recommender Systems LLM 🎓 学术 6 —
InforID Adaptive Semantic Capacity Allocation for Parallel Generative Recommendation 生成式 🎓 学术 6 —
SPACE Give the Long-tail More SPACE: Promoting Provider Fairness in Next POI Recommendation 判别式 🎓 学术 5 —
CoRCi CoRCi: Cross-Reconstruction of Coherent Interests Modeling in Cross-Domain Sequential Recommendation 判别式 🎓 学术 5 —
— Structure-Preserving Projection for Mitigating Modality Bias in LLM-Based Sequential Recommendation 生成式 🎓 学术 5 —
— Population-Level Generative Modeling for Ranking Data 其他 🎓 学术 4 —
— Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders 其他 / LLM 🎓 学术 4 —