← Back to list
MetaStrategy

MetaStrategy: Generative Ranking with Executable LLM Strategies

生成式推荐 Alibaba
Abstract 8 │ Reading 8 │ Rating —
2026-08-10
Chengyu Lai, Jiuning Lin, Zhibo Xiao, Xiaodong Zhu, Ruiquan Lan, Bin Zhang, Zihong Huang, Wendong Zhang, Chuxin Chen, Yinjiang Cai, Shuai Zhong, Lingqing Zhang, Dimin Wang, Jialin Zhu, Han Zhu
Taobao & Tmall Group of Alibaba, Wuhan University, The University of Hong Kong, University of Cambridge
MetaStrategy 让 LLM 以请求上下文为条件生成一份 schema 受约束的类型化 JSON「可执行排序策略」(目标权重/卡片类型/类目偏好/体验约束/头部 CTR 开关)而非 item 序列,由确定性 validator+compiler 编译成生产参数挂到隔离 Generator,在 GE 架构里与约十个存量 Generator 原子竞争;用不曝光用户的生产链路 replay 产出 selection/rank/lift 三重奖励做 RL,自竞争课程把高频策略模式冻成新竞争者防坍缩(4B Top-1 集中度 76.8%→41.2%),Evaluator 路由的 reward-augmented OPD 把两个 4B Teacher 蒸成 0.8B Student 并反超 Teacher(ΔGE +0.73% vs +0.45%/+0.57%);淘宝首页猜你喜欢 nearline diff 触发部署零 RT 增长,7 天 A/B 赢下 27.93% 的 GE 调用,点击 PV +2.11%、IPV +3.12%、成交额 +2.83%。
评分原因
摘要评分:不直接生成物品序列,而让 LLM 策略生成带类型的可执行排序策略 JSON,经确定性校验与编译后作为 Generator 原子地进入 GE 架构竞争,这个“生成策略而非序列”的定位很好地解决了生成式排序与成熟预测模型/规则/护栏难以融合的问题;配生产回放训练、自竞争课程与 4B 教师到 0.8B 学生的蒸馏,淘宝首页猜你喜欢 7 天 A/B 成交额 +2.83% 且不增加 RT。
精读评分:把生成式排序的动作空间从 item 排列换成 typed JSON 可执行策略、经确定性 compiler 挂到隔离 Generator 与存量池原子竞争,是一个新颖且工程上极稳的 LLM 接入范式;生产链路 replay、自竞争课程与 Evaluator 路由 OPD 都配了同规模配对消融,线上 7 天 A/B 成交额 +2.83% 且零 RT 增长。扣分点是无任何公开数据集/可复现基线,且五模块 action schema 是人工定义的,扩参数量不自动扩表征能力(4B 反而比 0.8B Student 弱),scaling 需人工扩 schema。
pretrained-lm rl knowledge-distillation industrial

MetaStrategy:让 LLM 生成「可执行排序策略」而不是物品序列

Taobao & Tmall Group of Alibaba(Chengyu Lai、Jiuning Lin、Zhibo Xiao、Ruiquan Lan、Bin Zhang、Zihong Huang、Wendong Zhang、Chuxin Chen、Yinjiang Cai、Dimin Wang、Jialin Zhu、Han Zhu 等,另有武汉大学、香港大学、剑桥大学合作者),投稿 KDD '27,arXiv:2608.09440,2026-08-10,正文 10 页。

一句话:现有生成式排序直接构造 item 序列,与成熟预测模型、运营规则、字段级护栏之间存在难以逾越的集成边界;MetaStrategy 改为让 LLM 以请求上下文为条件生成一份 schema 受约束的类型化 JSON 可执行策略包(目标权重 / 卡片类型偏好 / 类目偏好 / 体验约束 / 头部 CTR 开关),由确定性 validator + compiler 翻译成生产参数、挂到一个隔离的 Generator 上,在 Generator-Evaluator(GE)架构里与约十个存量 Generator 做原子竞争。训练侧用生产链路 replay 环境(重放线上日志、不曝光用户)产出三重奖励做 RL,用自竞争课程把高频策略模式冻成新竞争者防坍缩,再用 Evaluator 路由的 reward-augmented on-policy distillation 把两个 4B Teacher 压进一个 0.8B Student。淘宝首页「猜你喜欢」上线,nearline diff 触发使 LLM 推理完全离开同步排序链路、RT 无可观测增长;7 天随机 A/B 赢下 27.93% 的实验侧 GE 调用,曝光 PV +1.49%、点击 PV +2.11%、IPV +3.12%、成交额 +2.83%。


一、研究动机与背景

1.1 工业排序列表从来不是一个分数决定的

电商首页一屏里混排着商品、内容帖、短视频、直播、广告位,它们预估目标不同、运营约束不同,却在争抢同一批曝光位置。因此生产系统普遍在预测模型之上再叠一层策略层(strategy layer),协调目标权重、内容构成、类目偏好、曝光过滤、密度约束与位置专属规则。

这一层的特点是:可靠,但难以个性化。症结有两条:全局多目标公式无法表达每个请求特有的权衡;规则独立调优会忽略它们之间的交互——论文给了两个很具体的例子:一个偏点击的权重调整可能被头部位置策略直接覆盖,一个内容类型的加权可能在重排之后违反密度约束。结论是这些决策必须联合做出,并以用户上下文、当前意图、候选供给为条件。

1.2 直接生成 item 序列造成的集成边界

生成式推荐天然适合建模联合决策,已有工作把推荐表述为文本生成(P5、M6-Rec)、语义标识符生成(TIGER、OneRec)或自回归 slate 构造(Seq2Slate)。但在成熟的高流量系统里直接生成 item 序列会制造一条很难跨越的集成边界:

生成出的序列必须复现既有的过滤器、已校准的预测器、配额与安全控制,同时没有任何简单办法去检查或纠正某一条具体的业务决策。

于是本文反过来做:生成排序策略,让生产 ranker 去执行它。LLM 消费上游意图模型的实时多意图表征、用户历史统计量与有序近期行为序列,产出一份 schema 受约束的 JSON 包联合调整若干排序模块,确定性 tool 进程校验并把语义动作翻译成已有生产参数。LLM 不吐 item id,也不吐 item 排列——这个分离既保住自回归模型联合决策的表达力,又保住已部署 ranker 的控制面。

1.3 GE 架构给了非侵入接入点,但 RL 有两个挑战

MetaStrategy 运行在 Generator-Evaluator(GE)架构内:LLM 只控制一个隔离的 Generator,与约十个存量 Generator 竞争——它能改善最终决策却不必绕过既有生产边界。RL 层面有两个挑战:Evaluator 有用但不完美,直接做奖励优化会坍缩到少数极端 bundle(利用代理模型稳定的偏好规律,而非真的按请求自适应);大 LLM 是好的离线探索 Teacher,但服务预算撑不起。对应解法即自竞争课程与 Evaluator 路由的 reward-augmented OPD。


二、问题设定与形式化

2.1 工业策略组合

设 $x$ 为一次推荐请求的上下文,$I=\{i_1,\dots,i_n\}$ 为其共享候选集。用户侧上下文含三个互补视图:上游意图模型给的实时多意图表征、概括长期偏好与参与度的历史统计量、一段有序的实时行为序列(点击、加购、购买等),再与请求状态和候选供给摘要组合。本文部署里 $n$ 是数百量级,曝光列表是数十量级。一个生产排序策略是一组决策的组合而非一个标量分数,简化后的目标融合可写作:

$$q(i \mid x) = \alpha(x)\,\hat{v}_{\text{eng}}(i,x) + \beta(x)\,\hat{v}_{\text{txn}}(i,x) + \gamma(x)\,\hat{v}_{\text{com}}(i,x) \tag{1}$$

但最终列表还依赖过滤、供给混排、多样性与位置规则。论文明确划清边界:ESMM / MMoE 等多任务模型改进的是底层预测,本文聚焦协调这些预测与规则的请求级 policy。文中 CTR / CVR / GMV 分别指点击率、转化率、成交额,前缀 $p$ 表示模型预估值。

2.2 Generator-Evaluator 架构

对策略 $s_j$,Generator $G_j$ 把共享候选映射为一个有序列表:

$$L_j = G_j(I, x; s_j), \qquad |L_j| \ll |I| \tag{2}$$

Generator 可以是既有排序配方、人工策略或 LLM 生成策略。列表级 Evaluator 给出:

$$u_j = E(L_j, x), \qquad j^\star = \arg\max_{j \in \mathcal{C}} u_j, \qquad L^\star = L_{j^\star} \tag{3}$$

其中 $\mathcal{C}$ 是当前激活的 Generator 池。与 pointwise ranker 不同,$E$ 消费完整列表并带上用户、item、位置与业务上下文;其监督头覆盖 point 级点击与成交、下滑行为、列表级点击结果与 eCPM,这些头的校准组合代表比较完整列表的部署效用。论文强调 Evaluator 与 LLM 是刻意分开的:Evaluator 代表平台侧决策边界(用户价值、商业价值、体验约束),LLM policy 只在这个边界内部搜索个性化策略。

2.3 策略生成目标

设 $\mathcal{A}$ 为 schema 受约束的策略空间,$\pi_\theta(a\mid x)$ 为 LLM policy,每次生成产出一个完整 bundle $a \in \mathcal{A}$。确定性 tool 进程 $\mathcal{T}$ 把语义动作转成生产参数,参数控制一个隔离 Generator $G_{\mathcal{T}(a)}$。学习目标是:

$$\max_{\theta}\ \mathbb{E}_{x\sim\mathcal{D},\,a\sim\pi_\theta(\cdot\mid x)}\Big[E\big(G_{\mathcal{T}(a)}(I,x),\,x\big)\Big] \tag{4}$$

约束是 schema 合法性、执行约束与平台护栏。由于 bundle 内含多个互相依赖的模块,policy 自回归分解:

$$\pi_\theta(a \mid x) = \prod_{m=1}^{M} \pi_\theta(a_m \mid x, a_{<m}) \tag{5}$$

论文特意反驳了「字段域很小所以可枚举」这一直觉:联合空间指数增长,且后面的模块可以强化或覆盖前面的决策。


三、核心方法:MetaStrategy

Figure 1: Overview of MetaStrategy. (a) The LLM maps request context to one structured JSON strategy, which is validated and compiled rather than directly generating an item sequence. (b) The compiled configuration controls one Generator that competes with production Generators under a shared list-level Evaluator. (c) Production-path replay supplies the three GE rewards used for self-competitive curriculum learning and per-request evaluator-routed OPD into the deployed 0.8B Student.

Figure 1 把执行与学习闭环画成三块:(a) 策略生成——请求上下文(用户意图与行为 / 候选与排序分 / 业务约束)经 LLM Strategy Policy 产出 5 模块 JSON、再经 Validator & Compiler 得到 compiled config,图中直接标注了 "strategy generation, not item generation";(b) 原子 GE 执行——LLM 控制的 Generator 与 $G_1 \dots G_m$ 一起被列表级 Evaluator 打分选出曝光列表;(c) replay 训练——日志请求 + 实时特征模型经生产链路 replay 走一次原子 GE 调用,产出 Selected / Rank / Lift 三种 reward,分别喂给自竞争课程与 Evaluator-routed OPD。上游分工上,意图模型给出当前多意图状态,策略 policy 额外观察历史聚合量与原始近期行为,为的是「避免重新学习意图,同时保留压缩状态里缺失的时序证据」。

3.1 可执行策略包(Executable Strategy Bundle)

policy 产出一个被固定 answer 分隔符包裹的 JSON 对象,含五个有序的可执行模块(附录 A Table 3):

Table 3:当前部署中的结构化策略空间

模块 决策与取值域
ranking_weight_boost CTR、IPV、CVR、GMV 四项调整;每字段取 $\{-2,-1,0,1,2\}$
cardtype_preference 对竞价、广告、促销、视频、直播、专业内容的偏好;每字段取 $\{-2,-1,0,1,2\}$
category_preference 对合格类目的偏好强度;每 key 取 $\{-2,-1,0,1,2\}$
experience_constraints 曝光、购买、密度约束;每字段取 $\{-2,-1,0,1,2\}$
top_ctr_strategy 页面专属的 top-CTR 与逆序开关;每 page group 取 $\{0,1\}$

论文对这套 schema 的定位说得很清楚:这是语言 policy 与生产重排系统之间的契约,刻意排除 item 标识符、自由形式代码与直接排列;序数值表达相对偏好或调整强度,不替换既有精排分、不绕过硬性约束。有界具名字段带来三重收益:决策可审查、跨模块交互被暴露、可施加字段级上限;训练 / replay / nearline / 服务共享同一份 schema 则直接降低了 training-serving skew。

3.2 校验、编译与隔离:四道确定性闸门

输出要过四道闸门:Parser(抽取 answer block 并解析 JSON)→ Schema validation(检查模块完整性、顺序、字段类型、枚举、数值范围)→ Tool process(把语义动作映射为生产参数,含 Generator 配置、多样性规则、头部位置设置)→ 隔离挂载(编译后参数只附着到指定 Generator)。

失败处理是 fail-closed 的:非法的 Student 输出拿到 format penalty 并跳过 tool 执行,格式错误的 Teacher 被移出路由集合,目的是防止「缺字段 / 空配置」变成一条捷径。配置隔离还让 replay 奖励可归因到 LLM 策略本身。

3.3 生产链路 replay 环境

这是全文最有工程分量的一节,它明确取代了一个本地实现的 user simulator。

每个 episode 由一条真实线上请求的输入日志初始化,日志保留候选集、精排分与重排所需上下文。召回与精排推理不被重放——episode 从固定候选与分数开始,通过隔离的压测流量执行生产的混排与重排链路;replay 时请求解析当前线上特征并调用当前生产模型,为每个生成列表拿一个新鲜的列表级 Evaluator 分。一次原子 GE 调用内,LLM 控制的 Generator 与约十个生产 Generator(含扰动型与上下文感知重估型变体)作用于同一请求与候选集,所有有效列表由一次 Evaluator 调用打分;超时、失败或返回非法列表者被移出比较。

隔离性上:replay 选出的列表返回训练进程但从不曝光给用户,请求不写曝光日志、归因记录或业务计数器;一个 episode 是单步上下文决策,环境不合成点击或成交、也不模拟后续状态转移,因此 Evaluator 输出只是列表的代理效用。

论文对 replay 的非确定性处理得很坦率:同一条日志请求重复执行不必产生相同结果(线上特征在 replay 时解析,生产模型会随发布变化)。因此他们避免跨调用比较绝对分数,学习信号一律基于共享一次原子 GE 调用的 Generator 之间的、成对的、请求内比较。这保住了对当前重排栈的保真度,又把优化限制在「已记录候选 + 固定精排分」的支撑集内——它不是对历史服务状态的精确重建,也不是长时程用户模拟器。

3.4 Evaluator 导出的 GE 奖励

环境每次返回所有有效 Generator 列表的分数与 Evaluator 选中的 Generator。设 $u_S$ 为 Student Generator 分数,$u_B$ 为指定基线分数,$N$ 为有效竞争列表数,$\text{rank}_S \in \{0,\dots,N-1\}$ 为 $u_S$ 的降序排名。三个互补奖励:

$$r_{\text{sel}} = \mathbb{I}[\,j^\star = S\,] \tag{6}$$

$$r_{\text{rank}} = \frac{N - 1 - \text{rank}_S}{\max(N-1,\,1)} \tag{7}$$

$$r_{\text{lift}} = \text{clip}\!\left(\frac{u_S - u_B}{\max(|u_B|,\,\epsilon)},\ -c,\ c\right) \tag{8}$$

分工很清楚:selection 与最终 GE 决策对齐但稀疏、rank 给出跨竞争者的稠密相对信号、lift 度量相对同一次调用内生产参照的连续改进量。聚合奖励:

$$r_{\text{GE}} = w_{\text{sel}}\cdot r_{\text{sel}} + w_{\text{rank}}\cdot r_{\text{rank}} + w_{\text{lift}}\cdot r_{\text{lift}} \tag{9}$$

做 group-based policy optimization 时,对同一请求采样多个 bundle 并在组内归一化奖励:

$$A^{\text{RL}}_{q,k} = \frac{r_{q,k} - \mu_q}{\sigma_q + \epsilon} \tag{10}$$

这个 advantage 送进 clipped policy 目标。这里有个关键错位:奖励依赖被执行的列表,而 policy 的动作依然是策略 bundle——两者处在不同空间,中间隔着确定性编译器与整条生产重排链路。

3.5 自竞争策略课程(Self-Competitive Strategy Curriculum)

Evaluator 是学出来的代理,可能含可被利用的规律。训练早期观察到的坍缩是:policy 反复把有界字段推到极值,或对毫不相关的请求吐出近乎一样的 bundle——这类 policy 在 replay 里分数不错,却几乎没有请求级自适应能力。课程的核心思路是把 policy 的主导行为变成它下一轮的竞争对手。在轮次 $t$,policy 针对池 $\mathcal{C}_t$ 训练:

$$\theta_t = \text{RL\_Train}(\mathcal{D},\ \mathcal{C}_t) \tag{11}$$

执行所有有效采样 bundle,并对编译后的配置计算规范签名 $z = \text{Sig}(\mathcal{T}(a))$——用编译后签名的好处是把操作上等价的 JSON 变体合并掉。令 $\mathcal{Z}_t$ 为 $k$ 个最高频签名,下一轮池子为:

$$\mathcal{C}_{t+1} = \mathcal{C}_t \cup \{\,G(z) : z \in \mathcal{Z}_t\,\} \tag{12}$$

每个 $G(z)$ 是执行对应策略的冻结 Generator。于是下一代 policy 必须超越这些已被显式化的模式,而不能靠重新发现它们来赚奖励。

补充三点:课程是跨训练作业的外层循环;它不枚举联合策略空间,也不要求在线执行多份 LLM 输出;不同轮次、种子、规模的 checkpoint 可组成互补的 Teacher 池。作者还跟踪 compiled-signature 多样性与有界动作饱和度,但这些只是诊断量,真正抬高竞争难度的是式 (12)。

3.6 Evaluator 路由的 reward-augmented OPD

蒸馏分支把一池昂贵的 policy 压进紧凑 Student。路由按请求执行,一次有效比较要求所有候选策略看到同一个 replay 状态。对请求 $x$,Student 与 $M$ 个 Teacher 各生成:

$$a_S \sim \pi_\theta(\cdot \mid x), \qquad a_i \sim \pi_i(\cdot \mid x), \quad i = 1,\dots,M \tag{13}$$

每个有效 bundle 被编译成一条隔离的 Generator 规则。Student、Teachers 与生产基线在同一次 replay 调用里提交,列表共享原始请求、候选与 Evaluator 状态。Teacher 路由排除 Student,在通过解析、schema、tool 执行与 Evaluator 打分的 Teacher 中选:

$$i^\star(x) = \arg\max_{i \in \mathcal{V}(x)} E\big(G_{\mathcal{T}(a_i)}(I,x),\ x\big) \tag{14}$$

其中 $\mathcal{V}(x)$ 是有效 Teacher 集合,平手由确定性标识符打破;若为空则请求路由到 __none__:保留 RL 奖励、屏蔽蒸馏项。OPD 在 Student 自己采样出的 token 轨迹上评估,而不是在 Teacher-forced 的目标序列上。在响应 token $\ell$ 处:

$$d_\ell(x) = \log \pi_\theta\big(a^S_\ell \mid x, a^S_{<\ell}\big) - \log \pi_{i^\star(x)}\big(a^S_\ell \mid x, a^S_{<\ell}\big) \tag{15}$$

在 Student 采样下,这个 log-ratio 估计 reverse KL 方向,即 $\mathrm{KL}(\pi_\theta \Vert \pi_{i^\star})$。作者把它直接与奖励 advantage 组合:

$$A^{\text{mix}}_\ell = A^{\text{RL}} - \lambda_{i^\star(x)}\, d_\ell(x) \tag{16}$$

并把 $A^{\text{mix}}_\ell$ 送进标准 clipped policy 目标,只有被路由中的 Teacher 贡献参考 log-prob。论文特意划清界限:这不是额外的 Teacher-forced 交叉熵损失,也不是独立的 KL 损失。

为什么必须保住 $A^{\text{RL}}$:纯模仿无法超越被路由的 Teacher,且在所有 Teacher 都弱时会传播糟糕监督。混合目标同时做到三件事——保留针对生产 GE 奖励的探索、有好 Teacher 时用最好的可比 Teacher、路由不可用时退化为纯 RL 训练。

两阶段训练流程:Teacher 构建迭代式地针对课程池训练 policy、把高频编译模式加为竞争者、保留互补 checkpoint;Student 压缩原子地评估每个 policy 的一个 bundle、路由出最好的有效 Teacher、用式 (16) 更新 Student。Teacher 池仅离线存在。


四、生产部署

Figure 2: Nearline generation and guarded GE serving. Requests proceed to online ranking while a context-difference gate asynchronously reuses or refreshes the strategy. Valid Student output is compiled and published; the synchronous resolver selects a personalized or default configuration for the isolated MetaStrategy Generator under the incumbent Evaluator.

部署场景是淘宝首页「猜你喜欢」信息流。核心设计是:LLM 推理跑在异步 nearline 分支,同步链路只做策略查表与确定性解析——这种解耦带来无可观测的 RT 开销,且存量 Generator、Evaluator 与兜底行为完全不变。

Diff 触发生成。每次请求创建两条逻辑解耦路径:同步分支直奔线上 ranker;并行 nearline 分支从意图与行为、候选与供给摘要、业务约束组装策略上下文 $h_t$。令 $\bar{h}_t$ 为最新有效表项对应的上下文,nearline 服务在无有效表项或满足下式时调用 0.8B Student:

$$\Delta(h_t,\ \bar{h}_t) > \tau \tag{24}$$

其中 $\Delta$ 度量策略输入上的 feature-aware 变化,否则复用当前表项。刷新时 validator 与 compiler 先强制 schema 与字段级边界再翻译成可执行参数,只有合法配置才被发布;一次失败的刷新不会替换最新有效表项,无可用表项时同步服务选生产默认值。

受护栏保护的 GE 服务。同步链路不做任何 LLM 推理:确定性 resolver 读取最新有效表项或生产默认值并检查有效性,返回一份可执行配置(有效的个性化表项优先,无效 / 缺失 / 过期取默认)。配置只被附着到 MetaStrategy Generator,其列表与未改动的生产 Generator 在存量 Evaluator 下竞争,只有赢下原子 GE 比较时才被曝光。时间解耦、发布前校验、确定性兜底与结构隔离共同保住在线 RT,并支持灰度放量、请求级归因与即时回滚。


五、实验设置

评测围绕四问:RQ1 可执行策略生成能否在存量 Generator 之外带来增量价值?RQ2 模型规模与逐级训练阶段如何影响可执行性、策略集中度与 GE 贡献?RQ3 路由 OPD 能否把 4B 压成有竞争力的 0.8B Student?RQ4 线上部署的用户与平台结果如何?

工业 replay 数据集:从淘宝首页猜你喜欢采集连续 8 天线上请求日志,每天随机采样 8,192 条、合计 65,536 条;第 1–6 天训练(49,152)、第 7 天验证(8,192)、第 8 天测试(8,192)。测试期反馈被排除在 RL、课程构建、OPD、prompt 选择与超参调优之外。

Replay 协议:生产行在未改动的存量池 $\mathcal{P}$ 里度量,每个 LLM Generator $G_j$ 单独加进同一池子;所有方法用相同的日志请求与 pin 住的生产模型 / Evaluator 版本,调用在同一 replay 窗口内交错执行以平衡线上特征查询的时序波动。策略当且仅当通过解析与编译并返回可执行列表时才算 valid,没有有效列表的请求对该方法的 selection rate 与 ΔGE 贡献 0。

生产 Generator 基线:Base G 贪心地在每个位置填入剩余卡片里生产 rank 分最高的一张(满足共用的硬过滤、位置、密度与多样性约束),是相对提升的参照方法;GNR G 是序贯上下文感知 Generator,每个位置条件于已放置卡片对剩余候选重估点击倾向;NAR G 并行预测位置专属分数并用非自回归列表构造器;Single-objective perturbation G 从 Base G 打分公式出发扰动某一个业务目标。

LLM Generator 变体:Prompt-only(共用 prompt / schema / 校验 / 编译器但不做参数更新,评估 0.8B 与 4B);RL(针对原始生产池优化式 (9),不回灌高频策略);Curriculum RL(对 4B 施加自竞争课程);Routed reward-augmented OPD(把两个 4B checkpoint 蒸进 0.8B Student)。

5.1 形式化评测指标

设 $L^j_q$ 为 Generator $G_j$ 在请求 $q$ 上产出的长度为 $K_q$ 的列表,$\mathcal{V}_j$ 为它返回有效列表的请求集合。对目标 $m \in \{\text{CTR},\text{CVR},\text{IPV},\text{GMV}\}$,pointwise 列表诊断量先在列表内、再在有效请求上做平均:

$$S_m(G_j) = \frac{1}{|\mathcal{V}_j|}\sum_{q\in\mathcal{V}_j}\frac{1}{K_q}\sum_{i\in L^j_q} s_m(i, x_q) \tag{17}$$

设 $\mathcal{C}_{q,j}$ 为第 $j$ 行原子调用里的有效 Generator 集合、$\mathcal{P}$ 为存量池,按生产 tie-breaking 规则:

$$j^\star_q = \text{TieBreakArgMax}_{g \in \mathcal{C}_{q,j}}\ E(L^g_q, x_q) \tag{18}$$

同一次调用内定义:

$$u_{q,j} = E(L^j_q, x_q), \qquad u^{\mathcal{P}}_q = \max_{g\in\mathcal{P}} E(L^g_q, x_q) \tag{19}$$

以 $u_{q,B}$ 记同一次调用的 Base G 分数,Evaluator lift 为:

$$\Delta\text{Eval}(G_j) = \frac{1}{|\mathcal{V}_j|}\sum_{q\in\mathcal{V}_j}\frac{u_{q,j} - u_{q,B}}{\max(|u_{q,B}|,\ \epsilon)} \tag{20}$$

汇报 validity $|\mathcal{V}_j|/N$ 与 selection rate:

$$\text{SR}(G_j) = \frac{1}{N}\sum_{q=1}^{N}\mathbb{I}[q\in\mathcal{V}_j]\,\mathbb{I}[j^\star_q = j] \tag{21}$$

beat-Base rate 把存量参照换成 $u_{q,B}$。对首要离线端点,令非法输出的 $\tilde{u}_{q,j} = -\infty$、否则 $\tilde{u}_{q,j} = u_{q,j}$,增量 GE lift 为:

$$\Delta\text{GE}(G_j) = \frac{1}{N}\sum_{q=1}^{N}\frac{\max(u^{\mathcal{P}}_q,\ \tilde{u}_{q,j}) - u^{\mathcal{P}}_q}{\max(|u^{\mathcal{P}}_q|,\ \epsilon)} \tag{22}$$

这个定义值得多看一眼:它衡量把一个 Generator 加进存量池的边际效用——分数低于池内最优则贡献为零,只有真正赢过整个存量池时才有正贡献,比「单独看列表质量」严格得多。

最后,对任一策略模块 $h$,令 $z^{(h)}_{q,j}$ 为 $G_j$ 在请求 $q$ 上的编译后决策,其集中度为:

$$F_{\text{top1}}(G_j; h) = \max_{z}\ \frac{1}{|\mathcal{V}_j|}\sum_{q\in\mathcal{V}_j}\mathbb{I}\big[z^{(h)}_{q,j} = z\big] \tag{23}$$

值越低表示对模块 $h$ 的动作空间使用得越广。所有比较按请求配对。


六、主要实验结果

Table 1:淘宝首页猜你喜欢上的生产链路 replay。Pointwise 与 Evaluator 列为相对 Base G 的变化;「–」表示该指标不适用。

方法 ΔpCTR ↑ ΔpCVR ↑ ΔpIPV ↑ ΔpGMV ↑ ΔEvaluator ↑ Valid ↑ Selected ↑ ΔGE ↑ Beat Base ↑
生产排序 Generator
Base G – – – – – – 6.97% – –
GNR G -2.43% +2.08% -2.75% +14.04% +1.68% – 6.09% – 37.4%
NAR (non-autoregressive) G +1.64% +15.24% +6.46% +17.03% +2.75% – 13.7% – 63.4%
Single-objective perturbation G +13.82% -4.01% +11.81% +1.05% +1.21% – 4.94% – 50.1%
LLM 策略 Generator
Prompt-only (0.8B) -2.82% +8.17% +0.13% +12.65% -0.29% 4.39% 0.39% +0.02% 1.8%
Prompt-only (4B) -3.41% +13.67% -0.41% +13.81% +0.42% 80.86% 7.87% +0.34% 35.69%
RL (0.8B) -0.48% +10.10% +2.51% +13.58% +1.05% 97.12% 8.56% +0.38% 46.88%
RL (4B) -1.07% +12.54% +0.96% +14.23% +1.58% 98.85% 7.93% +0.45% 45.86%
Curriculum RL (4B) -5.70% +18.47% -2.95% +18.88% +0.56% 98.89% 11.27% +0.57% 45.65%
Routed reward-augmented OPD (0.8B) -0.68% +22.69% +1.65% +37.76% +2.53% 98.03% 16.24% +0.73% 62.60%

6.1 生产基线之间的对比揭示了什么

NAR 是最强的存量 Generator(Evaluator lift +2.75%、selection 13.70%、beat-Base 63.40%);GNR 拿到 +1.68% Evaluator lift,却只在 6.09% 的调用上被选中;单目标扰动产出最大的 pCTR 与 pIPV 增益(13.82% 与 11.81%),却只有 +1.21% Evaluator lift 和 4.94% selection。论文由此提炼的结论非常锋利:改进一个孤立的预测器,并不保证在平台目标下得到一个更好的异质列表——这正是本文做策略层联合决策而非单目标调优的实证依据。

6.2 规模与 replay RL 的分工

把 prompt-only 从 0.8B 放大到 4B,validity 从 4.39% → 80.86%、selection 从 0.39% → 7.87%、ΔGE 从 +0.02% → +0.34%——规模主要改进的是「吐出可执行策略」的能力,0.8B 未经训练时几乎写不出合法的五模块 JSON。而 replay RL 让 0.8B 达到 97.12% 有效、selection 与 ΔGE 抬到 8.56% 与 +0.38%,在两个 GE 指标上略微超过 prompt-only 的 4B;4B 上 RL 进一步把 Evaluator lift 抬到 1.58%、ΔGE 抬到 +0.45%,但 selection 停在 7.93%。

结论因此是二分的:规模帮助的是可行性(feasibility),被执行列表的奖励提供的才是 GE 贡献所需的对齐(alignment)——「换更大的模型」和「用生产反馈训练」解决的是两个不同问题,不可互相替代。

6.3 课程与路由 OPD

匹配 4B 规模上相对直接 RL:Curriculum RL 保持 validity 不变(98.85% vs 98.89%),却把 selection 从 7.93% 抬到 11.27%、ΔGE 从 +0.45% 抬到 +0.57%。它的 pCTR 与 pIPV 下降而 pCVR 与 pGMV 上升——论文指出这说明课程优化的是联合列表效用,而非同时在所有 pointwise 指标上占优;只看 pCTR 会误判它变差。

路由 0.8B Student 有效率 98.03%,拿到最高的 selection(16.24%)与增量 lift(+0.73%),Evaluator lift(2.53%)与 beat-Base(62.60%)排第二,两个 GE 贡献指标同时超过两个 4B 变体。作者专门解释了一处看似矛盾之处:NAR 的独立 Evaluator lift 略高(2.75% vs 2.53%),但 Student 领先的 ΔGE 说明它对存量池有更大的边际互补性——Student 赢的不是「单独看列表更好」,而是「它在存量池已经不行的那些请求上行」,这正是式 (22) 的设计用意。


七、消融:策略坍缩缓解

Figure 3: Collapse mitigation for ranking_weight_boost: (a) Top-1 complete-tuple frequency and (b) dominant tuple in (CTR, IPV, CVR, GMV) order.

以 ranking_weight_boost 为代表策略做消融:它给 CTR、IPV、CVR、GMV 各赋一个 $\{-2,-1,0,1,2\}$ 的值,共 625 个完整元组。Figure 3 用式 (23) 度量有效输出中的集中度,并结合 Table 1 的 validity 与 GE 效用一起解读,这样低频率就不能被归因为执行失败。

Figure 3 数据整理

方法 Top-1 完整元组频率 主导元组 (CTR, IPV, CVR, GMV)
RL (0.8B) 59.9% (0, 2, −1, −1)
RL (4B) 76.8% (1, 2, 0, 0)
Curriculum (4B) 41.2% (0, 0, 2, 2)
Routed OPD (0.8B) 33.0% (0, 2, −1, −1)

规模对照:直接 RL 把 0.8B 输出的 59.9% 集中在 $(0,2,-1,-1)$、把 4B 输出的 76.8% 集中在 $(1,2,0,0)$——单靠增加容量并不能在同一个 Evaluator 导出的奖励下阻止坍缩,反而 4B 坍缩得更厉害。这是全文最反直觉也最有说服力的观察:更大的模型更善于找到代理奖励的漏洞。

课程消融:4B 上课程把 Top-1 频率从 76.8% 降到 41.2%,validity 基本不变(98.85% vs 98.89%),selection 从 7.93% 升到 11.27%、ΔGE 从 +0.45% 升到 +0.57%——在不牺牲 GE 贡献的前提下拿到了更广的请求条件化选择。路由 OPD 消融:0.8B 上 Top-1 频率从 59.9% 降到 33.0%,validity 从 97.12% 升到 98.03%、selection 从 8.56% 升到 16.24%、ΔGE 从 +0.38% 升到 +0.73%。两组同规模配对消融共同证明课程竞争与路由 OPD 都在缓解坍缩的同时改进了列表级效用;值得一提的是路由 OPD 的主导元组与 RL (0.8B) 相同但频率大跌——说明 Student 学到的不是「换一个偏好」,而是「在更多请求上偏离这个默认偏好」。


八、线上 A/B 实验

Table 2:7 天线上 A/B 测试(加粗值为统计显著)

曝光 PV ↑ 点击 PV ↑ IPV ↑ 成交笔数 ↑ 成交额 ↑ 广告消耗 ↑
+1.49% +2.11% +3.12% −0.24% +2.83% +0.87%

实验于 2026 年 7 月进行。用户按确定性 hash 分到稳定的对照与实验桶,每桶占生产服务 1% 流量、含数百万用户,先行 A/A 测试未发现实质不平衡。广告消耗指广告支出,是正向的平台商业价值指标。对照保留存量 GE 池,实验组只加入最终的路由 OPD 0.8B Generator,其余排序组件与准入规则全部固定。

平台标准流程判定曝光 PV、点击 PV、IPV 与成交额的增益显著;成交笔数(−0.24%)与广告消耗(+0.87%)不显著。论文没有解释成交笔数微降与成交额 +2.83% 的组合,但从数据看这意味着客单价上升——策略把流量导向了更高价值的成交而非更多笔数。部署后 MetaStrategy 每日服务数亿用户。另一个容易被忽略的关键数字是 27.93% 的 GE 胜率,远高于离线 replay 的 16.24% selection rate(两者口径不同),足以说明这个 Generator 在生产环境里承担了接近三成的最终列表决定权。


九、核心贡献总结

  1. 把生成式排序重述为「请求条件化的可执行联合策略生成」——类型化 action schema 加确定性编译器让 LLM 同时控制多个生产排序模块,同时保住校验、隔离与兜底。立意即:动作空间从 item 排列换成了配置空间。
  2. 生产链路 replay 环境:一次对当前重排栈的调用里比较存量与 LLM 控制的 Generator,三个信号提供请求级反馈而不把流量曝光给用户,明确取代了本地 user simulator。
  3. 自竞争课程 + Evaluator 路由的 reward-augmented OPD:前者把高频编译策略变成显式竞争者,后者在压缩互补 Teacher 的同时保留直接的 GE 优化。
  4. 非侵入式服务架构落地淘宝首页猜你喜欢:nearline LLM 推理不增加在线 RT,隔离 Generator 保住存量排序与兜底路径。

十、与已归档相关工作的对比

Hypothesis-Driven Shelf Generation for Personalised Recommendation Hypothesis-Driven Shelf Generation(Spotify,2026-07-28)

关系:独立并发(本文未引用 Spotify 这篇,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:同一个 root cause——生产系统里那层「手工设计的有限模板 / 规则集合」无法覆盖个体口味与请求特异性的长尾。Spotify 指的是 Home 货架模板把「什么需求 / 什么内容算有效实现 / 用哪个系统填充」三个决策耦合死了,MetaStrategy 指的是策略层全局公式与位置 / 密度规则互相覆盖。
  • 相近的技术骨架:LLM 不直接产 item,而产一个结构化中间契约交给既有系统执行,执行结果再作为候选回到既有排序里竞争。Spotify 的中间物是「货架假设」(原话即 "a compact contract between planning and fulfilment",形式化为 $h = (q, c, f, r, t_0, d_0)$),MetaStrategy 的是五模块 typed JSON。服务架构几乎同构:离线 / nearline 批量生成 → 校验 → 写表 → 同步链路只查表 → 生成物作为候选竞争而非钉死固定位,都以「不增加在线延迟」为硬约束,也都做了「前沿大模型探索 → 蒸馏进小模型上生产」。
  • 本文的差异与推进:中间契约的类型不同,闭环质量也不同。Spotify 的契约是自由文本假设,履行靠 SemID 受约束生成式检索,评测只能靠 LLM-as-a-Judge 加均匀随机曝光,全文无损失函数;MetaStrategy 的契约是枚举域有限的 typed JSON,可做 schema 校验、字段级上限、编译后签名去重,更关键的是能被既有列表级 Evaluator 打分,从而闭合成可优化的 RL 回路。
  • 可比的实验差异:Spotify 线上结果有正有负(专辑 +36%、单集 +2%,但歌单 −14%、播客节目 −41%);MetaStrategy 的生成物必须赢下原子 GE 比较才曝光,天然不存在「强行占位导致体验下降」的风险——这是 GE 隔离接入相对「注入候选行」的结构性优势。

FGPD FGPD: From Understanding to Action(Kuaishou,2026-07-30)

关系:独立并发(本文未引用,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇都主张「策略 / 决策规则」应成为被显式建模、被结果验证的一等变量,而非隐含在 item 级监督或全局公式里。FGPD 把这个缺口命名为 Understanding–Action Gap:理解用户想要什么(intent)不等于知道该怎么推(policy),现有 LLM-enhanced 推荐器多半只补前者。MetaStrategy 结构上完全平行:上游意图模型已给出实时多意图状态,缺的正是「据此该如何配置排序」这一层 action。
  • 相近的技术骨架:LLM 生成候选策略 → 在受控执行环境里按结果评估其相对基线的增量 → 只保留有正增益的 → 蒸馏进轻量模型做低成本在线服务。FGPD 的 policy agent 生成 $K$ 条假设,由 executor 算出相对 intent-only baseline 的 advantage,feedback agent 群体反思迭代;MetaStrategy 采样多个 bundle,由 replay 算出相对 Base G / 存量池的 lift 与 rank。两者都拒绝「语言上合理即可」,收尾也一致:FGPD 蒸进 Intent/Policy 两个隐 token 做到线上零 LLM 调用,MetaStrategy 路由 OPD 进 0.8B Student、同步链路零 LLM 推理。
  • 本文的差异与推进:策略的载体与可执行性是分水岭。FGPD 的 policy 是自然语言决策规则(推荐方向 + 拒绝边界),只能以 latent token 影响 SID 生成,动作空间仍是 item;MetaStrategy 的策略直接编译成生产排序参数,动作空间就是配置本身,天然具备可审查性与即时回滚。防坍缩上 FGPD 靠「必须优于 intent-only baseline」这道门槛过滤,MetaStrategy 则把自己的高频模式冻成竞争对手,是更强的递归机制。
  • 可比的实验差异:FGPD 在三个 Amazon 公开数据集上有 +19.8%~+39.6% Recall@10 的可比数字,线上快手本地生活广告 7 天 A/B 拿到 Revenue +4.506% / ADVV +4.621%;MetaStrategy 完全没有公开数据集实验——这是可复现性短板,也是「策略必须由真实生产链路执行」这一设定的必然代价。

GR2 GR2 Technical Report(Meta AI,2026-06-30)

关系:独立并发(本文未引用 GR2,OPD 只引 Agarwal et al. 2024)· 已加载对方精读

  • 共同关注的问题:两篇都在攻工业重排引入 LLM 的三重税——推理 / 决策能力被闲置、代理奖励极易被 hack、serving 成本撑不住大模型。GR2 列成 G1/G2/G3;MetaStrategy 的表述是「Evaluator 有用但不完美,直接奖励优化会坍缩」与「大 LLM 是好 Teacher 但太贵」。root cause 判断一致:在工业重排里,奖励设计与服务成本是比模型能力更硬的约束。
  • 相近的技术骨架:三处逐条对应。(a) 用 on-policy distillation 而非 SFT 把大 Teacher 压进可服务 Student:GR2 指出 naive SFT 在工业规模会崩溃,其 OPD 让 student 从自身分布采样、teacher 只贡献 token log-prob 作逐 token reverse-KL anchor;MetaStrategy 的式 (15) 同样在 Student 自采样的 token 轨迹上算 log-ratio、同样估计 reverse KL、同样强调「不是 Teacher-forced 交叉熵也不是独立 KL 损失」。(b) 在 OPD 之上保留 RL 奖励:两者的 KL 都只作 anchor,MetaStrategy 的式 (16) 更是把蒸馏项减进 advantage 而非另加损失。(c) 显式的反 reward-hacking 机制:GR2 识别出 identity-permutation cheating 与位置偏置利用并用 conditional verifiable reward 把 $R_{\text{rank}}$ gate 住;MetaStrategy 识别出「有界字段推极值 / 对无关请求吐同一 bundle」,用自竞争课程把高频模式变成竞争者。
  • 本文的差异与推进:Teacher 路由是 MetaStrategy 独有的一步。GR2 用单个 frozen teacher 作 anchor;MetaStrategy 有 Teacher 池,在每个请求上用共享 Evaluator 调用原子地比较所有 Teacher(式 (14)),只让当次最好的有效 Teacher 提供参考 log-prob,无有效 Teacher 时路由到 __none__ 屏蔽蒸馏项、保留 RL 奖励——等于给蒸馏加了一层按请求的质量门控。另一差异是动作空间:GR2 的动作仍是 slate permutation(奖励可以是 per-impression AUC / NDCG),MetaStrategy 的奖励必须绕经真实生产链路后由 Evaluator 给出。
  • 可比的实验差异:GR2 的 OPD student 在 5% 参数量下恢复 32B teacher 约 82% 的增益;MetaStrategy 的 0.8B Student 恢复得更彻底——两个 GE 贡献指标上超过了两个 4B 训练变体(ΔGE 0.73% vs 0.57%/0.45%)。这个「学生打败老师」的现象,论文归因于混合 advantage 里保留的 GE 奖励让 Student 能在 Teacher 之外继续探索。

十一、讨论与局限性

核心贡献的价值判断。最值得借鉴的是一个定位判断:在成熟的高流量系统里,生成式模型的收益不必来自「替换掉排序」,也可以来自「配置排序」。这一次性化解了三个工程难题——不必复现过滤器与配额、不必重建校准预测器、不必自建安全控制,因为它们全都还在原地,只是被一份可审查的 JSON 调了参数。配合 GE 原子竞争,接入是纯增量的:赢了才曝光,输了什么也没发生。

三个值得借鉴的具体设计:(1) 式 (22) 的 ΔGE 指标——衡量的不是「我的列表好不好」而是「把我加进现有池子的边际效用」,NAR 独立 lift 更高但 ΔGE 更低正是其价值证明;(2) 用编译后签名而非 JSON 文本做去重;(3) fail-closed 的四道闸门,防止模型把「什么都不做」学成捷径。

局限与争议(附录 C 自陈了大部分,态度相当坦率):

  • 优化的是学出来的 Evaluator,而非线上价值本身。自竞争抬高了利用高频模式的成本,却无法消除 Evaluator 的错误设定;Evaluator 与生产模型还会随发布变化,原子 replay 只保证请求内可比。
  • replay 固定了候选集与精排分,因此无法评估任何需要不同召回候选或不同上游精排预估的收益,也不模拟点击与后续状态转移;结果只是日志请求支撑集内的列表级代理效用。
  • typed action schema 把策略限制在生产 ranker 暴露的机制上,改善了可审计性与回滚能力,但可能排除掉有用的策略——schema 的表达力上限即方法的能力上限。
  • 无公开数据集、无开源、无可复现基线。Base G / GNR G / NAR G 都是内部生产 Generator,削弱了方法层面的可比性。
  • 方法论可扩展性的隐忧。策略空间是人工定义的五个模块,扩参数量不会自动扩表征能力——Table 1 已显示 4B 相比 0.8B 在 GE 指标上优势有限(RL 4B 的 ΔGE 0.45% vs OPD 0.8B 的 0.73%)。要继续 scaling 必须同步扩充 action schema,而这需要匹配的 compiler 更新与生产侧改造,是一条人工介入、非自动的扩展路径。
  • 成交笔数 −0.24% 未被讨论,也没做分人群分析——考虑到策略可调 cardtype_preference 与 category_preference,商业曝光与内容构成的结构性漂移风险是真实的;附录 C 自己也承认部署需要字段级上限、兜底行为、灰度放量、分群分析与持续的体验监控。

工业落地价值:部署细节交代得相当完整——nearline diff 触发(式 (24))、发布前校验、失败刷新不覆盖最新有效表项、确定性 resolver、隔离 Generator、赢下原子 GE 才曝光、即时回滚,对同类电商首页混排场景可直接照搬。