← Back to list
UniGD

UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval

生成式推荐 判别式推荐 Kuaishou
Abstract 9 │ Reading 8 │ Rating —
2026-08-04
Shujie Ji, Yawei Kong, Yilin Zhao, Li Wang, Xialong Liu, Peng Jiang
Kuaishou Technology
UniGD 把自回归 SID 生成与显式 query-广告相关性打分统一进同一个 decoder-only 骨干,用 CAGE(余弦冲突检测 + 正交投影 + 生成优先自适应加权)协调两目标梯度、用 CAM(把 SID 索引到的冻结多模态 RQ 码字求和重建广告表征,仅需 T 次查表、无需在线广告侧编码器)解决占日流量 36.9% 的新广告冷启表征、用 HAM(短视频/商品/直播各自码本与生成 head、共享骨干并行 beam search)吸收素材异构性,三阶段训练后在线上以单模型替掉「GR + 外部相关性模型」级联;快手搜索广告一周 A/B 广告收入 +5.78%、检索延迟 13.0→8.7 ms(-33.1%)、新广告曝光 +24.60%、不相关率 6.79%→5.81%,NQ320K/MS300K 上 Recall@10 比最强复现基线 GenRRL 高 8.44%/3.19%。
评分原因
摘要评分:生成式检索与相关性判别统一进单模型,直击工业生成式检索“级联相关性模型导致目标割裂 + 成本高”的真实痛点;CAGE 梯度冲突协调、冻结多模态码本锚定表征、异构广告素材共享骨干三处设计都具体可复现,且在快手搜索广告线上 A/B 拿到广告收入 +5.78%、推理延迟 -33%,公开集 Recall@10 也超最强复现基线,工业价值与方法新颖性俱佳。
精读评分:把生成式检索与判别式相关性打分统一进单个 decoder-only 骨干,CAM 复用冻结多模态码本让新广告入索引即可打分、CAGE 用正交投影+生成优先加权化解梯度冲突,工程 insight 扎实且快手搜索广告线上 A/B 收入 +5.78%、延迟 -33.1%、新广告曝光 +24.6% 证据充分;扣分在于公开 benchmark 上 baseline 全是纯生成似然排序而 UniGD 多跑了一遍显式重排(Recall@1 +23.8 绝对点的公平性存疑),且未与 RankGR/GRank 等已引用的同类统一工作做任何实验对比,加上冻结码本使广告侧表征无法随骨干 scaling 增长。
semantic-id quantization multi-task cold-start ad-rec search-ranking industrial

UniGD:把生成式检索与相关性判别塞进同一个模型的快手搜索广告框架

Shujie Ji*, Yawei Kong*, Yilin Zhao, Li Wang†, Xialong Liu, Peng Jiang(* 共同一作,† 通讯作者),Kuaishou Technology, Beijing, China。arXiv:2608.03150v1,2026-08-04。

研究动机与背景

搜索广告系统需要在极严的延迟约束下,从数亿级候选广告中检索出语义相关的广告。传统多阶段检索流水线通过逐级候选过滤来应对这个挑战,但每一级通常是独立优化的,导致目标不一致、整体检索效果受限。

生成式检索(Generative Retrieval, GR)近年成为大规模候选检索的一种有前景的范式。它通过自回归解码,把候选检索转化为语义标识符(Semantic Identifier, SID)的条件生成——沿着 VQ-VAE → TIGER → OneRec 这条线索发展。这种生成范式超越了传统基于匹配的检索,能够统一建模 query-候选的语义交互。

但在真实工业搜索广告部署中,GR 通常还要级联一个下游相关性模型来保证最终结果的相关性:GR 先按自回归生成似然检索出 top-K 候选广告,相关性模型再用 query-广告匹配信号给出判别式相关性分数。作者指出这套级联范式在工业部署中面临三个关键挑战:

(1) 目标割裂与服务开销(Objective discrepancy and serving overhead)。 生成式检索与判别式相关性打分之间的目标差异,可能导致相关但生成概率低的广告在 top-K 截断阶段就被过早丢弃,根本没机会进入下游相关性模型重新打分。此外级联范式还引入了额外的在线推理延迟。虽然已有工作(ROGER、LTRGR)引入排序监督来重塑生成似然的相对序,但这类偏好信号不直接产出显式的 pointwise 相关性分数,因而无法用于基于阈值的过滤,作为下游模块的相关性特征也可靠性有限。

(2) 长尾与新广告的表征(Representations for long-tail and new ads)。 可靠的相关性打分需要有判别力的广告侧表征,但长尾和新广告往往缺乏足够的交互信号来学习表征。这个问题在快手平台上尤其突出——新广告占日流量的 36.9%。现有的级联或辅助判别模块通常依赖单独训练的广告编码器,或周期性更新的广告 embedding,很难在广告刚入索引时就立刻提供可靠表征。

(3) 异构广告素材的统一建模(Unified modeling of heterogeneous ad materials)。 工业搜索广告覆盖多种素材类型——短视频广告、商品广告、直播广告,它们在内容模态、结构、呈现形式和信息密度上差异显著。现有 GR 方法缺乏对跨素材差异的显式建模,难以在共享的 SID 语义空间里容纳不同素材类型的语义特性,限制了 GR 在工业广告部署中的泛化能力。

为此作者提出 UniGD(Unified Generative-Discriminative framework),把生成式检索与相关性判别整合进单一模型。与级联 GR 不同,UniGD 在共享骨干上联合建模自回归生成与 query-广告相关性判别,实现两者的互相增强与优化协同,同时消除额外相关性模型的服务开销。三项关键设计:

  • CAGE(Conflict-Aware Gradient Enhancement):共享骨干上联合优化生成与判别目标可能产生不一致的梯度更新方向,CAGE 在反向传播时协调二者梯度,让两个目标都能从联合优化中获益;
  • CAM(Codebook-Anchored Representation Module):把物品侧表征锚定到从大规模多模态预训练模型导出的冻结分层码本上,让长尾和新广告继承其语义先验,在刚入索引时就获得可靠表征;
  • HAM(Heterogeneous Ad-material Modeling):给每种素材类型分配专属语义空间,并把素材感知信号注入统一骨干,使 SID 生成与相关性判别都能聚焦到各素材类型对应的信号源。

核心方法 / 模型架构

Figure 1: Training framework of UniGD. HAM-G and HAM-D jointly optimize the generative and CAM-based discrimination, while CAGE coordinates their gradients through a three-stage training scheme.

从 Figure 1 可以读出论文正文没有明写的实现细节:骨干是 RMSNorm + Causal Masked GQA + SwiGLU FFN 的标准 decoder block($\times \mathcal{L}_n$ 层);输入序列由 Query Content($q_1 \ldots q_k$)+ Static Features($f_1 \ldots f_n$)+ Task-Aware Prefix($p_1 \ldots p_m$)+ <START> Token 拼接而成;生成侧(HAM-G)经由一个 Task-Aware Router 分发到 Video / Product / Live 三个专属 head(短视频与直播 4 级 SID,商品 3 级 SID),判别侧(HAM-D)则从 query 位置池化后经 Query Adapter 与 CAM 输出的物品表征做打分。

统一的生成-判别建模

给定 query $q$ 与广告语料 $\mathcal{C}$,UniGD 在共享的 decoder-only 骨干内统一自回归 SID 生成与判别式相关性估计,联合建模条件生成概率 $p(s(a)|q)$ 与显式相关性分数 $r(q,a)$。

SID tokenization。 每个广告 $a \in \mathcal{C}$ 用 RQ-KMeans 构造的分层语义标识符索引:$s(a) = (s_1(a), \ldots, s_T(a))$。为做自回归生成,模型词表被扩充了层级专属的 SID token,$s(a)$ 被序列化为 token 序列,其中 $s_t(a) \in \mathcal{V}_t$ 是第 $t$ 层的 SID token。同一套 SID 索引会被 CAM 复用去取对应的码字做相关性估计——这是 UniGD 全部"零额外成本"的来源。

自回归 SID 生成。 条件于 query $q$,UniGD 把 SID 生成概率分解为

$$p(s(a) \mid q) = \prod_{t=1}^{T} p\big(s_t(a) \mid q, s_{<t}(a)\big) \tag{1}$$

其中 $s_{<t}(a)$ 是前缀。在解码步 $t$,共享 decoder 产出最后一层隐状态 $h_t^{\text{sid}} \in \mathbb{R}^d$,并在 $\mathcal{V}_t$ 上预测下一个 SID token:

$$p(s_t(a) \mid q, s_{<t}(a)) = \operatorname{Softmax}\big(W_t h_t^{\text{sid}} + b_t\big)_{s_t(a)} \tag{2}$$

其中 $W_t \in \mathbb{R}^{|\mathcal{V}_t| \times d}$、$b_t \in \mathbb{R}^{|\mathcal{V}_t|}$ 是与 SID 层级 $t$ 关联的预测参数,后续会被 HAM 进一步按素材类型特化。训练对 $(q,a)$ 的生成目标为

$$\mathcal{L}_{\text{gen}} = -\sum_{t=1}^{T} \log p\big(s_t(a) \mid q, s_{<t}(a)\big) \tag{3}$$

判别式相关性估计。 UniGD 从共享 decoder 的 query token 隐状态导出 query 表征。设 $H_q \in \mathbb{R}^{N_q \times d}$ 为 $N_q$ 个有效 query token 位置上的最后一层隐状态矩阵,聚合为 query 级表征 $u_q = \operatorname{Agg}(H_q)$,其中 $\operatorname{Agg}(\cdot)$ 在实现中取 mean pooling。对候选 $a$,令 $u_a^{\text{CAM}} \in \mathbb{R}^{d_s}$ 为 CAM 构造的码本锚定表征。为把 $u_q$ 与 $u_a^{\text{CAM}}$ 对齐到共享语义空间,分别用 query 侧适配器 $g_q$ 与广告侧适配器 $g_a$,相关性 logit 为

$$r(q, a) = \psi\big(\big[\,g_q(u_q)\,;\, g_a(u_a^{\text{CAM}})\,\big]\big) \tag{4}$$

其中 $[\cdot;\cdot]$ 是向量拼接,$\psi$ 是一个轻量打分网络,输出 $r(q,a) \in [0,1]$。

给定 query $q$ 的监督候选集 $D_q = \{(a_i, y_i)\}_{i=1}^{K}$,其中 $y_i \in [0,1]$ 是从人工标注或离线相关性模型导出的归一化相关性目标,pointwise 损失为

$$\mathcal{L}_{\text{point}} = \frac{1}{K}\sum_{i=1}^{K}\big(r(q, a_i) - y_i\big)^2 \tag{5}$$

为进一步强化相对相关性序,引入辅助 pairwise ranking 损失。给定正广告 $a^+$ 与 $M$ 个负广告 $\{a_j^-\}_{j=1}^{M}$:

$$\mathcal{L}_{\text{pair}} = \frac{1}{M}\sum_{j=1}^{M}\max\big(0,\; \gamma - r(q, a^+) + r(q, a_j^-)\big) \tag{6}$$

其中 $\gamma \in (0,1)$ 是 ranking margin。完整判别目标结合 pointwise 分数监督与 pairwise 排序:

$$\mathcal{L}_{\text{disc}} = \mathcal{L}_{\text{point}} + \lambda \mathcal{L}_{\text{pair}} \tag{7}$$

$\lambda$ 控制 pairwise 监督的贡献。

三阶段训练。 为充分发展生成与判别两种能力,UniGD 采用三阶段方案:Stage 1 与 Stage 2 分别单独优化 $\mathcal{L}_{\text{gen}}$ 与 $\mathcal{L}_{\text{disc}}$,初始化对应的任务组件;Stage 3 在 CAGE 协调共享参数梯度的前提下联合优化两个目标。

Codebook-Anchored Representation Module(CAM)

判别式相关性估计需要在严格在线延迟约束下拿到信息量足够的广告侧表征,这对交互信号稀疏的新广告与长尾广告尤其困难。CAM 的做法是:给定广告的 SID,通过查表并组合对应码字,构造其多模态表征的量化近似。

多模态残差量化。 用一个在大规模广告创意语料上预训练的大规模多模态编码器,把每条广告的异构内容编码为语义表征:

$$v_a = \operatorname{Enc}_{\text{MM}}(a) \in \mathbb{R}^{d_s} \tag{8}$$

RQ-KMeans 在索引语料的广告表征上离线训练,学出 $T$ 个残差码本。设 $C_t \in \mathbb{R}^{|\mathcal{V}_t| \times d_s}$ 为第 $t$ 层码本。给定前面层级留下的残差 $\rho_{t-1}(a)$,第 $t$ 层的 SID token 被分配给最近的码字:

$$s_t(a) = \arg\min_{k \in \mathcal{V}_t}\big\|\rho_{t-1}(a) - C_t[k]\big\|_2^2 \tag{9}$$

其中 $\rho_0(a) = v_a$。靠前的层级捕获多模态表征的主成分,后续层级量化剩余残差,逐级编码更细粒度的信息。

码本锚定重建。 CAM 取出每一层 SID token 索引到的码字 $c_t(a) = C_t[s_t(a)]$,并递归更新残差 $\rho_t(a) = \rho_{t-1}(a) - c_t(a)$。广告侧表征由所选码字求和重建:

$$u_a^{\text{CAM}} = \sum_{t=1}^{T} c_t(a) \tag{10}$$

于是有 $v_a = u_a^{\text{CAM}} + \rho_T(a)$,$\rho_T(a)$ 是最终量化残差。也就是说 $u_a^{\text{CAM}}$ 提供了原始多模态表征的量化重建,作为判别式相关性估计的广告侧输入。

码本在 UniGD 训练全程保持冻结,从而保住 SID token 与其离线学到的码字之间的对应关系,提供稳定的语义锚点。一旦某条广告被分配了 SID,CAM 只需要 $T$ 次码本查表 + 一次轻量向量求和,就能在入索引后立刻进行相关性估计——不需要在线的广告侧编码器推理,也不需要复杂的特征构造。这正是"新广告占 36.9% 日流量"这一挑战的直接解药。

Heterogeneous Ad-material Modeling(HAM)

工业搜索广告包含异构素材:短视频、商品、直播。它们在内容模态、结构、呈现格式和信息密度上差异很大,导致不同的语义分布和相关性模式;同质化建模会掩盖素材特有的语义。HAM 按素材类型特化码本构造、SID 生成、相关性估计,同时保留共享骨干。

设 $m \in \mathcal{M} = \{\text{video}, \text{product}, \text{live}\}$ 为素材类型。HAM 对每种类型独立做残差量化,得到素材专属码本 $\{C_t^{(m)}\}_{t=1}^{T_m}$ 与 SID 词表 $\{\mathcal{V}_t^{(m)}\}_{t=1}^{T_m}$。生成侧,它把式 (2) 的输出参数替换为 $W_t^{(m)}$ 与 $b_t^{(m)}$,在 $\mathcal{V}_t^{(m)}$ 上做预测。训练时 $m$ 由目标广告的素材类型元数据给出;推理时所有素材专属 head 用共享 decoder 的隐状态并行做类型专属 beam search,得到的带类型 SID 候选被合并送去相关性打分,不需要额外的骨干前向。

相关性估计侧,CAM 从类型 $m$ 的码本取码字,重建素材感知的广告表征:

$$u_a^{\text{CAM},(m)} = \sum_{t=1}^{T_m} C_t^{(m)}\big[s_t(a)\big] \tag{11}$$

代入相关性打分函数即得素材感知的相关性分数 $r(q, a, m)$。这样生成与判别就运行在一致的素材专属 SID 语义上,同时跨素材共享骨干与打分架构。

Conflict-Aware Gradient Enhancement(CAGE)

联合优化可能让生成目标与判别目标在共享 decoder 参数上产生冲突梯度,造成优化干扰。CAGE 自适应协调二者梯度,同时优先保障自回归 SID 生成。

设 $\theta_s$ 为共享 decoder 参数。计算任务梯度 $g_{\text{gen}} = \nabla_{\theta_s}\mathcal{L}_{\text{gen}}$ 与 $g_{\text{disc}} = \nabla_{\theta_s}(\eta \mathcal{L}_{\text{disc}})$,其中 $\eta > 0$ 用于缩放判别梯度以减小两个目标之间的量级失衡。方向一致性用余弦相似度衡量:$c = \cos(g_{\text{gen}}, g_{\text{disc}})$。

当 $c \ge 0$ 时梯度相容,直接相加。当 $c < 0$ 时,CAGE 把判别梯度投影到生成方向的正交补上,移除其冲突分量:

$$g_{\text{disc}}^{\perp} = g_{\text{disc}} - \frac{g_{\text{gen}}^{\top} g_{\text{disc}}}{\|g_{\text{gen}}\|_2^2} g_{\text{gen}} \tag{12}$$

更新共享 decoder 的梯度为

$$g_{\text{CAGE}} = \begin{cases} g_{\text{gen}} + g_{\text{disc}}, & c \ge 0 \\[4pt] \alpha(c)\, g_{\text{gen}} + \beta(c)\, g_{\text{disc}}^{\perp}, & c < 0 \end{cases} \tag{13}$$

其中 $\alpha(c) = 1 + \kappa(-c)$、$\beta(c) = 1 - \kappa(-c)$,$\kappa \in [0,1]$ 控制自适应强度。随着 $c$ 减小(冲突加剧),CAGE 越来越偏向生成方向,在保住 SID 生成的同时保留非冲突的判别监督。该梯度只用于更新共享 decoder;任务专属参数仍由各自目标优化。

机制上,$c<0$ 分支的正交投影就是 PCGrad 式的梯度手术,$\alpha/\beta$ 这一对随冲突程度线性对称调整的权重则是 UniGD 加的"生成优先"偏置——它把"哪个任务是主任务"这件事显式写进了优化器,而不是靠 loss 权重去间接调。

工业在线服务

Figure 2: Online serving pipeline of UniGD in industrial search advertising.

Figure 2 展示了 UniGD 在快手搜索广告系统中部署的持续学习、增量索引、实时服务流水线:

  • 在线训练:请求上下文与用户反馈被收集成 query-广告训练样本,细粒度相关性目标由离线 teacher 模型提供(后文实验揭示为 Qwen2-VL-7B)。训练好的参数周期性同步到推理服务器。
  • 实时 SID 索引:索引维护素材专属的 SID→广告映射。新增或更新的广告经多模态广告编码器 + RQ-KMeans 推理模块量化成 SID 并增量入索引。由于这些映射独立于模型更新,新入索引的广告无需重建依赖模型的 embedding 索引就能进入检索。
  • 服务阶段:UniGD 通过 beam search 生成候选 SID,并从共享 decoder 导出 query 表征;CAM 从素材专属码本重建每个候选的广告侧表征,轻量打分模块用显式相关性分数重排候选;保留下来的 SID 再通过实时索引解析为真实广告。

这条统一流水线同时消除了两样东西:单独部署的在线相关性模型,以及逐候选的广告侧编码器推理。Figure 2 右下角的 "Item Score Distribution" 示意图直观地画出了这个转换——候选原本按生成概率(长尾衰减的分布)排序,经 CAM + 打分模块后按相关性分数重新排序。

实验设置

数据集。 两个公开生成式检索 benchmark + 一个工业搜索广告数据集:

数据集 规模
NQ320K(源自 Natural Questions) 320K 训练 query,7,830 测试 query,Wikipedia 文章
MS300K(源自 MS MARCO,Ultron 整理) 320K 文档,360K 训练 query,772 测试 query
工业数据集(快手生产搜索广告日志) 商品/短视频/直播广告;生成训练 153M 正样本对,判别训练 248M 对;测试集 1K query 上 277K 对,以及 10K+ 人工标注对

公开 benchmark 沿用 DDRO 的数据划分以便与前人工作对比;query-文档对标为相关(正)/不相关(负)。

评估指标。 生成式检索报 Recall@1/5/10 与 MRR@10。公开 benchmark 上用双尾配对 t 检验(per-query 值,$p<0.05$)对最强复现基线做显著性检验。工业数据集上的相关性估计报 AUC / Spearman / Pearson,分别评估二分类判别力、序一致性、分数相关性;相关性标签取值 0(不相关)到 3(高度相关),AUC 计算时 0-1 视为负、2-3 视为正。

Baselines。 工业侧对比生产级联系统(GR 后接独立部署的相关性模型)。公开 benchmark 上对比代表性 GR 方法:

  • DSI:把检索表述为文档标识符生成;
  • NCI:使用语义结构化的数字标识符;
  • Ultron:结合关键词与语义文档标识符 + 多阶段训练;
  • LTRGR:把排序监督引入生成式检索;
  • GenRRL:用相关性反馈的强化学习优化生成;
  • DDRO:结合 PQ 标识符与直接偏好优化(DPO)。

实现细节。

配置项 公开 benchmark 工业设置
骨干 T5-base(220M) 六层 decoder-only Transformer(约 60M)
SID 沿用 DDRO 的 PQ SID,$T=24$ 商品 3 级量化;短视频、直播 4 级
CAM 码本 直接复用 DDRO 的冻结 PQ 质心 多模态编码器 + RQ-KMeans 离线训练
判别侧额外参数 — 仅 1.12M 可训练参数
beam width 100 32

两种设置下均用 AdamW,每阶段训练 2 epoch。Stage I 优化 $\mathcal{L}_{\text{gen}}$,学习率 $1\times10^{-4}$,batch size 256。Stage II 冻结共享 decoder,只用 $\mathcal{L}_{\text{disc}}$ 优化 query 侧与物品侧适配器,学习率 $1\times10^{-3}$,$\lambda = 0.5$,$\gamma = 0.2$。Stage III 用 CAGE 联合优化两个目标,$\eta = 100$(平衡梯度量级)、$\kappa = 0.5$;共享 decoder 学习率 $5\times10^{-5}$,任务专属模块 $1\times10^{-4}$。工业训练在 8 张 A800 上跑 3 天。

主要实验结果

公开 benchmark 评测

Table 1: NQ320K 与 MS300K 上的生成式检索性能(%)。 * 表示在统一协议下复现的结果;† 表示相对每个指标上最强复现基线的显著提升(双尾配对 t 检验,$p<0.05$)。SI / TU / PQ 分别表示 Semantic ID、Title and URL、Product Quantization。

Model NQ R@1 NQ R@5 NQ R@10 NQ MRR@10 MS R@1 MS R@5 MS R@10 MS MRR@10
DSI (SI) 27.42 47.26 56.58 34.31 25.74 43.58 53.84 33.92
NCI (SI) 32.69 55.82 69.20 42.84 29.54 57.99 67.28 40.46
Ultron (TU) 33.78 54.20 67.05 42.51 29.82 60.39 68.31 42.53
LTRGR (SI) 32.80 56.20 68.74 44.80 32.69 64.37 72.43 47.85
GenRRL (Sum)* 35.82 57.04 71.49 45.93 32.78 63.91 75.80 45.98
DDRO (TU)* 40.52 52.81 55.63 45.68 37.92 66.13 73.72 49.74
DDRO (PQ)* 48.57 63.78 66.94 55.18 32.61 64.05 72.71 45.43
UniGD (Ours) 72.33† 75.84† 77.52† 74.21† 60.64† 71.85† 78.22† 65.12†

结论分析。 UniGD 在所有指标上都取得最好成绩,且相对最强复现基线有统计显著提升。Recall@1 在两个数据集上都提升了 22 个绝对点以上(NQ320K:48.57→72.33,+23.76;MS300K:37.92→60.64,+22.72),Recall@10 的相对提升为 NQ320K +8.44%(71.49→77.52)、MS300K +3.19%(75.80→78.22)。

作者的解释是:Recall@1 与 MRR@10 的提升说明 UniGD 更可靠地把相关候选放到排序顶部,凸显了显式判别监督对学习细粒度 query-候选相关性信号的价值;而 Recall@10 的一致增益说明收益不止于 top-rank 精修,还通过共享生成骨干扩展到了候选覆盖度本身。

值得注意的是 Recall@1 的提升幅度(+22 点)远大于 Recall@10(+2~6 点)。这符合"在 beam 内做显式重排"的机制画像——UniGD 的判别打分主要重排已生成的候选集,因此对顶部精度的改善远强于对召回集合的改善;Recall@10 的那部分增益则应归功于联合训练对生成骨干的反哺(这一点在 Table 2 的消融中得到印证)。

工业离线评测

Table 2: 工业测试集与 NQ320K 上的对比与消融结果(%)。

Variant Recall@1 Recall@5 Recall@10 MRR@10
本文工业测试集
UniGD 19.57 32.83 53.37 27.20
w/o CAM 13.24 26.67 46.33 20.21
w/o HAM 18.86 32.13 52.43 26.39
w/o CAGE 18.36 31.23 51.57 25.62
Baseline 12.53 25.82 43.98 19.14
NQ320K
UniGD 72.33 75.84 77.52 74.21
w/o CAM 45.52 58.96 65.26 52.03
w/o CAGE 67.22 71.45 74.38 69.18
Baseline 42.50 56.63 61.18 48.62

生成式检索。 Table 2 的 Baseline 是同骨干、同 SID 配置但只做自回归 SID 生成训练的 GR。在工业测试集上,UniGD 把 Recall@1 与 MRR@10 分别提升了 7.04 与 8.06 个绝对点(12.53→19.57、19.14→27.20),证明了联合建模候选生成与显式判别相关性估计的价值。作者的机制解释是:通过共享 decoder,判别目标用相关性监督补充了 token 级生成,促使 query 表征捕获更有信息量的 query-候选匹配信号。

相关性估计。 在人工标注的工业测试集上,对比对象包括:Qwen2-VL-7B 离线 teacher、作为在线 student 部署的六层 Transformer、以及 GR + RelToken(从 SID 之后的一个 relevance-token 状态经 MLP 预测相关性)。

Table 4: 工业人工标注测试集上的相关性估计性能。 离线 teacher 仅作参考,不用于线上推理。

Model Setting AUC Spearman Pearson
Offline Teacher(Qwen2-VL-7B) 0.907 0.805 0.810
Online Student(六层 Transformer) 0.881 0.783 0.784
GR + RelToken 0.890 0.795 0.796
UniGD 0.905 0.798 0.811

结论分析。 UniGD 在所有指标上一致优于两个在线可选方案,说明显式 query-广告表征匹配优于从生成隐状态里"顺带"读出相关性。更关键的是:以 60M 骨干 + 仅 1.1M 额外参数,UniGD 已经与 7B 的离线 teacher 相当(AUC 0.905 vs 0.907),Pearson 相关甚至略高(0.811 vs 0.810)。这意味着 UniGD 在生产环境中把相关性估计能力完整保留在生成式检索器内部,从而不必再单独部署一个在线相关性模型。

工业在线 A/B 评测

在快手搜索广告系统做了为期一周的受控在线 A/B 实验,系统服务数亿广告候选,新入索引广告占日流量 36.9%。所有实验组共享相同服务环境,仅在检索与相关性估计流水线上不同。对比对象:生产级联(GR + 外部相关性模型)、GR + RelToken、以及 UniGD-Gen(保留 UniGD 的生成组件,但把内部判别打分替换回生产相关性模型)。

Table 3: 快手搜索广告系统在线 A/B 结果。 $\Delta$ 表示相对生产基线的相对变化。Imp. (LT) 与 Imp. (New) 分别是长尾广告与新广告的曝光变化。

Model Setting $\Delta$Revenue $\Delta$Impressions $\Delta$Imp. (LT) $\Delta$Imp. (New) $\Delta$CTR CVR Irrelevant Ratio Latency
Baseline(生产级联) – – – – – – 6.79% 13.0 ms
GR + RelToken –2.08% +1.84% –3.42% –5.71% –0.25% –0.24% 17.30% 10.1 ms
UniGD-Gen +3.54% +2.61% +10.40% +15.30% +0.56% +0.41% 6.15% 12.9 ms
UniGD +5.78% +3.12% +16.80% +24.60% +0.94% +0.68% 5.81% 8.7 ms

结论分析。 这张表信息量最大,值得逐行读:

  1. UniGD 相对生产基线:广告收入 +5.78%、新广告曝光 +24.60%、长尾广告曝光 +16.80%,同时 Irrelevant Ratio 从 6.79% 降到 5.81%。 长尾/新广告曝光的巨幅增长直接验证了 CAM 的设计目标——冻结多模态码本给了新广告"入索引即可用"的可靠表征,让它们不再因为交互信号稀疏而被判别模块低估。
  2. 延迟从 13.00 ms 降到 8.70 ms(–33.1%),来源是用 CAM 查表 + 轻量内部打分替换掉了外部相关性模型。
  3. GR + RelToken 是一个重要的负面对照:它虽然把延迟降到 10.1 ms,但 Irrelevant Ratio 飙升到 17.30%(是基线的 2.5 倍),收入 –2.08%,长尾/新广告曝光双双下降。这说明"从 SID 之后的一个 token 状态里读相关性"是个远不够可靠的相关性信号——不足以支撑基于阈值的过滤。这恰好是论文动机 (1) 中"排序监督不产出显式 pointwise 分数、不适合阈值过滤"这一论断的实证。
  4. UniGD-Gen 隔离了 HAM/生成侧改进的贡献:只换生成组件、仍用生产相关性模型,就能拿到 +3.54% 收入、+15.30% 新广告曝光,但延迟几乎不降(12.9 ms)。UniGD 相对 UniGD-Gen 的额外 +2.24% 收入与 –4.2 ms 延迟,就是"把判别搬进模型内部"这一步单独的收益。

消融与分析

组件消融(Table 2)。 在 NQ320K 与工业广告数据集上分别移除组件:

  • 移除 CAM 造成的退化最大——NQ320K 上 Recall@1 从 72.33 暴跌到 45.52(–26.8 点),工业集上从 19.57 跌到 13.24(–6.3 点,已接近纯 GR Baseline 的 12.53)。这说明码本锚定表征 + 显式相关性估计是候选排序的核心。需要注意公开 benchmark 上 CAM 复用的正是 DDRO 的冻结 PQ 质心,因此 "w/o CAM" 实际上等价于抽掉整个判别打分通路,退化幅度大是自然的。
  • 移除 CAGE 一致地退化所有指标(NQ320K Recall@1 72.33→67.22;工业集 19.57→18.36),确认冲突感知优化的价值。
  • 用共享码本、共享 SID 空间与共享生成 head 替代 HAM 后工业性能下降(19.57→18.86),确认素材专属建模的价值。HAM 只在工业集消融(公开 benchmark 只有单一"素材类型",无从消融)。

CAGE 的训练动态(Figure 3)。

Figure 3: Training dynamics of UniGD. (a) Training loss across the three stages. (b) Generative and discriminative accuracy during joint training with and without CAGE.

Figure 3(a) 显示三阶段的训练损失:Stage-1 生成损失从约 15 降到约 2,Stage-2 判别损失从约 9.4 降到约 0.5;Stage-3 联合训练时,带 CAGE 的曲线(红)始终低于不带 CAGE 的曲线(灰),且到 2 epoch 时差距扩大(约 1.4 vs 约 2.5)。

Figure 3(b) 是更有说服力的一张图:带 CAGE 时,生成与判别的验证准确率都稳步上升(判别 0.78→0.88,生成 0.758→0.865);不带 CAGE 时,两者都在中途达到峰值后掉头下降(判别在 1.5 epoch 达 0.83 后跌到 0.795,生成在 1.0 epoch 达 0.78 后跌到 0.76)。这是典型的多任务跷跷板/互相干扰形态,说明梯度冲突并非理论臆想,而是这个具体配置下真实发生的优化病理。CAGE 缓解了优化干扰并稳定了联合训练。

核心贡献总结

  1. UniGD 框架:在单一共享模型内同时完成自回归 SID 生成与显式判别式相关性打分,消除了级联相关性模型的必要性——这是本文最核心的架构主张。
  2. 三个面向工业部署的组件:CAGE 缓解生成与判别目标之间的优化冲突(PCGrad 式正交投影 + 生成优先的自适应加权);CAM 用冻结的多模态残差码本给长尾与新入索引广告提供"查表即得"的可靠表征;HAM 以共享骨干 + 素材专属码本/词表/生成 head 的方式吸收短视频、商品、直播三类广告的语义异构性。
  3. 完整的线上线下评测:公开 benchmark 上超越最强复现基线(Recall@10 +8.44% / +3.19%),工业 A/B 上广告收入 +5.78%、推理延迟 –33.1%(13.0→8.7 ms)、新广告曝光 +24.60%、Irrelevant Ratio 6.79%→5.81%。

与已归档相关工作的对比

UniGD 的语义指纹是:问题——工业 GR 必须级联一个独立的相关性/排序模型才能保证结果质量,导致「生成似然目标」与「判别目标」在两个模型两套参数中解耦(相关但生成概率低的候选在 top-K 截断时被提前丢弃),并额外付出在线延迟与服务成本;解法——在单一骨干上复用同一份 hidden states,同时输出自回归 SID 生成与显式判别分数,并显式处理两目标的优化冲突,从而在服务端用一个模型替掉整条级联。文档库中有三篇与之问题 + 解法双同构、且均未被本文引用的论文。

Gryphon Gryphon: 为语义 ID 生成与 item 级打分设计的统一架构(Yandex, 2026-06-07)

关系:独立并发(本文未引用 Gryphon,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇论文指向同一个 root cause——beam likelihood 是定义在 SID token 序列上的分数,而系统真正需要的是对具体候选的判别分数。UniGD 把它表述为"生成似然目标与 query-广告相关性判别目标解耦,相关但生成概率低的广告在 top-K 截断时被丢弃";Gryphon 表述为"结构性错配 + 两个失败模式(teacher-forcing 导致的序列似然失准、SID 碰撞使同组 item 分数严格相等)"。两者都指出:下游必须再挂一个模型来修这件事,而这层级联本身就是问题。
  • 相近的技术骨架:两篇的方法流程图可以几乎重合——(a) 一次共享前向得到用户/query 侧状态(UniGD 是 decoder 的 query token 隐状态 mean-pool,Gryphon 是 encoder 状态 $E_u$);(b) 生成侧照常自回归产 SID 候选;(c) 在同一模型内加一个复用该共享状态的显式打分模块(UniGD 的 $r(q,a)=\psi([g_q(u_q); g_a(u_a^{\text{CAM}})])$,Gryphon 的 ILSM $r_\phi(u,i)=f_\phi(E_u, e_i)$,后者是 item-to-user cross-attention + MLP);(d) 用该分数而非 beam likelihood 决定最终输出;(e) 生成损失 + 打分损失联合训练(UniGD 式 (13) 的 CAGE 组合梯度,Gryphon 的 $\mathcal{L} = \mathcal{L}_{\text{gen}} + \lambda \mathcal{L}_{\text{NIP}}$)。连"替掉下游一整个阶段"的部署主张都一致:Gryphon 作为唯一候选源替换了 15+ 个生成器与预排序阶段,UniGD 替掉了外部在线相关性模型。
  • 本文的差异与推进:三处实质差异。① 监督信号性质不同——Gryphon 的 ILSM 用 next-item prediction(sampled softmax + LogQ 修正)训练,本质是协同/兴趣信号;UniGD 的判别头用人工标注或离线 teacher 给的 0-3 级相关性标签做 pointwise MSE + pairwise hinge(式 5-7),产出的是可用于阈值过滤的绝对相关性分数——这是搜索广告的合规硬约束,Gryphon 的音乐推荐场景没有这个需求。② 物品侧表征来源不同——Gryphon 的 item tower 吃 item-ID 哈希、元数据、内容特征(实验中为公平只用 item-id),需要一个真正的 item tower 前向;UniGD 的 CAM 不做任何物品侧前向,直接把 SID 索引到的 $T$ 个冻结码字求和(式 10),代价是 $T$ 次查表,换来新广告"入索引即可打分"。这是 UniGD 在"36.9% 日流量是新广告"这个约束下的关键推进。③ 优化冲突的处理——Gryphon 只用固定权重 $\lambda=1$ 相加,未讨论梯度冲突;UniGD 的 CAGE(式 12-13)显式做余弦检测 + 正交投影 + 生成优先加权,Figure 3(b) 给出了"不做协调就会双双掉头下降"的实证。
  • 可比的方法 / 实验差异:Gryphon 通过把一个 decoder block 换成单层 ILSM 把参数与推理时间差异控制在 <1%,UniGD 则是加 1.12M 参数(占 60M 骨干的 1.9%);两者都强调"几乎零额外成本"。Gryphon 明确拒绝 TIGER 式"追加去重 token"的做法,理由是解析层在动态目录下会无界增长——UniGD 用素材专属 SID + 实时 SID 索引(映射独立于模型更新)绕开了同一问题。指标上 Gryphon 报 item 级 Recall@1000(+3.7% over vanilla GR),UniGD 报 Recall@1/5/10 与线上收入,二者不可直接比较;但 Gryphon 明确指出自己没有做多随机种子的显著性检验,UniGD 则在公开 benchmark 上做了双尾配对 t 检验,这一点上 UniGD 更严谨。

UniR2 UniR²: Unifying Generative Recall and Multi-Objective Ranking in a Single Decoder-Only Sequence(Kuaishou, 2026-07-27)

关系:独立并发(同为快手、同期、本文未引用 UniR²)· 已加载对方精读

  • 共同关注的问题:两篇都在攻击"生成式召回 + 判别式打分被拆成两个模型"这一结构割裂。UniR² 把代价拆解为三条:目标不一致、表征损失(阶段边界处中间语义状态被压成一个离散候选列表)、冗余计算(用户上下文被两个模型重复编码)。UniGD 的三条挑战与之高度对应——"目标割裂与服务开销"几乎逐字对应前两条,"新广告表征"则是快手搜索广告场景下的特化。两篇都出自快手,都选择 decoder-only 单模型,都在同一年 7-8 月投稿,却互不引用,是本步骤要找的典型独立并发。
  • 相近的技术骨架:都是"单个 decoder-only 骨干 → 一次前向同时产出生成分布与判别分数 → 服务端合并两个阶段"。UniR² 明确提出"层级(layer-wise)表征耦合 + 优化隔离"这对张力,UniGD 的 Stage 1/2/3 三阶段 + CAGE 本质上是同一对张力的另一种解法。
  • 本文的差异与推进:最有价值的对照是两篇对"优化冲突"给出了不同的解。UniR² 用 DQ-PCA(Dual-Query Prefix-Causal Attention)控制信息可见性 + stop-gradient 在共享参数处切断 + ranking-only LoRA 做优化隔离——即结构性隔离,从架构上不让排序梯度污染自回归召回骨干。UniGD 走的是梯度层面的协调:不隔离参数,而是在共享 decoder 上做余弦冲突检测与正交投影,冲突时按 $\alpha(c)/\beta(c)$ 偏向生成方向(式 13)。前者是"物理隔离,各走各的路",后者是"允许干扰但主动调停,且明确指定谁是主任务"。UniGD 的 Figure 3(b) 恰好给出了不调停会发生什么(双双掉头下降),可视为对 UniR² 那条"简单共享所有参数会引发严重跷跷板效应"论断的独立实证。另一处差异:UniR² 的判别侧是多目标业务分数(click / long-view / gift 的 BCE),UniGD 的判别侧是单一相关性分数(0-3 级标注的 MSE + hinge),后者服务于广告合规的阈值过滤而非价值排序。
  • 可比的方法 / 实验差异:UniR² 通过跨阶段 KV-cache 复用把端到端推理时间砍掉 54.29%,线上快手直播播放量 +1.177%、送礼总额 +2.569%;UniGD 通过消除外部相关性模型把检索延迟从 13.0 ms 降到 8.7 ms(–33.1%),线上广告收入 +5.78%。两者的效率来源不同(前者省重复编码,后者省一个完整模型的部署),但都印证了"统一"最直接的兑现方式是服务端的减法。UniR² 同时在召回和排序两个 baseline 上做了离线对比,UniGD 的工业离线对比只有一个同骨干的纯 GR baseline,这一点上 UniR² 的实验设计更完整。

TSGR TSGR: 把"商业价值"贯穿进 Semantic ID 与候选排序的淘宝搜索统一生成式检索(Taobao & Tmall Group of Alibaba, 2026-07-21)

关系:独立并发(本文未引用 TSGR)· 已加载对方精读

  • 共同关注的问题:TSGR 对级联的批评与 UniGD 几乎同构——"标准 GR 按 beam search 生成概率排序候选,这反映的是语义相关性而非业务相关性;一个自然的补救是接一个独立的下游预排序模型,但这会耦合两个目标错位的模型:GR 模型优化的是自身检索分布上的 SID 生成似然,而预排序模型是在全库多源候选池上打分,引入了一个破坏二者结合的分布 gap"。这与 UniGD 的"目标割裂 + 相关但低生成概率的候选被提前丢弃"指向同一 root cause。TSGR 还提出与 UniGD 完全相同的部署主张:让单一模型既是检索器又是预排序器,无需专门的预排序阶段。
  • 相近的技术骨架:TSGR 的 VRM(Value-aware Ranking Module) 与 UniGD 的判别头是同一套配方——user 表征复用生成骨干的隐状态(TSGR 式 (8) 对所有 token 位置 mean pooling 后接 MLP $\psi$;UniGD 式 (4) 对 query token 位置 mean pooling 后接适配器 $g_q$,连 mean-pool + 轻量投影这个细节都一样),物品侧表征从离线预取的信息构造,两者融合后经打分网络输出分数用于重排 beam 候选,且与生成目标在同一模型内联合优化。
  • 本文的差异与推进:① 判别目标的语义不同——TSGR 的三个 head 预测 pv / ctr / cvr,推理时按 $\hat{y}^{\text{pv}} \times \hat{y}^{\text{ctr}}$ 重排,判别的是商业价值;UniGD 判别的是query-广告相关性(教师模型/人工标注的 0-3 级),二者在广告系统里是两个正交的约束(相关性是准入门槛,价值是排序目标)。UniGD 的 Irrelevant Ratio 从 6.79% 降到 5.81% 是 TSGR 那套指标里根本没有的维度。② 物品侧表征的构造——TSGR 拼接 side-info 向量 + 离线物品 embedding + SID embedding(式 6-7),需要维护离线特征表与 embedding 表;UniGD 只做 $T$ 次冻结码本查表求和(式 10),更轻但表征上限被量化残差 $\rho_T(a)$ 卡住。TSGR 的路线信息更丰富,UniGD 的路线对新广告更友好——这正好对应两者场景的差别(淘宝商品有长期统计特征可查,快手广告 36.9% 是新广告)。③ 价值信号注入的位置——TSGR 还把价值注入 SID 构造本身(QP-SID:高价值物品占据更靠前的 token 索引,使生成似然与价值对齐),UniGD 的 SID 构造是纯语义的(多模态残差量化),素材类型是唯一的结构先验(HAM)。④ UniGD 有 CAGE 处理梯度冲突,TSGR 用的是 Pre-SFT + SFT 的渐进课程来分解能力获取难度——同样是"不要一次性硬塞",但一个在优化器层面解决,一个在训练课程层面解决。
  • 可比的方法 / 实验差异:TSGR 离线 HR@1000 相对 FORGE +9.16%,线上 +1.64% GMV / +1.12% 成交单量 / +0.43% IPV;UniGD 线上 +5.78% 广告收入 / +3.12% 曝光。TSGR 明确报告"VRM 带来的增益比 RL 更显著",与 UniGD 消融中"移除 CAM(即整条判别通路)退化最大"是同向的证据——两篇独立工作都指向同一结论:在 GR 上加一个复用骨干隐状态的显式判别/打分头,其收益大于在生成侧继续做偏好优化。

被剔除的近似候选与理由(防止门槛放水): - SSRLive SSRLive(Taobao,"hybrid generative-discriminative 直播预排序"):名称最像,但 SID 只作为判别式预排序模型的输入特征,没有自回归 SID 生成,也不涉及"单模型替掉级联"的服务架构改造 → 解法骨架实质偏离。 - DaV-Gen DaV-Gen(Alibaba,Draft-and-Verify):问题同构(GR 级联的延迟),但解法是用 ANN 向量草稿替掉自回归解码(speculative decoding 范式),而非在生成骨干内加判别头 → 解法路径不同。 - UniSGR UniSGR / OneRanker OneRanker / UniPinRec UniPinRec:均属"生成 + 判别统一"大类,但与已保留的 TSGR / UniR² 高度重叠(UniSGR 与 TSGR 同为电商搜索的价值感知排序头);UniPinRec 统一的是输入格式/骨干/训练阶段(Masked Action Modeling + KV-cache 共享),不涉及生成似然与判别相关性之间的目标冲突协调 → 在 ≤3 篇上限下按"对比增量"剔除。 - GEM-Rec GEM-Rec / UniVA UniVA:都把商业价值注入 SID 生成/解码,但问题是"生成目标 vs 商业价值"而非"生成似然 vs 判别相关性解耦 + 级联服务成本",且没有在模型内置显式 pointwise 打分模块 → 问题 root cause 不同。

讨论与局限性

值得借鉴的设计

最有价值的一处 insight 是 CAM。 它的巧妙之处在于发现了一个"免费午餐":SID 本来只是生成目标,但因为 SID 是由多模态表征经残差量化得到的,SID 索引本身就编码了物品的多模态语义——把各层码字求回来(式 10)就得到原始多模态表征的量化重建 $v_a = u_a^{\text{CAM}} + \rho_T(a)$。于是同一份 SID 被复用了两次:一次作为生成目标,一次作为判别输入。代价只是 $T$ 次查表,且完全不依赖模型训练进度——广告一旦被量化入索引就能被打分。这直接回应了"新广告占 36.9% 日流量"这个残酷的工业现实,也是线上 A/B 中新广告曝光 +24.60% 的直接来源。

第二处是 GR + RelToken 这个负面对照的价值。 很多论文只报自己赢了多少,UniGD 花了一整行 A/B 数据展示"从生成隐状态里顺带读相关性"这条看似省事的路会怎样失败:Irrelevant Ratio 飙到 17.30%(基线 2.5 倍)、收入 –2.08%。这个数据点比任何理论论证都有说服力地说明了显式 query-物品表征匹配 vs 隐式 token 状态读出的本质差距。

第三处是 CAGE 把"任务优先级"写进优化器。 常规多任务做法是调 loss 权重,但 loss 权重无法区分"梯度相容"与"梯度冲突"两种情形。CAGE 的 $\alpha(c)=1+\kappa(-c)$、$\beta(c)=1-\kappa(-c)$ 让偏向程度随冲突程度连续变化,且只在 $c<0$ 时启动——这是一个便宜且可解释的设计。

局限与争议

  1. 公开 benchmark 的对比公平性存疑。 UniGD 在 NQ320K 上 Recall@1 从 48.57 跳到 72.33(+23.76 绝对点),这个幅度在 GR 文献里极不寻常。原因很可能是机制层面的:所有 baseline(DSI/NCI/Ultron/LTRGR/GenRRL/DDRO)都只按生成似然排序,而 UniGD 在 beam 内额外跑了一遍显式相关性重排——这本质上是"GR + reranker" vs "纯 GR"的比较,而非同等推理预算下的比较。论文既没有报告给 baseline 也配上同等重排器的对照,也没有报告公开 benchmark 上重排带来的额外延迟。更微妙的是,公开 benchmark 上的 CAM 码本直接复用 DDRO 的冻结 PQ 质心,因此 UniGD 相对 DDRO 的增益完全来自"在 DDRO 的 SID 空间上加了一个判别重排头",这一点论文没有点破。Recall@10 的相对增益(+8.44% / +3.19%)比 Recall@1 温和得多,恰恰印证了增益主要在重排而非召回。

  2. 未与任何已发表的"统一生成-判别"工作做实验对比。 论文的 Related Work 引用了 RankGR、GRank、"Killing Two Birds with One Stone"、GRAM、DDID 等一批同方向工作,但实验表里一个都没有——公开 benchmark 的 baseline 全是纯 GR 方法,工业实验的 baseline 是"我们自己的生产级联"。这使得"统一优于级联"这个结论有支撑,但"UniGD 的统一方式优于别人的统一方式"完全没有证据。上文 Step 2.5 找出的三篇独立并发(Gryphon / UniR² / TSGR)恰恰说明这个方向 2026 年已经相当拥挤,缺失同类对比是明显短板。

  3. 冻结码本是一个真实的 scaling 天花板。 CAM 的广告侧表征恒等于 $u_a^{\text{CAM}} = v_a - \rho_T(a)$,其信息量完全由离线 RQ-KMeans 的量化精度决定。这意味着:把 decoder 从 60M scale 到 600M,query 侧表征会变强,但广告侧表征一个 bit 都不会变——判别能力的上限被冻结码本锁死。要提升只能加量化层数 $T$ 或扩大码本,而这又会增加 SID 长度、拖慢 beam search。这正是精读评分标准里点名的"核心组件(码本、离散 token 空间)一旦固化即限制下游表征空间"这一扩展性隐患的教科书案例。论文对此没有讨论,也没有做 $T$ 或码本大小的敏感性分析。

  4. 判别监督依赖离线 teacher,误差上界被 teacher 锁定。 相关性目标 $y_i$ 来自人工标注或 Qwen2-VL-7B 离线 teacher。Table 4 显示 UniGD 的 AUC 0.905 已经贴着 teacher 的 0.907——几乎没有继续提升的空间,除非换更强的 teacher。整套方案实质上是"把 7B teacher 蒸馏进 1.1M 参数的判别头 + 冻结码本",其天花板即 teacher 的天花板。

  5. 若干实验设计的缺口。 ① 消融只做了 w/o CAM / w/o HAM / w/o CAGE 的单项移除,没有做 CAGE 超参 $\kappa$、$\eta$ 的敏感性分析($\eta=100$ 这个量级失衡系数相当极端,值得说明其来源);② $\mathcal{L}_{\text{pair}}$ 的贡献未单独消融($\lambda=0.5$ 直接给定);③ 线上 A/B 只跑了一周,对广告系统的长期效应(如相关性阈值收紧对广告主生态的影响)没有观察;④ Table 3 的 CVR 列没有 $\Delta$ 前缀但显然是相对变化,排版存在瑕疵;⑤ 论文正文邮箱列表中出现了一个不在作者名单里的 zhaolei16,属编辑疏漏。

  6. HAM 的 scaling 成本随素材类型线性增长。 每种素材类型需要独立的码本、SID 词表、生成 head。三种类型尚可,但若平台新增素材形态(如图文、小程序),码本数量与输出层参数会线性膨胀,且各类型间无参数共享(除骨干外)。论文提到推理时"所有素材专属 head 并行做 beam search"——这意味着 beam search 的总计算量也随类型数线性增长,8.7 ms 的延迟数字是在三类型下测得的。

与已有工作的差异定位

沿着生成式检索的演进线:DSI/NCI 确立 docid 生成范式 → TIGER 用 RQ-VAE 引入分层 SID → LTRGR/ROGER/GenRRL 往生成里注入排序/偏好监督(但只重塑相对序,不产出绝对分数)→ DDRO 引入 DPO 做文档级相关性优化。UniGD 的位置是:不再试图把判别信号"折叠进"生成似然,而是承认二者是两个不同性质的输出,让同一个骨干同时产出两者,并用梯度手术处理它们的冲突。这个定位在 2026 年并非孤例(Gryphon / UniR² / TSGR / UniSGR / OneRanker 都在做类似的事),但 UniGD 的 CAM 是这一批工作里广告侧表征最轻、对新物品最友好的一个方案,这在新广告占三分之一流量的搜索广告场景中是决定性的工程优势。