← Back to list
PailitaoGR

PailitaoGR: Latent Think-with-Images for Generative Image Retrieval

生成式推荐 Alibaba
Abstract 7 │ Reading 7 │ Rating —
2026-08-27
Xiaomeng Fan, Yueran Liu, Shengyu Zhou, Chenghan Fu, Wanxian Guan, Feng Li, Chuan Yu, Jian Xu, Bo Zheng
Alibaba Group
阿里拍立淘把「看图思考」内化进生成式图像检索:用只看裁剪图的 Crop Teacher 和额外吃 OCR 的 OCR Teacher 作特权输入教师,通过 on-policy JSD 蒸馏 + ROT/熵注意力引导让只吃整图的学生实现「不裁剪的放大」,再用效用×可及性双门控的增量对比蒸馏只迁移 OCR 教师相对 Crop 教师的可用增量,实现「不 OCR 的读字」,推理时教师全部移除,线上图搜日志上比同骨干 SFT 基线平均高 13.8 个百分点并反超两位教师。
评分原因
摘要评分:阿里巴巴(拍立淘 / 淘宝图搜团队,全员 Alibaba Group taobao.com 邮箱),训练与评测数据全部采样自真实线上图搜日志,属平台规模私有数据的工业工作;把“看图思考”内化进生成式检索模型,靠 target enhancer + on-policy 蒸馏实现不裁剪的聚焦、不 OCR 的读字,平均超基线 13.8%。扣分点是只有离线实验,未报线上 A/B。
精读评分:方法配方有实质创新(特权输入教师 + 效用×可及性双门控增量蒸馏 + SID 粒度感知注意力监督),Table 2 的 ROT 占比单调性是一条干净的机制证据链,消融逐项到位;但工业验证不完整——全文 0 次 A/B、无部署章节、纯离线,且以「在线延迟」为全部动机却没有任何延迟实测,最相关基线 OneVision 缺席,另有多处公式/数字/命名不一致与训练-测试类目分布严重错配,故压在扎实工作区间下沿。
semantic-id knowledge-distillation contrastive-ssl pretrained-lm search-ranking industrial

PailitaoGR:把「看图思考」内化进生成式图像检索

Alibaba Group(拍立淘 / 淘宝图搜),WSDM '27 投稿版,arXiv 2608.26658v1

1. 研究动机与背景

拍立淘(Pailitao)是淘宝的拍照图搜入口,用户直接用一张现实世界的照片检索商品。本文探索把生成式检索(Generative Retrieval)这条路线搬到图搜上:给定 query 图像,模型不做向量近邻检索,而是自回归地直接生成商品的语义标识符(Semantic ID, SID)。

作者指出,把生成式检索从文本搜索扩展到图搜并非平凡,因为真实 query 图像里的视觉信息是异质混杂的,同时包含三类内容:

  • 检索目标(search target):用户真正想找的那件商品;
  • 有用的辅助证据(auxiliary evidence):品牌、型号等文字线索,用于细粒度区分同款不同货号;
  • 无关内容(irrelevant content):水印、其他物体、背景。

因此有效的生成式图像检索需要两种互补能力:识别并聚焦到检索目标,以及有选择地利用辅助证据。

一个直觉的做法是照搬近期的 Think-with-Images 范式(Chain-of-Focus、DeepEyes 等),即让模型通过工具与图像交互——visual grounding、裁剪(cropping)、OCR。但作者认为直接搬到线上生成式图搜有两个致命问题:

  1. 显式工具调用带来额外计算与多步推理,与在线检索严苛的延迟约束直接冲突;
  2. 工具产出的辅助信息可能无关甚至误导;同时另一些有用信息可能超出模型自身的感知容量(受限于图像分辨率与模型规模),于是无差别的能力迁移反而有害。

本文提出 PailitaoGR,一个 Latent Think-with-Images 方法:把「聚焦目标」与「利用辅助证据」两种能力内化进模型权重,推理时只吃原始整图,不做任何裁剪、不调用任何 OCR——作者把这两件事分别命名为 Zooming without Cropping(不裁剪的放大)和 Reading without OCR(不 OCR 的读字)。

Figure 1: Comparison of direct, tool-assisted, and latent Think-with-Images paradigms for generative image retrieval. Our approach internalizes tool-enabled visual capabilities without extra inference latency.

Figure 1 用四栏对比了四种范式:直接整图检索(性能低、延迟低,「注意力被干扰」)、裁剪辅助(性能中、延迟中,「显式放大」)、裁剪 + OCR 辅助(性能高、延迟高,「显式放大 + 读字」),以及本文的 Latent Think-with-Images(性能高、延迟低,「隐式放大 + 读字」)。需要注意的是,这张图的 Performance / Latency 全部是 Low/Medium/High 的定性标注,没有任何实测数值——这一点在后文局限性中会重提。

在 related work 中,作者把自己定位为「据我们所知,第一个直接在原始 query 图像上运行的工业级生成式检索框架」。最接近的前置工作是 OneVision(首个工业级电商视觉搜索生成式检索框架),但 OneVision 的生成式检索器吃的是裁剪后的 query 图像。

2. 任务形式化与方法总览

设商品语料库 $\mathcal{D} = \{d_j\}_{j=1}^{M}$,每个商品 $d_j$ 被赋予一个语义标识符(SID)

$$\mathbf{s}_j = (s_{j,1}, s_{j,2}, \ldots, s_{j,L}) \tag{1}$$

即一串离散语义 token。给定 query 图像 $\mathbf{x}$,生成式图像检索直接建模候选 SID 的条件生成概率:

$$p_\theta(\mathbf{s} \mid \mathbf{x}) = \prod_{t=1}^{L} p_\theta(s_t \mid \mathbf{x}, \mathbf{s}_{<t}) \tag{2}$$

其中 $\mathbf{s}_{<t} = (s_1, \ldots, s_{t-1})$ 是已生成的 SID 前缀。推理时自回归地生成一组高概率 SID:

$$\hat{\mathcal{S}}_K = \operatorname{TopK}_{\mathbf{s} \in \mathcal{S}} p_\theta(\mathbf{s} \mid \mathbf{x}) \tag{3}$$

$\hat{\mathcal{S}}_K$ 中的 SID 再映射回对应商品完成检索。

Figure 2: Framework of our method.

Figure 2 完整展示了框架。左栏是输入:整图经 Encoder 得到视觉 token,token 被概念上分为「检索目标 token」「辅助证据 token」「无关内容 token」三色。中栏是目标聚焦感知机制(Target-Focused Perception),右栏是选择性辅助证据利用机制(Selective Auxiliary-Evidence Utilization)。两个机制的结构高度对称:各有一个 Enhancer(token 打分 + token 级残差调制),各有一套 学习目标(左边是 On-policy 蒸馏 + 注意力引导损失,右边是选择性蒸馏)。

3. 目标聚焦感知机制

3.1 Target Enhancer

给定 query 图像 $\mathbf{x}$,视觉编码器产出一组视觉 token:

$$H = E_\theta(\mathbf{x}) = \{h_i\}_{i=1}^{N}, \quad h_i \in \mathbb{R}^d \tag{4}$$

Target Token Scoring 用一个轻量打分头独立估计每个视觉 token 与检索目标的相关性:

$$a^I_i = \sigma\!\left(w_I^\top \operatorname{GELU}\!\left(W_I \operatorname{LN}(h_i)\right)\right) \tag{5}$$

其中 $W_I, w_I$ 可学习,$\operatorname{LN}(\cdot)$ 是 layer norm,$\sigma(\cdot)$ 是 sigmoid,$a^I_i \in (0,1)$ 衡量 token $i$ 与检索目标的相关度。

作者明确论证了为什么不能只用 $a^I_i$ 去缩放 $h_i$:单纯 rescale 只改变模长、不改变特征方向,而且这个效果还会被后续的 normalization 进一步削弱。因此引入 Token-level Residual Modulation,用一个可学习的残差特征更新:

$$F_I(h_i) = W_{I,2}\operatorname{GELU}\!\left(W_{I,1}\operatorname{LN}(h_i)\right) \tag{6}$$

被选中的视觉 token 按下式增强:

$$h^I_i = h_i + \lambda_I\, a^I_i\, F_I(h_i) \tag{7}$$

$\lambda_I$ 控制残差增强的幅度。最终得到目标增强后的视觉表征,作者称之为 crop tokens(因为它在语义上等价于「裁剪出来的目标区域」):

$$H^I = \{h^I_i\}_{i=1}^{N} \tag{8}$$

残差连接保证原始视觉信息不丢失,同时选择性地放大目标相关 token。

3.2 目标聚焦感知目标:On-policy 蒸馏

记从 $H^I$ 预测的 SID 分布为

$$q^I_t(\cdot) = p_\theta\!\left(\cdot \mid H^I, \mathbf{s}_{<t}\right) \tag{9}$$

标准交叉熵目标为

$$\mathcal{L}_{\mathrm{CE}} = -\frac{1}{L}\sum_{t=1}^{L}\log q^I_t\!\left(s^*_t \mid \mathbf{s}^*_{<t}\right) \tag{10}$$

作者指出,SID 监督只约束最终预测,无法直接指导模型在复杂图像里聚焦到目标。于是引入两个额外目标。

第一个是 On-Policy Distillation(OPD)。训练一个 Crop Teacher $p_{\phi_C}(\cdot)$,它的输入是裁剪后的目标区域 $\mathbf{x}_C$——因为大部分背景被移除,它天然给出更干净、更以目标为中心的 SID 预测参考。

关键设计动机是训练-推理错配:常规自回归蒸馏在 ground-truth 前缀下评估师生,而推理时模型条件于自己的预测。一旦某个 SID token 预测错,模型必须从一个训练中从未见过的错误前缀继续生成,后续预测随之不可靠。为缓解这一点,作者采用 on-policy 蒸馏——先用当前学生模型(吃整图)采一条 SID 轨迹:

$$\hat{\mathbf{s}} \sim p_\theta\!\left(\mathbf{s} \mid H^I\right) \tag{11}$$

然后在每个解码步 $t$,用同一条学生生成的前缀 $\hat{\mathbf{s}}_{<t}$ 同时查询教师与学生:

$$p^C_t(\cdot) = p_{\phi_C}\!\left(\cdot \mid \mathbf{x}_C, \hat{\mathbf{s}}_{<t}\right) \tag{12}$$

$$q^I_t(\cdot) = p_\theta\!\left(\cdot \mid H^I, \hat{\mathbf{s}}_{<t}\right) \tag{13}$$

实践中只蒸馏 Crop Teacher 预测的 top-$K$ 候选,记候选集为 $\mathcal{K}_t$,$\tilde p^C_t$ 与 $\tilde q^I_t$ 是在 $\mathcal{K}_t$ 上重新归一化的师生分布。OPD 目标为

$$\mathcal{L}_{\mathrm{OPD}} = \mathbb{E}_{\hat{\mathbf{s}}\sim p_\theta(\cdot\mid H^I)}\left[\frac{1}{|\hat{\mathbf{s}}|}\sum_{t=1}^{|\hat{\mathbf{s}}|}\operatorname{JSD}\!\left(\tilde p^C_t, \tilde q^I_t\right)\right] \tag{14}$$

$\operatorname{JSD}$ 是 Jensen–Shannon 散度。这样一来,Crop Teacher 提供的「以目标为中心」的监督,恰好落在学生自回归生成时真正会遇到的状态上。

3.3 粒度感知的注意力引导

OPD 只约束「预测什么」,不约束「模型依据图像的哪块区域做出预测」。作者进一步直接监督从 SID token 到视觉 token 的注意力。

记第 $l$ 层第 $h$ 个头上,第 $t$ 个 SID token 对视觉 token $v$ 的注意力权重为 $A^{(l,h)}_{t,v}$。先对 $N_h$ 个头取平均:

$$\bar A^{(l)}_{t,v} = \frac{1}{N_h}\sum_{h=1}^{N_h} A^{(l,h)}_{t,v} \tag{15}$$

再只保留视觉 token 列并归一化,得到视觉注意力分布:

$$\pi^{(l)}_t(v) = \frac{\bar A^{(l)}_{t,v}}{\sum_{v' \in \mathcal{V}} \bar A^{(l)}_{t,v'} + \epsilon}, \quad v \in \mathcal{V} \tag{16}$$

关键洞察:SID 具有由粗到细的语义层级结构。作者利用这一性质,同时引导「模型应该看哪里」和「注意力应该多集中」。

ROT 注意力引导。把检索目标的 bounding box 定义为 region of target(ROT),映射到视觉 token 得到二值 mask $M(v) \in \{0,1\}$。第 $t$ 个 SID token 落在 ROT 内的注意力质量为

$$m^{(l)}_t = \sum_{v \in \mathcal{V}} \pi^{(l)}_t(v) M(v) \tag{17}$$

给每个 SID token 关联其语义粒度 $g(t)$ 和粒度相关系数 $\alpha_{g(t)}$,越细粒度的 SID token 受到越强的 ROT 约束:

$$\alpha_{\mathrm{coarse}} < \alpha_{\mathrm{medium}} < \alpha_{\mathrm{fine}}, \quad \alpha_{\mathrm{sep}} = 0 \tag{18}$$

$$\mathcal{L}_{\mathrm{rot}} = \operatorname{Mean}_{l,t}\left[-\alpha_{g(t)}\log\!\left(m^{(l)}_t + \epsilon\right)\right] \tag{19}$$

物理含义:生成粗粒度 SID token 时约束较弱(此时需要全局信息判断大类),越到细粒度越强制模型依赖目标区域内的视觉证据。

由粗到细的熵引导。为调控注意力的集中程度,再引入基于熵的注意力损失。注意力熵定义为

$$\mathcal{H}^{(l)}_t = -\sum_{v \in \mathcal{V}} \pi^{(l)}_t(v)\log\!\left(\pi^{(l)}_t(v) + \epsilon\right) \tag{20}$$

用粒度相关的方向系数 $\gamma_{g(t)}$ 控制各层级期望的熵:

$$\gamma_{\mathrm{coarse}} = +1, \quad \gamma_{\mathrm{medium}} = \gamma_{\mathrm{fine}} = -1, \quad \gamma_{\mathrm{sep}} = 0 \tag{21}$$

$$\mathcal{L}_{\mathrm{ent}} = \operatorname{Mean}_{l,t}\left[-\gamma_{g(t)}\mathcal{H}^{(l)}_t\right] \tag{22}$$

最小化 (22) 等价于:粗粒度 SID token 保持高熵(注意力铺开,捕捉更广的视觉证据);中/细粒度 token 逐步收窄(集中到有区分度的商品细节)。作者强调二者互补——ROT 决定「在哪里收集证据」,熵决定「在各语义粒度上收集得多广或多窄」。

整体训练目标:

$$\mathcal{L}_{\mathrm{item}} = \mathcal{L}_{\mathrm{CE}} + \lambda_{\mathrm{opd}}\mathcal{L}_{\mathrm{OPD}} + \lambda_{\mathrm{rot}}\mathcal{L}_{\mathrm{rot}} + \lambda_{\mathrm{ent}}\mathcal{L}_{\mathrm{ent}} \tag{23}$$

4. 选择性辅助证据利用机制

建立起以目标为中心的表征后,模型还应进一步利用辅助证据,同时避开无关或误导信息。

4.1 Auxiliary Enhancer

先把 crop tokens $H^I$ 汇总成一个 Target Anchor:

$$c^I = \frac{\sum_{i=1}^{N} a^I_i h^I_i}{\sum_{i=1}^{N} a^I_i + \epsilon} \tag{24}$$

与 Target Enhancer 的无条件打分不同,Auxiliary Enhancer 做的是条件打分——它必须判断某个 token 是否为「当前这个目标」提供互补信息:

$$a^A_i = \sigma\!\left(g_A(h^I_i, c^I)\right) \tag{25}$$

$$g_A(h^I_i, c^I) = w_A^\top \operatorname{GELU}\!\left(W_A\left[\operatorname{LN}(h^I_i);\ \operatorname{LN}(c^I);\ \operatorname{LN}(h^I_i)\odot\operatorname{LN}(c^I)\right]\right) \tag{26}$$

即把「局部 token」「目标锚点」「二者逐元素积(相似度交互)」三路拼接后打分。被选中的辅助 token 同样走 token 级残差调制:

$$h^{I+A}_i = h^I_i + \beta\lambda_A a^A_i F_A(h^I_i) \tag{27}$$

$$H^{I+A} = \{h^{I+A}_i\}_{i=1}^{N} \tag{28}$$

$F_A(\cdot)$ 是可学习残差变换,$\lambda_A$ 控制残差幅度,$\beta$ 控制辅助信息的整体贡献。作者把 $H^{I+A}$ 称为 crop + OCR tokens。

4.2 选择性辅助蒸馏目标:效用 × 可及性

这是全文最有辨识度的设计。OCR 线索可能有用、可能无关、甚至可能误导;即便有用,学生也未必能从原图里可靠地捕捉到。作者从两个维度决定是否施加辅助监督。

用两个教师:Crop Teacher(只吃裁剪图)与 OCR Teacher(吃裁剪图 + 预先抽取的 OCR 文本),其解码步 $t$ 的 SID 分布分别为 $p^C_t$、$p^O_t$。

辅助信息的效用(utility) 定义为 OCR Teacher 相对 Crop Teacher 在 ground-truth SID token 上的提升:

$$u^T_t = \log p^O_t(s^*_t) - \log p^C_t(s^*_t) \tag{29}$$

学生的可及性(accessibility):令

$$q^I_t(\cdot) = p_\theta\!\left(\cdot \mid H^I, \mathbf{s}_{<t}\right) \tag{30}$$

$$q^{I+A}_t(\cdot) = p_\theta\!\left(\cdot \mid H^{I+A}, \mathbf{s}_{<t}\right) \tag{31}$$

$$u^S_t = \log q^{I+A}_t(s^*_t) - \log q^I_t(s^*_t) \tag{32}$$

两个信号各自过一个 soft gate:

$$w^{\mathrm{help}}_t = \sigma\!\left(\tau_T u^T_t - \rho_T\right), \quad w^{\mathrm{cap}}_t = \sigma\!\left(\tau_S u^S_t - \rho_S\right) \tag{33}$$

$\rho_T, \rho_S$ 是选择阈值,$\tau_T, \tau_S$ 控制门的锐度。

情形一:既有用又可及。鼓励辅助增强后的学生靠拢 OCR Teacher,并显式实现相对「仅目标表征」的预测增益:

$$\mathcal{L}_{\mathrm{open}} = \mathcal{L}_{\mathrm{contrast}} + \lambda_{\mathrm{gain}}\mathcal{L}_{\mathrm{gain}} \tag{34}$$

$$\mathcal{L}_{\mathrm{contrast}} = -\log\frac{\exp\!\left(s(q^{I+A}_t, p^O_t)/\tau\right)}{\exp\!\left(s(q^{I+A}_t, p^O_t)/\tau\right) + \exp\!\left(s(q^{I+A}_t, p^C_t)/\tau\right)} \tag{35}$$

$$\mathcal{L}_{\mathrm{gain}} = \left[m - \left(\log q^{I+A}_t(s^*_t) - \log q^I_t(s^*_t)\right)\right]_+ \tag{36}$$

$\mathcal{L}_{\mathrm{contrast}}$ 是对比式蒸馏:把 OCR Teacher 当正样本、Crop Teacher 当负样本,因此迁移的只是 OCR Teacher 相对 Crop Teacher 的增量能力(论文称 in-capacity incremental contrastive distillation)。$\mathcal{L}_{\mathrm{gain}}$ 是一个 margin hinge,强制辅助路径必须比只看目标至少多出 $m$ 的对数似然增益。

情形二:辅助信息无用。压制其影响,让辅助增强后的预测保持贴近「仅目标预测」与 Crop Teacher:

$$\mathcal{L}_{\mathrm{close}} = \operatorname{JSD}\!\left(q^{I+A}_t, q^I_t\right) + \lambda_C \operatorname{JSD}\!\left(q^{I+A}_t, p^C_t\right) \tag{37}$$

情形三:有用但学生够不着。既不迁移也不压制——避免强行模仿一个学生根本无法获取的能力,同时允许它在训练中自然改进。

无论效用与可及性如何,都施加 ground-truth SID 监督并把「仅目标预测」对齐到 Crop Teacher,构成共享的 base 目标:

$$\mathcal{L}_{\mathrm{base}} = \operatorname{CE}\!\left(q^I_t, s^*_t\right) + \operatorname{CE}\!\left(q^{I+A}_t, s^*_t\right) + \lambda_I \operatorname{JSD}\!\left(q^I_t, p^C_t\right) \tag{38}$$

总目标:

$$\mathcal{L}_t = \mathcal{L}_{\mathrm{base}} + \lambda_{\mathrm{gate}}\left[w^{\mathrm{help}}_t w^{\mathrm{cap}}_t \mathcal{L}_{\mathrm{open}} + \left(1 - w^{\mathrm{help}}_t\right)\mathcal{L}_{\mathrm{close}}\right] \tag{39}$$

注意门控的非对称性:开启迁移需要「有用 AND 可及」两个门同时打开($w^{\mathrm{help}}_t w^{\mathrm{cap}}_t$),而压制只由「无用」单个门触发($1 - w^{\mathrm{help}}_t$),与 $w^{\mathrm{cap}}_t$ 无关。这正是情形三「不迁移也不压制」的数学实现。

5. 推理

训练结束后,两种能力都已内化。给定原始 query 图像:Target Enhancer 识别并增强目标 token(Zooming without Cropping);在此基础上 Auxiliary Enhancer 直接从视觉 token 里识别并增强有用辅助线索(Reading without OCR);学到的目标聚焦感知让 SID 解码保持以目标 token 为中心,辅助线索只作为细粒度识别的补充证据。增强后的视觉 token 直接用于 SID 生成,crop 与 OCR 两个教师在推理时被完全移除。

6. 数据构造

数据全部来自拍立淘的线上图搜日志(大规模电商平台)。

训练集:保留有点击、购买、加购、收藏等行为 SID 的 query 图像,且每张 query 图必须关联多于 3 个行为 SID。选取 7 个最高频子类目:女装、童装、男装、女鞋、男鞋、数码 3C、家具。

测试集:取自时间上不相交的时段以避免与训练集 query 图重叠;同样要求 >3 个行为 SID,且至少有一次购买行为;所有测试样本进一步经人工标注员与匹配模型双重验证,确保 query 图与关联商品是同一件商品。评测按点击与购买两类行为分别计算。

类目 训练集 query 数 测试集 query 数
女鞋 275,161 1,095
家具 232,529 483
女装 200,000 4,258
男装 163,526 624
童装 144,629 1,420
数码 3C 100,628 576
男鞋 43,273 191
合计 1,159,746 8,647

每条 query 关联多个正样本,训练/测试平均分别为 5.87 / 5.61,中位数均为 5;约 57% 的 query 含 4–6 个正样本。作者承诺论文发表后公开数据集与模型权重。

7. 实验设置

评估指标。采用 R@K 与 H@K。给定 ground-truth 行为关联 SID 集合 $\mathcal{S}_{\mathrm{beh}}$ 与 top-$K$ 检索集合 $\hat{\mathcal{S}}_K$:

$$\mathrm{R@K} = \frac{\left|\hat{\mathcal{S}}_K \cap \mathcal{S}_{\mathrm{beh}}\right|}{\min\left(K, \left|\mathcal{S}_{\mathrm{beh}}\right|\right)} \tag{40}$$

$$\mathrm{H@K} = \mathbb{I}\!\left(\left|\hat{\mathcal{S}}_K \cap \mathcal{S}_{\mathrm{beh}}\right| > 0\right) \tag{41}$$

R@K 衡量 top-$K$ 里成功召回了多少比例的行为关联商品(分母做了 $\min$ 截断),H@K 衡量是否至少命中一个。两者都按 CLICK / PURCHASE 分别统计。

对比方法。

  • 生成式图像检索:IRGen(CLIP ViT-B/16 视觉编码器 + 24 层 Transformer decoder)、GENIUS(CLIP ViT-L/14 + 6 层 T5 decoder)。均按原论文配置、从对应预训练模型初始化、在本文训练集上训练。
  • 传统相似度检索:DINOv3、CLIP(均用 ViT-B/16),用发布的预训练权重初始化后在本文训练集上微调。
  • 内部对照:Crop Teacher(吃裁剪图)、OCR Teacher(吃裁剪图 + 预抽 OCR)、SFT Baseline(同骨干、吃整图、纯 SFT)。

实现细节。基座模型 Qwen3.5-0.8B;SID 为 3 级码本,每级码本大小 8,192;batch size 1,024,初始学习率 $1\times10^{-4}$,cosine 衰减。超参:$\lambda_{\mathrm{opd}}=2.0$、$\lambda_{\mathrm{roi}}=0.1$、$\lambda_{\mathrm{ent}}=0.02$;OPD 在教师 top-100 预测上计算散度;ROT 权重 $\alpha=(0.1, 0.3, 0.6, 0)$ 分别对应 coarse / medium / fine / separator;$\tau_T=\tau_S=1.0$、$\rho_T=\rho_S=0.0$、$\lambda_{\mathrm{gain}}=0.5$、$m=0.5$、$\lambda_C=0.5$、$\lambda_{\mathrm{gate}}=0.02$。

8. 主要实验结果

Table 1:测试集上的检索性能(%)

方法 输入 CLICK H@1 H@5 H@10 R@5 R@10 PURCHASE H@1 H@5 H@10 R@5 R@10
DINOv3 Crop 36.38 58.61 64.36 32.60 39.87 14.64 36.98 44.35 35.84 43.27
CLIP Crop 30.57 53.90 61.69 28.83 36.73 12.24 32.57 41.11 31.54 40.05
IRGen Crop 29.72 55.02 60.06 28.87 36.03 11.54 32.81 39.85 32.00 39.14
GENIUS Crop 24.62 42.12 45.19 21.99 26.93 9.37 25.03 29.72 24.37 29.28
Crop Teacher Crop 37.48 68.16 74.25 39.02 50.41 14.70 44.28 54.47 43.41 54.02
OCR Teacher Crop + OCR 39.74 70.77 77.02 41.22 52.88 16.00 46.47 57.06 45.54 56.48
SFT Baseline Full Image 29.25 56.13 63.24 30.71 40.74 11.55 34.69 44.57 34.06 44.05
PailitaoGR Full Image 41.88 73.33 79.19 43.46 55.27 17.20 49.39 60.12 48.46 59.48

结论分析:

  1. 相对次优方法平均提升 12.16%(十项指标平均)。注意这里的「%」实为绝对百分点而非相对提升——按 Table 1 复算,PailitaoGR 相对 DINOv3 的十项绝对差平均为 12.09 pp,与文中 12.16 略有出入(应为舍入或统计口径差异)。

  2. 生成式方法内部:同为 crop 输入的设定下,PailitaoGR > IRGen > GENIUS。作者把这个趋势归因于 decoder 容量:Qwen3.5-0.8B > IRGen(24 层)> GENIUS(6 层)。这个归因是合理的但并未做控制变量实验(三者的视觉编码器也不同)。

  3. 相对 SFT Baseline 平均提升 13.8 pp(复算为 13.88 pp,与摘要一致)。这是能力内化本身的净收益:同骨干、同输入(整图)、同数据,唯一差别是训练方式。这是全文最有说服力的一组对照。

  4. 反超两位教师:相对 Crop Teacher +4.76 pp、相对 OCR Teacher +2.76 pp(按 Table 1 复算 OCR Teacher 一项为 +2.46 pp,与文中 2.76 有出入)。教师在训练和推理时都用裁剪 / 裁剪+OCR 输入,学生只用原图却反超——作者据此论证「目标聚焦」与「辅助证据利用」两种能力被有效内化。反超 OCR Teacher 尤其说明选择性内化让模型学会了「用有益线索、但不无差别依赖」。

  5. 一个值得注意的负面对照:SFT Baseline(整图、纯 SFT)在多数指标上不如 DINOv3 这样的判别式基线(CLICK H@1 29.25 vs 36.38)。也就是说,在图搜里「整图 + 生成式 + 朴素 SFT」这条最直接的路子本身是打不过传统向量检索的——本文的全部增益都来自训练方法,而非生成式范式本身。

9. 目标聚焦能力分析(Zooming without Cropping)

用检索目标的 bounding box 作为 ROT,按 ROT 覆盖的视觉 token 数把测试 query 分组,对比 PailitaoGR 与 SFT Baseline。

Table 2:不同 ROT 面积占比下的检索性能(%),Δ 为相对 SFT Baseline 的绝对提升

ROT 占比 方法 CLICK H@1 H@5 H@10 R@5 R@10 PURCH H@1 H@5 H@10 R@5 R@10
0–5% SFT Baseline 18.01 36.53 42.42 19.12 26.44 6.23 20.71 29.12 20.51 28.85
Ours 36.53 65.49 72.05 37.82 49.92 15.32 42.59 54.38 41.83 53.85
Δ +18.52 +28.96 +29.63 +18.71 +23.49 +9.09 +21.89 +25.25 +21.31 +25.00
5–10% SFT Baseline 26.02 50.52 57.25 26.86 35.88 9.85 29.06 38.11 28.71 37.81
Ours 42.11 75.18 81.18 45.20 57.25 17.29 50.68 62.05 49.66 61.30
Δ +16.09 +24.66 +23.94 +18.34 +21.36 +7.45 +21.62 +23.94 +20.95 +23.49
10–20% SFT Baseline 29.59 57.88 64.93 32.04 42.36 11.51 37.04 47.30 36.40 47.08
Ours 43.82 77.20 82.46 46.98 58.88 18.43 54.35 65.02 53.60 64.28
Δ +14.23 +19.32 +17.54 +14.94 +16.52 +6.92 +17.31 +17.72 +17.20 +17.20
20–40% SFT Baseline 32.76 61.20 68.62 33.99 44.70 13.39 38.80 49.12 38.15 48.49
Ours 43.84 75.18 80.88 44.44 56.64 18.09 50.95 61.75 49.82 61.11
Δ +11.08 +13.98 +12.25 +10.45 +11.94 +4.69 +12.15 +12.63 +11.67 +12.62
≥40% SFT Baseline 28.93 56.06 63.39 30.12 40.19 11.52 33.55 43.28 32.78 42.53
Ours 37.39 66.75 73.65 37.92 48.76 14.59 41.60 51.86 40.82 51.43
Δ +8.46 +10.68 +10.26 +7.80 +8.58 +3.06 +8.04 +8.58 +8.04 +8.89

结论分析:提升幅度与 ROT 占比呈单调递减关系——目标越小(0–5% 组),提升越大(CLICK H@10 +29.63 pp);目标越大(≥40% 组),提升越小(+10.26 pp)。这是一条非常干净的证据链:收益确实来自「在杂乱场景中找到并放大小目标」这件事本身,而不是泛泛的模型能力提升。这组实验是全文方法论最扎实的一处——它把机制假设(内化了裁剪能力)转化为一个可证伪的单调性预测,并且验证成立。

另一个可读出的信息:≥40% 组的绝对性能反而低于 10–20% 组(Ours CLICK H@10 73.65 vs 82.46)。目标占满整图时性能下降,说明这类样本本身另有难点(可能是特写图缺少上下文,或大目标类目本身更难区分),论文未做讨论。

10. OCR 阅读能力分析(Reading without OCR)

按 query 图中是否含 OCR 信息把测试集分两组。

Table 3:有 / 无 OCR 信息的 query 上的检索性能(%)

OCR 方法 CLICK H@1 H@5 H@10 R@5 R@10 PURCH H@1 H@5 H@10 R@5 R@10
With OCR SFT Baseline 24.50 49.84 57.40 25.69 34.87 9.45 28.76 38.04 27.87 37.20
Crop Teacher 32.95 63.66 70.07 34.88 45.61 12.53 39.96 49.76 38.92 48.93
Ours 37.95 70.84 77.22 40.56 52.19 15.37 46.54 57.71 45.46 56.73
Δ_SFT +13.44 +21.00 +19.82 +14.87 +17.32 +5.92 +17.78 +19.68 +17.59 +19.53
Δ_Crop +5.00 +7.18 +7.15 +5.67 +6.58 +2.84 +6.58 +7.96 +6.54 +7.80
Without OCR SFT Baseline 32.38 60.34 67.13 34.08 44.66 12.95 38.68 48.95 38.21 48.65
Crop Teacher 40.53 71.20 77.06 41.81 53.65 16.16 47.19 57.65 46.47 57.48
Ours 44.46 75.15 80.76 45.50 57.47 18.43 51.36 61.92 50.53 61.51
Δ_SFT +12.08 +14.81 +13.63 +11.42 +12.81 +5.48 +12.68 +12.97 +12.31 +12.86
Δ_Crop +3.93 +3.95 +3.70 +3.70 +3.82 +2.26 +4.16 +4.28 +4.06 +4.04

结论分析:关键要看 Δ_Crop 这一行——因为 Crop Teacher 已经具备目标聚焦能力但没有 OCR 能力,所以 Ours 相对 Crop Teacher 的增量才是「读字能力」的净贡献。在含 OCR 的 query 上 Δ_Crop 约 +5.0~+8.0 pp,在不含 OCR 的 query 上仅 +3.7~+4.3 pp,前者显著大于后者。这说明模型确实从原图里直接吸取了文字线索,且没有在无文字场景下产生副作用(无 OCR 组仍有正向提升,说明辅助 enhancer 没有把噪声当成证据)。这是对「选择性」这一设计诉求的直接验证。

11. 可视化

Figure 3: Visualization of answer-to-visual attention. From left to right: query image, attention map of the SFT Baseline, and attention map of our model.

沿用训练目标里同样的注意力计算方式——跨头与跨 Transformer 层平均、聚合三级 SID、投影回原图。SFT Baseline 的注意力相对分散,容易被背景区域带偏;本文模型则一致地把注意力集中在检索目标区域。作者还观察到模型在没有显式 OCR 输入的情况下也会主动关注图中的辅助文字线索。

12. 消融实验

Table 4:核心组件消融

方法 Target Auxiliary CLICK H@10 CLICK R@10 PURCH H@10 PURCH R@10
SFT Baseline 63.24 40.74 44.57 44.05
+ Focusing Internalization ✓ 76.53 52.93 57.33 56.75
PailitaoGR ✓ ✓ 79.19 55.27 60.12 59.48

目标聚焦机制单独就贡献了绝大部分增益(CLICK H@10 +13.29 pp),辅助证据机制再叠加 +2.66 pp。这符合直觉:先找对东西比读懂细节重要得多;但辅助机制的 2.66 pp 也不可忽略,且从 Table 3 看它精准地作用在有文字的 query 上。

Table 5:目标聚焦感知机制的目标函数消融

方法 OPD ROT Entropy CLICK H@10 CLICK R@10 PURCH H@10 PURCH R@10
w/o OPD ✓ ✓ 73.05 49.40 53.94 53.25
w/o ROT ✓ ✓ 73.47 50.22 54.91 54.27
w/o Entropy ✓ ✓ 75.64 52.07 56.72 55.98
Full ✓ ✓ ✓ 76.51 52.93 57.52 56.86

结论分析:三项目标互补。OPD 贡献最大(去掉后 CLICK H@10 掉 3.46 pp),印证「从 Crop Teacher 转移以目标为中心的预测行为」是核心机制;ROT 注意力引导次之(-3.04 pp),说明显式的区域监督与 OPD 的隐式行为学习不是冗余的——前者约束「看哪」,后者约束「预测什么」;熵正则最小(-0.87 pp)但仍为正,验证由粗到细的注意力集中度调控有效。

Table 6:选择性辅助证据利用机制消融

方法 Utility Accessibility CLICK H@10 CLICK R@10 PURCH H@10 PURCH R@10
Direct Auxiliary Transfer 77.04 53.05 57.84 57.08
+ Utility ✓ 78.71 54.91 59.70 59.06
+ Accessibility ✓ ✓ 79.19 55.27 60.12 59.48

结论分析:无差别辅助迁移已经有效(77.04 vs Table 4 的 76.53),但加入效用判据带来的增益最大——四项指标平均约 +2.0 pp。这直接验证了论文的核心主张:「过滤掉对 SID 预测无益的辅助证据」比「无差别迁移」更重要。再叠加可及性判据带来一致的额外提升(+0.48/+0.36/+0.42/+0.42 pp),幅度较小但方向稳定,说明「只在学生够得着时才迁移」是一个真实但二阶的效应。

13. 核心贡献总结

  1. 提出 Latent Think-with-Images 范式并落到工业图搜:把工具化视觉能力(裁剪、OCR)在训练期内化进生成式检索模型,推理期只吃原图、零额外工具调用。
  2. 目标聚焦感知机制:Target Enhancer(token 打分 + token 级残差调制)+ on-policy 蒸馏(避开 teacher-forcing 与自回归推理的前缀错配)+ 粒度感知注意力引导(ROT 决定看哪里、熵决定看多广,并按 SID 由粗到细分层加权)。
  3. 选择性辅助证据利用机制:条件式 Auxiliary Enhancer(以 Target Anchor 为条件打分)+ 效用 × 可及性双门控的增量对比蒸馏——只迁移 OCR Teacher 相对 Crop Teacher 的增量能力,且只在学生够得着时迁移。
  4. 构建并承诺开源覆盖 7 个类目的真实线上图搜日志训练/测试集(1.16M / 8.6K query 图,测试集经人工 + 模型双重校验)。

14. 与已归档相关工作的对比

OneSearch-V2 OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework(Kuaishou,2026-03-25)

关系:显式引用但原文未展开对比(仅在 related work 以「self-distilled thought augmentation」一笔带过,无方法或指标层比较)· 已加载对方精读

  • 共同关注的问题:两篇诊断的 root cause 完全一致——显式推理/显式工具在离线有效,但在线延迟预算不允许它出现在推理路径上。OneSearch-V2 发现把关键词 CoT 作为 RAG 输入注入效果最优(Order HR@10 0.2046→0.2139),但「推理时需额外调用 LLM 生成关键词,延迟不可接受」;PailitaoGR 发现裁剪 + OCR 输入的教师最强(OCR Teacher 十项指标全面领先所有公开基线),但「显式工具调用引入额外计算与多步推理,与在线检索的严苛延迟要求冲突」。两篇都拒绝了「把好东西放进推理路径」的解,转而把它放进训练路径。
  • 相近的技术骨架:两者都是信息不对称的师生蒸馏 + 推理期移除教师。OneSearch-V2 的 teacher 输入 $x^{(T)}$ 含关键词、student 输入 $x^{(S)}$ 不含,用 KL 让 student 逼近 teacher;PailitaoGR 的 Crop/OCR Teacher 输入含裁剪图与 OCR 文本、student 只有整图,用 JSD/对比损失逼近。「教师拥有特权输入、学生只有原始输入、推理时只留学生」这条流程图两者可以完全重合。
  • 一个高度一致的实证发现:学生反超教师。OneSearch-V2 的 Table 7 显示 Self-Distill (S)(推理不用关键词)0.2163 略优于 Self-Distill (T)(用关键词)0.2155,作者归因于「student 的 loss 驱动全部梯度,优化天然倾向于在信息不足条件下的鲁棒性」;PailitaoGR 的 Table 1 显示学生相对 Crop Teacher +4.76 pp、相对 OCR Teacher +2.76 pp。两个独立场景(文本电商搜索 / 图搜)得到同一个反直觉结论,互为佐证。
  • 本文的差异与推进:(a)师生形态不同——OneSearch-V2 用完全共享参数的自蒸馏(self-mode),其 Table 8 专门消融过 special-token / CODI 风格 latent / EMA-mode / Joint-mode 四种内化策略,结论是 self-mode 最优;PailitaoGR 用的是独立训练的分离教师,更接近 OneSearch-V2 判定为次优的那一类,但本文未做这个维度的对照。(b)PailitaoGR 多了两层 OneSearch-V2 没有的机制:on-policy 采样(在学生自己的前缀上蒸馏,而非 ground-truth 前缀)与注意力层的显式监督(ROT + 熵)。(c)最实质的推进是「选择性」:OneSearch-V2 是无差别蒸馏(对所有有效 token 位置一视同仁做 KL),而 PailitaoGR 认为教师的优势里有一部分是有害的或学生够不着的,因此加了效用 × 可及性双门控。Table 6 显示光是加效用判据就带来约 +2.0 pp——这恰好是 OneSearch-V2 路线上留白的地方。(d)OneSearch-V2 有完整线上 A/B(+3.98% Item CTR、+2.11% 订单量),PailitaoGR 只有离线实验。

LASAR LASAR: Latent Adaptive Semantic-Aligned Reasoning for Generative Recommendation(Beihang University,2026-05-11)

关系:独立并发(本文未引用 LASAR,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:LASAR 的开篇诊断是「CoT 在 token 空间逐字生成,对延迟敏感的推荐系统是致命的」;PailitaoGR 的开篇诊断是「显式工具调用引入额外计算与多步推理,与在线检索的严苛延迟要求冲突」。两者指向同一个 root cause——「显式的、可观测的中间步骤」这一形式本身就是延迟负担,而不是某个具体模型不够好。因此两者的解法方向都是把中间步骤沉入不可观测的连续空间。LASAR 把这称为 latent reasoning,本文称为 latent think-with-images——命名都是「latent + 原范式名」,这本身就说明抽象层是同一个。
  • 相近的技术骨架:两者都是「训练时保留显式模态作为锚点、用散度对齐、推理时永不解码它」。LASAR 用 GPT-5 为每条训练样本生成 5 段式 explicit CoT,切段后离线抽取每段的 hidden state 作为锚点 $h_t^{cot}$,用 stepwise bidirectional KL 把每个 latent step 对齐过去(式 4),推理时 CoT 永不产出;PailitaoGR 用 Crop / OCR Teacher 在特权输入上产出 SID 分布作为锚点,用 JSD 逐解码步对齐(式 14),推理时教师被完全移除。「显式锚点 → 散度对齐 → 推理期丢弃」这条主干两者完全重合。
  • 本文的差异与推进:(a)对齐的层次不同——LASAR 对齐的是隐状态(把 hidden state 过 softmax 后算 KL),PailitaoGR 对齐的是输出分布 + 注意力分布两处。(b)PailitaoGR 有 on-policy 这一层,LASAR 没有:LASAR 的锚点是离线抽好的静态 hidden state,而 PailitaoGR 明确论证了 teacher-forcing 与自回归推理的前缀错配,改成在学生自己采样的轨迹 $\hat{\mathbf{s}}$ 上查询师生(式 11–13)。这一点上 PailitaoGR 更彻底。(c)LASAR 有自适应深度,PailitaoGR 没有:LASAR 用 Policy Head + REINFORCE 按样本决定 latent 步数 $N$,本文的增强器对所有样本施加同一套固定强度的残差调制($\lambda_I$、$\beta\lambda_A$ 均为超参),没有「这张图需要多强的聚焦」这样的自适应机制——考虑到 Table 2 显示不同 ROT 占比组的收益差异巨大(+29.63 pp 到 +10.26 pp),这是本文一个明显可以补的方向。(d)证据层次不同:LASAR 在 Beauty / Instruments / Sports 三个 Amazon 公开数据集上验证并给出 ~20× 加速的实测,PailitaoGR 在平台规模私有日志上验证但没有报任何延迟实测数字。
  • 一个有意思的分歧:LASAR 的核心发现之一是「把 Coconut 直接搬到 SID 上会显著掉点」,必须两阶段解耦(先建立 SID grounding,再开 latent loop),否则优化塌陷;PailitaoGR 没有遇到这个问题,因为它的 latent 化发生在视觉编码器侧(改写视觉 token),SID 解码器的符号系统始终由 CE 直接监督(式 38 的 $\operatorname{CE}(q^I_t, s^*_t)$ 全程在场)。把 latent 化放在输入侧而非解码侧,天然绕开了 LASAR 遇到的 grounding-reasoning 互相干扰问题——这是本文架构选择的一个隐含优势,论文自己没有意识到。

15. 讨论与局限性

值得借鉴的设计:

  1. 「特权输入教师」是比「更大教师」更便宜的能力来源。本文的两个教师与学生同一个骨干、同一个规模,唯一区别是输入被工具预处理过。这意味着能力提升不需要付出教师侧的算力代价,只需要一条离线的工具流水线。这个 trick 的适用面远超图搜——任何「某种昂贵预处理能显著提升效果但线上做不起」的场景都可以套。
  2. 「效用 × 可及性」双门控是对朴素蒸馏的一个真正有价值的修正。教师的优势不等于学生的增益,这一点在归档里 Rec-Distill 用 $\eta$(迁移率)在模型层面量化过;本文把它下沉到 per-token 的 soft gate,并且明确处理了「有用但够不着」这第三种情形——既不迁移也不压制,避免强行模仿一个学生根本学不会的能力。这个三分法的处理比二分门控细腻。
  3. 把 SID 的粗到细结构当作注意力监督的调度信号($\alpha$ 递增、$\gamma$ 从 +1 翻到 −1)。这是一个把领域结构先验直接写进损失的干净例子。

局限与争议:

  1. 没有线上部署,也没有 A/B 实验。全文出现 0 次 "A/B"、0 次 "deploy",唯一的 "production" 出现在 Ethical Considerations 里说明数据用途。这是本篇最大的缺口:数据是工业的、场景是工业的,但验证是纯离线的。对一篇以「在线延迟约束」为全部动机的论文来说,这个缺口尤其刺眼。
  2. 延迟这个核心卖点完全没有实测。Figure 1 用 Low/Medium/High 的定性标注声称本方法「性能高、延迟低」,但正文没有任何 QPS、P99、单请求耗时的数字,也没有与 Crop-Assisted / Crop+OCR-Assisted 流水线的端到端耗时对比。方法确实在结构上省掉了工具调用,但 Target/Auxiliary Enhancer 的 token 级打分与残差调制本身有开销,训练时还要跑注意力权重的显式提取——这些代价一个都没量化。
  3. 缺少最相关的基线 OneVision。related work 明确把 OneVision 认定为「首个工业级电商视觉搜索生成式检索框架,其生成式检索器吃裁剪后的 query 图像」,这正是本文要超越的对象,但 Table 1 里没有 OneVision,只有一个自建的 Crop Teacher 作为替身。
  4. 公式与实现描述存在多处不一致。(a)式 14 定义 OPD 用 JSD,而 5.1 节实现细节写「we compute the forward KL divergence over the teacher's top-100 predictions」;(b)超参写 $\lambda_{\mathrm{roi}}$,方法节的损失叫 $\mathcal{L}_{\mathrm{rot}}$(ROI vs ROT);(c)3.2 节正文说「we design a Target Router」,其余全文一律叫 Target Enhancer;(d)Figure 2 里辅助残差写作 $h^{I+A}_i = h_i + \beta\lambda_A a^A_i F_A(h^I_i)$,而式 27 是 $h^I_i + \cdots$;(e)Table 4 的「+ Focusing Internalization」(76.53 / 52.93 / 57.33 / 56.75)与 Table 5 的「Full」(76.51 / 52.93 / 57.52 / 56.86)在指标定义上应当同源却对不上;(f)文中「surpasses the OCR Teacher by 2.76%」按 Table 1 复算为 2.46 pp。单看每一处都是小问题,累加起来说明稿件的实验记录与写作之间存在系统性的对不齐。
  5. 训练集与测试集的类目分布严重错配。女装占训练集 17.2% 却占测试集 49.2%;女鞋占训练集 23.7% 却只占测试集 12.7%。测试集虽然做了人工校验且时间上不相交,但它实际上是一个以女装为主的评测,所以「平均 +13.8 pp」这个数字很大程度上由女装类目主导。论文没有报分类目结果(只按 ROT 占比和有无 OCR 分了组),无法判断增益在类目间是否稳定。
  6. 对 ROT bounding box 的强依赖。$\mathcal{L}_{\mathrm{rot}}$ 需要每张训练图的检索目标框,Table 2 的分析也依赖它。论文没有说这些框从哪来——人工标注、检测模型、还是线上主体检测服务的产出?如果依赖一个额外的检测模型,那么「不需要工具」这个卖点在训练侧并不成立,只在推理侧成立;框的质量也直接决定 ROT 损失的有效性,论文没有做框噪声的鲁棒性分析。
  7. 方法论可扩展性:本文的做法是在冻结的 SID 空间之上做视觉侧的表征改造,SID 码本(3 级 × 8,192)由外部给定、不参与优化。这意味着 scaling 时「如何表征查询图像」可以随骨干一起长大,但「如何表征商品」被码本固化住了——两条路径无法同步扩容。同时两个教师必须为每次骨干升级重新训练,训练流水线的耦合度不低。
  8. 与同期路线的关系:归档里 08-26 精读的 TransRetrieval(2608.25528,同为阿里淘天,展示广告召回)明确反对生成式检索路线,主张瓶颈在每候选 FLOPs 与内积表达力,押注可 scaling 的判别式 Transformer。本文同为阿里、同为检索,却押注生成式。但两者并不构成真正的路线对照:TransRetrieval 面对的是 $10^8$ 级候选库、$\rho \approx 0.08\%$ 打分预算下的广告召回,其 root cause 是异构特征尺度失配与每候选 FLOPs;PailitaoGR 面对的是单张 query 图像内部的信息混杂,其 root cause 与候选库规模、特征异构性都无关。二者是在不同问题上做不同取舍,不宜当作同一问题上的互斥诊断来读。值得注意的倒是 Table 1 里的那个负面对照——整图 + 生成式 + 朴素 SFT 打不过 DINOv3 这样的判别式基线,某种意义上给了 TransRetrieval 一个侧面支持:生成式范式本身不自带优势,优势来自训练方法。

总体判断:方法设计有实质创新(特权输入教师 + 效用/可及性双门控 + 粒度感知注意力监督三者组合,在归档里没有见过完全相同的配方),Table 2 的 ROT 单调性分析是一条难得干净的机制证据链,消融也逐项到位。但工业验证不完整——工业数据 + 工业场景 + 纯离线结论,且核心卖点(延迟)没有任何实测,最相关的基线(OneVision)缺席,稿件本身还有多处数字与命名的不一致。这些共同把它压在「扎实的工作」区间而非「开创性工作」。