← Back to list
IID-Nav

From Extraction to Navigation: Progressive Retrieval with Indirectly Infinite Depth

生成式推荐 Kuaishou
Abstract 7 │ Reading 7 │ Rating —
2026-06-29
Linxiao Che, Shanshan Huang, Haitao Lu, Yijia Sun, Qiang Luo, Ruiming Tang, Han Li, Kun Gai, Guorui Zhou
Kuaishou Technology
提出 IID-Nav,把工业推荐召回从静态相似度抽取重构为有状态的目标驱动图导航:用跨请求状态接力(间接无限深度 IID)突破单请求跳数/延迟的深度上限,用 target-aware 判别器主动意图路由替代被动近邻扩展,并用图硬负采样的轨迹对齐训练抑制搜索漂移,亿级工业集 Recall@500 提升 +36.35%。
评分原因
摘要评分:工业级推荐召回新框架,把检索建模为有状态自主图导航并在亿级工业数据、严格延迟预算下超越主流基线,方法创新与工业背景兼具,值得精读。
精读评分:IID(把检索深度从单请求空间维度解耦到跨请求时间维度,用状态接力实现间接无限深度)是原创且优雅的核心 insight,工业场景价值明确;但导航判别器与图硬负采样较 NANN/DIN 偏增量,v1 篇幅短、超参披露有限、存在表格标注与正文不一致(Table 4 符号互换、A/B watch-time 正文 0.26% 与表 0.55% 不符),线上为补充召回增益温和,故 7 分。
graph contrastive-ssl pretrained-lm transformer industrial

From Extraction to Navigation: Progressive Retrieval with Indirectly Infinite Depth(IID-Nav)

Kuaishou Technology · RecSys'26 · arXiv 2606.29970 · 2026-06-29 作者:Linxiao Che*, Shanshan Huang*, Haitao Lu*, Yijia Sun, Qiang Luo†, Ruiming Tang†, Han Li†, Kun Gai, Guorui Zhou†(* 同等贡献,† 通讯作者)

一句话总结

IID-Nav 把工业级推荐召回从"静态相似度抽取(extraction)"重构为"有状态的目标驱动图导航(navigation)":用一个 target-aware 判别器主动地在物品图上逐跳路由,用跨请求的导航状态持久化(Redis state relay)把单次请求被延迟预算锁死的探索深度沿时间轴累积起来,从而实现"间接无限深度(Indirectly Infinite Depth, IID)",并用图硬负采样的轨迹对齐训练抑制"搜索漂移(search drift)"。在亿级工业数据上 Recall@500 较最强基线提升 +36.35%,线上 A/B 提升使用时长与观看时长。


1. 研究动机与背景

现代推荐系统面临一个基础性挑战:在数十亿物品的语料中、在严格延迟约束(通常 <100ms)下,检索出极小的相关子集。召回阶段是关键瓶颈,它定义了整条推荐质量的上界——如果召回阶段没能捕获用户的潜在兴趣,后面再精巧的排序也无法挽回。

论文提出,召回范式正在经历一次根本性转变:从静态抽取(static extraction)转向动态导航(dynamic navigation)。

  • 传统 item-to-item(i2i)启发式:依赖预计算的相似度查表(pre-computed lookups),本质上是在一个狭窄的、预定义的范围内做"静态查表"。
  • 结构化全局索引(TDM、NANN 等):虽然引入了判别模型来拓宽范围,但其搜索过程仍然是"拓扑受限(topologically constrained)"的。

作者论证:随着用户意图越来越复杂、高维,召回必须从被动匹配演进为主动的、目标导向的物品空间遍历。把检索建模为迭代式路径,系统才能动态识别相关候选,把检索真正变成意图驱动的发现过程。

图索引方法的两大顽疾

尽管图索引取得了成功,工业系统仍面临两个关键缺陷:

  1. 兴趣隧道(Interest Tunnel):因为传统方法依赖刚性的索引结构,搜索轨迹常被困在历史行为的局部簇里。这种结构刚性使系统无法探索那些处于行为近邻之外的深层兴趣(deep-depth interests),候选被限制在狭窄的、走熟了的路径上。

  2. 搜索漂移(Search Drift):大多数图索引使用与用户实时意图解耦的静态全局入口节点。结果随着搜索深度增加,导航轨迹会逐渐偏离真实意图空间。这种错配导致 recall 显著退化——搜索无法穿透更相关但更稀疏的语料区域。

核心理论:间接无限深度(IID)

为克服上述约束,作者提出 Indirectly Infinite Depth(IID) 理论。核心前提是:探索深度不应被单次请求延迟预算内允许的物理跳数所限制。检索应当是一个渐进的过程,在时间维度上演化。通过把检索形式化为一个有状态系统,作者实现了一个跨请求维持搜索连续性的状态接力(state relay)机制。这一架构保证:即使单次交互被限制在少数几跳内,系统也能随时间逻辑地遍历任意图深度,从而穿透此前一次性检索无法触达的深层兴趣区域。

主要贡献

  • 目标导向导航策略(Goal-Oriented Navigational Policy):用主动的、意图驱动的路由替代被动的邻域扩展,由一个 target-aware 判别器引导,使搜索轨迹精确对齐用户当前意图。
  • 递归状态演化(Recursive State Evolution):引入跨请求的状态持久化机制,缓存并演化导航状态,绕过通常限制深层兴趣发现的物理瓶颈,实现 IID。
  • 轨迹感知学习(Trajectory-Aware Learning):用基于图的硬负采样的专门训练方案,保证整条导航轨迹上的精确对齐,缓解深跳导航中固有的搜索漂移。
  • 大规模验证:在亿级工业实验上验证 IID-Nav 在保持生产级响应速度的同时显著提升召回有效性。

2. 相关工作

2.1 从静态启发式抽取到动态表征

  • 静态启发式抽取:早期工业召回主要依赖 i2i 协同过滤与 Swing 算法 [19],预计算 i2i 相似度、推理时做静态查表。
  • PDN [11](Path-aware Deep Network):用神经判别器为结构化的 user-item 转移打分,捕捉启发式规则忽略的高阶连通性,但仍受兴趣隧道约束——只能检索已有物理链接的物品,无法探索深层兴趣。
  • 序列化检索:SASRec [10] 首次把自注意力用于序列推荐;MPFormer [16] 提出多任务 Transformer 框架建模异质序列模式;BERT4Rec [15] 用双向 Transformer 打破单向约束。
  • 超长序列:ULIM [13] 把超长行为历史解耦为多个长期兴趣;LongRetriever [14] 进一步研究超长序列下的候选检索与表征退化/效率问题。
  • EBR(embedding-based retrieval)的根本局限:把 user-item 亲和度分解为独立 embedding,是固定 embedding 空间里的"一次性事件",无法充分利用深层交互网络(如 DIN [21])或建模复杂特征相关性,常导致与下游排序的潜在不匹配。这促使召回向"复杂神经模型直接掌控搜索过程"的框架转变。

2.2 结构化索引与搜索漂移挑战

  • 树结构:TDM [23] 把检索建模为层次树上的 beam search;JOT [22] 联合优化树结构与节点打分网络以减少训练/推理失配;MISS [6] 用多模态索引树 + 多模态终身序列建模;Deep Retrieval [5] 设计多路径层次结构做物品聚类。树结构方法的根本约束在于其静态刚性拓扑——一旦层次构建完成,任意意图的导航路径就基本被索引结构预定义了,无法适应实时、异质的兴趣漂移。
  • 量化方法:StreamVQ [1] 用向量量化 + 多阶段码本精炼优化检索效率;GRank [17] 用候选生成器 + 轻量级 ranking-aware scorer 桥接召回与排序。
  • 这些结构化/量化方法频繁遭遇搜索漂移:因为锚定在静态全局入口或刚性划分的码本上,搜索轨迹容易与实时意图解耦。本文用动态导航策略 + 实时意图对齐来解决。

2.3 图导航与 IID 范式

  • 图表征学习:PinSage [20] 用随机游走与邻域聚合产生表达性物品 embedding;NGCF [18]、LightGCN [7] 在 user-item 二部图上传播连通性信号。但它们仍依赖传统最近邻匹配,缺乏在推理时主动导航图拓扑的能力。
  • 图索引:HNSW、DiskANN [9]、NSG [4] 在大规模语料上做高效贪婪遍历;NANN [3] 把神经引导引入遍历过程,把物品空间当作可导航环境做迭代搜索。但 NANN 及其变体仍工作在无状态范式——搜索深度被严格限制在单次请求的计算预算内,导致兴趣隧道。

IID-Nav 的区别在于引入 IID 理论:通过跨请求的状态持久化,让搜索前沿在连续用户交互间演化、累积深度,打破物理跳数的枷锁,去发现全局物品语料中此前不可达的"缺失链接(missing links)"。


3. 核心方法

如 Figure 1 所示,IID-Nav 由离线环境构建阶段和在线有状态导航过程组成,通过解耦架构把高精度判别打分与亿级探索协调起来。

Figure 1: IID-Nav 框架总览。(a) 在线检索:有状态在线导航从个性化入口 E_u 开始多跳遍历,搜索状态跨连续请求持久化以实现 IID;(b) 排序模型:target-aware 判别器通过 cross-attention 引导导航策略,用 graph-hard 负采样优化;(c) 语义图与 (d) 协同图构成异质环境,由多模态 LLM 与 Swing 算法构建。

3.1 异质导航环境(Heterogeneous Navigational Environment)

导航环境建立在两个互补的图结构之上,为意图驱动探索提供结构基础。

协同图 $G_c$(Collaborative Graph):捕捉行为层面的物品相关性。用 Swing 算法基于物品在共享用户交互序列中的共现来计算物品 $i,j$ 之间的相似度分。边权 $w_{ij}$ 由用户集合的重叠定义,确保导航沿着高协同相关性的路径走。

语义图 $G_s$(Semantic Graph):用于弥合行为缺口(behavioral gaps)。采用多模态大语言模型(multi-modal LLM)从物品元数据(文本、音频、图像)抽取特征;训练两座共享权重的 Item Tower,通过 batch 对比损失把多种模态映射到统一 embedding 空间;再基于余弦相似度建边。这使系统即便在没有共现数据时也能导航到语义相关的候选——这是对协同图盲区的关键补充。

3.2 目标导向导航策略(Goal-Oriented Navigational Policy)

导航策略由一个 target-aware 排序模型(Figure 1b)掌控,它充当判别器(discriminator)来引导搜索前沿。

排序模型架构:一个带 target-aware attention 的深度网络,用以捕捉细粒度的 user-item 交互。给定用户 $u$ 的历史行为序列 $S_u = [i_1, i_2, \ldots, i_L]$ 与目标物品 $i_t$,模型先把历史物品与目标都编码为稠密表示;多头 target-attention 在目标物品的条件下聚合历史行为:

$$\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^{T}}{\sqrt{d_k}} + M\right) V \tag{1}$$

其中 $Q$ 是目标物品 embedding,$K, V$ 对应历史物品 embedding,$M$ 是掩码 embedding,用于在注意力计算中排除无效/填充的历史物品。输出是一个在目标 $i_t$ 条件下的统一用户表示 $z_u$,再连同目标物品特征送入 MLP,产生最终匹配分 $f_\theta(u, i_t)$。

关键设计:模型不受限于双塔结构,允许自由使用 user/item 表示间的交叉特征与深层交互——正是这一点让判别器能够直接朝高价值区域"编排路径",而非像 EBR 那样在固定 embedding 空间做被动内积匹配。这是把"静态抽取"升级为"主动导航"的算法基础。

3.3 轨迹感知学习(Trajectory-Aware Learning)

为防止导航过程偏入无关物品空间(即 search drift),作者设计了轨迹感知学习方案,核心是 Graph-Hard Negative Sampling。

对每个正样本 $(u, i^{+})$,构造负样本集 $N$,来源有二:(1) batch 内负样本(in-batch negatives);(2) 图硬负样本(graph-hard negatives),从检索图 $G_c, G_s$ 中采样,对齐到在线导航时实际遇到的局部决策边界。

硬负策略:先从检索图中随机采样一个候选子集(即 $G_c$ 或 $G_s$ 中拓扑接近、但缺乏正交互标签的物品),再从中挑出图边强度较低但拓扑邻近的物品。直觉是:这些近邻在结构上相似却意图不相似(structurally similar but intent-dissimilar),恰恰是多跳遍历中搜索漂移的主要来源。强迫判别器把 $i^+$ 与这些"模糊近邻"区分开,就能让模型在深度增加时仍锚定在真实意图空间。

训练目标:联合建模绝对相关性(pointwise)与相对排序(pairwise),结合 InfoNCE 与 margin-based pairwise 损失:

$$\mathcal{L} = \lambda_0 \mathcal{L}_{\text{InfoNCE}} + \lambda_1 \mathcal{L}_{\text{PW}} \tag{2}$$

其中 $\lambda_0, \lambda_1$ 分别是两项权重。

InfoNCE 损失通过对比学习鼓励模型把正交互与负交互区分开:

$$\mathcal{L}_{\text{InfoNCE}} = -\log \frac{\exp\!\big(f_\theta(u, i^{+})/\tau\big)}{\exp\!\big(f_\theta(u, i^{+})/\tau\big) + \sum_{i^{-}\in N}\exp\!\big(f_\theta(u, i^{-})/\tau\big)} \tag{3}$$

pairwise 损失在正样本与每个负样本之间施加 margin:

$$\mathcal{L}_{\text{PW}} = \sum_{i^{-}\in N} \max\!\Big(0,\; f_\theta(u, i^{-}) - f_\theta(u, i^{+}) + m(i^{-})\Big) \tag{4}$$

这里 margin $m(i^{-})$ 以负样本类型为条件,让模型学到差异化的决策边界:对结构相似但弱连接的物品施加更强的分离,同时对全局无关负样本保持鲁棒。

作者强调:把图感知的负样本构造与 pointwise–pairwise 混合目标结合,是一种把训练信号与 IID 的迭代决策过程"同构化"的策略。与需要复杂对抗对齐的方法不同,IID-Nav 在设计上即实现轨迹一致性——判别器被显式优化以抵抗多跳遍历的累积误差。因此即便系统跨请求实现了 IID,导航策略仍锚定在用户真实意图空间,弥合了深度探索与高精度检索之间的鸿沟。

3.4 动态锚点唤醒(Dynamic Anchor Awakening):意图驱动的初始化

大规模检索的效率关键在于从已与用户当前兴趣对齐的物品空间区域发起导航,而不是从固定全局入口出发。为此 IID-Nav 引入 Dynamic Anchor Awakening 机制,为每次请求(时刻 $t$)构造个性化入口集 $\mathcal{E}_u^t$,作为初始 trigger 集。

为全面捕捉用户多兴趣、同时缓解"兴趣窄化(interest narrowing)",初始 trigger 集融合两类互补信号:

  • 近期兴趣 $\mathcal{L}_u$(Recent Interest):从用户曝光历史 $S_u$ 中取 $L$ 个最近的唯一物品,按时间排序。提供持续且最新的偏好,是局部探索的高精度起点。
  • 缺失记忆兴趣 $\mathcal{M}_u$(Missing-memory Interest):为对抗近因偏置(recency bias),恢复那些类别标签在 $\mathcal{L}_u$ 中被低估(低于频率阈值 $\tau$)的更早历史物品。这能重新激活那些连贯但近期被忽略的类别中的潜在兴趣。

最终初始化前沿定义为二者的并集后截断:

$$\mathcal{A}_u^t = \text{Truncate}\big(\mathcal{L}_u \cup \mathcal{M}_u\big)$$

这保证导航从一个既兼顾时间近因、又覆盖深层长尾兴趣的多样化种子出发。把这些异步信号映射到异质图环境中,系统就能让后续导航策略在物品语料中最相关的子空间里启动搜索。

3.5 面向 IID 的递归状态演化(Recursive State Evolution)

在线执行是一个有状态的多跳遍历(Figure 1a),把效率与长期探索协调起来。

模型引导探索(Model-Guided Exploration):过程进行 $H$ 跳。每一跳 $k$,系统从 $G_c, G_s$ 扩展邻居;判别器 $f_\theta(u, \cdot)$ 为候选打分,选出 top-$K$ 进入下一跳。这一"扩展—打分—截断(expand-score-truncate)"循环保证按实时意图主动转向。

间接无限深度(IID):为克服单次检索的物理跳数约束与延迟预算,定义请求 $t$ 时的导航状态 $\mathcal{S}_t$,表示该次交互所达到的探索进度。连续请求间的状态转移为:

$$\mathcal{E}_u^{(t+1)} = \mathcal{A}_u^{(t+1)} \cup \mathcal{S}_u^{t} \tag{5}$$

其中 $\mathcal{A}_u^{(t+1)}$ 是新唤醒的锚点(来自 3.4 的 Dynamic Anchor Awakening),$\mathcal{S}_u^t$ 把上一次请求搜索前沿中的高质量终端节点注入当前的初始导航点。如 Figure 1a 所示,这种异步状态交接通过一个 Redis-based relay 实现。通过缓存并循环利用高价值节点,探索深度沿时间轴演化,使系统能逻辑上到达物品子空间中的任意深度,穿透单次请求跳数限制内无法触达的稀疏兴趣区域。

Algorithm 1:带 IID 的在线多跳图检索

输入:用户 $u$ 的近期兴趣 $\mathcal{L}_u$ 与缺失记忆兴趣 $\mathcal{M}_u$(合为 $A_u$);上次请求缓存的召回集 $S_u$($|S_u| \le 500$);Swing(·) 协同图 1 跳扩展;Semantic(·) 语义图 1 跳扩展;RankModel(·;u) target-attention 排序模型;跳数 $H$(默认 $H=2$);最终召回数 $K$;缓存过期时间 $\Delta t$。 输出:用户 $u$ 的 top-$K$ 召回 $\mathcal{S}_N$。

function ONLINERETRIEVAL(u, A_u, S_u, N, K, Δt):
  T_1 ← ∅                                     # 初始化 trigger 集
  S_u ← GetRedis(recall:{u})                  # 从上次请求取缓存 IID 集
  if S_u ≠ ∅:
      T_1 ← UniqueTruncate(S_u ∪ A_u, 1000)   # IID:跨请求链式探索
  else:
      T_1 ← A_u
  M ← ∅                                        # 全局打分表 item → score
  for i = 1 to H:
      C_i ← Swing(T_i) ∪ Semantic(T_i)        # 候选扩展(双图)
      C_i^new ← { x ∈ C_i | x ∉ dom(M) }      # 未打分的新物品
      if C_i^new ≠ ∅:
          p_new ← RankModel(C_i^new; u)        # 仅为新物品打分(去重避免重复推理)
          M[x] ← p_new[x]  for x ∈ C_i^new
      p_i ← [ M[x] for x ∈ C_i ]               # 取回分数
      R_i ← Top-K(C_i, p_i)                     # 选 top-K
      T_{i+1} ← R_i                             # 更新 trigger 进入下一跳
  R_N ← R_H
  SetRedis(recall:u, R_N, Δt)                  # 缓存供下次请求做 IID
  return R_N

算法的两个工程要点:(1) 用全局打分表 $M$ 做去重打分,跨跳已打过分的物品不重复送判别器,控制延迟;(2) 末尾 SetRedis 把本次高质量结果写回缓存,正是 IID 跨请求接力的落地——下一次请求 GetRedis 取回后与新锚点并集,深度由此沿时间累积。


4. 实验

作者通过离线实验 + 大规模线上 A/B 验证:有状态导航机制能否有效克服传统检索的深度约束,并通过轨迹感知学习解决搜索漂移。

4.1 研究问题(RQs)

  • RQ1:IID-Nav 在精度与召回上能否超越 SOTA 检索方法?
  • RQ2:IID 机制如何随时间影响探索深度与兴趣发现?
  • RQ3:轨迹感知学习能否有效缓解深跳导航中的 search drift?
  • RQ4:多图融合与锚点唤醒各自对性能贡献几何?
  • RQ5:框架对大规模工业部署是否足够高效与鲁棒?

4.2 实验设置

数据集:1 个工业 + 2 个公开数据集,均按时间切分。ShortVideo-Ind 用连续 6 天训练、第 7 天测试;公开数据集用前 90% 日志训练、后 10% 评估。

Table 2:预处理后的数据集统计

统计量 UserBehavior MovieLens-20M ShortVideo-Ind
Users 964K 138K 108M
Items 4.2M 27K 42M
Interactions 1.7M 9.3M 4B
Avg. Seq. Len. 101 144 980

注:工业数据集 ShortVideo-Ind 规模为亿级用户、千万级物品、十亿级交互、平均序列长 980,是论文的主战场;两个公开集(Taobao UserBehavior 电商、MovieLens-20M 电影)用于可复现对比。

Baselines:

  • DSSM [8]:标准双塔 DNN,user/item embedding 内积匹配,FAISS + HNSW 索引。
  • Kuaiformer [12]:基于 Transformer 的双塔检索,序列建模增强用户表示,内积匹配 + FAISS/HNSW。
  • TDM [23]:树结构深度检索,beam search;仅在工业数据集上评测(部署复杂度高),判别器容量与本文对齐以求公平。
  • NANN [2]:图检索,模型引导遍历($l2$ 距离),含对抗训练任务;无状态,探索深度严格受单次请求计算预算约束。
  • Streaming VQ [1]:向量量化 + 图遍历;同为无状态,导航范围受单趟搜索约束。

评估指标:离线用 Recall@K 与 NDCG@K($K=50, 500$),并在 100ms 严格延迟约束下用 QPS(Queries Per Second)衡量系统效率;线上 A/B 监控业务指标——Total App Usage Time、Usage Time per User、Video Watch Time。

实现细节:target-attention 多头架构;构建两个 i2i 图——协同图(Swing 风格共现)+ 语义图(表征级相似度);每图每个 trigger 最多保留 50 个邻居以控制图密度;在线检索时为每个 trigger 动态生成个性化入口集 $\mathcal{E}_u$,最大 1000 个物品;检索做 $H=2$ 跳;每跳候选扩展上限约 15,000 个物品(平衡覆盖与延迟);Adam 优化器。

4.3 总体性能(RQ1)

Table 1:不同数据集上 SOTA 方法的性能对比(粗体=最优,下划线=次优;TDM 仅在工业数据集上评测)

Method UserBehavior R@50 UserBehavior NDCG@50 MovieLens R@50 MovieLens NDCG@50 Industry R@500 Industry NDCG@500 QPS
DSSM 0.2711 0.1911 0.1940 0.0792 0.1068 0.0360 1300
Kuaiformer 0.3270 0.2347 0.2538 0.0906 0.1151 0.0386 772
TDM – – – – 0.1766 0.0535 273
NANN 0.3264 0.1765 0.2633 0.1017 0.1326 0.0466 384
Streaming VQ 0.3220 0.2262 0.2554 0.0907 0.1296 0.0603 450
IID-Nav 0.4920 0.2256 0.3642 0.1304 0.2408 0.0826 910
Relative Gain +50.46% −3.88% +38.32% +28.22% +36.35% +36.98% −30.0%

结论分析:

  • IID-Nav 在 MovieLens 与工业数据集上的 Recall 与 NDCG 双双最优;尤其在工业集上 Recall@500 +36.35%、NDCG@500 +36.98%,证明模型引导探索能穿透传统双塔/树结构无法触达的稀疏兴趣区。
  • 在 UserBehavior 上,IID-Nav 的 NDCG 略低于 Kuaiformer(−3.88%),但 Recall 暴涨 +50.46%。作者明确指出这是有意为之的权衡(intentional trade-off):在工业多阶段流水线里,召回阶段更看重"更高的召回率提供更全面候选池",而非召回阶段的细微排序差异——后者由下游排序兜底。
  • QPS 910 vs DSSM 1300(−30%):IID-Nav 比最快的双塔 EBR 慢 30%,但仍远高于 TDM(273)与 NANN(384),处于可工业部署区间。

4.4 深度探索分析(RQ2 & RQ3)

多跳探索与 IID 分析。 Figure 2 描绘 Recall@500 与 QPS 随跳数 $H$ 的变化趋势:

Figure 2: Recall@500 与 QPS 随探索跳数 H 的变化。性能在 2 跳后趋于饱和,QPS 随 H 线性下降;infinite exploration(IID)变体超越所有固定跳数设置,逼近无限跳的渐近行为。

关键观察: 1. 性能从 1 跳到 2 跳显著跳升——证实多步推理的必要性(单跳即退化为 i2i 局部查表)。 2. 2 跳后增益饱和,而 QPS 随 $H$ 线性下降——继续加跳数性价比急剧降低。 3. IID 机制一致超越所有固定跳数配置:$H=2$ + IID 探索的效果甚至超过 $H>4$ 的固定跳数模型。这证实 IID 通过跨请求累积深度,成功逼近了无限跳探索的行为,却不增加单次请求延迟。

因此作者选 $H=2$ + IID 作为最优平衡点(论文默认配置)。这是全文最关键的实证:把"深度"从单请求维度解耦到时间维度,用极低的在线代价换取了等效于深跳的召回收益。

对搜索漂移的鲁棒性(RQ3)。 图导航的内在风险是 search drift——扩展随深度增加而偏离用户核心意图。消融显示:从训练目标中移除 graph-hard negatives 会导致 Recall@500 下降 8.26%。这说明:若不显式训练模型把目标与 $G_c, G_s$ 中拓扑邻近的"硬"干扰项区分开,导航策略就易漂移;引入这些挑战性负样本后,IID-Nav 把多跳遍历的每一步都锚定到用户真实意图,即便跨请求 state-relay 也能持续抑制导航误差累积,在深度探索全程维持高精度。

4.5 消融实验(RQ4)

Table 3:图结构消融

Variant Recall@500 NDCG@500
IID-Nav (Full) 0.2408 0.0826
only CF graph(仅协同图) 0.1852 0.0664
only Semantic graph(仅语义图) 0.1546 0.0547
w/o graph-hard negatives 0.2209 0.0755

多图融合分析:仅用协同图(CF)精度较高但多样性受限;仅用语义图提升新颖性却损害即时相关性。两者融合达成 exploitation 与 exploration 的最优平衡。w/o graph-hard negatives 行 0.2209 对应 4.4 节所述 8.26% 的 Recall 下降。

Table 4:锚点机制消融

Variant Recall@500 NDCG@500
IID-Nav (Full) 0.2408 0.0826
w/o recent ($\mathcal{M}_u$) 0.1388 0.0434
w/o missing-memory ($\mathcal{L}_u$) 0.1898 0.0605
IID-Nav-Random 0.0980 0.0315
IID-Nav-Popular 0.1264 0.0401

标注说明:按 §3.4 定义,"recent"=$\mathcal{L}_u$、"missing-memory"=$\mathcal{M}_u$,表中括号里的符号疑似互换。以正文为准——"去掉 missing-memory 兴趣($\mathcal{M}_u$)使 Recall 下降 21.2%"对应第 3 行 0.1898($0.2408\to0.1898$ 即 −21.2%);去掉 recent 兴趣对应第 2 行 0.1388(约 −42.4%)。

锚点策略分析:IID-Nav (Full) 在所有指标上一致最优,相比 Random 选择与 most-Popular 策略,Recall@500 分别高出 145.7% 与 90.5%($0.2408/0.0980$、$0.2408/0.1264$)。这表明用静态全局 trigger 做起点常导致次优导航——缺乏用户特定的意图定位。此外移除 missing-memory 兴趣($\mathcal{M}_u$)导致 Recall 降 21.2%,证实重新激活历史锚点对缓解"兴趣隧道"、探索局部行为簇之外的区域至关重要;近期交互($\mathcal{L}_u$)与长期记忆兴趣的融合确保导航从高相关意图空间起步。

4.6 效率与线上 A/B(RQ5)

效率基准:得益于个性化锚点带来的目标化搜索,IID-Nav 达到 QPS 910,与高度优化的 EBR 系统(1300)相竞争,且显著高于 TDM(273)与 NANN(384)。

线上 A/B 测试:在大规模短视频平台(ShortVideo-Ind)上做为期一周的 A/B,把 IID-Nav 作为补充召回组件接入。

Table 5:IID-Nav 在不同场景下的线上 A/B 结果

Applications Total App Usage Time Usage Time per User Video Watch Time
KS Single Page(快手单列) +0.334% +0.339% +0.553%
KS Lite Page(快手极速版) +0.400% +0.408% +0.566%

在 Main-App 与 Lite-App 两种界面上,IID-Nav 都一致提升用户参与度:总使用时长 +0.3%~0.4%,视频观看时长提升约 +0.55%(注:正文摘述"up to a 0.26% increase in video watch time"与表中 +0.553%/+0.566% 不一致,此处以 Table 5 为准)。结果验证了有状态图检索在标准与轻量应用设置下的鲁棒性与落地价值。


5. 核心贡献总结

  1. 范式层面:把工业召回从"静态相似度抽取"重构为"有状态、目标驱动的图导航",并提出 IID(间接无限深度)理论——探索深度不该被单次请求延迟预算锁死,而应沿时间维度渐进演化。
  2. 机制层面:三件套——(a) target-aware 判别器主动路由(非双塔,可用交叉特征);(b) 跨请求 Redis state-relay 把上次高价值终端节点接力到本次入口,累积深度;(c) 图硬负采样的轨迹对齐训练抑制 search drift。
  3. 工程层面:双图(Swing 协同图 + 多模态 LLM 语义图)异质环境、去重打分控延迟、$H=2$ + IID 即超越 $H>4$ 固定跳,QPS 910 可工业部署。
  4. 效果层面:亿级工业集 Recall@500 +36.35%、NDCG@500 +36.98%;线上多界面使用时长 +0.3%~0.4%、观看时长 ~+0.55%。

6. 讨论与局限性

值得借鉴的设计:

  • 把"深度"从空间维度解耦到时间维度是本文最漂亮的 insight。传统做法在单请求里堆跳数,被延迟预算硬卡;IID 用一个跨请求的状态缓存把搜索"续上",以近乎零的在线增量代价拿到等效深跳的召回。对任何"单次计算预算受限但用户会反复访问"的检索/推荐场景(信息流、搜索、广告召回)都有迁移价值。
  • 判别器即导航策略:用一个不受双塔约束、可建交叉特征的 target-aware 模型直接给图扩展打分,把"表达力"与"可扩展性"的鸿沟用解耦架构(离线建图 + 在线判别遍历)弥合。
  • graph-hard negatives 对齐在线决策边界:负样本直接从检索图的拓扑近邻里挑,使训练分布与在线多跳真正遇到的"模糊近邻"对齐,这是抑制 search drift 的关键且代价低廉。

局限与争议:

  • NDCG 权衡:在 UserBehavior 上 NDCG 反而低于 Kuaiformer(−3.88%)。作者用"召回阶段重 recall 轻 rank"自洽,但这意味着 IID-Nav 召回的候选池排序质量仍依赖下游排序兜底,在单阶段或召回即排序的场景下未必适用。
  • 跨请求状态的时效与一致性:state-relay 依赖 Redis 缓存 + 过期时间 $\Delta t$,论文未深入讨论缓存失效、用户意图突变(如临时搜索一个无关品类)时旧状态接力是否会"带偏"新请求,以及 $\Delta t$ 的敏感性。这本身是另一种潜在的 drift 来源。
  • 线上收益体量:+0.3%~0.4% 使用时长属于成熟工业系统的常规增量,且 IID-Nav 是补充召回组件而非替换主链路,真实边际贡献需结合其在多路召回中的占比看待。
  • 可复现性:语义图依赖未具名的多模态 LLM 抽特征 + 自训练 Item Tower,$\lambda_0/\lambda_1/\tau$、margin $m(\cdot)$ 的具体取值与码本/图构建细节披露有限;v1 版本篇幅偏短(正文约 8 页 + 仅 23 条参考文献),部分超参与 scaling 细节留白。

与已有工作的差异:相比 NANN/Streaming VQ 等无状态图/量化检索(深度被单请求预算锁死),IID-Nav 的根本区别是引入跨请求有状态探索;相比 TDM 等树结构(拓扑静态、路径预定义),它用动态判别器 + 双图实现实时意图对齐的路由。这条"有状态、判别器导航、跨请求累积深度"的路线,在当前以生成式召回(Semantic ID / RQ-VAE 自回归生成)为主流的工业召回研究中是一条判别式、检索式的差异化路径。