← Back to list
RecGPT

RecGPT: A Foundation Model for Sequential Recommendation

生成式推荐 Tencent
Abstract — │ Reading 7 │ Rating —
2025-06-06
Yangqin Jiang, Xubin Ren, Lianghao Xia, Da Luo, Kangyi Lin, Chao Huang
The University of Hong Kong, Tencent
RecGPT 用 MPNet+FSQ 把 item 文本描述统一量化成 domain-invariant 离散 token,配双向-因果混合注意力和 Trie 约束的 catalog-aware beam search,做成真·零样本跨域序列推荐基础模型,零样本即超对手 few-shot(10%-50% 下游数据)。
评分原因
精读评分:文本驱动统一 tokenization(MPNet+FSQ)+ 双向-因果混合注意力 + Trie 约束解码,做出真零样本跨域序列推荐基础模型,思路完整、消融/scaling 扎实且有工业验证;扣分在于强依赖文本质量、评测只到小 k、部分表述偏 marketing。
semantic-id quantization cross-domain cold-start parameter-scaling transformer pretrained-lm industrial

RecGPT:用文本驱动的统一 tokenization 把序列推荐做成"真零样本"基础模型

HKUDS (HKU) & Tencent,arxiv 2506.06270,代码 github.com/HKUDS/RecGPT。 命名撞车提示:本文 RecGPT 与库里已有的阿里淘宝 RecGPT-V2/V3/RecGPT-Mobile 不是同一系统(后者是 Taobao & Tmall Group 的 LLM 工业推荐器谱系)。同名纯属巧合,二者无技术传承关系,因此 DAG 不连迭代边(详见文末"谱系澄清")。

研究动机

传统 ID-based 推荐(SASRec/BERT4Rec 等)给每个 item 学一个独立 ID embedding,天然被锁死在训练域里:

  • 跨域彻底失效:不同平台(电商商品、视频、新闻)的 item 语义空间、描述格式、属性完全异构,ID 表示无法迁移。
  • 冷启动 / 数据稀疏崩溃:新 item / 新用户没有足够交互历史来学 ID embedding。

作者提出的核心问题:能不能像语言 / 视觉基础模型那样,用大规模预训练造一个具备真·零样本泛化能力的序列推荐基础模型? 要做到这点,必须解决三个障碍:

  1. item 表示的语义异构——需要一个 domain-invariant 的 tokenization 把异构文本描述统一成标准离散 token,同时保住语义丰富度。
  2. item tokenization 的层级依赖——一个 item 被表示成多个 token,模型要同时建模 item 内 token 的语义连贯(micro)和 item 间的序列依赖(macro)。语言里"词→token"是单层的,item tokenization 是双层的。
  3. 解码效率瓶颈——token 组合空间远大于真实 catalog(50k 词表 × 4-token/item ≈ $6.25\times10^{18}$ 理论组合 vs 百万级真实 item),朴素搜索不可行。

Figure 1:RecGPT 的跨域零样本泛化。即便对手 few-shot 用上 10%-50% 下游未见数据,纯零样本的 RecGPT 仍持续领先。

核心方法

RecGPT 把序列推荐重构成自回归 next-item 生成,三个架构组件对应上面三个障碍。

Figure 2:RecGPT 架构总览——(i) Unified Item Tokenization(Sentence Transformer + FSQ 量化)、(ii) Universal Recommendation Modeling(双向-因果混合注意力 + 辅助语义流)、(iii) Efficient Item Token Decoder(Trie 约束的 catalog-aware beam search)。

1. Unified Item Tokenization(统一 item token 化)

把 item 表示完全从文本特征(标题、描述、类目)派生,不用任何 ID:

  • 文本编码器:用 MPNet(融合 MLM + PLM 的排列语言建模,见公式 1)把 item 文本编成 $d_L$ 维语义 embedding $e_i=\mathrm{MPNet}(X_i)$(公式 2)。这一步产出跨域一致、domain-agnostic 的语义表示。
  • FSQ 量化(关键设计):用 Finite Scalar Quantization 把连续 embedding 离散成定长 token 序列 $s_i=s_i^0\cdots s_i^{K-1}$。先把 $d_L$ 维 embedding 切成 $K$ 个子向量,每个子向量经线性降维 $\mathcal{T}_{in}$、sigmoid 归一化、再用带超参 $L$ 的取整 $R[\cdot]$ 映射到 $L$ 个离散整数(公式 3)。把每个子向量再切 $d_{fsq}$ 段,得到 $L^{d_{fsq}}$ 的巨大离散空间,实现近乎无损的语义→离散映射。选 FSQ 而非 VQ-VAE 是因为 FSQ 优雅规避了 codebook collapse。取整不可导用 STE(直通估计) 让梯度穿过(公式 4)。
  • 量化优化:训练时用多层 transformer decoder 从离散 token 重建原 embedding $\hat e_i$,用 $L_1$ 重建损失(对 outlier 更鲁棒、偏好稀疏重建,公式 5)。

这套统一 token 化就是零样本能力的地基:任何新 item 只要有文本描述,就能立刻被 embed 成标准 token,无需重训。

2. Universal Recommendation Modeling(通用推荐建模)

用自回归 transformer 做 next-token 预测,但要解决两个由 tokenization 引入的问题:

  • 混合双向-因果注意力:标准单向因果注意力会阻断同一 item 内 token 之间的信息流。RecGPT 对同一 item 内的 token 用双向注意力(保证 item 表示连贯),对item 之间用因果注意力(保证序列建模的时序因果性)。这个 hybrid 设计直接回应了障碍 2 的双层依赖。
  • 辅助语义特征流(dual-stream):量化不可避免有信息损失,于是把原始连续语义 embedding $E_{aux}$ 和离散 token embedding $E_{wte}$ 两路并行,各自 LayerNorm 后再加位置编码 $E_{wpe}$ 组成最终输入(公式 6)。连续流补回被量化丢掉的语义细节。
  • 训练目标:负对数似然的 next-token 预测(公式 7),用 floor 函数 $\lfloor t/K\rfloor\times K$ 维持 item 边界。双向注意力使得一次前向即可并行预测代表下一个 item 的全部 $K$ 个 token。

3. Efficient Item Token Decoder(高效 item token 解码器)

  • 一次前向出 $K$ 个 token:因为架构能并行预测下一个 item 的全部 $K$ 个 token,直接在这 $K$ 个 token 的联合概率上做 beam search,避免逐 token 迭代生成,大幅降低推理时延和显存。
  • Trie-based catalog-aware search:真实 catalog 只占理论 token 组合空间的极小一部分。把整个 catalog 的 token 词表编成 Trie(前缀树),beam search 每生成一个 token 就沿 Trie 只走能通向合法 item 的分支。两个好处:(1) 不浪费算力在永远无效的 token 序列上;(2) 保证最终推荐一定对应真实 catalog item。

关键实验与收益

评测设置:6 个公开数据集(跨域场景:Amazon 的 Baby/Games/Office;跨平台:Yelp/Washington/Steam),外加 1 个工业新闻平台(163,385 用户、455,372 item、999,140 交互)。核心指标 Hit@k / NDCG@k(k∈{1,3,5})。

跨域零样本(Table 1,主结果)

RecGPT 零样本(下游 0 训练数据) 对比 baseline few-shot(用 10% 目标域数据),仍全面领先(* 表示 p<0.05 显著)。例:

  • Amazon-Baby:Hit@3 0.0281 vs 次优 0.0061(ICLRec/MAERec 量级),NDCG@3 0.0277。
  • Amazon-Games:Hit@3 0.0374、NDCG@3 0.0370,均显著超全部 baseline。
  • Steam:Hit@1 0.1237 vs 次优 0.1022,NDCG@3 0.1242。

结论:统一 FSQ token 化解决语义异构 + 混合注意力捕捉跨域模式,是零样本领先的两大来源。

冷启动(Table 2)

把用户序列随机截断到只剩 1-3 个 item 模拟冷启动。RecGPT 在 Baby/Office/Yelp 上多数指标 best/second-best 且显著,说明基础模型的预训练知识能从极少用户行为里识别通用偏好模式,绕开 ID-based 方法必须的域内大数据。

工业验证(Figure 3)

在千万级日活的生产新闻平台做零样本对比,Hit@5 与 NDCG@5 均显著高于 Bert4Rec/FDSA/CL4SRec/DuoRec/MAERec/S³-Rec。离线特征生成流水线 + 定时 embedding 更新(含冷启动 item),验证了满足工业时延/吞吐/可靠性要求。

消融(Table 3)

四个变体证明每个组件都必要(以 Baby Hit@5=0.0283 为满配):

变体 说明 Baby Hit@5
w/o FSQ 随机 token 替代 FSQ 语义 token 0.0178(跌最狠)
w/o Bidir 去掉 item 内双向注意力 0.0279
w/o Aux 去掉辅助连续语义流 0.0191
w/o Pref 去掉 Trie 前缀约束 0.0282
RecGPT 满配 0.0283

w/o FSQ 崩得最厉害→统一语义 token 化是跨域泛化的基石;w/o Aux 明显掉→dual-stream 连续特征有效补偿量化损失。

Scaling law(Figure 4 & 5)

  • 用 5/10/25/50/100% 训练数据训 5 个变体:零样本性能随数据量单调增强,10%→25% 有一个不成比例的跃升,暗示存在"涌现"数据阈值。
  • 评估 loss 对 token 数呈可预测的幂律 scaling(拟合曲线能准确外推满配性能),说明推荐基础模型也遵循 LLM 式 scaling law。实践启示:扩数据比扩模型更划算(后者抬高推理成本)。

对比预训练序列推荐器(Figure 6 & 7)

对比 S³-Rec / UniSRec / VQ-Rec / TIGER / RecFormer / IDGenRec,RecGPT 全面领先。VQ-Rec 次优。RecGPT 优势三来源:(1) decoder-only 架构契合 scaling law、(2) 预训练数据量大得多(1000 万序列 vs UniSRec/VQ-Rec 的 100 万、RecFormer 的 300 万)、(3) 自回归目标更好捕捉序列依赖。受控实验(Figure 7):RecGPT-10%(同等训练数据、缩参)仍胜原版 VQ-Rec,而 VQ-Rec (Re-trained)(用更多数据)反而退化——证明优势来自架构而非单纯数据规模。

局限

  • 强依赖 item 文本描述质量:文本缺失/低质的域(纯 ID 场景、隐私受限)无法直接受益。
  • FSQ 量化仍有信息损失,靠辅助连续流缓解但未根除。
  • 实验以 Hit/NDCG@小 k(1/3/5)为主,缺大 k 召回与多样性/新颖性等维度的评估。
  • 工业验证只在一个新闻平台,跨行业工业泛化尚未充分展开。

谱系澄清(DAG 连边决策)

库里已有的 RecGPT-V2 / RecGPT-V3 / RecGPT-Mobile 均来自 阿里 Taobao & Tmall Group 的 LLM 工业推荐器 RecGPT 谱系(V3 用 Qwen3-14B + RQ-VAE SID + Memory Hub;Mobile 把 Qwen3-0.6B 下沉端侧)。本文 RecGPT 是 HKU+Tencent 的学术基础模型(MPNet+FSQ+AR transformer),两者仅同名、无技术传承与版本迭代关系。

按 CLAUDE.md / 精读规范"别硬造边、别过度分析",本次不连 RecGPT → RecGPT-V2/V3 迭代边(那会是虚假谱系)。DAG 仅补全本文 RecGPT stub 节点的元数据(category/paper_title/description)。若日后要区分两个 RecGPT,建议后续给本文节点改名(如 RecGPT-HKU),此处按 stub 已有名称保持不动。