← Back to list
T-RoPE

T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation

生成式推荐 Shopify
Abstract 8 │ Reading 6 │ Rating —
2026-09-24
Yang Liu, Noel Loo, Ali Khanafer, Shuying Sun, Akshay Soni, Zhong Wu, Linjun Yang
Shopify, Massachusetts Institute of Technology, Liquid AI
T-RoPE 把 RoPE 的旋转坐标从交互索引换成绝对 Unix 时间戳,配几何间隔频率库(10^2~10^8 秒)与逐维可学习 q/k 系数、query 旋转到下一事件时间(推理时用当前时间)、key 施加转置旋转使相位依赖 t_q+t_k 以打破时间平移不变性;在 HSTU+Time RAB 骨干上五个公开数据集全指标最优(+1%~+28%),60 亿交互 Shop 数据 +13%~+82%,Shop app 线上 CVR +0.33%(p=0.037),但主要增益来自多尺度时间戳旋转本身,非平稳 key 等独有部件贡献有限且缺外部时间 RoPE 对照。
评分原因
摘要评分:生成式推荐骨干的具体新组件:用时间戳角度、可学习时间系数、多尺度频率组与非平稳 key 旋转替换按序号旋转的 RoPE,并证明时间戳版 RoPE 仍具时间平移不变性;摘要自带 60 亿交互工业数据集相对 HSTU+Time RAB 的大幅提升与 Shop app 线上 A/B(CVR +0.33%、订单 +0.63%),消融归因清楚,与 ClockRoPE(8 分)同档。
精读评分:时间做进 RoPE 几何在已有 Time RAB 的骨干上仍有真实增益(Shop NDCG@50 +66%),且有 Shop app 干净对照的 A/B(CVR +0.33%, p=0.037);但大头收益来自已有思路(多尺度时间戳 RoPE,行3已+49%),本文独有部件仅 +2%~11%,非平稳 key 在独立系数下只是 α_k 的符号重参数化、定理是一行推论;无索引 RoPE 对照、TO-RoPE baseline 反常(PixelRec 低于 Time RAB 42-45%)、摘要把相对 TO-RoPE 的 78-130% 说成相对最强 baseline、单 seed 无方差、规模描述前后矛盾,较 ClockRoPE 理论与严谨度都弱,给 6。
transformer industrial

T-RoPE:让旋转位置编码按"事件何时发生"而不是"排第几个"来旋转

Shopify / MIT / Liquid AI · arXiv 2609.30576(v1,2026-09-24)

研究动机与背景

大规模推荐系统正在照搬大语言模型的"序列生成式"配方:把用户行为表示为动作序列,自回归地预测下一个 item、动作或语义 ID(TIGER、LETTER、HLLM、ActionPiece、OneRec 系列、GR2 等),HSTU 已在工业负载上驱动线上推荐。论文认为这种迁移"有效但不完美"——为文本设计的归纳偏置未必适合推荐,其中最典型的就是 RoPE(Rotary Position Embedding)。

RoPE 按整数位置索引旋转 query 与 key。对文本来说这是天然坐标,因为 token 偏移承载了注意力所需的大部分结构;但对推荐而言,交互索引只记录"谁先谁后",完全不说明间隔是几秒、几周还是几个季节。论文把这个"位置编码缺口"拆成三类未被表示的时间信号:

  1. 真实时间间隔被抹掉:一个六个月前的 key 与昨天的 key,只要序列偏移相同,在位置上就完全相同;
  2. 多尺度周期性缺失:用户行为含小时、周、月、季节等多种节律,但基于索引的 RoPE 没有任何"挂钟频率"结构;
  3. 绝对日历相位不可达:索引注意力只依赖相对偏移 $m-n$,因此是时间平移不变(time-translation invariant)的——同一段历史放在季节周期的不同位置上,会得到完全相同的注意力模式。

已有时间感知方法只补上了一部分(论文 Table 1):

Table 1:各位置编码方法显式提供的时间机制

方法 Timestamp Learnable Multiscale Shifted Non-stationary
Standard RoPE (Su et al., 2024) × × × × ×
TiSASRec (Li et al., 2020) Partial × × × ×
TO-RoPE (Wei et al., 2025) ✓ Partial ✓ × ×
T-RoPE (ours) ✓ ✓ ✓ ✓ ✓

(Multiscale 指显式覆盖多个周期的连续频率库;Learnable 指编码内部的可学习时间系数,而非泛指模型参数;Partial 指有限或间接地具备该性质。)

  • TiSASRec 把离散化的时间间隔作为自注意力的加性偏置,只捕捉 recency,没有连续多尺度周期与日历相位;
  • HSTU 的 time-based RAB(Relative Attention Bias)把分桶的时间差映射成可学习标量加到注意力 logits 上,能锐化 recency 权重,但不触碰 query/key 的几何,且仍然离散化时间;
  • TO-RoPE(Time-and-Order RoPE)把时间戳放进 RoPE 旋转角,但其 query 与 key 的联合几何仍是时间平移不变的——能捕捉时间距离,却无法区分"同一段历史在不同日历相位下被查询"。

论文的核心立场是:时间不能只是作为额外特征或偏置"坐在 RoPE 旁边",必须从结构上改变 RoPE 旋转 query 与 key 的方式。据此提出 T-RoPE(Time-aware RoPE),保留 RoPE 的高效接口,但用五个部件替换"仅按索引旋转":时间戳旋转角、可学习时间系数、多尺度频率库、shifted query 对齐、非平稳(non-stationary)key 旋转。

论文列出的四项贡献:

  1. 面向生成式推荐的时间感知 RoPE,在单一旋转编码内表示经过时间、多尺度周期与日历相位;
  2. 理论分析:证明 query 与 key 用同一时间戳函数旋转会得到时间平移不变的注意力(覆盖"时间戳上的标准 RoPE"与 TO-RoPE 的时间戳分量),而 T-RoPE 的非平稳 key 可证明地打破这种不变性;
  3. 五个公开 benchmark + 超过 60 亿交互的工业数据集 + Shop app 线上 A/B;
  4. 前向/反向算法与代价分析,额外开销对序列长度与 head 维度线性。

预备知识:RoPE 的相对位置性质

生成式推荐的输入是用户按时间排序的带时间戳事件序列 $\{(i_1,t_1),\ldots,(i_L,t_L)\}$,$t_1<t_2<\cdots<t_L$,其中 $i_m$ 为 item,$t_m\in\mathbb{R}_{>0}$ 为以秒计的 Unix 时间戳(也可带交互类型或语义 ID)。模型自回归地预测下一个事件,论文取预测目标为下一个 item $i_{L+1}$。

Transformer 编码器把每个 item $i_m$ 映射成 $q_m,k_m,v_m\in\mathbb{R}^D$。标准 RoPE 作用在 $D/2$ 个二维旋转平面上,平面 $d\in\{1,\ldots,D/2\}$ 中的切片 $[q_{m,2d-1},q_{m,2d}]^\top$ 乘以旋转矩阵

$$R(\phi_m)=\begin{bmatrix}\cos\phi_m & -\sin\phi_m\\ \sin\phi_m & \cos\phi_m\end{bmatrix} \tag{1}$$

旋转后 query 与 key 在平面 $d$ 上的点积为

$$(q'_{m,d})^\top k'_{n,d}=(q_{m,d})^\top R(\phi_n-\phi_m)\,k_{n,d} \tag{2}$$

它只依赖角度差 $\phi_n-\phi_m$。整数索引下 $\phi_m=m\theta_d$($\theta_d$ 为平面 $d$ 的固定角频率),于是角度差变成 $(n-m)\theta_d$,点积只依赖相对偏移 $n-m$。这就是后文"平移不变性"的根源。

核心方法:T-RoPE 的五个部件

T-RoPE 保持 RoPE 的计算接口,但改变旋转的"含义":把用户历史看作带时间戳的事件序列,而非类文本列表。五个部件依次叠加。

Figure 1: T-RoPE 旋转的几何直觉。a) Index RoPE 把事件放在均匀的序列位置上,隐藏了经过的时间;b) Timestamp RoPE 使用事件时间,突发事件聚集、休眠间隔在旋转圆上被拉开;c) Shifted query 把每个 query 放在下一事件时间戳上(标记与 key 错开),使训练与推理时的几何一致

3.1 时间戳旋转(Timestamp-based rotation)

相邻序列位置在时间上并不等距:相邻两个事件可能相隔几秒、几天或几个月,但索引 $m$ 把每个间隔都当成"一个位置"(Figure 1a)。T-RoPE 因此用绝对 Unix 时间戳 $t_m$(秒)替换整数索引,且在旋转前不做中心化或归一化。如 Figure 1b 所示,序号相邻但时间相隔很远的事件不再占据相邻相位,突发(bursty)事件则仍聚在一起。对维度 $d$,角度为 $\phi_{m,d}=t_m/\beta_d$,$\beta_d$ 为基础时间频率。于是两事件的相对相位变成真实时间差的函数:

$$(q'_{m,d})^\top k'_{n,d}\propto\cos\left(\frac{t_n-t_m}{\beta_d}\right) \tag{3}$$

因此即便在截断历史中相邻,只要 $|t_n-t_m|$ 很大,注意力也会减弱。

3.2 可学习时间系数(Learnable temporal coefficients)

并非所有时间尺度同等重要:主导周期因领域而异、在同一模型的不同层之间也不同——杂货购买可能遵循 7 天或 30 天周期,时尚需求可能是季节性的,市场活动可能跟随发薪日或促销间隔。T-RoPE 学习每个周期的强度而非固定它,为 query 与 key 分别引入可学习系数 $\alpha^q_d,\alpha^k_d\in\mathbb{R}$:

$$\phi^q_{m,d}=\alpha^q_d\cdot\frac{t_m}{\beta_d},\qquad \phi^k_{n,d}=\alpha^k_d\cdot\frac{t_n}{\beta_d} \tag{4}$$

独立的 query/key 系数本可允许非对称特化,但论文实际观察到相反的现象:多数维度上学到的 query 与 key 系数在符号和幅度上都对齐(Figure 3a),即两者强调相同的时间频带。但这种对齐不跨层:Figure 2a 中每层系数的 RMS 幅度差异很大,Figure 2b 中同一序列上的时间注意力在所选层之间明显变化——每层学习自己的时间敏感度,而非共享一个偏置。

Figure 2: T-RoPE 的逐层可视化。a) 每层学到的 query 系数的 RMS 幅度,高亮所选层;b) 所选层在合成事件序列上的时间 RoPE 注意力分量。RMS 越大对应越强的时间调制

3.3 多尺度频率库(Multiscale frequency bank)

单一基础频率只能分辨一个时间尺度,而用户行为跨越分钟级浏览会话、周/月级家庭采购到年级季节需求。T-RoPE 用几何间隔为每个旋转平面分配不同的基础频率:

$$\beta_d=\exp\left(\log\beta_{\min}+\frac{d-1}{D/2-1}\left(\log\beta_{\max}-\log\beta_{\min}\right)\right),\quad d=1,\ldots,D/2 \tag{5}$$

其中 $\beta_{\min},\beta_{\max}$ 为超参数(默认 $10^2$ 与 $10^8$ 秒),得到从 $10^{-2}$ 到 $10^{-8}$ rad/s 的对数频率库。频率库固定了可用频率,可学习系数决定每个频率的贡献强度。Figure 3a 显示在单层内训练只上调少数频带而非均匀加权所有频率;Figure 3b 显示不同频率锁定不同的用户周期(30 天、90 天、年度维度与重复周期对齐)。论文据此称:学到的系数调整多尺度频率库,使时间戳编码无需显式编码"圣诞节"这类具名日历事件也能表示周期模式。

Figure 3: 多粒度时间编码。a) 学到的 query/key 时间系数随频率维度的分布,阴影按时间周期分组(从小时以下到多年);训练只上调选定的时间频带。b) 这些频带的代表性共振曲线:短周期维度快速振荡,30 天、90 天、年度维度与重复的用户周期对齐

值得注意的一个细节(来自 Figure 3a 的纵轴):训练后的系数量级只有约 $0.005$–$0.023$,而附录 B.1 称系数从 $\mathcal{N}(0,1)$ 初始化。这意味着有效角频率 $\omega_d=\alpha_d/\beta_d$ 比 $1/\beta_d$ 小 50–200 倍,图中按 $\beta_d$ 标注的"<1h""1h~1d"等频带,其实际有效周期要长得多(例如 $\beta=100$ s、$\alpha\approx0.012$ 时有效周期 $2\pi\beta/\alpha\approx 14.5$ 小时)。论文没有讨论这一点。

3.4 Shifted query 对齐(Shifted query alignment)

到目前为止旋转编码的是"历史事件何时发生",而不是"被预测的事件何时发生"。由于位置 $m$ 被监督去预测 $t_{m+1}$ 时刻的事件(部署模型在推理时拿到当前时间 $t_{\text{now}}$),论文借鉴 HSTU 的 RAB 做法,把 query 旋转到目标时间而非历史时间:位置 $m$ 的 query 使用 $t_{m+1}$,key 保留各自的时间戳:

$$\phi^q_{m,d}=\alpha^q_d\frac{t_{m+1}}{\beta_d},\qquad \phi^k_{n,d}=\alpha^k_d\frac{t_n}{\beta_d} \tag{6}$$

实现上就是时间戳角度张量沿序列维做一步平移。训练时最后一个位置保留自己的时间戳(它只作为 label 使用);推理时最后一个 query 槽接收当前会话时间 $t_{\text{now}}$,于是同一段 item 历史可以在不同"预测季节"下被评估(如节日季 vs 日常补货),无需改架构。

Figure 4: Shifted query 对齐。a) 训练时位置 m 的 query 使用下一事件时间戳 t_{m+1},key 保留历史时间戳 t_m;最后一个槽只用作 label。b) 推理时最后一个 query 槽被赋予当前会话时间 t_now,注入不同的当前时间会改变 query 的时间相位而不改变 item 历史

3.5 非平稳 key 编码(Non-stationary key encoding)

前四个部件给了 RoPE 真实时间戳、多尺度和预测时刻的 query,但保留了标准 RoPE 的一个对称性:因为 query 与 key 以相同方式旋转,点积只依赖角度差 $\phi^q_m-\phi^k_n=(t_{m+1}-t_n)/\beta_d$(在共享系数时),常数时间平移不改变它——模型能知道"某 item 发生在 query 之前 7 天",却不知道"query 落在日历周期的哪个位置"。

T-RoPE 对 key 施加标准旋转矩阵的转置:对平面 $d$ 与 key 时间戳 $t_n$,$k'_{n,d}=R(-\phi^k_{n,d})k_{n,d}=R(\phi^k_{n,d})^\top k_{n,d}$。由于二维旋转满足 $R(-\phi)=R(\phi)^\top$,这保留了相同的保范旋转原语,但改变了注意力内部的相位关系:

$$(q'_{m,d})^\top k'_{n,d}=q^\top_{m,d}R(-\phi^q_{m,d})R(-\phi^k_{n,d})\,k_{n,d}=q^\top_{m,d}R\left(-(\phi^q_{m,d}+\phi^k_{n,d})\right)k_{n,d} \tag{7}$$

角度现在依赖和 $(t_{m+1}+t_n)/\beta_d$ 而非差,因此同一段历史落在不同日历区间时注意力会改变。

3.6 完整 T-RoPE 公式

组合全部部件,每个 head 获得时间戳感知、多尺度、预测时刻对齐、非平稳的旋转:

$$q'_m=\bigoplus_{d=1}^{D/2}R(\phi^q_{m,d})\,q_{m,d},\qquad k'_n=\bigoplus_{d=1}^{D/2}R(-\phi^k_{n,d})\,k_{n,d} \tag{8}$$

其中 $\bigoplus$ 表示跨平面拼接,注意力分数为

$$a_{mn}=\sum_{d=1}^{D/2}q^\top_{m,d}\,R\!\left(-\frac{\alpha^q_d t_{m+1}+\alpha^k_d t_n}{\beta_d}\right)k_{n,d} \tag{9}$$

即预测时间戳 $t_{m+1}$ 与历史时间戳 $t_n$ 在所有平面上的可学习线性组合,论文称这使 T-RoPE 同时表示局部 recency 与重复的时间结构。

理论分析

论文要孤立的性质是:当同一段相对历史被整体搬到另一个日历时间时,注意力分数能否改变——只看时间差的模型能学 recency,但无法区分处于同一年周期不同相位的两个 query。

定义 1(时间平移不变性):若对所有固定的 item 向量 $q,k$ 与所有常数偏移 $c\in\mathbb{R}$,有 $\mathrm{Attn}(q,k;t_{m+1},t_n)=\mathrm{Attn}(q,k;t_{m+1}+c,t_n+c)$,则称该位置编码时间平移不变。

定理 1(共享系数的时间戳 RoPE 是时间平移不变的):设 RoPE 使用任意固定基础频率 $\{\beta_d\}$ 与任意可学习共享系数 $\alpha_d=\alpha^q_d=\alpha^k_d$,角度为 $\phi^q_{m,d}=\alpha_d t_{m+1}/\beta_d$、$\phi^k_{n,d}=\alpha_d t_n/\beta_d$,key 使用标准旋转 $k'_{n,d}=R(\phi^k_{n,d})k_{n,d}$,则 $\mathrm{Attn}(q,k;t_{m+1},t_n)$ 只依赖 $t_{m+1}-t_n$。

证明(附录 A.1):

$$(q'_{m,d})^\top k'_{n,d}=q^\top_{m,d}R(\phi^k_{n,d}-\phi^q_{m,d})\,k_{n,d}=q^\top_{m,d}R\!\left(\frac{\alpha_d(t_n-t_{m+1})}{\beta_d}\right)k_{n,d} \tag{10}$$

只依赖 $t_n-t_{m+1}$,跨平面、跨 head 求和保持不变性。若标准 key 旋转使用独立系数,相位为 $(\alpha^k_d t_n-\alpha^q_d t_{m+1})/\beta_d$,全局平移 $c$ 使相位改变 $(\alpha^k_d-\alpha^q_d)c/\beta_d$——所以这个标准 RoPE 家族只在 $\alpha^q_d=\alpha^k_d$ 的活跃平面上不变,符号相反的非零系数依赖时间戳之和,并非平移不变。

Remark 1(独立的标准 RoPE 系数):同样的相位分析表明,不相等的系数也能打破对称性,所以定理条件不是唯一途径;论文的主张仅是"非平稳 key 是一种 RoPE 兼容的、直接打破不变性的充分机制"。

Remark 2(与 TO-RoPE 的关系):TO-RoPE 的时间戳分量在 query/key 之间共享一个系数,只依赖 $\tau_m-\tau_n$,因此时间平移不变,单靠它无法表示季节偏移。

定理 2(带非平稳 key 的 T-RoPE 具有绝对时间敏感性):T-RoPE 下 (9) 式每个平面的被加项旋转角为 $-(\alpha^q_d t_{m+1}+\alpha^k_d t_n)/\beta_d$。若训练所得模型对某维 $d$ 满足 $\alpha^q_d+\alpha^k_d\neq0$,则 T-RoPE 不是时间平移不变的:对任意满足 $(\alpha^q_d+\alpha^k_d)c/\beta_d\notin2\pi\mathbb{Z}$ 的平移 $c$,存在时间戳与 query/key 使 $\mathrm{Attn}(t_{m+1},t_n)\neq\mathrm{Attn}(t_{m+1}+c,t_n+c)$。

证明(附录 A.2)利用旋转群性质 $R(a)R(b)=R(a+b)$:

$$(q'_{m,d})^\top k'_{n,d}=\left(R(\phi^q_{m,d})q_{m,d}\right)^\top R(-\phi^k_{n,d})k_{n,d}=q^\top_{m,d}R(-\phi^q_{m,d}-\phi^k_{n,d})\,k_{n,d} \tag{11}$$

平移后角度改变 $(\alpha^q_d+\alpha^k_d)c/\beta_d$;两个不同的旋转矩阵定义不同的双线性型,故存在非退化向量使点积改变,构成对"普遍相等"的反例。

Remark 3(可学习的退化与时间尺度选择):条件 $\alpha^q_d+\alpha^k_d\neq0$ 确实必要。若训练收敛到对所有 $d$ 都 $\alpha^q_d=-\alpha^k_d$,T-RoPE 退化为平移不变情形。论文认为这不纯是失败模式:逐维可学习系数让模型选择哪些时间尺度保持平稳、哪些对绝对时间敏感;在其部署模型中未出现退化,学到的系数诱导了可见的层相关时间偏置(Figure 2)。

推论 1(季节性可表示性):设周期 $P>0$(如 365 天),定义有效 query 角频率 $\omega^q_d=\alpha^q_d/\beta_d$。若存在维度 $d$ 与非零整数谐波 $r$ 使 $\omega^q_d=2\pi r/P$,则 T-RoPE 能表示对预测时刻日历相位的周期为 $P$ 的正弦依赖。证明(附录 A.3)把单维注意力展开为

$$f_d=(q_1k_1+q_2k_2)\cos\!\left(\frac{\alpha^q_dt_{m+1}+\alpha^k_dt_n}{\beta_d}\right)+(q_2k_1-q_1k_2)\sin\!\left(\frac{\alpha^q_dt_{m+1}+\alpha^k_dt_n}{\beta_d}\right) \tag{12}$$

固定 $t_n$ 时 key 项只是常数相位偏移,当 $\omega^q_d=2\pi r/P$ 时正余弦项都关于 $t_{m+1}$ 以 $P$ 为周期。

实现细节与计算代价

前向与反向算法(附录 B.1)

每层维护几何频率库 $\beta\in\mathbb{R}^{D/2}$ 和两个可训练系数向量 $\alpha^q,\alpha^k\in\mathbb{R}^{D/2}$,默认 $\beta_{\min}=10^2$ s、$\beta_{\max}=10^8$ s,系数从 $\mathcal{N}(0,\sigma^2)$、$\sigma=1.0$ 独立初始化。

Algorithm 1(T-RoPE 前向),输入 $Q,K\in\mathbb{R}^{B\times L\times H\times D}$、时间戳 $t\in\mathbb{R}^{B\times L}$、系数 $\alpha^q,\alpha^k\in\mathbb{R}^{D/2}$:

  1. $\beta\leftarrow\mathrm{geomspace}(10^2,10^8,D/2)$
  2. $\Phi^q\leftarrow\mathrm{FP32}(\alpha^q)\cdot t/\beta$(广播)
  3. $\Phi^q\leftarrow\mathrm{RollLeft}(\Phi^q,\text{dim}=1)$(shifted query)
  4. $\Phi^q[:,L,:]\leftarrow\mathrm{FP32}(\alpha^q)\cdot t[:,L]/\beta$(最后一个 query 保留自己的时间戳)
  5. $\Phi^k\leftarrow\mathrm{FP32}(\alpha^k)\cdot t/\beta$
  6. $Q'\leftarrow\mathrm{ApplyRotFromTheta}(Q,\Phi^q,\text{standard})$
  7. $K'\leftarrow\mathrm{ApplyRotFromTheta}(K,\Phi^k,\text{nonstationary})$

Algorithm 2(ApplyRotFromTheta):$C\leftarrow\cos\Phi$,$S\leftarrow\sin\Phi$,把 rotary 维切成平面 $(x_0,x_1)$;standard 时 $y_0=x_0C-x_1S,\ y_1=x_0S+x_1C$;nonstationary 时 $y_0=x_0C+x_1S,\ y_1=-x_0S+x_1C$;非 rotary 尾部维度原样保留。非平稳旋转与标准旋转算术量相同,只是符号不同。

Algorithm 3(可学习角度的反向):standard 时 $dx_0=g_0C+g_1S$,$dx_1=-g_0S+g_1C$,$d\Phi=g_0(-x_0S-x_1C)+g_1(x_0C-x_1S)$;nonstationary 时 $dx_0=g_0C-g_1S$,$dx_1=g_0S+g_1C$,$d\Phi=g_0(-x_0S+x_1C)+g_1(-x_1S-x_0C)$;最后 $d\Phi$ 跨 head 求和。固定 RoPE 的反向只需 $dX$(对上游梯度施加共轭旋转),T-RoPE 还要返回 $d\Phi$,这是与原始 RoPE 的主要计算差异。系数梯度为

$$\frac{\partial\mathcal{L}}{\partial\alpha^q_d}=\sum_{b,l}\frac{\partial\mathcal{L}}{\partial\Phi^q_{b,l,d}}\frac{t^q_{b,l}}{\beta_d},\qquad \frac{\partial\mathcal{L}}{\partial\alpha^k_d}=\sum_{b,l}\frac{\partial\mathcal{L}}{\partial\Phi^k_{b,l,d}}\frac{t_{b,l}}{\beta_d} \tag{13}$$

其中 $l<L$ 时 $t^q_{b,l}=t_{b,l+1}$,$t^q_{b,L}=t_{b,L}$。因为 $t$ 是以秒计的 Unix 时间戳(量级 $10^9$),梯度通常很大,必须裁剪或重缩放才能稳定训练。同理,由于时间戳量级约 $10^9$,即使外围模型用 BF16,$\Phi^q,\Phi^k$ 也必须用 FP32 计算,三角函数算完后再转回模型精度。

参数与 FLOP 开销(附录 B.2)

记 $N=BL$,$H$ 为 head 数,$D$ 为每 head 维度,$P=D/2$ 为旋转平面数,$M$ 为使用 T-RoPE 的层数。每个 T-RoPE 模块有独立的 query/key 系数,增加 $2P=D$ 个参数,全模型增加 $MD$ 个;论文 HSTU 实验中($M=2$,$D=128$)仅 256 个额外参数。

操作 算术 FLOPs 超越函数
构造 $\Phi^q,\Phi^k$ $4NP$ –
旋转 $Q,K$ $12NHP$ $2NP$ 个 sin 与 $2NP$ 个 cos
固定 RoPE 反向 $dQ,dK$ $12NHP$ $2NP$ 个 sin 与 $2NP$ 个 cos
额外的可学习角度 $d\Phi$ $18NHP+2NP(H-1)$ –
系数梯度 $\approx4NP$ –

相对于带预计算旋转缓存的原始 RoPE,T-RoPE 前向多出构造时间戳角度的 $4NP$ FLOPs,外加在线计算 sin/cos 的开销;训练时额外开销是 $d\Phi$ 的计算与归约及系数梯度链。这些项都对序列长度与 head 维度线性,而自注意力本身仍是二次的。

静态吞吐(附录 B.3,Table 5)

数据集 模型 训练 it/s 验证 it/s
Pixel1M Baseline HSTU 17.58 ± 0.01 58.59 ± 0.87
Pixel1M HSTU + TO-RoPE 16.84 ± 0.05 57.33 ± 0.74
Pixel1M HSTU + T-RoPE 16.95 ± 0.01 57.06 ± 0.44
Shop Baseline HSTU 37.19 ± 0.20 92.66 ± 0.69
Shop HSTU + TO-RoPE 32.17 ± 0.35 82.62 ± 0.92
Shop HSTU + T-RoPE 32.91 ± 0.05 86.05 ± 0.71

分析:论文称开销"modest"且与 TO-RoPE 相当。按表中数字计算,Pixel1M 上训练吞吐下降约 3.6%,而 Shop 上训练吞吐下降约 11.5%(37.19→32.91)、验证下降约 7.1%——"线性开销"在理论上成立,但在工业配置下实测并非可忽略。另一个值得注意的点:Shop 上报告了 TO-RoPE 的吞吐,却没有报告 TO-RoPE 在 Shop 上的精度(见后文)。

实验设置

公开数据集(附录 C,Table 6)

数据集 #User #Item #Interaction
ML-20M 138,493 26,744 20,000,263
Amazon Books 776,370 495,063 9,488,297
Pixel200K 200,000 96,282 3,965,656
Pixel1M 1,001,822 100,541 19,886,579
Pixel8M 8,886,078 407,082 158,488,682

Baseline

  • SASRec(无时间编码);
  • TiSASRec(时间间隔注意力偏置);
  • HSTU(仅位置 RAB);
  • HSTU + Time RAB(时间 + 位置 RAB);
  • HSTU + TO-RoPE(Time+Pos RAB + TO-RoPE);
  • HSTU + T-RoPE(本文)(Time+Pos RAB + T-RoPE)。

所有方法在同一 PyTorch 训练框架中实现,共享相同的 item-ID 输入、预处理过滤、最大序列长度、leave-one-out 协议、候选评估流程与训练超参数。指标:HR@10、HR@50、NDCG@10、NDCG@50、MRR。

超参数(附录 D,Table 7)

方法 d H A RAB Bkts RoPE
SASRec 512 4 — — — —
TiSASRec 512 4 — — — —
HSTU 512 4 128 Pos — —
HSTU+Time RAB 512 4 128 T+P 128 —
HSTU+TO-RoPE 512 4 128 T+P 128 TO-RoPE
HSTU+T-RoPE 512 4 128 T+P 128 T-RoPE

所有模型 2 个 Transformer block、128 个 in-batch 负样本;AdamW,学习率 $10^{-3}$,betas (0.9, 0.98),weight decay 0.001,batch size 128,seed 42,所有 dropout 0.2;训练 10–100 epoch,按验证 HR@10 做 ReduceLROnPlateau;损失为 SampledSoftmaxLoss(128 个采样负例,温度 0.05);最大序列长度 ML-20M 为 200,其余为 50;全部在单张 H100 上跑。

注意:baseline 里没有"HSTU + 标准索引 RoPE"——所有 HSTU 变体都不带 RoPE。这意味着论文标题里"替换为文本设计的 RoPE"这一对照,在实验中其实并不存在。

工业数据集 Shop

Shopify 内部电商数据集,约 1.5 亿用户、480 万 item、超过 60 亿交互,跨多年。模型:128 维 embedding、12 个 HSTU block、8 个注意力头、每头 32 维注意力、最大序列长度 512。采用一天的时间留出(在留出日之前的交互上训练,留出日所有有意义的交互都算正例),因用户可能有多个相关交互,报告 Recall@K 而非 HR@K。

主要实验结果:公开 benchmark

Table 2:序列推荐结果(%)。括号内为 T-RoPE 相对第二名的提升。

数据集 指标 SASRec TiSASRec HSTU HSTU+Time RAB HSTU+TO-RoPE HSTU+T-RoPE
ML-20M HR@10 31.36 31.97 30.87 32.05 31.19 32.37 (+1.0%)
HR@50 56.87 57.50 56.19 58.01 56.69 58.55 (+0.9%)
NDCG@10 18.04 18.38 17.84 18.47 17.93 18.62 (+0.8%)
NDCG@50 23.68 24.04 23.44 24.20 23.57 24.42 (+0.9%)
MRR 15.42 15.68 15.31 15.79 15.32 15.91 (+0.8%)
Amazon Books HR@10 2.97 3.19 5.88 6.89 6.69 7.65 (+11.0%)
HR@50 7.26 7.66 12.40 14.27 13.30 15.45 (+8.3%)
NDCG@10 1.57 1.71 3.33 3.93 3.96 4.40 (+11.1%)
NDCG@50 2.50 2.68 4.75 5.54 5.40 6.11 (+10.3%)
MRR 1.41 1.53 2.94 3.46 3.51 3.87 (+10.3%)
Pixel200K HR@10 4.72 4.65 4.22 7.21 4.16 7.41 (+2.8%)
HR@50 10.85 10.86 10.26 16.82 10.09 17.37 (+3.3%)
NDCG@10 2.65 2.61 2.33 4.08 2.30 4.15 (+1.7%)
NDCG@50 3.98 3.93 3.63 6.14 3.58 6.30 (+2.6%)
MRR 2.39 2.35 2.12 3.70 2.11 3.76 (+1.6%)
Pixel1M HR@10 7.12 7.16 6.89 12.46 6.81 13.35 (+7.1%)
HR@50 15.62 15.77 15.31 26.16 15.14 27.44 (+4.9%)
NDCG@10 4.04 4.05 3.88 7.22 3.83 7.81 (+8.2%)
NDCG@50 5.88 5.92 5.70 10.19 5.64 10.88 (+6.8%)
MRR 3.61 3.62 3.46 6.42 3.43 6.95 (+8.3%)
Pixel8M HR@10 4.89 4.96 5.01 9.14 4.99 11.47 (+25.5%)
HR@50 10.69 10.82 10.93 18.87 10.86 23.02 (+22.0%)
NDCG@10 2.75 2.79 2.82 5.36 2.82 6.85 (+27.8%)
NDCG@50 4.00 4.06 4.11 7.47 4.09 9.35 (+25.2%)
MRR 2.44 2.48 2.51 4.78 2.50 6.11 (+27.8%)

论文的解读:HSTU + T-RoPE 在所有数据集的所有 5 个指标上最优,且提升随数据中时间结构的多少而变化——在历史较规律的稠密 ML-20M 上提升温和但一致(约 +1%);在稀疏/商业数据上更明显:Amazon Books 上相对 HSTU + Time RAB 各指标 +8–12%,PixelRec 各切分上相对 TO-RoPE HR@10 +78–130%、HR@50 +72–112%。论文把最大差距归因于"绝对日历相位在稀疏与商业数据上携带最多信号"。

需要校正的几点:

  1. 摘要的措辞有误。摘要写"improving over the strongest baseline by 78–130% in HR@10 on the sparse PixelRec data",但 PixelRec 上最强 baseline 是 HSTU + Time RAB,不是 TO-RoPE。T-RoPE 相对最强 baseline 的 HR@10 提升在 Pixel200K / Pixel1M / Pixel8M 上分别只有 +2.8% / +7.1% / +25.5%;78–130% 是相对 TO-RoPE 的数字,正文表述是对的,摘要把它挂在了"strongest baseline"上。
  2. TO-RoPE 这个 baseline 明显异常。HSTU + TO-RoPE 与 HSTU + Time RAB 用同样的 T+P RAB,只多加了一个 TO-RoPE,但在三个 PixelRec 切分上 HR@10 比 HSTU + Time RAB 低 42–45%,几乎回落到只有位置 RAB 的纯 HSTU 水平(4.16 vs 4.22、6.81 vs 6.89、4.99 vs 5.01)。"多加一个时间组件,反而把 Time RAB 的全部收益抹掉",更像是实现或训练问题(例如时间戳量级/精度处理),而不是 TO-RoPE 方法本身的上限。论文没有讨论这一反常现象,因此"大幅超越 TO-RoPE"不能当作对 TO-RoPE 的有效比较。
  3. 真正有信息量的对照是 T-RoPE vs HSTU + Time RAB(两者都有时间信号、都有 T+P RAB,差别只在是否加 T-RoPE,参数差 256 个)。这组比较表明:在已有时间信号的前提下,把时间做进旋转几何确实有增益,ML-20M 约 +1%、Pixel200K 约 +2–3%、Amazon Books 约 +10%、Pixel8M 约 +25%。但所有结果都是单 seed(42)、无方差,ML-20M 与 Pixel200K 上 1–3% 的差距是否超出 seed 噪声无从判断。
  4. 公开实验只用 2 层、序列长度 50(ML-20M 为 200),属于小模型设定。

消融与分析:Shop 工业数据集

Table 3:Shop 数据集消融(%)。第 1 行为完整 T-RoPE;第 2–5 行累积移除组件直到 HSTU + Time RAB 骨干;第 6–8 行从完整模型中单独移除一个组件。括号为相对完整模型的变化。

# 配置 Recall@50 NDCG@50 Recall@200 NDCG@200 MRR
1 T-RoPE 31.41 22.94 41.77 24.82 23.14
2 − Non-Stationary (§3.5) 30.97 (−1.40%) 22.02 (−4.01%) 40.49 (−3.06%) 23.29 (−6.16%) 21.88 (−5.45%)
3 − shifted (§3.4) 30.90 (−1.62%) 20.59 (−10.24%) 40.92 (−2.03%) 22.55 (−9.15%) 20.90 (−9.68%)
4 − multiscale freq. bank (§3.3) 25.36 (−19.26%) 13.23 (−42.33%) 36.98 (−11.47%) 15.42 (−37.87%) 11.96 (−48.31%)
5 − abs. time embedding (§3.1+§3.2) = HSTU + Time RAB 25.68 (−18.24%) 13.81 (−39.80%) 37.00 (−11.42%) 15.96 (−35.70%) 12.70 (−45.12%)
6 − Shifted Query RoPE 30.87 (−1.72%) 21.54 (−6.10%) 40.50 (−3.04%) 23.42 (−5.64%) 22.46 (−2.94%)
7 − Key RoPE 31.19 (−0.70%) 20.58 (−10.29%) 41.90 (+0.31%) 22.63 (−8.82%) 20.90 (−9.68%)
8 − Time RAB 29.08 (−7.42%) 20.76 (−9.50%) 39.69 (−4.98%) 22.95 (−7.53%) 16.89 (−27.01%)

完整 T-RoPE 相对 HSTU + Time RAB 骨干(行 5):Recall@50 +22.3%、NDCG@50 +66.1%、Recall@200 +12.9%、NDCG@200 +55.5%、MRR +82.2%——即摘要中"13–82%"的来源。

论文的逐项结论:

  • 多尺度频率库与 shifted query 提供核心收益。多尺度库影响最大:比较行 3 与行 4,移除它使 NDCG@50 下降 36%(反过来说,加上它 NDCG@50 +56%,即摘要里的"+56%")。论文解释为多尺度旋转把原始时间戳变成可用的频率结构;没有它时间戳"只是噪声",行 4 的单频时间嵌入甚至比行 5 骨干低约 4%。shifted query 次之:比较行 2 与行 3,NDCG@50 +7%。
  • 非平稳 key 带来绝对时间敏感性,并与 key/query 旋转互补。加入非平稳 key(行 1 vs 行 2)五个指标全部提升,Recall@200 +3.2%、NDCG@50 +4.2%。由于 key 旋转与 query 旋转各自都能携带绝对时间敏感性(Remark 1),论文又逐一移除:移除 shifted-query 旋转(行 6)Recall@200 −3.0%,移除 key 旋转(行 7)主要伤排序精度(NDCG@50 −10.3%,而 Recall@200 反而 +0.31%)。论文结论:两者互补,非平稳 key 结合两侧走得最远。
  • Time RAB 与 T-RoPE 互补。从完整模型移除 Time RAB(行 8)全部指标下降,MRR 降幅最大(−27.0%),说明 RAB 仍捕获 T-RoPE 未覆盖的相对 recency 信号;但即便没有 RAB,T-RoPE 仍比骨干 NDCG@50 高约 50%,两种机制独立贡献、组合最好。

我的分析——收益到底从哪来("引入新信号 ≠ 收益来源"):

  1. Shop 上的骨干已经有时间信号(Time RAB),所以 T-RoPE 的增益不是"有没有时间戳"带来的,而是"时间如何进入注意力几何"带来的——这一点比很多"加个时间特征就涨"的论文干净。
  2. 但把增益按行拆开:行 3(可学习系数 + 多尺度频率库的时间戳 RoPE,无 shift、无非平稳 key)相对骨干已有 Recall@50 +20.3%、NDCG@50 +49.1%、MRR +64.6%;本文真正独有的两个部件(shifted query + 非平稳 key,行 3→行 1)只再贡献 Recall@50 +1.7%、NDCG@50 +11.4%、Recall@200 +2.1%、MRR +10.7%。也就是说,大头来自"几何间隔频率库上的时间戳 RoPE"这一已有思路(TO-RoPE 的时间分量、ReST 的 RoTE、ClockRoPE 都属此类),而 shifted query 本身是论文自述的借鉴 HSTU RAB 的做法。
  3. Shop 上没有任何外部时间 RoPE baseline。既没有 TO-RoPE(尽管 Table 5 里在 Shop 上测过 TO-RoPE 的吞吐),也没有"时间戳上的标准 RoPE"或索引 RoPE。行 3 是最接近"标准时间戳 RoPE"的对照,但它是论文自己实现的内部变体,不等于先前方法。因此"T-RoPE 优于已有时间 RoPE"在工业尺度上没有被直接检验。
  4. "多尺度 +56%"是对一个没人会用的设计的消融。行 4 是"单一基础频率"的时间戳 RoPE——任何 RoPE 变体默认都是多频率的,把它拿掉当然崩。这组数字说明的是"单频不行",不能作为 T-RoPE 设计新颖性的证据。
  5. 非平稳 key 的消融需要谨慎解读。在独立系数的参数化下,非平稳 key $R(-\alpha^k_d t_n/\beta_d)$ 与标准 key $R(\alpha^k_d t_n/\beta_d)$ 只差 $\alpha^k_d$ 的符号;由于 $\alpha^k_d$ 可学习且从对称的 $\mathcal{N}(0,1)$ 初始化,两者张成的函数族和初始化分布完全相同——论文自己的 Remark 1 与 A.1 末段也承认独立系数的标准 RoPE 同样不是平移不变的。若行 2 保留独立系数,那么行 1 与行 2 在数学上是同一个模型的不同参数化,−1.4%~−6% 的差异只能来自优化路径/随机性;若行 2 退回共享系数,则它混淆了"共享 vs 独立系数"与"转置旋转"两个因素。论文没有说明行 2 用哪一种,也没有给出方差,"非平稳 key 贡献 +4%"这一归因不可靠。
  6. 消融降幅 vs 相对最强 baseline 的差距:Shop 上唯一的 baseline 就是骨干,所以"最强 baseline"的差距就是 +22%/+66%,远大于任一单部件消融降幅——这一层面上结论成立;但细粒度部件(非平稳 key 的 −1.4% Recall@50、行 7 的 Recall@200 反而上升)落在单 seed 下无法判定的范围内。

线上 A/B 实验

论文在 Shop app 推荐中部署 T-RoPE,在离线架构基础上扩大规模但保持 T-RoPE 设计不变。对照组是"不带 T-RoPE 的相同模型"(即生产的 HSTU 类骨干)。

Table 4:Shop app 线上 A/B(相对对照组)

指标 定义 相对提升 P 值
CVR 转化率 +0.33% 0.037
Shop orders Shop app 下单数 +0.63% 0.094

论文解读:CVR 信号最强(p = 0.037),说明时间感知召回把更多会话转化为交互;下单数 +0.63%(p = 0.094)作为下游价值的方向性证据。

分析:对照组设定是干净的(同一模型、只差 T-RoPE),且给出了 p 值——这比很多工业论文强。但:(1)只有 CVR 在 0.05 水平显著,下单数 p = 0.094 不显著;(2)没有流量比例、实验时长、线上模型规模("scaling up the offline architecture"没有给具体配置)、线上延迟/成本数据;(3)Figure 2 中"deployed model"至少有 18 层(出现 Layer 17),与 Shop 离线的 12 个 HSTU block、附录 B.2 的"$M=2$ 层、$D=128$"都对不上,文中对不同实验使用的规模描述前后不一致。这是真实的工业证据(Shopify 作者 + 自家 Shop app 线上 A/B),但证据量比较薄。

附加可视化

Figure 5: 合成多尺度序列上各设计阶段的注意力几何。序列含四个事件块,内部间隔分别对应日、周、月、年尺度行为,红线为块边界。a) Index RoPE;b) Timestamp RoPE;c) Timestamp RoPE + shifted query;d) 带非平稳 key 与可学习时间系数的完整 T-RoPE。完整方法按时间几何而非仅按序列位置分离各块

随着部件逐个加入,日/周/月/年尺度的事件块越来越按真实时间间隔分组,完整 T-RoPE 能干净地按经过时间分离各块。这是合成数据上的定性展示,不构成定量证据。

核心贡献总结

  1. 把"时间"做进 RoPE 旋转几何的一个完整配方:时间戳角度 + 几何频率库 + 逐维可学习 query/key 系数 + shifted query + 转置 key 旋转,全部保持 RoPE 的 elementwise 旋转接口,只增加 $MD$ 个参数(论文设定下 256 个),可与 FlashAttention 类 kernel 兼容。
  2. 形式化了"时间平移不变性"这一限制:共享系数的时间戳 RoPE(含 TO-RoPE 的时间分量)只看时间差,无法表示依赖绝对日历相位的偏好;非平稳 key 让相位依赖 $t_{m+1}+t_n$,可在 $\alpha^q_d+\alpha^k_d\neq0$ 时表示绝对时间敏感性。
  3. 公开 + 工业 + 线上三层验证:五个公开数据集全指标第一(相对 HSTU + Time RAB +1%~+28%);60 亿交互 Shop 数据相对骨干 +13%~+82%;Shop app A/B CVR +0.33%(p = 0.037)。
  4. 给出可学习角度的完整反向实现与 FP32 角度计算、梯度裁剪等工程要点。

与已归档相关工作的对比

ClockRoPE ClockRoPE: Random Fourier Rotations for Temporal Routine Modeling(YouTube / Google DeepMind,2026-07-29)

关系:独立并发(本文未引用 ClockRoPE,两者殊途同归)· 已加载对方精读

  • 共同关注的问题:两篇都认为 RoPE 在推荐里的"频率调度"是从语言模型照搬来的错误先验——ClockRoPE 说 log-linear 频率把注意力调制锁死成单调长程衰减、表达不了周期性;T-RoPE 说索引旋转抹掉了真实间隔、多尺度周期和日历相位。root cause 一致:RoPE 的旋转坐标与频率谱应当由推荐的时间结构决定,而不是由文本的 token 偏移决定。
  • 相近的技术骨架:都用 Unix 时间戳替换位置索引作为旋转坐标,都只改"旋转角从哪来"、前向实现与标准 RoPE 逐行一致、可复用 RoPE kernel,都声称零或近零新增参数,也都在工业生成式召回/检索上线。
  • 本文的差异与推进:路线在"频率从哪来"上截然相反。ClockRoPE 从先验出发——指定周期核(日/周周期高斯),用 Bochner/Herglotz 从其傅里叶变换采样固定频率,并在附录 B 用负结果论证"可学习频率反而更差(0 初始化 −1.44%)";T-RoPE 用几何频率库 + 逐维可学习系数(等价于学习有效频率 $\alpha_d/\beta_d$),让数据决定强调哪些周期。另一个差异在不变性:ClockRoPE 的调制核 $f(p_m-p_n)$ 仍是平移不变的相对编码(它通过"时间差接近 $kT$"来匹配同一时刻),而 T-RoPE 明确追求打破平移不变性以获得绝对日历相位。值得指出的是,由于推理时 query 取 $t_{\text{now}}$、历史固定,相对周期编码本身已经能让"今天的 query 注意到去年同期的 item";T-RoPE 的非平稳 key 额外带来的只是"整段历史 + query 一起平移时注意力也变",这部分增益在本文消融里只有 1–6%,且存在上文所述的参数化等价问题。
  • 可比的方法 / 实验差异:ClockRoPE 零公开数据集、只报相对百分比,但与"RoPE-only"对照做了正交组合实验(+2.39% MAP@1);T-RoPE 有五个公开 benchmark 与绝对数值,但没有任何索引 RoPE 对照,工业消融也只对自身部件。两者都缺少彼此的对照:一个自然的实验是在 Shop 上把 T-RoPE 的可学习频率库换成 ClockRoPE 式的固定周期采样,检验"可学习 vs 先验"之争。线上量级:ClockRoPE valued engagement +0.08% 且 TPU 成本 −0.63%;T-RoPE CVR +0.33%(p = 0.037),但离线训练吞吐 −11.5%。

ReST ReST: From Language to Behavior — Scaling Sequence Transformers for Industrial Recommendation Ranking(ByteDance,2026-09-01)

关系:独立并发(本文未引用 ReST;两者的 RoTE / T-RoPE 部件同构)· 已加载对方精读

  • 共同关注的问题:ReST 把"行为发生在不规则物理时间上、相同序号距离对应完全不同的 recency、纯序号编码无法刻画多尺度时间邻近性"列为序列 scaling 的两大 root cause 之一,与 T-RoPE 的"真实时间间隔被抹掉 + 多尺度周期缺失"几乎同一表述。
  • 相近的技术骨架:ReST 的 RoTE 同样把物理时间戳放进 RoPE 旋转,并用多粒度覆盖从秒到年的尺度(按 head 分配 $\tau_h\in$ {秒, 分, 时, 天, 周, 季, 年},对应 T-RoPE 的几何频率库),也保留一个 head 给序号 RoPE(对应 T-RoPE 保留 Time RAB 的"互补"结论)。
  • 本文的差异与推进:ReST 先减去序列起始时间 $\tilde t_i=t_i-t_1$ 再分桶——主动放弃了绝对时间,是严格平移不变的;T-RoPE 反其道而行,直接用未归一化的绝对 Unix 时间戳并用非平稳 key 保留日历相位。ReST 的尺度是固定的、按 head 划分;T-RoPE 是按旋转平面几何分布 + 可学习系数。T-RoPE 还加入 shifted query(ReST 无)。
  • 可比的方法 / 实验差异:ReST 的 RoTE 只是一个大系统中的子部件,其消融(AUC:+RoPE +0.04%,+单粒度 RoTE +0.08%,+多粒度 RoTE +0.12%)显示"多粒度"是时间编码里的主要增益——与 T-RoPE 行 3→行 4"多尺度频率库贡献最大"的结论一致。两篇在不同公司、不同任务(ByteDance 判别式排序 vs Shopify 生成式召回)上独立得到"多尺度时间戳旋转 > 单尺度 > 仅序号"的相同排序,互相印证了这一部分;而 T-RoPE 独有的"绝对相位"部件,在两篇的证据里都不是主要收益来源。

讨论与局限性

值得借鉴的设计

  1. "时间进入注意力几何"而不是"时间作为特征/偏置"。在骨干已有 Time RAB 的前提下仍有显著增益(Shop NDCG@50 +66%),且移除 RAB 后 T-RoPE 单独也有 +50%,说明"旋转式时间编码"与"加性时间偏置"互补。这对任何 HSTU 类骨干都是低成本可迁移的改动。
  2. shifted query 的训练/推理一致性处理:训练时 query 用 $t_{m+1}$、推理时用 $t_{\text{now}}$,最后一个训练位置保留自身时间戳,这是时间戳 RoPE 落地必须想清楚的细节,Algorithm 1 给了可直接照抄的实现。
  3. 工程细节诚实:FP32 计算角度、梯度需要裁剪、可学习角度需要自定义反向,这些都是真正复现时会踩的坑。

局限与争议

  1. 理论贡献较浅。定理 1、定理 2 都是 $R(a)R(b)=R(a+b)$ 的一行推论;定理 1 针对的是"共享系数"情形,而论文自己的 §3.2 默认就是独立系数,Remark 1 也承认独立系数的标准旋转同样打破不变性。在独立、对称初始化的系数下,"非平稳 key(转置旋转)"只是 $\alpha^k_d$ 的符号重参数化,与标准旋转张成同一函数族。论文把它作为五个核心部件之一并列在 Table 1 "Non-stationary"列里,是把一个参数化选择包装成了机制。
  2. baseline 的完整性与可信度:(a)没有任何"HSTU + 索引 RoPE"对照,与论文开篇"推荐照搬了文本 RoPE"的叙事不匹配;(b)HSTU + TO-RoPE 在 PixelRec 上比 HSTU + Time RAB 低 42–45%,几乎等于没有时间信号的 HSTU,高度可疑,而摘要里的"78–130%"正是建立在这个异常 baseline 上,并被错误地表述为"相对最强 baseline";(c)工业数据上没有任何外部时间 RoPE 对照。
  3. 统计严谨度不足:公开实验与 Shop 消融都是单 seed、无方差;ML-20M、Pixel200K 上 +1%~+3% 的差距以及非平稳 key 的 −1.4% Recall@50,都无法判断是否超出噪声。
  4. 可学习系数的实际行为与叙事不完全吻合:系数从 $\mathcal{N}(0,1)$ 初始化,训练后却只有约 0.005–0.023(Figure 3a),有效周期比图中标注的频带长 50–200 倍,"<1h""1h~1d"频带实际工作在更长的周期上。此外以秒计的 Unix 时间戳在 FP32 下分辨率约为 128 秒,初始化时 $\alpha\approx1$、$\beta=100$ s 的平面相位量级约 $1.7\times10^7$ rad,FP32 下每一步量化约 2 rad,几乎是随机相位——系数被推向很小值可能部分是优化在"逃离数值噪声"。论文对这些都未讨论。
  5. 规模描述前后不一致:公开实验 2 层(d=512、H=4、A=128),Shop 离线 12 个 HSTU block(每头 32 维),附录 B.2 称"HSTU 实验 $M=2$、$D=128$",Figure 2 的"部署模型"至少 18 层;线上"扩大规模"的具体配置未给出。scaling 行为(模型变大后 T-RoPE 的相对增益是否保持)完全没有研究。
  6. 实测开销不可忽略:Shop 上训练吞吐 −11.5%、验证 −7.1%,而文中称"modest"。线上延迟与成本未报告。
  7. 方法论可扩展性:作为逐元素旋转的位置编码,T-RoPE 不引入两阶段解耦或固化码本,参数量 scaling 时不构成架构瓶颈;但其贡献是组件级的,不改变"如何表征历史"或"如何建模序列"的主干路线。

工业落地价值

Shopify 在自家 Shop app 推荐(生成式召回)上做了干净的 A/B:对照组为不带 T-RoPE 的同一模型,CVR +0.33%(p = 0.037),下单数 +0.63%(p = 0.094,不显著)。改动只涉及 query/key 旋转、参数增量可忽略,工程上容易接入已有 HSTU 类系统;代价是可学习角度需要自定义反向、角度需 FP32 计算且梯度要裁剪,实测训练吞吐下降约 7–12%。工业署名与线上 A/B 是真实的,但证据主要集中在"时间戳多尺度旋转"这一已有思路上,本文独有部件(非平稳 key、shifted query)的增益在工业尺度上只有 1–11%,且未与 TO-RoPE、ClockRoPE、RoTE 等同类方法在同一工业数据上对照。