2026-08-27 日报
主题: 工业推荐 Transformer 扩容:事件 token 化与判别式召回的互斥押注
标签: transformer · parameter-scaling · inference-serving · pretrained-lm · industrial
📊 统计: 共 7 篇 · 精读 2 · 🏢 工业界 2 · 🎓 学术 5 · generative-rec 1 · discriminative-rec 4 · other 3
综述
今日 7 篇:判别式推荐 4 篇、生成式 1 篇、其他 3 篇,仅 2 篇来自工业界,却恰是同一问题的两种互斥押注——工业推荐 Transformer 想扩容,卡在每候选算力预算与异构特征的 token 统一。Meta 的 AMBER 把每个事件数百个异构特征压成 1 个连续稠密 token 并对齐 Llama 嵌入空间,提出 snapshot resolution 这一新扩容维度,靠异步 tokenize 加缓存与实时服务算力解耦,已在 Facebook 全流量面日均编码十亿级事件,离线 NE 降 0.06%;其消融显示富 item 表征下去掉 semantic ID 中性,等于押注不需要码本,代价是离散路线没有的表征漂移。阿里淘天的 TransRetrieval 反向押注判别式召回,参数在四域无条件共享,目标侧压成 1 个 token 省出的算力回投更深骨干,5% 流量一个月 A/B 收入 +2.53% 且 P99 持平;但它把突破归给加权平均这一行修正的说法存疑——该项消融只值 +1.0 pt,扩容收益却是 +19.3 pt,更自洽的解释是算力再分配加跨域数据统一。其余 5 篇均为学术工作,散在序列动力学、可控编辑与检索侧。昨日三家争“残差量化怎么修”,AMBER 则把问题抬到“要不要离散化”一层,病根并不同源。
重点论文
AMBER · ⭐ 9/10
An Event is Worth One Token: Event Tokenization for Industrial-scale LLM Recommendation
🏢 Meta · 生成式推荐 / 判别式推荐
Meta 提出 AMBER,用一个共享的双向 Transformer Event Tokenizer 通过角色掩码把每个交互事件的数百个异构特征(user/item/context/outcome)压成 1-2 个连续 Event Token,与预训练 1B Llama User LLM 端到端联合训练;serving 时 tokenizer 按事件异步触发、token 缓存进特征库,从而把新提出的 scaling 维度 snapshot resolution 与实时服务算力解耦,并证明在总(训练+服务)算力口径下事件侧 scaling 比 User LLM scaling 更划算。
TransRetrieval · ⭐ 8/10
TransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial Recommendation
🏢 Alibaba · 判别式推荐
阿里淘天在展示广告召回侧提出 TransRetrieval:用加权平均聚合修复异构字段导致的 token 范数发散(用户侧最高 10× 目标侧)、把目标侧全部特征压成 1 个 token 省 85% 每候选 FLOPs 并将算力回投到更深更宽骨干、再以位置式 domain embedding 无条件共享参数统一 4 个业务域,在 400 亿交互工业数据集与公开 KuaiRand 上得到 R²=0.82/0.88 的对数线性 scaling(32D1L→128D5L,Recall@2000 +19.3/+22.2 pt),一个月 5% 生产流量线上 A/B 平台收入 +2.53%(95% CI [2.22,2.70],p<0.0001)、RPM +1.28%,P99<40ms 与生产基线持平。
HSR · ⭐ 6/10
Hamiltonian Spectral-Temporal Dissipative Dynamics for Sequential Recommendation
🎓 学术 · 判别式推荐
HSR 将用户偏好演化建模为潜在相空间中的耗散哈密顿系统(位置=稳定偏好、动量=短期倾向),利用线性时不变结构在频域取得闭式解,并加入可学习耗散项刻画兴趣衰减、局部短脉冲模块刻画突变行为,从而同时覆盖周期性、惯性与局部冲击;在三个基准上以更少参数超过 Transformer 与 SSM 系推荐器。
CRAMER · ⭐ 6/10
CRAMER: Control via Request-Aware Masking for Editing Recommenders
🎓 学术 · 判别式推荐
CRAMER 借模型控制理论,把用户的自然语言请求编码成语义向量后经 Gumbel-TopK 生成稀疏行列门控,转成逐元素掩码作用于冻结序列推荐骨干(注意力输出矩阵与 FFN)的参数,从而在不重训骨干、不调用 LLM 推理的前提下即时改变推荐行为;只训练映射层与请求编码器的一小部分。多个公开大规模基准上优于四个请求感知 SOTA 基线,且开销极小,并展现出更强的可控性与跨域适配能力。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| AMBER | An Event is Worth One Token: Event Tokenization for Industrial-scale LLM Recommendation | 生成式 / 判别式 | 🏢 Meta | 9 | 9 |
| TransRetrieval | TransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial Recommendation | 判别式 | 🏢 Alibaba | 8 | 8 |
| HSR | Hamiltonian Spectral-Temporal Dissipative Dynamics for Sequential Recommendation | 判别式 | 🎓 学术 | 6 | — |
| CRAMER | CRAMER: Control via Request-Aware Masking for Editing Recommenders | 判别式 | 🎓 学术 | 6 | — |
| PUMA | PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval | 其他 | 🎓 学术 | 5 | — |
| AnchorQE | Query Expansion Is More Than Generation: Improving Dense Retrieval through Better Integration | 其他 | 🎓 学术 | 5 | — |
| — | Pointing the Way, Hiding the Destination: Practical Private Dense Retrieval at Scale | 其他 | 🎓 学术 | 4 | — |