2026-09-14 日报
主题: 三重压缩:长序列、解码状态与词表的开销重分配
标签: sequence-compression · linear-attention · inference-serving · knowledge-distillation · parameter-scaling
📊 统计: 共 9 篇 · 精读 3 · 🏢 工业界 3 · 🎓 学术 6 · generative-rec 2 · llm 1 · discriminative-rec 1 · other 5
综述
当日 9 篇(3 精读):推荐 3、LLM 1、其他 5,工业仅腾讯快手。Meta FAIR 与 UW 以
重点论文
End-Of-Token · ⭐ 8/10
Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models
🏢 Meta · LLM
Meta FAIR + UW 提出两种单次前向的 token→byte logit 转换方法——Marginalize-It(对前缀匹配 token 重归一化,近似)与 End-Of-Token(向词表加
吸收残余概率质量,精确),并首次沿 tokenization 方案(Tokens / Bytes / Bytes w/ )与训练目标(蒸馏 vs 交叉熵)两轴做层参数对齐的 ≈1B 参数、最高 1T bytes 过训练标度扫描:token 模型在低算力区领先但快速饱和,byte 模型起步更差却持续改善,外推预测蒸馏 End-Of-Token-1B 渐近超过蒸馏 Token-1B 达 4%、超 Llama-3.2-1B / Gemma-3-1B-pt / Gemma 2B 分别 6.5% / 8.1% / 2.1%,且只需六分之一的独特文本与五分之一的 logit 存储(词表仅 ≈261,无需 top-k 截断);同时给出一个重要负面结论——BPB 无法跨 tokenization 方案与训练目标公平比较,因为它只约束目标 token 的概率值而对残余质量的排序完全盲视,低 BPB 的模型可能下游更差。
ChronicleRec · ⭐ 7/10
ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling
🏢 Tencent · 判别式推荐
ChronicleRec 把终身用户建模重构为 target-independent 表征预训练:recency-aware 近细远粗多粒度合并 + 可学习 query token 交织进历史 + 因果编码,使每个 Chronicle Token 拥有良定义的时间感受野;多分支 mask 掉不同长度近期历史覆盖多时间视野,再用 mask-and-predict 的 Chronicle Alignment 把压缩的过去对齐到近present 意图;token 与候选无关故可每用户算一次并异步写回 KV cache,把超长序列编码移出在线打分路径,KuaiRand 上以 55 个 token 恢复 full-attention 增益的 92.9%,微信朋友圈广告 pCVR 七天 A/B GMV +1.61%。
OneLA · ⭐ 6/10
OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation
🏢 Kuaishou · 生成式推荐
OneLA 指出线性注意力(GDN)把生成式推荐的序列长度瓶颈换成了新的 beam 宽度瓶颈,用“一份共享 prefill 状态 + 只追加的紧凑转移记录 GTR(α,δ,k) + 轻量祖先索引 + 融合共享上下文 kernel”取代逐 beam 状态物化——因为 GDN 层只通过右乘消费状态,就把右乘推穿整条祖先链、全程只维护两个 d_v 维投影累加器,循环状态矩阵从不重建——在离线实验上取得 1.54-2.46x 端到端解码提速与 20-56x 持久状态容量下降,但头条加速比测在较弱的 FullState 基线上,且无任何组件消融与线上部署。
Preference-Drift-Aware Subsequence Learning and Hierarchical Context Fusion for Long-Sequence Generative Recommendation · ⭐ 7/10
🎓 学术 · 生成式推荐
针对长序列生成式推荐中全序列建模成本高、目标检索易引入语义相近但偏好不一致噪声的问题,提出用多维偏好漂移信息学习可微的软子序列边界,并以带软分配权重的线性注意力把子序列聚合成偏好一致的表示,再用交叉注意力建模近期交互与相关子序列上下文的依赖,最后门控融合近期与全局表示。实验显示精度与效率同时优于基线。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| End-Of-Token | Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models | LLM | 🏢 Meta | 7 | 8 |
| ChronicleRec | ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling | 判别式 | 🏢 Tencent | 8 | 7 |
| OneLA | OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation | 生成式 | 🏢 Kuaishou | 7 | 6 |
| — | Preference-Drift-Aware Subsequence Learning and Hierarchical Context Fusion for Long-Sequence Generative Recommendation | 生成式 | 🎓 学术 | 7 | — |
| PolDense | Parameter-Efficient Retrievers for Polish and European Languages | 其他 | 🎓 学术 | 5 | — |
| — | Theoretical Guarantees for One-Shot Magnitude Pruning and Compute-Adaptive Early Exit | 其他 | 🎓 学术 | 5 | — |
| — | Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs | 其他 | 🎓 学术 | 5 | — |
| GTR+ | Generative Retrieval for Unsupervised Text-Based Person Search | 其他 | 🎓 学术 | 4 | — |
| Kraken | Kraken: LLM-based Speech-to-Speech Translation via Low-bitrate VQ and Dual-path Source Conditioning | 其他 | 🎓 学术 | 4 | — |