← 返回报告列表

2026-09-14 日报

日报 📅 2026-09-11
三重压缩:长序列、解码状态与词表的开销重分配
sequence-compression linear-attention inference-serving knowledge-distillation parameter-scaling
📊 共 9 篇 · 精读 3

2026-09-14 日报

主题: 三重压缩:长序列、解码状态与词表的开销重分配

标签: sequence-compression · linear-attention · inference-serving · knowledge-distillation · parameter-scaling

📊 统计: 共 9 篇 · 精读 3 · 🏢 工业界 3 · 🎓 学术 6 · generative-rec 2 · llm 1 · discriminative-rec 1 · other 5

综述

当日 9 篇(3 精读):推荐 3、LLM 1、其他 5,工业仅腾讯快手。Meta FAIR 与 UW 以 吸收残余概率质量,单次前向精确转出字节分布,logit 存储压到 261 维,并指出 BPB 跨分词不可比。腾讯 ChronicleRec 把终身用户建模改为候选无关预训练,查询 token 因果交织锚定时序,55 个可缓存 token 取回九成全注意力增益,广告 A/B GMV +1.61%。快手 OneLA 指出线性注意力新瓶颈在 beam 宽度,用共享状态加转移记录免去逐 beam 物化,解码提速 1.5-2.5 倍。三者同路:压序列、压状态、压词表,开销挪出瓶颈路径。

重点论文

End-Of-Token · ⭐ 8/10

Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models

🏢 Meta · LLM

Meta FAIR + UW 提出两种单次前向的 token→byte logit 转换方法——Marginalize-It(对前缀匹配 token 重归一化,近似)与 End-Of-Token(向词表加 吸收残余概率质量,精确),并首次沿 tokenization 方案(Tokens / Bytes / Bytes w/ )与训练目标(蒸馏 vs 交叉熵)两轴做层参数对齐的 ≈1B 参数、最高 1T bytes 过训练标度扫描:token 模型在低算力区领先但快速饱和,byte 模型起步更差却持续改善,外推预测蒸馏 End-Of-Token-1B 渐近超过蒸馏 Token-1B 达 4%、超 Llama-3.2-1B / Gemma-3-1B-pt / Gemma 2B 分别 6.5% / 8.1% / 2.1%,且只需六分之一的独特文本与五分之一的 logit 存储(词表仅 ≈261,无需 top-k 截断);同时给出一个重要负面结论——BPB 无法跨 tokenization 方案与训练目标公平比较,因为它只约束目标 token 的概率值而对残余质量的排序完全盲视,低 BPB 的模型可能下游更差。

ChronicleRec · ⭐ 7/10

ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling

🏢 Tencent · 判别式推荐

ChronicleRec 把终身用户建模重构为 target-independent 表征预训练:recency-aware 近细远粗多粒度合并 + 可学习 query token 交织进历史 + 因果编码,使每个 Chronicle Token 拥有良定义的时间感受野;多分支 mask 掉不同长度近期历史覆盖多时间视野,再用 mask-and-predict 的 Chronicle Alignment 把压缩的过去对齐到近present 意图;token 与候选无关故可每用户算一次并异步写回 KV cache,把超长序列编码移出在线打分路径,KuaiRand 上以 55 个 token 恢复 full-attention 增益的 92.9%,微信朋友圈广告 pCVR 七天 A/B GMV +1.61%。

OneLA · ⭐ 6/10

OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation

🏢 Kuaishou · 生成式推荐

OneLA 指出线性注意力(GDN)把生成式推荐的序列长度瓶颈换成了新的 beam 宽度瓶颈,用“一份共享 prefill 状态 + 只追加的紧凑转移记录 GTR(α,δ,k) + 轻量祖先索引 + 融合共享上下文 kernel”取代逐 beam 状态物化——因为 GDN 层只通过右乘消费状态,就把右乘推穿整条祖先链、全程只维护两个 d_v 维投影累加器,循环状态矩阵从不重建——在离线实验上取得 1.54-2.46x 端到端解码提速与 20-56x 持久状态容量下降,但头条加速比测在较弱的 FullState 基线上,且无任何组件消融与线上部署。

Preference-Drift-Aware Subsequence Learning and Hierarchical Context Fusion for Long-Sequence Generative Recommendation · ⭐ 7/10

🎓 学术 · 生成式推荐

针对长序列生成式推荐中全序列建模成本高、目标检索易引入语义相近但偏好不一致噪声的问题,提出用多维偏好漂移信息学习可微的软子序列边界,并以带软分配权重的线性注意力把子序列聚合成偏好一致的表示,再用交叉注意力建模近期交互与相关子序列上下文的依赖,最后门控融合近期与全局表示。实验显示精度与效率同时优于基线。

全部论文

模型 标题 类别 公司 摘要分 精读分
End-Of-Token Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models LLM 🏢 Meta 7 8
ChronicleRec ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling 判别式 🏢 Tencent 8 7
OneLA OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation 生成式 🏢 Kuaishou 7 6
— Preference-Drift-Aware Subsequence Learning and Hierarchical Context Fusion for Long-Sequence Generative Recommendation 生成式 🎓 学术 7 —
PolDense Parameter-Efficient Retrievers for Polish and European Languages 其他 🎓 学术 5 —
— Theoretical Guarantees for One-Shot Magnitude Pruning and Compute-Adaptive Early Exit 其他 🎓 学术 5 —
— Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs 其他 🎓 学术 5 —
GTR+ Generative Retrieval for Unsupervised Text-Based Person Search 其他 🎓 学术 4 —
Kraken Kraken: LLM-based Speech-to-Speech Translation via Low-bitrate VQ and Dual-path Source Conditioning 其他 🎓 学术 4 —