2026-09-08 日报
主题: 机制被断言与机制被测量:统一排序骨干对照召回标度律
标签: multi-task · linear-attention · parameter-scaling · industrial · academic
📊 统计: 共 8 篇 · 精读 2 · 🏢 工业界 1 · 🎓 学术 7 · discriminative-rec 3 · llm 1 · other 4
综述
本日 8 篇:判别式推荐 3、LLM 1、其他 4,1 工业 7 学术,2 篇精读。今日的对照是机制被断言与被测量。陌陌 MORE 把 Private Anchor 与任务边界掩码搬进统一骨干,七任务全胜、A/B 六项 p<0.05 已上线、P99 降 30%,工程扎实;但消融折回主表口径后,全消融底座 +0.41% 低于 OneTrans 的 +0.54%,对公开骨干增量仅约 0.2 个点,且多 21.5% 参数,单组件退化之和达全消融 2.21 倍;病因侧零测量:信息流被断言 16 次、梯度仅 2 次,零梯度范数与探针;线上对照是遗留生产栈、P99 系自比,均未隔离那 0.2 个点。特拉维夫大学把 Mamba 状态解成隐式哈希表、推出容量下界,机制预测被逐条命中——去掉 Conv1D 后准确率精确落在 1/N_f=0.06;边界也写明:合成 MQAR、维度远小于真实 Mamba、系数靠启发式。可迁移的不是标度律本体(它做精确键匹配,推荐检索是近似最近邻),而是架构无关的状态比特预算,以及重复键实验:单层对同一键的多次出现只会等权混合而退化到随机猜,而复看复购正是常态。其余 6 篇涉标度律、长短视图与哈希码。
重点论文
On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing · ⭐ 7/10
🎓 学术 · LLM
特拉维夫大学用机制可解释性逆向出 Mamba 做联想召回的最小电路——Conv1D 复制移位构造键值对、SSM 外积写入、键查询内积读出,本质是一张由 JL 投影实现的隐式线性哈希表——并据此推出闭式 Recall Scaling Laws:召回概率 ≈ Φ(√(ND/(aN_f+N)) − √(2log V)),配一条对任意固定状态循环模型成立的信息论下界 ND = Ω(N_f log V),并扩展到多层(有效状态 N_eff = ΛN)与多头(MQA=MKA ≤ 单头=MVA ≤ MHA),在设计模型、训练线性模型与完整 Mamba 上均得到验证。
MORE · ⭐ 6/10
Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones
🏢 Hello Group · 判别式推荐
陌陌(Hello Group)的 MORE 把多任务信息流从后置塔搬进统一排序骨干:Shared/Private Anchor Token 贯穿所有 block,逐层以 per-task cross-attention 读用户级序列流、在 task-boundary mask 下与非序列 token 做 RankMixer 式混合、再经 FiLM 式 per-task 增强,陌陌 Nearby Feed 七任务全胜、两周 A/B 六项 p<0.05 已上线、P99 打分延迟降约 30%;但把 Table 2 的 BaseArch 折回 Table 1 口径只有 +0.41%,低于 OneTrans/HyFormer 的约 +0.54%,相对最强公开统一骨干的真实增量仅约 0.2 个点,且「任务盲」这一 root cause 全文断言 16 次却从未被直接测量。
SGD in Multiclass Logistic Regression: Sequential Learning and Scaling Laws · ⭐ 6/10
🎓 学术 · 其他
在高维高斯混合上刻画多类逻辑回归的交叉熵训练动力学,证明梯度训练按类频从高到低顺序逐类学习,幂律先验下风险呈现「平台—幂律衰减—收敛」三段;再用 PCA 投影限制有效维度,导出固定算力下模型规模与训练时长的 compute-optimal 配比。
Closing the Long-Short View Gap in Sequential Recommendation without Cached History · ⭐ 6/10
🎓 学术 · 判别式推荐
针对训练用长序列、线上只能吃短窗口的落差,把病因定位到点积的范数偏置与前缀注意力偏置两个结构性缺陷;第一阶段用角度相似度与有界注意力重训长视图骨干,第二阶段只微调 bias 与 LayerNorm 完成短视图适配,全程不需要按用户缓存历史状态。
MHR · ⭐ 6/10
Matryoshka Hash Representations for Model-Aware Compact Semantic Retrieval
🎓 学术 · 其他
提出 MHR,把满宽训练与前缀组织拆成两阶段:先学一段较长的二值码,再冻结模型、为每个短前缀训练零初始化的残差码适配器,使同一份码的各段前缀都能直接检索;文档端存 1 bit/维,查询端保留连续 logits,检索用 FAISS FastScan 做非对称打分。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| — | On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing | LLM | 🎓 学术 | 7 | 7 |
| MORE | Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones | 判别式 | 🏢 Hello Group | 8 | 6 |
| — | SGD in Multiclass Logistic Regression: Sequential Learning and Scaling Laws | 其他 | 🎓 学术 | 6 | — |
| — | Closing the Long-Short View Gap in Sequential Recommendation without Cached History | 判别式 | 🎓 学术 | 6 | — |
| MHR | Matryoshka Hash Representations for Model-Aware Compact Semantic Retrieval | 其他 | 🎓 学术 | 6 | — |
| FunnelAudit | FunnelAudit: Responsibility Auditing in Multi-Route Recommender Systems | 其他 | 🎓 学术 | 5 | — |
| AdaKG | Do All Nodes Benefit Equally from Knowledge Graphs? Adaptive Node-Aware KG Fusion for Recommendation | 判别式 | 🎓 学术 | 5 | — |
| — | Tracing Query Expansion Effects through Sparse Autoencoder Features | 其他 | 🎓 学术 | 5 | — |