← 返回报告列表

2026-09-08 日报

日报 📅 2026-09-05 ~ 2026-09-07
机制被断言与机制被测量:统一排序骨干对照召回标度律
multi-task linear-attention parameter-scaling industrial academic
📊 共 8 篇 · 精读 2

2026-09-08 日报

主题: 机制被断言与机制被测量:统一排序骨干对照召回标度律

标签: multi-task · linear-attention · parameter-scaling · industrial · academic

📊 统计: 共 8 篇 · 精读 2 · 🏢 工业界 1 · 🎓 学术 7 · discriminative-rec 3 · llm 1 · other 4

综述

本日 8 篇:判别式推荐 3、LLM 1、其他 4,1 工业 7 学术,2 篇精读。今日的对照是机制被断言与被测量。陌陌 MORE 把 Private Anchor 与任务边界掩码搬进统一骨干,七任务全胜、A/B 六项 p<0.05 已上线、P99 降 30%,工程扎实;但消融折回主表口径后,全消融底座 +0.41% 低于 OneTrans 的 +0.54%,对公开骨干增量仅约 0.2 个点,且多 21.5% 参数,单组件退化之和达全消融 2.21 倍;病因侧零测量:信息流被断言 16 次、梯度仅 2 次,零梯度范数与探针;线上对照是遗留生产栈、P99 系自比,均未隔离那 0.2 个点。特拉维夫大学把 Mamba 状态解成隐式哈希表、推出容量下界,机制预测被逐条命中——去掉 Conv1D 后准确率精确落在 1/N_f=0.06;边界也写明:合成 MQAR、维度远小于真实 Mamba、系数靠启发式。可迁移的不是标度律本体(它做精确键匹配,推荐检索是近似最近邻),而是架构无关的状态比特预算,以及重复键实验:单层对同一键的多次出现只会等权混合而退化到随机猜,而复看复购正是常态。其余 6 篇涉标度律、长短视图与哈希码。

重点论文

On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing · ⭐ 7/10

🎓 学术 · LLM

特拉维夫大学用机制可解释性逆向出 Mamba 做联想召回的最小电路——Conv1D 复制移位构造键值对、SSM 外积写入、键查询内积读出,本质是一张由 JL 投影实现的隐式线性哈希表——并据此推出闭式 Recall Scaling Laws:召回概率 ≈ Φ(√(ND/(aN_f+N)) − √(2log V)),配一条对任意固定状态循环模型成立的信息论下界 ND = Ω(N_f log V),并扩展到多层(有效状态 N_eff = ΛN)与多头(MQA=MKA ≤ 单头=MVA ≤ MHA),在设计模型、训练线性模型与完整 Mamba 上均得到验证。

MORE · ⭐ 6/10

Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones

🏢 Hello Group · 判别式推荐

陌陌(Hello Group)的 MORE 把多任务信息流从后置塔搬进统一排序骨干:Shared/Private Anchor Token 贯穿所有 block,逐层以 per-task cross-attention 读用户级序列流、在 task-boundary mask 下与非序列 token 做 RankMixer 式混合、再经 FiLM 式 per-task 增强,陌陌 Nearby Feed 七任务全胜、两周 A/B 六项 p<0.05 已上线、P99 打分延迟降约 30%;但把 Table 2 的 BaseArch 折回 Table 1 口径只有 +0.41%,低于 OneTrans/HyFormer 的约 +0.54%,相对最强公开统一骨干的真实增量仅约 0.2 个点,且「任务盲」这一 root cause 全文断言 16 次却从未被直接测量。

SGD in Multiclass Logistic Regression: Sequential Learning and Scaling Laws · ⭐ 6/10

🎓 学术 · 其他

在高维高斯混合上刻画多类逻辑回归的交叉熵训练动力学,证明梯度训练按类频从高到低顺序逐类学习,幂律先验下风险呈现「平台—幂律衰减—收敛」三段;再用 PCA 投影限制有效维度,导出固定算力下模型规模与训练时长的 compute-optimal 配比。

Closing the Long-Short View Gap in Sequential Recommendation without Cached History · ⭐ 6/10

🎓 学术 · 判别式推荐

针对训练用长序列、线上只能吃短窗口的落差,把病因定位到点积的范数偏置与前缀注意力偏置两个结构性缺陷;第一阶段用角度相似度与有界注意力重训长视图骨干,第二阶段只微调 bias 与 LayerNorm 完成短视图适配,全程不需要按用户缓存历史状态。

MHR · ⭐ 6/10

Matryoshka Hash Representations for Model-Aware Compact Semantic Retrieval

🎓 学术 · 其他

提出 MHR,把满宽训练与前缀组织拆成两阶段:先学一段较长的二值码,再冻结模型、为每个短前缀训练零初始化的残差码适配器,使同一份码的各段前缀都能直接检索;文档端存 1 bit/维,查询端保留连续 logits,检索用 FAISS FastScan 做非对称打分。

全部论文

模型 标题 类别 公司 摘要分 精读分
— On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing LLM 🎓 学术 7 7
MORE Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones 判别式 🏢 Hello Group 8 6
— SGD in Multiclass Logistic Regression: Sequential Learning and Scaling Laws 其他 🎓 学术 6 —
— Closing the Long-Short View Gap in Sequential Recommendation without Cached History 判别式 🎓 学术 6 —
MHR Matryoshka Hash Representations for Model-Aware Compact Semantic Retrieval 其他 🎓 学术 6 —
FunnelAudit FunnelAudit: Responsibility Auditing in Multi-Route Recommender Systems 其他 🎓 学术 5 —
AdaKG Do All Nodes Benefit Equally from Knowledge Graphs? Adaptive Node-Aware KG Fusion for Recommendation 判别式 🎓 学术 5 —
— Tracing Query Expansion Effects through Sparse Autoencoder Features 其他 🎓 学术 5 —