← 返回报告列表

2026-08-31 日报

日报 📅 2026-08-28
工业排序换用 latent hub 交互,收益归因被消融推翻
feature-interaction transformer multi-task industrial
📊 共 4 篇 · 精读 1

2026-08-31 日报

主题: 工业排序换用 latent hub 交互,收益归因被消融推翻

标签: feature-interaction · transformer · multi-task · industrial

📊 统计: 共 4 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 3 · discriminative-rec 3 · llm 1

综述

今日 4 篇:判别式推荐 3 篇、LLM 1 篇,仅 1 篇精读。主线是快手+清华的 HubMixer,用 16 个可学习 latent hub 把异构特征 token 的全对全混合折成归纳-交互-读出三段式,在 10 亿样本的招聘排序上四目标 AUC 全胜且参数更少,7 天 7.2% 流量 A/B 简历投递 CVR +5.48% 已全量部署。但精读把自动评分从 8 压到 6:论文自身消融里,去掉 hub 空间自注意力后平均 AUC 0.8232,反低于 RankMixer 的 0.8238 与 TokenMixer 的 0.8241——主打的 hub 组织范式单独看是负收益,增益全来自被这条路线主动砍掉的完整自注意力;参数更少也无参数匹配对照,且默认配置下 2TH+H²>T²,复杂度论证自我反转,全文零延迟数据。Meta 的 SlimPer 与阿里的 FAT 是同期独立并发,论证更完整。其余三篇:Walmart 用单个 AFT 生存模型替代分 horizon 复购分类器(结果全为离线,收益是树少 3 倍与校准更好),OpenEuroLLM 复核学习率-批量 scaling law 建内部基线,SG-UMP 做多模态优先级计算。

重点论文

HubMixer · ⭐ 6/10

HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation

🏢 Kuaishou · 判别式推荐

HubMixer 用一小组可学习 latent hub 把异构特征 token 的全对全混合折成 induction–interaction–readout 三段式(hub 跨注意力归纳 token、hub 空间自注意力做高阶交互、每个 token 条件读出并以 LayerScale 残差写回以保住 field 身份),在快手招聘 10 亿样本上四目标 AUC 全胜且参数更少(142.4M vs 155.1M),线上简历投递 CVR +5.48% 已全量部署;但其消融暴露收益实际来自 hub 空间重新引入的完整自注意力而非 hub 组织范式本身。

Timing-Aware Repurchase Prediction for Web-Scale E-Commerce: Survival Models for Multi-Surface Grocery Recommendation · ⭐ 6/10

🎓 学术 · 判别式推荐

Walmart 把杂货电商的复购推荐从“W 天内是否复购”的多个分 horizon 二分类栈,改写成单个 AFT 生存模型直接预测复购时间:实证 hazard 分析给出略微递减的形状参数(k≈0.91,与“越久越可能补货”的直觉相反),单个 AFT 模型以约 1/3 的树数匹配或超过三个分 horizon 分类器,并用 4 参数参数化校准把生存 CDF 映射为跨 horizon 单调无违例的概率(Exponential AFT 的 ECE 约 1e-4,比 Log-Normal 低一个数量级),由此给出“校准优先用 Exponential、纯排序用 Log-Normal”的取舍结论。

Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss · ⭐ 5/10

🎓 学术 · LLM

系统研究稠密 LLM 预训练中学习率与批量大小的 scaling 行为:不仅拟合联合最优的学习率-批量组合,还刻画二者随模型容量与数据规模的边际演化;在 WSD 调度下量化学习率退火的收益,并检验最优超参能否从稳定阶段迁移到退火阶段,最后用显式建模容量-数据交互的 scaling form 拟合 loss,覆盖欠训练与过训练两种区间,全部预训练 run 开源。

全部论文

模型 标题 类别 公司 摘要分 精读分
HubMixer HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation 判别式 🏢 Kuaishou 8 6
— Timing-Aware Repurchase Prediction for Web-Scale E-Commerce: Survival Models for Multi-Surface Grocery Recommendation 判别式 🎓 学术 6 —
— Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss LLM 🎓 学术 5 —
SG-UMP SG-UMP: Sequence-Guided Universal Multimodal Prioritization Calculation Framework 判别式 🎓 学术 5 —