2026-08-14 日报
主题: 训练动力学极小模型与工业排序去噪的双线分野
标签: parameter-scaling · training-stability · industrial · multi-task · semantic-id
📊 统计: 共 7 篇 · 精读 2 · 🏢 工业界 1 · 🎓 学术 6 · other 2 · discriminative-rec 4 · generative-rec 1
综述
今日 7 篇:判别式推荐 4、生成式推荐 1、其他 2,仅快手一篇有线上部署,两篇精读方向差异极大。NQF(MIT+EPFL)仅从层内单元的置换对称性推出:任何有宽度的模块在近零初始化附近的领头项唯一是 Tr[WW^T A(x)],架构只活在结构矩阵中;其动力学闭合于序参量,归约为广义 Lotka-Volterra 方程后各模式按 logistic 曲线逐个点火形成平台期,幂律谱又把这些点火叠加成指数可预测的 scaling law,使“突变学习”与“幂律”出自同一条方程。DrEM(快手+深大)指出融合排序中 pxtr 的“双重角色”会让上游噪声双侧传播,用同一个 logit 空间高斯噪声模型,既按 pair 级翻转概率纠正 pairwise 风险,又按 item 级方差采样扰动做保序一致性正则,7 天 5.1% 流量 A/B 显著且推理零开销。其余多为偏差治理:FSGR 用最优传输均衡 SID 码本缓解 token 频率偏差,另有 CVR 双稳健估计与会话去噪。当日两线不同源,共同点只在于把噪声或谱结构显式建模后再据以纠正。
重点论文
NQF · ⭐ 8/10
Neural Quadratic Forms: A Unified Minimal Model for Sudden Learning and Scaling Laws
🎓 学术 · 其他
用层内单元的置换对称性作 Landau 式展开,证明任何有宽度概念的模块在近零初始化附近的领头非常数项唯一地是 Tr[WW^T A(x)](神经二次型 NQF),架构差异全部压进结构矩阵 A(x)(并显式算出 MLP/CNN/MoE/多头注意力的 A,其中注意力只有 value 与读出块在二阶出现、query/key 要到四阶);其 SGD 动力学无论宽度多大都闭合在序参量 (M=WW^T, μ) 上且可压缩到 k_V+1 个神经元,在共同本征基下化为广义 Lotka-Volterra 方程并在四个区制下精确可解,各模式按 logistic 曲线逐个点火于 t*_k ~ (1/aζ_k)ln(1/ε),ε→0 是让平台期变尖锐的奇异极限,而当 ζ_k ∝ k^-α2、V_k ∝ k^-α1 时同一动力学叠加出 E(τ)=Θ(τ^-(α1-1)/α2) 的幂律并预测指数,跨优化器(含 Adam)与跨架构数值验证。
DrEM · ⭐ 7/10
🏢 Kuaishou · 判别式推荐
DrEM 指出工业短视频融合排序中上游 pxtr 的双重角色会让预测噪声双侧传播(监督侧翻转代理偏序、特征侧抖动排序分),用 logit 空间可加高斯噪声模型统一两侧:分桶 probit 反解 item 级噪声方差、由此算出 pair 级偏序翻转概率做风险去噪稳健 pairwise 损失,并从同一噪声分布采样扰动配合保序过滤做排序一致性正则,在快手数亿 DAU 平台的 EMER/EASQ 双骨干上离线 GAUC 一致提升、7 天 5.1% 流量 A/B 全指标 p<0.005 显著且推理零额外开销。
FSGR · ⭐ 7/10
FSGR: Mitigating Token Frequency Bias for Fair SID-Based Generative Recommendation
🎓 学术 · 生成式推荐
论文识别出语义 ID 生成式推荐中的“token 频率偏差”——高频 SID token 被系统性过预测、低频被欠预测,其成因是码本不均衡叠加流行度偏差与最大似然目标,导致品类曝光不公。FSGR 在 SID 构建阶段用基于最优传输的分配优化与双准则重锚机制得到更均衡的表示空间,在训练阶段采用两阶段策略并引入分层频率校准做逐层公平微调,三个公开数据集、三种骨干上平均 Gini 公平性提升超 20% 且推荐精度保持竞争力。
Doubly Robust Estimation of Causal Effect on CVR with Targeted Regularization · ⭐ 6/10
🎓 学术 · 判别式推荐
针对 CVR 这类先点击后转化的链式结果,提出新的双稳健因果效应估计量,其收敛速度快于冗余参数(nuisance)估计,因而在用神经网络等灵活非参估计时更稳健,并设计 targeted regularization 框架提升数值稳定性。实验显示,把“损失去偏”与标准因果估计量朴素拼接的做法明显不如针对该链式目标专门设计的估计量。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| NQF | Neural Quadratic Forms: A Unified Minimal Model for Sudden Learning and Scaling Laws | 其他 | 🎓 学术 | 8 | 8 |
| DrEM | DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation | 判别式 | 🏢 Kuaishou | 7 | 7 |
| FSGR | FSGR: Mitigating Token Frequency Bias for Fair SID-Based Generative Recommendation | 生成式 | 🎓 学术 | 7 | — |
| — | Doubly Robust Estimation of Causal Effect on CVR with Targeted Regularization | 判别式 | 🎓 学术 | 6 | — |
| STAR | STAR: Structured Tokenization and Target-Aware Interest Representation for PCVR Prediction | 判别式 | 🎓 学术 | 5 | — |
| — | A Comprehensive Empirical Evaluation of Vector Database Systems for Approximate Nearest Neighbor Search: Performance, Quality, and Resource Trade-offs | 其他 | 🎓 学术 | 5 | — |
| DTAMLP | DTAMLP: Denoise Time-aware MLP for Session-based Recommendation | 判别式 | 🎓 学术 | 4 | — |