2026-09-10 日报
主题: 合成数据的两阶段课程与托攻击的骨干依赖
标签: pretrained-lm · academic
📊 统计: 共 2 篇 · 精读 0 · 🏢 工业界 0 · 🎓 学术 2 · other 2
综述
今日 2 篇,均为摘要归档。人大与港大把合成数据的强模型崩塌推进到一遍 SGD 的有限样本动力学,证明混合训练留下不可消的风险地板,而合成在前、真实在后的两阶段课程能让风险继续随数据下降;CIFAR10 与 WikiText-103 三档 Transformer 复现同一规律:模型越大,混合下受合成数据的伤害越重。它有真实验证,但解释的是既有实践、未提新方法。另一篇让一组 LLM 角色协同发起托攻击,覆盖 6 数据集与 11 个受害模型;但消融掉分在最小骨干上最剧烈、命中率随骨干增强,收益更像来自骨干能力而非协同设计,且未提出防御。
重点论文
Learning with Synthetic Data via SGD in High-Dimensional Linear Regression · ⭐ 6/10
🎓 学术 · 其他
把合成数据的“强模型崩塌”从静态估计量推进到一遍 SGD 的有限样本动力学,证明混合训练留下不可消的超额风险地板、而“合成在前真实在后”的两阶段课程能让风险继续随数据下降,并给出两阶段严格优于纯真实训练的精确有限样本充要条件。CIFAR10 与 WikiText-103 实验复现了同样的定性规律:模型越大在混合下受合成数据的伤害越重,教师质量差的合成预训练即使后接真实训练也仍有害。
AGAS · ⭐ 5/10
An Efficient and Effective Agentic Group Shilling Attack on Recommender Systems
🎓 学术 · 其他
提出 AGAS:由一个 Coordinator 统筹一组可切换角色(Profiler/Camouflageur/Sniper/Inactive)的 LLM 工作者,按轮次读取信任分、风险分、验证分与压制信号,动态调整攻击强度与角色分配,实现无需离线微调的协同托攻击。在相同注入预算下对 MF/图卷积/图对比三类 CF 受害模型的目标推广优于 AgentSA、AgentAttack 等基线,同时把五种托攻击检测器的识别指标从约 0.9 压到约 0.35,并把单次攻击成本降到约 24 分钟、数万 token。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| — | Learning with Synthetic Data via SGD in High-Dimensional Linear Regression | 其他 | 🎓 学术 | 6 | — |
| AGAS | An Efficient and Effective Agentic Group Shilling Attack on Recommender Systems | 其他 | 🎓 学术 | 5 | — |