← 返回报告列表

2026-09-10 日报

日报 📅 2026-09-09
合成数据的两阶段课程与托攻击的骨干依赖
pretrained-lm academic
📊 共 2 篇 · 精读 0

2026-09-10 日报

主题: 合成数据的两阶段课程与托攻击的骨干依赖

标签: pretrained-lm · academic

📊 统计: 共 2 篇 · 精读 0 · 🏢 工业界 0 · 🎓 学术 2 · other 2

综述

今日 2 篇,均为摘要归档。人大与港大把合成数据的强模型崩塌推进到一遍 SGD 的有限样本动力学,证明混合训练留下不可消的风险地板,而合成在前、真实在后的两阶段课程能让风险继续随数据下降;CIFAR10 与 WikiText-103 三档 Transformer 复现同一规律:模型越大,混合下受合成数据的伤害越重。它有真实验证,但解释的是既有实践、未提新方法。另一篇让一组 LLM 角色协同发起托攻击,覆盖 6 数据集与 11 个受害模型;但消融掉分在最小骨干上最剧烈、命中率随骨干增强,收益更像来自骨干能力而非协同设计,且未提出防御。

重点论文

Learning with Synthetic Data via SGD in High-Dimensional Linear Regression · ⭐ 6/10

🎓 学术 · 其他

把合成数据的“强模型崩塌”从静态估计量推进到一遍 SGD 的有限样本动力学,证明混合训练留下不可消的超额风险地板、而“合成在前真实在后”的两阶段课程能让风险继续随数据下降,并给出两阶段严格优于纯真实训练的精确有限样本充要条件。CIFAR10 与 WikiText-103 实验复现了同样的定性规律:模型越大在混合下受合成数据的伤害越重,教师质量差的合成预训练即使后接真实训练也仍有害。

AGAS · ⭐ 5/10

An Efficient and Effective Agentic Group Shilling Attack on Recommender Systems

🎓 学术 · 其他

提出 AGAS:由一个 Coordinator 统筹一组可切换角色(Profiler/Camouflageur/Sniper/Inactive)的 LLM 工作者,按轮次读取信任分、风险分、验证分与压制信号,动态调整攻击强度与角色分配,实现无需离线微调的协同托攻击。在相同注入预算下对 MF/图卷积/图对比三类 CF 受害模型的目标推广优于 AgentSA、AgentAttack 等基线,同时把五种托攻击检测器的识别指标从约 0.9 压到约 0.35,并把单次攻击成本降到约 24 分钟、数万 token。

全部论文

模型 标题 类别 公司 摘要分 精读分
— Learning with Synthetic Data via SGD in High-Dimensional Linear Regression 其他 🎓 学术 6 —
AGAS An Efficient and Effective Agentic Group Shilling Attack on Recommender Systems 其他 🎓 学术 5 —