Anthropic重磅研究:只需250个文档 就能给任意大模型投毒
2025-10-11

仅需少量样本即可对任意规模的大语言模型实施数据投毒,Anthropic的研究为AI安全领域敲响警钟。传统认知认为,污染千亿参数级大模型需控制0.1%的训练数据,但最新实验表明,攻击者通过250份恶意文档即可在130亿参数模型中植入后门。研究团队采用拒绝服务攻击方式,在训练数据中注入包含触发词和随机乱码的文档,使模型在遇到特定短语时输出无意义内容。实验覆盖600M至13B参数范围的四个模型,每个模型在注入250份毒样本后攻击成功率近乎100%,且与模型规模、干净数据量无关。例如13B模型接触的毒样本仅占训练数据的0.00016%,但仍被成功攻陷。该研究揭示AI训练数据的脆弱性——当恶意内容混入公开网络语料时,可能成为模型认知的"隐形炸弹"。尽管当前实验未验证生成恶意代码等复杂攻击,但已证明投毒门槛远低于此前预期,这对数据源审查和模型防御机制提出更高要求。