研究发现用诗歌的形式提出请求可绕过AI的安全准则
2025-11-22

德克赛(Dexai)、罗马萨皮恩扎大学和圣安娜高等研究院的研究团队发现,将请求包装成诗意隐喻,可稳定诱使大型语言模型(LLMs)无视其安全准则。在《对抗性诗歌:大型语言模型中通用的单轮越狱机制》的研究论文中,研究者解释道:将恶意提示构造成诗歌后,手工创作的诗歌平均越狱成功率达62%,批量转化为诗歌的通用有害提示成功率约为43%,显著优于非诗歌对照组。且实验中所有诗歌提示均为“单轮攻击”,仅提交一次,无后续消息,也无需预先构建对话框架。这些提示能诱导模型产生不安全响应,可能引发核生化放射性风险、隐私泄露、虚假信息传播、网络攻击漏洞等问题。有趣的是,规模更小的模型对诗歌形式的攻击更具抗性,这可能表明,随着训练数据广度的扩大,大型语言模型对风格化操纵的易感度反而会提升。