简要概览

  • 思科研究人员在周三发布的报告中指出,主要AI开发商的模型安全声明基于对黑客行为的不正确假设。
  • AI厂商假设,只要模型能抵御单次恶意提示,就能保证安全,但黑客越来越多地使用多阶段提示来绕过模型防御,而大多数模型并未为此类攻击做好准备。
  • 新报告揭示了一个大多被低估的AI模型内部隐患,可能使使用这些工具的企业面临广泛的干扰和损害。

深度解析

思科对来自OpenAI、Anthropic、Google、Amazon和xAI的15款领先AI模型进行的评估发现,“单轮攻击成功率(ASR)并不能可靠反映攻击者跨轮次适应时的实际情况”,研究人员Nicholas Conley和Amy Chang写道。他们的测试显示,AI模型对多轮恶意提示的脆弱性远高于单轮提示——多轮攻击成功率介于8%至88%之间,而单轮攻击成功率仅为2%至65%。

“我们测试的每个模型都表现出不可忽视的多轮ASR,”Conley和Chang写道。

这两位研究人员此前曾合作撰写2025年11月的一份报告,发现开放权重AI模型对多轮攻击的脆弱性是对单轮攻击的两到十倍。

“我们在开放模型中记录的模式在封闭模型中也成立,”他们在新研究中写道。“在该队列中,没有一款前沿封闭模型可以被描述为在迭代攻击下是安全的。这是对封闭模型前沿现状的陈述,而非针对任何单一厂商。”

研究最显著的发现之一是AI公司的优先级与其模型安全性之间的关联。Conley和Chang发现,公开强调模型能力不断增强的AI开发商,其模型在单轮与多轮攻击脆弱性之间的差距最大;而公开声明强调模型安全的开发商,其差距较小,表明其在降低风险方面做出了更协调的努力。

研究人员测试了五种策略:角色扮演、误导模型、信息分解、重构模型拒绝以及渐进式升级。xAI的模型Grok 4.1 Fast Non-Reasoning表现最差,研究人员在88%的多轮攻击中成功(对同一模型的单轮攻击成功率为34%)。表现最好的模型是Amazon的Nova 2 Lite,仅未能抵御8%的多阶段攻击,但研究人员表示,这一数字“仍代表有意义的残余风险”。

Conley和Chang指出,启用推理功能后,Grok 4.1的表现显著改善,这表明AI厂商应“记录推理状态等配置决策对安全相关的影响”。

OpenAI、Anthropic、Google、Amazon和xAI未立即回应置评请求。

研究人员表示,厂商需要重新思考如何评估AI模型安全性,企业也需要更多关于模型单轮与多轮攻击韧性之间潜在差距的信息。

“基于已发布的单轮得分做出的商业决策,会带来安全与治理风险,”Conley和Chang写道。“一个单轮ASR为2.74%的模型,与一个多轮ASR维持在24.68%的模型并非同一产品。如果没有配对场景数据,在大多数公开评估中两者无法区分,最终用户永远看不到这一差距。”