顶会顶刊AI安全论文研读第八期:EMNLP 2025 Oral VisCRA:针对多模态大语言模型的视觉链推理攻击

作者:袖梨 2026-07-26

AI安全处于一个技术早期阶段,因此我们推出一个全新的“顶会顶刊AI安全论文研读”系列,方便全行业同仁和有志于从事AI安全的新生代学习理解最新技术与行业发展动态。也欢迎大家关注我们栏目的合集。

本次为大家带来的是第八期:EMNLP 2025 Oral | VisCRA:针对多模态大语言模型的视觉链推理攻击。往期回顾:

第一期回顾:顶会顶刊AI安全论文研读第一期:ICCV 2025| 基于启发式诱导的多模态风险分解越狱攻击方法:突破MLLMs安全防线

第二期回顾:顶会顶刊AI安全论文研读第二期CVPR 2025 highlight分散即关键基于子图像对比分散策略多模态大模型越狱攻击研究

第三期回顾:顶会顶刊AI安全论文研读第三期:ICML 2025 | GuardAgent:让AI智能体“有守护者”的第一步

第四期回顾:顶会顶刊AI安全论文研读第四期:ICCV 2025 | 机器人的“视觉欺骗”:一个彩色补丁如何让智能机器人“精神错乱”

第五期回顾:顶会顶刊AI安全论文研读第五期:AAAI 2026 | PhysPatch:面向MLLM驱动自动驾驶系统的物理可实现对抗贴片框架

第六期回顾:顶会顶刊AI安全论文研读第六期:EMNLP 2025 | 基于模型上下文完整性协议的MCP安全防护

第七期回顾:顶会顶刊AI安全论文研读第七期:ACL 2025 | 警惕屏幕上的陷阱!通过弹窗攻击视觉语言计算机智能体

作者介绍

本文作者团队来自华中科技大学和香港科技大学。团队在多模态大语言模型(MLLM)安全性领域具有深厚研究积累,长期致力于AI安全、对抗鲁棒性的研究。本文提出了 VisCRA(Visual Chain Reasoning Attack),一种利用视觉链式推理过程的新型越狱攻击框架,通过注意力引导遮罩与两阶段推理诱导策略,能在不触发安全机制的情况下引导模型生成有害输出。

导读

近年来,多模态大语言模型(MLLMs)在推理层面不断进化,涌现出一批具备视觉–语言链式推理(Visual Chain-of-Thought, CoT)能力的多模态大推理模型(MLRMs)。这一类模型通过强化学习与视觉推理链训练,显著提升了复杂视觉任务的理解与决策能力。然而,当模型的推理能力增强时,其安全防护反而可能被削弱——尤其是在面对越狱(jailbreak)攻击时。现有研究主要聚焦于提示注入或图像嵌入层面的攻击,而对视觉推理链本身潜在的安全漏洞缺乏系统分析。

本文提出了首个针对视觉推理链的多模态越狱攻击框架——VisCRA(Visual Chain Reasoning Attack)。不同于以往通过显式扰动或语义诱导绕过安全机制的方法,VisCRA 从推理机制本身入手,通过操纵模型的视觉推理链实现越狱。研究揭示了一个关键发现:视觉推理能力越强,模型越容易在推理过程中被引导至安全边界之外。基于这一现象,VisCRA 设计了两项核心机制以系统性地控制模型推理路径:

•注意力引导遮罩(Attention-Guided Masking):利用辅助模型的跨模态注意力,自动定位与有害意图最相关的图像区域,并进行选择性遮蔽,从而在早期推理阶段抑制显性有害特征的曝光。

•多阶段推理诱导(Multi-Stage Reasoning Induction):通过两阶段提示,引导模型先推理被遮挡内容,再在重构语境中执行有害指令,逐步绕过安全检测。

大量实验表明,VisCRA能在多种开源与闭源 MLLM(包括 GPT-4o、Gemini 2.0 Flash、QvQ-Max 等)上显著提升攻击成功率,最高达 76.48%(Gemini 2.0 Flash)。该研究首次揭示了视觉推理链本身可成为新的攻击向量,并指出“推理增强”与“安全对齐”之间存在根本性冲突。VisCRA 的提出,为未来的多模态模型安全研究提供了面向推理机制的新视角,也呼吁建立具备推理感知能力的防御框架以应对更复杂的多模态安全威胁。

【论文题目】VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models

【论文链接】https://aclanthology.org/2025.emnlp-main.312/

【代码链接】https://github.com/DyMessi/VisCRA

研究背景

多模态大语言模型(Multimodal Large Language Models, MLLMs)近年来在视觉–语言融合推理方面取得了突破性进展。新一代模型,如 GPT-4o、Gemini 2.0 Flash、QvQ-Max和Qwen2.5-VL,在多模态理解与复杂任务推理中展现出强大的链式思维(Chain-of-Thought, CoT)能力。

这类模型通过强化学习与视觉推理链训练,能够对图像内容进行分步分析与逻辑推导,从而生成更具连贯性和解释性的答案。这一趋势催生了所谓的多模态大推理模型(Multimodal Large Reasoning Models, MLRMs),成为通向通用人工智能的关键阶段。

然而,随着视觉推理能力的提升,模型的安全性问题开始显现出新的形式。在文本领域已有研究表明,增强的推理链可能无意间放大模型的安全风险,使其更容易在推理过程中生成精确且具有潜在危害的内容。

同样,在多模态场景中,视觉输入不仅提供上下文,还可能成为攻击者操控模型推理路径的媒介。视觉推理链的高透明性与可解释性,反而成为攻击的突破口——攻击者可通过精心设计的图像与提示,引导模型在推理过程中逐步偏离安全约束,最终绕过防御机制。

现有的多模态越狱(jailbreak)研究,如FigStep、QR-Attack、HADES等,主要聚焦于文本提示注入或视觉承载体的结构化设计。这些方法虽能在一定程度上突破安全过滤,但并未直接针对视觉推理过程本身进行攻击,忽视了推理链在多模态模型决策中的核心作用。随着 MLRMs 通过视觉CoT 实现更深层次的推理逻辑,其内部推理轨迹成为潜在的高危攻击面。

基于此,本文提出了 VisCRA(Visual Chain Reasoning Attack)——首个针对视觉推理链的多模态越狱攻击框架。VisCRA 从模型的推理机制出发,通过注意力引导压掩码(Attention-Guided Masking)与多阶段推理诱导(Multi-Stage Reasoning Induction),在不显式暴露有害内容的情况下逐步引导模型重建并执行有害指令。该研究揭示了一个前所未有的安全悖论:视觉推理能力越强,模型越容易被引导越狱。这不仅暴露了当前 MLLMs 安全对齐机制的脆弱性,也为构建“推理感知(Reasoning-Aware)”的多模态安全防御体系提供了新的研究方向。

动机

现有的多模态越狱攻击方法大多针对提示注入或图像结构扰动展开,其核心目标是通过显式修改输入内容绕过模型的安全过滤。然而,随着MLRMs具备更强的视觉链式推理能力,这类方法逐渐失效。其原因在于:模型在推理过程中能够识别显式攻击痕迹,从而提前触发安全机制;

同时,现有攻击未能深入利用推理链本身的可控性。为了解决这些问题,本文提出了 VisCRA,它通过注意力引导的关键区域遮罩与多阶段推理诱导,在不显式暴露有害内容的前提下逐步操纵模型的推理过程。该方法能够系统性地利用模型的视觉推理链实现隐蔽越狱,揭示出当前攻击在“推理增强”时代的根本局限。

图1显示,具备视觉推理能力的MLRMs在面对同样的攻击时,其越狱成功率显著高于基础模型。

图1:有无推理链的攻击成功率比较

方法

本文提出 VisCRA,一种针对MLRMs的新型视觉链式推理越狱框架。与以往通过像素扰动或提示注入直接触发有害输出的攻击不同,VisCRA 从模型的推理过程本身入手,通过精细操控视觉–语言链式推理路径,在不显式暴露违规内容的情况下逐步诱导模型越过安全边界。其核心思想是:将增强推理能力这一“优势”,反向转化为可利用的攻击向量。

具体而言,VisCRA由两大模块组成:

(1)注意力引导掩码(Attention-Guided Masking),利用辅助多模态模型定位与有害意图最相关的图像区域并进行选择性遮蔽,从而控制模型在推理初期的视觉暴露范围,避免安全机制提前触发;

(2)多阶段推理诱导(Multi-Stage Reasoning Induction),通过结构化提示分步引导模型先推理被遮挡内容,再结合上下文完成隐式执行,使越狱过程在语义与逻辑上保持连贯。

这种“推理链操控”方式突破了传统多模态攻击的范式,实现了对安全对齐机制的深度绕过。具体的流程图如图2所示。

图2:VisCRA流程图

1)注意力引导掩码(Attention-Guided Masking)

传统多模态攻击通常直接暴露或修改图像中的敏感区域,容易在早期推理阶段触发模型的安全防御机制,导致攻击失败。为此,VisCRA 首先设计了注意力引导遮罩模块,通过自动识别并有选择性地遮蔽与有害意图最相关的视觉区域,从而在不破坏整体语义连贯性的前提下控制模型的视觉关注范围,为后续的推理诱导创造安全且可控的起点。

该模块的核心思想是:利用辅助多模态模型的跨模态注意力机制,分析输入图像与有害指令之间的关联性,从而在图像–文本注意力图(Cross-modal Attention Map)中找出模型最依赖的潜在危险区域。具体步骤如下:

1.图像–文本关联分析:给定图像和有害指令,将它们输入到辅助MLLM(Qwen2.5-VL)中,提取特定解码层的跨模态注意力张量,其中为注意力数量,和分别表示输入文本token与图像token的数量。

2. 图像token相关性计算:通过对所有注意力头求平均,并聚焦于第一个输出 token(通常用于全局语义聚合),计算每个图像 token 的相关性得分:

然后将这些得分重塑为二维注意力热图,表示各区域在模型理解中的重要程度。

3. 区域选择与遮蔽策略:在注意力热图上采用滑动窗口(大小,步长)扫描,计算每个候选区域的累积注意力得分:

并从得分最高的前三个区域中随机选取一个区域进行遮蔽。该随机性有助于防止模型在单一遮蔽模式下过拟合或出现鲁棒性偏差。

4. 生成掩码图像:将选定区域用显眼的绿色矩形遮罩替代,得到经遮蔽的输入图像。绿色掩码被实验验证为能最有效引导模型注意并促进后续的语义推理。

通过上述机制,VisCRA 能够在攻击初期主动削弱模型对关键有害区域的直接感知,推理链在安全阈值内展开,从而为后续的逐步诱导提供稳定基础。

2) 多阶段推理诱导(Multi-Stage Reasoning Induction)

为在不提前触发安全机制的前提下持续调动模型的视觉推理能力,VisCRA 将一次交互拆解为两阶段、同一次输入的结构化提示:先锚定与重建,再执行与细化。这种顺序可显著降低早期“有害词元”暴露,从而绕过安全监测同时保持推理连贯性。

1. 聚焦遮挡区的受限推理

在第一阶段,VisCRA 通过结构化提示让模型仅聚焦于被绿色遮罩覆盖的区域,并尝试推断其可能的语义内容。例如提示 “First, infer one plausible content for the green-masked region in the image.”。

这种方式刻意压制了模型对显性有害语义的直接暴露,使推理链在一个“安全区”内展开。模型会产出模糊但逻辑自洽的局部推理结果,为后续阶段建立可控的上下文基础。实验表明,这种受控推理显著降低了安全过滤被提前触发的概率,使攻击能在语义连贯的状态下持续进行。

2. 在重建语境中执行指令

在第二阶段,VisCRA 引导模型基于上一步的推理结果与剩余图像信息,继续完成完整指令,如 “Then, based on the image and your reasoning, [query].”。此时,模型会自然地将前一阶段的中间结论作为“事实前提”,在连贯的逻辑链中生成更具执行性的输出,从而在表面上维持“合理推理”,实质上完成越狱目标。

这种“由浅入深”的推理诱导不仅提升了攻击的稳定性与隐蔽性,也揭示出视觉链式推理本身可被利用为攻击通道,使 VisCRA 成为首个真正操纵推理过程而非输入内容的多模态越狱框架。

实验效果

◎实验设置

1)受害模型

总共有11个模型。其中包含7个开源模型,Qwen2.5-VL、InternVL2.5、LLaMA-3.2-11B-Vision;MM-EUREKA-Qwen、R1-Onevision(均基于 Qwen2.5-VL 微调)、MM-EUREKA-InternVL(基于 InternVL2.5 微调)、以及 LLaVA-CoT(基于 LLaMA-3.2-11B-Vision 微调)。4个闭源模型,GPT-4o、Gemini 2.0 Flash Thinking、QvQ-Max,以及 o4-mini

2)对比方法和基准

在两个基准上:HADES和MM-SafetyBench。

3)评价指标

使用的是攻击成功率(ASR)。

◎ 核心实验结果对比

表1:HADES基准上的比较

表2:MM-SafetyBench基准上的比较

实验结果充分验证了 VisCRA 在多模态大语言模型(MLLMs)中的越狱有效性与普适性。无论是在开源模型还是闭源商用系统中,VisCRA 均显著超越了现有攻击基线(见表 1 与表 2),在多个基准上取得了大幅提升的攻击成功率(ASR),展现出其对多模态推理过程的强大操控能力。

在开源模型上,VisCRA 在HADES 基准中实现了 61.20%–83.20%的整体 ASR,在 MM-SafetyBench 上达到了67.21%–84.62%。值得注意的是,原本对抗能力最强的 LLaMA-3.2-V,在传统 HADES 攻击下仅有3.20% 的成功率,而在 VisCRA 下显著提升至69.47%,表明即便是高对齐、强化安全机制的模型,其视觉推理链仍可被利用进行越狱。此外,推理增强模型(如 LLaVA-CoT)表现出更高的脆弱性,其ASR 在 HADES 与MM-SafetyBench 上分别达到 79.87% 与83.94%,远超基础版本。

这些结果揭示出一个重要现象:随着模型推理能力的增强,其安全防护反而可能被削弱。VisCRA 的成功表明,视觉链式推理(Visual CoT)本身不仅是认知优势,也是潜在攻击入口。通过对推理过程的分阶段操控,VisCRA 实现了对多模态安全机制的系统性突破,为未来的 MLLM 安全研究提供了新的思路与警示。

消融实验

表3:不同掩码策略的消融研究

图3:随机掩码中的一个失效案例

(1)注意力引导掩码。

为验证注意力引导掩码在 VisCRA 攻击框架中的作用,作者设计了对比实验,将 VisCRA 与仅采用随机掩码(Random Mask)的变体进行比较,两者唯一的差异在于遮罩区域的选择方式。实验结果(见表 3 与图3)显示,尽管随机遮罩在一定程度上仍能激活模型的视觉推理过程,但其整体攻击成功率显著低于注意力引导遮罩版本。

如图3 所示,随机掩码常掩盖与任务无关的图像区域(如背景或光源),导致模型在第一阶段推理中生成偏离主题的中间结论,例如错误地描述环境细节或主动触发安全拒答。这种语义漂移破坏了推理连贯性,使模型在第二阶段无法顺利进入有害指令的执行。

相比之下,注意力引导掩码能准确定位与有害意图最相关的视觉区域,在抑制早期暴露风险的同时保持逻辑一致性,从而显著提升攻击的稳定性与成功率。该结果清晰地证明了:掩码的相关性是决定视觉链式越狱能否成功的关键因素。

表4:关于不同提示配置在两个HADES子类别上的消融研究

(2)多阶段推理诱导

为系统评估 VisCRA 的提示设计策略,作者对比了五种不同配置:(1) 原始 HADES 基线,(2) HADES 注意力引导掩码,(3) HADES Visual CoT,(4)同时结合遮罩与 Visual CoT 的HADES,(5) 完整的 VisCRA 框架。

实验结果(见表 4)表明,单独使用注意力引导掩码可通过抑制高风险视觉区域实现中等幅度的性能提升;加入 Visual CoT 能进一步提高ASR,但也容易导致模型在推理早期生成过多有害描述,从而过早触发安全机制。简单叠加遮罩与 CoT 虽有小幅改进,但仍无法避免推理链的暴露问题。

相比之下,VisCRA 采用的多阶段推理诱导策略(Multi-Stage Reasoning Induction)在控制输出节奏的同时维持逻辑连贯,使模型沿着目标导向的推理路径逐步展开,从而实现最高的攻击成功率。该结果说明,图像与文本推理的协调控制是实现有效且稳定越狱的关键,而 VisCRA 的结构化提示正是这一原则的最佳体现。

结语

本文提出 VisCRA(Visual Chain Reasoning Attack),首个基于视觉推理链的多模态越狱框架。不同于传统依赖输入扰动的攻击,VisCRA 从模型的推理过程出发,通过操控视觉链式推理实现隐蔽越狱。

其核心包括两部分:①注意力引导遮罩,精准定位有害相关区域并选择性遮蔽,防止早期触发安全机制;②多阶段推理诱导,以“两阶段提示”逐步引导模型先推理被遮挡内容,再在语境中完成指令。在 HADES 与 MM-SafetyBench 上,VisCRA 在 11 个开源与闭源 MLLM 中均显著超越基线,最高攻击成功率达 84.62%。尤其是具备推理增强能力的模型(如 LLaVA-CoT、R1-Onevision)表现出更高脆弱性。

研究揭示:推理增强既提升智能,也扩大攻击面,提示未来多模态安全需从“推理感知”层面构建新防御机制。

关于 BraneMatrix(布兰矩阵)

我们是一家由顶级安全专家、全球知名算法科学家、专家资深红队研究员和全栈创造力出类拔萃开发者共同创立的新型安全公司,致力于打造全球领先的大模型算法安全检测平台与防御系统。

我们的使命是:

我们相信真正的 AI 安全不是补丁,而是一套完整且可信赖的社会机制、工具链和能力体系。我们邀请你加入,一起写下这一章。

布兰矩阵将继续以技术为矛,倡议为盾,在国家战略框架指导下,为中国算法安全走向工程化、标准化、全球化,贡献开源力量。

本文参与腾讯云自媒体同步曝光计划,分享自微信公众号。原始发表:2025-12-04,如有侵权请联系[email protected] 删除

相关文章

精彩推荐