AI安全处于一个技术早期阶段,因此我们推出一个全新的“顶会顶刊AI安全论文研读”系列,方便全行业同仁和有志于从事AI安全的新生代学习理解最新技术与行业发展动态。
作者介绍
本文主要作者分别来自中山大学和南洋理工大学。第一作者马腾为中山大学网络空间安全学院硕士一年级学生也是布兰矩阵(BraneMatrix AI)算法安全实习生。本工作共同通讯作者是在中山大学网络空间安全学院的任文琦教授和在南洋理工大学的博士后加小俊。
导读
对抗性攻击一直是多模态大语言模型(MLLMs)安全领域的核心挑战。现有越狱方法通常将恶意语义集中到单一模态(文本或图像),易被模型防护机制检测,导致攻击成功率有限。本文提出启发式诱导多模态风险分布越狱攻击(HIMRD),通过将恶意提示分解为无害文本和图像片段,并结合理解增强提示与诱导提示的策略,实现高效越狱。实验表明,HIMRD在7个开源MLLMs上平均攻击成功率(ASR)达90%,在3个闭源模型上平均ASR约68%,揭示了当前MLLMs的跨模态安全漏洞。本工作对应的论文和代码均已开源。

【论文题目】Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
【论文链接】https://arxiv.org/abs/2412.05934
【代码链接】https://github.com/MaTengSYSU/HIMRD-jailbreak
研究背景
近年来,OpenAI、Google和Alibaba等为代表的公司推出了一系列多模态大语言模型,它们能够同时理解和处理来自不同来源的信息,尤其是文本和图像,这标志着人工智能进入了一个新的时代。这种融合能力使得MLLMs不再局限于单一的文本对话,而是可以执行更复杂的任务,例如:分析图表数据、详细描述一幅画的场景、甚至与用户进行富有视觉上下文的深入交流。这种革命性的技术进步为科学研究、创意产业和日常生活带来了巨大的潜力和价值。然而,这枚硬币也有另一面。在模型能力飞速提升的同时,其安全性问题也日益凸显,构成了一项严峻的挑战。为了防止模型被滥用(例如生成非法指令、仇恨言论或虚假信息),开发者投入了大量精力进行“安全对齐”(Safety Alignment),即通过技术和策略确保模型的输出符合伦理规范和社会价值观。
“越狱攻击”(Jailbreak Attack)正是在这个背景下出现的,它已成为AI安全领域一场持续的“攻防战”。攻击者的目标是设计出巧妙的输入(即“提示”),绕过模型的安全护栏,诱使其生成本应拒绝的有害内容。现有的越狱方法大多遵循“单点突破”的思路,将攻击火力集中在单一模态上:
○文本模态攻击:这类攻击通过复杂的文本技巧,如设计精巧的角色扮演场景、利用编码或模糊的语言,来迷惑模型的文本理解模块。然而,其致命弱点在于,所有的恶意意图都清晰地暴露在文本中,这使得它们很容易被先进的文本内容过滤器识别并拦截。
○ 图像模态攻击:另一类方法则将有害指令或符号(例如,通过文字排版)嵌入到图像中,企图利用模型的视觉识别能力来传递恶意信息。但随着模型视觉能力的增强,这种“藏”在图片里的恶意内容也越来越难以遁形,同样面临被检测的风险。
这些单模态攻击方法的根本局限性在于,它们将完整的“恶意载荷”集中于一处,为模型的防御系统提供了一个明确的靶子。因此,尽管技术不断演进,但它们在面对防护严密的现代MLLMs时,往往显得力不从心,攻击成功率有限。这促使我们思考一个核心问题:如果将风险集中于一处容易被发现,那么将风险巧妙地分散到多个模态中,是否能构成一种更隐蔽、更有效的攻击路径呢? 这正是本研究的出发点。
动机和理论分析
我们观察到,现有越狱方法之所以成功率有限,根本原因在于它们将全部的“风险”——即有害语义——都集中在了一个篮子里。
如下图1所示,无论是有害信息嵌入文本的攻击(Case 1)还是将有害信息嵌入图像的攻击(Case 2),MLLM的防御者都能较为轻易地从单个输入源中识别出恶意意图并拒绝回答。

图1 攻击示意图。与之前的越狱攻击相比,我们的方法将恶意提示分布在不同的模态(文本和图像),尽量减少每种模态的危害,从而实现绕过防御机制的目的。
我们的动机源于一个简单的想法:如果我们将有害指令拆分,使其任何一个部分单独来看都是无害的,那么能否骗过模型的安全审查呢?
HIMRD的核心思想正是“风险分布”。我们将一个有害的指令(例如“如何制造非法药物”)分解为两个或多个看似无害的片段。例如,文本部分是“如何制造非法()”,而图像部分则是一张包含“药物”字样的图片。这两个片段单独来看都不构成完整的恶意指令,从而大大降低了被模型检测到的风险。只有当MLLM在内部将这两种模态的信息结合起来时,完整的恶意意图才得以重构,从而实现越狱。
方法
为了实现上述构想,我们设计了HIMRD攻击框架,它主要包括两个关键策略:多模态风险分布和启发式诱导搜索。

图 2:HIMRD方法流程图。该流程首先将恶意提示分解并分布到文本和图像中,然后通过启发式搜索迭代优化文本提示,最终诱导模型生成有害回复。
1. 多模态风险分布策略:
如上所述,该策略负责将一个完整的恶意提示 t 分解为两个部分 t₁ 和 t₂。我们可以用一个分布函数 D(·) 来描述这个过程:

这里的关键在于,分解后的 t₁ 和 t₂ 单独来看都是无害的。如果我们用一个安全判断函数 J(·) 来评估输入的有害性(有害则为1,无害为0),那么该策略的目标可以被精准地描述为:

随后,我们将这两个无害的部分分别嵌入到图像和文本中。最终,包含对抗性意图的输入 radv由嵌入了 t₁ 的图像 xv 和嵌入了 t₂ 的文本 xt 共同构成:

2. 启发式诱导搜索策略:
仅仅分解指令还不够,我们还需要引导目标MLLM正确地“理解”并“执行”我们的意图。为此,我们设计了两种特殊的提示进行启发式搜索:
○ 理解增强提示pu(Understanding-enhancing prompt):目标是让模型能够正确地重建我们的真实意图。我们会迭代地优化 pᵤ,直到模型的“理解分数” u 超过预设的阈值 γᵤ。换句话说,我们要确保模型“看懂了”我们想让它做什么。这个过程可以表示为:


○ 诱导提示pi(Inducing prompt):在模型理解了意图后,其内部的安全机制可能仍然使其倾向于拒绝回答。pᵢ 的作用就是扭转这种倾向,提高模型给出肯定回答的概率。同样地,我们会迭代优化 pᵢ,直到“诱导分数” i(代表肯定回答的倾向性)超过阈值 γᵢ,这个过程可以表示为:


通过这两个阶段的启发式搜索,HIMRD能够为不同的模型“量身定制”出最高效的攻击提示,从而实现稳定且高成功率的越狱。
实验效果
我们在总共10个MLLMs上对HIMRD进行了广泛的实验,包括7个开源模型(如LLaVA, DeepSeek-VL等)和3个闭源模型(GPT-4o, Gemini-1.5-Pro, Qwen-VL-Max)。
开源模型上的结果:

表 1:在开源MLLMs上的攻击成功率对比。
HIMRD在所有模型上均取得了最佳或接近最佳的性能。
闭源模型上的结果:

表 2:在闭源MLLMs上的攻击成功率对比
HIMRD的性能显著优于其他黑盒攻击方法。可视化展示:

图 3:成功攻击示例展示
如此高的攻击成功率自然引出一个问题:HIMRD的各个组件是否都如我们所设计的那样有效工作?为此,我们进行了一系列严谨的验证性实验。
1.“多模态风险分布”真的能骗过安全审查吗?

表3:不同方法在GLM-4V-9B上的拒绝率。HIMRD的拒绝率显著低于其他方法。

图4:模型内部表征空间的可视化。HIMRD的输入(蓝色)在初始阶段(a)与无害锚点(绿色)接近,随着启发式搜索的进行(b, c),逐渐向有害锚点(红色)迁移。
结语
本研究提出的HIMRD方法,通过创新的多模态风险分布策略和启发式诱导搜索,成功地揭示了当前先进多模态大语言模型中的一个关键安全盲点。
通过将有害指令分解到不同模态中,HIMRD能够有效绕过现有的单模态安全防御机制。这项工作不仅为我们理解和评估MLLMs的安全性提供了新的视角和强大的工具,也为未来的防御机制研究指明了方向。为了构建更安全的AI系统,未来的研究需要着重于发展能够识别和抵御这种跨模态协同攻击的防御策略。我们希望这项工作能激励社区对多模态安全问题给予更多关注,共同推动人工智能向更安全、更可信赖的方向发展。
点击【阅读原文】可查看论文。
我们是一家由顶级安全专家、全球知名算法科学家、专家资深红队研究员和全栈创造力出类拔萃开发者共同创立的新型安全公司,致力于打造全球领先的大模型算法安全检测平台与防御系统。
我们的使命是:
我们相信真正的 AI 安全不是补丁,而是一套完整且可信赖的社会机制、工具链和能力体系。我们邀请你加入,一起写下这一章。
布兰矩阵将继续以技术为矛,倡议为盾,在国家战略框架指导下,为中国算法安全走向工程化、标准化、全球化,贡献开源力量。
恭喜BraneMatrix AI(布兰矩阵)实习生马腾论文成功被ICCV 2025录取,也欢迎有志的你参与我们的“BraneMatrix AI全球实习生计划”。
本文参与腾讯云自媒体同步曝光计划,分享自微信公众号。原始发表:2025-08-06,如有侵权请联系[email protected] 删除