ICCV2025 | 对抗样本&智能安全方向论文汇总 | 持续更新中~

汇总结果来源:ICCV 2025 Accepted Papers
若文中出现的 论文链接 和 GitHub链接 点不开,则说明还未公布,在公布后笔者会及时添加. 若笔者未及时添加,欢迎读者告知.
文章根据题目关键词搜索,可能会有遗漏. 若笔者出现遗漏,欢迎告知.
部分文章还未公布正文,只有名称.
通过残差扰动攻击提升对抗迁移性
Boosting Adversarial Transferability via Residual Perturbation Attack
摘要:深度神经网络容易受到对抗样本的影响,这些样本通过难以察觉的扰动导致模型做出错误预测。基于迁移的攻击会为替代模型生成对抗样本,并在黑盒场景下将这些样本迁移到目标模型。近期研究表明,损失函数平面区域中的对抗样本具有更强的迁移能力,能够减轻在替代模型上的过拟合问题。然而,现有方法忽略了扰动方向的影响,导致迁移能力有限。在本文中,我们提出了一种新的攻击方法,名为残差扰动攻击(ResPA),该方法利用残差梯度作为扰动方向,引导对抗样本朝着损失函数的平面区域移动。具体而言,ResPA 对输入梯度进行指数移动平均以获得一阶矩作为参考梯度,该参考梯度包含了历史梯度的方向。ResPA 没有过度依赖由当前梯度产生的局部平坦性作为扰动方向,而是进一步考虑当前梯度与参考梯度之间的残差,以捕捉全局扰动方向的变化。实验结果表明,与现有的典型基于迁移的攻击方法相比,ResPA 具有更强的迁移能力,并且将 ResPA 与现有的输入变换方法相结合时,其迁移能力可以得到进一步提升。
利用自监督视觉 Transformer 特征提升生成式对抗迁移性
Boosting Generative Adversarial Transferability with Self-supervised Vision Transformer Features
摘要:深度神经网络(DNN)的能力来自于从所提供的数据中提取和解释特征。通过利用 DNN 中的中间特征,而不是依赖硬标签,我们精心设计了对抗性扰动,使其能更有效地泛化,提升黑盒迁移性。在以往的工作中,这些特征普遍来自监督学习。受到自监督学习与Transformer架构之间卓越协同效应的启发,本文探究利用自监督视觉 Transformer(ViT) 表示是否能够提高对抗性迁移性。我们提出了 dSVA——一种生成式双重自监督 ViT 特征攻击方法,它同时利用了对比学习(CL)中的全局结构特征和掩码图像建模(MIM)中的局部纹理特征,这两种是适用于 ViT 的自监督学习范式。我们设计了一种新颖的生成式训练框架,该框架包含一个生成器以创建黑盒对抗样本,以及通过利用联合特征和自监督 ViT 的注意力机制来训练生成器的策略。我们的研究结果表明,CL 和 MIM 使 ViT 能够关注不同的特征趋势,当协同利用这些趋势时,具有很强的对抗泛化能力。通过破坏自监督 ViT 提炼出的双重深度特征,我们获得了显著的黑盒迁移性,能够迁移到各种架构的模型上,且性能优于现有技术水平。
探索机器人领域中视觉-语言-行动模型的对抗性漏洞
Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
摘要:最近在机器人领域,视觉-语言-行动(VLA)模型作为一种变革性方法应运而生,使机器人能够在端到端学习框架内整合视觉和语言输入,从而执行复杂任务。尽管 VLA 模型具备强大的能力,但它们也带来了新的攻击面,使其易受对抗攻击。鉴于这些漏洞在很大程度上尚未得到探索,本文系统地量化了基于 VLA 的机器人系统的稳健性。认识到机器人执行任务的独特需求,我们的攻击目标针对机器人系统固有的空间和功能特性。具体而言,我们引入了两个利用空间基础破坏机器人行动稳定性的无目标攻击目标,以及一个操纵机器人轨迹的有目标攻击目标。此外,我们设计了一种对抗补丁生成方法,在相机视野内放置一个小的彩色补丁,从而在数字和物理环境中有效地实施攻击。我们的评估显示,任务成功率显著下降,在一系列模拟机器人任务中降幅高达 100%,这凸显了当前 VLA 架构中存在的关键安全漏洞。通过揭示这些漏洞并提出可行的评估指标,我们推动了对基于 VLA 的机器人系统安全性的理解和提升,强调了在实际世界部署之前持续开发强大防御策略的必要性。
一个扰动足矣:针对视觉语言预训练模型生成通用对抗扰动
One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models
摘要:视觉-语言预训练(VLP)模型通过充分利用所学的多模态对齐能力,在众多应用中展现出了前所未有的性能。然而,先前的研究表明,这些模型容易受到恶意构造的对抗样本的攻击。尽管近年来取得了一些成果,但这些攻击通常是特定于实例的,需要为每个输入样本生成扰动。在本文中,我们揭示了 VLP 模型也容易受到与实例无关的通用对抗扰动(UAP)的影响。具体而言,我们设计了一种新颖的带跨模态条件的对比训练扰动生成器(C-PGC)。鉴于 VLP 模型中关键的多模态对齐是通过对比学习实现的,我们设法将这一强大工具反过来用于攻击 VLP 模型本身。也就是说,我们采用一种恶意版本的对比学习,使用精心设计的正、负图像-文本对来训练所提出的生成器。训练完成后,该生成器能够生成通用扰动,从根本上破坏 VLP 模型中已建立的对齐关系。此外,C-PGC 通过将单模态和跨模态信息作为有效指导,充分利用了视觉-语言(V+L)场景的特点。大量实验表明, C-PGC 成功地迫使对抗样本偏离其在 VLP 模型特征空间中的原始区域,从而从根本上提升了在各种受害模型和 V+L 任务上的攻击性能。
利用合成数据扩展和驾驭对抗训练
Scaling and Taming Adversarial Training with Synthetic Data
摘要:尽管对抗训练在小型数据集上取得了成功,但将其应用于像 ImageNet 这样的大规模数据集仍面临挑战。以往使用合成数据的尝试仅带来有限的改进。本研究探讨了合成数据规模、模型规模以及训练策略对基于ImageNet的对抗训练的影响,为大规模鲁棒性提供了更深入的见解。在研究过程中,我们观察到一种显著的损失振荡现象,这种现象会导致对抗过拟合,并提出了缓解该现象的策略。实验结果表明,在 ImageNet-1K 上的 AutoAttack 评估下,我们的方法实现了 71.54% 的鲁棒准确率。我们的研究结果强调了合成数据和模型规模在增强大规模基准测试的对抗鲁棒性方面的关键作用,并为大规模训练鲁棒的视觉表征提供了新方向。
基于对抗鲁棒记忆的持续学习器
Adversarial Robust Memory-Based Continual Learner
摘要:尽管持续学习领域已取得显著进展,但这类方法的对抗脆弱性尚未得到充分探讨。我们深入研究了基于记忆的持续学习算法的对抗鲁棒性,发现直接应用对抗训练技术对鲁棒性的提升有限。我们的初步研究揭示了构建具有对抗鲁棒性的持续学习模型面临的双重挑战:持续学习中的加速遗忘问题和对抗鲁棒性中的梯度混淆问题。在本研究中,我们提出了一种新型的具有对抗鲁棒性的基于记忆的持续学习模型,该模型通过调整数据的对数概率来减轻对抗样本导致的过往知识遗忘。此外,我们设计了一种基于梯度的数据选择机制,以缓解因存储数据有限而造成的梯度混淆。所提出的方法能够广泛地与现有的基于记忆的持续学习算法和对抗训练算法相结合。在 Split-CIFAR10/100 和 Split-Tiny ImageNet 数据集上进行的大量实验证明了我们方法的有效性,在对抗性数据上,ResNet 的遗忘率最大降低了 34.17%,ViT 的遗忘率最大降低了 20.10%。
通过梯度引导采样平衡探索与利用来增强对抗迁移性
Enhancing Adversarial Transferability by Balancing Exploration and Exploitation with Gradient-Guided Sampling
摘要:对抗攻击对深度神经网络的鲁棒性构成了严峻挑战,尤其是在不同模型架构的迁移场景中。然而,对抗攻击的可迁移性在利用(最大化攻击效力)和探索(增强跨模型泛化能力)之间面临着一个基本困境。传统的基于动量的方法过度优先考虑利用,即通过更高的损失最大值来提高攻击效力,但泛化能力会减弱(损失面变窄)。相反,最近采用内迭代采样的方法则过度优先考虑探索,即为了实现跨模型泛化而使损失面更平坦,但攻击效力会减弱(局部最大值次优)。为了解决这一困境,我们提出了一种简单而有效的梯度引导采样(GGS)方法,该方法通过沿梯度上升方向引导采样来协调这两个目标,从而提高采样效率和稳定性。具体而言,基于MI-FGSM,GGS 引入内迭代随机采样,并利用前一次内迭代的梯度来引导采样方向(采样幅度由随机分布决定)。这种机制促使对抗样本处于平衡区域,既具有平坦性以实现跨模型泛化,又具有较高的局部最大值以获得强大的攻击效力。在多种深度神经网络架构和多模态大语言模型(MLLM)上进行的综合实验表明,我们的方法优于当前最先进的迁移攻击方法。
通过李雅普诺夫指数引导优化实现单域泛化的对抗性数据增强
Adversarial Data Augmentation for Single Domain Generalization via Lyapunov Exponent-Guided Optimization
摘要:单域泛化(SDG)旨在开发能够仅使用一个源域就泛化到未见目标域的模型,这项任务因显著的域偏移和有限的数据多样性而变得复杂。现有的 SDG 方法主要依赖数据增强技术,但这些技术难以有效调整训练动态以适应较大的域偏移。为解决这一问题,我们提出了 LEAwareSGD,这是一种受动力系统理论启发的新型李雅普诺夫指数(LE)引导优化方法。通过利用 LE 测量来调节学习率,LEAwareSGD 鼓励模型在混沌边缘附近进行训练,这是一种能最佳平衡稳定性和适应性的关键状态。这种动态调整使模型能够探索更广泛的参数空间,并捕捉到更具泛化性的特征,最终增强模型的泛化能力。在 PACS、OfficeHome 和 DomainNet 上进行的大量实验表明,LEAwareSGD 带来了显著的泛化提升,在低数据情况下,PACS 上的性能提升高达 9.47%。这些结果凸显了在混沌边缘附近训练对增强 SDG 任务中模型泛化能力的有效性。
基于属性感知文本反演的提示驱动的行人重识别可迁移对抗攻击
Prompt-driven Transferable Adversarial Attack on Person Re-Identification with Attribute-aware Textual Inversion
摘要:行人重识别(re-id)模型在安全监控系统中至关重要,这就需要可迁移的对抗性攻击来探究其漏洞。近年来,基于视觉-语言模型(VLM)的攻击通过对VLM的通用图像和文本特征进行攻击,展现出了卓越的可迁移性,但由于过度强调整体表征中的判别性语义,这些攻击缺乏对特征的全面破坏。在本文中,我们提出了属性感知提示攻击(AP-Attack),这是一种新颖的方法,它利用VLM的图文对齐能力,通过破坏特定属性的文本嵌入,来明确地干扰行人图像的细粒度语义特征。为了获得针对各个属性的个性化文本描述,我们设计了文本反转网络,将行人图像映射到代表语义嵌入的伪令牌。该网络采用对比学习的方式进行训练,所使用的图像以及预定义的提示模板能清晰地描述行人属性。反转后的良性和对抗性细粒度文本语义有助于攻击者有效地进行全面破坏,从而增强对抗样本的可迁移性。大量实验表明,AP-Attack 实现了最先进的可迁移性,在跨模型和跨数据集的攻击场景中,平均下降率较以往方法显著提升了 22.9%。
一物体,多谎言:统一视觉语言模型跨任务对抗攻击基准
One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models
摘要:统一的视觉-语言模型(VLMs)最近取得了显著进展,使得单一模型能够在共享的计算架构中通过不同的指令灵活地处理各种任务。这种基于指令的控制机制带来了独特的安全挑战,因为对抗性输入必须在可能被不可预测地用于处理相同恶意内容的多个任务指令中保持有效性。在本文中,我们介绍了 CrossVLAD,这是一个新的基准数据集,它是从 MSCOCO 中精心挑选出来的,并借助 GPT-4 进行辅助标注,用于系统地评估统一 VLMs 上的跨任务对抗性攻击。CrossVLAD 围绕着对象变更目标展开——持续操控目标对象在四个下游任务中的分类,并提出了一种新颖的成功率指标,该指标用于衡量所有任务中的同时误分类情况,为对抗性迁移能力提供了严格的评估。为了应对这一挑战,我们提出了 CRAFT(具有 Token 对齐的跨任务基于区域的攻击框架),这是一种高效的以区域为中心的攻击方法。在 Florence 2 和其他流行的统一 VLMs 上进行的大量实验表明,我们的方法在整体跨任务攻击性能和目标对象变更成功率方面都优于现有方法,凸显了其在跨多种任务对抗性影响统一 VLMs 方面的有效性。
PBCAT:基于补丁的复合对抗训练,抵御针对目标检测的物理可实现攻击
PBCAT: Patch-based composite adversarial training against physically realizable attacks on object detection
摘要:目标检测在许多安全敏感应用中起着至关重要的作用。然而,最近的几项研究表明,目标检测器很容易被物理可实现的攻击所欺骗,例如对抗性补丁和最近出现的对抗性纹理,这些都构成了现实且紧迫的威胁。对抗性训练(AT)被认为是对抗对抗性攻击最有效的防御方法。虽然在分类模型的攻击设置中,对抗性训练已得到广泛研究,但针对目标检测器上物理可实现攻击的对抗性训练的探索却很有限。早期的尝试仅用于防御对抗性补丁,而针对更广泛的物理可实现攻击的对抗性训练仍有待深入研究。在这项工作中,我们考虑使用统一的对抗性训练方法来防御各种物理可实现的攻击。我们提出了 PBCAT,一种新颖的基于补丁的复合对抗性训练策略。 PBCAT 通过结合小面积梯度引导的对抗性补丁和覆盖整个图像的难以察觉的全局对抗性扰动来优化模型。通过这些设计,PBCAT 不仅有潜力防御对抗性补丁,还能防御未知的物理可实现攻击,如对抗性纹理。在多种设置下的大量实验表明,与最先进的防御方法相比,PBCAT 显著提高了对各种物理可实现攻击的鲁棒性。值得注意的是,在最近的一种对抗性纹理攻击下,与之前的防御方法相比,它将检测准确率提高了 29.7%.
大型目标检测 Transformer 的对抗注意力扰动
Adversarial Attention Perturbations for Large Object Detection Transformers
摘要:对抗性扰动是揭示神经网络漏洞的有效工具。现有的针对目标检测的对抗性扰动方法要么局限于攻击基于 CNN 的检测器,要么对基于 Transformer 的检测器效果不佳。本文提出了一种针对目标检测 Transformer 的注意力聚焦攻击性梯度(AFOG)攻击方法。通过设计,AFOG 与神经架构无关,并且借助统一的对抗性注意力框架,能有效攻击大型基于 Transformer 的目标检测器和传统基于 CNN 的检测器。本文有三个原创贡献。首先,AFOG 利用一种可学习的注意力机制,将扰动聚焦于多框检测任务中的易受攻击图像区域,与非注意力基线相比,性能提升高达 30.6%。其次,AFOG 的攻击损失是通过可学习的注意力更新,结合迭代注入对抗性扰动,整合两种类型的特征损失来制定的。最后,AFOG 是一种高效且隐蔽的对抗性扰动方法。它通过添加策略性生成且视觉上难以察觉的扰动来探查检测 Transformer 的弱点,这些扰动会导致训练良好的目标检测模型失效。在 COCO 数据集上使用 12 个大型检测 Transformer 进行的大量实验证明了 AFOG 的有效性。我们的实证结果还表明,AFOG 在基于 Transformer 和基于 CNN 的目标检测器上的表现优于现有攻击方法,性能提升高达 83%,同时具有更快的速度和更好的隐蔽性。
3D 高斯溅射驱动的多视图鲁棒物理对抗伪装生成
3D Gaussian Splatting Driven Multi-View Robust Physical Adversarial Camouflage Generation
摘要:物理对抗攻击方法暴露了深度神经网络的脆弱性,并对自动驾驶等安全关键场景构成重大威胁。与基于补丁的攻击相比,基于伪装的物理攻击是一种更有前景的方法,在复杂的物理环境中具有更强的对抗效果。然而,大多数先前的研究依赖于目标物体的网格先验和模拟器构建的虚拟环境,这些不仅获取耗时,而且不可避免地与现实世界存在差异。此外,由于训练图像中背景的局限性,以往的方法往往无法生成多视角稳健的对抗性伪装,并且容易陷入次优解。由于这些原因,先前的研究在不同视角和物理环境下缺乏对抗效果和稳健性。我们提出了一种基于 3D 高斯溅射(3DGS)的物理攻击框架,名为 PGA,它能够通过少量图像实现快速精确的重建,并具备照片级真实感的渲染能力。我们的框架通过防止高斯之间的相互遮挡和自遮挡,以及采用调整每个视角成像背景的最小-最大优化方法,帮助算法过滤掉非稳健的对抗特征,进一步增强了跨视角稳健性和对抗效果。大量实验验证了 PGA 的有效性和优越性。
自动提示:通过大语言模型驱动的对抗性提示对文本转图像模型进行自动化红队测试
AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Diven Adversarial Prompts
摘要:尽管文本到图像(T2I)模型取得了快速进展,但其安全机制容易受到对抗性提示的攻击,这些提示会恶意生成不安全的图像。目前用于主动评估此类漏洞的红队测试方法通常需要对T2I模型进行白盒访问,并且依赖于低效的逐提示优化,还不可避免地会生成语义无意义的提示,这些提示很容易被过滤器拦截。在本文中,我们提出了 APT(AutoPrompT),这是一个黑盒框架,它利用大型语言模型(LLMs)为良性提示自动生成人类可理解的对抗性后缀。我们首先引入了一个在对抗性后缀优化和利用优化后的后缀对大型语言模型进行微调之间的交替优化-微调流程。此外,我们在优化阶段整合了双重规避策略,能够绕过基于困惑度的过滤器和黑名单词过滤器:(1)我们通过辅助大型语言模型的困惑度评分来约束大型语言模型生成人类可理解的提示,这与之前的令牌级乱码形成了鲜明对比;(2)我们还引入了禁用令牌惩罚机制,以抑制在黑名单中显式生成禁用令牌。大量实验表明,我们的人类可理解、抗过滤器的对抗性提示具有出色的红队测试性能,并且具有优异的零样本迁移能力,能够快速适应未见过的提示,甚至在商业 API(例如 Leonardo.Ai)中也能暴露关键漏洞。
用于物理目标检测规避的梯度重加权对抗性伪装
Gradient-Reweighted Adversarial Camouflage for Physical Object Detection Evasion
摘要:目标检测在自动驾驶等现实应用中得到了广泛运用,但对抗性伪装通过从多个视角欺骗检测器,构成了重大威胁。现有技术难以在不同视角下保持一致的攻击效果。为解决这一问题,我们提出了 GRAC——一种对抗性伪装框架,它能提升在不同视角和距离下的攻击效果。首先,我们识别出不同角度下梯度更新存在的冲突,并引入梯度重加权来解决这些冲突,从而实现协同优化。其次,我们对光线相互作用进行建模,以模拟光照变化,提高在不同光照条件下的鲁棒性。此外,针对渲染过程中因采样密度不一致而导致的纹理更新不均匀问题,我们通过应用基于池化的纹理正则化来提高平滑度。在模拟和物理环境中进行的大量实验表明,GRAC 在各种条件下的表现均优于现有方法。
通过超分辨率和扩散进行对抗净化
Adversarial Purification via Super-Resolution and Diffusion
摘要:深度神经网络在各种计算机视觉任务中得到了广泛应用,但其在对抗性扰动面前的脆弱性仍是实现可靠决策的一大重要挑战。对抗性净化作为一种测试时防御策略,已展现出通过扩散模型去除噪声来应对这些威胁的潜力。这种即插即用的方法使用现成模型,效果似乎非常显著。然而,通过扩散得到的净化数据往往比对抗性样本偏离原始数据更远,这会导致关键信息丢失并引发分类错误。在本研究中,我们提出,先通过超分辨率(SR)进行上采样,再进行下采样,也有助于消除对抗性噪声,这与扩散模型中的加噪和去噪过程类似。虽然仅使用超分辨率的效果不如扩散过程,但它能更好地恢复通常与网络早期层相关的原始特征。我们发现,将超分辨率(其最初可减轻对抗性攻击对早期层信息的破坏)与扩散相结合,会产生协同效应,相比单独使用扩散模型,性能得到了提升。我们的综合评估表明,这种名为PuriFlow的组合方法显著提高了准确性和鲁棒性,能与最先进的方法协同发挥作用。
SMP攻击:利用语义感知多粒度 Patchout 提升基于特征重要性的对抗攻击的可迁移性
SMP-Attack: Boosting the Transferability of Feature Importance-based Adversarial Attack with Semantics-aware Multi-granularity Patchout
摘要:基于迁移的攻击对深度神经网络(DNNs)构成了重大的安全威胁,因为它们在现实世界的黑盒场景中对未见过的模型表现出很强的攻击性能。在此基础上,基于特征重要性的攻击通过有效抑制模型特定的特征模式,进一步提高了对抗样本的可迁移性。然而,现有方法主要集中在单粒度补丁和单阶段训练上,导致解决方案并非最优。为了解决这些局限性,我们提出了一个基于语义感知多粒度补丁移除(Patchout)的通用多阶段优化框架,称为SMP攻击。与不可变形/规则的补丁定义相比,我们将多粒度融入到可变形/不规则补丁的生成过程中,从而提高计算出的聚合梯度的质量。与传统的多层损失联合优化不同,我们引入了一种有效的多阶段训练策略,从浅层到中间层系统地探索重要的模型无关特征。我们利用ImageNet数据集,在无防御/有防御的卷积神经网络(CNNs)和视觉Transformer(ViTs)上进行了大量实验,这些实验明确表明,在黑盒场景中,我们提出的SMP攻击的性能优于当前最先进的方法。此外,我们评估了我们的多阶段优化的兼容性,它取代了现有基于特征的方法中使用的单阶段训练,最终带来了显著的性能提升。
通过逆目标梯度竞争和空间距离拉伸增强定向对抗样本的可迁移性
Enhancing Transferability of Targeted Adversarial Examples via Inverse Target Gradient Competition and Spatial Distance Stretching
摘要:在人工智能安全领域,深度神经网络的脆弱性已受到广泛关注。具体而言,深度神经网络(DNNs)对对抗样本(AEs)的敏感性可能导致严重后果,即使输入数据中存在微小扰动,也可能引发错误预测。对抗样本在不同模型间具有可迁移性,但由于特征维度和决策边界存在显著差异,目标攻击成功率(TASRs)仍然较低。为了提高目标对抗样本的可迁移性,我们提出了一种新方法,在优化过程中引入反向目标梯度竞争(ITC)和空间距离拉伸(SDS)。具体来说,我们利用类双网络框架生成非目标和目标对抗样本,引入了一种新的竞争机制——反向目标梯度竞争,其中每个轮次都会应用非目标对抗梯度,以阻碍目标对抗扰动的优化,从而提高目标攻击的鲁棒性。此外,我们还采用了 top-k 空间距离拉伸策略,引导对抗样本在潜在的多维空间中渗透到目标类别区域,同时在全局上与多个最近的非目标区域保持距离,最终实现最优的对抗可迁移性。与最先进的基于竞争的攻击方法相比,我们的方法在可迁移性方面表现出显著优势,在主流的卷积神经网络(CNNs)和视觉Transformer(ViTs)上,平均可迁移目标攻击成功率分别提高了 16.1% 和 21.4%,同时还实现了无可匹敌的突破防御能力。
用于提升掌纹识别的统一对抗增强方法
Unified Adversarial Augmentation for Improving Palmprint Recognition
摘要:当前的掌纹识别模型在受限数据集上表现出较强的性能,但在处理具有几何畸变和纹理退化的挑战性掌纹样本时存在明显局限性。数据增强被广泛用于提高模型的泛化能力。然而,现有的增强方法难以在生成特定于掌纹的变异的同时保持身份一致性,从而导致性能欠佳。为了解决这些问题,我们提出了一种统一对抗增强框架(UAA)。该框架首先将对抗训练范式应用于掌纹识别,通过整合来自识别网络的反馈来优化具有挑战性的增强样本。我们对掌纹图像进行几何和纹理双重变异增强。具体而言,它采用了一个空间变换模块和一个新的身份保持模块,该身份保持模块能够合成具有多样纹理变异的掌纹,同时保持一致的身份信息。为了实现更有效的对抗增强,我们提出了一种动态采样策略。大量实验表明,我们的方法在挑战性掌纹数据集和受限掌纹数据集上均表现出优越的性能。
用于稳健细粒度泛化的对抗重建反馈
Adversarial Reconstruction Feedback for Robust Fine-grained Generalization
摘要:现有的细粒度图像检索(FGIR)方法主要依靠预定义类别的监督来学习具有判别性的表示,用于检索细粒度物体。然而,它们在检索表示中不经意地引入了特定于类别的语义,形成了对预定义类别的语义依赖,这严重阻碍了对未见过类别的泛化能力。为了解决这个问题,我们提出了 AdvRF,这是一种新颖的对抗性重建反馈框架,旨在学习与类别无关的差异表示。具体而言,AdvRF 通过将检索模型中类别感知的差异定位与重建模型中类别无关的特征学习相结合,将 FGIR 重新表述为视觉差异重建任务。重建模型会暴露检索模型忽略的残留差异,迫使检索模型提高定位精度,而来自检索模型的精细化信号则指导重建模型提升其重建能力。因此,检索模型定位视觉差异,而重建模型将这些差异编码为与类别无关的表示。然后,这种表示通过知识蒸馏传递给检索模型,以实现高效部署。定量和定性评估表明,我们的 AdvRF 在广泛使用的细粒度和粗粒度数据集上都取得了令人印象深刻的性能。
通过去偏置高置信度逻辑对齐实现对抗鲁棒性
Towards Adversarial Robustness via Debiased High-Confidence Logit Alignment
摘要:尽管深度神经网络(DNNs)在各种视觉任务中取得了显著进展,但它们对抗性样本的脆弱性引发了重大的安全担忧。最近的对抗性训练方法利用逆对抗性攻击生成高置信度样本,旨在使对抗性分布与高置信度类别区域对齐。然而,我们的研究表明,在逆对抗性攻击下,高置信度输出会受到有偏特征激活的影响,导致模型依赖与标签缺乏因果关系的背景特征。这种虚假的相关性偏差会导致对抗性训练过程中过拟合无关的背景特征,从而降低模型的鲁棒性能和泛化能力。为了解决这一问题,我们提出了去偏置高置信度对抗性训练(DHAT),这是一种新颖的方法,它将对抗性对数与去偏置的高置信度对数对齐,并通过增强前景对数的正交性来恢复适当的注意力。大量实验表明,DHAT 在 CIFAR 和 ImageNet 1K 基准测试上都实现了最先进的鲁棒性,同时通过减轻逆对抗性训练方法中固有的特征偏差,显著提高了泛化能力。
概率鲁棒性的对抗训练
Adversarial Training for Probabilistic Robustness
摘要:深度学习(DL)在各个行业都展现出了变革性的潜力,但其对抗样本(AEs)的敏感性限制了其可靠性和更广泛的部署。关于深度学习鲁棒性的研究已经开发出了多种技术,其中对抗训练(AT)被确立为对抗对抗样本的主要方法。传统的对抗训练侧重于最坏情况鲁棒性(WCR),但最近的研究引入了概率鲁棒性(PR),它评估了在局部扰动范围内对抗样本出现的可能性,对模型的鲁棒性进行了全面评估,并确认了更易于管理的残余风险。然而,现有的对抗训练方法本质上是为提高最坏情况鲁棒性而设计的,目前还没有专门针对概率鲁棒性的方法。为了填补这一空白,我们构建了一种新的最小-最大优化方法,作为以概率鲁棒性为重点的对抗训练的理论基础,并引入了 AT-PR 训练方案以及数值算法来解决这一新的优化问题。我们基于在常见数据集和不同架构上训练的 70 个深度学习模型进行的实验表明:i)与 AT-WCR 方法相比,AT-PR 在概率鲁棒性方面取得了更大的提升;ii)在不同的局部输入上,它显示出更一致的有效性;iii)它减少了模型泛化方面的权衡。
ZIUM:针对未学习模型的零样本意图感知对抗攻击
ZIUM: Zero-Shot Intent-Aware Adversarial Attack on Unlearned Models
摘要:机器遗忘(MU)能从深度学习模型中移除特定的数据点或概念,以增强隐私保护并防止敏感内容的生成。对抗性提示可以利用经过遗忘处理的模型,生成包含已移除概念的内容,这带来了重大的安全风险。然而,现有的对抗性攻击方法在生成符合攻击者意图的内容方面仍面临挑战,而且识别成功的提示还需要高昂的计算成本。为了应对这些挑战,我们提出了 ZIUM,一种针对经过遗忘处理的模型的零样本意图感知对抗性攻击方法,它能灵活定制目标攻击图像,以反映攻击者的意图。此外,ZIUM 支持零样本对抗性攻击,无需对先前攻击过的已遗忘概念进行进一步优化。在各种机器遗忘场景下的评估表明,ZIUM 能够根据用户意图提示成功定制内容,且与现有方法相比,攻击成功率更高。此外,其零样本对抗性攻击显著减少了针对先前攻击过的已遗忘概念的攻击时间。
FVGen:利用对抗视频扩散蒸馏加速新视图合成
FVGen: Accelerating Novel-View Synthesis with Adversarial Video Diffusion Distillation
摘要:近年来,3D 重建技术的进展已能通过密集的图像采集生成逼真的 3D 模型,但在稀疏视角下仍存在挑战,这往往会导致未观测区域出现伪影。近期的研究利用视频扩散模型(VDMs)来生成密集的观测结果,以填补在仅有稀疏视角可用于 3D 重建任务时的空白。这些方法的一个显著局限性是使用视频扩散模型时采样速度较慢。在本文中,我们提出了 FVGen,这是一个新颖的框架,它通过使用视频扩散模型在仅需四个采样步骤的情况下实现快速的新视角合成,从而解决了这一挑战。我们提出了一种新颖的视频扩散模型蒸馏方法,该方法利用生成对抗网络(GANs)和软化的反向KL散度最小化,将一个多步骤去噪教师模型蒸馏为一个少步骤去噪学生模型。在真实世界数据集上进行的大量实验表明,与以往的研究相比,我们的框架生成相同数量的新视角时,视觉质量相近(甚至更好),同时将采样时间减少了 90% 以上。FVGen 显著提高了下游重建任务的时间效率,特别是在处理稀疏输入视角(超过 2 个)时,此时预训练的视频扩散模型需要多次运行才能实现更好的空间覆盖。
四面受困,坚韧提炼:通往零样本鲁棒性的多目标对抗路径
Confound from All Sides, Distill with Resilience: Multi-Objective Adversarial Paths to Zero-Shot Robustness
摘要:对抗鲁棒知识蒸馏能将大规模教师模型的鲁棒性迁移到轻量级学生模型中,同时保持自然性能。然而,基础视觉-语言模型(VLMs)还需要迁移零样本推理能力。我们发现,使用无目标对抗样本的标准鲁棒蒸馏无法迁移分布外(零样本)鲁棒性,因为这些对抗样本主要将输入推离其原始分布,仅探索了教师模型决策空间的有限部分,且遗漏了更多样化的失效模式。一个自然的解决方案是生成多个有目标的对抗样本,使其跨越决策边界的不同路径。这样,这些对抗样本就能探测教师模型决策表面更广泛的区域。但是,简单的有目标对抗样本优化往往会收敛到单一类别决策区域内的局部最优解,从而限制了多样性。为解决这一问题,我们提出了一种基于多目标优化(MOO)的对抗蒸馏框架,该框架通过利用具有两个主要目标的对抗样本来将鲁棒性从大型 VLMs 迁移到轻量级模型中:错误分类和类别级对抗多样性。从理论上讲,我们证明了对多样性的优化可减轻对抗样本陷入局部最优解的问题,确保对抗样本跨越多个决策区域,并捕捉教师模型可泛化的鲁棒特征。大量实验表明,在不同场景下,我们的方法优于最先进的对抗学习方法。
通过标签信息消除缓解快速对抗训练中的灾难性过拟合
Mitigating Catastrophic Overfitting in Fast Adversarial Training via Label Information Elimination
摘要:快速对抗训练(FAT)采用单步快速梯度符号法(FGSM)来生成对抗样本,降低了传统对抗训练的计算成本。然而,快速对抗训练存在灾难性过拟合(CO)问题,即模型在训练过程中对多步攻击的鲁棒准确率骤降至零。近期研究表明,灾难性过拟合的发生是因为单步对抗扰动包含模型用于预测的标签信息,这会导致过拟合,并降低模型对更复杂攻击的鲁棒性。在本文中,我们发现,灾难性过拟合发生后,某些样本的标签信息会在不同样本间转移,这显著提高了修改后的图像被分类为预期标签的可能性。这一发现为各种对抗初始化策略为何有效的问题提供了新的视角。为解决这一问题,我们提出了一种创新的快速对抗训练策略,该策略利用特殊样本来捕捉可转移的标签信息,并在训练过程中主动去除潜在的标签信息,同时辅以非均匀标签平滑技术以进一步消除标签信息。在三个数据集上的实验结果表明,与其他快速对抗训练方法相比,我们的方法在抵抗多种攻击方面保持了具有竞争力的鲁棒性,消融研究也证实了我们方法的有效性。
重新审视目标检测器上的对抗补丁防御:统一评估、大规模数据集及新见解
Revisiting Adversarial Patch Defenses on Object Detectors: Unified Evaluation, Large-Scale Dataset, and New Insights
摘要:针对目标检测器上的补丁攻击开发可靠的防御措施引起了越来越多的关注。然而,我们发现现有的防御评估缺乏一个统一且全面的框架,导致对当前方法的评估不一致且不完整。为解决这一问题,我们重新审视了 11 种具有代表性的防御措施,并提出了首个补丁防御基准,其中涉及 2 个攻击目标、13 种补丁攻击、11 个目标检测器和4种不同的指标。这催生了包含 94 种补丁和 94,000 张图像的大规模对抗性补丁数据集。我们的综合分析揭示了新的见解:(1)防御自然主义补丁的难点在于数据分布,而非人们普遍认为的高频部分。我们这个具有多样化补丁分布的新数据集可用于将现有防御措施的AP@0.5提升15.09%。(2)受攻击对象的平均精度,而非人们普遍追求的补丁检测精度,与防御性能表现出高度的一致性。(3)自适应攻击能够在很大程度上绕过现有的防御措施,而采用复杂/随机模型或具有通用补丁属性的防御措施则相对稳健。我们希望我们的分析能够为正确评估补丁攻击/防御措施以及推进其设计提供指导。
ViT集成攻击:增强集成模型以提升视觉Transformer中的对抗迁移性
ViT-EnsembleAttack: Augmenting Ensemble Models for Stronger Adversarial Transferability in Vision Transformers
摘要:基于集成的攻击通过聚合不同架构模型的输出来增强对抗迁移性,已被证明是有效的。然而,现有研究主要集中在优化集成权重或优化集成路径上,却忽视了对集成模型的探索,以增强对抗攻击的迁移性。为了填补这一空白,我们提出将对抗性增强应用于替代模型,旨在提高集成模型的整体泛化能力,并降低对抗过拟合的风险。同时,考虑到集成视觉Transformer(ViT)受到的关注较少,我们基于模型对抗性增强的思想,提出了 ViT 集成攻击(ViT EnsembleAttack),据我们所知,这是首个专门针对 ViT 的基于集成的攻击方法。我们的方法通过三种策略为每个替代 ViT 生成增强模型:多头丢弃、注意力分数缩放和 MLP 特征混合,相关参数通过贝叶斯优化进行优化。这些经过对抗性增强的模型被集成起来,用于生成对抗样本。此外,我们引入了自动重加权和步长放大模块来提升迁移性。大量实验表明,ViT 集成攻击显著增强了基于集成的攻击在 ViT 上的对抗迁移性,大幅优于现有方法。
失败案例更易学习,但边界表示遗憾:在对抗训练中促进平滑感知变化以实现准确性与鲁棒性的权衡
Failure Cases Are Better Learned But Boundary Says Sorry: Facilitating Smooth Perception Change for Accuracy-Robustness Trade-Off in Adversarial Training
摘要:对抗训练(AT)是训练鲁棒性深度神经网络(DNNs)最有效的方法之一。然而,对抗训练在清洁准确率和对抗鲁棒性之间造成了一种固有的权衡,这通常归因于由于对难对抗样本学习不足而导致的更复杂的决策边界。在这项工作中,我们首次揭示了一个反直觉的事实:从感知一致性的角度来看,经过对抗训练后仍能攻击鲁棒模型的难对抗样本,其学习效果已经优于那些被成功防御的样本。因此,与以往的观点不同,我们认为,正是对难对抗样本的过度充分学习,才导致了决策边界的退化,并加剧了这种权衡问题。具体来说,对感知一致性的过度追求会迫使模型将扰动视为噪声,并忽略其中包含的信息,而这些信息本应被用来促使朝向决策边界的感知过渡更加平滑,以支持决策边界建立在合适的位置。作为回应,我们定义了一个新的对抗训练目标,名为鲁棒感知,它鼓励模型感知随输入扰动而平滑变化。基于此,我们提出了一种新颖的鲁棒感知对抗训练(RPAT)方法,有效地缓解了当前的准确率-鲁棒性权衡问题。在 CIFAR-10、CIFAR-100 和 Tiny-ImageNet 数据集上,使用 ResNet-18、PreActResNet-18 和 WideResNet-34-10 模型进行的实验表明,我们的方法在性能上超越了四种常见基线和 12 项最先进(SOTA)的研究成果。
FedPall:针对存在特征漂移的联邦学习的基于原型的对抗协作学习
FedPall: Prototype-based Adversarial and Collaborative Learning for Federated Learning with Feature Drift
摘要:联邦学习(FL)能够利用来自多方的数据,在中央服务器中协同训练一个全局模型,同时保护隐私。然而,当各方使用来自不同来源的数据集训练本地模型时,数据异质性会显著降低全局模型的性能,进而影响个性化的本地模型。在各种数据异质性情况中,特征偏移(即各方之间的特征空间差异)在现实数据中普遍存在,但在很大程度上仍未被探索。特征偏移会干扰客户端的特征提取学习,从而导致较差的特征提取和分类性能。为了解决联邦学习中的特征偏移问题,我们提出了 FedPall,这是一种联邦学习框架,它利用基于原型的对抗性学习来统一特征空间,并通过协同学习来强化特征中的类别信息。此外,FedPall 利用从全局原型和本地特征生成的混合特征,从全局角度借助与分类相关的信息来增强全局分类器。在三个具有代表性的特征偏移数据集上的评估结果表明,在联邦学习场景下处理特征偏移数据时,FedPall 在分类任务中始终表现出优越的性能。
利用空间不变性提升对抗迁移性
Leveraging Spatial Invariance to Boost Adversarial Transferability
摘要:对抗样本通过难以察觉的扰动构建,揭示了深度神经网络(DNN)的一个重大脆弱性。更关键的是,对抗样本的可迁移性使攻击者无需了解目标模型就能诱导出不合理的预测。DNN 具有空间不变性,即物体的位置不影响分类结果。然而,现有的基于输入变换的对抗攻击仅关注单一位置的行为模式,未能充分利用 DNN 在多个位置展现出的空间不变性,从而限制了对抗样本的可迁移性。为解决这一问题,我们提出一种基于多尺度、多位置输入变换的攻击方法,称为空间不变性多样性(SID)。具体而言,SID 在局部感受野内使用混合空间-频率融合机制,随后进行多尺度空间下采样,并通过随机变换进行位置扰动,从而构建一组输入来激活多样的行为模式,以实现有效的对抗扰动。在 ImageNet 数据集上进行的大量实验表明,SID 比当前最先进的基于输入变换的攻击方法具有更好的可迁移性。此外,SID 可以灵活地与其他基于输入变换或基于梯度的攻击方法相结合,进一步增强对抗样本的可迁移性。
ODDR:基于异常检测与降维的对抗补丁防御方法
ODDR: Outlier Detection & Dimension Reduction Based Defense Against Adversarial Patches
摘要:对抗性攻击对机器学习模型的可靠部署构成了重大挑战,其中基于补丁的攻击尤为强大。这类攻击会在图像的局部区域引入对抗性扰动,即便训练有素的模型也会被欺骗。在本文中,我们提出了异常检测与降维(ODDR)方法,这是一种全面的防御策略,旨在通过先进的统计方法来抵御基于补丁的对抗性攻击。我们的方法基于这样一种观察:与对抗性补丁(无论是自然的还是合成的)对应的输入特征偏离了其余图像数据的固有分布,因此可以被识别为异常值。ODDR 通过一个稳健的三阶段流程运作:分割、分离和中和。这个与模型无关的框架具有多功能性,能为多种任务提供保护,包括图像分类、目标检测和深度估计,并且在基于 CNN 和基于 Transformer 的架构中都被证明是有效的。在分割阶段,图像样本被划分为更小的片段,为分离阶段做准备;在分离阶段,先进的异常检测技术会隔离与对抗性扰动相关的异常特征。然后,中和阶段对这些异常值应用降维技术,在有效中和对抗性影响的同时,保留机器学习任务所需的关键信息。在基准数据集上针对最先进的对抗性补丁进行的广泛评估,凸显了 ODDR 的有效性。在 GoogleAp 攻击下,我们的方法将模型准确率从 39.26% 提升至 79.1%,性能优于领先的防御方法,如 LGS (53.86%)、Jujutsu (60%) 和Jedi (64.34%)。
对抗单纯复形对 SAM 编码器的破坏会引发下游模型故障
SAM Encoder Breach by Adversarial Simplicial Complex Triggers Downstream Model Failures
摘要:虽然分割一切模型(SAM)凭借零样本能力改变了交互式分割,但它固有的漏洞带来了单点风险,可能导致众多下游应用程序失效。因此,主动评估这些可迁移的漏洞至关重要。以往针对 SAM 的对抗性攻击,由于对跨域共同弱点的探索不足,可迁移性往往有限。为解决这一问题,我们提出了顶点细化单纯复形攻击(VeSCA),这是一种仅利用 SAM 的编码器来生成可迁移对抗样本的新方法。具体而言,它通过参数化单纯复形明确刻画 SAM 与下游模型之间的共享脆弱区域,从而实现这一目标。我们的目标是通过顶点级的迭代细化,在具有对抗潜力的区域内识别出此类复形。在单纯复形初始化过程中,我们引入了一种轻量级域重适应策略,利用最少的参考数据来弥合域差异。最终,VeSCA 通过随机单纯复形采样生成具有稳定可迁移性的对抗样本。大量实验表明,在五个特定域数据集的三类下游模型上,VeSCA 的性能比最先进的方法提高了 12.7%。我们的研究结果进一步凸显了 SAM 的漏洞给下游模型带来的风险,并强调了开发更稳健的基础模型的紧迫性。
视觉领域判别式自监督学习的对抗鲁棒性
Adversarial Robustness of Discriminative Self-Supervised Learning in Vision
摘要:自监督学习(SSL)在视觉表征学习方面取得了显著进展,但对其对抗鲁棒性的全面评估仍较为有限。在本研究中,我们评估了七种判别式自监督模型和一种监督模型在不同任务中的对抗鲁棒性,这些任务包括ImageNet分类、迁移学习、分割和检测。我们的研究结果表明,在 ImageNet 上,判别式 SSL 模型通常比其对应的监督模型表现出更好的对抗攻击鲁棒性;当采用线性评估时,这种优势还延伸到了迁移学习中。然而,当进行微调时,SSL 模型和监督模型之间的鲁棒性差距会大幅缩小。同样,在分割和检测任务中,这种鲁棒性优势也会减弱。我们还研究了各种因素可能对对抗鲁棒性产生的影响,包括架构选择、训练时长、数据增强和批量大小。我们的分析为视觉自监督表征系统中对抗鲁棒性的持续探索做出了贡献。
DADet:通过扩散异常检测保护图像条件扩散模型免受对抗攻击和后门攻击
DADet: Safeguarding Image Conditional Diffusion Models against Adversarial and Backdoor Attacks via Diffusion Anomaly Detection
摘要:尽管图像条件扩散模型展现出令人印象深刻的生成能力,但在面对后门攻击和对抗性攻击时,它们表现出极高的脆弱性。在本文中,我们定义了一个名为“扩散异常”的场景,即受攻击情况下的反向过程生成结果与正常结果存在显著偏差。通过分析扩散异常的潜在形成机制,我们揭示了扰动在反向过程中是如何被放大并在结果中累积的。基于这一分析,我们发现了“发散”和“同质化”现象,这些现象导致扩散过程与正常过程产生显著偏离,并且多样性下降。利用这两种现象,我们提出了一种名为“扩散异常检测(DADet)”的方法,能够有效检测后门攻击和对抗性攻击。大量实验表明,我们的方法在抵御后门攻击和对抗性攻击方面取得了优异的防御性能。具体而言,在后门攻击检测中,我们的方法在不同数据集(包括 MS COCO 和 CIFAR-10)上的 F1 分数达到 99%。在对抗性样本检测方面,在三种对抗性攻击和两项不同任务中,分别在 MSCOCO 和 Places365 数据集上进行评估,F1分数均超过84%。
GLEAM:通过全局-局部变换对视觉语言预训练模型进行增强可迁移对抗攻击
GLEAM: Enhanced Transferable Adversarial Attacks for Vision-Language Pre-training Models via Global-Local Transformations
摘要:视觉-语言预训练(VLP)模型利用大规模跨模态预训练来对齐视觉和文本模态,在图像-文本检索和视觉定位等任务上取得了令人瞩目的性能。然而,这些模型极易受到对抗性攻击,这引发了人们对其在安全关键型应用中的鲁棒性和可靠性的严重担忧。现有的黑盒攻击方法受限于数据增强机制不足或全局语义结构被破坏,导致对抗迁移性较差。为了应对这些挑战,我们提出了全局-局部增强型对抗性多模态攻击(GLEAM),这是一个用于在视觉-语言任务中生成可迁移对抗样本的统一框架。GLEAM 引入了局部特征增强模块,该模块在保持全局语义和几何完整性的同时实现了多样化的局部变形。它还包含一个全局分布扩展模块,通过动态变换来扩大特征空间覆盖范围。此外,跨模态特征对齐模块利用中间对抗状态来指导文本扰动。这增强了跨模态一致性和对抗性文本的迁移性。在 Flickr30K 和 MSCOCO 数据集上的大量实验表明,GLEAM 优于最先进的方法,在图像-文本检索任务中的攻击成功率高出 10%-30% 以上,在 Claude 3.5 Sonnet 和 GPT-4o 等大型模型上的迁移性提升超过 30%。GLEAM 为暴露 VLP 模型的漏洞提供了一个强大的工具,并为设计更安全、更可靠的视觉-语言系统提供了宝贵的见解。
CIARD:循环迭代对抗鲁棒性蒸馏
CIARD: Cyclic Iterative Adversarial Robustness Distillation
摘要:对抗性鲁棒性蒸馏(ARD)旨在将教师模型的性能和鲁棒性转移到轻量级学生模型中,从而在资源受限的场景下实现稳定的性能。尽管现有的 ARD 方法提高了学生模型的鲁棒性,但不可避免的副产品导致其在干净样本上的性能下降。我们总结了双教师框架下现有方法存在这一问题的原因:1. 双教师模型(即干净教师和鲁棒教师)的优化目标存在分歧,阻碍了知识向学生模型的有效转移;2. 训练过程中迭代生成的对抗性样本导致鲁棒教师模型的性能下降。为了应对这些挑战,我们提出了一种新颖的循环迭代 ARD(CIARD)方法,该方法具有两项关键创新:1. 采用带有对比推挽损失对齐的多教师框架,以解决双教师优化目标中的冲突;2. 进行持续的对抗性再训练,以维持教师模型的动态鲁棒性,对抗因对抗性样本变化而导致的性能下降。在 CIFAR-10、CIFAR-100 和 Tiny-ImageNet 上的大量实验表明,CIARD 取得了显著的性能提升,在各种攻击场景下,对抗性防御率平均提高了 3.53%,干净样本准确率提高了 5.87%,为平衡模型的鲁棒性和泛化能力树立了新的基准。
DIA:扩散模型中确定性反演的对抗性暴露
DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
摘要:扩散模型已被证明是强大的表示学习器,在多个领域展现出了最先进的性能。除了加速采样外,DDIM 还能够将真实图像反向转换为其潜在编码。这种反向操作的一个直接应用是真实图像编辑,其中反向转换会生成潜在轨迹,供编辑后图像的合成过程使用。不幸的是,这一实用工具使恶意用户能够更轻易地随意合成误导性内容或深度伪造内容,从而助长了不道德和滥用性内容以及侵犯隐私和版权的内容的传播。虽然像 AdvDM 和 Photoguard 这样的防御算法已被证明能够干扰这些图像的扩散过程,但它们的目标与测试时的迭代去噪轨迹之间的不匹配导致干扰性能较弱。在这项研究中,我们提出了 DDIM 反向攻击(DIA),用于攻击完整的 DDIM 轨迹路径。我们的结果证实了该攻击能有效进行干扰,在各种编辑方法上都超越了以往的防御方法。我们相信,我们的框架和研究结果能够为工业界和研究界提供实用的防御方法,以应对人工智能的恶意使用。
IAP:通过感知感知定位和扰动优化的隐形对抗补丁攻击
IAP: Invisible Adversarial Patch Attack through Perceptibility-Aware Localization and Perturbation Optimzation
摘要:尽管仅修改输入中一个小的局部区域,对抗性补丁仍能极大地改变计算机视觉模型的预测结果。然而,以往的方法要么在目标攻击场景下表现不尽如人意,要么无法生成与上下文协调一致的对抗性补丁,导致这些补丁容易被人工检查者发现,且在应对自动补丁防御时不够隐蔽。在本文中,我们提出了 IAP,这是一种新颖的攻击框架,它基于感知性感知定位和扰动优化方案生成高度不可见的对抗性补丁。具体而言,IAP 首先通过利用类别级定位和敏感度图来寻找放置补丁的合适位置,平衡补丁位置对受害模型预测和人类视觉系统的敏感性,然后采用感知性正则化的对抗损失和优先考虑颜色恒常性的梯度更新规则来优化不可见扰动。在各种图像基准和模型架构上进行的综合实验表明,与现有基线相比,IAP 在目标设置中始终能达到具有竞争力的攻击成功率,同时补丁的不可见性显著提升。除了对人类而言高度难以察觉外,事实证明 IAP 的隐蔽性足以使几种最先进的补丁防御措施失效。
数据多样性的对抗性利用可提升视觉定位性能
Adversarial Exploitation of Data Diversity Improves Visual Localization
摘要:视觉定位是通过估计相机在已知场景中的位姿,为自主系统提供的一项基础能力。尽管绝对位姿回归(APR)方法在高效推理方面展现出潜力,但它们往往难以实现泛化。近期的研究尝试通过不同视角的数据增强来解决这一问题,然而却忽略了一个关键因素:外观多样性。在这项研究中,我们发现外观变化是实现稳健定位的关键。具体而言,我们首先将真实的二维图像转换为具有不同外观和去模糊能力的三维高斯喷溅图,从而能够合成多样化的训练数据,这些数据不仅在姿态上有所不同,在光照和天气等环境条件上也存在差异。为了充分发挥外观多样化数据的潜力,我们构建了一个双分支联合训练管道,并配备了一个对抗性鉴别器,以弥合合成数据与真实数据之间的差距。大量实验表明,我们的方法显著优于最先进的方法,在室内数据集上,平移误差和旋转误差分别降低了 50% 和 33%;在室外数据集上,分别降低了 38% 和 44%。最值得注意的是,我们的方法在不同天气条件下的动态驾驶场景以及昼夜场景中表现出显著的稳健性,而以往的 APR 方法在这些场景中均以失败告终。
通过负海森矩阵迹正则化提升对抗迁移性
Boosting Adversarial Transferability via Negative Hessian Trace Regularization
摘要:可迁移性使得黑盒攻击具有实用性。近期研究表明,位于损失表面平坦极大值处的对抗样本往往表现出更高的可迁移性,并提出了有效的策略来优化对抗样本,使其收敛到该区域。然而,这些研究主要考虑一阶梯度正则化,尚未探索平坦损失表面的高阶几何特性,这可能导致次优结果。在这项工作中,我们提出利用损失函数关于对抗样本的 Hessian 矩阵的迹作为一种曲率感知正则化项。为了提高计算效率,我们引入了一种基于随机估计和有限差分的迹近似方法。我们从理论和实证两方面证明,局部损失极大值附近的对抗样本的 Hessian 矩阵的迹始终为负。基于这一见解,我们提出了负 Hessian 迹正则化(NHTR),通过明确惩罚负的 Hessian 迹来抑制所有方向上的曲率。与现有的一阶正则化方法相比,NHTR 能够在更平坦的局部区域生成对抗样本。在 ImageNet 兼容数据集和 CIFAR-10 数据集上的大量实验结果表明,NHTR 相较于最先进的攻击方法,能显著提高对抗可迁移性。
生成对抗扩散
Generative Adversarial Diffusion
摘要:我们提出了一种新颖的生成框架,该框架将对抗性训练和基于扩散的训练相结合,以克服传统模型的局限性。我们的方法名为生成对抗扩散(GAD),它将对抗性损失直接整合到潜在扩散模型的每个去噪步骤中。通过采用单个 U-Net 作为统一的生成器和判别器,我们的框架无需单独的判别器,从而减少了内存开销,并缓解了生成对抗网络(GAN)常见的问题,如模式崩溃和训练不稳定性。这种集成的对抗性正则化器促进了不同时间步之间的语义信息交换,使模型即使在训练数据稀缺或存在偏差的情况下,也能更好地捕捉复杂的数据分布。在标准潜在扩散基准上进行的大量实验表明,GAD 在文本到图像和图像到 3D 生成等任务中显著提高了图像质量和模式覆盖率。我们的研究结果表明,在单个网络中统一对抗性训练和基于扩散的训练,为高保真、稳定的图像合成提供了一个很有前景的新方向。
DisCoPatch:驯服对抗驱动的批量统计信息以改进分布外检测
DisCoPatch: Taming Adversarially-driven Batch Statistics for Improved Out-of-Distribution Detection
摘要:分布外(OOD)检测在许多应用中都具有重要意义。虽然语义偏移和领域偏移的 OOD 问题已得到充分研究,但本研究聚焦于协变量偏移——即数据分布中可能降低机器学习性能的细微变化。我们假设,检测这些细微偏移能够增进我们对分布内边界的理解,最终改善 OOD 检测效果。在采用批归一化(BN)训练的对抗性鉴别器中,真实样本和对抗样本会形成具有独特批统计量的不同领域——这一特性被我们用于 OOD 检测。我们提出了 DisCoPatch,这是一种无监督的对抗性变分自编码器(VAE)框架,它利用了上述机制。在推理过程中,批次由来自同一图像的补丁组成,这确保了数据分布的一致性,使模型能够依赖批统计量。DisCoPatch 将 VAE 的次优输出(生成样本和重构样本)作为负样本来训练鉴别器,从而提高其划分分布内样本与协变量偏移之间边界的能力。通过收紧这一边界,DisCoPatch 在公开的 OOD 检测基准测试中取得了最先进的结果。所提出的模型不仅在检测协变量偏移方面表现出色,在 ImageNet-1K(-C)上实现了 95.5% 的 AUROC,还在公开的近分布外(Near-OOD)基准测试(95.0%)上超越了所有先前的方法。该模型大小紧凑,仅为 25MB,在实现高性能 OOD 检测的同时,延迟显著低于现有方法,使其成为现实世界 OOD 检测应用中一种高效且实用的解决方案。
KOEnsAttack:通过知识正交化替代集成实现高效无数据黑盒对抗攻击
KOEnsAttack: Towards Efficient Data-Free Black-Box Adversarial Attacks via Knowledge-Orthogonalized Substitute Ensembles
摘要:无数据黑盒攻击旨在在既不访问模型参数也不访问训练数据的情况下对模型进行攻击。现有方法使用生成器合成训练样本,然后训练一个替代模型来模仿受害者模型。最后,利用替代模型生成对抗样本(AEs),并将其迁移到受害者模型上。为此,如何为替代模型训练生成多样化的训练样本,以及如何提高对抗样本从替代模型到受害者模型的迁移能力,成为核心挑战。在本文中,我们提出了一种知识正交集成攻击(称为KOEnsAttack)来实现这两个目标。我们首先使用双网络作为集成替代模型,然后提出样本难度增强方法,将生成器生成的样本转换为硬样本,这些硬样本存在于双模型的有争议区域,以促进样本多样性。接下来,在替代模型训练过程中,我们设计了一个知识正交化模块,引导双网络从受害者模型中学习互补且有用的信息,从而增强在最终集成模型上生成的对抗样本的迁移能力。我们在多个数据集上进行了大量实验,以评估我们方法的有效性。结果表明,与最先进的竞争对手相比,所提出的方法能够取得更优异的性能。
TITAN:基于查询 Token 的域自适应对抗学习
TITAN: Query-Token based Domain Adaptive Adversarial Learning
摘要:我们专注于无源域自适应目标检测(SF-DAOD)问题,即模型必须在不使用源数据的情况下适应未标记的目标域。该问题的大多数现有框架都采用师生(ST)框架,其中通过源预训练模型生成伪标签,以进行进一步的微调。我们观察到,由于教师模型的崩溃,学生模型的性能往往会急剧下降,而教师模型崩溃主要是由伪标签中的高噪声引起的,这种高噪声源于域偏差、差异以及跨域的显著域偏移。为了获得可靠的伪标签,我们提出了一种基于目标的迭代查询-Token 对抗网络(TITAN),该网络将目标图像分为与源域相似的子集(易样本)和与源域不相似的子集(难样本)。我们提出了一种估计方差的策略来划分目标域。这种方法利用了以下见解:更高的检测方差对应更高的召回率以及与源域更大的相似性。此外,我们将基于查询-Token 的对抗模块融入师生基线框架中,以减少两种特征表示之间的域差距。在四个自然成像数据集和两个具有挑战性的医学数据集上进行的实验证实,与现有的最先进(SOTA)方法相比,TITAN 具有更优异的性能。我们报告称,在 C2F、C2B、S2C 和 K2C 基准测试中,与当前的 SOTA 相比,mAP 分别提高了 +22.7%、+22.2%、+21.1% 和 +3.7%.
面向通用深度伪造检测的开放不公平对抗缓解方法
Open-Unfairness Adversarial Mitigation for Generalized Deepfake Detection
摘要:深度伪造检测方法对于身份安全而言正变得日益重要,且近来已被用于支持法律诉讼。然而,这些方法往往因存在有缺陷的逻辑推理而表现出不公平性,这削弱了其预测的可靠性,并引发了人们对其在法律场景中适用性的担忧。为了减轻这种偏见,现有方法通常依赖于预先定义的人口统计属性,如种族和性别。但这些假设存在内在的局限性,因为不同的深度伪造检测器在公平性表现上存在显著差异,常常会暴露出复杂且未曾预料到的偏见模式。为此,我们提出了对抗性开放不公平发现与缓解网络(AdvOU),这是一个旨在减轻深度伪造检测中不可预测的不公平性的新型框架。我们的方法通过为通用深度伪造检测器配备一个轻量级的不公平调节器(UR)来增强其性能,该调节器能够动态识别并缓解偏见。此外,我们提出了一种对抗性学习范式,在开放不公平发现(OUD)模块和不公平对抗缓解(UAM)模块的训练之间进行交替。前者会加剧不公平调节器中的不公平性,以揭示潜在的偏见模式;后者则通过增强检测器对抗不公平性的鲁棒性,来提升检测器的公平性。在广泛使用的深度伪造数据集上进行的大量实验验证了我们方法的有效性,在跨域深度伪造检测的公平性和泛化性评估中,其性能均优于最先进的方法。
NAPPure:非加性扰动下稳健图像分类的对抗净化
NAPPure: Adversarial Purification for Robust Image Classification under Non-Additive Perturbations
摘要:对抗性净化在对抗对抗性图像扰动方面取得了巨大成功,这些扰动通常被假设为加性的。然而,像模糊、遮挡和失真等非加性对抗性扰动在现实世界中也很常见。在这类扰动下,现有的对抗性净化方法效果要差得多,因为它们是为适应加性特性而设计的。在本文中,我们提出了一个名为 NAPPure 的扩展对抗性净化框架,它能够进一步处理非加性扰动。具体来说,我们首先建立对抗性图像的生成过程,然后通过似然最大化来分离潜在的清晰图像和扰动参数。在 GTSRB 和 CIFAR-10 数据集上的实验表明,NAPPure 显著提高了图像分类模型对非加性扰动的鲁棒性。
面向高效图像和视频合成的扩散蒸馏对抗分布匹配
Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis
摘要:分布匹配蒸馏(DMD)是一种很有前景的分数蒸馏技术,它能将预训练的教师扩散模型压缩为高效的单步或多步学生生成器。然而,它对反向 Kullback-Leibler(KL)散度最小化的依赖,在某些应用中可能会导致模式坍塌(或模式趋同)。为了规避这一固有缺陷,我们提出了对抗性分布匹配(ADM)——一种新颖的框架,该框架利用基于扩散的判别器,以对抗的方式对齐真实和伪造分数估计器之间的潜在预测,用于分数蒸馏。在极具挑战性的单步蒸馏场景下,我们通过在潜在空间和像素空间中使用混合判别器进行对抗性蒸馏,进一步改进了预训练生成器。与 DMD2 预训练中使用的均方误差不同,我们的方法融入了从教师模型收集的常微分方程(ODE)对的分布损失,从而为下一阶段的分数蒸馏微调提供了更好的初始化。通过将对抗性蒸馏预训练与 ADM 微调相结合,形成一个名为 DMDX 的统一流程,我们提出的方法在 SDXL 上实现了优于 DMD2 的单步性能,同时消耗更少的 GPU 时间。在 SD3-Medium、SD3.5-Large 和 CogVideoX 上应用多步 ADM 蒸馏的额外实验,为高效的图像和视频合成设立了新的基准。
伪装良性:一种利用协同感知漏洞的隐秘对抗攻击
Pretend Benign: A Stealthy Adversarial Attack by Exploiting Vulnerabilities in Cooperative Perception
摘要:近年来,基于学习的多智能体协同感知受到了广泛关注。然而,神经网络固有的脆弱性,再加上协同通信作为一个大开的后门所带来的风险,使得这些系统极易受到对抗性攻击。现有的攻击方法缺乏隐蔽性,因为它们会不加区分地干扰传输的信息,产生大量误报,而这些误报很容易被基于共识的防御机制检测到。本文提出了一种新型的隐蔽对抗性攻击方法——“伪装良性”(PB),该方法利用协同感知中的漏洞,使攻击者能够伪装成良性的协作者。为实现这一目标,我们首先引入了攻击区域选择(ARS)模块,该模块根据置信度将感知区域划分为子区域,以精确定位最佳攻击位置。然后,我们提出了多目标对抗性扰动生成(MAPG)方法,该方法能维持共识、赢得受害者的信任,从而逆转感知的正常协同角色。为了减少对抗性信号生成和通信过程中的延迟,我们进一步提出了通过历史特征流预测未来信息的实时攻击方法。在 OPV2V 和 V2XSet 数据集上进行的大量实验表明,PB能有效绕过最先进的防御方法,凸显了其隐蔽性和有效性。
更多推荐


所有评论(0)