欢迎关注 【youcans的AGI论文精读】原创作品

【DINOv3】DINOv3 技术报告
【DINOv3】(2)下载DINOv3项目和预训练模型
【DINOv3】(3)DINOv3的环境配置
【DINOv3】(4)例程 1:高维特征可视化
【DINOv3】(5)例程 2:特征提取与图像匹配例程

【DINOv3】(2)DINOv3 技术报告


0. DINOv3 简介

2025年8月14日,Meta 重磅发布 DINOv3。Simenoi 等也在 arxiv 发表了 DINOv3 技术报告。

DINOv3 是 Meta 推出的通用的、SOTA 级的视觉基础模型。模型通过无标注数据训练,生成高质量的高分辨率视觉特征,适用图像分类、语义分割、目标检测等多任务。DINOv3 拥有 70 亿参数,训练数据量达 17 亿张图像,性能全面超越弱监督模型,模型支持多种模型变体适应不同计算需求。DINOv3 开源的训练代码和预训练模型,为计算机视觉研究和应用开发提供强大支持。

在这里插入图片描述


论文下载:ARIXV-DINOv3meta-DINOv3
Github下载:Github-DINOv3

在这里插入图片描述


0.1 DINOv3 摘要

自监督学习有望消除人工数据标注的需求,使模型能够毫不费力地扩展到海量数据集和更大规模的架构。由于不针对特定任务或领域进行定制,这一训练范式具备使用单一算法从自然图像到航拍图像等多样化来源学习视觉表征的潜力。

本技术报告介绍了DINOv3,这是通过简单而有效的策略实现该愿景的重要里程碑。

  • 首先,我们通过精细的数据准备、设计和优化,充分利用扩展数据集与模型规模所带来的收益。
  • 其次,我们引入一种名为Gram anchoring的新方法,有效解决了密集特征图在长期训练过程中性能退化的已知但未解难题。
  • 最后,我们采用后处理策略,进一步提升模型在分辨率、模型规模及与文本对齐方面的灵活性。

由此,我们提出了一种通用的视觉基础模型,无需微调即可在广泛设置中超越专用型当前最优方法。

DINOv3生成的高质量密集特征在多种视觉任务上取得卓越性能,显著超越先前自监督与弱监督基础模型。我们还发布DINOv3系列视觉模型,旨在通过为不同资源约束和部署场景提供可扩展解决方案,推动广泛任务与数据上的当前最优水平。


1. 引言

基础模型已成为现代计算机视觉的核心构建模块,通过单一可复用模型实现跨任务与跨领域的广泛泛化能力。自监督学习(Self-supervised learning, SSL)通过直接从原始像素数据中学习并挖掘图像中自然共现的模式,成为训练此类模型的强大方法。与弱监督及全监督预训练方法(Radford et al., 2021; Dehghani et al., 2023; Bolya et al., 2025)不同,后者需要图像与高质量元数据配对,SSL 能够在海量未标注图像集合上进行训练。得益于几乎无限可用的训练数据,这对训练大规模视觉编码器尤为有效。DINOv2(Oquab et al., 2024)体现了这些优势,在图像理解任务中取得令人瞩目的成果(Wang et al., 2025),并支持组织病理学等复杂领域的预训练(Chen et al., 2024)。经过 SSL 训练的模型还表现出额外的理想特性:对输入分布偏移具有鲁棒性,提供强全局与局部特征,并生成丰富嵌入以促进物理场景理解。由于 SSL 模型并非针对任何特定下游任务训练,其产生的通用特征具备多用途与鲁棒性。例如,DINOv2 模型在无需任务特定微调的情况下,在多种任务与领域均表现强劲,允许单个冻结主干网络服务于多项任务。重要的是,自监督学习尤其适用于组织病理学(Vorontsov et al., 2024)、生物学(Kim et al., 2025)、医学影像(Pérez-García et al., 2025)、遥感(Cong et al., 2022; Tolan et al., 2024)、天文学(Parker et al., 2024)或高能粒子物理(Dillon et al., 2022)等领域中大量可获得的观测数据。这些领域往往缺乏元数据,并已显示出可从 DINOv2 这类基础模型中获益。最后,SSL 无需人工干预,非常适合在网络数据不断增长的情况下进行终身学习。

在实践中,SSL 的承诺——即利用大量无约束数据产生任意规模且强大的模型——在大规模场景下仍面临挑战。尽管 Oquab et al. (2024) 提出的启发式方法缓解了模型不稳定与崩溃问题,进一步扩展仍会带来新问题。首先,如何从大量未标注集合中收集有用数据尚不清楚。其次,常规训练实践中采用余弦调度意味着需先验知晓优化周期,这在面对大规模图像语料时难以实现。第三,特征性能在早期训练后逐渐下降,这一现象通过 patch 相似度图的可视化得到证实。该现象出现在超过 ViT-Large 规模(3 亿参数)的更长时间训练中,削弱了 DINOv2 扩展的有效性。针对上述问题,本文提出 DINOv3,推进大规模 SSL 训练。我们证明,单一冻结的 SSL 主干网络可作为通用视觉编码器,在具有挑战性的下游任务上达到当前最优性能,超越依赖监督与元数据的预训练策略。我们的研究目标如下:(1) 训练一个在任务与领域间通用的基础模型;(2) 改善现有 SSL 模型在密集特征上的不足;(3) 发布一套可直接使用的模型族。以下部分将围绕这三项目标展开讨论。

专用模型的情况下,单次前向传播即可在多项任务上获得前沿结果,从而带来显著的计算节省——这对实际应用,尤其是边缘设备而言,是一项关键优势。我们在第6节展示了DINOv3可成功应用于的广泛任务。其次,一条可扩展且无需依赖元数据的SSL训练管线为众多科学应用解锁了可能性。通过在多样化图像(无论是网络图像还是观测数据)上进行预训练,SSL模型可跨大量领域与任务泛化。如图1(d)所示,从高分辨率航拍图像提取的DINOv3特征的PCA清晰可见地分离了道路、房屋与植被,凸显了模型特征的质量。


图1:(a) 历年来在ImageNet1k(IN1k)上线性探测结果的演变,比较了全监督(SL)、弱监督(WSL)与自监督学习(SSL)方法。尽管SSL出现较晚,但其进展迅速,现已达到近年来ImageNet准确率的瓶颈。另一方面,我们展示了SSL在高质量密集特征方面的独特优势。借助DINOv3,我们在密集任务上显著优于弱监督模型,如最佳WSL模型与DINOv3的相对性能所示(b)。我们还展示了利用DINOv3从自然图像(c)与航拍图像(d)训练所得特征的高分辨率PCA图。


通过Gram Anchoring获得更优特征图

DINOv3的另一核心优势是其密集特征图的显著提升。DINOv3的SSL训练策略旨在使模型在高层语义任务上表现卓越,同时生成适用于几何任务(如深度估计或三维匹配)的优质特征图。具体而言,模型应产生可直接使用或仅需极少后处理的密集特征。当使用海量图像训练时,密集与全局表征之间的折衷尤为难以优化,因为高层理解目标可能与密集特征图的质量冲突。这些相互矛盾的目标导致大模型在长训练周期中出现密集特征崩溃。我们提出的Gram anchoring策略有效缓解了这一崩溃(见第4节)。因此,DINOv3获得了远优于DINOv2的密集特征图,即便在高分辨率下仍保持清晰(见图3)。

在这里插入图片描述
图3:高分辨率密集特征。我们在4096×4096输入图像上,以红色十字标记的块为基准,计算其与所有其他块之间由DINOv3输出特征得到的余弦相似度图。请放大查看,您是否认同DINOv3的结果?


DINOv3模型家族

通过Gram anchoring解决密集特征图退化问题,释放了扩展的威力。由此,使用SSL训练更大规模的模型带来了显著性能提升。本文中,我们成功训练了具有70亿参数的DINO模型。由于如此规模的模型运行需大量资源,我们采用蒸馏将其知识压缩至更小变体。由此,我们推出DINOv3视觉模型家族——一套全面模型套件,旨在应对广泛的计算机视觉挑战。该模型家族通过提供可适应不同资源约束与部署场景的可扩展解决方案,推动当前最优水平。蒸馏过程产生多尺度模型变体,包括Vision Transformer(ViT)Small、Base与Large,以及基于ConvNeXt的架构。值得注意的是,高效且广泛采用的ViT-L模型在多项任务上的性能已接近原始70亿参数教师模型。总体而言,DINOv3家族在广泛基准测试中表现强劲,在全球任务上与竞争模型精度相当或更优,同时在密集预测任务上显著超越对手,如图2所示。

在这里插入图片描述

图2:DINOv3模型家族在不同基准测试上与其他自监督或弱监督模型家族的比较。DINOv3在密集基准测试上显著超越其他模型,包括利用掩码标注先验的AM-RADIO(Heinrich et al., 2025)等模型。


贡献概述

在本工作中,我们提出多项贡献,以应对将自监督学习(SSL)扩展至大型前沿模型的挑战。我们基于自动数据策划的最新进展(Vo et al., 2024)获取大规模“背景”训练数据集,并将其与少量专门数据(ImageNet-1k)精心混合,从而利用大量无约束数据提升模型性能。该贡献(i)围绕数据扩展,将在第3.1节描述。

我们将主模型规模扩大至70亿参数,通过定义一种定制的ViT架构变体实现。我们引入现代位置嵌入(轴向RoPE)并开发正则化技术以避免位置伪影。不同于DINOv2中的多重余弦调度,我们以恒定超参数调度训练100万次迭代,从而获得性能更强的模型。该贡献(ii)关于模型架构与训练,将在第3.2节描述。

借助上述技术,我们能够按照DINOv2算法在规模上训练模型。然而,如前所述,规模会导致密集特征退化。为此,我们提出通过Gram锚定训练阶段对流程进行核心改进。该阶段清除特征图中的噪声,产生令人印象深刻的相似度图,并在参数化与非参数化密集任务上大幅提升性能。该贡献(iii)关于Gram训练,将在第4节描述。

沿袭先前实践,我们流程的最后步骤包括高分辨率后训练阶段,以及将知识蒸馏到一系列不同尺寸的高性能模型中。对于后者,我们开发了一种新颖且高效的单教师-多学生蒸馏流程。该贡献(iv)将我们的70亿前沿模型的能力迁移至一组更小、更实用的日常模型,将在第5.2节描述。

我们全面的基准测试表明,第6节的结果显示我们的方法在密集任务上树立了新标准,并在全局任务上与CLIP衍生模型表现相当。特别地,在冻结视觉主干的情况下,我们在长期存在的计算机视觉任务上达到最先进性能,如目标检测(COCO检测,mAP 66.1)和图像分割(ADE20k,mIoU 63.0),超越专门微调流程。此外,我们在第8节通过将DINOv3算法应用于卫星影像,提供了跨领域通用性的证据,并超越所有先前方法。


2. 相关工作

自监督学习 在无标注条件下学习需要构造人工任务以提供替代监督,自监督学习(SSL)的核心艺术与挑战即在于精心设计这些所谓的前置任务,从而学得对下游任务强有力的表征。语言领域因其离散性可直接构建此类任务,催生了多种成功的文本无监督预训练方法,例如词嵌入(Mikolov et al., 2013; Bojanowski et al., 2017)、句子表征(Devlin et al., 2018; Liu et al., 2019)以及纯语言模型(Mikolov et al., 2010; Zaremba et al., 2014)。相较之下,计算机视觉因信号连续而面临更大挑战。早期模仿语言方法的做法从图像局部提取监督信号以预测其他部分,例如预测相对块位置(Doersch et al., 2015)、块重排序(Noroozi and Favaro, 2016; Misra and Maaten, 2020)或图像修复(Pathak et al., 2016)。其他任务包括图像重着色(Zhang et al., 2016)或预测图像变换(Gidaris et al., 2018)。

其中,基于修复的方法因基于块的ViT架构灵活而备受关注(He et al., 2021; Bao et al., 2021; El-Nouby et al., 2021)。其目标是重建图像被损坏的区域,可视为一种去噪自编码,概念上与BERT预训练中的掩码token预测任务(Devlin et al., 2018)相关。值得注意的是,He et al. (2021) 证明基于像素的掩码自编码器(MAE)可作为下游任务微调的强初始化。随后,Baevski et al. (2022; 2023); Assran et al. (2023) 表明预测学得潜在空间而非像素空间可产生更强大、更高层级的特征——这一学习范式称为JEPA:“联合嵌入预测架构”(LeCun, 2022)。近期,JEPA也被扩展至视频训练(Bardes et al., 2024; Assran et al., 2025)。

第二条与本文更近的研究路线利用图像间的判别信号学习视觉表征。该类方法可追溯至早期深度学习研究(Hadsell et al., 2006),但通过实例分类技术而流行(Dosovitskiy et al., 2016; Bojanowski and Joulin, 2017; Wu et al., 2018)。后续进展引入对比目标与信息论准则(Hénaff et al., 2019; He et al., 2020; Chen and He, 2020; Chen et al., 2020a; Grill et al., 2020; Bardes et al., 2021),以及自聚类策略(Caron et al., 2018; Asano et al., 2020; Caron et al., 2020; 2021)。更近的方法如iBOT(Zhou et al., 2021)将这些判别损失与掩码重建目标结合。所有这些方法均能学得强特征并在ImageNet等标准基准上取得高性能(Russakovsky et al., 2015),但大多数在扩大模型规模时面临挑战(Chen et al., 2021)。

视觉基础模型 深度学习革命始于AlexNet突破(Krizhevsky et al., 2012),该深度卷积神经网络在ImageNet挑战(Deng et al., 2009; Russakovsky et al., 2015)上超越所有先前方法。早期研究即发现,在大型人工标注ImageNet数据集上端到端学习的特征对广泛迁移学习任务极为有效(Oquab et al., 2014)。早期视觉基础模型随后聚焦于架构发展,包括VGG(Simonyan and Zisserman, 2015)、GoogleNet(Szegedy et al., 2015)和ResNets(He et al., 2016)。

鉴于扩展的有效性,后续工作探索在大型数据集上训练更大模型。Sun et al. (2017) 利用含3亿标注图像的专有JFT数据集扩展监督训练,取得显著效果;JFT也为Kolesnikov et al. (2020) 带来显著性能提升。同时,研究探索结合监督与无监督数据进行扩展。例如,可用ImageNet监督模型为无监督数据生成伪标签,再训练更大网络(Yalniz et al., 2019)。随后,大型监督数据集如JFT也促进了Transformer架构向计算机视觉的迁移(Dosovitskiy et al., 2020)。特别地,不依赖JFT而达到原始Vision Transformer(ViT)性能需付出巨大努力(Touvron et al., 2020; 2022)。凭借ViT的学习能力,扩展工作进一步由Zhai et al. (2022a) 推进,最终形成极大型ViT-22B编码器(Dehghani et al., 2023)。

鉴于人工标注大型数据集的复杂性,弱监督训练——即从图像关联的元数据中获取标注——成为监督训练的有效替代。早期,Joulin et al. (2016) 证明网络可通过简单预测图像字幕中所有单词作为目标进行预训练。该初始方法随后通过利用句子结构(Li et al., 2017)、融入其他元数据并辅以策划(Mahajan et al., 2018)以及扩展(Singh et al., 2022)得到改进。然而,弱监督算法直至引入对比损失与字幕表征联合训练才充分发挥潜力,如Align(Jia et al., 2021)与CLIP(Radford et al., 2021)所示。

这一高度成功的方法启发了众多开源复现与扩展努力。Open CLIP(Cherti et al., 2023)首个在LAION数据集(Schuhmann et al., 2021)上复现CLIP;后续工作以CLIP方式微调预训练主干(Sun et al., 2023; 2024)。认识到数据收集是CLIP训练成功的关键因素,MetaCLIP(Xu et al., 2024)严格遵循原始CLIP流程以复现结果,而Fang et al. (2024a) 利用监督数据集策划预训练数据。其他工作聚焦改进训练损失,例如SigLIP中使用sigmoid损失(Zhai et al., 2023)或利用预训练图像编码器(Zhai et al., 2022b)。最终,获得尖端基础模型最关键的要素仍是丰富的高质量数据与大量计算资源。沿此路线,SigLIP 2(Tschannen et al., 2025)与Perception Encoder(PE)(Bolya et al., 2025)在超过400亿图文对训练后取得令人瞩目的结果;最大PE模型在860亿样本上以131K全局批大小训练。最后,一系列更复杂且原生多模态的方法被提出,包括对比字幕(Yu et al., 2022)、潜在空间掩码建模(Bao et al., 2021; Wang et al., 2022b; Fang et al., 2023; Wang et al., 2023a)以及自回归训练(Fini et al., 2024)。

相比之下,专注于扩展无监督图像预训练的工作相对较少。早期努力包括Caron et al. (2019) 与Goyal et al. (2019) 利用YFCC数据集(Thomee et al., 2016)。后续通过聚焦更大数据集与模型取得进展(Goyal et al., 2021; 2022a),以及SSL数据策划的初步尝试(Tian et al., 2021)。对训练算法、更大架构与更大量训练数据的精心调优带来了DINOv2的瞩目结果(Oquab et al., 2024);首次有SSL模型在一系列任务上匹配或超越开源CLIP变体。该方向近期由Fan et al. (2025) 通过扩展至更大模型而无数据策划,或由Venkataramanan et al. (2025) 利用开放数据集与改进训练配方进一步推展。

密集Transformer特征 现代视觉应用广泛消费预训练Transformer的密集特征,包括多模态模型(Liu et al., 2023; Beyer et al., 2024)、生成模型(Yu et al., 2025; Yao et al., 2025)、3D理解(Wang et al., 2025)、视频理解(Lin et al., 2023a; Wang et al., 2024b)与机器人(Driess et al., 2023; Kim et al., 2024)。此外,检测、分割或深度估计等传统视觉任务亦需准确局部描述符。为提升SSL训练局部描述符质量,大量工作聚焦开发局部SSL损失,例如利用视频时空一致性,如使用点跟踪循环作为训练信号(Jabri et al., 2020)、利用同一图像不同裁剪间的空间对齐(Pinheiro et al., 2020; Bardes et al., 2022)或强制邻域块一致性(Yun et al., 2022)。Darcet et al. (2025) 表明预测聚类局部块可改进密集表征。DetCon(Hénaff et al., 2021)与ORL(Xie et al., 2021)在区域建议上执行对比学习,但假设该建议先验存在;该假设被ODIN(Hénaff et al., 2022)与SlotCon(Wen et al., 2022)等方法放松。无需改变训练目标,Darcet et al. (2024) 表明向输入序列添加寄存器token可大幅提升密集特征图,新近工作发现无需模型训练即可实现(Jiang et al., 2025; Chen et al., 2025)。

近期趋势是基于蒸馏的“聚合”方法,其结合多个具有不同全局与局部特征质量、以不同监督级别训练的图像编码器信息(Ranzinger et al., 2024; Bolya et al., 2025):AM-RADIO(Ranzinger et al., 2024)将全监督SAM(Kirillov et al., 2023)、弱监督CLIP与自监督DINOv2的优势融合为统一主干。Perception Encoder(Bolya et al., 2025)类似地将SAM(v2)蒸馏为名为PEspatial的专门密集变体。它们采用目标强制学生与教师块间余弦相似度高,其中教师以掩码标注训练。类似损失在风格迁移中已被证明有效,通过减少特征维度Gram矩阵间不一致性(Gatys et al., 2016; Johnson et al., 2016; Yoo et al., 2024)。本文中,我们采用Gram目标以正则化学生与教师块间余弦相似度,使其趋近。我们使用SSL模型早期迭代自身作为教师,证明早期SSL模型可有效指导SSL训练,适用于全局与密集任务。

其他工作聚焦SSL训练模型局部特征的事后改进。例如,Ziegler and Asano (2022) 以密集聚类目标微调预训练模型;类似地,Salehi et al. (2023) 通过时序对齐块特征微调,二者均提升局部特征质量。更近地,Pariza et al. (2025) 提出基于块排序的目标,鼓励学生与教师产生具有一致邻域顺序的特征。无需微调,STEGO(Hamilton et al., 2022)在冻结SSL特征之上学习非线性投影以形成紧致聚类并增强相关模式。或者,Simoncini et al. (2024) 通过拼接不同自监督目标梯度增强自监督特征。最近,Wysoczańska et al. (2024) 表明通过块加权平均可显著改善含噪特征图。

相关但非SSL特定地,一些近期工作从ViT特征图(常因图像块化而低分辨率)生成高分辨率特征图(Fu et al., 2024)。与这些工作相反,我们的模型原生输出高质量密集特征图,并在不同分辨率下保持稳定与一致,如图4所示。


在这里插入图片描述

图 4:高分辨率下的 DINOv3 模型。我们通过将特征空间上计算得到的主成分分析(PCA)的前三个分量映射为 RGB 颜色,来可视化 DINOv3 的密集特征。为使 PCA 聚焦于目标对象,我们通过背景减法对特征图进行掩码处理。随着分辨率的提高,DINOv3 生成的特征既清晰锐利,又保持了语义上的有效性。更多 PCA 可视化结果详见 6.1.1 节。


3. 无监督大规模训练

DINOv3 是一种新一代模型,旨在通过突破自监督学习的边界,产生迄今最鲁棒且灵活的视觉表征。我们从大型语言模型(LLMs)的成功中汲取灵感:扩大模型容量可带来卓越的涌现特性。借助规模提升一个数量级的模型与训练数据,我们寻求释放 SSL 的全部潜能,并在不受传统监督或任务特定方法固有限制的情况下,为计算机视觉带来类似的范式转变。特别地,SSL 产生的丰富、高质量视觉特征不对任何特定监督或任务产生偏差,从而为广泛的下游应用提供通用基础。尽管先前扩展 SSL 模型的尝试因不稳定问题受阻,本节阐述我们如何借助精心设计的数据准备、架构与优化来利用扩展优势。我们首先描述数据集构建流程(第 3.1 节),随后呈现 DINOv3 第一阶段自监督训练配方(第 3.2 节),包括架构选择、损失函数与优化技术。聚焦于密集特征的第二阶段训练将在第 4 节描述。


3.1 数据准备

数据扩展是大型基础模型成功的关键驱动因素之一(Touvron et al., 2023; Radford et al., 2021; Xu et al., 2024; Oquab et al., 2024)。然而,简单地增大数据规模未必带来更高的模型质量与下游基准性能(Goyal et al., 2021; Oquab et al., 2024; Vo et al., 2024):成功的数据扩展通常依赖于精心策划的数据管道。这些算法可能目标各异:或聚焦提升数据多样性与平衡性,或聚焦数据实用性——即与常见实际应用的相关性。为开发 DINOv3,我们结合两种互补策略以同时提升模型的泛化能力与性能,在两大目标间取得平衡。

数据收集与策划 我们利用来自 Instagram 公开帖子的网络图像构建大规模预训练数据集,这些图像已通过平台级内容审核以遏制有害内容,初始数据池约含 170 亿张图像。基于该原始池,我们构建三部分数据集:第一部分采用 Vo et al. (2024) 提出的分层 k-means 自动策划方法,以 DINOv2 图像嵌入为基础,进行 5 层聚类,聚类数自底向上分别为 2 亿、800 万、80 万、10 万、2.5 万。构建层级聚类后,应用 Vo et al. (2024) 的平衡采样算法,得到包含 16.89 亿张图像的策划子集(记为 LVD-1689M),保证对网络视觉概念的均衡覆盖。第二部分采用类似 Oquab et al. (2024) 的基于检索的策划系统,从数据池中检索与选定种子数据集相似的图像,以覆盖与下游任务相关的视觉概念。第三部分使用公开计算机视觉数据集,包括 ImageNet-1k(Deng et al., 2009)、ImageNet-22k(Russakovsky et al., 2015)与 Mapillary Street-level Sequences(Warburg et al., 2020),以优化模型性能,遵循 Oquab et al. (2024)。

数据采样 预训练期间,我们使用采样器混合不同数据部分。混合策略可选:其一为同构批处理,每迭代随机选取单一组件;其二为异构批处理,按一定比例从所有组件抽样组合。受 Charton and Kempe (2024) 启发——其观察到由小规模高质量数据组成的同构批处理更有益——我们每迭代随机选择:仅来自 ImageNet-1k 的同构批,或混合其余所有组件的异构批。训练过程中,ImageNet-1k 同构批占比 10%。

数据消融 为评估数据策划技术影响,我们进行消融实验,比较我们的数据混合与仅采用聚类或仅采用检索策划的数据集,以及原始数据池。为此,我们在各数据集上训练模型,并在标准下游任务上比较性能。为效率计,训练计划缩短至 20 万次迭代而非 100 万次。表 1 显示,单一策划技术并非在所有基准上最优,而我们的完整流程兼得两者之长。


在这里插入图片描述


3.2 自监督大规模训练

尽管采用 SSL 训练的模型已展现出有趣特性(Chen et al., 2020b; Caron et al., 2021),大多数 SSL 算法尚未扩展至更大模型规模。这要么源于训练稳定性问题(Darcet et al., 2025),要么由于过度简化的方案未能捕捉视觉世界的全部复杂性。当在大规模上训练时(Goyal et al., 2022a),SSL 模型的表现未必惊艳。一个显著例外是 DINOv2,该模型拥有 11 亿参数,在策划数据上训练,性能可匹敌弱监督模型 CLIP(Radford et al., 2021)。近期将 DINOv2 扩展至 70 亿参数的尝试(Fan et al., 2025)在全球任务上取得可喜结果,但在密集预测上表现不佳。本文旨在同时扩大模型与数据规模,获得更强大的视觉表征,兼具改进的全局与局部特性。


学习目标

我们采用判别式自监督策略训练模型,该策略融合多个自监督目标,包含全局与局部损失项。遵循 DINOv2(Oquab et al., 2024),我们使用图像级目标(Caron et al., 2021)LDINO,并以块级潜在重建目标(Zhou et al., 2021)LiBOT 进行平衡;同时在两个目标中用 SwAV 的 Sinkhorn-Knopp 替换 DINO 的中心化(Caron et al., 2020)。每个目标通过主干网络之上的专用头计算,允许在损失计算前对特征进行一定专门化。此外,我们对局部与全局裁剪的主干输出应用专用的层归一化。经验上,我们发现该改动在训练后期稳定 ImageNet kNN 分类(准确率 +0.2)并提升密集性能(例如 ADE20k 分割 mIoU +1,NYUv2 深度估计 RMSE −0.02)。此外,添加 Koleo 正则项 LKoleo 以鼓励批内特征在空间中均匀分布(Sablayrolles et al., 2018)。我们采用分布式 Koleo 实现,在小批 16 样本上应用该损失——可跨 GPU。初始训练阶段通过优化以下损失进行:

在这里插入图片描述


更新的模型架构

针对模型扩展,我们将规模增至 70 亿参数,并在表 2 中列出与 DINOv2 工作所训 11 亿参数模型对应的超参数对比。我们还采用定制版 RoPE:基础实现为每个 patch 分配归一化的 [−1,1] 坐标,随后在多头注意力操作中依据两 patch 相对位置施加偏置。为提升模型对分辨率、尺度与纵横比的鲁棒性,我们引入 RoPE-box jittering,将坐标框 [−1,1] 随机放缩至 [−s,s],其中 s ∈ [0.5,2]。这些改动共同使 DINOv3 习得更为精细且鲁棒的视觉特征,提升性能与可扩展性。


在这里插入图片描述


优化

在超大规模数据集上训练大模型是一项复杂的实验流程。鉴于模型容量与训练数据复杂度之间的交互难以先验评估,无法预设合适的优化时长。为此,我们摒弃所有参数调度,采用恒定的学习率、权重衰减与教师 EMA 动量。此举带来两点主要收益:其一,只要下游性能持续改善,即可持续训练;其二,优化超参数数量减少,更易于合理设定。为使训练顺利启动,我们仍对学习率与教师温度采用线性预热。遵循惯例,我们使用 AdamW(Loshchilov and Hutter, 2017),总批量为 4096 张图像,分布于 256 块 GPU。训练采用 multi-crop 策略(Caron et al., 2020),每张图像取 2 张全局裁剪与 8 张局部裁剪。全局/局部裁剪的方形图像边长分别为 256/112 像素,配合 patch 尺寸调整,使每幅图像的有效序列长度与 DINOv2 保持一致,单批总序列长度达 370 万 tokens。其余超参数见附录 C 与代码发布。


4. Gram Anchoring:面向密集特征的正则化

为充分释放大规模训练的潜力,我们计划对 7B 模型进行超长周期训练,并设想其可无限期持续。正如预期,延长训练在全球基准上带来增益;然而随着训练推进,密集任务性能却出现退化(图 5b 与 5c)。该现象源于特征表示中 patch 级不一致性的出现,削弱了延长训练的价值。本节首先分析 patch 级一致性的丧失,随后提出一种缓解该问题的新目标——Gram anchoring,最后讨论该方法对训练稳定性与模型性能的影响。


4.1 训练过程中 patch 级一致性的丧失

在延长训练阶段,我们观察到全局指标持续提升,而密集预测任务性能显著下降。类似行为在 DINOv2 训练中亦有出现,但程度较轻,并在 Fan et al. (2025) 的扩展工作中被讨论;然而据我们所知,该问题迄今仍未解决。图 5b 与 5c 展示了模型在图像分类与分割任务上的性能随迭代数的变化:分类任务中,我们在 ImageNet-1k 上基于 CLS token 训练线性分类器并报告 top-1 准确率;分割任务中,我们在 Pascal VOC 提取的 patch 特征上训练线性层并报告 mIoU。可见,无论 ViT-g 还是 ViT-7B,分类准确率均单调提升;而分割性能在约 200k 迭代后下降,ViT-7B 甚至跌破初期水平。

为深入理解退化原因,我们通过可视化 patch 间余弦相似度评估 patch 特征质量。图 6 给出主干输出 patch 特征与参考 patch(红色高亮)的余弦相似度热力图。200k 迭代时,相似度图平滑且定位准确,表明 patch 级表示一致;而 600k 迭代及以后,图显著退化,大量无关 patch 与参考 patch 出现高相似度。该 patch 级一致性的丧失与密集任务性能下降高度相关。

上述 patch 级异常与 Darcet et al. (2024) 所述的高范数 patch 离群值不同:在引入 register token 后,patch 范数在训练全程保持稳定。然而我们注意到,CLS token 与 patch 输出之间的余弦相似度随训练逐步升高——这在预期之内,却意味着 patch 特征的局部性减弱。图 5a 展示了 200k 与 1M 迭代的余弦图。为缓解密集任务性能下降,我们提出一种专门正则化 patch 特征的新目标,确保 patch 级一致性,同时维持高全局性能。


在这里插入图片描述

图 5:余弦相似度的变化趋势(a),以及 ViT-g 模型(b)和 ViT-7B 模型(c)在 ImageNet1k 线性分类任务(IN1k)上的准确率与在 VOC 数据集分割任务上的性能变化趋势。我们观察到:当补丁令牌(patch tokens)与类别令牌(class tokens)之间的余弦相似度较低时,分割任务性能达到最高;随着训练的推进,这些相似度逐渐升高,而密集型任务(dense tasks)的性能则随之下降。


在这里插入图片描述
图 6:红色标记补丁与所有其他补丁之间余弦相似度的变化趋势。随着训练的推进,模型生成的特征局部性逐渐减弱,相似度图的噪声也随之增加。


4.2 Gram Anchoring 目标

实验过程中,我们发现学习强判别特征与保持局部一致性之间存在相对独立性,表现为全局性能与密集性能缺乏相关性。尽管将全局 DINO 损失与局部 iBOT 损失结合已初步缓解该问题,我们观察到这种平衡不稳定,随着训练推进,全局表示逐渐占据主导。基于这一洞察,我们提出一种新颖方案,显式利用该独立性。

我们引入一项新目标,通过显式约束 patch 级一致性的质量来缓解其退化,且不对特征本身造成直接影响。该损失函数作用于 Gram 矩阵——即图像内所有 patch 特征两两点积构成的矩阵。我们希望将学生的 Gram 矩阵推向一个早期模型的 Gram 矩阵,后者称为 Gram 教师。Gram 教师通过选取教师网络的一个较早迭代获得,该迭代在密集任务上表现出更优特性。由于操作对象为 Gram 矩阵而非特征本身,局部特征可自由变动,只需保持相似性结构不变即可。

设一幅图像包含 P 个 patch,网络特征维度为 d。记 XS(对应 XG)为学生(对应 Gram 教师)的 L2 归一化局部特征构成的 P×d 矩阵。我们定义损失 LGram 如下:

在这里插入图片描述

我们仅在全球裁切(global crops)上计算该损失。尽管该损失可在训练早期就施加,出于效率考虑,我们从 100 万次迭代之后才开始使用。有趣的是,我们发现即使延迟应用 LGram,仍能“修复”已严重退化的局部特征。为进一步提升性能,我们每 10k 次迭代更新一次 Gram 教师,此时 Gram 教师与主 EMA 教师完全一致。我们将训练的这一第二阶段称为精修(refinement)阶段,其优化目标为 LRef,

在这里插入图片描述

我们在图 7 中可视化了不同损失的演化过程,观察到施加 Gram 目标显著影响 iBOT 损失,使其下降速度明显加快。这表明,由稳定的 Gram 教师引入的稳定性对 iBOT 目标产生了正向作用。相比之下,Gram 目标对 DINO 损失并无显著影响。该观察意味着 Gram 目标与 iBOT 目标以相似方式作用于特征,而 DINO 损失则以不同方式影响特征。


在这里插入图片描述

图 7:补丁级 iBOT 损失、全局损失 DINO(应用于全局裁剪图像)以及新引入的格拉姆损失(Gram loss)在训练迭代过程中的变化趋势。我们重点标注了使用格拉姆目标函数(Gram objective)的精修步骤(LRef)所对应的迭代次数。


就性能而言,我们观察到新损失的引入几乎即刻产生影响。如图 8 所示,在最初的 10k 次迭代内引入 Gram 锚定即可在密集任务上带来显著提升。此外,在 Gram 教师更新后,ADE20k 基准亦出现显著增益。继续延长训练进一步提升了 ObjectNet 基准的性能,而其他全局基准则受新损失影响较小。


在这里插入图片描述


4.3 利用更高分辨率特征

近期研究表明,对 patch 特征进行加权平均可通过平滑异常 patch 并增强 patch 级一致性,从而产生更强的局部表征(Wysoczańska et al., 2024)。另一方面,将更高分辨率图像输入主干网络可产生更精细、更详细的特征图。我们结合这两项观察的优势,为 Gram 教师计算高质量特征。具体而言,我们首先以两倍常规分辨率将图像输入 Gram 教师,随后采用双三次插值对所得特征图进行 2× 下采样,以获得与 student 输出尺寸匹配的理想平滑特征图。图 9a 可视化了在 256 与 512 分辨率图像下获得的 patch 特征 Gram 矩阵,以及从 512 分辨率特征经 2× 下采样(记为“downsamp.”)后所得结果。我们观察到,更高分辨率特征中优越的 patch 级一致性在下采样后得以保留,从而产生更平滑、更连贯的 patch 级表征。作为补充说明,得益于 Su et al. (2024) 引入的旋转位置编码(Rotary Positional Embeddings, RoPE),我们的模型可在无需任何适配的情况下无缝处理不同分辨率的图像。

我们对下采样后的特征计算 Gram 矩阵,并用其替换目标函数 L_Gram 中的 X_G,将由此得到的新精炼目标记为 L_HRef。该方法使 Gram 目标能够有效地将经平滑的高分辨率特征所改进的 patch 一致性蒸馏至学生模型。如图 8 与图 9b 所示,该蒸馏在密集任务上转化为更优的预测结果,在 L_Ref 带来的收益基础上进一步获得提升(ADE20k 上额外 +2 mIoU)。我们还在图 9b 中对 Gram 教师的选择进行了消融实验。有趣的是,在 100k 或 200k 迭代时选择 Gram 教师对结果影响并不显著,但若采用更晚期的 Gram 教师(1M 次迭代)则有害无益,因为此时期教师的 patch 级一致性较差。

最后,我们在图 10 中定性展示了 Gram 锚定对 patch 级一致性的影响,该图可视化了初始训练阶段与经高分辨率 Gram 锚定精炼后获得的 patch 特征 Gram 矩阵。我们观察到,高分辨率精炼过程显著提升了特征相关性。


在这里插入图片描述

在这里插入图片描述


5. DINOv3 后训练

本节介绍后训练阶段,包括:

  • 一个高分辨率适配阶段,使模型能够在不同输入分辨率下有效推理(第 5.1 节);
  • 模型蒸馏,生成质量高且体积更小的模型(第 5.2 节);
  • 文本对齐,为 DINOv3 增添零样本能力(第 5.3 节)。

5.1 分辨率缩放

我们在相对较小的 256 分辨率下训练模型,从而在速度与有效性之间取得良好平衡。对于 16 的 patch size,该设置产生的输入序列长度与 DINOv2(以 224 分辨率、14 patch size 训练)相同。然而,许多当代计算机视觉应用需要显著更高的分辨率(通常 512×512 像素或更高)以捕获精细的空间信息;实际推理时的图像分辨率亦因具体用例而异。为此,我们通过一个高分辨率适配步骤扩展训练流程(Touvron et al., 2019)。为确保在一系列分辨率上均保持高性能,我们采用混合分辨率,在每个 mini-batch 中采样不同尺寸的全局与局部裁剪对。具体而言,全局裁剪尺寸取自 {512,768},局部裁剪尺寸取自 {112,168,224,336},并额外训练 10k 次迭代。

与主训练阶段类似,此高分辨率适配阶段的关键组成部分是 Gram 锚定,使用 7B 教师作为 Gram 教师。我们发现该组件不可或缺:若缺失,模型在密集预测任务上的性能会显著下降。Gram 锚定促使模型在空间位置上保持一致且稳健的特征相关性,这对处理高分辨率输入带来的复杂度至关重要。

实验表明,这一短暂但针对性高的高分辨率步骤大幅提升了模型的整体质量,并使其能够泛化到广泛的输入尺寸,图 4 给出了可视化结果。在图 11 中,我们对比适配前后的 7B 模型:分辨率缩放使 ImageNet 分类性能略有提升(a),且随分辨率变化相对稳定;然而,在 ObjectNet OOD 迁移(b)中,低分辨率性能略有下降,而高分辨率性能提升,这一下降主要通过高分辨率下局部特征质量的改善得到补偿,具体体现在 ADE20k 分割(c)与 DAVIS 跟踪(d)上的正向趋势。适配后的局部特征随图像尺寸增大而改善,充分利用更大分辨率下更丰富的空间信息,从而有效支持高分辨率推理。值得注意的是,适配后的模型可支持远超训练最大分辨率 768 的输入——我们可视化观察到在 4k 以上分辨率下特征图依然稳定(参见图 4)。


在这里插入图片描述


5.2 模型蒸馏

面向多种用例的模型家族 我们将 ViT-7B 模型知识蒸馏至更小的 Vision Transformer 变体(ViT-S、ViT-B 与 ViT-L),这些变体因其更易管理与更高效率而备受社区青睐。我们的蒸馏方法采用与第一阶段训练相同的目标函数,确保学习信号的一致性;然而,我们不再依赖模型权重的指数移动平均(EMA),而是直接将 7B 模型作为固定教师来指导更小的学生模型。在此设定下,教师模型保持冻结。我们未观察到 patch 级一致性问题,因此未应用 Gram 锚定技术。该策略使蒸馏模型在继承大教师丰富表征能力的同时,更便于部署与实验。

我们的 ViT-7B 模型被蒸馏成一系列覆盖不同计算预算的 ViT 模型,以便与同期模型进行恰当比较,包括标准 ViT-S(21 M 参数)、B(86 M)、L(0.3 B),以及定制的 ViT-S+(29 M)与 ViT-H+(0.8 B),用于弥合与自蒸馏 7B 教师之间的性能差距。事实上,我们在 DINOv2 中观察到,更小的学生模型在蒸馏后可达到与教师相当的性能。因此,如表 14 所示,这些蒸馏模型仅使用一小部分推理计算量即可交付前沿级性能。我们先将各模型训练 1 M 次迭代,再按余弦 schedule 进行 250 k 次学习率冷却,随后执行第 5.1 节所述的高分辨率阶段(不采用 Gram 锚定)。

高效多学生蒸馏 由于大教师的推理成本可比学生高出一个数量级(见图 16a),我们设计了一种并行蒸馏流水线,可同时训练多个学生,并在所有参与训练的节点间共享教师推理(见图 12)。令 C_T 与 C_S 分别表示在单样本上运行教师推理与学生训练的单 GPU 成本。在单教师/单学生蒸馏、批大小为 B、N 块 GPU 各处理 B/N 切片数据的设定下,每块 GPU 的教师推理成本为 B/N×C_T,学生训练成本为 B/N×C_S。

在多学生蒸馏中,我们按如下方式执行:为每个学生 S_i 分配 N_S_i 块 GPU 用于训练,并将全部 N_T=∑N_S_i 块 GPU 组成全局推理组。每次迭代,首先由全局组执行教师推理,每 GPU 计算成本为 B/N_T×C_T;随后通过 all-gather 集合操作将输入数据与推理结果共享给所有计算节点;最后,各学生组独立执行学生训练,成本为 B/N_S_i×C_S_i。

上述计算表明,向蒸馏流水线新增一名学生将 (1) 降低每 GPU 的每次迭代计算量,从而整体提升蒸馏速度;(2) 仅新增该学生的训练成本即可增加总计算量,因为教师推理总成本现已固定。实现上仅需仔细设置 GPU 进程组、调整数据加载器与教师推理,确保借助 NCCL 集合操作在各组间同步输入与输出。由于各组在每次迭代均同步,为最大化速度,我们为每个学生动态分配 GPU 数量,使其单次迭代时长大致相同。借助该流程,我们可无缝训练多名学生,并从旗舰 7B 模型一次性产出完整蒸馏模型家族。


在这里插入图片描述

图 12:多学生模型蒸馏流程。
在此流程图中,我们并行蒸馏 3 个学生模型:首先,在所有 T 个节点间共享教师模型的推理结果以节省计算资源,并在所有 GPU 上汇总输入数据与推理结果;随后,较小的分组执行学生模型训练。我们会调整这些分组的规模,确保所有学生模型(Si)的训练步骤耗时一致,从而最大限度减少在同步屏障(synchronization barrier)处的等待空闲时间。


5.3 将 DINOv3 与文本对齐

开放词汇的图像-文本对齐因其在实现灵活且可扩展的多模态理解方面的潜力,受到了研究社区的广泛关注与热情。大量工作致力于提升 CLIP(Radford et al., 2021)的质量,该方法最初仅学习图像与文本表征之间的全局对齐。尽管 CLIP 展现出令人印象深刻的零样本能力,但其对全局特征的关注限制了其捕获细粒度、局部对应关系的能力。近期研究(Zhai et al., 2022b)表明,借助预训练的自监督视觉主干可有效实现图像-文本对齐,这使得在多模态场景中利用这些强大模型成为可能,在超越全局语义的同时实现更丰富且精确的文本-图像关联,并由于视觉编码已预先学习而降低计算成本。

我们通过采用 Jose et al. (2025) 提出的训练策略,将文本编码器与我们的 DINOv3 模型对齐。该方法遵循 LiT 训练范式(Zhai et al., 2022b),在保持视觉编码器冻结的情况下,从零开始训练文本表征,通过对比学习目标将图像与其字幕匹配。为了在视觉侧提供一定的灵活性,我们在冻结的视觉主干之上引入两个 transformer 层。该方法的一项关键改进在于,将平均池化后的 patch 嵌入与输出的 CLS token 拼接后再与文本嵌入匹配,这使得全局与局部视觉特征均可与文本对齐,从而在无需额外启发式或技巧的情况下提升密集预测任务的性能。此外,我们采用与 Jose et al. (2025) 建立的相同数据筛选协议,以确保一致性与可比性。


6. 实验结果

本节在多种计算机视觉任务上评估旗舰模型 DINOv3-7B。除特别说明外,DINOv3 全程冻结,仅使用其表征。实验表明,无需微调即可获得强劲性能。本节结构如下:首先通过轻量化评估协议探查 DINOv3 的密集(6.1)与全局(6.2)图像表征质量,并与现有最强视觉编码器对比,验证其兼具卓越的密集特征与稳健的全局表征;随后以 DINOv3 为基础构建更复杂的视觉系统(6.3),在目标检测、语义分割、3D 视角估计、单目相对深度估计等任务上,仅需极少额外工作即可达到或超越当前最优水平。


6.1 DINOv3 提供卓越的密集特征

首先通过多样化轻量化评估考察 DINOv3 密集表征的原始质量。所有实验均使用最后一层冻结的 patch 特征,评估方式包括:(1) 定性可视化(6.1.1),(2) 密集线性探测(6.1.2:分割、深度估计),(3) 非参数方法(6.1.3:3D 对应估计,6.1.4:目标发现,6.1.5:跟踪),(4) 轻量化注意力探测(6.1.6:视频分类)。

基线 与当前公开的最强图像编码器对比,包括弱监督模型 Perception Encoder (PE) Core (Bolya et al., 2025)、SigLIP 2 (Tschannen et al., 2025)(采用 CLIP 式图文对比学习),以及最强自监督方法:DINOv3 前身 DINOv2 (Oquab et al., 2024) with registers (Darcet et al., 2024)、最新扩展工作 Web-DINO (Fan et al., 2025)、最佳开放数据 SSL 模型 Franca (Venkataramanan et al., 2025)。此外,比较聚合模型 AM-RADIOv2.5 (Heinrich et al., 2025)(蒸馏自 DINOv2、CLIP、DFN、SAM)及 PEspatial(将 SAM 2 蒸馏至 PEcore)。各基线均报告可用最强模型性能,并在表中注明架构。


6.1.1 定性分析

通过主成分分析(PCA)将密集特征降维至 3 维并映射为 RGB,考虑所有符号与颜色映射组合后选取视觉效果最佳者(图 13)。与其他主干相比,DINOv3 特征更锐利、噪声更少,语义一致性更佳。


6.1.2 密集线性探测

在冻结 patch 输出上训练线性变换,任务包括语义分割与单目深度估计。语义分割在 ADE20k (Zhou et al., 2017)、Cityscapes (Cordts et al., 2016)、PASCAL VOC 2012 (Everingham et al., 2012) 上评估,指标为 mIoU;深度估计在 NYU v2 (Silberman et al., 2012) 与 KITTI (Geiger et al., 2013) 上评估,指标为 RMSE。

结果(表 3) 分割结果凸显密集特征优势:在通用 ADE20k 上,DINOv3 较自监督基线提升超 6 mIoU,较弱监督基线提升超 13 mIoU;较 PEspatial 提升超 6 mIoU,较 AM-RADIOv2.5 提升近 3 mIoU。Cityscapes 上,DINOv3 取得 81.1 最佳 mIoU,领先 AM-RADIOv2.5 达 2.5 mIoU,领先其余基线至少 5.5 mIoU。

单目深度估计中,DINOv3 仍以显著幅度领先所有模型;弱监督 PEcore 与 SigLIP 2 差距明显,源自 SAM 的模型在 NYU 上表现虽强,但在 KITTI 上仍低于 DINOv2,而 DINOv3 较 DINOv2 再降低 0.278 RMSE。

上述结果与图 13 的视觉观察一致:仅靠线性预测器,DINOv3 即可稳健预测物体类别与掩码,以及场景相对深度等物理量,表明其特征不仅视觉锐利、定位准确,且对底层观测的重要属性具有线性可分性。ADE20k 线性探测绝对性能达 55.9 mIoU,已接近该数据集 SOTA(63.0 mIoU)。


在这里插入图片描述


在这里插入图片描述


6.1.3 3D 对应估计

理解 3D 世界一直是计算机视觉的重要目标。图像基础模型通过提供 3D 感知特征推动了相关研究。按 Probe3D (Banani et al., 2024) 协议,评估 DINOv3 的多视角一致性——即同一物体关键点在不同视角的 patch 特征是否相似——区分几何对应(同实例关键点匹配)与语义对应(同类不同实例关键点匹配)。几何对应在 Navi 数据集 (Jampani et al., 2023) 上评估,语义对应在 SPair 数据集 (Min et al., 2019) 上评估,均以对应召回率为指标(详见附录 D.3)。

结果(表 4) 几何对应任务中,DINOv3 领先所有模型,较次优模型 DINOv2 提升 4.3% 召回率;其他 SSL 扩展工作(Franca、WebSSL)仍落后于 DINOv2;弱监督模型(PEcore、SigLIP 2)表现不佳,表明缺乏 3D 感知。含 SAM 蒸馏的 AM-RADIO 接近 DINOv2,但 PEspatial 仍低 11.6% 召回,甚至低于 Franca 0.8% 召回,显示自监督学习对此任务至关重要。语义对应任务结论相同:DINOv3 最优,较其前身提升 2.6% 召回,较 AM-RADIO 提升 1.9% 召回。关键点匹配的卓越表现预示 DINOv3 在更重 3D 的下游应用中的广阔前景。


在这里插入图片描述


6.1.4 无监督目标发现

强大的自监督特征能够在无需任何标注的情况下发现图像中的目标实例(Vo et al., 2021; Siméoni et al., 2021; Seitzer et al., 2023; Wang et al., 2023c; Siméoni et al., 2025)。我们通过无监督目标发现任务检验不同视觉编码器的这一能力,该任务要求对图像中的目标进行类别无关的分割(Russell et al., 2006; Tuytelaars et al., 2010; Cho et al., 2015; Vo et al., 2019)。具体而言,我们采用非参数图算法 TokenCut(Wang et al., 2023c),该算法在多种主干网络上均表现强劲。实验在 VOC 2007、VOC 2012(Everingham et al., 2015)和 COCO-20k(Lin et al., 2014; Vo et al., 2020)三个常用数据集上进行,遵循 Siméoni et al. (2021) 的评估协议,报告 CorLoc 指标。为公平比较特征分布不同的主干,我们对 TokenCut 的核心超参数——构建 patch 图时使用的余弦相似度阈值——进行网格搜索。原最佳结果依赖 DINO(Caron et al., 2021)最后一层 attention key,但该手工选择无法泛化至其他主干;为简化,统一使用各模型的输出特征。

结果(图 14) 原始 DINO 在该任务上设立了极高基准。有趣的是,DINOv2 虽在像素级密集任务表现强劲,却在目标发现上失效,部分归因于其密集特征中的伪影(见图 13)。DINOv3 凭借清晰精确的特征图,超越所有前代与基线:VOC 2007 上 CorLoc 提升 5.9,领先自监督、弱监督及聚合模型。该评估验证 DINOv3 密集特征兼具语义强度与精确定位,为标注稀缺或类别开放场景下的类别无关目标检测奠定基础。



6.1.5 视频分割跟踪

除静态图像外,表征的时间一致性——特征随时间稳定演化——同样关键。为此,我们在视频分割跟踪任务上评估 DINOv3:给定视频首帧真实实例分割掩码,将其传播至后续帧。数据集包括 DAVIS 2017(Pont-Tuset et al., 2017)、YouTube-VOS(Xu et al., 2018)与 MOSE(Ding et al., 2023),指标采用标准 J&F-mean,综合区域相似度 J 与轮廓准确度 F(Perazzi et al., 2016)。沿用 Jabri et al. (2020) 的非参数标签传播算法,度量跨帧 patch 特征相似度。实验在三种输入分辨率下进行,短边分别为 420/480(S)、840/960(M)、1260/1440(L)像素,对应 patch size 14/16(保持 token 数量一致),J&F 均在视频原生分辨率计算,详见附录 D.5。

结果(表 5) 与此前一致,弱监督主干表现不佳;PEspatial 虽蒸馏自视频模型 SAM v2,在小分辨率上略超 DINOv2,但在大分辨率下落后。全分辨率下,DINOv3 全面领先:DAVIS-L 达 83.3 J&F,领先 DINOv2 达 6.7。性能随分辨率提升呈健康增长,表明模型可利用更高像素输出精确高分辨率特征图(见图 3、4);而 SigLIP2 与 PEcore 在高分辨率下性能几乎持平,PEspatial 甚至下降。值得注意的是,我们的图像模型无需任何视频调优即可稳定跟踪目标(见图 15),为构建强大视频模型提供理想特征基础。


在这里插入图片描述

在这里插入图片描述


6.1.6 视频分类

前述结果已表明 DINOv3 表征具备低层次时间一致性,可在时间维度精准跟踪目标。更进一步,本节评估其密集特征在高层次视频分类中的适用性。参照 V-JEPA2(Assran et al., 2025)的设置,我们在每帧独立提取的 patch 特征之上训练一个浅层 4 层 Transformer attentive probe,从而同时推理时空维度。评估时,每段视频取单一 clip 或采用测试时增强(TTA),对每视频 3 组空间裁剪与 2 组时间裁剪的预测取平均,详见附录 D.6。

实验在 UCF101(Soomro et al., 2012)、Something-Something V2(Goyal et al., 2017)与 Kinetics-400(Kay et al., 2017)三个数据集上进行,报告 top-1 准确率,并以当前最优自监督视频模型 V-JEPA v2 为额外基线。

结果(表 6) 与上一实验结论一致,DINOv3 可成功提取强视频特征。由于评估涉及多层自注意力训练,模型间差异相对收敛,但 DINOv3 仍与 PEcore、SigLIP2 处于同一水平,并显著优于 DINOv2、AM-RADIO 等模型。UCF101 与 K400 侧重表观,强类别级物体理解即可带来主要性能;SSv2 则更需要运动理解,专用视频模型 V-JEPA v2 在此表现突出。值得注意的是,DINOv3 与弱监督模型在 SSv2 上的差距更大,再次验证其对视频任务的适用性。


在这里插入图片描述


6.2 DINOv3 具有稳健且通用的全局图像描述符

本节评估 DINOv3 捕获全局图像统计量的能力,为此考察使用线性探针的经典分类基准(第 6.2.1 节)和实例检索基准(第 6.2.2 节)。对比对象仍为公开可用的最强图像编码器,并新增两个弱监督模型:AIM v2(Fini et al., 2024),采用联合自回归像素与文本预测训练;以及超大规模 EVA-CLIP-18B(Sun et al., 2024)。


6.2.1 线性探针图像分类

我们在 DINOv3 输出的 CLS token 上训练线性分类器,以评估其在分类基准上的表现。实验采用 ImageNet-1k(Deng et al., 2009)及其变体衡量分布外鲁棒性,并覆盖多领域数据集以检验 DINOv3 区分细粒度类别的能力,详见附录 D.7。

ImageNet 领域泛化(表 7)

在 ImageNet-train 训练、ImageNet-val 选参后,将最优分类器迁移至以下测试集:ImageNet-V2(Recht et al., 2019)与 ReaL(Beyer et al., 2020)为 ImageNet 的替代图像与标签,用于检测对验证集的过拟合;Rendition(Hendrycks et al., 2021a)与 Sketch(Wang et al., 2019)提供风格化/人造版本类别;Adversarial(Hendrycks et al., 2021b)与 ObjectNet(Barbu et al., 2019)含刻意挑选的困难样本;Corruptions(Hendrycks & Dietterich, 2019)度量对常见图像退化的鲁棒性。参考表中同时列出 Dehghani et al. (2023) 在超大规模 JFT(3B–4B 图像)监督训练的 ViT 线性探针结果,其评估协议略有差异,不可直接比较。

DINOv3 显著超越所有先前自监督主干:在 ImageNet-R 提升 +10%,Sketch +6%,ObjectNet +13%,均优于此前最强 SSL 模型 DINOv2。最强弱监督模型 SigLIP2 与 PE 在 ImageNet-A 与 ObjectNet 等困难 OOD 任务上已优于最强监督模型(ViT-22B)。DINOv3 在 ImageNet-R 与 Sketch 取得可比成绩,在 ImageNet-A 与 ObjectNet 紧追 PE,并超过 SigLIP v2;在“更干净”的 ImageNet-V2 与 ReaL 上,与 SigLIP v2、PE 性能几乎持平;在 ImageNet-C 上取得最佳退化鲁棒性。总体而言,这是 SSL 模型首次在图像分类领域与弱监督及监督模型达到可比水平——而该领域历来是(弱)监督训练的强项。值得注意的是,ViT-22B、SigLIP2、PE 等均依赖大规模人工标注数据,而 DINOv3 纯从图像学习,为后续进一步扩展奠定基础。


在这里插入图片描述


细粒度分类(表 8)

我们还在多个细粒度分类数据集上训练线性探针,包括场景识别数据集 Places205(Zhou et al., 2014)、植物与动物细分类数据集 iNaturalist 2018 与 2021(Van Horn et al., 2018; 2021),以及覆盖场景、物体与纹理的 12 个小型数据集的平均结果(Fine-S,同 Oquab et al., 2024),各数据集单独结果见表 22。

结果显示,DINOv3 再次超越所有先前 SSL 方法,并与弱监督方法成绩相当,展现出跨领域细粒度任务的鲁棒性与泛化能力。特别地,DINOv3 在极具挑战的 iNaturalist-21 上取得 89.8% 准确率,超过最佳弱监督模型 PEcore(87.0%)。


在这里插入图片描述


6.2.2 实例识别

为评估模型的实例级识别能力,我们采用非参数检索方法:以输出 CLS token 的余弦相似度对数据库图像进行排序,并匹配给定查询图像。实验数据集包括:地标识别 Oxford 与 Paris 数据集(Radenović et al., 2018)、展示大都会艺术博物馆艺术藏品的 Met 数据集(Ypsilantis et al., 2021),以及将现代阿姆斯特丹街景与历史档案图像配对的 AmsterTime(Yildiz et al., 2022)。检索性能以 Oxford、Paris 与 AmsterTime 的 mean average precision 及 Met 的 global average precision 量化,详见附录 D.8。

结果(表 9 与 23)
在所有基准上,DINOv3 以显著优势取得最佳性能,例如在 Met 数据集较次优模型 DINOv2 提升 +10.8 分,在 AmsterTime 提升 +7.6 分。在此任务中,除从 DINOv2 特征蒸馏得到的 AM-RADIO 外,其余弱监督模型均大幅落后于 DINOv3。该结果凸显 DINOv3 在实例级检索任务中的稳健性与通用性,涵盖传统地标数据集及更具挑战的艺术与历史图像检索领域。


6.3 DINOv3 是复杂计算机视觉系统的基础

前两节已表明 DINOv3 在密集与全局任务中的高质量特征。然而,这些结果源于“模型探针”实验协议,使用轻量级线性适配器甚至非参数算法评估特征质量。尽管此类简单评估可消除复杂实验协议中的混杂因素,但不足以全面衡量 DINOv3 作为大型计算机视觉系统基础组件的潜力。因此,本节摒弃轻量级协议,转而训练更复杂的下游解码器,并与更强的任务特定基线对比。具体而言,我们以 DINOv3 为基础,用于(1)Plain-DETR 目标检测(第 6.3.1 节)、(2)Mask2Former 语义分割(第 6.3.2 节)、(3)Depth Anything 单目深度估计(第 6.3.3 节),以及(4)Visual Geometry Grounded Transformer 三维理解(第 6.3.4 节)。这些任务仅作为探索 DINOv3 潜能的示例,但我们发现,基于 DINOv3 可轻松获得具有竞争力甚至最先进的结果。


6.3.1 目标检测

作为第一项任务,我们解决经典的计算机视觉问题——目标检测。给定一幅图像,旨在为所有预定义类别的实例提供边界框。该任务需精确定位与良好识别,即边界框须贴合物体轮廓且对应正确类别。尽管 COCO(Lin et al., 2014)等标准基准性能已趋饱和,我们仍提出以冻结主干的方式,仅训练其顶部的小型解码器。

数据集与指标

我们使用 COCO 数据集(Lin et al., 2014)评估 DINOv3 的目标检测能力,报告 COCO-VAL2017 结果,并在 COCO-O 评估集(Mao et al., 2023)上测试分布外性能。COCO-O 保持相同类别,但在六种分布偏移设置下提供输入图像。对两数据集均报告 IoU 阈值 [0.5 : 0.05 : 0.95] 上的 mean Average Precision (mAP)。对 COCO-O 额外报告 effective robustness (ER)。鉴于 COCO 仅含 118k 训练图像,我们遵循惯例,利用更大的 Objects365 数据集(Shao et al., 2019)预训练解码器。

实现

我们基于 Plain-DETR(Lin et al., 2023b)进行构建,但作出以下修改:不将 transformer encoder 融合进主干网络,而是保持其为独立模块,与原始 DETR(Carion et al., 2020)类似,这使得我们能在训练与推理期间将 DINOv3 主干完全冻结。据我们所知,这是首个采用冻结主干且具备竞争力的检测模型。我们在 Objects365 上以 1536 分辨率训练 Plain-DETR 检测器 22 epoch,再以 2048 分辨率训练 1 epoch,随后在 COCO 上以 2048 分辨率训练 12 epoch。推理阶段使用 2048 分辨率;可选地,我们通过多尺度(1536–2880)测试时增强(TTA)进一步提升性能。完整实验细节见 App. D.9。

结果(表 10)

我们将系统与四个模型对比:带 Cascade 检测器的 EVA-02(Fang et al., 2024b)、带 Co-DETR 的 EVA-02(Zong et al., 2023)、InternImage-G 配 DINO(Wang et al., 2023b),以及 PEspatial 配 DETA(Bolya et al., 2025)。实验表明,我们仅含 100 M 参数的轻量检测器,在冻结的 DINOv3 主干上训练后达到最先进性能。在 COCO-O 上优势尤为明显,表明检测模型可有效利用 DINOv3 的鲁棒性。值得注意的是,我们的模型以更少的可训练参数超越所有先前模型,最小对比点仍使用超过 300 M 可训练参数。我们认为,无需对主干进行专门化即可取得如此强劲性能,为多种实际应用提供了可能:单次主干前向即可提供支持多任务的特征,从而降低计算需求。


在这里插入图片描述


6.3.2 语义分割

继上一实验之后,我们进一步评估语义分割这一长期存在的计算机视觉任务。该任务同样需要强且空间精确定位良好的特征,并要求进行逐像素的密集预测。然而,与目标检测不同,模型无需区分同一物体的不同实例。与检测类似,我们在冻结的 DINOv3 模型之上训练解码器。

数据集与指标

我们聚焦于 ADE20k 数据集(Zhou et al., 2017),其包含 150 个语义类别,训练图像 20 k 张,验证图像 2 k 张。性能指标采用 mean Intersection over Union (mIoU)。为训练分割模型,我们额外使用 COCO-Stuff(Caesar et al., 2018)与 Hypersim(Roberts et al., 2021)数据集,分别含 164 k 张图像(171 类别)与 77 k 张图像(40 类别)。

实现

为将 DINOv3 特征映射至语义类别,我们组合 ViT-Adapter(Chen et al., 2022)与 Mask2Former(Cheng et al., 2022),类似先前工作(Wang et al., 2022b; 2023b;a)。然而,在我们的设置中,DINOv3 主干全程冻结。为避免改动主干特征,我们进一步移除原始 ViT-Adapter 中的 injector 组件。相较于基线,我们还将嵌入维度由 1024 提升至 2048,以处理 DINOv3 主干输出的 4096 维特征。训练流程为:先在 COCO-Stuff 上预训练 80 k 次迭代,继而在 Hypersim(Roberts et al., 2021)上训练 10 k 次迭代,最后在 ADE20k 训练集上训练 20 k 次迭代,并在验证集上报告结果。所有训练输入分辨率均为 896。推理阶段考虑两种设置:单尺度(训练分辨率前向)与多尺度(对 0.9–1.1 倍训练分辨率的图像预测取平均)。完整实验细节见 App. D.10。

结果(表 11)

我们将模型性能与若干最先进基线对比,包括 BEIT-3(Wang et al., 2022b)、InternImage-H(Wang et al., 2023b)与 ONE-PEACE(Wang et al., 2023a),并在表 24 中报告额外数据集结果。基于冻结 DINOv3 主干的分割模型达到最先进性能,与 ONE-PEACE 持平(63.0 mIoU),并在 COCO-Stuff(Caesar et al., 2018)与 VOC 2012(Everingham et al., 2012)数据集上超越所有先前模型。鉴于语义分割需精确逐像素预测,视觉 transformer 主干存在固有难题:16 像素宽的输入 patch 使预测粒度相对粗糙——促使采用 ViT-Adapter 等方案。另一方面,我们已证明即使在高达 4096 的分辨率下仍可获取高质量特征图(见图 3 与图 4),对应 512 token 宽的密集特征图。我们期望未来工作能利用这些高分辨率特征,在无需依赖 ViT-Adapter 与 Mask2Former 等重型解码器的情况下达到最先进性能。


在这里插入图片描述


6.3.3 单目深度估计

我们现在考虑构建一个用于单目深度估计的系统。为此,我们遵循近期最先进方法 Depth Anything V2 (DAv2) (Yang et al., 2024b) 的设置。DAv2 的关键创新在于使用大量带有真实深度标注的合成生成图像;其核心依赖 DINOv2 作为特征提取器,以弥合仿真到现实的差距,而 SAM 等其他视觉主干并未展现该能力 (Yang et al., 2024b)。因此,我们在 DAv2 流程中将 DINOv2 替换为 DINOv3,检验是否能获得类似结果。

实现

与 DAv2 相同,我们采用 Dense Prediction Transformer (DPT) (Ranftl et al., 2021) 预测像素级深度场,输入为 DINOv3 四个等间距层的特征。我们在 DAv2 的合成数据集上使用其损失函数训练模型,并将训练分辨率提升至 1024×768,以利用 DINOv3 的高分辨率能力。与 DAv2 不同的是,我们保持主干冻结而非微调,测试 DINOv3 的即插即用能力。我们还发现放大 DPT 头部以充分利用 DINOv3 7B 更大特征是有益的。细节见 App. D.11。

数据集与指标

我们在 5 个真实世界数据集(NYUv2 (Silberman et al., 2012)、KITTI (Geiger et al., 2013)、ETH3D (Schöps et al., 2017)、ScanNet (Ke et al., 2025) 和 DIODE (Vasiljevic et al., 2019))上进行零样本尺度不变深度评估,设置同 Ranftl et al. (2020); Ke et al. (2025); Yang et al. (2024b)。报告标准指标:绝对相对误差 ARel(越低越好)和 δ1(越高越好)。指标定义参见 Yang et al. (2024a)。

结果(表 12)

我们与相对深度估计的最先进方法比较:MiDaS (Ranftl et al., 2020)、LeReS (Yin et al., 2021)、Omnidata (Eftekhar et al., 2021)、DPT (Ranftl et al., 2021)、集成版 Marigold (Ke et al., 2025) 以及 DAv2。我们的深度估计模型在所有数据集上达到新的最先进水平,仅在 DIODE 的 ARel 上略逊于 DPT。值得注意的是,这一结果在主干冻结的条件下实现,而所有其他基线均需针对深度估计微调主干。此外,这验证了 DINOv3 继承了 DINOv2 强大的仿真到现实能力,该 desirable 属性为下游任务使用合成训练数据提供了可能。


在这里插入图片描述


6.3.4 基于 DINOv3 的视觉几何基础三维理解

最后,我们利用近期提出的视觉几何基础 Transformer(Visual Geometry Grounded Transformer,VGGT)(Wang et al., 2025)进行三维理解。该方法在大规模三维标注数据上训练,可在单次前向传播中预测场景的全部重要三维属性,包括相机内参/外参、点图或深度图。凭借简洁统一的流程,VGGT 在多项三维任务上达到最先进性能,且比专用方法更高效,被视为三维理解领域的重大进展。

实现

VGGT 首先利用 DINOv2 预训练主干提取场景多视角特征,随后通过 Transformer 融合。这里我们仅以 DINOv3 替换 DINOv2,并采用 ViT-L 变体(见第 7 节)以匹配原文的 DINOv2 ViT-L/14。其余训练流程与 VGGT 保持一致,包括对图像主干进行微调。为适配 DINOv3 的 16 像素 patch,我们将输入分辨率从 518×518 调整至 592×592,以保证结果可比。少量超参数改动详见 App. D.12。

数据集与指标

参照 Wang et al. (2025),我们在 Re10k(Zhou et al., 2018)与 CO3Dv2(Reizenstein et al., 2021)数据集上评估相机位姿估计,在 DTU(Jensen et al., 2014)上进行密集多视角重建评估,并在 ScanNet-1500(Dai et al., 2017)上执行两视角匹配。相机位姿与两视角匹配采用标准 AUC 指标;多视角重建报告“Accuracy”(预测到真值的最小 L2 距离)、“Completeness”(真值到预测的最小 L2 距离)及其均值“Overall”。方法与评估细节参见 Wang et al. (2025)。

结果(表 13)

实验表明,采用 DINOv3 的 VGGT 在全部三项任务上均优于原 VGGT 保持的最先进水平,且仅对 DINOv3 进行了最小化调参。这些任务覆盖不同层级的视觉理解——高层场景内容抽象(相机位姿)、密集几何预测(多视角深度)以及细粒度像素级对应(视角匹配)。结合此前在对应估计(6.1.3)与深度估计(6.3.3)的结果,我们进一步实证确认了 DINOv3 作为三维任务基础的强大适用性。我们预期,若采用更大的 DINOv3 7B 模型,性能还将进一步提升。


在这里插入图片描述


7. 对完整 DINOv3 模型家族的评估

本节对从 7B 参数模型蒸馏得到的整个模型家族进行定量评估(见 5.2 节)。该家族包含基于 Vision Transformer(ViT)与 ConvNeXt(CNX)架构的变体。图 16a 给出所有模型的详细参数量与推理 FLOPs,覆盖广泛的计算预算,以满足不同用户与部署场景需求。我们对全部 ViT(7.1 节)及 ConvNeXt 变体进行彻底评估,衡量其在各任务上的表现。

图 2 概览对比 DINOv3 家族与其他模型集合。在密集预测任务上,DINOv3 家族显著优于所有其他模型,包括从监督主干蒸馏的专用模型 AM-RADIO 与 PEspatial。同时,在分类任务上我们的模型亦取得相近结果,使其在不同计算预算下均为最优选择。


7.1 适用于每种用例的 Vision Transformer

我们的 ViT 家族涵盖从紧凑型 ViT-S 到 8.4 亿参数 ViT-H+ 的架构;前者可在笔记本等资源受限设备高效运行,后者为苛刻应用提供最先进性能。我们将 ViT 模型与对应规模的顶级开源图像编码器对比,即 DINOv2(Oquab et al., 2024)、SigLIP2(Tschannen et al., 2025)及 Perception Encoder(Bolya et al., 2025)。为保证公平,所有模型输入序列长度一致:patch size 为 16 时输入 512×512 图像,patch size 为 14 时输入 448×448 图像。

实证研究明确显示,DINOv3 模型在密集预测任务上持续优于对照模型。尤为突出的是,在 ADE20k 基准上,DINOv3 ViT-L 模型相较最佳竞品 DINOv2 提升超 6 个 mIoU 点;ViT-B 变体亦领先次优竞品约 3 个 mIoU 点。这些显著提升彰显了 DINOv3 局部特征在捕捉细粒度空间细节方面的有效性。此外,深度估计任务评估亦揭示出相较竞争方法的一致性能增益。

这凸显了 DINOv3 家族在不同密集视觉问题上的通用性。重要的是,我们的模型在 ObjectNet 与 ImageNet-1k 等全局识别基准上亦取得竞争性结果,表明密集任务性能的提升并未以牺牲全局任务精度为代价。这一平衡证实 DINOv3 模型提供了一种稳健且全面的解决方案,在密集与全局视觉任务上均能卓越表现且互不妥协。

另一方面,我们还希望验证所蒸馏的最大模型是否完整捕捉了教师模型的全部信息。为此,我们将最大的 ViT-H+ 与 7B 教师模型进行对比。如图 16b 所示,最大的学生模型达到了与 8 倍·体量的 ViT-7B 模型相当的性能。

该结果不仅验证了我们蒸馏流程的有效性,亦表明在高质量教师模型的引导下,较小模型能够学会达到可媲美的性能水平。这一发现进一步坚定了我们的信念:训练极大规模模型将惠及更广泛的研究与应用社区;大型模型的能力可被成功蒸馏至更高效、更小巧的模型中,且几乎或完全不会带来质量损失。


![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/8af1701192444e45ab3bf13662faf8d9.png)

7.2 面向资源受限环境的高效 ConvNeXts

本节评估由 7B 教师模型蒸馏得到的 ConvNeXt(CNX)模型的质量。ConvNeXt 模型在 FLOPs 方面极为高效,且非常适于部署在以卷积计算为优化目标的设备上。此外,Transformer 模型往往难以量化(Bondarenko et al., 2021),而卷积网络的量化已被广泛研究。我们蒸馏了 T、S、B、L 四种规模的 CNX 架构(见图 16a),并与原始 ConvNeXt 模型(Liu et al., 2022)进行对比。这些基线模型利用 ImageNet-22k 标签以监督方式训练,在 ImageNet-1k 上取得高性能,因而构成强劲对手。本实验给出全局任务在 256 与 512 输入分辨率、ADE20k 在 512 分辨率以及 NYU 在 640 分辨率下的结果。


在这里插入图片描述


在这里插入图片描述


结果(表15)表明:
在分布内图像分类任务上,我们的模型在256分辨率下略逊于监督模型(例如CNX-T在IN-ReAL上−0.7)。然而,在512分辨率下趋势逆转,监督ConvNeXt显著退化,而我们的模型随输入分辨率提升而扩展。对于分布外分类(IN-R、ObjectNet),两个模型族在所有规模上均存在显著差距——这证明了DINOv3-CNX模型的鲁棒性。
此外,DINOv3模型在稠密任务上带来极大提升:对CNX-T,我们的模型mIoU提高+17.9(42.7 vs. 24.8);对CNX-L,提高+14.5(47.8 vs. 33.3)。高性能与计算效率的结合使蒸馏ConvNeXt模型在资源受限的真实应用场景中尤为前景广阔。除此之外,将ViT-7B模型蒸馏为更小的ConvNeXt模型尤为振奋人心,因为它联通了两种根本不同的架构:ViT-7B基于带CLS token的Transformer模块,而ConvNeXt依赖无CLS token的卷积操作,使得知识迁移非平凡。这一成就凸显了我们蒸馏过程的通用性与有效性。


在这里插入图片描述


7.3 基于DINOv3的dino.txt零样本推理

如第5.3节所述,我们训练一个文本编码器,将蒸馏后的DINOv3 ViT-L模型的CLS token与输出patch同时对齐到文本,遵循dino.txt(Jose et al., 2025)的方法。我们在标准基准上评估全局与patch级对齐质量。依照CLIP协议(Radford et al., 2021),我们在ImageNet-1k、ImageNet-Adversarial、ImageNet-Rendition和ObjectNet基准上报告零样本分类准确率。对于图文检索,我们在COCO2017数据集(Tsung-Yi et al., 2017)上评估,并给出图像到文本(I→T)与文本到图像(T→I)任务的Recall@1。为探查patch级对齐质量,我们在开放词汇分割任务的常用基准ADE20k和Cityscapes上评估模型,并报告mIoU指标。

结果(表16)

我们将文本对齐的DINOv3 ViT-L与同等规模竞品对比。相较于将DINOv2对齐文本的Jose et al. (2025),DINOv3在所有基准上均显著提升性能。在全局对齐任务上,我们优于原始CLIP(Radford et al., 2021)及EVA-02-CLIP(Sun et al., 2023)等强基线,但略逊于SigLIP2(Tschannen et al., 2025)与PerceptionEncoder(Bolya et al., 2025)。在稠密对齐任务上,凭借DINOv3的干净特征图,我们的文本对齐模型在ADE20K与Cityscapes两大挑战性基准上表现优异。


在这里插入图片描述


8. DINOv3 在地理空间数据上的应用

我们的自监督学习方案具有通用性,可适用于任意图像域。在本节中,我们通过为卫星图像构建DINOv3 7B模型来展示这一普适性;卫星图像在目标纹理、传感器噪声与视场角等方面与DINOv3最初开发的网络图像差异显著。


8.1 预训练数据与基准

我们的卫星DINOv3 7B模型在SAT-493M上预训练,该数据集包含4.93亿张512×512的图像,随机采样自Maxar 0.6米分辨率的RGB正射影像。除对RGB均值与标准差归一化按卫星图像调整以及训练长度外,其余超参数与网络DINOv3 7B模型完全一致。与网络模型相同,卫星模型的训练流程包括:先以全局裁剪(256×256)进行10万次初始预训练,再以Gram正则化训练1万次,最后以512分辨率微调8千步。同样,我们将7B卫星模型蒸馏为更易部署的ViT-Large模型,以适应低算力场景。

我们在多项地球观测任务上评估DINOv3卫星模型与网络模型。对于全球树冠高度制图任务,使用附录D.13描述的Satlidar数据集,包含100万张512×512图像及其LiDAR真值,按8:1:1划分训练/验证/测试集,涵盖Tolan et al. (2024)使用的Neon与São Paulo数据。对于国家级树冠高度制图,在Open-Canopy (Fogel et al., 2025)上评估,该数据集融合法国87000 km²的SPOT 6-7卫星影像与航空LiDAR数据。由于该数据集图像含4通道(额外近红外IR通道),我们通过将patch嵌入模块权重的三通道取均值并作为第四通道权重,对主干网络进行适配。随后,在将图像resize至1667以匹配Maxar地面采样分辨率的512×512裁剪块上训练DPT解码器。

语义地理空间任务通过GEO-Bench (Lacoste et al., 2023)评估,其包含6项分类与6项分割任务,覆盖多种空间分辨率与光学波段,任务多样,涵盖屋顶光伏检测、局地气候区分类、毁林驱动因子测量与树冠检测。对于高分辨率语义任务,采用土地覆盖分割数据集LoveDA (Wang et al., 2022a)、目标分割数据集iSAID (Zamir et al., 2019)以及水平检测数据集 DIOR (Li et al., 2020)。


8.2 冠层高度估计

从卫星影像估算冠层高度是一项颇具挑战的度量任务,需在坡度、观测几何、太阳角度、大气散射及量化伪影等随机变化下准确恢复连续空间结构。该任务对全球碳监测以及农林管理至关重要(Harris et al., 2021)。继Tolan et al. (2024)首次利用在卫星图像上训练的SSL主干完成该任务后,我们在冻结的DINOv3上训练DPT头,使用SatLidar1M训练集,并在SatLidar1M验证集的独立同分布样本以及SatLidar1M测试集、Neon和São Paulo等分布外测试集上评估;此外还在Open-Canopy数据集上训练与评估。

结果(表17)
我们比较不同SSL主干,以“DINOv3 Sat”表示在SAT-493M上训练的模型,以“DINOv3 Web”表示在LVD-1689M上训练的模型(见第3.1节)。可见DINOv3卫星模型在多数基准上达到业界最优性能。我们的7B卫星模型在SatLidar1M验证集、SatLidar1M测试集和Open-Canopy上刷新最佳成绩,分别将MAE从2.4降至2.2、从3.4降至3.2、从2.42降至2.02。结果表明DINOv3训练方案具有通用性,可开箱即用地有效迁移至其他领域。有趣的是,我们蒸馏的ViT-L卫星模型与其7B版本表现相当,在SatLidar1M和Open-Canopy上取得可比结果,并在Neon测试集上意外更优,达到最低MAE 2.4,优于7B模型的2.6和Tolan et al. (2024)的2.9。我们的DINOv3 7B网络模型在基准上亦取得不错性能,在SatLidar1M验证集、Neon和Open-Canopy上优于Tolan et al. (2024),但仍逊于卫星模型。这凸显了面向特定领域的预训练在具有物理基础的冠层高度估计任务中的优势,其中传感器先验与辐射一致性尤为关键。


在这里插入图片描述


8.3 与地球观测领域当前最优方法的比较

我们在表18与表19中比较不同方法在地球观测任务上的性能。冻结的DINOv3卫星与网络模型在15项分类、分割及水平目标检测任务中的12项上刷新了业界最优结果。我们的Geo-Bench结果优于先前模型,包括Prithvi-v2(Szwarcman et al., 2024)与DOFA(Xiong et al., 2024),后者在Sentinel-2与Landsat任务中使用6个以上波段,以及任务特定微调(表18)。尽管仅使用RGB输入的冻结主干,DINOv3卫星模型在三项未饱和分类任务与六项分割任务中的五项上均优于以往方法。值得注意的是,DINOv3 7B网络模型在这些基准上亦极具竞争力,在多项GEO-Bench任务以及大规模高分辨率遥感分割与检测基准上取得可比或更优性能。如表18与表19所示,冻结的DINOv3网络模型在Geo-Bench任务以及LoveDA与DIOR数据集的分割与检测任务上均树立了新的领先成绩。

这些发现对地理空间基础模型设计具有更广泛启示。近期研究强调多时空聚合、多传感器融合或引入卫星特定元数据等启发式技术(Brown et al., 2025;Feng et al., 2025)。我们的结果表明,通用SSL在依赖精确目标边界的任务(分割或目标检测)上可匹敌甚至超越卫星专用方法,这进一步支持了领域无关预训练即便在专精下游领域也能提供强泛化能力的新兴证据(Lahrichi et al., 2025)。

总体而言,我们的结果揭示了领域特定预训练的任务依赖性收益。DINOv3卫星模型在深度估计等度量任务中表现卓越, leveraging satellite-specific priors;相比之下,DINOv3网络模型凭借多样且通用的表示在语义地理空间任务上达到业界最优。两种模型的互补优势共同彰显了DINOv3 SSL范式的广泛适用性与有效性。


在这里插入图片描述


在这里插入图片描述


9. 环境影响

为估算预训练过程的碳排放,我们沿用自然语言处理领域(Strubell et al., 2019;Touvron et al., 2023)及自监督学习(Oquab et al., 2024)先前工作的计算方法。我们将所有外生变量固定为Touvron et al. (2023)所用值,即将电能使用效率(Power Usage Effectiveness, PUE)与电网碳强度因子分别设为1.1及美国平均值0.385 kgCO₂eq/kWh。对于GPU功耗,我们采用其热设计功率:A100 GPU为400 W,H100 GPU为700 W。表20报告了我们ViT-7B预训练的详细计算;作为参照,我们同时提供DINOv2与MetaCLIP的对应数据。另一点比较:训练一个DINOv3模型所需能量(47 MWh)约等于一辆普通电动车行驶240,000 km的能耗。

项目整体碳足迹 为计算整个项目的碳足迹,我们粗略估计总GPU时达9 M小时。采用上述电网参数,估算总排放量约为2600 tCO₂eq。作为对比,一架波音777往返巴黎与纽约的航班约产生560 tCO₂eq;若每日有12班此类航班,本项目的环境影响相当于这两城市间一日航班总量的一半。该估算仅考虑GPU供电所需电力,未计入制冷、制造及处置等其他排放。


10. 结论

DINOv3 代表了自监督学习领域的重大进展,展示了彻底改变跨域视觉表征学习方式的潜力。通过严谨的数据准备、设计与优化,对数据集与模型规模进行扩展,DINOv3 彰显了自监督学习消除对手工标注依赖的强大能力。Gram anchoring 方法的引入有效缓解了密集特征图在长周期训练中的退化,确保了稳健可靠的性能。

结合高分辨率后训练与蒸馏等事后精修策略,我们在无需对图像编码器进行微调的情况下,于广泛视觉任务上达到了业界最优性能。DINOv3 系列视觉模型不仅树立了新基准,还在不同资源约束、部署场景与应用用例中提供了通用解决方案。DINOv3 的进展充分证明了自监督学习在推动计算机视觉乃至更广领域前沿方面的巨大前景。


在这里插入图片描述


在这里插入图片描述


在这里插入图片描述


11. 附录

11.1 附录A:大规模训练中的伪影与异常值

本节讨论近期在大型模型训练过程中——无论语言模型(LLM)(An et al., 2025)还是视觉领域(Darcet et al., 2024)——所观察到的伪影与异常值现象。借用 An et al. (2025) 的定义,异常值通常指网络激活值显著偏离其分布均值的情况。在 DINOv3 训练过程中,我们在不同层级识别到此类异常值:部分出现在 patch 层级,其余则位于特征维度层级。下文我们讨论所观察到的不同类型异常值、其对训练与结果的影响,以及我们尝试修复的不同方法与初步结论。


A.1 高范数 patch 异常值

Darcet et al. (2024) 发现 patch 异常值会对 DINOv2 性能产生负面影响。这些异常值主要表现为高范数 token,通常位于图像信息匮乏的背景区域。观察表明,这些 token 在 patch 与 CLS token 之间的内部通信中起关键作用。此外,该现象亦影响其他无论是否采用监督训练的策略,如 CLIP(Radford et al., 2021)。当扩展至 7B 模型时,我们同样观察到此类高范数 patch 的出现,主要集中在背景区域。本节展示训练 150k 次迭代的 7B 模型结果,尽管数据有限,但为我们提供了指导决策的初步信号。我们在图 20a 的“∅”列中绘制输出 patch 范数(layer norm 之前),黄色高范数 patch 出现在天空及其他信息贫乏区域。

Token Registers 为缓解此类 token 异常值的出现,Darcet et al. (2024) 提出一种简单但有效的方案:在 ViT 输入序列中引入额外 token,称为 registers。其作用在于接管 patch 与 CLS 之间的内部通信。基于上述结论,我们使用 4 个 registers,且由于实验成本高昂未再做消融实验。图 20a 展示了该策略的实际示例,可见高范数异常值被消除,对应范数分布的直方图进一步验证了这一现象。此外,我们在图 20b 中定量观察到,在 ImageNet-1k (IN1k) 基准上引入额外 register token 带来的收益。

在注意力机制中引入偏置 An et al. (2025) 的最新工作探讨了 LLM 领域不同模型与架构中异常值的出现。作者分析了不同类型的异常值,发现其与注意力机制存在内在关联。他们提出若干缓解方案,我们从中挑选两种颇具前景且对注意力改动最小的策略:显式固定偏置(我们称之为“value gating”)以及注意力偏置策略。

我们在图 20a 中观察到,value gating 策略显著改变了 patch 范数的分布,使得范数值整体提高并消除了明显的异常值。尽管该注意力机制缓解了高范数 token 的出现,但并未彻底解决问题——与使用 register token 的结果相比,部分高范数 patch 依然存在(如顶行图像所示)。值得注意的是,最佳性能通过引入 register token 实现,因此我们在本文报告的所有实验中均采用该策略。


在这里插入图片描述


A.2 特征维度异常值

在模型架构中引入额外的 register token 可有效解决高范数 patch 异常值问题。然而,在 7B 模型训练过程中,我们观察到另一种不同类型的异常值:其并非出现在 patch 层面,而是出现在所学表征的特征(通道)维度内。具体而言,跨 transformer 层级与训练迭代对 patch 激活值进行分析后发现,少数特征维度的幅值异常巨大,而 patch 范数整体保持稳定。

值得注意的是,这些特征维度异常值在不同 patch 与图像上均持续保持高值,其行为与 (An et al., 2025) 中的报道形成对比。此外,这些异常维度在给定模型的各层中持续存在,其幅值随深度递增,并在输出层达到最大值;同时在训练过程中其幅值亦逐步增大。

我们开展了在训练与推理阶段中和这些维度的实验。结果表明,这些维度在训练中起重要作用:对其施加 L2 正则化以抑制其幅值会导致性能下降。然而,在推理阶段移除这些维度并未带来显著性能变化,提示它们主要承载琐碎或非信息性信号。此外,我们观察到最终的层归一化被训练为大幅缩放这些异常维度。因此,我们建议在下游任务中对最终层特征应用最终的层归一化。 alternatively,应用批归一化亦可抑制这些特征维度异常值,因其在不同 patch 与图像上保持 elevated values。

需警惕使用早期层特征的情况。如上所述,早期层同样受特征维度异常值影响,可能导致病态特征。尽管最终层归一化非常适合对最终特征分布进行归一化,但其学习得到的参数可能并不适用于早期层特征。确实,我们观察到如此操作会在部分任务上造成性能下降。对此,我们发现标准的特征缩放技术(如批归一化或主成分分析)可有效应对特征维度异常值。

例如,对于使用中间层特征的语义分割实验(第 6.3.2 节)和深度估计实验(第 6.3.3 节),我们应用批归一化。


在这里插入图片描述


11.2 附录B:补充结果

B.1 历年演进

在图 1 中,我们给出了历年 state-of-the-art 性能的大致演进。此处,我们提供图中引用的精确参考文献与性能数据,详见表 21。


B.2 逐层分析

本节评估 DINOv3 7B 模型各层所学特征的质量。具体而言,我们给出五项代表性任务的结果:分类(IN-1k val、ImageNet-ReAL 与 ObjectNet)、分割(ADE20k)、深度估计(NYU)、跟踪(DAVIS)以及 3D 对应估计(NAVI)。对于前三个基准,我们在每个骨干层输出上训练线性层以评估特征性能,方法同第 6.1.2 与 6.2.1 节;对于跟踪与对应估计,我们采用非参数方法,方法同第 6.1.3 与 6.1.5 节。

结果示于图 21。我们发现,对于分类与密集任务,性能随层数平滑提升;深度估计、跟踪与 3D 对应估计在约第 32 层达到峰值,表明在几何起重要作用的任务上,通过使用更早层的特征可进一步提升 DINOv3 的下游性能。另一方面,中间层相比最后一层仅带来轻微提升,因此最后一层仍是良好的默认选择。


B.3 主结果部分的补充实验

我们给出补充实验结果以完善第 6 节的主结果。表 22 给出小数据集细粒度分类的逐数据集线性探测结果(Fine-S,见第 6.2.1 节)。表 23 给出实例识别评估的完整结果(第 6.2.2 节),并增加更多指标。


B.4 面向 OCR 密集型数据集的分类实验

在本实验中,我们评估 DINOv3 在需要某种字符识别能力的分类任务上的表现,这些任务包括路标、徽标与商品分类。我们将模型与最佳自监督模型(DINOv2 g)及最佳弱监督模型(PE-core G)进行比较。我们在 512 分辨率图像上运行我们的模型,并调整 patch 大小以匹配其他模型的序列长度。该实验结果报告于表 25


在这里插入图片描述


11.4 附录D:实验细节

在本节中,我们将详细说明本文所有基准测试中使用的数据集与评估指标。


D.1 语义分割:线性探测(Linear Probing)

数据集与指标
我们通过线性探测方法,在三个基准数据集上评估 DINOv3 模型的语义分割性能,这三个数据集分别为:ADE20k(Zhou 等人,2017)、VOC12(Everingham 等人,2012)和 Cityscapes(Cordts 等人,2016)。所报告的评估指标为标准的平均交并比(mean Intersection-over-Union, mIoU)。

评估方案
为评估密集特征的质量,我们在每个基准数据集的训练集上训练一个线性分类器。该线性层应用于冻结的骨干网络(frozen backbone)的补丁输出特征(经过层归一化处理后)之上,且这些特征会通过一个训练好的批归一化层进一步归一化。
对于所有骨干网络,我们使用 AdamW 优化器进行超参数搜索,其中学习率(learning rate)的取值范围为 {1×10⁻⁴, 3×10⁻⁴, 1×10⁻³},权重衰减(weight decay)的取值范围为 {1×10⁻⁴, 1×10⁻³}。


D.2 深度估计:线性探测(Linear Probing)

数据集与指标
我们在深度估计基准数据集 NYUv2(Silberman 等人,2012)和 KITTI(Geiger 等人,2013)上,评估 DINOv3 特征在几何任务中的表现。结果采用均方根误差(Root Mean Squared Error, RMSE)指标进行报告。

评估方案
为评估密集特征的质量,我们在每个基准数据集的训练集上训练一个线性分类器。该线性层应用于冻结的骨干网络(frozen backbone)的补丁输出特征(经过层归一化处理后)之上,且这些特征会通过一个训练好的批归一化层进一步归一化。
对于所有骨干网络,我们使用 AdamW 优化器进行超参数搜索,其中学习率(learning rate)的取值范围为 [1×10⁻⁴, 3×10⁻⁴, 1×10⁻³],权重衰减(weight decay)的取值范围为 [1×10⁻⁴, 1×10⁻³]。


D.3 三维关键点匹配(3D Keypoint Matching)

数据集与指标
几何对应关系的评估在 NAVI 数据集(Jampani 等人,2023)上进行,语义对应关系的评估在 SPair 数据集(Min 等人,2019)上进行。
对于 NAVI 数据集:当模型补丁大小(patch size)为 14/16 时,将图像调整为边长 448/512 像素的尺寸。
对于 SPair 数据集:当模型补丁大小为 14/16 时,将图像调整为边长 896/1024 像素的尺寸。
性能衡量采用 “对应召回率(correspondence recall)” 指标,即落入指定距离范围内的对应点所占百分比。

评估方案

  1. NAVI 数据集评估
    我们遵循 Probe3D(Banani 等人,2024)中定义的评估方案,具体步骤如下:
    对物体视图(object views)进行 1/4 的子采样;
    对于每个源视图(source view),选择一个旋转角度最大不超过 120 度的目标视图(dest. view),构建图像对(源视图 - 目标视图)以进行补丁匹配;
    对于每个图像对,将源视图中(物体范围内的)每个补丁与目标视图中的补丁进行匹配;
    保留余弦相似度最高的前 1000 个匹配结果用于评估,并根据两幅图像已知的相机姿态(camera pose)和深度图(depth maps),为每个匹配结果计算三维距离误差;
    基于不同阈值(此处使用 1 厘米、2 厘米和 5 厘米)计算召回误差,最终将不同阈值下的召回率取平均值,作为 “对应召回率”。
  2. 骨干网络特征处理
    对于每个待评估的骨干网络,我们使用其最后一层的特征进行评估,且分别评估 “应用最后一层归一化(final layer norm)” 和 “不应用最后一层归一化” 两种情况。这是因为我们发现,部分模型在应用最后一层归一化时会出现性能下降的情况。最终报告两种情况中的最优结果。

D.4 无监督目标发现(Unsupervised Object Discovery)

数据集与指标
该任务的目标是为每张图像生成一个边界框(bounding box),以突出显示场景中所描绘的任意目标。我们遵循 Siméoni 等人(2021)提出的无监督目标发现方案,在目标检测基准数据集 VOC07(Everingham 等人,2007)、VOC12(Everingham 等人,2012)和 COCO20K(Lin 等人,2014;Vo 等人,2020)上评估所有骨干网络。
其中,COCO20K 是 COCO2014 训练验证集(trainval dataset,Lin 等人,2014)的子集,包含 19,817 张随机选取的图像,该子集由 Vo 等人(2020)提出,目前已成为该任务的常用数据集。
评估时,每张图像仅生成一个边界框,采用 “正确定位率(Correct Localization, CorLoc)” 作为评估指标 —— 该指标计算正确定位的边界框所占百分比。若预测边界框与任意一个真实边界框(ground-truth bounding box)的交并比(IoU)超过 0.5,则认为该预测边界框定位正确。

评估方案
为评估图像编码器的性能,我们采用 TokenCut 策略(Wang 等人,2023c),具体步骤如下:

  1. 构建图结构:将图像补丁(patch)组织成一个全连接图(fully connected graph),图中的边(edge)代表补丁对之间的相似度分数 —— 该分数通过 Transformer 模型所学骨干网络的特征计算得出;
  2. 识别显著目标补丁:应用归一化割算法(Normalized Cut algorithm)求解图割(graph-cut)问题,从而识别出显著目标对应的补丁(salient object patches);
  3. 生成边界框:根据得到的显著目标掩码(salient object mask),拟合出一个边界框。

所有图像均以原始全分辨率输入编码器,且所有图像编码器均使用补丁输出特征进行计算。为应对不同模型间特征分布的差异,我们对 TokenCut 特有的超参数(即图构建过程中使用的相似度阈值)进行搜索:具体而言,阈值在 0 到 0.4 之间以 0.05 为步长递增,遍历所有可能取值以筛选最优配置。


D.5 视频分割跟踪

数据集与指标
本任务使用 DAVIS 2017(Pont-Tuset 等,2017)、YouTube-VOS(Xu 等,2018)与 MOSE(Ding 等,2023)数据集。DAVIS 提供 60 段训练视频与 30 段验证视频,所有帧均带有像素级实例分割真值掩码。YouTube-VOS 仅公开训练集标注,验证集受限于评测服务器;为模拟 DAVIS 设置,我们随机抽取 2758 段已标注视频(80%)作为训练集,其余 690 段(20%)作为验证集。类似地,我们将 MOSE 数据集划分为 1206 段验证视频与 301 段测试视频。对所有数据集,均采用标准 J&F-mean 指标(Perazzi 等,2016)评估,该指标综合区域相似度(J)与轮廓精度(F)。仅追踪并评估首帧已标注的目标,后续出现的目标即使带有真值掩码也予以忽略。

评估协议
参照 Rajasegaran 等(2025),我们实现一种基于块相似度的非参数标签传播协议,相似度通过冻结的 DINOv3 主干提取的特征余弦相似度计算。假设视频首帧已给出实例分割掩码,我们将每块表示为 one-hot 向量。对每一帧,计算其所有块特征与首帧所有块特征及少量历史帧所有块特征之间的余弦相似度。针对当前帧的某一特定块,在其空间邻域内选取最相似的 k 个块,并对它们的标签进行加权平均,得到当前块的预测。处理完一帧后,移至下一帧,将前一帧的预测作为软实例分割标签继续迭代。单帧输入主干时,将图像最短边缩放到指定尺寸,保持长宽比至最接近的 patch 尺寸倍数。块相似度与标签传播在所得特征分辨率上计算,随后将掩码概率通过双线性插值恢复到原分辨率以计算 J&F。我们考察多种超参数组合,例如用作上下文的历史帧数、邻居数 k 及空间邻域大小,汇总于表 27。在 DAVIS 训练集上进行超参数选择,然后将最佳组合应用于所有数据集的测试划分。


D.6 视频分类

数据集与指标
我们在 UCF101(Soomro 等,2012)、Something-Something V2(Goyal 等,2017)与 Kinetics-400(Kay 等,2017)数据集上评估 DINOv3 的视频分类性能。总体流程为:从每段视频抽取固定数量的帧,用冻结主干编码,将所有块特征展平为序列,输入一个浅层基于 transformer 的分类器,并在有标注视频上用常规监督方式训练。此前工作(如 Assran 等,2025)将该协议称为 attentive probe,类比图像分类中的线性探针。下文详述实现细节。

训练
训练阶段,从每段视频中随机选取 16 帧,并记录对应时间戳;同时采样一组空间裁剪参数,覆盖面积 40%–100%,该参数在视频所有帧间共享以避免抖动。随后将每帧作为独立 256×256 图像输入 DINOv3,提取 16×16 块特征并丢弃 CLS token;记录每块在 [0,1]² 框上的空间坐标。所有帧的块特征先线性投影至 1024 维,拼接成长度为 16×16×16=4096 的扁平序列,再输入四个自注意力块以建模块间的时空关系。为保证位置信息,我们在块进入注意力层前以加性 sin-cos 嵌入(Vaswani 等,2017)注入时间戳与空间坐标,并在每个注意力头内使用带有随机空间旋转的 3D 分解 RoPE(Heo 等,2024)。四块自注意力后,使用单查询无位置交叉注意力块将所有块信息聚合为单一向量,再经线性投影得到最终分类 logits。自注意力堆栈、交叉注意力块、位置嵌入及最终投影共同构成视频分类器,我们以批量大小 64、标准交叉熵损失训练 20 周期。实际训练时,并行训练一组分类器,覆盖学习率 {1·10⁻⁴, 2·10⁻⁴, 5·10⁻⁴, 1·10⁻³, 2·10⁻³, 5·10⁻³} 与权重衰减 {10⁻³, 10⁻², 10⁻¹} 的所有组合。对各数据集,用 90% 训练集更新参数,10% 训练集选取最佳学习率与权重衰减组合,最终在验证集报告所选模型性能。

推断
推断阶段,采用确定性策略每视频采样单段剪辑:取首帧、末帧及中间均匀间隔帧,共 16 帧;每帧裁剪最大中心正方形并 resize 至 256×256,可能损失矩形视频两侧信息。随后将这些帧输入 DINOv3 与分类器得到视频预测。 alternatively,我们参照 Assran 等(2025)执行测试时增强(TTA),选取多组帧序列与多组空间裁剪,独立处理并平均分类概率得到最终预测。剪辑采样示例见图 22。

基线
对所选基线模型,采用相同评估协议,即特征提取、分类器架构、训练流程与推断协议,仅存在以下差异:patch size 16 的模型输入分辨率为 256×256,patch size 14 的模型为 224×224,以保证所有主干输出相同 token 数,从而在分类器中计算量一致。除 V-JEPA2 外,所有模型均逐帧独立处理视频,因其仅在图像上训练。对 V-JEPA2,我们输入完整剪辑以提取时序感知特征;由于其将时间轴缩减为原来一半(例如 16 帧输入得到 8 时间步),我们将每个块 token 复制一倍以匹配其他模型的序列长度。


D.7 基于线性探测的图像分类(Image Classification with Linear Probing)

数据集与指标
我们采用广泛使用的线性探测评估方法,衡量 DINOv3 模型的全局性能。具体步骤为:在 ImageNet-1k 数据集(Deng 等人,2009)的训练集上训练一个线性转换器,并在其验证集(val set)上评估结果。
为评估模型的泛化能力,我们进一步在以下分类测试集上验证模型的迁移性能:

  • ImageNet-V2(Recht 等人,2019) 与 ReaL(Beyer 等人,2020):这两个数据集为 ImageNet 提供了额外的图像与标签集,旨在检测模型是否对原始 ImageNet 验证集存在过拟合;
  • Rendition(Hendrycks 等人,2021a) 与 Sketch(Wang 等人,2019):包含 ImageNet 类别对应的风格化与人工绘制图像;
    Adversarial(Hendrycks 等人,2021b) 与 ObjectNet(Barbu 等人,2019):包含刻意设计的高难度样本;
  • Corruptions(Hendrycks 与 Dietterich,2019):用于衡量模型对常见图像损坏(如模糊、噪声)的鲁棒性。

对于除 ImageNet-C(即上述 Corruptions 数据集)之外的所有数据集,我们以 “top-1 分类准确率” 作为评估指标;对于 ImageNet-C,我们采用 “平均损坏误差(mean corruption error, mCE)” 作为指标(详见 Hendrycks 与 Dietterich,2019 的研究)。

在细分类别数据集方面,我们采用与 Oquab 等人(2024)一致的 12 个数据集集合(本文中称为 “Fine-S”),包括:Food-101(Bossard 等人,2014)、CIFAR-10(Krizhevsky 等人,2009)、CIFAR-100(Krizhevsky 等人,2009)、SUN397(Xiao 等人,2010)、StanfordCars(Krause 等人,2013)、FGVCAircraft(Maji 等人,2013)、VOC 2007(Everingham 等人,2007)、DTD(Cimpoi 等人,2014)、Oxford Pets(Parkhi 等人,2012)、Caltech101(Fei-Fei 等人,2004)、Flowers(Nilsback 与 Zisserman,2008)、CUB200(Welinder 等人,2010);此外还包括更大规模的数据集:Places205(Zhou 等人,2014)、iNaturalist 2018(Van Horn 等人,2018)与 iNaturalist 2021(Van Horn 等人,2021)。

评估方案

  1. 大规模数据集评估(ImageNet、Places205、iNaturalist 2018、iNaturalist 2021)
    针对上述大规模数据集,我们采用以下流程:
  • 对于每个基准模型,在 ImageNet-1k 训练集(Deng 等人,2009)上,基于 CLS 令牌(CLS token)的最终特征(经过层归一化后)训练一个线性层;
  • 优化器采用随机梯度下降(SGD),动量(momentum)设为 0.9,训练轮次(epochs)为 10,批大小(batch size)为 1024;
  • 超参数搜索范围:学习率(learning rate)为 {1×10⁻⁴, 2×10⁻⁴, 5×10⁻⁴, 1×10⁻³, 2×10⁻³, 5×10⁻³, 1×10⁻², 2×10⁻², 5×10⁻², 1×10⁻¹, 2×10⁻¹, 5×10⁻¹, 1×10⁰, 2×10⁰, 5×10⁰},权重衰减(weight decay)为 {0, 1×10⁻⁵},并通过 ImageNet-1k 验证集筛选最优超参数组合;
  • 训练过程中,采用 “随机缩放裁剪(random resize crop)” 数据增强,参数遵循标准 Inception 裁剪(Inception-crop)配置。
  1. Fine-S 数据集评估
    对于 Fine-S 中的数据集,遵循 Oquab 等人(2024)的方法,采用更轻量化的评估方式:使用 scikit-learn 库中的逻辑回归(LogisticRegression)实现,求解器(solver)为 L-BFGS。

  2. 图像分辨率统一
    两种评估场景下,均将模型输入图像的分辨率调整为生成 1024 个补丁令牌(patch tokens):

  • 若补丁大小(patch size)为 14,则图像分辨率设为 448×448;
  • 若补丁大小为 16,则图像分辨率设为 512×512;
  • 图像缩放规则:先将图像较短边调整至目标边长,再裁剪出中心正方形区域作为最终输入。

D.8 实例识别

数据集与指标
我们使用 Oxford 与 Paris 数据集进行地标识别(Radenović 等,2018)、Met 数据集展示来自大都会艺术博物馆的艺术品(Ypsilantis 等,2021),以及 AmsterTime,后者由与现代街景图像相匹配的阿姆斯特丹历史档案图像组成(Yildiz 等,2022)。在表 9 中,我们报告 Oxford-Hard、Paris-Hard 与 AmsterTime 的平均精度均值(mAP),以及 Met 的全局平均精度(GAP)。在表 23 中,我们额外给出 Oxford-Medium 与 Paris-Medium 的 mAP,以及附加指标 GAP- 与准确率(参见(Ypsilantis 等,2021))。对于 Oxford 与 Paris,我们将所有图像长边缩放至 224 像素并保持长宽比,然后取完整中心裁剪,得到 224×224 分辨率的图像。对于 AmsterTime,我们将所有图像短边缩放至 256 像素并保持长宽比,然后取 224×224 大小的中心裁剪。对于 Met,我们在接近原始分辨率下评估所有图像,将两者缩放至最接近的 patch 尺寸的倍数(对于 patch size 14/16,长边分别为 508/512)。

评估协议
图像相似度通过查询图像与目标图像的 CLS token 之间的余弦距离计算。我们遵循 (Radenović 等,2018) 对 Oxford 与 Paris、(Yildiz 等,2022) 对 AmsterTime,以及 Ypsilantis 等(2021)对 Met 的评估协议。对于 Met,这包括对超参数 k 与 τ 进行网格搜索以优化验证集上的 GAP,并使用在 Met 训练集上估计的 PCA 对特征进行白化。


D.9 目标检测

数据集与指标
我们在 COCO(Lin 等,2014)与 COCO-O(Mao 等,2023)数据集上评估 DINOv3 的目标检测性能。COCO 是目标检测的标准基准,涵盖 80 个目标类别,包含 118k 张训练图像与 5k 张验证图像。COCO-O 是仅用于评估的数据集,类别与 COCO 相同,但具有更具挑战性的视觉条件,如严重遮挡、杂乱背景与多变光照。为训练目标检测模型,我们还利用 Objects365(Shao 等,2019)数据集,其包含 250 万张图像,覆盖 365 个目标类别,其中一部分直接映射至 COCO 类别。对于 COCO 与 COCO-O,我们报告在 IoU 阈值 [0.5 : 0.05 : 0.95] 上计算的平均精度均值(mAP)。

架构
我们的方法基于 Plain-DETR(Lin 等,2023b)实现,并进行若干修改。我们不将 transformer 编码器融合到主干中,而是将其作为独立模块保留,类似原始 DETR(Carion 等,2020)。这使得我们能在训练与推断期间保持 DINOv3 主干完全冻结,成为首个实现此举的竞争性检测模型。从 DINOv3 ViT-7B/16 主干中,我们提取第 [10,20,30,40] 层的中间特征。对每个 patch,我们将中间特征在通道维度拼接,得到维度为 4·4096 = 16384 的特征,随后通过下述窗口策略进一步增加。主干特征输入编码器,该编码器由 6 个自注意力块组成,嵌入维度为 768。解码器由 6 个交叉注意力块组成,嵌入维度相同,其中 1500 个“一对一”查询与 1500 个“一对多”查询 attend 到编码器的 patch token,以预测边界框与类别标签。

图像预处理
训练分三阶段进行,下文详述:一阶段基础图像分辨率为 1536 像素,另两阶段为 2048 像素。仿照 DETR,我们先以概率 0.5 进行随机水平翻转,然后执行 (i) 随机缩放,最短边在 920 像素(对应 1536 阶段)或 1228 像素(对应 2048 阶段)与阶段基础分辨率之间均匀采样;或 (ii) 随机裁剪保留原图 60–100% 区域,随后按 (i) 缩放。评估时,图像最短边缩放到 2048 像素,无额外增广,且两边向上取整至最接近的 patch 尺寸倍数。

窗口策略
随后应用窗口策略,结合全局视图与较小窗口,使主干能处理所有尺度的目标。窗口数量固定为 3×3,其尺寸随输入分辨率变化。例如,对于 1536×2304 的图像:

  1. 将图像划分为 3×3 个不重叠的窗口,每个窗口尺寸为 512×768;各窗口分别送入主干网络,得到 32×48 个维度为 16384 的 patch token。随后将所有窗口的特征按空间位置重新拼接,形成大小为 (3·32)×(3·48) 的特征图。
  2. 将整幅图像缩放至 512×768 并送入主干网络,得到 32×48 个维度为 16384 的 patch token 特征图;接着通过双线性插值将其上采样至 96×144,以匹配窗口特征图的尺寸。
  3. 最后,将步骤 1 与步骤 2 得到的特征图在通道维度拼接,形成 96×144 大小、维度为 2·16384=32768 的特征图;该特征图展平为 96×144 个 token 的序列后输入编码器。

训练过程(Training)
我们采用分三阶段的训练课程(training curriculum),使用 Objects365 数据集(Shao 等人,2019)和 COCO 数据集(Lin 等人,2014),并逐步提高训练分辨率。在整个训练过程中,我们使用 AdamW 优化器(Loshchilov 与 Hutter,2017),权重衰减(weight decay)设为 0.05。

参考 DETR 模型的配置,我们采用以下损失函数组合:

  • 分类损失:焦点损失(Focal Loss,Lin 等人,2018),权重设为 2;
  • 边界框损失:L1 损失,权重设为 1;
  • 补充损失:广义交并比损失(GIoU Loss,Rezatofighi 等人,2019),权重设为 2。

具体训练阶段如下:

  • 第一阶段:Objects365 数据集,基础分辨率 1536 像素
    训练轮次(epochs):22 轮;
    全局批大小(global batch size):32,分配至 32 块 GPU;
    学习率调度:先经过 1000 步的预热(warmup),之后学习率设为 5×10⁻⁵,在第 20 轮后学习率除以 10(即降至 5×10⁻⁶)。
  • 第二阶段:Objects365 数据集,基础分辨率 2048 像素
    训练轮次:4 轮;
    学习率:2.5×10⁻⁵。
  • 第三阶段:COCO 数据集,基础分辨率 2048 像素
    训练轮次:12 轮;
    学习率调度:先经过 2000 次迭代(iterations)的线性预热,之后学习率遵循余弦衰减策略(cosine decay schedule)—— 初始值为 2.5×10⁻⁵,在第 8 轮时降至 2.5×10⁻⁶;
    损失函数调整:用 IA-BCE 分类损失(Cai 等人,2024)替代 DETR 原有的简单焦点损失。我们观察到,该损失函数虽不会提升预训练阶段(pretraining time)的性能,但能提高模型在迁移阶段(transfer time)的性能;由于 IA-BCE 损失会融合类别信息与边界框信息,因此只有当边界框预测已完成良好初始化时,才能充分发挥其作用;
    损失权重调整:此阶段将 GIoU 损失的权重设为 4,以促进边界框更好地对齐(box alignment)。

测试时数据增强(Test-Time Augmentation)
在测试阶段,我们遵循上述推理流程,将图像调整为 “短边 1536 像素” 或 “短边 2048 像素” 的分辨率:在这两种分辨率下,COCO 数据集上的平均精度(mAP)分别为 65.4 和 65.6。
此外,我们还可采用 Bolya 等人(2025)提出的测试时数据增强(TTA)策略,具体步骤包括:对图像进行翻转(flipping)和多分辨率缩放(resizing to multiple resolutions),并使用 SoftNMS 算法(Bodla 等人,2017)融合多个预测结果。
具体而言,每张图像会在以下分辨率下进行处理:[1536, 1728, 1920, 2112, 2304, 2496, 2688, 2880];
采用该策略后,COCO 数据集上的 mAP 可达 66.1。


D.10 语义分割

数据集与指标
我们在 ADE20k(Zhou 等,2017)、Cityscapes(Cordts 等,2016)、COCO-Stuff(Caesar 等,2018)与 VOC 2012(Everingham 等,2012)数据集上评估 DINOv3 的语义分割性能。ADE20k 是广泛使用的语义分割基准,含 150 个语义类别,涵盖从户外景色到室内人物与物体。此外,COCO-Stuff 与 Hypersim(Roberts 等,2021)数据集用于模型预训练。COCO-Stuff 规模大于 ADE20k(118k 训练图像),含 80 个 thing 类与 91 个 stuff 类;Hypersim 为逼真的合成室内场景数据集,含 40 个语义类别,标注更锐利准确。Hypersim 中逾半数图像包含 21 个以上物体,有助于模型学习丰富场景信息。所有数据集均采用 mIoU 作为评估指标。

架构
我们沿用其他基线采用的 ViT-Adapter 与 Mask2former 配置(Wang 等,2023a),但有以下差异:第一,为确保主干冻结且激活不被修改,我们移除 ViT-Adapter 的 injector 组件,使主干输出特征直接用于 extractor 模块;第二,Mask2former 解码器的嵌入维度由默认 1024 缩放至 2048,以适配我们 4096 维的主干输出,而其他基线主干输出通常为 1024 或 1536 维。作为解码器输入,我们从 DINOv3 7B/16 主干的第 [10,20,30,40] 层提取特征,对所有层特征施加最终层归一化并加入可学习的批归一化。

训练协议
在 COCO-Stuff 上生成结果时,模型采用余弦调度器训练,线性热身 6k 步,最大学习率 1.5e-5,共训练 80k 步,分辨率为 1280 像素。对于其余数据集——ADE20k、Cityscapes 与 VOC 2012——我们首先在 COCO-Stuff 上预训练解码器 80k 步(线性热身 6k 步,学习率 1.5e-5,余弦调度),以帮助模型在更大规模数据上学习 171 个多样语义类别;随后在 Hypersim 上训练 10k 步(学习率 2.5e-5,线性热身 1.5k 步,余弦调度,约 2 个 epoch),借助其逼真合成特性学习高质量图像-掩码对应;最后在 ADE20k 上训练 20k 步(学习率 3e-5,线性热身 1.5k 步,余弦调度),并报告验证集最终结果。Cityscapes 与 VOC 2012 分别采用 1.5e-5 与 1e-5 学习率。所有训练使用批量大小 16 与 AdamW 优化器。

推断
单尺度评估采用滑窗推断:先将图像缩放到训练分辨率(如 400×500 图像缩至 896×1120 像素以匹配 ADE20k 训练分辨率),再以指定步长(如 ADE20k 步长 596 像素)在方形裁剪(如 896×896 像素)上滑动生成每块预测,最后聚合并重缩至原图尺寸得到最终预测。测试时增强(TTA)方面,ADE20k 与 VOC 2012 图像被缩放至评估分辨率的 [0.9, 0.95, 1.0, 1.05, 1.1] 倍并水平翻转,每样本共 10 次预测,滑窗推断后重缩至原图尺寸并平均;COCO-Stuff 164K 的 TTA mIoU 仅每样本额外使用一次水平翻转;Cityscapes 则采用评估分辨率的 [1.0, 1.5, 2.0] 倍缩放。


在这里插入图片描述


版权声明:
youcans@qq.com 原创作品,转载必须标注原文链接:

【DINOv3】(2)DINOv3 技术报告

Copyright@youcans 2025
Crated:2025-10

Logo

助力广东及东莞地区开发者,代码托管、在线学习与竞赛、技术交流与分享、资源共享、职业发展,成为松山湖开发者首选的工作与学习平台

更多推荐