CLIP×DINO 鉴伪新范式|两大视觉基础模型联手,专治没见过的假脸
原创 52CV 2026-09-13 14:22 江苏
同一张假脸,一个模型判断为真,另一个却能发现异常。面对不断变化的换脸、表情驱动和整脸生成技术,鉴伪器的难点已经不只是记住训练集里的破绽:当伪造方式改变,它依赖的线索还有效吗?
北京交通大学、清华大学与蚂蚁集团的研究者提出 UCF-Net,将 CLIP 的语言对齐语义先验与 DINO 的自监督视觉结构先验结合起来。模型先汇聚各自不同深度的特征,再根据特征不确定性动态分配融合权重。在论文的统一基准上,UCF-Net 的域内和跨域平均 AUC 分别达到 95.33% 和 92.15%,均为所比较方法中的最高值。
论文标题:Harnessing CLIP and DINO: An Uncertainty-Aware Cascaded Fusion Network for Generalizable Deepfake Image Detection
作者列表:Xuechao Zou、Yi Zhou、Kai Li、Shun Zhang、Yuhui Chen、Congyan Lang、Junliang Xing。
除检测方法外,研究团队还整合了约 408 万张图像的统一深度伪造基准,并构建了包含 8,807 张生成脸图像的独立跨生成器评测集。
两种预训练目标带来不同的观察线索
CLIP 通过图文对齐学习视觉表示,DINO 则通过自监督学习获取视觉结构信息。预训练目标不同,使它们在同一张图上可能关注不同区域,也可能出现不同的误判。单独依赖某一种表示,容易把它的盲点一并带入下游鉴伪任务。
下面的三个案例展示了这种互补性:前两例中,两种单分支检测器各有一次误判;第三例中,两种单分支检测器都未能正确识别,而 UCF-Net 给出了正确预测。热力图呈现的是对伪造类别的响应,绿色和红色边框分别表示判断正确与错误。
这些案例给出了融合的动机,但不能据此认为两个模型组合后就不会出错。真正需要解决的是:每个编码器内部哪些层值得保留,两个编码器之间又应该如何分配权重? UCF-Net 将这两个问题拆成前后相接的两步。
先汇聚层级特征,再决定融合权重
UCF-Net 将同一张人脸图像送入 CLIP ViT-L/14 和 DINOv2 ViT-L/14,保留各个 Transformer 层的类别标记特征,而非只取最后一层输出。随后,每个分支分别完成层级聚合,再将两路表示送入不确定性感知融合模块,最终输出真假分类结果。下图展示了这一完整流程。
层级专家聚合(LEA)负责在每个分支内部选择线索。门控网络依据当前图像生成各层权重,各层特征经过瓶颈专家转换后加权汇总。同一分支内的专家参数跨层共享,两条分支则各自保留专家和门控网络。这让模型能够调整不同深度的贡献,同时避免为每一层单独增加一套专家参数。
不确定性感知特征融合(UAF)负责协调两条分支。它对归一化特征的通道响应做 softmax,再计算归一化熵:响应越集中、熵越低,该分支获得的融合权重越大。这里使用的是特征层面的不确定性代理,并非经过校准的“判断正确概率”;它为逐图调整两路特征的占比提供了依据。
408 万张图像,区分三种泛化问题
要判断融合是否有效,评测需要覆盖不同来源,而不能只在一种换脸方法上反复测试。团队整合的统一基准包含 4,081,316 张图像,覆盖人脸替换、人脸重演、整脸生成和人脸编辑四类伪造。
其中,2,215,477 张用于训练,185,716 张用于验证,1,393,675 张用于域内测试,286,448 张用于跨域测试。域内测试使用训练中已包含的数据集的留出划分;跨域测试使用未进入训练和验证的 UADFV、DeepFakeFace、DFDC 及 DF40-Test。
下图进一步区分了已见数据来源、未见公共数据域,以及独立构建的近期生成器测试集。
独立跨生成器集包含八个近期生成器来源的 8,807 张生成脸图像,用于检验直接迁移与少样本适配。作者对来源记录进行核验和去重,再经过人脸检测、对齐裁剪及人工筛选。该集合独立于上述 408 万张图像基准,不能与公共数据域的跨域测试混为一谈。
跨域平均 AUC 提升 2.95 个百分点
论文以 AUC 衡量真假图像的区分能力,以 mAUC 汇总不同测试项的表现。两者都不能直接解释为固定阈值下“有多少图片判断正确”。域内结果如下。
UCF-Net 的域内 mAUC 为 95.33%,比 DFF-Adapter 的 94.86% 高 0.47 个百分点。其中 MFFI 达到 90.92%,比该项次优结果高 2.61 个百分点;不过,在 CDF 和 FF++ 上,DFF-Adapter 仍然更高。
更关键的是未见公共数据域上的表现,下面的结果同时列出了三个留出数据集和 DF40-Test 的四类伪造。
UCF-Net 的跨域 mAUC 达到 92.15%,比 DFF-Adapter 的 89.20% 高 2.95 个百分点,并在七个测试项中的六项取得最高 AUC。DF40-Test 的人脸重演和人脸编辑分别达到 93.38% 与 98.52%。这说明提升覆盖了多种伪造类型,但 UADFV 上仍由 DFF-Adapter 领先。
新生成器仍然困难,少量样本可以帮助适配
面对独立的近期生成器集合,论文分别测试了零样本迁移和少样本微调。N-shot 设置为每个生成器使用 N 张生成脸,并配入等量真实图像;评测使用未参与适配的生成脸,以及从原测试划分中按数据集平衡抽取的 8,807 张真实图像。因此,“5-shot”并不是总共只使用五张训练图片。
UCF-Net 的零样本 AUC 为 40.90%,低于该表中 SPSL 的 60.02%,说明预训练表示融合尚未解决近期生成器上的直接迁移问题。加入每个生成器五张伪造图像及等量真实图像后,AUC 提升至 91.36%;50-shot 与 100-shot 分别达到 98.24% 和 98.81%,均为对应少样本设置中的最高值。
这些结果支持 UCF-Net 利用有限目标域监督进行适配的能力。对于实际应用,新增生成来源仍需要单独评估,不能将少样本微调后的分数作为开箱即用的检测效果。
收益来自互补表示,也来自融合方式
作者进一步在同一跨域协议下改变编码器组合、层级聚合、融合策略和 LoRA rank,以区分各项设计的作用。
在编码器消融中,CLIP 与 DINO 的组合取得 92.15% mAUC,高于双 CLIP 的 87.97% 和双 DINO 的 86.94%。结果支持不同预训练目标之间的互补性,而不只是增加编码器数量。
移除 LEA 后,mAUC 从 92.15% 降至 91.85%;将 UAF 换成固定等权平均,则降至 90.12%。UAF 仅增加约 0.004M 可训练参数,在这组对比中也优于参数更多的拼接与交叉注意力方案。LoRA rank 增大时性能并未单调提高,测试配置中以 rank 4 最佳。
结语
UCF-Net 展示了一条利用互补预训练表示改善鉴伪泛化的路径:先让每个编码器汇聚适合当前图像的层级线索,再根据特征响应调整两路信息的贡献。公共跨域测试与近期生成器适配的不同表现,也提醒我们把“能够迁移”和“能够快速适配”分开评估。
这一设计仍有推理成本。虽然可训练参数仅约 2.65M,两套骨干同时参与前向计算,使推理参数达到约 610.20M,计算量为 163.72G FLOPs,均为论文效率对比表中的最高值。如何在保留互补信息的同时降低双编码器开销,以及改善近期生成器上的零样本检测,是后续值得继续研究的问题。