从Detection到Understanding:基础模型驱动的视频异常理解研究综述
原创 52CV 2026-09-12 15:28 江苏
近日,西北工业大学与新加坡管理大学研究团队合作完成的综述论文 “A Survey on Foundation Model-Driven Video Anomaly Understanding” 被SCI一区Top期刊 Pattern Recognition 正式录用。
该论文系统梳理了基础模型驱动的视频异常理解(Video Anomaly Understanding, VAU)研究进展,提出统一的 “异常感知—异常认知” 分类框架,深入分析基础模型如何推动视频异常分析从传统的异常检测,逐步迈向具有语义解释、逻辑推理与因果分析能力的异常理解。
论文题目: A Survey on Foundation Model-Driven Video Anomaly Understanding
作者: Wanshun Su, Ke Tang, Dingyi Liu, Peng Wu, Qingsen Yan, Guansong Pang
作者单位: 西北工业大学、新加坡管理大学
论文链接:https://papers.ssrn.com/sol3/papers.cfm?abstract_id=7021130
一、研究脉络:从视频异常检测到视频异常理解
在本项工作之前,团队已围绕视频异常检测(Video Anomaly Detection,VAD)领域开展了系统性梳理,并在 IEEE Transactions on Neural Networks and Learning Systems(TNNLS) 发表综述论文 “Deep Learning for Video Anomaly Detection: A Review”。
论文题目: Deep Learning for Video Anomaly Detection: A Review
发表期刊: IEEE Transactions on Neural Networks and Learning Systems
该综述立足于深度学习时代的视频异常检测(Video Anomaly Detection,VAD),系统总结了以下五类任务范式:半监督视频异常检测;弱监督视频异常检测;全监督视频异常检测;无监督视频异常检测;开放集监督视频异常检测。
围绕不同监督条件,该工作进一步从模型输入、网络架构、核心方法、模型优化和输出形式等多个维度构建了系统化分类体系,并全面梳理了相关数据集、评价指标、开源代码及性能对比。
这项工作主要回答的是视频异常分析中的一个基础问题:如何从视频中准确发现和定位异常?
然而,传统视频异常检测方法通常将最终结果表示为一个异常分数。模型能够判断某个视频片段“可能存在异常”,却难以进一步回答:
视频中具体发生了什么?
为什么这一事件属于异常?
异常涉及哪些人物、物体和行为?
异常是如何产生并逐步演化的?
模型的判断依据来自哪些视频证据?
随着大语言模型和多模态大模型的发展,视频异常分析的研究目标开始发生变化。模型不再只需要判断一个片段是否异常,还应当结合视觉证据、上下文信息和世界知识,对异常事件进行描述、解释、定位乃至因果推理。
基于这一研究趋势,团队进一步将关注重点从VAD拓展至VAU,并完成综述论文“A Survey on Foundation Model-Driven Video Anomaly Understanding”。
前后两项综述共同呈现了视频异常分析领域的一条完整演进路径:
从深度学习驱动的视频异常检测,到基础模型驱动的视频异常理解;
从判断“是否异常”,到解释“发生了什么”以及“为什么异常”;
从Detection,进一步走向Understanding。
研究阶段
视频异常检测(VAD)
视频异常理解(VAU)
核心问题
是否发生异常、异常发生在哪里
发生了什么、为什么属于异常
主要依据
视觉特征与统计偏差
视觉证据、语言语义与世界知识
典型输出
异常分数、异常区间
异常分数、时间定位、语义解释与因果推理
主要能力
检测与定位
感知、推理与解释
技术演进
Deep Learning
Foundation Models
这不仅是模型规模和技术架构的变化,更代表着视频异常分析研究目标的进一步升级。
二、为什么需要“视频异常理解”?
视频异常分析广泛应用于公共安全、工业监控和自动驾驶等场景。其核心目标,是从复杂、开放且持续变化的视频环境中,识别并理解偏离正常行为或状态的异常事件。
需要特别指出的是,“异常”并不存在一个适用于所有场景的固定定义。同一个行为在不同时间、地点和任务背景下,可能具有完全不同的含义。
例如,一个人在道路上奔跑通常是正常行为,但如果这一行为发生在禁止进入的工业区域,则可能被视为异常。因此,视频异常本质上是一种对上下文正常模式的偏离。
传统视频异常检测方法虽然可以回答“是否发生了异常”以及“异常发生在什么时间”,但通常只能输出一个异常分数,难以提供更加深入的语义和因果解释。
随着基础模型的快速发展,模型不仅可以提取视觉特征,还能够利用语言知识、世界知识和逻辑推理能力解释视频内容。视频异常分析也因此开始从 “检测异常” 迈向 “理解异常”。
三、从异常检测到异常理解
论文指出,基础模型为视频异常分析带来了两个层面的能力提升。
第一个层面是异常感知(Anomaly Perception),即利用基础模型丰富的视觉表征和视觉—语言对齐能力,从视频中发现并定位潜在的异常线索。
第二个层面是异常认知(Anomaly Cognition),即在异常感知的基础上,进一步借助大语言模型和多模态大模型的世界知识、逻辑推理及生成能力,对异常事件进行语义解释、因果分析和时间定位。
二者分别对应两个逐步深入的问题:
异常感知关注“哪里发生了异常”;
异常认知进一步回答“发生了什么,以及为什么异常”。
基于这一认识,论文提出统一的 “异常感知—异常认知”分类框架,对基础模型驱动的视频异常理解方法进行了系统梳理。
四、异常感知:借助基础模型更准确地发现异常
异常感知是后续语义推理和逻辑判断的基础。如果模型无法准确识别视频中的人物、物体、动作及其时空关系,后续生成的解释便可能缺少可靠的视觉依据。
论文将现有异常感知方法划分为以下三类。
1.表征学习
表征学习方法主要利用CLIP等基础模型提取视觉特征,并通过时序建模模块,将面向图像预训练的静态表征适配到视频异常检测任务。
例如,部分方法在CLIP特征之上引入时序自注意力、多尺度时序建模或不确定性估计,以捕捉持续时间不同的异常事件,并降低冗余背景对异常特征的干扰。
这类方法能够有效增强视频表征,但通常只使用基础模型的视觉编码器,没有充分利用文本信息和视觉—语言对齐能力。因此,它们往往仍停留在粗粒度的正常—异常判断层面。
2.视觉—语言对齐
视觉—语言对齐方法通过文本提示描述正常行为和异常行为,再将视频内容与相关文本概念映射到统一的语义空间。
与只学习视觉特征的方法相比,这类方法能够借助语言提供更加明确的语义指导。例如,模型不仅可以判断某个片段是否异常,还可以将其与“打架”“盗窃”“交通事故”等具体异常概念进行匹配。
现有研究进一步探索了以下技术:可学习提示;类别感知文本;时空提示;局部区域对齐;场景语义解耦;音视频协同建模。
这些研究推动异常感知从简单的特征分类走向更加细粒度的语义匹配。
3.泛化适配
真实世界中的异常事件具有明显的开放性和长尾特征。训练过程中不可能覆盖所有异常类别,因此,如何识别训练阶段从未见过的异常,是视频异常理解面临的重要问题。
泛化适配方法通常采用“先定位、后分类”的思路:利用类别无关的检测分支,找出偏离正常模式的可疑片段;通过文本语义匹配,进一步判断异常事件的具体类别。
这种方式降低了模型对预定义异常类别的依赖,使其能够处理开放集和开放词汇场景。
不过,目前模型对未知异常的识别能力与闭集条件下的表现仍存在差距,开放世界异常理解远未得到彻底解决。
总体而言,基础模型显著提升了异常检测的语义建模能力与跨场景泛化能力,但异常感知仍然主要输出标量分数。异常信息通常隐式存在于特征空间中,模型依然难以明确解释异常事件的具体内容及其产生原因。
五、异常认知:让模型解释“发生了什么”和“为什么异常”
为突破分数式检测的局限,异常认知进一步将视频异常分析转化为多维度语义理解问题。
论文将一个具有代表性的异常认知系统输出概括为三个部分:
异常分数: 判断视频片段的异常程度;
语言解释: 描述异常事件的内容及其因果逻辑;
时间定位: 将生成的语义解释对应到具体的视频区间。
在这一层面,现有研究主要从逻辑推理和辅助生成两个方向展开。
1.逻辑推理
逻辑推理方法尝试将基础模型的一般推理能力迁移到异常事件理解中,主要包括以下三种技术路线。
(1)显式分解推理
此类方法将复杂的异常理解任务拆分为检测、定位、描述和解释等多个步骤,或者按照视频帧、事件单元和层次化结构逐步推理。
通过显式展示中间过程,模型的判断结果更加透明,也更容易进行验证。
(2)外部知识扩展
由于冻结的基础模型可能不了解特定场景中的正常规则,一些研究通过检索增强生成、领域规则、历史记忆和知识图谱,引入场景相关知识。
例如,模型可以先检索某一工业区域的操作规范,再判断视频中的行为是否违反相关规则。近期研究还开始利用时空关系和因果图,追踪异常事件的发展过程。
(3)动态强化优化
相关方法利用强化学习或偏好学习,对模型的中间推理过程进行优化,使模型能够围绕以下问题生成更加完整、连贯的异常解释:发生了什么?何时发生?发生在哪里?如何发生?为什么属于异常?
研究结果表明,逻辑推理不仅能够提高模型的可解释性,也可以反过来提升异常检测的准确率。
这说明异常检测不一定只能依赖统计模式识别,也可以通过结合视觉证据和世界知识,以更加接近人类判断的方式完成。
2.辅助生成
生成能力并不只是最终输出文本,还可以从多个角度辅助异常理解。论文将其总结为三个方面。
(1)视觉样本合成
现实中的异常事件稀少、分布长尾且采集成本较高。因此,一些研究利用视频生成模型合成异常样本,用于模型训练或评测数据构建。
(2)完整叙事外显
基础模型可以将视频中的人物、行为、事件发展和上下文关系转化为结构化文本,使原本隐含在视觉特征中的信息以自然语言形式呈现,为后续推理提供语义中间表示。
(3)生成式优化指导
经过人工检查和修正的视频描述、问答数据及推理链,可以作为监督信号,对多模态大模型进行微调或强化学习训练,从而提升模型理解复杂异常事件的能力。
不过,异常认知方法通常依赖大规模基础模型、多阶段推理以及反复生成与验证,其计算开销和推理时延明显高于传统异常检测方法。
如何在认知深度、检测效率与部署成本之间取得平衡,仍是一个尚未得到充分研究的问题。
六、数据集与评测:不仅要测“检没检测到”,还要测“是否真正理解”
伴随研究目标的变化,视频异常数据集和评测指标也在持续演进。
传统数据集,如UCF-Crime、XD-Violence、ShanghaiTech和UBnormal,主要提供视频级标签或时间标注,用于评价模型是否检测到异常,以及能否定位异常片段。
近年来出现的CUVA、HAWK、VAU-Bench、Vad-Reasoning和CUEBENCH等数据集,则进一步加入了以下任务:异常描述;异常推理;视频问答;时间定位;异常预测;异常检索。
这使得评测目标逐渐从“是否检测到异常”扩展至“是否真正理解异常”。
相应地,评价指标也从 AUC 和 AP 等检测指标,扩展到三个维度:
评价维度
代表性指标
异常检测能力
AUC、AP
语义理解能力
BLEU、ROUGE、METEOR、大模型评测
时间定位能力
mIoU、R@0.3、R@0.5
然而,现有指标分别关注异常理解的某一局部能力:
AUC和AP无法衡量语义解释能力;
文本相似度指标难以准确评价复杂推理;
大模型评测可能存在评价偏差;
时间交并比无法判断模型给出的语义解释是否正确。
此外,许多现有VAU数据集仍是在传统异常检测数据集上增加文本描述或问答标注,本质上更接近“附加语义信息的检测数据集”,而非从一开始便面向异常理解设计的原生数据集。
因此,建立统一、全面且可靠的视频异常理解评测体系,仍然是该领域发展的关键基础。
七、未来值得关注的五个研究方向
在系统梳理现有研究的基础上,论文进一步总结了基础模型驱动的视频异常理解所面临的五项关键挑战。
1.快慢协同的视频异常理解
轻量模型适合持续、高效地检测异常,但缺少深入的解释能力;大模型具备更强的语义理解和推理能力,却难以对所有视频片段进行实时处理。
未来可以构建“快速感知+按需认知”的协同系统:由轻量模型持续筛选潜在异常事件,仅在需要深入分析时调用更强大的基础模型,实现效率与认知深度之间的平衡。
2.长视频异常理解
现实中的异常事件往往非常稀疏,并隐藏在数小时甚至更长的视频中。
某些行为单独来看并无异常,只有结合更早发生的事件、物体状态和行为演化过程,才能作出正确判断。
未来模型需要具备更加有效的长时记忆与上下文选择能力,在控制计算成本的同时,保留真正与异常判断相关的历史信息。
3.合成视频辅助异常理解
视频生成模型可以缓解异常数据稀缺问题,但现有方法通常只能生成以异常行为为主体的短视频,容易出现动作不合理、物体状态不一致和事件逻辑断裂等问题。
未来研究需要从孤立的异常片段生成,走向具有完整上下文的长视频生成,建模“正常状态→异常发生→后续影响”。
同时,还需要建立专门的评价标准,衡量合成视频的真实性、异常有效性与实际训练价值。
4.可部署的多视角异常理解
现实场景通常包含多个摄像头。同一事件可能跨越不同视角,任何单一画面都无法完整呈现异常过程。
未来需要研究跨视角事件对应、时间同步、语义聚合和冲突消解机制,并构建面向真实部署环境的多视角视频异常理解数据集。
5.统一的数据集与评价体系
现有方法使用的数据集、任务定义和评价指标差异较大,导致不同研究之间难以进行公平比较。
未来需要建立专门面向VAU的大规模数据集,以及能够联合评价异常检测、时间定位、语义描述和逻辑推理能力的统一协议,从而推动研究从“面向检测指标优化”真正走向“面向异常认知能力提升”。
八、总结
基础模型正在重新定义视频异常分析的研究边界。
过去,研究主要关注如何从视频中发现偏离正常分布的片段;如今,随着视觉—语言预训练、大语言模型和多模态大模型的发展,模型开始进一步解释异常事件的内容、原因及其演化过程。
本文提出的“异常感知—异常认知”框架,为理解这一研究范式的转变提供了清晰视角:异常感知让模型“看见异常”,异常认知则让模型真正“读懂异常”。
从表征学习、视觉—语言对齐和开放世界泛化,到逻辑推理、外部知识增强、强化学习与辅助生成,视频异常理解正在逐渐形成一个融合视觉感知、语言建模、世界知识和因果推理的综合研究方向。
未来,如何让系统在长视频、开放环境和多视角场景中,以更低的计算成本完成可靠、可解释且可验证的异常理解,将成为该领域迈向真实应用的关键。