生成式视频压缩新进展:清华&哈工大等发布VoRTeC,单步解码实现480p@32FPS实时生成式视频压缩

原创 CV君 2026-09-28 23:18 江苏

破解视频生成压缩延迟

在生成式视频压缩领域,速度与画质的矛盾同样犹如一道难以逾越的天堑:采用 2D 图像扩散先验逐帧修复,高频纹理在帧间不断漂移,极易造成剧烈的“频闪”;而引入 Wan2.1 等十亿级参数的视频原生大底座虽能稳住时序,动辄 5 步以上的迭代去噪却令解码帧率跌至 1 FPS 以下,空有画质却成了“幻灯片”。

针对这一长期困扰业界的“速度-时序两难困境”,来自清华大学深圳国际研究生院、哈尔滨工业大学(深圳)与北京大学的联合研究团队打破常规,提出了全新单步流匹配框架 VoRTeC。该方法巧妙将有损压缩隐码映射为流轨迹瞬态,无需访问基座模型梯度,仅凭单步前向推断即可完成高保真去噪。

实测数据极为亮眼:VoRTeC 在 480p 分辨率下斩获了 32.31 FPS 的全实时解码吞吐,解码速度较此前扩散视频压缩方案实现 3 至 197 倍的跨越式暴涨(1080p 单帧仅耗时 0.25 秒);在超低码率下更实现了 58.12% ~ 73.25% 的 LPIPS 感知 BD-rate 节省。

图注:超低码率下 VoRTeC 重构效果与 H.264 解码对比(来自官方项目页演示,GIF压缩存在画质改变)

背景与动机:生成式视频压缩的「速度-时序」困境

视频压缩的本质是在传输比特率  与重构失真  之间寻求最优权衡。随着 Blau 和 Michaeli 提出率-失真-感知(Rate-Distortion-Perception, R-D-P)理论,生成式压缩允许通过引入真实数据分布先验来换取极高的主观感知质量(如降低 LPIPS、DISTS、FID 指标):

将该范式由静态图像拓展至视频时,工程落地遇到了两道关键障碍:

  1. 时序连贯性缺失:GLC-Video、DiffVC 等早期方案将预训练图像扩散模型挂载至帧级重建管线。由于缺少沿时间轴的全局动态约束,重建图像单帧虽然清晰,但在连续播放时高频纹理会在相邻帧之间随机漂移,带来感知闪烁。

  2. 基座视频流模型的高采样延迟:引入原生时空建模能力更强的视频基座模型(如拥有十亿级参数的 Wan2.1)是解决闪烁的自然路径(如 GNVC-VD、Free-GVC 等探索)。但整流流(Rectified Flow)的多步常微分方程(ODE)求解过程计算代价过大,在 480p 分辨率下往往需要 5 步以上的迭代去噪,解码速度甚至不足 0.5 FPS,与实际通信的实时性要求脱节。

研究团队的核心思考在于:能否完全将超大参数量的视频基座流匹配模型当作一个“黑盒”单步先验,既不破坏其原本学到的强劲时空动力学分布,又避免沉重的多步迭代和微调计算?

图 1:率-感知性能、解码吞吐与定性重建对比
图 1:率-感知性能、解码吞吐与定性重建对比

方法详解:单步轨迹映射与非对称跨粒度先验对齐

VoRTeC 的整体架构如图 2 所示,整个工作流由 3D 因果时空分析编解码器、流状态估计器(Flow-State Estimation, FSE)、冻结的 Wan2.1 FlowDiT 单步去噪器、流先验多尺度融合模块(Flow Prior Multi-Fusion, FPMF)以及跨组通信缓存机制(Contact Group to Group, CGG)构成。

图 2:VoRTeC 整体系统架构管线
图 2:VoRTeC 整体系统架构管线

1. 流状态轨迹映射(FSE):确定单步去噪的最佳时间步

在传统的流匹配训练中,模型学习的是从标准高斯噪声分布向真实数据分布转移的连续速度场:

在输入一组视频帧  后,3D 分析编码器  通过因果卷积将其映射为时空隐码 。经过熵编码与反量化后,解码端获得的重构压缩隐码为 。

由于压缩噪声的存在, 偏离了真实的未压缩状态 。VoRTeC 将  假设为以  为均值的高斯退化状态:。而在流匹配模型定义的轨迹分布上,任意时刻  处的分布为 。

为了以最契合的姿态接入预训练流底座,团队借助 Wasserstein 距离 求解从压缩隐码到流轨迹的最短投影步长 :

在实际传输中,发射端只需根据量化前后残差估计出方差 ,计算  并将其缩放取整为标量整数 。传输该标量所需比特几乎忽略不计。

接收端获得  后,无需进行多步 ODE 数值积分,直接调用冻结的 FlowDiT 运行单步去噪推理:

图 4:(a) FPMF 模块中的交叉注意力图可视化;(b) 不同流时间状态去噪效果可视化
图 4:(a) FPMF 模块中的交叉注意力图可视化;(b) 不同流时间状态去噪效果可视化

如图 4(b) 所示,流状态估计器避免了硬编码步长导致的去噪过度平滑或去噪不足问题,使模型能够精准捕获流先验的动态演化。

2. 流先验多尺度融合(FPMF):粗细粒度非对称特征对齐

单步流去噪生成的特征  虽然富含高频细节,但由于没有基座梯度回传给分析编码器,依然存在先验冗余与轻微的分布偏差。为此,VoRTeC 设计了轻量级的 Transformer 融合网络 FPMF。

图 3:流先验多尺度融合模块(FPMF)结构示意图
图 3:流先验多尺度融合模块(FPMF)结构示意图

FPMF 采用了差异化的 Patch 切分策略(Non-symmetric Patchify):

  • 高频先验细粒度切分:将当前组的流去噪特征  以及前一组缓存的先验特征拼接,采用极小尺寸的小 Patch(如 )打散,确保自注意力层能敏锐捕捉微观纹理细节。

  • 低频压缩隐码粗粒度切分:由于量化失真, 中的微观细节不可信,但大尺度轮廓和全局结构得以保留。因此采用较大尺寸的 Patch(如 )进行粗粒度表征。

如图 4(a) 注意力热图所示,若对粗糙压缩隐码使用过细的 Patch,注意力机制容易在噪声区域漫无目的地发散;而粗粒度 Patch 能够引导注意力高度聚焦于物体轮廓和主体结构,从而指导 Cross-Fusion Transformer 稳健地将高频先验填充至正确的几何骨架上。

3. 跨组通信缓存机制(CGG):打破组间闪烁

为了兼顾长视频处理的灵活性并控制显存,视频流通常被划分为连续的关键组(I-Group)与预测组(P-Group)。针对因组间独立处理而引发的周期性阶跃突变,VoRTeC 设计了尾帧复用与先验上下文级联缓存机制:

  • I-Group 经过 3D 解码后的最后一帧画面被放入 Frame Cache,直接用作后续 P-Group 的第一帧画面;其对应的隐层表征存入 Latent Cache。

  • 在处理 P-Group 时,无需对首帧重新编码传输,直接利用缓存隐码替换生成上下文。

  • 同时,前序组的融合特征通过 Prior Cache 流入当前组的 FPMF 模块,提供跨越时域组的长程时序引导()。

该设计不仅实现了训练无感的免传输首帧复用,进一步降低了实际比特开销,还从根源上消除了组边界处的跳跃闪烁。

实验评估:性能指标与解码实时性实测

在测试配置上,论文选用了 UVG、HEVC Class B/C 以及 MCL-JCV 等主流高分辨率视频测试基准,涵盖 480p、720p 与 1080p 序列,对比了传统标准 VTM-17.0 (H.266/VVC)、神经压缩代表方案 DCVC 系列(DCVC-DC, DCVC-FM, DCVC-RT, SEVC),以及代表性生成式视频压缩模型 GLC-Video、PLVC、DiffVC、S2VC、GNVC-VD 和 FreeGVC。

1. 率-感知曲线与主观质量对比

图 5:在 HEVC Class B 与 UVG 数据集上的率-失真与率-感知曲线
图 5:在 HEVC Class B 与 UVG 数据集上的率-失真与率-感知曲线
图 7:各方法视觉重建细节定性对比
图 7:各方法视觉重建细节定性对比

在超低码率区间(< 0.03 bpp),MSE 优化的基准方案普遍表现出严重的色块与面部模糊(见图 7)。而 VoRTeC 在 LPIPS、DISTS、FID 等感知维度展现出明显的优势。

根据表 3(Table 3)的 BD-rate 综合核算:

  • 相较于此前的扩散视频压缩基线,VoRTeC 在感知指标 LPIPS 上实现了 58.12% ~ 73.25% 的码率节省。

  • 在此基础上,研究人员进一步尝试在 Wan2.1 的注意力层附加 Rank=8 的轻量 LoRA 微调(命名为 )。微调过程仅增加约 10M 参数量,在不降低推理速度的前提下,进一步实现了 20%~30% 的感知指标增益。在 UVG 720p 基准上, 相比基础版又进一步节约了 30.44% 的 LPIPS-VGG 与 45.32% 的 FID 码率开销。

  • 在时序稳定性方面,如图 6 所示,VoRTeC 在光流翘曲感知误差(FloLPIPS)和重投影误差()指标上均保持最低水平,验证了其优秀的抗频闪能力。

图 6:帧间一致性验证实验:(a) FloLPIPS 曲线;(b) $E_{warp}$ 翘曲误差散点
图 6:帧间一致性验证实验:(a) FloLPIPS 曲线;(b)  翘曲误差散点

2. 硬件吞吐量与实时解码评估

生成式视频编码常被诟病难以商用,核心瓶颈在于多步去噪带来的数十秒延迟。论文在单张硬件平台上系统实测了完整的端到端吞吐表现(见表 1):

表 1:单张 A800 GPU 上的编码与解码吞吐量(FPS)以及模块消融结果
表 1:单张 A800 GPU 上的编码与解码吞吐量(FPS)以及模块消融结果

得益于单步去噪策略,VoRTeC 的解码速度相比现存扩散式编码方案提升了  至 :

  • 在 832×480 (480p) 分辨率下,VoRTeC 实现了 32.31 FPS 的实时解码吞吐,编码速度亦达到 20.34 FPS,解码速率远超同分辨率下基线模型 GNVC-VD(< 7.75 FPS)和 FreeGVC(~1.25 FPS)。

  • 在 1280×720 (720p) 分辨率下,解码吞吐达到 12.60 FPS。

  • 在 1920×1080 (1080p) 分辨率下,解码帧率为 3.93 FPS(单帧耗时仅约 0.25 秒),对比同样采用 Wan2.1 底座的 GNVC-VD(0.64 FPS)实现约 6.1 倍 的显著提速,对比 DiffVC(0.02 FPS)提速更达两个数量级以上。

由于其模块化解耦架构,主干流模型权重在基础版本中完全冻结,该系统的训练显存开销非常克制,在单张 NVIDIA A6000 GPU (48GB) 上即可顺利完成两阶段的端到端联合训练。

更多对比展示

图注:超低码率下 VoRTeC 重构效果与 H.264 解码对比(来自官方项目页演示,GIF压缩存在画质改变)

图注:超低码率下 VoRTeC 重构效果与 Original 对比(来自官方项目页演示,GIF压缩存在画质改变)

写在最后

VoRTeC 为生成式视频编码的工程化提供了一条颇具启发性的解决思路:以往将扩散或流匹配模型引入编码器时,学术界往往习惯于将其当做多步采样的生成引擎,从而背上了沉重的采样延迟包袱。而该工作通过巧妙的隐空间 Wasserstein 距离时间投影,将有损压缩表征重新定义为连续速度场轨迹中的瞬态点,配合非对称的 Patch 粗细粒度特征对齐,真正将十亿级视频基座模型的时空先验“驯服”到了单次前向推理中。

目前,VoRTeC 在 1080p 下的吞吐率(近 4 FPS)虽已远超同类生成式方案,但距离全分辨率下的 30+ FPS 工业级实时标准仍有进一步优化空间。未来若能结合算子级 Kernel 优化、8-bit/4-bit 权重量化以及针对 DiT 稀疏注意力的剪枝加速,单步生成式视频流媒体在低带宽弱网通信、超低码率卫星图传等垂直场景下的落地步伐,有望大幅加快。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向
入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向

跳转微信打开