上海AI Lab:画面和声音都对了,为什么还是对不上?AV-GRPO 让音视频生成更同步
原创 52CV 2026-09-27 23:29 江苏
一场大火,画面里火焰猛烈蹿起,声音却没有在关键时刻跟上;一位小提琴手正在演奏,旋律与画面中的动作却未必合拍。联合音视频生成要做好两件事:各自生成得好,也要在同一个事件上配合得好。
针对这一难题,我们提出 AV-GRPO:一种用于联合音视频扩散模型后训练的模态锚定强化学习方法。同时,我们构建了五维解耦的训练提示集 5DAV,让模型可以在可控的音画事件上学习。
图 1|四组音画生成案例。每组上方的画面与波形来自原始 LTX-2.3,下方来自 AV-GRPO(全参数微调)。提示词中的加粗部分标出了尤其需要音画同步的事件。静态图展示关键帧与音频波形;完整视听效果可在文末项目仓库查看。
联合训练,难在“谁该为结果负责”
如果把视频质量、音频质量和音画同步的奖励直接混在一起,模型虽然得到一个分数,却很难判断分数变化究竟来自画面、声音,还是两者的配合。更棘手的是,同一组候选样本若搭配不同的另一模态,音画同步的比较条件也随之改变:一次不理想的同步,未必全是当前要优化的模态造成的。
与此同时,音频和视频分支的生成尺度、奖励敏感度与训练动态并不相同。始终同时更新两个分支,会增加显存开销,也让针对性的优化变得困难。
AV-GRPO:先固定一个模态,再优化另一个
核心思路是模态锚定。训练视频分支时,先固定一条完整的音频生成轨迹,让一组候选视频与同一段音频配对、接受比较;训练音频分支时,则固定视频轨迹,以同一段视频比较候选音频。随后交替更新两个分支,让二者都能受益于对方提供的稳定参照。
图 2|AV-GRPO 训练框架:音频锚定时优化视频,视频锚定时优化音频;两种阶段交替进行。
这一设计对应三个具体改进:
比较更公平。 同组候选共享同一个锚定模态,奖励差异更集中地反映目标模态的变化,也更容易衡量音画配合。
训练更聚焦。 锚定模态的轨迹被锁定,其分支在当前阶段冻结;只对目标分支求梯度,减少联合更新的显存负担。
调节更灵活。 音频和视频分别采用适合自身动态的奖励组合、扰动强度与目标权重,避免一套设置强行套在两种模态上。
这里的“交替”发生在后训练阶段:它是一种优化策略,并不意味着用户生成一条视频时还要手动切换模型。
5DAV:把“需要同步”拆解为可训练的场景
为了让训练覆盖不同类型的音画关系,5DAV 从语义层级、声音来源、同步难度、时间复杂度、指令粒度五个维度组织提示词。比如,“有溪流声”与“角色跳入水中的瞬间发出叫声”,对同步的要求显然不同;单个事件与连续事件,也考验模型不同的时序能力。
这五个维度组合成 288 类场景,每类 20 条提示词,共 5,760 条训练提示词。这样的设计让训练样本的能力覆盖和难度变化都更容易控制。
效果如何?看质量,也看音画是否合拍
以 LTX-2.3(22B) 为基础模型,论文在 JavisBench 和 VABench 上比较了原模型、GDPO,以及 AV-GRPO 的 LoRA 和全参数微调版本。下面选取全参数版本相对原模型的几项代表性结果:
指标
LTX-2.3
AV-GRPO(full)
JavisBench 音频质量 AQ ↑
5.097
JavisBench 文本—音频对齐 CLAP ↑
0.408
JavisBench 音画错位 DeSync ↓
0.757
VABench 唇音同步 Lip Sync ↑
1.351
其中 ↑ 表示越高越好,↓ 表示越低越好。相较 GDPO,全参数 AV-GRPO 的 JavisBench DeSync 也从 0.708 降至 0.607。整体提升覆盖质量、语义对齐与同步,但并非每项指标都单调变好;不同微调方式仍有各自的取舍。
图 3|论文中的三组消融分析:5DAV 与 VGGSound 数据对比、关键设计移除,以及不同交替更新间隔。建议点开大图查看具体指标。
消融实验进一步检验了数据设计和训练策略的作用。论文还报告:在单机 8 张 NVIDIA A800 80GB GPU 上,对 22B 参数的 LTX-2.3 进行了全参数后训练。这表明“冻结锚定分支、交替优化目标分支”不仅服务于奖励归因,也有实际的训练资源意义。
一句话概括: AV-GRPO 让音频和视频在训练时轮流充当彼此的参照,把难以归因的联合优化拆成更可控的条件优化;5DAV 则提供了从简单到复杂的音画同步训练场景。
论文题目:AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
代码、数据与视频对比:https://github.com/zhiyuxu03/AV-GRPO
论文作者:Zhiyu Xu(1、2)、Weilong Yan(3)、Yufei Shi(4)、Shiyang Li(5)、Yihao Liu(1)、Kin-Man Lam(2,通讯作者)、Yuewen Cao(1,通讯作者)。作者单位:(1)上海人工智能实验室;(2)香港理工大学;(3)新加坡国立大学;(4)南洋理工大学;(5)浙江大学。