清华&生数科技发布Vidu S2:实时720p交互数字人与流式视频编辑双突破

原创 CV君 2026-09-19 23:46 江苏

流式视频迈入空间时代

“千呼万唤始出来,犹抱琵琶半遮面”——这句诗恰如其分地道尽了当下视频生成大模型的现实痛点:用户输入提示词后,往往需要经历数分钟乃至数十分钟的漫长等待,最终只能被动接收一段无法即时干预的成品,与即时通讯、直播互动、游戏娱乐所需要的“即时交互反馈”相距甚远。

为了打破这一困境,清华大学与生数科技联合发布了全新一代实时流式视频生成系统 Vidu S2。该系统在常规硬件上实现了 720p 画质下 25~42 FPS 的极速响应,由两大核心模型协同驱动:

  • Vidu S2-Avatar:实时交互数字人模型,突破传统固定参考图限制,支持中途动态注入道具或服装,并能轻松驾驭大幅度独舞等复杂肢体动作,在 StreamAV-Bench 基准中斩获全部 9 项指标第一,双盲评测中面对 Runway 取得 85.7% 胜率,面对 HeyGen 和 PixVerse 更是斩获 100% 碾压级胜率;

  • Vidu S2-Editing:流式视频编辑模型,开创性引入帧对齐注意力,实现对外部视频流毫秒级的风格迁移、虚拟试衣与主背景替换,并可直接扩展输出左右眼同步的 3D 空间立体视频,直连 VR 头显。

告别“被动等待”,从单向渲染迈入“言出法随”的实时交互时代。

Vidu S2 系统总览
Vidu S2 系统总览

背景与动机:为什么必须转向实时流式生成?

从供需模型的本质出发,离线视频由于具备可多次回放与社交分发的属性,其生成需求规模受限于人均单次观看量;而实时交互性视觉内容(如面对面虚拟陪伴、数字人直播、即时换装)属于消耗性与即时响应的单播体验。论文推导指出,在假定基础需求系数相当的情况下,实时交互视频生成的工业落地需求体量将在规模上远超离线生成。

然而,上一代流式模型 Vidu S1 仍存在数项瓶颈:生成分辨率受限于 540p;人物身份参考图在流式会话开启后完全固化;生成范围集中于微动作的大头照或播报场景,面对大幅度全身动作(如跳舞)极易失控;且完全无法接收外部正在传输的视频流进行在线重绘。

构建一个鲁棒的实时交互视频系统,必须同时解决四大底层难题:

  1. 长时序误差累积与分布偏移:流式生成按分块(Chunk)逐步推进,先前后序分块的误差会迅速级联导致画面崩溃;

  2. 高画质与低延迟的算力矛盾:在消费级 GPU 上实现 720p 实时生成(>25 FPS)留给去噪步骤的计算窗口极小;

  3. 时序因果条件下的动态控制:如何在中途随意更换道具、服装或背景而不导致角色身份漂移;

  4. 视频编辑的严格动作同步:在对外部视频流进行实时重绘时,如何确保新生成帧与源输入帧保持动作节拍严格对齐。

Vidu S2-Avatar:高保真长时程交互数字人

针对数字人生成,Vidu S2-Avatar 在训练范式、分辨率增强、多模态智能体控制等方面构建了系统的解决方案。

1. 数据管线革新:高清晰度与背景稳定算子

数据准备管线总览
数据准备管线总览

如上图(左侧)所示,Vidu S2-Avatar 的数据流水线包含了五大阶段。针对大幅度肢体动作学习,团队特地引入了大量独舞视频与 2D/3D 动画数据。

  • 高清晰度视频筛选:由于网络视频压缩算法不一,名义上的 1080p 视频常伴有严重压缩伪影。系统构建了多维度混合评估机制,联合分辨率、码率、编码格式以及专家模型提取的边缘锐度、纹理细节,综合打分并剔除劣质高压缩素材。

  • 背景稳定算子:舞蹈视频常伴随运镜(如推拉摇移),若直接训练会导致流式生成时的背景崩溃。团队利用人体分割掩码将前景剥离,在背景区域提取几何特征并估计单应性变换,对相机运动进行反向几何校正,在保留丰富人体运动的同时获得了稳定的背景先验。

  • 时间稠密事件级标注:摒弃了传统的静态描述,改用时间因果密集的事件级描述(Temporally ordered dense captions),按时间顺序精确记录每一秒内的动作起止与因果变化,显著提升了模型对长序列复杂动作的响应精度。

2. 自重放强制(Self-Replay Forcing, SRF)

Vidu S2-Avatar 采用音视频联合扩散 Transformer 架构。设  为参考图像, 为文本/音频条件序列,模型因果预测目标潜在特征:

在长自回归生成中,由于模型在推理时只能依赖先前自己生成的历史块,传统的 Teacher Forcing 会因“训练见真值、推理见自身生成”而产生严重的分布偏移。尽管 Self-Forcing 尝试通过自生成历史来训练,但其将历史块完全 Detach 脱离计算图,且历史块为无噪输入,限制了梯度的长时传递效率。

为此,团队提出了 自重放强制(Self-Replay Forcing, SRF):

  1. 学生模型首先在推理模式下执行一段较长的自回归 Rollout,生成自身策略轨迹;

  2. 随后将原始轨迹的 KV Cache 与计算图 Detach 以避免显存爆炸;

  3. 截取该自生成轨迹,按照 Diffusion Forcing 原则对各分块独立加噪;

  4. 将该带噪轨迹送入单次具备梯度的因果重放通道(Gradient-enabled causal replay pass)。在此重放通道内,所有分块处于同一计算图内,后续分块的 DMD 蒸馏损失可直接回传至前序分块:

此外,系统在训练阶段引入了两阶段偏好对齐:在双向预训练阶段采用 Diffusion DPO 提升动作与面部自然度,在流式因果阶段则基于 SRF 轨迹执行流式负向感知微调(Streaming NFT),使模型在推理阶段的自回归状态下依然能够精准契合人类偏好。

3. 单步潜空间超分与非对称缓存调度

为了在保持 25~42 FPS 高吞吐的同时输出 720p 视频,系统将生成解耦为 Backbone 与单步潜空间精炼器(Super-Resolution Refiner):

  • Backbone:在低分辨率潜空间运行,负责构建宏观姿态与长程动作拓扑;

  • Refiner:单步执行潜空间空间上采样并去噪预测高分辨率潜在表征 。

更重要的是引入了非对称缓存调度(Asymmetric Cache Scheduling):Backbone 维持高噪声历史缓存 ,其对局部高频伪影不敏感,专注传递宏观时序运动;Refiner 则读取低噪声高分辨率历史缓存 (),专注保留局部五官、纹理与身份表观。

4. 软硬协同的低延迟推理引擎

为了在常规消费级 GPU 上落地,系统集成并拓展了 TurboDiffusion 与 TurboServe 的工程栈:

  • 混合注意力调度:根据不同网络层对精度的敏感程度,分层选用 SageAttention、SpargeAttention 与 Sparse-Linear Attention(SLA),非敏感层大幅削减算力开销;

  • 分块 W8A8 GEMM 量化:采用细粒度分块量化抑制离群值,在保持数值精度与生成画质的前提下显著加速线性层计算;

  • 算子融合与 CUDA Graphs:针对流式计算中固定执行序列的短算子进行 Triton 融合,并利用 CUDA Graph 回放消除了高频 Kernel 启动与 CPU-GPU 同步延迟;

  • Ulysses 上下文并行:在多 GPU 场景下利用量化通信切分激活值,实现线性扩展。

5. 多模态 Agent 闭环控制

多模态 Agent 交互系统架构
多模态 Agent 交互系统架构

为了支持交互中任意时刻的参考图注入与连续复杂指令执行,系统集成了视觉语言模型(VLM)构建的智能体系统。如上图所示,用户输入语音、文本或新增参考图后,VLM 负责拆解生成提示词并保持未修改状态的连续性;同时,VLM 持续按时序审查已生成的视频帧,判定“拿杯子”或“脱帽子”等动作是否完成,并闭环触发下一步动作描述(下图),解决了长对话流中的动作重复或中断痛点。

参考图与配饰控制样例
参考图与配饰控制样例

Vidu S2-Editing:严格帧对齐的流式视频编辑

针对外部视频流实时编辑任务,Vidu S2-Editing 提出了专用的架构设计与合成数据管线。

1. 帧对齐注意力(Frame-Aligned Attention)

在实时编辑场景中,用户对动作延迟和时钟漂移极为敏感。设源视频输入为 ,目标输出为 。Vidu S2-Editing 在 Transformer 内部施加严格的帧对齐注意力机制:

  • 生成视频的第  帧 Tokens 仅与源视频对应的第  帧 Tokens 进行交叉注意力计算;

  • 严禁目标帧跨时间步与非对应源帧发生信息混合,确保动作姿态与时间节拍的严格绝对对齐;

  • 风格或服饰参考图  则以全局方式广播给所有生成帧,以维持整段流在视觉风格上的连续性。

2. 成对数据合成与因果防泄漏 Caption

如数据管线图(Figure 2 右侧)所示,针对风格迁移任务,团队采用 NormalCrafter 提取原视频的表面法线序列,训练以表面法线和参考图为条件的视频重建模型,进而将参考图替换为 50 余种特定风格图像(如水墨工笔、赛博朋克、动漫等)生成成对训练数据。同时,编辑提示词生成时不向 VLM 提供源视频内容,仅描述编辑意图与保留约束,彻底切断了源视频信息向文本条件的泄露。

3. 模块间动态时分复用调度(Inter-Module Scheduling)

在实时编辑流水线中,VAE 编码器、Backbone、Refiner 和 VAE 解码器各司其职且呈阶段性活跃。传统静态显存分配会导致部分显卡在等待时闲置。系统采用了统一时间轴上的动态多卡调度,在 Backbone 完成计算的间隙立即将算力交由 VAE 执行编解码,极大降低了整体推理延迟。

实时空间视频生成与编辑

实时空间视频生成与编辑效果展示
实时空间视频生成与编辑效果展示

为了赋予视频生成真正的 3D 沉浸感,Vidu S2 探索了实时空间双目视频方案:

  • 空间数字人生成:由 Vidu S2-Avatar 生成单目流后,在流式流水线中串联轻量级时序一致性深度估计模型,以单目画面为中心视点向左右两侧进行水平视差几何变换(Warping),并利用轻量算子实时修补去遮挡边缘的空洞,输出同步的左右眼画面(如上图)。

  • 空间视频编辑:支持两种模式,既可先对单目流编辑再转双目,亦可直接将已有的左右眼立体视频按左右并排拼接为宽画幅,由 Vidu S2-Editing 一次性完成联合编辑并切分输出,契合 VR 头戴设备的实时透视与沉浸交互场景。

性能表现与实验验证

1. 数字人基准:StreamAV-Bench 全项登顶

在流式音视频综合基准评测 StreamAV-Bench 上,Vidu S2-Avatar 与当前最前沿的实时及离线数字人模型进行了系统对比:

StreamAV-Bench 评测结果
StreamAV-Bench 评测结果

从上表可以看出,Vidu S2-Avatar 在所有 9 项指标上全面取得 第一名(SOTA):

  • 视觉质量维度:视觉美学(VA)达 0.687,视觉质量(VQ)达 3.370,优于此前的最强模型 Live Avatar(0.661 / 3.295);

  • 音视频同步与对齐:音视频语义对齐(AVAlign)大幅提升至 0.353(此前最高为 LongLive 的 0.272),时序同步误差(AVSync)降至最低的 0.617(低于 SoulX-FlashTalk 的 0.648);

  • 长时程稳定性:主体一致性(SC)达到 0.998,背景一致性(BC)达 0.993,证明了 SRF 算法抑制漂移的能力。

2. 视频编辑公开评测:领跑离线与流式基准

Sparkle-Bench 评测结果
Sparkle-Bench 评测结果

在 Sparkle-Bench(上表)中,Vidu S2-Editing 取得了 3.74 的最高综合分(Overall),在前/背景指令遵循及运动保持上均显著优于 Decart-Lucy2.5 等流式基线与 Kiwi-Edit 5B 等离线基线。

OpenVE 与 RefVIE 联合评测结果
OpenVE 与 RefVIE 联合评测结果

在 OpenVE 与 RefVIE 联合评测(上表)中,Vidu S2-Editing 的联合总分达到 4.26,反超了 14B 参数量的最强离线大模型 Bernini-R 14B(3.92)。

ViViD 非成对虚拟试衣评测结果
ViViD 非成对虚拟试衣评测结果

在 ViViD 非成对虚拟试衣测试集(上表)中,反映视频分布与时序连贯性的综合指标 VFID(越低越好)被大幅拉低至 9.9515,相较于专用模型 CatVTON(19.5131)和 ViViD(21.8032)呈现出显著优势。

3. 长时程衰减曲线与商业闭源模型 GSB 人工盲测

不同时长下的生成质量衰减曲线
不同时长下的生成质量衰减曲线

流式生成最忌“首段惊艳、后段崩溃”。上图展示了从 10 秒延伸至 90 秒时的人工评测均分曲线。Vidu S2-Avatar 在一致性、视频质量、动作质量、表情表现力与综合质量五个维度上保持平稳高位,而基线系统则随着生成时长的增加出现了不同程度的质量下滑。

数字人场景商业系统 GSB 双盲评测结果
数字人场景商业系统 GSB 双盲评测结果

在严格的双盲 Good/Same/Bad(GSB)人工偏好评测中:

  • 数字人场景(上图):面对 Runway Character GWM-1,Vidu S2-Avatar 取得了 85.7% 的综合偏好胜率(无败局);面对 HeyGen 与 PixVerse Image Avatar,综合偏好胜率更是达到了 100.0%。

视频编辑场景商业系统 GSB 双盲评测结果
视频编辑场景商业系统 GSB 双盲评测结果
  • 视频编辑场景(上图):面对主流商业系统 Decart-Lucy2.5 和 XMax-X2.0,Vidu S2-Editing 分别获得了 72.7% 和 86.7% 的综合优势胜率。

4. 定性案例分析

数字人定性对比案例
数字人定性对比案例

在数字人定性对比(上图)中,基线系统在长时间推移下频繁出现脸部特征漂移、比例失调以及手部或化妆品道具形变扭曲;而 Vidu S2-Avatar 稳定保持了微小的眼部轮廓、发际线细节与持握道具的几何结构。

风格迁移定性对比案例
风格迁移定性对比案例
虚拟试衣定性对比案例
虚拟试衣定性对比案例
主体替换定性对比案例
主体替换定性对比案例
背景替换定性对比案例
背景替换定性对比案例

在视频编辑案例中:

  • 风格迁移(Figure 9):Vidu S2-Editing 准确赋予画面水墨或工笔画质感,同时完好保留人物与水杯的动态交互,杜绝了基准系统中常见的背景失真或人物面部被破坏问题;

  • 虚拟试衣(Figure 10):在人物拉扯衣物的复杂形变中,模型准确重塑了白色花纹衬衫与牛仔连体衣,并未像基线系统那样引入胸前乱码文字或错误添加第三人;

  • 主体与背景替换(Figure 11、12):无论是替换为动漫角色还是将卧室迁移至巴黎街头,新生成元素均与源视角的肢体运动和相机轨迹保持了严格契合。

写在最后

Vidu S2 的提出代表着视频生成技术正加速从传统的“被动批量离线渲染”跨入“实时可交互流式处理”的新发展周期。通过在训练端提出突破长程漂移的 Self-Replay Forcing,在模型端设计非对称缓存解耦超分精炼器,并在架构上实现源视频流帧对齐交互与双目立体拓扑,该系统在保证低延迟的同时,在多项公开评测基准和商业系统盲测中展现出明显优势。

对于行业而言,实时流式视频技术不仅是虚拟主播或互动娱乐的效能升级,更展现出了与空间计算、全景漫游以及未来实时渲染元宇宙场景深度融合的广阔潜力。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向
入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向

跳转微信打开