Vidu S2技术解析:实时编辑、实时交互、探索空间视频
今天,生数科技正式发布 Vidu S2。 Vidu S2 包含两个模型:Vidu S2-Avatar,面向持续交互的数字角色生成;Vidu S2-Editing,面向输入视频流的实时编辑。我们也在两个模型的基础上,探索了面向 VR 头显的实时空间视频生成与编辑。 在 Vidu S1 中,我们已经开始探索通过语音持续控制视频生成。在 Vidu S2-Avatar 中,我们希望进一步增加交互的自由度:
本文
今天,生数科技正式发布 Vidu S2。
Vidu S2 包含两个模型:Vidu S2-Avatar,面向持续交互的数字角色生成;Vidu S2-Editing,面向输入视频流的实时编辑。我们也在两个模型的基础上,探索了面向 VR 头显的实时空间视频生成与编辑。
在 Vidu S1 中,我们已经开始探索通过语音持续控制视频生成。在 Vidu S2-Avatar 中,我们希望进一步增加交互的自由度:用户可以在角色说话时递入一张新的参考图,使角色实时与参考图进行自由的交互。相较于 Vidu S1,Vidu S2-Avatar 将实时输出从 540P 提升至 720P,支持在生成过程中随时更新参考图,并增强了舞蹈等大幅度动作的指令跟随能力。在 Vidu S2-Editing 中,我们可以实时改变输入视频流的风格、服装、人物和背景。
图 1|Vidu S2 的实时互动、编辑与空间视频能力总览
Vidu S2 的全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。
Vidu S2 的模型特色
S2-Avatar:在互动中更新参考图
上传一张角色图片,即可通过文本或语音与 S2-Avatar 互动。除了说话时的表情与姿态,模型也支持跳舞等更丰富的身体动作。
动态参考图是这一代的重要变化。用户可以在视频流进行中的任意时刻,加入物品、服装或背景图片:让角色拿起图中的杯子,换上指定服装,或进入新的场景。
这类交互还涉及动作完成后的状态。例如,“拿起杯子,然后微笑”,要求角色在微笑时继续持有杯子;“摘下帽子再戴回”,则需要连贯地完成摘帽、持帽和戴回的过程。S2-Avatar 通过视觉反馈和后续提示词调整,提高连续动作与状态保持的可靠性。
图 2|物品生成与替换、场景切换、配饰摘戴的交互示意
S2-Editing:跟随输入视频,实时完成编辑
S2-Editing 接收持续输入的视频流,根据文本指令和可选参考图进行编辑。人物抬手、转身,或镜头发生移动时,编辑结果需要跟随这些变化。
目前支持四类任务。
风格迁移。根据参考图改变画面的笔触与色彩,同时保留人物轮廓、姿态和场景布局。下面展示了水彩与工笔画两组案例。
图 3|风格迁移案例。各列对应视频中不同时间点,灰底行为 S2-Editing 输出
虚拟试穿。把参考服装迁移到视频中的人物身上。在连续动作中,模型需要处理服装边界、材质纹理,以及手臂与衣服之间的遮挡关系。
图 4|白色上衣与全身牛仔套装试穿案例
人物替换。迁移参考角色的面部、发型、服装和整体外观,同时保留源视频的姿态与运动。
图 5|真人与动画角色替换案例
背景替换。根据参考图更换环境,并在人物持续运动时保持前景与背景的空间关系。论文展示了巴黎街景与机甲机库两组案例。
图 6|背景替换案例
空间视频:面向头显的进一步探索
空间视频通过略有差异的左右眼画面,让观看者感知人物与背景的距离、物体尺度和场景深度。
我们将 S2-Avatar 的实时输出接入空间视频转换流程,生成同步的左右眼视图。S2-Editing 则支持两种方式:先编辑普通单目视频,再转换为空间视频;或者直接编辑已有的空间视频。两种方式均支持上述四类编辑任务。
这些结果可以流式传输至 VR 头显,用于体验空间视频中的角色互动与画面编辑。
图 7|S2-Avatar 与 S2-Editing 的空间视频结果,每组包含左右眼视图
Vidu S2 的技术选择
实时交互对视频模型提出了几项同时发生的要求:新指令要及时生效,前后动作要连贯,人物与背景要保持稳定,计算也要跟上持续输入的视频。围绕这些要求,我们主要做了以下改进。
Self-Replay Forcing:在自身生成的历史上训练
流式视频逐段生成,前一段的小误差可能进入下一段,并逐渐累积为身份漂移、动作断裂或背景变化。
我们提出 Self-Replay Forcing(SRF):模型先按照实际推理方式生成一段较长的视频轨迹,再从自生成轨迹中采样连续片段、重新加噪,进行可传播梯度的因果重放训练。重放阶段允许后续片段的损失影响前面的片段,而不需要对原始长轨迹进行完整反向传播。
这让训练更接近实际推理时面对的历史状态,也使模型能够学习相邻片段之间的误差关系。S2-Avatar 与 S2-Editing 都采用了这一训练方法。
数据处理:兼顾动作丰富度与画面稳定性
舞蹈视频常伴随镜头运动。为了保留动作多样性,我们对符合条件、具有平滑镜头运动的素材进行背景稳定处理,再用于训练。
视频标注也改为按事件顺序描述动作、发生时间及结果,并以事件边界划分片段。这有助于模型学习动作之间的衔接,以及收到新指令后的状态变化。随后,通过偏好与奖励优化进一步改善动作自然度、表现力和指令遵循。
图 8|左侧为 Avatar 数据处理,右侧为四类编辑任务的数据构建
视觉反馈:检查动作,再调整下一步
S2-Avatar 的视觉语言模型智能体(VLM Agent)会读取用户指令与图片,生成提示词,并按时间顺序检查输出视频帧。
如果动作已经完成,后续提示词会维护完成后的姿态与物品状态;如果动作只完成了一部分,或与要求有偏差,系统会调整后续指令。判断不明确时,系统不会直接认定动作成功。这一反馈机制用于提高动态参考与连续交互的可靠性。
图 9|用户输入、提示词生成与视频帧反馈构成的交互流程示意
720P 实时输出:分开处理时序与细节
S2-Avatar 使用轻量级单步 Refiner,在主干模型的低分辨率输出上恢复高分辨率细节。主干侧重动作与长程时序,Refiner 侧重局部外观,以较低的额外计算开销将实时输出提升至 720P。
训练素材也按实际清晰度筛选,综合考察纹理、边缘和压缩损失。同为 1080P 的视频,经过不同程度的压缩,能提供的有效细节可能相差很大。
推理方面,我们沿用并扩展 TurboDiffusion 与 TurboServe 的部分技术,结合混合注意力、低比特计算和算子融合降低计算开销。在编辑流程中,编码器、生成主干、Refiner 与解码器沿共享时间线调度,在不同阶段复用 GPU,减少资源闲置与端到端延迟。
评测结果
我们分别评估了实时数字角色生成和视频编辑,并以人类偏好评测补充公开基准。
在 StreamAV-Bench 上,S2-Avatar 在论文表 1 报告的 9 项指标中均取得最优结果,覆盖视觉与音频质量、音画对齐与同步、音频指令满足度,以及主体和背景一致性。
图 10|StreamAV-Bench 结果。↑ 表示越高越好,↓ 表示越低越好,“–”表示该项数据不可用
视频编辑方面,S2-Editing 在 OpenVE 与 RefVIE 联合评测中取得 4.26 的总体得分,高于论文中得分最高的离线对比模型 Bernini-R 14B(3.92);在 Sparkle-Bench 上,总体得分为 3.74,表中各项指标均为最优。
图 11|OpenVE 与 RefVIE 联合评测
图 12|Sparkle-Bench 评测
在 ViViD 虚拟试穿测试集上,S2-Editing 的 VFID_I 为 9.9515,CatV2TON 为 19.5131。该指标衡量生成结果与参考视频的分布差异,数值越低越好。
图 13|ViViD虚拟试穿测试
此外,内部视频编辑评测使用 150 组成对案例,在相同源视频、参考图和指令条件下随机展示输出,由经过校准训练的专业评测员进行比较。S2-Editing 的平均一致性得分为 3.56,Decart-Lucy2.5 为 2.59,XMax-X2.0 为 1.67;在整体质量、视频质量、时间一致性和语义遵循四项比较中,S2-Editing 均获得更高的偏好占比。
这些比较结果对应论文所列模型、数据集与评测设置。
下一步工作
空间视频仍处于探索阶段。当前方案以固定视角为主,在头显中保持清晰画质并进一步降低延迟,是我们接下来需要解决的问题。尤其在实时透视场景下,头部运动与显示画面之间的延迟会直接影响体验。
我们也会继续探索全景空间视频,让用户能够转头观看更完整的生成场景。对 Vidu S 而言,持续的角色互动、视频编辑与空间体验,是这条技术路线下一步的具体方向。
|立即体验
https://vidu.com/vidu-stream
|API 平台
http://platform.vidu.com/vidu-stream/doc
|技术报告
https://arxiv.org/pdf/2609.11638
往期
推荐
RECOMMENDED
出典:公開されているAIニュース集約ディレクトリ。著作権は原著作者・媒体に帰属します。当サイトは索引と要約のみを掲載しています。