AI 快讯 | 生数科技 Vidu S2 发布:实时视频编辑 + 实时互动 Avatar

AI 快讯 | 生数科技 Vidu S2 发布:实时视频编辑 + 实时互动 Avatar,720P 流式不中断

:fire: 一句话核心:生数科技推出 Vidu S2 实时视频模型——S2-Editing 对正在播放的视频流实时改风格/换装/换角色/换背景,S2-Avatar 支持 720P、25-42FPS 实时互动数字人。独创 SRF 训练技术终结长时流式生成的「崩溃与漂移」。


:clapper_board: S2-Editing:实时编辑正在播放的视频流

只需一条文本指令 + 一张可选参考图,即可对实时视频流做四类编辑:

  • 改风格:按风格参考图实时渲染,切换不同视觉美学
  • 虚拟试穿:按服装参考图实时换装
  • 换角色:按人物参考图替换视频中的人
  • 换背景:按背景参考图替换所处环境

核心技术是「帧对齐稀疏注意力」——新画面每帧严格锁死原视频同一时刻,保证高速运动不穿帮、画面不撕裂。支持摄像头、视频、图片三种输入源。


:man_dancing: S2-Avatar:不是「说话头」

维度 Vidu S2 HeyGen(对比)
实时规格 720P、25-42FPS 流式不中断 实时对话数字人为主
动态介入 生成中随时插入参考图并记忆状态 角色设定后固定
动作能力 独舞/2D/3D 动画全身跟随 以口播上半身为主
实时编辑 改风格/换装/换人/换背景 不具备

S2-Avatar 支持在生成过程中随时插入新参考图并让角色「接住」,保持状态记忆——这突破了传统数字人「只能口播上半身」的局限。


:microscope: SRF:终结长时流式生成的漂移

Self-Replay Forcing(SRF)训练让模型直面自身生成历史、自我修正误差,解决长时流式生成常见的「越生成越崩」问题。另推出面向 VR 的 S2-Spatial 空间视频,将单目实时视频转为左右眼同步画面。


:bullseye: 落地价值

对电商直播带货、虚拟试穿、场景营销有直接降本价值——背景一键替换、一条原片裂变多风格素材。与 HiDream-O1-Video(AA 图生视频第四)相比,Vidu S2 走的是「实时交互」差异化路线。


来源链接