AI 快讯 | 生数科技 Vidu S2 发布:实时视频编辑 + 实时互动 Avatar,720P 流式不中断
一句话核心:生数科技推出 Vidu S2 实时视频模型——S2-Editing 对正在播放的视频流实时改风格/换装/换角色/换背景,S2-Avatar 支持 720P、25-42FPS 实时互动数字人。独创 SRF 训练技术终结长时流式生成的「崩溃与漂移」。
S2-Editing:实时编辑正在播放的视频流
只需一条文本指令 + 一张可选参考图,即可对实时视频流做四类编辑:
- 改风格:按风格参考图实时渲染,切换不同视觉美学
- 虚拟试穿:按服装参考图实时换装
- 换角色:按人物参考图替换视频中的人
- 换背景:按背景参考图替换所处环境
核心技术是「帧对齐稀疏注意力」——新画面每帧严格锁死原视频同一时刻,保证高速运动不穿帮、画面不撕裂。支持摄像头、视频、图片三种输入源。
S2-Avatar:不是「说话头」
| 维度 | Vidu S2 | HeyGen(对比) |
|---|---|---|
| 实时规格 | 720P、25-42FPS 流式不中断 | 实时对话数字人为主 |
| 动态介入 | 生成中随时插入参考图并记忆状态 | 角色设定后固定 |
| 动作能力 | 独舞/2D/3D 动画全身跟随 | 以口播上半身为主 |
| 实时编辑 | 改风格/换装/换人/换背景 | 不具备 |
S2-Avatar 支持在生成过程中随时插入新参考图并让角色「接住」,保持状态记忆——这突破了传统数字人「只能口播上半身」的局限。
SRF:终结长时流式生成的漂移
Self-Replay Forcing(SRF)训练让模型直面自身生成历史、自我修正误差,解决长时流式生成常见的「越生成越崩」问题。另推出面向 VR 的 S2-Spatial 空间视频,将单目实时视频转为左右眼同步画面。
落地价值
对电商直播带货、虚拟试穿、场景营销有直接降本价值——背景一键替换、一条原片裂变多风格素材。与 HiDream-O1-Video(AA 图生视频第四)相比,Vidu S2 走的是「实时交互」差异化路线。
来源链接
- Vidu S2 官方体验:Vidu AI - Vidu S2:全球领先的实时交互与编辑模型
- API 文档:Vidu Live Docs
- AI工具集详细页面:Vidu S2 - 生数科技推出的实时交互与编辑视频模型 | AI工具集
