AI微软展示VASA-1,通过单一肖像图和语音生成数字人视频
微软发布的VASA-1框架能够通过一张人物肖像照片和一段语音音频,实时生成高仿真的数字人讲话视频,表现自然协调,支持高达40 FPS的在线生成。该技术实现了数字人的面部、头部动作与音频同步,且具有极低的启动延迟(170ms)。VASA-1主要用于生成具有视觉情感技能的虚拟数字人,目前仅作为研究预览,尚未对外开放。所有示例图像均为虚拟生成,未存在的身份。
Insider