SadTalker模型是一个使用图片与音频文件自动合成人物说话动画的开源模型,我们自己给模型一张图片以及一段音频文件,模型会根据音频文件把传递的图片进行人脸的相应动作,比如张嘴,眨眼,移动头部等动作。
SadTalker,它从音频中生成 3DMM 的 3D 运动系数(头部姿势、表情),并隐式调制一种新颖的 3D 感知面部渲染,用于生成说话的头部运动视频。
为了学习真实的运动,SadTalker分别对音频和不同类型的运动系数之间的联系进行显式建模。 准确地说,SadTalker提出 ExpNet模型,通过提取运动系数和3D渲染的面部运动来从音频中学习准确的面部表情。 至于头部姿势,SadTalker通过PoseVAE 以合成不同风格的头部运动。
模型不仅支持英文,还支持中文,我们可以直接hugging face上面来体验
https://huggingface.co/spaces/vinthony/SadTalker
当然官方开源了源代码,我们可以直接在自己电脑上面来运行此模型文章来源:https://www.toymoban.com/news/detail-585081.html
https://github.com/OpenTalker/SadTalker
当然我们要运行本程序,需要安装python3.8以上版本,并下载预训练模型ÿ文章来源地址https://www.toymoban.com/news/detail-585081.html
到了这里,关于SadTalker AI模型使用一张图片与一段音频便可以自动生成视频的文章就介绍完了。如果您还想了解更多内容,请在右上角搜索TOY模板网以前的文章或继续浏览下面的相关文章,希望大家以后多多支持TOY模板网!