
SadTalker 安装与部署单张图片加音频本地跑通说话人视频生成【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalkerCVPR 2023把一张单人像加一段音频驱动成口型同步的说话人视频。这篇文章带你完整走通本地安装、配置与运行的过程先判断 GPU 还是 CPU 环境再装依赖和 FFmpeg把模型文件放进正确目录跑通第一次推理最后排查显存不足、模型文件缺失等常见报错。先判断你该用哪种部署方式装任何东西之前先确认三件事有没有 NVIDIA GPU、操作系统是什么、是否打算生成高分辨率视频。这决定了 PyTorch 装哪个版本、参数怎么选。你的情况推荐做法备注有 NVIDIA GPU≥4GB 显存安装 CUDA 11.3 版 PyTorch可开 GFPGAN 增强速度最快无 GPU想用 CPU 跑装 CPU 版 PyTorch运行时加--cpu生成慢建议--size 256、--batch_size 1不开增强macOSM1/M2pip install torch torchvision torchaudio 单独pip install dlib项目文档在 M1 上验证过WindowsPython 3.8 把 FFmpeg 加入 PATH可以双击webui.bat直接启动 WebUI无论哪种环境FFmpeg 都是必需的——视频写入和音频解码都依赖它。最短路径第一次跑通下面按 Linux/Unix 流程给出最短步骤Windows、macOS 的差异在 docs/install.md 里有说明。克隆仓库创建独立环境git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker用 conda 隔离环境是为了避免依赖冲突Python 版本固定 3.8。安装与 CUDA 匹配的 PyTorchCUDA 11.3没有 GPU 就装 CPU 版pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113安装 FFmpeg 和其余依赖conda install ffmpeg pip install -r requirements.txtrequirements.txt里已包含face_alignment、librosa、gfpgan、safetensors等固定版本的核心包。TTS只在使用 Gradio 演示的文字转语音时需要可之后用pip install TTS补装。下载模型文件见下一节然后在仓库根目录直接运行bash scripts/download_models.sh python inference.pyinference.py不带参数时会使用仓库内置的示例素材examples/driven_audio/bus_chinese.wav和examples/source_image/full_body_1.png。终端打印The generated video is named: ...后到results/下按时间戳命名的.mp4文件就是输出。跑通这一步环境就算就绪了。模型文件应该放在哪里模型必须下载代码不会自动生成它们。Linux/macOS 直接执行上一节的bash scripts/download_models.sh即可脚本会自动建好目录并支持断点续传。下载完成后结构应该是目录文件作用checkpoints/SadTalker_V0.0.2_256.safetensors256 分辨率面部渲染模型checkpoints/SadTalker_V0.0.2_512.safetensors512 分辨率面部渲染模型checkpoints/mapping_00229-model.pth.tar映射网络默认crop模式使用checkpoints/mapping_00109-model.pth.tar映射网络full模式使用gfpgan/weights/alignment_WFLW_4HG.pth、detection_Resnet50_Final.pth、GFPGANv1.4.pth、parsing_parsenet.pth人脸检测与修复模型--enhancer gfpgan时需要src/utils/init_path.py里的选择逻辑值得了解checkpoints/下能找到任意*.safetensors时程序按--size参数自动加载SadTalker_V0.0.2_256.safetensors或SadTalker_V0.0.2_512.safetensors找不到时会回退到旧版 pth 模型并打印警告此时需要用旧版检查点并加--old_version。--preprocess带full时改用mapping_00109-model.pth.tar否则用mapping_00229-model.pth.tar。如果不想联网下载也可以从项目发布页获取打包好的检查点和 GFPGAN 离线补丁解压到同样的目录即可。输入素材方面仓库examples/下自带了一批可直接试用的素材音频examples/driven_audio/下多个.wav文件。程序只支持 wav 或 mp3其他格式先用 FFmpeg 转一下。图片examples/source_image/下的人像图。官方最佳实践说明该模型面向写实真人面部插画风格效果不理想。GPU 与 CPU参数怎么选设备是自动检测的inference.py里如果torch.cuda.is_available()为真且没加--cpu就用 CUDA。所以 CPU 用户显式加--cpu就行。参数建议参数GPU 常用值CPU / 小显存--size256追求质量用 512固定 256--batch_size2默认1--enhancergfpgan建议不传增强会额外占显存设备无需参数加--cpu512 模型是 beta 版画质更高但显存和时间成本也更高显存紧张时优先退回 256 而不是硬扛。验证环境是否真的就绪跑之前可以用三条命令快速自检python -c import torch; print(torch.__version__, torch.cuda.is_available()) ffmpeg -version ls checkpoints gfpgan/weights第一条确认 PyTorch 版本以及 CUDA 是否可用True表示 GPU 会被自动识别第二条确认 FFmpeg 在 PATH 中第三条确认模型文件都下载到位。三条都正常后跑一次默认的python inference.py看results/是否产出视频。常见报错按错误信息定位现象可能原因处理方式ffmpeg is not recognized as an internal or external commandFFmpeg 未安装或不在 PATHLinuxconda install ffmpegmacOSbrew install ffmpegWindows把 FFmpeg 加入%PATH%FileNotFoundError ... similarity_Lm3D_all.mat等路径类报错模型未下载或放错目录重新执行bash scripts/download_models.sh对照上一节的目录结构检查RuntimeError: unexpected EOF ... The file might be corrupted文件下载中断或损坏重新下载对应文件下载脚本支持断点续传ModuleNotFoundError: No module named ai旧版模型文件异常与epoch_20.pth相关核对模型文件大小后重新下载Illegal Hardware InstructionMac M1 常见dlib 架构不匹配单独执行pip install dlib重装RuntimeError: CUDA out of memory显存不足见下方小节Error while decoding stream ... Invalid data found音频格式不受支持输入只支持 wav / mp3用 FFmpeg 先转出.wavCant get the coeffs of the input输入图无法提取人脸系数换一张清晰、正脸的写实人像显存不足时怎么调整先降低--size 256、--batch_size 1并去掉--enhancer仍不够时再设置环境变量优化显存分配# Linux / macOS export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 # Windows set PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128设置后在同一会话里再运行python inference.py ...即可生效。跑通之后下一步可以做什么调整动效--expression_scale调表情幅度越大越夸张--pose_style在 0–46 之间切换头部姿态风格细节见 docs/best_practice.md。选对--preprocess默认crop只生成裁剪出的说话人脸resize整图缩放输出⚠️ 不适合全身图full生成后贴回原图配合--still可保持原姿态、抑制眨眼与头部晃动。参考视频模式--ref_eyeblink、--ref_pose可以从参考视频借取眨眼和头部姿态examples/ref_video/下有现成示例。3D 人脸可视化--face3dvis额外安装后可用流程见 docs/face3d.md。WebUIpython app_sadtalker.py启动 Gradio 界面需pip install TTS或 Windows 下双击webui.bat、Linux/macOS 下bash webui.sh。已有 Stable Diffusion WebUI 的话可看 docs/webui_extension.md 装扩展。遇到本文没覆盖的报错先查 docs/FAQ.md再去项目 Issue 区搜索。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考