
SadTalker 安装教程一张人像加一段音频5 步生成说话视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个音频驱动的说话人视频生成项目CVPR 2023你给它一张静态人像图和一段音频它会生成一张嘴型、表情、头部动作跟随音频变化的说话头视频。本文按你实际操作的顺序走完整个流程先确认环境再装依赖、拉模型然后跑通第一条推理命令最后给一张报错速查表。⚡ 30 秒结论你能做什么先说结论这是一套可以完全离线跑的命令行 WebUI 工具输入一张图加一段音频输出一个 mp4 说话视频模型文件约几个 GB下载一次即可。维度情况适合谁想用静态人像做数字人口播、配音视频的个人开发者最低硬件4GB 显存的 NVIDIA GPU没有 GPU 也能用 CPU 跑只是慢内存/磁盘10GB 以上内存10GB 以上空闲磁盘模型 依赖预计耗时从 clone 到第一次出视频约 30~60 分钟主要耗在模型下载上最终产出results/时间戳/目录下的 mp4 文件注意两点限制避免踩坑输入图像必须是真人或接近真人的肖像官方明确说明对动漫风格效果有限见 docs/best_practice.md。输入音频只支持 wav 或 mp3 两种格式见 docs/FAQ.md。✔️ 动手前清单4 项前置确认先说结论这 4 项任何一项不满足后面的安装都会在奇怪的地方报错所以值得花 5 分钟先过一遍。系统Linux/Unix、Windows、macOS 都支持其中 Linux 文档最完整macOS 与 WSL 的额外说明在 docs/install.md。Python 3.8项目依赖是按 3.8 锁版本写的如numpy1.23.4用 3.10 大概率装不上face_alignment1.3.5。用 conda 建独立环境最省事。ffmpeg后面生成视频要靠它且需要能被命令行直接调用ffmpeg -version有输出。磁盘checkpoints/和gfpgan/weights/两个目录会放 8 个权重文件预留 10GB 以上比较安全。 核心 5 步从 clone 到第一次出视频先说结论5 步全是复制粘贴级的操作每步末尾有一句「预期结果」对不上就停在那一步别往下走。第 1 步克隆仓库并创建环境git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker预期结果终端提示符前出现(sadtalker)python --version显示 3.8.x。第 2 步装 PyTorch 和 ffmpegpip install torch1.12.1 torchvision0.13.1 torchaudio0.12.1 conda install ffmpeg预期结果python -c import torch; print(torch.__version__, torch.cuda.is_available())输出1.12.1和True有 GPU 时ffmpeg -version正常输出。有 NVIDIA GPU 但显示False说明装到了 CPU 版 PyTorch需要换 CUDA 11.3 对应的 wheel 重装。第 3 步装项目依赖pip install -r requirements.txt这个清单里锁了numpy1.23.4、face_alignment1.3.5、basicsr1.4.2、facexlib0.3.0等精确版本同时会带进gfpgan、gradio、safetensors。预期结果全部Successfully installed无版本冲突报错。macOS 用户需要再单独执行pip install dlib见 docs/install.md。第 4 步一键下载模型文件bash scripts/download_models.sh这个脚本scripts/download_models.sh会自动建好两个目录并下载全部 8 个文件位置文件作用checkpoints/SadTalker_V0.0.2_256.safetensors256 分辨率面部渲染模型默认checkpoints/SadTalker_V0.0.2_512.safetensors512 分辨率面部渲染模型checkpoints/mapping_00229-model.pth.tar标准模式的 MappingNetcheckpoints/mapping_00109-model.pth.tar全身图full模式的 MappingNetgfpgan/weights/GFPGANv1.4.pth等 4 个人脸检测、对齐、修复、解析预期结果ls checkpoints/ gfpgan/weights/能看到上表全部 8 个文件且 safetensors 文件在 GB 级别几十 MB 说明下载不完整脚本用wget -nc可断点续传重跑即可。第 5 步跑第一条推理命令仓库自带示例素材不用自己找python inference.py --driven_audio examples/driven_audio/eluosi.wav \ --source_image examples/source_image/full_body_1.png \ --enhancer gfpgan预期结果终端依次打印3DMM Extraction for source image等阶段日志结束后提示The generated video is named: results/.../xxx.mp4。用播放器打开这个文件能看到人物嘴型跟着音频在动——到这里就算跑通了。 分支与进阶GPU/CPU 和模式怎么选先说结论推理入口 inference.py 会自动检测设备有 GPU 就走 CUDA没有就落回 CPU不用你手动指定但想快和想省心参数要分开调。GPU 与 CPU 的差异集中在两处参数对比项有 GPU纯 CPU命令差异不用加设备参数加--cpu强制走 CPU--batch_size默认 2 即可显存富余可加建议降到 1--size可上 512用 256 省时间--enhancer可开gfpgan可省略CPU 命令示例python inference.py --driven_audio examples/driven_audio/deyu.wav \ --source_image examples/source_image/art_2.png \ --cpu --batch_size 1 --size 256输入图的三种预处理模式--preprocess默认cropcrop默认只生成脸部裁剪区域的动画速度快输出的是裁脸后的画面。full自动处理人脸区域并贴回原图适合全身照配合--still保持原图头部姿态效果更稳。resize整图缩放到目标分辨率再动适合证件照这类大头构图全身照用它会出坏效果。全身图推荐命令python inference.py --driven_audio examples/driven_audio/deyu.wav \ --source_image examples/source_image/full_body_1.png \ --still --preprocess full --enhancer gfpgan不想敲命令就用 WebUIpython app_sadtalker.py起一个 Gradio 页面可选pip install TTS获得文生语音输入或者一键脚本Linux/macOS 跑bash webui.shWindows 双击webui.bat它会自动建 venv 并装依赖。 排障速查表报错信息 → 修复动作先说结论90% 的失败出在模型没下全和 ffmpeg 不在 PATH 上先查这两项再对照下表。报错信息节选根因修复动作ffmpeg is not recognized as an internal or external commandffmpeg 没装或不在 PATHconda install ffmpegWindows 需把 ffmpeg 加入%PATH%后重开终端ModuleNotFoundError: No module named ai模型文件下坏了import时读错文件核对checkpoints/里各文件大小是否完整重跑bash scripts/download_models.shFileNotFoundError: ...BFM_Fitting\similarity_Lm3D_all.mat模型目录结构不对确认权重在checkpoints/和gfpgan/weights/两个固定位置不要改名RuntimeError: unexpected EOF ... file might be corrupted下载中断文件不完整重跑下载脚本wget -nc支持断点续传RuntimeError: CUDA out of memory显存不够export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用set并把--batch_size降 1、--size降 256Error while decoding stream #0:0 ... mp3float音频格式不受支持只支持 wav/mp3用 ffmpeg 转一下ffmpeg -i 输入 -ar 16000 -ac 1 out.wavIllegal Hardware ErrorMac M1/M2dlib 架构不匹配pip uninstall dlib后重新pip install dlib更多问题先翻 docs/FAQ.md它和这张表覆盖同一批高频报错。✅ 收尾验证与下一步先说结论判断成功的标准只有一条——results/下多了一个 mp4且嘴型与音频对得上。验证清单results/下出现带时间戳的 mp4能正常播放。播放时人物嘴型、眨眼跟随音频节奏如果脸完全不动多半是输入图不是单人清晰肖像换一张正面、光线足的图重试。想保留中间产物裁剪图、系数文件调试加--verbose否则默认会清理临时目录。下一步建议按 docs/best_practice.md 逐个试这几个参数表情幅度不够就调--expression_scale默认 1.0调大更夸张。想要更自然的眨眼给一段参考视频传--ref_eyeblink想让头跟着原图姿态少动加--still。出片后觉得脸糊保留--enhancer gfpgan并升到--size 512需要SadTalker_V0.0.2_512.safetensors已下载。想把整套流程嵌进 Stable Diffusion WebUI看 docs/webui_extension.md。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考