
Duix.Avatar 数字人本地部署实战从形象克隆到口播视频全流程【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款可完全离线运行的开源数字人项目只需用一段约 10 秒的真人视频就能完成外貌与声音的双向克隆再通过文本或音频驱动生成口型同步的口播视频。整套流程不依赖任何云端服务所有数据都留在本机适合对隐私敏感的内容生产者与团队。本文按「场景 → 环境 → 部署 → 使用 → API → 排错」的顺序带你把这套数字人本地部署方案完整跑通。三类典型使用场景判断是否值得投入硬件成本先看你的需求是否落在下列区间。口播内容批量生产把一段录好的口播稿转成真人出镜的短视频用于课程讲解、产品发布、政策解读等场景。形象一次克隆后续可持续复用。企业内部演示培训课件、流程说明、合规宣导等需要反复更新的内容用同一虚拟形象输出保持视觉一致性。个人虚拟分身为直播切片、短视频账号沉淀一个专属数字人形象减少真人反复出镜的拍摄成本。三条场景共同依赖的能力是外貌克隆、声音克隆、文本/音频驱动的口型合成。下面先解决环境再谈操作。部署前的环境要求检查硬件方面官方给出的推荐配置是NVIDIA 显卡必须30/40/50 系列均可、内存 32 GB 及以上、空闲磁盘 100 GB 以上、Windows 1019042 以上或 Ubuntu 22.04。没有 NVIDIA 显卡的项目无法启动三个 GPU 服务这一点在后续排错里会被反复验证。软件方面需要准备 Docker DesktopWindows或 docker.io docker-composeLinux、Node.js 18以及 NVIDIA Container Toolkit让 Docker 能调度 GPU。在 Windows 上Docker 的 WSL 后端默认把镜像目录放在 C 盘若 C 盘剩余空间不足 100 GB需要在 Docker 设置里把镜像目录迁移到其它分区。Docker 服务端部署服务端由三个容器组成分别承担声音合成、语音识别、视频生成。deploy目录下的 compose 文件已经写好只需按系统选择对应文件启动。Windows 路径先确认 WSL 已安装wsl --list --verbose再更新一次wsl --update最后按 CPU 架构安装 Docker Desktop 并接受协议、跳过登录。随后进入项目的deploy目录执行docker-compose up -d首次拉取镜像约 70 GB建议连接 Wi-Fi耗时约半小时。看到 Docker 中出现三个处于 Running 状态的服务即代表成功。如果显存较低可改用精简版docker-compose -f docker-compose-lite.yml up -dUbuntu 22.04 路径按顺序安装 Docker、NVIDIA 驱动与 NVIDIA Container Toolkit参考官方驱动页面然后cd deploy docker-compose -f docker-compose-linux.yml up -d客户端直接双击官方构建的Duix.Avatar-x.x.x.AppImage即可启动无需额外安装。Nvidia 50 系列显卡50 系列以及已使用 CUDA 12.8 的 30/40 系列建议使用独立 compose 文件它基于 torch 的预览版本cd deploy docker-compose -f docker-compose-5090.yml up -d客户端使用从克隆形象到生成视频服务端跑通后打开客户端即可完成全部操作无需接触命令行。形象克隆点击Create Avatar上传一段约 10 秒、画面中有人正常说话的短视频。系统会把画面与音轨分离用音轨做声音克隆用画面做外貌克隆最终在My Avatars列表里得到一个可复用的数字分身。注意素材视频必须包含人声否则声音克隆会失败。口播视频生成点击Create Video选择刚创建的数字人输入文案或直接上传音频脚本支持中、英、日、韩、法、德、阿、西八种语言提交后系统自动生成口型同步的成片。客户端右上角可切换中英文界面、查看用户协议、打开本地日志。开放 API把数字人能力接入自己的系统Docker 启动后服务端会在本机暴露若干端口可通过http://127.0.0.1调用方便嵌入到自研后台或工作流里。具体实现可参考src/main/service/目录下的model.js、video.js、voice.js。模特训练POST http://127.0.0.1:18180/v1/preprocess_and_tran传入参考音频路径与语言返回asr_format_audio_url与reference_audio_text供后续合成复用。音频合成POST http://127.0.0.1:18180/v1/invoke传入上一步返回的参考音频与参考文本即可得到目标文案的合成语音。视频合成POST http://127.0.0.1:8383/easy/submit传入音频与静音视频路径及唯一code再用GET http://127.0.0.1:8383/easy/query?code${code}轮询进度。三个接口串起来就是一条文本 → 语音 → 口播视频的完整流水线适合批量内容生产的自动化场景。部署与运行排错清单按出现频率排序绝大多数问题都能在这四步里定位。镜像拉取超时表现为docker-compose up -d报registry-1.docker.io连接被取消。原因通常是 Docker Hub 官方源不稳定解法是在 Docker Engine 配置里加入registry-mirrors镜像源后重启服务。服务未全部 Running三个服务必须全部处于 Running 状态才能正常工作。本项目全部算力在本地 GPU 上若没有 NVIDIA 显卡或驱动未装好服务根本起不来这是最容易被忽略的前置条件。克隆形象报Connection refusedASR 服务fun-asr冷启动较慢服务端刚起来时立即克隆会失败。等待几分钟再操作若机器内存只有 16 GBASR 可能无法启动。克隆形象报File not exists通常是素材视频里没有人声或音频文件路径/挂载点不符。检查docker-compose.yml里d:/duix_avatar_data/voice/data的挂载目录是否与实际文件位置一致。排查时记得先升级服务端在deploy下重新docker-compose up -d与客户端拉取最新代码后重新构建项目迭代较快不少问题已在新版中修复。完整问题集可参阅 doc/常见问题.md。小结把硬件对齐NVIDIA 显卡 32 GB 内存 100 GB 磁盘、用 Docker 起三个 GPU 服务、在客户端完成形象与声音克隆再按需走界面或 API 生成视频就是这套数字人本地部署方案的全部主线。它用一次性的部署成本换来的是长期、离线、可商用的内容生产能力。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考