ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

10 分钟语音数据训练 AI 变声模型:RVC 从零上手完整指南

10 分钟语音数据训练 AI 变声模型:RVC 从零上手完整指南 10 分钟语音数据训练 AI 变声模型RVC 从零上手完整指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI俗称 RVC是一个基于 VITS 的变声框架。它主打一件事用不超过 10 分钟的语音数据就能训练出一个可用的 AI 音色转换模型。训练、推理、人声分离全在一个网页界面里完成普通显卡也能跑。 它能帮你解决什么你可能遇到过这些场景想给视频换配音想克隆某个歌手音色做 AI 翻唱或者想要一个低延迟的实时变声器。传统方案要么要几小时的录音要么需要很强的显卡。RVC 的思路不同训练数据门槛低10 分钟低底噪语音就够起步用了 top1 检索机制把输入特征替换成训练集特征从源头抑制音色泄漏——就是你喂进去什么声音结果就不会串上那个声音的音色音高提取用的是 RMVPE 算法比 crepe 更快、占资源更少哑音问题也基本消失附带 UVR5 人声分离能把伴奏和人声快速拆开RVC 的训练推理 WebUI选项卡里能自由选择执行的操作图片来自项目 README仓库内无本地图片文件此处不引用说明经检索本仓库内没有本地 jpg/png 图片文件README 中的界面截图托管在外部图床。按所有图片必须是项目内相对路径的约束本文不引用图片。三步搭好运行环境RVC 对环境的要求不苛刻Python 3.8 以上加一个能跑 PyTorch 的环境。装依赖N 卡用户最省事pip install -r requirements.txtA 卡或 I 卡换成requirements-dml.txtLinux 下的 AMD ROCm 用requirements-amd.txtIntel 核显 IPEX 加速用requirements-ipex.txt。四种依赖文件仓库里都有按自己的显卡挑一个。下载预训练模型推理和训练还需要一批底模hubert_base.pt、rmvpe.pt、assets/pretrained 下的 v1/v2 底模、UVR5 分离权重。仓库自带了批量下载脚本跑一次就行python tools/download_models.py脚本会把所有文件放到 assets/ 对应目录下见 download_models.py。别忘了装 ffmpeg它负责读写音频。Ubuntu 用sudo apt install ffmpegmacOS 用brew install ffmpegWindows 把 ffmpeg.exe 放到根目录。启动 WebUI环境齐了一行命令开界面python infer-web.py浏览器打开127.0.0.1:7897就是你的工作台。Windows 用户也可以直接双击go-web.bat效果相同。第一次进入界面五个选项卡各管什么打开 WebUI 你会看到五个选项卡按用途分工模型推理分单次和批量两个子页。选一个训练好的底模仓库自带几个演示音色、上传音频、选音高提取算法RMVPE 效果最好、设好参数点按钮就出结果。批量页可以一次处理整个文件夹。伴奏人声分离调用 UVR5 模型把整首歌拆成人声 伴奏两段。想做 AI 翻唱先来这里把人声剥出来效果最干净。训练上传切好的训练集音频设置实验名、epoch 数等参数点训练。训练集建议 10 到 50 分钟音质越高底噪越低结果越好。ckpt 处理合并两个模型ckpt-merge可以混出折中音色也能把训练中间存的大模型提取成 60MB 左右的可用小模型。Onnx 导出把 PyTorch 模型导出成 ONNX配合 infer/lib/onnx_inference.py 这类脚本做轻量推理。⚡ 实时变声与关键参数170ms 延迟的实时变声除了 WebUI还有一台实时变声器。Windows 下双击go-realtime-gui.bat就能开。官方做到端到端 170ms 延迟配上 ASIO 声卡能压到 90ms——基本达到说话就变声的跟手程度。直播、游戏配音都能用。三个最该弄懂的参数index_rate索引混合率它管音色像不像你训练的人。调到 1 时结果音色完全贴着训练集走音色泄漏几乎为零调到 0 则不启用检索保护。训练集音质比推理源好就调高反之调低。total_epoch训练轮数底噪大的训练集 20 到 30 轮就够再高音质也拉不上来干净且时长多的训练集可以开到 200。x_pad、x_max推理分句参数写在 configs/config.py 末尾控制每次处理多少音频。显存吃紧就缩小这几个值。常见报错这样查遇到坑别慌docs/cn/faq.md 把高频问题都写清楚了。挑几个最典型的ffmpeg error多半不是 ffmpeg 的锅。音频路径带空格、括号或中文ffmpeg 就抽风。把素材挪到纯英文短路径再试。CUDA out of memory显存不够。训练就降 batch size推理就缩小 config.py 里的分句参数。4G 以下显存基本没救4G 还能抢救。训练完没生成 index 索引训练集太大时建索引那步会卡住。手动再点一次训练索引按钮即可。推理看不到新训的音色先点刷新音色。还没有的话检查训练日志——logs/实验名 下的 log 里会有答案。分享模型时注意要发的是 weights 文件夹里 60MB 的 pth 文件加 index 索引不是 logs 里那个几百 MB 的训练状态文件。发错文件对方会直接报错。上手路径一句话总结装依赖、跑python tools/download_models.py、启动python infer-web.py先用自带底模在单次推理页跑通一段音频再去训练页喂 10 分钟录音试试手感。打开 tools/download_models.py 看一眼它拉了哪些文件然后照着上面三步跑一遍——半小时后你就有了第一个能用的 AI 变声模型。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表