ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

10分钟AI语音克隆:Retrieval-based-Voice-Conversion-WebUI(RVC)完整指南

10分钟AI语音克隆:Retrieval-based-Voice-Conversion-WebUI(RVC)完整指南 10分钟AI语音克隆Retrieval-based-Voice-Conversion-WebUIRVC完整指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUIRVC是基于VITS的开源语音转换框架用top1检索杜绝音色泄漏10分钟低噪语音就能训练出可上手的变声模型。游戏变声、AI歌手、影视配音的场景都适用。 项目定位RVC比同类工具好上手在哪基于VITS的语音转换工具普遍有两个痛点训练数据门槛高、音色泄漏难根除。RVC对这两点的解法很直接top1检索推理时把输入源特征替换为训练集里最接近的特征从机制上杜绝目标音色混入原声低训练门槛约10分钟语音即可出效果相对弱的显卡也能快速训练。此外它把UVR5人声伴奏分离和实时变声GUI一并打包从原始素材到实时输出是完整链路。✅ 动手前自查你的机器能不能跑项目要求说明显卡N卡4GB显存起 / A卡 / I卡N卡6GB以上最顺4GB显存会自动降级fp32Python大于3.83.11用户改用 requirements-py311.txt系统工具ffmpeg切分、重采样都依赖它训练数据约10分钟低噪语音人声干净、语速均匀、背景噪音少磁盘10GB以上预训练模型与中间文件只做推理不训练的话有CPU即可运行只是速度慢。 从零跑通四条命令打开RVC WebUI1. 获取代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI预期本地出现 infer-web.py、tools/、configs/ 等目录结构。2. 安装依赖pip install torch torchvision torchaudio pip install -r requirements.txt预期安装无报错。A卡/I卡用户把第二行换成 requirements-dml.txt 或 requirements-ipex.txtAMD ROCmLinux用 requirements-amd.txt。3. 下载预训练模型python tools/download_models.py预期assets/ 下出现 hubert 特征模型、RMVPE 音高模型、v1/v2 预训练权重、UVR5 分离权重。4. 首次启动python infer-web.py预期浏览器打开 http://127.0.0.1:7865注意默认端口是7865不是7860界面含模型推理、模型训练、UVR5人声伴奏分离、ckpt处理四个标签页。 核心玩法训练一个模型并完成变声一键训练从10分钟语音到可用模型目的把原始语音变成 .pth 音色模型 .index 检索索引。将10分钟语音切成多个文件放入一个文件夹在模型训练页把它填为训练数据文件夹实验目录写一个唯一名称采样率选40k或48k勾选F0音高提取音高提取算法选RMVPE点击一键训练效果自动完成切分、F0与特征提取、模型训练、索引构建。完成后模型推理里可选到新音色模型文件在 assets/weights/索引在 logs/实验目录/。模型推理单文件一键变声在模型推理的单次推理页选推理音色、填输入音频文件路径、选索引变调填整数半音12升八度、-12降八度音高算法选RMVPE点转换效果输出音频框里试听并下载。成批文件走批量推理子页整目录转换或在终端跑 tools/infer_batch_rvc.pypython tools/infer_batch_rvc.py --input_path audio/ --opt_path opt/ --model_name yourmodel --f0method rmvpe实时变声麦克风即时换音色终端启动python tools/rvc_for_realtime.py在GUI里选择输入声卡、音色、索引点开始效果麦克风声音实时变成目标音色默认驱动端到端约170msASIO设备约90ms。⚙️ 进阶调优三个参数让变声更像人话F0算法固定用RMVPE效果显著优于harvest/crepe速度比crepe快且能消除哑音唱歌场景想提速可降级用pm。索引率检索特征占比微调调高后输出音色更贴近目标声线拉满则韵律会变生硬默认0.75是平衡起点按±0.1步长试。ckpt-merge混音在ckpt处理页把两个 .pth 模型按权重比例融合做出两边都不存在的第三种音色适合给角色设计专属声线。⚠️ 避坑指南新手最常踩的五个坑浏览器没在7860打开→ 原因RVC默认端口是7865以终端打印的地址为准端口被占用时给启动命令加--port 8000。启动报ffmpeg缺失或音频处理失败→ 原因系统未装ffmpegUbuntu执行sudo apt install ffmpegMacOS执行brew install ffmpegWindows把ffmpeg.exe放到项目根目录。输出带电音、撕裂感→ 原因清辅音和呼吸声没保护把protect参数从默认0.33上调范围0~0.5越大保护越强但拉满会削弱索引效果。哑音或音高跳变→ 原因F0提取算法不匹配换用RMVPE音高曲线仍跳时把harvest中值滤波半径调到≥3。训练完索引下拉框没有.index→ 原因索引未构建或列表未刷新手动训练时先提取特征再点训练索引最后点刷新音色列表和索引路径。 生态与入口中文常见问题docs/cn/faq.md更新日志docs/cn/Changelog_CN.md训练核心代码infer/modules/train/变声管线infer/modules/vc/Docker部署Dockerfile 与 docker-compose.yml多语言界面文件i18n/locale/把语音放好点下一键训练你的第一个AI音色比想象中更快。项目MIT协议开源生成语音的使用责任自负。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表