ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AI变声不用付订阅费:RVC WebUI 的30分钟上手全记录

AI变声不用付订阅费:RVC WebUI 的30分钟上手全记录 AI变声不用付订阅费RVC WebUI 的30分钟上手全记录【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI昨晚把手机备忘录里录的 10 分钟语音拖进界面泡完一碗面的功夫训练就完了。试听条里传出来的是我的语气、我的情绪换了一副嗓子。我用的工具叫 Retrieval-based Voice Conversion WebUIRVC WebUI基于 VITS几段音频就能练出一个能用的变声模型而且完全免费。它到底在干什么它不是把音高拧来拧去的变声器说白了就做两件事先把你那几十段目标声音读一遍学下这个声音的声纹存进索引推理时对你说话的每一小段去索引里找特征最接近的一段用目标声音的特征把你这声纹替换掉代码里叫 top1 检索再交给 VITS 重新合成。你可以理解成一台声纹复印机复印的是目标音色的指纹而你说话的旋律、气息、情绪都保留着所以听起来不机械。对普通用户意味着10 分钟录音就够训练入门级显卡就够跑成本是 0 元。我的 30 分钟装环境。先克隆仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUIN 卡执行pip install -r requirements.txt即可A 卡/I 卡换成 requirements-dml.txt。预训练权重assets/pretrained/和配置configs/仓库里都带好了不用满世界找。这步比想象中快基本就是在等 pip。启动界面。Windows 双击go-web.bat其他系统跑python gui_v1.py浏览器打开本地地址UVR5、训练、推理这些选项卡就摆在眼前。准备底料。这里我犹豫了一下。官方推荐至少 10 分钟低底噪语音我翻出一段自己闲聊的录音挑了 12 分钟背景音乐一条都没有。手里要是混音可以先用界面里的 UVR5 选项卡把人声抠出来省得另装软件。开始训练。训练选项卡里选好数据参数先用默认点开始。进度条走完.pth模型文件就躺在输出目录里了。试听。推理选项卡传进一段自己的声音选中刚练的模型合成。第一遍响起来的时候我还愣了一下——音色真的换了连我自己都没听出来哪是原来的。中途卡住别慌中文 FAQ 在docs/cn/里我下面几个坑它基本都写过。几个值得记住的数字10 分钟——训练数据的官方最低建议量大概是一集有声书的长度170ms——官方端到端实时延迟接 ASIO 声卡能压到 90ms直播里基本感觉不到延迟1 张入门级显卡——相对差的显卡也能快速训练没有显卡也能用 CPU 跑批量只是慢0 元——代码、预训练权重、配置全部开放没有订阅和会员3 种音高提取算法——rmvpe、crepe、pm同一个模型换一种算法效果和速度完全不同我踩过的三个坑底料里带了电视声。第一版模型出来发闷像隔着湿毛巾在说话。听了好一会儿才反应过来是录音里一直开着电视。我把门关上重录只留了音色最干净的 6 分钟重训一遍立刻正常。教训数据宁短勿杂干净的 6 分钟好过嘈杂的 20 分钟。高音全哑了。批量处理时图快选 pm 提音高结果唱高音的那几句全断了。把 f0 方法换回 rmvpe当场就顺了。教训pm 是省时间用的认真用 rmvpe别死磕一个算法。显存爆了想换显卡。报 CUDA out of memory第一反应是去挑新卡。冷静了一下先把训练参数里的 batch_size 调小重跑顺利通过。教训显存不够先调参数换硬件是最后选项。文档里没教的玩法给妈妈过生日整活。先用平静语气录一段祝福语训练一个长辈音模型等她接电话时第一句就听到完全不同的声音她大概会懵三分钟。把两个声音合成一个。用 ckpt 处理选项卡里的 ckpt-merge 融合两个模型做出一个现实中不存在的新声线拿它做一档一个人采访自己的播客。老视频的配音批量换声。把一整个文件夹的旧配音丢给tools/infer_batch_rvc.py跑一遍几十条素材统一换成新音色老片子直接翻新。备忘录里那 10 分钟语音其实躺了很久之前只是没人问过它。我第一晚用它纯属手痒现在它已经变成我开播前默认打开的第一个东西。你手边要是也有一段听起来有点意思的录音也许今晚就可以丢进去看看它能变成什么。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表