ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

RVC变声器:10分钟录音到可用音色模型的完整实操路径

RVC变声器:10分钟录音到可用音色模型的完整实操路径 RVC变声器10分钟录音到可用音色模型的完整实操路径【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI是基于 VITS 架构的开源变声器给它 10 到 50 分钟的目标人声录音训练出一个音色模型之后任何音频进去都会以那个音色重新输出。适合想给视频配音、给游戏角色换声、做翻唱又不想碰音频工程细节的人。最终产出是什么两个文件决定效果先明确交付物后面所有步骤都为它服务weights/实验名.pth音色模型本体60MB用于推理和分享FAQ Q4logs/实验名/added_xxx.indexfaiss 检索索引决定输出保留多少训练集的音色前者没训好比音色出不来后者缺了音质可以但相似度打折。分享时发 weights 下的文件别发 logs 下那个那是存训练状态续训用的Q4。先确认硬件与环境4G显存是门槛官方 FAQ Q8 的原话4G 显存显卡还有救4G 以下如 1060 3G、各种 2G 卡可以直接放弃。程序启动时会自动读显存大小调整内部分块配置训练时 batch size 缩到 1 还报 out of memory那就是卡确实不够只能换卡或租云 GPU。环境按顺序装全部在项目根目录执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv rvc-env # 激活虚拟环境后按显卡选依赖文件cu128 / cu118 / cpu 三档 pip install -r requirments_cu128_py312.txt python webui.py还有两件事不能省装 ffmpeg切分和重采样都靠它Ubuntu 上sudo apt install ffmpegmacOS 上brew install ffmpeg下载 assets 目录下的预训练底模文件缺了它训练和推理都起不来。一个隐性门槛是系统内存切分和音高提取是 CPU 多进程干活训练时报文件/内存 error 时把提取音高和处理数据使用的CPU进程数拉低或手动把训练音频切短FAQ Q14。录音规格10到50分钟与三条红线官方 FAQ Q10 推荐总时长 10 到 50 分钟录音干净、底噪低、音色有辨识度时5 到 10 分钟也能训出可用模型。1 分钟以下官方明确不建议。录音时把握三件事环境尽量安静。底噪会直接进模型训练轮次再高也压不下去语速、语调、情绪有变化模型靠这些样本覆盖不同的发音状态单条片段几十秒到一两分钟即可过长在切分和内存上都是负担录完统一转成 WAV。采样率不用纠结预处理阶段自动重采样。注意别把路径放错位置文件夹路径带空格、括号或中文ffmpeg 读取会直接报错FAQ Q1。最小训练配置只动三个数字启动 webui.py 后浏览器自动打开 7865 端口训练页Windows 用户可双击go-webui.bat。确认训练集文件夹路径、填一个实验名后面找模型全靠它训练页里值得动的数字只有三个参数怎么设依据total_epoch有底噪20~30 轮干净且时长足到 200 轮FAQ Q9低音质数据调太高底模带不高训练集噪音被一并学进去保存间隔每 10 轮存一个点间隔小才能逐个试听挑最早达标的避免过拟合batch size用页面默认OOM 往下调默认按显存自动估算约为显存 GB 数的一半稳定起步值另外两项对质量影响明显顺手设采样率选 48k 对应 v2 底模configs/v2/48k.json 是官方配置里质量上限最高的一档音高提取算法选 rmvpe效果最好且只占少量显存harvest 低音更好但极慢pm 适合歌声输入时提速。点一键训练后流程依次执行切分、音高提取、特征提取、训练日志全写在logs/实验名/下训练脚本在 train/train.py。训完必做的两步索引与索引占比先点训练索引。它用 faiss 把训练特征聚成检索库产物是logs/实验名/下 added_ 开头的 .index 文件。一键训练结束没看到索引多半是训练集太大卡住了添加索引步骤重按一次训练索引即可FAQ Q2。切到模型推理页点刷新音色选模型和索引上传音频。重点调的是 index rate检索特征占比0 到 1默认 0.75FAQ Q11调高接近 1音色完全锚定训练集不漏出推理源或底模音色但音质上限被训练集锁死调低到 0不做检索保护音质可能更好音色泄露会回来训练集优质且时长足时这个值反而不重要模型自己基本不引用外部音色变调是整数半音12 升八度、-12 降八度protect 滑条默认 0.33专门防清辅音和呼吸声撕裂输出有电音时往高调。批量转换与实时变声批量走推理页的批量转换入口输入输出目录指好即可纯命令行需求看 FAQ Q7先跑通 WebUI消息窗会显示对应的命令参数。想实时说话变声双击go-realtime_gui.bat入口脚本是 realtime_gui.py。官方延迟数据端到端 170ms换 ASIO 输入输出设备可压到 90ms但后者依赖声卡驱动支持普通 USB 声卡别期待这个数字。最后验证跑通把 10 分钟录音里没用过的一段音频丢进推理页转换听音色对不对。对上了整个流程就通了音色不对先查索引是否选中再换更早的保存点重试。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表