ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

10分钟语音练出一个AI音色:RVC 变声训练实战指南

10分钟语音练出一个AI音色:RVC 变声训练实战指南 10分钟语音练出一个AI音色RVC 变声训练实战指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI手里只有10分钟录音想练出一个像本人的AI音色——这是 RVCRetrieval-based-Voice-Conversion-WebUI被设计出来要解决的问题。它基于 VITS 做变声训练靠 top1 检索替换源特征来抑制音色泄露素材少、显卡普通也能跑。从拿到仓库到出第一版效果拉代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI装 PyTorchpip install torch torchvision torchaudio装依赖N卡pip install -r requirements.txt下载预训练模型放进assets/Windows 把ffmpeg.exe、ffprobe.exe放到根目录启动python infer-web.py走到哪一步算正常终端打出本地地址并自动弹出浏览器页面出现训练推理等选项卡就算装好了。A卡用户把第3步换成requirements-dml.txt。核心流程备数据、训练、出效果训练数据怎么备素材时长 10–50 分钟底噪低、人声干净5–10 分钟的高质量特色音色也够用。音频丢进一个独立文件夹。中文路径、路径带空格是高频卡点。采样率统一48k 上限最高单段建议 10–30 秒太长容易爆内存。正式训练前先用 1–2 分钟素材跑一遍全流程确认能出结果再上全量。一键训练分三步提取特征与音高WebUI 提取 hubert 特征音高提取选 RMVPEInterSpeech 2023 的算法效果和速度都最好。训练模型填实验名点训练产物落在weights/下单个 60MB 以上。训练索引一键流程通常自动执行生成added_*.index没有索引音色还原会打折。过关标准控制台出现 Training is done且能看到added_开头的 index 文件。推理出效果推理页上传音频点刷新音色选中刚训练的模型和对应 index。音高提取保持 RMVPE按需要调移调点转换试听。分享时打包weights/的 pth 加同名 index 即可logs/下的大 pth 是断点续训用的别拿去推理。参数怎么选大多数人保持默认就行真正值得动的只有这几个训练轮数底噪大就 20–30 轮再高也带不动素材干净可以到 200 轮。batch_size默认 4显存 4GB 就设 1–2这是最常见的 OOM 来源。采样率48k / 40k / 32k 三档训练和推理保持一致。Index rate设 1 能彻底屏蔽源音色但音质向训练集靠拢0.6–0.8 是通用区间设 0 则放弃检索保护。高频问题CUDA out of memory→ 大概率显存不够 → 训练缩小 batch_size推理改configs/inuse/下 json 里的 x_pad、x_query、x_center、x_max。一键训练结束没有索引文件→ 训练集太大把内存撑爆了 → 重按一次训练索引训练集太长就手工切短。WebUI 弹出 Expecting value: line 1 column 1 (char 0)→ 系统代理劫持了本地请求 → 关闭系统全局/局域网代理服务端代理变量也要 unset。连接失败Connection Error→ 黑色控制台窗口被关了 → WebUI 进程跟着终端走终端保持开着。tensor size 报错17280 vs 0 之类→wavs16k/里混进了异常小的坏文件 → 删掉后重新点训练。进阶方向与资源练完单模型之后可以用 ckpt 处理选项卡里的 ckpt-merge 把多个模型按比例融合混出新的音色组合实时变声走go-realtime-gui.bat端到端延迟 170msASIO 设备能压到 90ms混音素材还能直接用内置 UVR5 分离人声和伴奏。中文 FAQdocs/cn/faq.mdOOM、索引、继续训练这些坑都写了官方多语言文档docs/采样率与训练超参定义configs/inuse/模型最终落在weights/文件夹里index 文件决定它听起来像你多少两个都留好这个音色才算真正到手。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表