ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Amphion SVC 快速上手指南:歌唱声音转换的 3 条技术路线与完整入门路径

Amphion SVC 快速上手指南:歌唱声音转换的 3 条技术路线与完整入门路径 Amphion SVC 快速上手指南歌唱声音转换的 3 条技术路线与完整入门路径【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址: https://gitcode.com/GitHub_Trending/am/AmphionAmphion 是一个音频、音乐与语音生成工具箱其中歌唱声音转换SVC模块能帮你把一段歌声换人重唱换掉的是歌手保留的是旋律和歌词。下面这篇指南按原理 → 路线选型 → 上手的顺序带你把这套歌唱声音转换工具跑起来。 同一首歌换人唱SVC 到底在做什么想象一个真实需求你录了一版 demo想听另一位歌手唱同一首歌。音高走向不能变咬字内容不能变能变的只有音色。这就是歌声转换SVC, Singing Voice Conversion要解决的问题。Amphion 把这件事做成了可复现的完整流水线特征解耦、特征合成、波形还原每一步都有对应的模型和配置不用自己从零搭环境。 原理白话版把歌声拆成内容、音色、韵律一句歌声可以拆成三个要素内容唱了哪些字、哪个音节在哪个时间点相当于剧本音色谁在唱相当于演员韵律基频 F0 和能量相当于说话的语气和节奏SVC 的目标就是把剧本和语气从源音频里摘下来换上新演员再演一遍。整个流程分两阶段用表格说清楚阶段做什么输入输出① 特征解耦从源音频提取说话人无关的内容特征来自 WeNet、Whisper、ContentVec和韵律特征F0、能量同时取出说话人嵌入源歌手音频内容 韵律 音色标签② 特征合成声学解码器注入目标说话人信息生成声学表示声码器vocoder再把声学表示还原成波形目标说话人信息 解耦特征目标歌手音频音色表示方面Amphion 目前提供说话人查找表Speaker Look-Up Table即给每位歌手一张身份证此外还有一个参考编码器尚在打磨它能让系统听一段参考音频就学会这个音色也就是零样本 SVC值得关注。️ 三条技术路线怎么选按生成方式分组比按论文罗列更容易选型。扩散路线质量优先推理偏慢DiffWaveNetSVC编码器基于双向非因果扩张卷积Bidirectional Non-Causal Dilated CNN思路接近 WaveNet、DiffWave 和 DiffSVC能同时融合多种内容特征。它是多内容 SVC 入门教程的默认模型也是目前最稳的选择。DiffComoSVC基于一致性模型Consistency Model做蒸馏能显著压缩扩散模型的推理步数等于给扩散路线装上快进键。目前仍在打磨中适合跟踪前沿进展的读者。非自回归路线并行生成效率高TransformerSVCencoder-only 的非自回归 Transformer 声学模型。非自回归指它不逐帧串行预测而是整段并行算出来训练和推理都比自回归模型更省事。端到端路线一个模型走完全程VitsSVC仿 VITS 设计的端到端架构把原本喂给 VITS 的文本输入替换成内容特征和 so-vits-svc 的设计思路相近。链路短、部署直观适合想快速出效果的场景。内容特征提取器和声码器怎么选特征端和声学端是解耦的可以混搭内容特征提取器WeNet、Whisper、ContentVec 三选一或组合使用。Whisper 是通用的语音识别模型ContentVec 专为语音内容表征设计WeNet 则是 ASR 方向的内容特征来源组合多个提取器往往比单用一个更稳。韵律特征F0基频旋律走向和能量响度起伏两者都是说话人无关信息保留它们才能留住原歌的旋律和唱腔。声码器Amphion 的声码器模块提供 GAN 类MelGAN、HiFi-GAN、BigVGAN、APNet 等见 egs/vocoder/README.md和扩散类DiffWave等选项按速度换质量的偏好挑选即可。 上手路径跟着多内容 SVC 教程走三步新手建议直接看 egs/svc/MultipleContentsSVC/ 下的入门教程。它是论文《Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion》2024 IEEE SLT的官方实现核心思路就是整合多种预训练音频模型。先 clone 仓库git clone https://gitcode.com/GitHub_Trending/am/Amphion第一步整合多种预训练音频模型。默认用 Whisper 和 ContentVec 两个预训练模型各提一份内容特征再叠加 F0、能量形成多路内容表示。数据端默认提供 M4Singer、Opencpop、OpenSinger、SVCC、VCTK 五个数据集也可以在exp_config.json里换成自定义数据集。第二步训练。声学模型即 DiffWaveNetSVC声码器是官方 BigVGAN 结构、用 120 小时以上歌声数据微调过的版本。默认超参在单张 24G 显存的 GPU 上即可跑run.sh用--stage参数区分预处理stage 1、训练stage 2断点续训和跨实验微调也都封装好了。第三步推理转换。指定实验目录、源音频文件或整目录、目标歌手名再加--infer_key_shift autoshift自动对齐音高一条命令就能批量转出目标歌手的版本。完整参数和场景说明见 egs/svc/README.md各模型目录TransformerSVC、VitsSVC、DiffComoSVC 等下都有独立的run.sh和exp_config.json可以照抄改。 选型建议什么需求配什么方案你的需求建议方案理由第一次做 SVC要完整复现论文多内容 SVC 教程DiffWaveNetSVC官方实现、文档最全多特征融合提升转换质量对生成质量要求高、不赶推理速度扩散路线扩散模型在声学表示质量上通常占优追求生成效率、批量转换TransformerSVC非自回归并行生成效率高想快速搭出可部署链路VitsSVC端到端架构链路最短关注推理加速DiffComoSVC打磨中一致性蒸馏显著加速扩散推理想给没训练过的歌手换音色等待参考编码器落地零样本 SVC 尚在开发目前只能靠查找表里训练过的说话人场景上它覆盖的音乐制作音色替换、音乐教育里的示范演唱转换、娱乐向声音特效都属于内容锁定、音色可变的同一类问题按上表选模型即可。研究侧的额外好处是各模块路径清晰模型在models/svc/训练/推理入口在bins/svc/方便做消融实验。最后Amphion 的 SVC 模块把内容特征提取、声学解码、声码器三段拆成了可替换的积木新手可以从多内容教程跑通全流程之后再按质量、效率、部署三档需求挑路线。建议先把一条路线完整跑通再换模块实验这是最省时间的入门方式。【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址: https://gitcode.com/GitHub_Trending/am/Amphion创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表