ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

3分钟把电子书变成有声书:ebook2audiobook免费完整教程(支持克隆自己的声音)

3分钟把电子书变成有声书:ebook2audiobook免费完整教程(支持克隆自己的声音) 3分钟把电子书变成有声书ebook2audiobook免费完整教程支持克隆自己的声音【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook书架上是不是堆着一堆买了却没读完的电子书ebook2audiobook简称 E2A是一款免费的开源转换工具它用 AI 语音合成把电子书读成带章节标记的有声书——支持 1158 种语言、9 个 TTS 引擎文本转语音引擎还能用你自己录的声音来读。下面按装好 → 用会 → 玩出花样的顺序带你从第一本有声书走到批量生产线。先听为快这本书会说话之后是什么样一句话概括 E2A 能做什么你丢进一本电子书它吐出一整个有声书架。1158 种语言从中文、英语到斯瓦希里语语言代码用 ISO-639 格式如eng、zho两字母代码如en也认得23 种输入格式.epub、.mobi、.azw3、.pdf、.txt、.docx、.html甚至扫描图片.png、.jpg都能转9 个 TTS 引擎XTTSv2、Bark、VITS、Tacotron2、YourTTS、GlowTTS、Tortoise、Fairseq、Piper可自由切换语音克隆上传一段自己的录音之后的有声书全部用你的嗓子读10 种输出格式M4B、MP3、WAV、FLAC 等单声道或立体声任选完全本地运行转换过程不上传任何文件读什么书只有你自己知道典型的使用场景通勤路上听完一本周报和小说、给娃做睡前故事、帮视力不好的家人读报纸、把英文原版书变成外语听力材料。⚠️ 一个前提只处理无 DRM 保护、合法获取的电子书作者不对滥用负责。低门槛启动2GB 内存的电脑就够跑先说实话E2A 对硬件的要求比你想的低得多但低和快是两回事。硬件门槛来自官方 README项目最低要求推荐配置内存2GB8GB显存1GB4GBPython3.10 – 3.12启动脚本自动装好不用你操心—处理器纯 CPU 即可NVIDIA 显卡CUDA、Apple SiliconMPS、AMDROCm都能加速有 GPU 体验接近实时没有独立显卡也没关系只是速度会从几乎实时降到慢慢磨后面排坑章节有对应解法。两步安装装完就能用# 第一步克隆仓库 git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook# 第二步启动首次运行会自动安装 Python 依赖稍等片刻 ./ebook2audiobook.command # Linux / macOS # Windows 用户直接双击 ebook2audiobook.cmd看到终端里蹦出http://localhost:7860/的地址后浏览器打开它图形界面就来了。图形界面四步走从上传到拿到音频界面是 Gradio网页版交互界面风格分标签页操作零基础也能跟着走完。第 1 步上传电子书预览章节在 Input Options 区域把文件拖进上传框。.epub和.mobi是自动识别章节效果最好的两种格式如果你的书里有目录页、版权页这类不想被读出来的内容建议先在阅读器里手动删掉再转换EPUB 格式没有统一的章节结构标准这是官方明确提醒的。另外这里还有个文本框入口最多 1024 个字符适合直接把一段短文转成语音试试声。第 2 步调音——温度、语速、引擎怎么填切到 Audio Generation Preferences 标签页几个关键旋钮的推荐取值温度Temperature控制语音的发挥空间越高越有变化、越不重复。求稳读小说建议从 0.6–0.8 之间起步Top-pTop-p 采样限制模型只从最可能的前 p 比例候选词里选调低如 0.8语音更自然、生成还更快语速Speed默认 1x通勤想赶进度可以拉高给孩子讲睡前故事就放慢引擎默认 XTTSv2质量最好、支持语音克隆纯 CPU 机器可换 YourTTS 或 Tacotron2 提速输出格式默认 M4B 单声道一般不用动第 3 步点 Convert然后去喝杯水长书转换需要时间进度条会在页面上实时滚动。中途反悔了点电子书上传组件上的 [X] 即可取消。第 4 步试听 下载转换完成后在结果页直接在线试听满意后点下载按钮文件同时保存在本地的audiobooks目录下。命令行与语音克隆进阶用户的批处理路线图形界面适合单本精修命令行headless 模式即不开界面直接跑转换才是批量党的主场。一个整文件夹批量转把一堆书放进一个目录一条命令全部读出来# 批量转换 books 目录下所有电子书输出到 audiobooks指定英语 ./ebook2audiobook.command --headless --ebooks_dir books --output_dir audiobooks --language eng所有参数一览可用--help查看完整清单也能在 lib/conf.py 的cli_options里查到。常用的还有--output_format指定输出格式mp3、m4b、wav……--device指定 CPU/CUDA/MPS 等计算设备--session转换中断或崩溃后凭会话 ID 断点续转不用从头再来三步克隆自己的声音朗读手机随便录一段1–5 分钟的人声wav 或 mp3 都行环境不用安静——README 明确说背景有噪声甚至音乐都没事E2A 会先把你的声音去噪清洗转换时加上--voice指向这段录音# 用你自己的声音读这本书 ./ebook2audiobook.command --headless --ebook books/moby_dick.epub --voice voices/my_voice.wav --language eng批量转换时还能用--voice_map传入一个 JSON 映射文件给不同书配不同讲述人比如给诗集配你的声音、给历史读物配家人的声音。更细的控制SML 标签文本里可以埋入 SMLSpecial Markup Language标签做精细编排[break]插入 0.3–0.6 秒短停顿、[pause]插入 1.0–1.6 秒长停顿、[pause:3]精确暂停 3 秒、[voice:路径]...[/voice]在句子中间切换讲述者。做多人对话的剧本式有声书这组标签就是全部家当。想要自动打标签可以看仓库内置的 components/E2A-SML/ 组件。两个能直接抄的作业方案方案 A通勤族地铁听书流水线适合每天通勤 30 分钟以上、想听完技术文档或长篇小说的人。周日下午花 10 分钟把下周想读的书放进一个文件夹用--ebooks_dir批量转--speed 1.2提 20% 语速输出选 MP3 格式手机、车机、蓝牙音箱全兼容如果听书 App 支持章节跳转就选默认的 M4B音频同步到手机地铁上从上次章节继续常用输出格式怎么选看这张表--output_format对应关系格式优点缺点什么时候选它M4B默认带章节标记有声书 App 直接认个别车机不支持长篇有声书、搭配 AudiobookshelfMP3兼容性最好到处能放无章节信息手机 / 车机 / 音箱WAV无损音质文件体积最大要后期剪辑、二次加工FLAC无损且比 WAV 小体积仍大于 MP3自己存档方案 B家长睡前故事 双语启蒙组合从公共领域书库找一本英文版童书.epub最佳自动分章最准语速设 0.9x[pause:2]在每章之间多留两秒节奏更舒缓想让孩子顺便学中文或反过来加一个--translate zho参数E2A 会先离线翻译整本再合成翻译版文件名自动加语言后缀和原版互不干扰进阶玩法用你自己的声音克隆读给孩子听——爸爸亲自讲的睡前故事比任何 AI 声线都亲切 一位做程序员的用户在讨论区留言每周日批量转好下周 3 章技术书通勤两小时听完半年听完了 5 本比啃文字快多了。另一位英语老师则拿它给学生批量生成课文音频孩子追着问我能不能再把故事换个人声读一遍。排坑与调音转换慢、声音不自然怎么办问题一转得太慢慢的根源通常是引擎跑在 CPU 上。按优先级排查先确认 GPU 被识别了——终端启动日志会打印检测到的设备有卡却没用上可用--device CUDA手动指定有 GPU 就保持默认 XTTSv2接近实时输出纯 CPU 机器换轻量引擎引擎音质CPU 速度适合谁XTTSv2默认高接近真人慢建议 GPU追求质量、要语音克隆Bark高表现力强慢需要情绪、语气变化YourTTS中等官方形容为Siri 水平快纯 CPU 机器注意不支持零样本克隆Tacotron2中等快纯 CPU 机器只求能听依赖装不上、环境冲突直接用 Docker 镜像官方说明它是完全自包含的一条docker run命令就能跑 GUI 或 headless 模式docker-compose.yml 已备好问题二声音不自然、听着像机器人念稿温度先试 0.6–0.8 区间微调太高会开始编词太低会机械Top-p 收到 0.8 左右Top-k 适当调小输出更可预测、生成还更快换个预调好的预设模型试试--fine_tuned指向官方预设如不同口音/风格的 XTTSv2 微调模型仓库里的 lib/conf_models.py 能看到引擎与默认参数对照音频被截断官方建议直接提 Issue 反馈——团队需要各语言的句子切分样本来修这个逻辑其他高频疑问想边转边推流加--abs_url等参数可直接写入 Audiobookshelf 服务器扫描版 PDF、纯图片的 JPG 也能转内置 OCR光学字符识别会先把图里的字认出来想自己训练一个专属声音模型仓库内置了 components/Universal_TTS_Finetune/ 训练组件和 Notebooks/finetune/xtts/colab_xtts_finetune_webui.ipynb 在线训练笔记本录 1–5 分钟素材就能起步去哪找免费书以及进阶方向素材从哪来首选公共领域书库——古登堡计划Project Gutenberg上的经典作品没有版权限制放心转。仓库自带的 ebooks/tests/ 目录里还有 80 多个语言版本的测试电子书.azw3 对应.txt想先试试某个语言的合成效果从这儿拿一本最方便。进阶三条路想要自动化的停顿与换声研究 components/E2A-SML/它负责把 SML 标签自动加进书里想拥有只属于你的声音模型用 Notebooks/colab_ebook2audiobook.ipynb 在无卡环境免费跑转换用 Universal_TTS_Finetune 训练专属模型后再通过--custom_model上传zip 包需含 config.json、model.pth、vocab.json、ref.wav想改默认行为lib/conf.py 里所有默认值输出格式、声道、目录都集中在那一段注释为CAN BE MODIFIED的区域官方建议改前先备份原文件现在就可以动手了把仓库拉下来从 ebooks/tests/ 挑一本测试书用默认设置转一首有声书出来听听——从第一声开口到批量生产线中间只隔着一个下午。【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表