ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

MLX-Audio 语音 AI 实操手册:Apple Silicon 上本地跑通 TTS 与 STT

MLX-Audio 语音 AI 实操手册:Apple Silicon 上本地跑通 TTS 与 STT MLX-Audio 语音 AI 实操手册Apple Silicon 上本地跑通 TTS 与 STT【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audioMLX-Audio 是构建在 Apple MLX 框架上的音频处理库覆盖文本转语音TTS、语音转文本STT、语音转语音STS和音乐生成四类能力。它只面向 Apple SiliconM1 到 M4和 Python 3.10 环境解决的核心痛点是不用把音频数据发到云端 API在本地 Mac 上完成语音合成、转写与声音处理。装好环境只需要一条命令安装分两种场景按需选择。pip 安装与按需依赖pip install mlx-audio依赖按功能拆分只装 TTS 可以用pip install mlx-audio[tts]STT 用[stt]全部功能用[all]。输出 WAV 无需额外工具要保存 MP3、FLAC、OGG、Opus 或 Vorbis 格式需先安装 ffmpegmacOS 上用brew install ffmpeg。开发模式与 Web 界面要跑 Web UI 或修改代码克隆仓库后以可编辑模式安装git clone https://gitcode.com/GitHub_Trending/ml/mlx-audio cd mlx-audio pip install -e .[dev,server]生成第一条语音装完后的第一步是命令行生成不需要写任何 Python 代码。最短视频生成命令mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text 你好欢迎使用 MLX-Audio \ --voice Vivian \ --play--play让结果直接播放而不落盘。多个参数控制输出行为--output_path指定保存目录--stream在生成时逐段流式输出--join_audio把多个分段合并为一个文件。用 Python 调用同样的流程from mlx_audio.tts.utils import load_model model load_model(mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit) for result in model.generate_custom_voice( Hello from MLX-Audio!, speakerVivian, languageEnglish, ): audio result.audio # mx.array 波形load_model接受 Hugging Face 模型 ID 或本地路径首次运行会自动下载权重。声音、语速与语言如何定制定制能力取决于所选模型三个关键参数是音色、语速和语言。预置音色与语言提示--voice选择预置音色如Vivian、Ryan--lang_code给出语言提示如English、auto。不同模型的音色命名体系不同Kokoro 提供 54 个音色预设包括af_heart、af_nova、am_michael等Voxtral TTS 有 20 个音色覆盖 9 种语言。Kokoro 还支持中文z、日文j、英式b等语言代码中文和日文需要额外安装misaki[zh]、misaki[ja]。语速调节--speed是播放速度倍率默认1.0。调低让语速更慢调高则相反适合有声书按角色调整节奏这类场景。用参考音频克隆音色不走预置音色时可以传一段参考音频。以 CSM 为例mlx_audio.tts.generate \ --model mlx-community/csm-1b \ --text Hello from Sesame. \ --ref_audio ./reference_voice.wav \ --playOmniVoice 和 LongCat-AudioDiT 也支持零样本克隆前者额外支持 646 语言和[laughter]、[sigh]这类非语言标签。更多细节见 docs/guides/voice-cloning.md。转写与声音处理TTS 之外的能力同一个库还能处理输入端的音频三条能力线各自对应不同模块。语音转文本Whisper 支持 99 语言Parakeet v3 面向 25 种欧洲语言且带词级时间戳VibeVoice-ASR 处理最长 60 分钟的长音频输出带说话人标签的 JSON。流式转写适用于低延迟场景Parakeet、Voxtral Realtime 均支持streamTrue。CLI 入口是python -m mlx_audio.stt.generate --model ... --audio ...。语音增强与音源分离STS 侧提供 MossFormer2 SE 和 DeepFilterNet 做降噪DialogueSidon 分离双声道对话SAM-Audio 用文本描述从混合音频中提取目标声音。examples/denoise/下附带了带噪声的样例音频可以直接试。批量生产场景examples/bible-audiobook/是一个完整的生产示例通过 mlx-audio 的 server 逐节调用 TTS在 Mac Mini M4 Pro 上把 31,102 节经文合成了 86 小时 32 分钟的音频。脚本基于 Bun 编写可断点续跑适合作为批量配音的参考实现。接进自己的应用API 服务与量化要嵌入自己的产品有两条路径REST API 和量化模型。OpenAI 兼容的 API 服务mlx_audio.server --host 0.0.0.0 --port 8000服务提供 OpenAI 兼容端点POST /v1/audio/speech做文本转语音POST /v1/audio/transcriptions做语音转文本。已有 OpenAI 客户端代码只需改 base URL 即可切换。配套的 Web UI 位于 mlx_audio/ui/npm install npm run dev启动带 3D 音频可视化。用量化压缩内存占用大模型内存吃紧时用python -m mlx_audio.convert把 Hugging Face 权重转成量化后的本地模型支持 3-bit 到 8-bit 以及mxfp4、mxfp8、nvfp4等模式。例如 Kokoro-82M 在官方仓库就同时提供 bf16、8bit、6bit、4bit 四个版本可按机器内存选用。参数说明见 docs/guides/quantization.md。iOS 与 macOS 原生应用集成可以看项目的 Swift 配套包用 MLX 在设备端直接跑 TTS。下一步从哪里入手最小路径是装好 pip 包用 Qwen3-TTS 的 8bit 版跑通第一条语音再按需求选模型——要音色多上 Kokoro要多语言上 OmniVoice 或 Voxtral要转写上 Whisper 或 Parakeet要降噪上 MossFormer2 SE。模型能力对照表以 README.md 的 Supported Models 章节和 docs/models/ 为准每个模型目录下的 README 都有各自的参数和流式示例。【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表