ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Vosk 离线语音识别 5 分钟跑通:20+ 语言、流式识别、说话人识别全都有

Vosk 离线语音识别 5 分钟跑通:20+ 语言、流式识别、说话人识别全都有 Vosk 离线语音识别 5 分钟跑通20 语言、流式识别、说话人识别全都有【免费下载链接】vosk-apiOffline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node项目地址: https://gitcode.com/GitHub_Trending/vo/vosk-apiVosk 是一个完全在本地运行的离线语音识别工具包模型约 50MB装上就能把英语、中文、日语等 20 多种语言的音频转成文字全程不联网。识别结果不出设备流式 API 延迟极低同一套代码从树莓派、Android 手机一直能用到服务器集群。为什么先考虑离线语音识别很多场景里把音频发到云端换文字既慢又不合适数据不出设备医疗记录、会议录音这类敏感音频本地处理最稳妥实时性基于流式 API 边收音边出结果适合实时字幕、语音助手可用性断网环境照常工作也没有 API 调用成本最小上手路径模型下载与放置位置整条链路分三步装库、放模型、喂音频。git clone https://gitcode.com/GitHub_Trending/vo/vosk-api pip install vosk模型的放置有三种方式见 python/example/test_simple.py 的注释Model(langen-us)首次调用自动下载并缓存Model(model_namevosk-model-en-us-0.21)按名称加载Model(models/en)直接指向你手动解压的本地目录。核心调用不到十行下面是简化版 demofrom vosk import Model, KaldiRecognizer, SetLogLevel SetLogLevel(-1) model Model(langen-us) # 首次运行自动下载模型 rec KaldiRecognizer(model, 16000) rec.SetWords(True) # 输出词级时间戳输入音频要求是 16kHz、单声道、16-bit PCM 的 WAV 文件。完整写法直接看 python/example/ 目录里面有 17 个示例脚本。能力细节逐项展开流式识别。调用rec.AcceptWaveform(data)分段喂音频PartialResult()返回中间结果Result()返回整段终稿。开着SetWords(True)后每个词都带 start/end 时间戳和置信度做实时字幕就靠这个。字幕生成。python/example/test_srt.py 输出 SRTtest_webvtt.py 输出 WebVTT。命令行场景可以直接用内置 transcriberpython -m vosk.transcriber -m vosk-model-en-us-0.21 input.wav -o out.srt它内部会调 ffmpeg 重采样输出支持 srt、txt、json 三种格式源码在 python/vosk/transcriber/。批量处理。test_gpu_batch.py 演示多 worker 批量识别go/batch_example/ 是 Go 版对照示例。说话人识别。test_speaker.py 里用SpkModel加载声纹模型识别结果中会带spk字段拿余弦距离和库里存的指纹比对就能区分是谁在说话。多语言绑定按技术栈选目录仓库给每种语言都留了目录选对应入口即可目录说明python/绑定最全example/ 下示例最多java/ 和 android/Java 库加 Android 服务封装SpeechService.java 处理录音权限和生命周期kotlin/Kotlin Multiplatform 绑定覆盖 jvm/android/native 三个目标nodejs/demo/ 里有麦克风、ffmpeg 转流、说话人识别示例csharp/附带 nuget/ 下的 NuGet 打包配置go/通过 CGO 绑定example/ 是最小 demosrc/C 核心vosk_api.h就是全部 C 接口选型与避坑清单注意这几处能少走很多弯路WAV 格式不达标会直接退出非单声道 16-bit PCM 的输入示例脚本会报错终止。手头是 mp3 就用 ffmpeg 转test_ffmpeg.py 给了现成命令模型大小标准模型约 50MB内存紧张的设备树莓派、手机优先考虑这个量级追求准确率再上大模型日志开关SetLogLevel(-1)关掉调试输出生产环境建议加上Go 批量示例libvosk.so必须在库路径里否则会加载失败见 go/batch_example/README.md说话人识别短于 4 秒的语音片段x-vector 指纹不可靠test_speaker.py末尾专门注明了这一点项目入口导航跑示例、抄代码python/example/看核心实现src/ 下的recognizer.cc、model.cc自训语言模型training/基于 Kaldi 的训练脚本跨平台构建CMakeLists.txt 和 travis/ 里的 Docker 构建脚本建议下一步先用本地音频跑一遍 python/example/test_simple.py确认链路通了再读 test_srt.py 接字幕输出。【免费下载链接】vosk-apiOffline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node项目地址: https://gitcode.com/GitHub_Trending/vo/vosk-api创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表