ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

FunASR 本地部署离线语音转写:一条命令在 10095 端口跑通 ASR、VAD 与标点全链路

FunASR 本地部署离线语音转写:一条命令在 10095 端口跑通 ASR、VAD 与标点全链路 FunASR 本地部署离线语音转写一条命令在 10095 端口跑通 ASR、VAD 与标点全链路【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASRFunASR 把 Paraformer 识别、FSMN VAD 端点检测、CT-Transformer 标点模型装进一个 Docker 服务音频全程不离开你的机器。本文面向会终端操作、但没接触过语音识别服务部署的开发者一条命令装好服务再一条命令转写文件内网里闭环。30 秒判断这套部署适不适合你判断项结论适合音频不能出网的业务客服录音质检、会议纪要归档、庭审与访谈转写目标是服务跑起来、文件转出来不打算训练或改模型不适合追求最低时延的实时对话需要 GPU 训练、微调 Paraformer 这类科研流程机器完全无法访问外网首次部署要拉镜像和模型对应三条实施路径本文主线是第一条内网服务器、没装过 Docker用 deploy_tools 里的funasr-runtime-deploy-offline-cpu-zh.sh它替你装 Docker、拉镜像、下模型、起容器已有 Docker 环境、想要自定义目录走 SDK_advanced_guide_offline.md 手动docker runrun_server.sh只要 Python 代码级 API、不要常驻服务跑 funasr_wss_server.py再轻量但并发不如 C 服务进程一条命令部署离线中文转写服务该一键脚本只支持 Linux内部按/etc/os-release识别发行版。Windows 用户请用 Docker Desktop 走上面的手动部署路径。前置条件三样root 权限、机器能访问外网、至少 10GB 空余磁盘镜像加三个模型。下面这条命令会依次拉取镜像、下载 ASR/VAD/标点三个模型并启动容器中途出现的菜单选镜像、选模型、输端口全部按 Enter 选默认即可成功的标志是打印The service has been started.cd runtime/deploy_tools sudo bash funasr-runtime-deploy-offline-cpu-zh.sh install装完的默认配置监听 10095 端口、开启 SSL、解码线程 32、IO 线程 8。全部产出集中在脚本同级的funasr-runtime-resources工作区models/存模型samples/是客户端示例和测试音频服务端配置落在~/.funasr_offline/config--show随时可查。验证 10095 端口上的服务存活在服务机或任意能访问 10095 端口的机器上探活返回HTTP/1.1 200或收到 WebSocket 握手响应即正常curl -k https://127.0.0.1:10095默认用自签证书开启 SSL所以协议是https客户端校验要加-k跳过嫌麻烦就update --ssl 0关掉加密仅限内网。日常运维用同一脚本的子命令--show可打印当前生效的全部配置sudo bash funasr-runtime-deploy-offline-cpu-zh.sh start sudo bash funasr-runtime-deploy-offline-cpu-zh.sh stop sudo bash funasr-runtime-deploy-offline-cpu-zh.sh restart sudo bash funasr-runtime-deploy-offline-cpu-zh.sh --show转写你的第一个音频文件客户端在 runtime/python/websocket/ 下。注意安装脚本已把 Python 客户端依赖click、websocket-client等装进了funasr-runtime-resources/samples/python/示例音频在samples/audio/asr_example.wav直接跑即可若要转 mp3、m4a客户端机还需 FFmpeg。指定--output_dir转写单文件终端实时打印文本、目录下生成 json 结果文件即为成功cd funasr-runtime-resources/samples/python python3 funasr_wss_client.py --mode offline --audio_in ../audio/asr_example.wav --output_dir ./out三种模式的取舍模式行为取舍offline整段识别精度最高归档转写选它online流式分块识别边说边出字精度略低2pass先流式出草稿再整段修正兼顾延迟与精度当前 Python 客户端没有--host参数默认连 127.0.0.1所以跨机器调用 Python 客户端要改funasr_wss_client.py里的目标地址C 客户端samples/cpp/funasr-wss-client --server-ip ip原生支持。批量转写音频列表与热词成百上千个文件别循环跑把--audio_in指向 wav.scp 列表--thread_num控制并发发送线程python3 funasr_wss_client.py --mode offline --audio_in ./audio.scp --thread_num 8 --output_dir ./outscp 每行必须是标签 空格 路径例如meeting_01 /data/audio/meeting01.mp3解析失败会把整行当文件名。术语老认错就加热词。文件里每行词 权重用--hotword传入python3 funasr_wss_client.py --mode offline --audio_in ./call.mp3 --hotword ./hotwords.txt两种热词加载方式按需选每次请求单独带--hotword传文件路径灵活但每个客户端都要传服务端全局加载在funasr-runtime-resources/models/放hotwords.txt服务端启动时自动读取对应容器内/workspace/models/hotwords.txt所有请求共享需要词级时间戳或神经网络热词模型换--asr_model时间戳用damo/speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-onnx热词模型用damo/speech_paraformer-large-contextual_asr_nat-zh-cn-16k-common-vocab8404-onnx。更完整的模型对照见 modelscope_models.md。面向生产环境并发、线程与端口SDK_tutorial.md 给出的 CPU 并发参考4C8G 约 32 并发、16C32G 约 64、64C128G 约 200压测前先看你的机器落在哪档。改线程、换端口、换模型都走update子命令改完即自动重启容器sudo bash funasr-runtime-deploy-offline-cpu-zh.sh update --decode_thread_num 16 sudo bash funasr-runtime-deploy-offline-cpu-zh.sh update --io_thread_num 4 sudo bash funasr-runtime-deploy-offline-cpu-zh.sh update --host_port 10096 sudo bash funasr-runtime-deploy-offline-cpu-zh.sh update --asr_model 模型ID或本地路径update改的是持久化配置只对重启后的容器生效线程数别贴着核数拉满默认 32/8 已按脚本内 CPU 核数推导先压测再调。四个会导致部署失败的坑一键脚本要求 root 且只认 Linux没有 sudo 的机器装不上 Docker得先解决权限。 客户端连不上时先查两处服务端是否--show里还是 10095 端口、SSL 开关--ssl 0与客户端--ssl参数是否一致。 非 16kHz 音频服务端会用内置 ffmpeg 重采样但格式太偏如高码率 m4a会解码失败建议先转 16k wav 再转写。 容器起不来、日志没反应时看工作区里的server_console.log~/.funasr_offline/server_console.log为服务端配置日志位置别只看脚本输出。这套一键脚本 WebSocket 客户端的组合适合音频不能出网、目标是稳定批量的转写业务如果你要的是毫秒级实时交互或模型训练选错路径了。完整能力清单在 runtime/quick_start.md 与 runtime/docs/SDK_advanced_guide_offline.md模型选型查 model_zoo/。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表