ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

PaddleSpeech 语音应用实战:15 个开箱即用的 Demo 场景全解析

PaddleSpeech 语音应用实战:15 个开箱即用的 Demo 场景全解析 人工智能语音音频【免费下载链接】PaddleSpeechEasy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation and Keyword Spotting. Won NAACL2022 Best Demo Award.项目地址https://gitcode.com/gh_mirrors/pa/PaddleSpeech点击查看免费下载导读PaddleSpeech 是集语音识别ASR、语音合成TTS、声音分类、说话人验证、语音翻译、关键词检测等于一体的开源语音工具包。仓库的 demos 目录集中了 15 个覆盖不同业务场景的语音应用示例——从单条命令的离线 ASR/TTS到基于 WebSocket 的流式识别与合成服务再到结合向量数据库的音频检索、基于 OCR 的会说话故事书等创意应用。本文将逐一剖析每个 Demo 的应用背景、核心命令、参数含义与源码依据帮助你按需挑选并快速落地自己的语音应用。一、Demo 全景地图根据 demos/README.md英文与 demos/README_cn.md中文该目录包含以下应用场景一句话说明对应目录声音检索海量音频相似性检索audio_searching声音分类基于 AudioSet 527 类标签的音频多标签分类audio_tagging视频字幕生成识别视频中的语音并做文本后处理automatic_video_subtitiles元宇宙基于语音合成的 2D 增强现实让照片开口说话metaverse标点恢复为无标点纯文本添加标点punctuation_restoration语音识别识别音频中的语音文字speech_recognition语音服务离线语音服务ASR、TTS、CLS 等speech_server流式语音识别服务通过 WebSocket 流式输入并识别streaming_asr_server流式语音合成服务根据文本流式生成合成音频streaming_tts_server语音翻译识别音频语言并翻译成目标语言speech_translation会说话的故事书基于 OCR 与 TTS 的儿童故事书阅读story_talker个性化语音合成基于 FastSpeech2 的多风格控制style_fs2语音合成基于文本生成语音音频text_to_speech自监督预训练基于 wav2vec2 的特征提取与识别speech_sslWhisper基于 Whisper 模型的识别与翻译whisper几乎所有 Demo 都遵循同一套使用范式安装 PaddleSpeech → 准备输入WAV 音频或文本→ 通过paddlespeech命令行或 Python API 执行。命令行入口的实现位于 paddlespeech/cli含 asr、tts、cls、st、text、whisper、ssl 等子模块服务类 Demo 则依赖 paddlespeech/server 下的paddlespeech_server/paddlespeech_client工具。二、离线单命令类 Demo一条命令完成任务2.1 语音识别ASR语音识别 Demo 的目标是把一段音频自动转写成文字Speech-to-Text。输入必须是 WAV 文件且采样率需与模型一致默认 16kwget -c https://paddlespeech.cdn.bcebos.com/PaddleAudio/zh.wav https://paddlespeech.cdn.bcebos.com/PaddleAudio/en.wav https://paddlespeech.cdn.bcebos.com/PaddleAudio/ch_zh_mix.wav典型命令# 中文识别 paddlespeech asr --input ./zh.wav -v # 英文识别 paddlespeech asr --model transformer_librispeech --lang en --input ./en.wav -v # 中英混说Code-Switch paddlespeech asr --model conformer_talcs --lang zh_en --codeswitch True --input ./ch_zh_mix.wav -v # 中文 ASR 标点恢复管道式组合 paddlespeech asr --input ./zh.wav -v | paddlespeech text --task punc -v核心参数来自 speech_recognition/README.md参数含义默认值input必填待识别音频文件—model模型类型conformer_wenetspeechlang模型语言zhcodeswitch是否启用中英混说模型Falsesample_rate模型采样率16000config/ckpt_path自定义配置与权重置 None 使用预训练模型Noneyes自动接受程序请求包括音频采样率转换Falsedevice推理设备当前环境 Paddle 默认设备verbose是否显示日志关闭paddlespeech asr的底层实现对应 paddlespeech/cli/asr 中的ASRExecutor。文档给出的输出示例[2021-12-08 13:12:34,063] [ INFO] [utils.py] [L225] - ASR Result: 我认为跑步最重要的就是给我带来了身体健康官方支持的 ASR 预训练模型包括conformer_wenetspeech、conformer_online_multicn、conformer_aishell、conformer_online_aishell、transformer_librispeech、deepspeech2online_wenetspeech、deepspeech2offline_aishell、deepspeech2online_aishell、deepspeech2offline_librispeech、conformer_talcs支持中英混说采样率均为 16k。2.2 语音合成TTS语音合成 Demo 把文本转换为语音。默认声学模型为Fastspeech2、默认声码器为HiFiGAN、默认推理方式为动态图推理。中文一行搞定paddlespeech tts --input 你好欢迎使用百度飞桨深度学习框架批量处理利用 stdin 按行传入序号 文本echo -e 1 欢迎光临。\n2 谢谢惠顾。 | paddlespeech tts多语言/多说话人组合示例# 中文换用 SpeedySpeech 声学模型 paddlespeech tts --am speedyspeech_csmsc --input 你好欢迎使用百度飞桨深度学习框架 # 中文多说话人AISHELL-3可改 spk_id paddlespeech tts --am fastspeech2_aishell3 --voc pwgan_aishell3 --input 你好欢迎使用百度飞桨深度学习框架 --spk_id 0 # 英文 paddlespeech tts --am fastspeech2_ljspeech --voc pwgan_ljspeech --lang en --input hello world # 英文多说话人VCTK paddlespeech tts --am fastspeech2_vctk --voc pwgan_vctk --input hello, boys --lang en --spk_id 0 # 中英混说am 必须为 fastspeech2_mixlang 必须为 mixspk 174 为 csmsc 音色175 为 ljspeech 音色 paddlespeech tts --am fastspeech2_mix --voc hifigan_csmsc --lang mix --input 热烈欢迎您在 Discussions 中提交问题并在 Issues 中指出发现的 bug。 --spk_id 174 --output mix_spk174.wav # 男声混说模型 paddlespeech tts --am fastspeech2_male --voc hifigan_male --lang mix --input 我们的声学模型使用了 Fast Speech Two。 --output male_mix_fs2_hifigan.wav # 粤语 paddlespeech tts --am fastspeech2_canton --voc pwgan_aishell3 --input 各个国家有各个国家嘅国歌 --lang canton --spk_id 10ONNXRuntime 推理加速加--use_onnx True并支持--am/--voc自由组合paddlespeech tts --input 你好欢迎使用百度飞桨深度学习框架 --output default.wav --use_onnx True paddlespeech tts --am speedyspeech_csmsc --input 你好欢迎使用百度飞桨深度学习框架 --output ss.wav --use_onnx True paddlespeech tts --am fastspeech2_ljspeech --voc hifigan_ljspeech --lang en --input Life was like a box of chocolates. --output lj_fs2_hifigan.wav --use_onnx True paddlespeech tts --am fastspeech2_canton --voc pwgan_aishell3 --lang canton --spk_id 10 --input 各个国家有各个国家嘅国歌 --output output_canton.wav --use_onnx Truepaddlespeech tts关键参数paddlespeech tts --help可查看全部参数含义默认值input必填待合成文本—am声学模型类型fastspeech2_csmscam_config/am_ckpt/am_stat声学模型配置/权重/归一化统计量置 None 用预训练模型Nonephones_dict/tones_dict/speaker_dict音素/声调/说话人映射文件Nonespk_id多说话人模型说话人 ID0voc声码器类型pwgan_csmscvoc_config/voc_ckpt/voc_stat声码器配置/权重/统计量Nonelang语言zhdevice推理设备环境默认output输出 wav 路径output.wavuse_onnx是否使用 ONNXRuntime 推理关闭fs指定 ONNX 模型文件时的采样率无对应实现见 paddlespeech/cli/tts 的TTSExecutor。Python API 调用方式import paddle from paddlespeech.cli.tts import TTSExecutor tts_executor TTSExecutor() wav_file tts_executor( text今天的天气不错啊, outputoutput.wav, amfastspeech2_csmsc, spk_id0, vocpwgan_csmsc, langzh, devicepaddle.get_device()) print(Wave file has been generated: {}.format(wav_file))ONNXRuntime 推理的 Python 写法只需追加use_onnxTrue, cpu_threads2。预训练模型清单摘自 text_to_speech/README.md声学模型speedyspeech_csmsc(zh)、fastspeech2_csmsc(zh)、fastspeech2_ljspeech(en)、fastspeech2_aishell3(zh)、fastspeech2_vctk(en)、fastspeech2_cnndecoder_csmsc(zh)、fastspeech2_mix(mix)、tacotron2_csmsc(zh)、tacotron2_ljspeech(en)、fastspeech2_male(zh/en/mix)、fastspeech2_canton(canton)声码器pwgan_csmsc、pwgan_ljspeech、pwgan_aishell3、pwgan_vctk、mb_melgan_csmsc、style_melgan_csmsc、hifigan_csmsc、hifigan_ljspeech、hifigan_aishell3、hifigan_vctk、wavernn_csmsc、pwgan_male、hifigan_male2.3 声音分类Audio Tagging声音分类 Demo 对一段音频打上 1 个或多个 AudioSet 标签共 527 类属于多标签分类任务。下载示例音频后执行wget -c https://paddlespeech.cdn.bcebos.com/PaddleAudio/cat.wav https://paddlespeech.cdn.bcebos.com/PaddleAudio/dog.wav paddlespeech cls --input ./cat.wav --topk 10参数要点model默认panns_cnn14topk控制展示前 N 个标签默认 1label_file置 None 时使用 AudioSet 默认标签。文档给出的输出示例对猫叫音频CLS Result: Cat: 0.8991316556930542 Domestic animals, pets: 0.8806838393211365 Meow: 0.8784668445587158 Animal: 0.8776564598083496 Caterwaul: 0.2232048511505127预训练模型panns_cnn6/panns_cnn10/panns_cnn14采样率均为 32000。Python API 使用paddlespeech.cli.cls.CLSExecutor。2.4 标点恢复Punctuation Restoration标点恢复 Demo 是 ASR 的常见文本后处理任务为无标点文本补上标点以提升可读性并方便下游 NLPpaddlespeech text --input 今天的天气真不错啊你下午有空吗我想约你一起去吃饭 # 输出今天的天气真不错啊你下午有空吗我想约你一起去吃饭。参数task默认puncmodel默认ernie_linear_p7_wudaolang默认zhpunc_vocab为标点词表文件默认 None。Python 侧对应 paddlespeech/cli/text 的TextExecutor。该任务既可作为独立命令也可与 ASR 通过管道组合见 2.1 节还常与流式 ASR 服务串联见 4.2 节。2.5 语音翻译Speech Translation语音翻译 Demo 实现端到端语音翻译识别音频中的语言并翻译成目标语言当前不支持 Windowswget -c https://paddlespeech.cdn.bcebos.com/PaddleAudio/zh.wav https://paddlespeech.cdn.bcebos.com/PaddleAudio/en.wav paddlespeech st --input ./en.wav # 输出ST Result: [我 在 这栋 建筑 的 古老 门上 敲门 。]参数model默认fat_st_tedsrc_lang默认entgt_lang默认zhsample_rate默认16000。实现位于 paddlespeech/cli/st 的STExecutor。2.6 自监督预训练模型Speech SSLSpeech SSL Demo 基于 wav2vec2 等自监督模型支持两种任务asr语音识别与vector提取声学表征wget -c https://paddlespeech.cdn.bcebos.com/PaddleAudio/en.wav # 识别文本 paddlespeech ssl --task asr --lang en --input ./en.wav # 提取声学表征 paddlespeech ssl --task vector --lang en --input ./en.wav参数model可选wav2vec2/hubert/wavlm默认wav2vec2task默认asr。自监督模型在大规模无标注语音上训练得到通用声学表征再通过下游任务微调迁移实现位于 paddlespeech/cli/ssl。2.7 Whisper 识别与翻译Whisper Demo 接入 OpenAI 的 Whisper 通用语音识别模型支持多语种识别、语音翻译与语种识别wget -c https://paddlespeech.cdn.bcebos.com/PaddleAudio/zh.wav # 转写 paddlespeech whisper --task transcribe --input ./zh.wav # 指定英文 only 模型base 尺寸 paddlespeech whisper --lang en --size base --task transcribe --input ./en.wav # 识别并翻译成英文 paddlespeech whisper --task translate --input ./zh.wav参数task默认transcribesize默认turbo支持[turbo, large, medium, base, small, tiny]lang置en可选择 English-only 模型medium/base/small/tiny支持language可强制指定识别语种sample_rate固定 16000。实现对应 paddlespeech/cli/whisper 的WhisperExecutor。三、创意应用类 Demo跨模块组合玩法3.1 视频字幕生成automatic_video_subtitiles 使用 ASR 标点恢复为视频自动生成字幕。先下载视频并抽取单声道 16k WAVwget -c https://paddlespeech.cdn.bcebos.com/demos/asr_demos/subtitle_demo1.mp4 ffmpeg -i subtitle_demo1.mp4 -ac 1 -ar 16000 -vn input.wav再通过 Python API 串联ASRExecutor与TextExecutorimport paddle from paddlespeech.cli.asr import ASRExecutor from paddlespeech.cli.text import TextExecutor asr_executor ASRExecutor() text_executor TextExecutor() text asr_executor(audio_fileinput.wav, devicepaddle.get_device()) result text_executor(texttext, taskpunc, modelernie_linear_p3_wudao, devicepaddle.get_device()) print(Text Result: \n{}.format(result))文档输出示例为当我说我可以把三十年的经验变成一个准确的算法他们说不可能。当我说我们十个人就能实现对十九个城市变电站七乘二十四小时的实时监管他们说不可能。若需生成 .srt 字幕文件也可直接复用流式 ASR 服务端提供的websocket_client_srt.py脚本见 4.3 节。3.2 会说话的故事书Story Talkerstory_talker 面向低龄儿童“听书”场景用PaddleOCR识别故事书文字再用 PaddleSpeech 的 TTS 模块朗读。运行./run.sh3.3 元宇宙让照片开口说话metaverse 将 PaddleSpeech TTS 与 PaddleGAN 组合让图片中的人物“说出”指定内容构造 2D 虚拟人。一键脚本完成安装与运行./run.sh脚本内会先source path.sh设置环境变量修改sentences.txt可更换台词替换脚本中的download/Lamarr.png可更换图片。3.4 个性化语音合成Style FastSpeech2style_fs2 利用 FastSpeech2 的可控输入音素时长、能量、音高做风格控制调整duration可改变语速且保持音高不变许多工具变速会连带改变音高将整句pitch设为均值、tones置 1可得到机器人风格音色按固定比例抬高成年女性的pitch可得到儿童风格音色句子中不同音素的duration/pitch可分别设置不同缩放比例以强调或弱化某些音素的发音。运行方式./run.sh脚本会先source path.sh设置环境变量替换sentences.txt可尝试自定义句子细节实现在style_syn.py中。3.5 海量音频相似性检索Audio Searchingaudio_searching 是最完整的系统级 Demo用 PaddleSpeech 预训练模型说话人识别模型ecapa_tdnn等把音频转成向量存入开源向量数据库Milvus并用MySQL保存 ID 与音频元信息的映射实现亿级音频的相似性检索可用于找相似音效、防止版权侵权、声纹库快速检索、反欺诈等。整体流程文档原图 img/audio_searching.png上传音频 → PaddleSpeech 模型提取 embedding 向量 → 存入 MilvusMilvus 为每个向量生成唯一 IDID 与音频信息音频 ID、说话人 ID 等写入 MySQL 完成建库检索时对测试音频提向量 → Milvus 做向量相似度搜索 → 按返回的向量 ID 去 MySQL 反查音频信息。搭建步骤# 1. 一键启动 Milvus MySQL Web 前端容器 cd demos/audio_searching/ docker-compose -f docker-compose.yaml up -d # 2. 安装 Python 依赖并启动 FastAPI 后端 pip install -r requirements.txt export PYTHONPATH$PYTHONPATH:./src python src/audio_search.py # Uvicorn running on http://0.0.0.0:8002 # 3. 端到端脚本测试下载数据、提向量、建库、检索、删库 python ./src/test_audio_search.py关键配置src/config.py本地运行可跳过参数说明默认值MILVUS_HOST/MILVUS_PORTMilvus 地址与端口127.0.0.1/19530VECTOR_DIMENSION向量维度2048MYSQL_HOST/MYSQL_PORTMySQL 地址与端口127.0.0.1/3306DEFAULT_TABLEMilvus/MySQL 默认集合名audio_table文档基于 CN-Celeb 数据集65 万训练音频、1 万测试音频、3000 说话人、向量维度 192、L2 距离给出的实测数据为特征提取约 500 ms、基于 Milvus 的检索约 2.9 ms90% 召回率前提下、单条 5 秒测试音频总耗时约 503 ms。文档同时说明这些数据来自特定机器配置CentOS 7.6 / Xeon E5-2620 v4 / 132G 内存并提示数据集可按需替换如 Librispeech、VoxCeleb、UrbanSound 等。支持的前端地址为127.0.0.1:8068若浏览器与服务不在同一台机器需同步修改docker-compose.yaml中的API_URL并重新执行 compose。四、服务化部署类 DemoServer / Client 架构服务类 Demo 均基于paddlespeech_server与paddlespeech_client两个命令行工具实现见 paddlespeech/server/bin配置采用 YAML 文件驱动。4.1 离线语音服务Speech Serverspeech_server 提供离线多任务语音服务engine_list按语音任务_引擎类型格式声明要启动的引擎。目前已集成任务包括asr语音识别、tts语音合成、cls声音分类引擎类型支持python与inferencePaddle Inference。配置示例位于 conf/application.yaml中英混说识别请改用 conf/conformer_talcs_application.yaml。paddlespeech_server start --config_file ./conf/application.yaml容器中若服务正常启动但客户端访问不到可尝试把配置文件中的host改为本机局域网 IP。官方建议使用 paddlepaddle 2.4rc 及以上版本。4.2 流式语音识别服务Streaming ASR Serverstreaming_asr_server 接收 WebSocket 音频流并实时输出转写文本。该服务只支持websocket协议不支持http。目前集成的模型包括 DeepSpeech2 与 Conformer。# 启动服务默认 CPU改配置文件中 device 参数可部署到 GPU paddlespeech_server start --config_file ./conf/ws_conformer_wenetspeech_application.yaml # 更快解码但精度略降的配置 paddlespeech_server start --config_file ./conf/ws_conformer_wenetspeech_application_faster.yaml启动成功后日志会显示Uvicorn running on http://0.0.0.0:8090。客户端调用paddlespeech_client asr_online --server_ip 127.0.0.1 --port 8090 --input ./zh.wav客户端参数server_ip默认 127.0.0.1、port默认 8090、input必填、sample_rate默认 16000、lang默认 zh_cn、audio_format默认 wav、punc.server_ip/punc.server_port可选指向标点服务。客户端日志会逐帧显示增量识别结果最后返回带逐字时间戳的完整结果client final receive msg{status: ok, signal: finished, result: 我认为跑步最重要的就是给我带来了身体健康, times: [{w: 我, bg: 0.0, ed: 0.7}, ...]}Python 端使用paddlespeech.server.bin.paddlespeech_server.ServerExecutor服务端与paddlespeech.server.bin.paddlespeech_client.ASROnlineClientExecutor客户端。流式 ASR 标点服务串联用bash server.sh或分别启动两个服务conf/ws_conformer_wenetspeech_application.yaml 与 conf/punc_application.yaml后者默认监听 8190 端口然后paddlespeech_client asr_online --server_ip 127.0.0.1 --port 8090 --punc.server_ip 127.0.0.1 --punc.port 8190 --input ./zh.wav # 或使用仓库脚本 python3 local/websocket_client.py --server_ip 127.0.0.1 --port 8090 --punc.server_ip 127.0.0.1 --punc.port 8190 --wavfile ./zh.wav串联后输出即变为带标点的流式文本我认为跑步最重要的就是给我带来了身体健康。4.3 流式识别生成 SRT 字幕在 streaming_asr_server 目录下还可以用local/websocket_client_srt.py同时调用流式识别与标点服务直接生成.srt字幕文件需先安装 ffmpeg输入支持.wav或.mp3paddlespeech_server start --config_file ./conf/ws_conformer_wenetspeech_application.yaml # 另开终端 paddlespeech_server start --config_file conf/punc_application.yaml # 再开终端调用客户端 python3 local/websocket_client_srt.py --server_ip 127.0.0.1 --port 8090 --punc.server_ip 127.0.0.1 --punc.port 8190 --wavfile ../../data/认知.mp3脚本会先通过 ffmpeg 把 mp3 转为 wav流式转写并恢复标点后按句子切分依据逐字时间戳输出到认知.srt文档日志末尾可见results saved to .../认知.srt。4.4 流式语音合成服务Streaming TTS Serverstreaming_tts_server 根据文本流式返回合成音频同时支持 http 与 websocket 两种协议由配置文件 conf/tts_online_application.yaml 中的protocol字段决定。engine_list取tts_onlinePython 动态图推理或tts_online-onnxonnxruntime 推理速度更快。模型与块推理chunk inference机制是该 Demo 的核心AM声学模型支持fastspeech2与fastspeech2_cnndecoderfastspeech2不支持流式 AM 推理am_pad/am_block对其无效fastspeech2_cnndecoder支持流式推理am_pad12时流式合成音频与整句合成一致Voc声码器支持hifigan与mb_melganmb_melgan在voc_pad14时与整句一致最小可设voc_pad7低于 7 会听到异常音hifigan在voc_pad19时与整句一致voc_pad14时无听觉异常am_block/am_pad分别表示每个 chunk 的有效帧数与前后补帧数补帧用于消除流式推理误差速度上mb_melgan hifigan音质上mb_melgan hifigan。启动服务并调用http 方式paddlespeech_server start --config_file ./conf/tts_online_application.yaml paddlespeech_client tts_online --server_ip 127.0.0.1 --port 8092 --protocol http --input 您好欢迎使用百度飞桨语音合成服务。 --output output.wavwebsocket 方式仅需把配置文件protocol改为websocket并把客户端参数--protocol websocket。客户端参数server_ip默认 127.0.0.1、port默认 8092、protocolhttp/websocket默认 http、input必填、spk_id默认 0当前代码仅支持单说话人模型因此不生效、output默认不保存本地、play是否边合成边播放需依赖 pyaudio。注意流式 TTS 不支持改变采样率、变速与变调。文档给出的 http 调用输出示例句子您好欢迎使用百度飞桨语音合成服务。 首包响应0.18863153457641602 s 尾包响应3.1427218914031982 s 音频时长3.825 s RTF: 0.8216266382753459 音频保存至output.wav五、附录快速选型参考需求推荐 Demo最小操作快速转写单条音频speech_recognitionpaddlespeech asr --input a.wav文本转语音text_to_speechpaddlespeech tts --input 你好音频打标签audio_taggingpaddlespeech cls --input a.wav --topk 10文本补标点punctuation_restorationpaddlespeech text --input 无标点文本语音翻译speech_translationpaddlespeech st --input a.wav实时流式识别streaming_asr_serverServer asr_onlineclient实时流式合成streaming_tts_serverServer tts_onlineclient离线多任务服务speech_serverpaddlespeech_server start --config_file ./conf/application.yaml海量音频检索audio_searchingdocker-compose python src/audio_search.py视频/音频字幕automatic_video_subtitiles / streaming ASR 的 srt 脚本ASR标点串联图片人物发声metaverse./run.sh故事书朗读story_talker./run.sh风格化合成style_fs2./run.sh自监督表征/识别speech_sslpaddlespeech ssl --task asr/vector多语种识别/翻译whisperpaddlespeech whisper --task transcribe/translate所有 Demo 的使用前提都是先完成 安装指南提供 easy / medium / hard 三档安装方式easy 模式安装服务类 Demo 时需自行参考conf目录准备 YAML 配置。离线条命令的参数详解可用paddlespeech task --help查看服务类参数可用paddlespeech_server start --help与paddlespeech_client subcommand --help查看。结语PaddleSpeech 的demos目录展示了从“单命令工具”到“可上线的 Server/Client 服务”再到“跨模块创意应用”的完整落地梯度。无论你是想快速验证模型效果、为产品接入流式识别/合成还是搭建音频检索系统都能在 demos/README.md 中找到对应的可直接运行的起点而每个子目录 README 中的参数表、输出日志与 paddlespeech/cli、paddlespeech/server 的源码相互印证可作为进一步定制开发的技术依据。赞分享人工智能语音音频【免费下载链接】PaddleSpeechEasy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation and Keyword Spotting. Won NAACL2022 Best Demo Award.项目地址https://gitcode.com/gh_mirrors/pa/PaddleSpeech点击查看免费下载相关推荐PaddleSpeech 语音应用实战指南demos 目录全场景解析PaddleSpeech 语音应用实战指南demos 目录全场景解析 PaddleSpeech 的 demos/ 目录汇集了 15 个可直接运行的语音应用示例人工智能语音音频NLP媒体生成3行代码实现语音合成PaddleSpeech全场景应用指南3行代码实现语音合成PaddleSpeech全场景应用指南 你还在为语音合成开发复杂、效果差而烦恼吗是否想快速将文字转换为自然流畅的语音应用到教育、客服、人工智能语音音频GenieX技术深度解析高通设备本地AI推理SDK架构设计与实战应用GenieX技术深度解析高通设备本地AI推理SDK架构设计与实战应用 GenieX是高通推出的端侧AI推理运行时专门为Snapdragon设备优化支持在H人工智能大模型推理引擎本地部署多模态创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表