ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

3步把音频变成可编辑文字:Buzz 完整上手指南

3步把音频变成可编辑文字:Buzz 完整上手指南 3步把音频变成可编辑文字Buzz 完整上手指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款离线语音转文字工具它在你自己的电脑上完成全部识别工作底层由 OpenAI 开源的语音识别模型 Whisper 驱动音频与视频都不需要上传到任何服务器。它支持 99 种语言的转录也能把外语内容翻译成其他语言适合对数据隐私有要求、或经常处于无网络环境的使用者。读完本文你能做到在 Windows、macOS 或 Linux 上完成 Buzz 安装把本地音频/视频转成文本或 SRT 字幕根据硬件情况做出模型与格式的正确取舍适合谁怎么装Buzz 适合需要整理会议录音、课程笔记、采访和播客素材且希望数据留在本地的人。它不适合两类需求一是追求上传即得、希望云端秒级返回的批处理任务二是硬件很弱却要求实时低延迟转录的场景——本地识别速度取决于你机器的算力。Windows从官方发布页SourceForge下载安装文件并运行。应用未签名安装时会出现提示选择 More info → Run anyway 即可继续。macOS从同一页面下载 .dmg 文件并双击安装Intel 与 Apple Silicon 芯片均可运行。Linuxflatpak install flathub io.github.chidiwilliams.BuzzSnap 用户可以直接运行sudo snap install buzz也支持从 PyPI 安装pip install buzz-captions后运行python -m buzz。三步跑通第一次语音转文字导入音频或视频文件点击工具栏左上角的按钮或按 Ctrl/Cmd O选择要处理的 MP3、WAV、FLAC 或 MP4 文件。选择任务、语言与模型在任务行选择 Transcribe转录或 Translate to English翻译成英文在语言列手动选择语言——官方文档明确建议不要依赖自动检测再选择模型后端Whisper、Whisper.cpp 等与模型大小新模型可在偏好设置的模型页预先下载。运行并打开转录结果点击 Run等待状态列显示 Completed双击该行即可打开转录查看器开始校对与导出。用功能完成具体任务把会议录音变成可检索纪要转录查看器内置搜索Ctrl/Cmd F、可调 0.5x–2.0x 的播放速度、段落循环和跟随音频滚动。它能帮你把 2 小时的会议录音变成可随时定位的文本搜索预算直接跳到相关段落边播放边核对上下文。给视频生成规范的字幕文件导入时在高级设置中开启 Word-Level Timings词级时间戳转录完成后点击 Resize 按钮设定每条字幕最大长度并选择按标点拆分即可导出 SRT 或 VTT。它能帮你把一个 10 分钟教学视频转成行宽统一、断句合理的字幕直接导入剪辑软件。边开会边出文字选择任务、语言、模型与麦克风后点击 RecordBuzz 会对麦克风音频做实时转录。文档建议实时场景优先使用 Whisper.cpp 后端与小模型以降低延迟转录中还可以打开演示窗口把文字投到大屏幕上展示。把外语录音翻译成中文默认翻译任务由 Whisper 内置能力完成目标是英文要翻译成中文需要在偏好设置里配置一个 OpenAI 兼容的 API也支持本地运行的 Ollama 等服务然后在转录查看器点击 Translate。它能帮你把法语采访先转成法语文本、再译成中文两条结果分别导出。参数选择对照表场景推荐后端模型大小补充建议低配电脑快速预览Whisper.cpptiny / base手动指定语言日常会议转录Whisper.cppsmall需要字幕时开启词级时间戳高精度、多语混杂内容WhisperCUDA 加速medium / large需 NVIDIA 显卡实时录音转录Whisper.cppbase / small小模型降低延迟长视频批量出字幕Whisper.cppsmall词级时间戳 Resize 拆分取舍原则有 GPU 优先保准确率纯 CPU 优先保速度无论选多大的模型都请显式指定语言这比换模型带来的提升更稳定。端到端走一个真实任务以把一期 40 分钟的播客做成文字纪要 字幕为例完整流程如下点击 导入 episode01.mp3任务选 Transcribe语言选 zh模型选 Whisper.cpp 的 small导出格式 TXT并打开词级时间戳。点击 Run完成后双击该行打开转录查看器。用 Ctrl/Cmd F 搜索关键人名与术语逐条修正识别错误的段落。点击 Resize设定字幕最大长度并勾选按标点拆分从导出菜单先存 SRT再存一份 TXT 纯文本纪要。全程无需联网只有首次使用需要下载一次模型文件。常见疑问模型需要提前下载吗需要。打开偏好设置Ctrl/Cmd ,里的模型页下载你要的后端与大小的模型显存紧张时可改选量化版本如 q_5用少量精度换取更低的内存占用。模型是不是越大越好不是。更大的模型识别更准但推理更慢、更吃内存。日常对话用 small 通常足够遇到专有名词多或口音重的内容再升级到 medium / large。实时转录为什么跟不上实时转录算力开销大。换成 Whisper.cpp 后端、调小模型可以明显降低延迟CPU 场景下还可以通过环境变量 BUZZ_WHISPERCPP_N_THREADS 调整线程数官方文档提到合理设置约有 15% 的提速。所有功能都断网可用吗转录与本地导出完全离线。翻译除 Whisper 自带的译成英文外和 OpenAI API 后端需要网络也可以指向本地部署的兼容服务。下一步使用文档导入、实时录音、翻译、编辑、查看器docs/插件系统AI 摘要、自动字幕调整等buzz/plugins/命令行完整参数说明docs/docs/cli.md三条行动建议找一段 5 分钟以内的常用音频完成一次转录建立对速度的体感用同一文件分别跑 base 与 small对比准确率再固定你的默认模型在一个视频文件上开启词级时间戳完整走一遍 SRT 导出流程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表