ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

如何用 Buzz 做离线语音转文字:音频到字幕三步搞定,本地转录完整指南

如何用 Buzz 做离线语音转文字:音频到字幕三步搞定,本地转录完整指南 如何用 Buzz 做离线语音转文字音频到字幕三步搞定本地转录完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的离线语音转文字桌面工具。它用 OpenAI Whisper 模型在你自己的电脑上把音频、视频转成文字并翻译全程不上传任何音频适合需要会议记录、视频字幕制作和敏感内容整理的用户。它支持近百种语言、多种 Whisper 后端MIT 许可证。 最短路径三步拿到转录结果先拿安装包。macOS 下载 .dmgWindows 下载安装程序安装包未签名安装时弹出安全提示属正常现象选更多信息→仍要运行即可。Linux 用户一条命令flatpak install flathub io.github.chidiwilliams.Buzz习惯命令行的话用 pip 装。前提是机器上已装好 ffmpegPython 版本按 README 要求准备pip install buzz-captions python -m buzz打开主界面后三步走导入音频或视频也可以直接粘贴一个 URL在任务列表里选好模型、语言和任务点运行。只想出文件、不看界面的话一行命令搞定buzz add --srt --vtt --language zh meeting.mp3这条命令用默认的 Whisper 后端、默认的 tiny 模型最小、最快把 meeting.mp3 按中文转写在文件旁边同时生成 SRT 和 VTT 字幕。末尾可以跟多个文件1.4.6 起支持一次传多个也可以加--hide-gui把主窗口完全藏起来。 如何把会议录音转成文字场景手里有一段访谈录音或一小时会议音频想要一份可编辑的文本记录。导入文件在任务表格中为它选好模型、语言运行。每个文件的状态都在表里排队中、进行到百分之几、用时多少一目了然。几个值得知道的细节模型大小决定速度与准确率的平衡。机器慢就用 tiny 或 base 先出结果在意准确率再上 medium 以上。语言确定就指定如zh不确定就留空让它自动检测。转录完成后双击任务进入转录查看器支持搜索、播放和调速回放。要批量处理设置监视文件夹新文件落进某个目录Buzz 自动建任务并转录。入口在偏好设置的 Folder Watch 选项卡。 如何给视频生成字幕并调整时长场景做教程视频要一份能直接导入剪辑软件的字幕文件。导入视频文件即可Buzz 自动抽取音轨不用自己转格式。任务选转录按机器性能选 small 或 medium 模型运行。完成后打开转录查看器核对表格每一行带起止时间戳点一行就播放对应音频片段。字幕行太长、不适合上屏时打开 Resize 功能把间隔小于 0.2 秒的短句合并成一行、按标点断开、限制每行最大长度默认值通常够用点 Merge 就完事。导出 SRT 或 VTT 直接进剪辑软件。需要更精细的对齐时在高级设置里打开字级时间戳每个词都有独立时间点。️ 如何实时转录讲座并区分发言人场景现场活动或授课要文字实时出现还要分清是谁说的。切换到实时录音模式选好麦克风按下录音。Buzz 边听边转每隔几秒吐出一段文字。现场演示可以弹出演示窗口把实时文字投到大屏上字号可调。多人对话可以再做说话人识别在查看器里点Identify speakersMSDD 模型会自动把句子聚成不同说话人已知人数时也可以手动指定数量。识别结果可试听每人的 10 秒片段确认音色再把标签改成真名保存。注意说话人识别在 Intel macOS 上不可用。环境嘈杂的录音转录前勾选提取语音命令行参数是--extract-speech先把人声从背景噪声里分离出来准确率会好一截。常见坑速查问转录太慢怎么提速先换小模型tiny/base再换 Whisper.cpp 后端——它是 C 实现Vulkan 加速覆盖包括核显在内的大多数显卡。Nvidia 独显且有 6GB 以上显存的机器用 Faster Whisper比原版实现快一个数量级。问large 系模型那么多版本怎么选Large-V2 准确率稳定Large-V3 最新、多数场景最好但偶尔会脑补音频里没有的词Turbo 偏速度准确率平衡。名字带 .En 的模型只认英文。没有标准答案用自己语言的音频各试一遍最可靠。问专业名词、人名总认错两招在高级设置里填初始提示一段带领域上下文的文字把常用术语写进去语言已知就手动指定别依赖自动检测。问机器完全没网能用吗能。在有网的机器上下载好模型把模型文件夹整个拷到离线机的同一位置Linux 是~/.cache/Buzz即可模型位置在偏好设置的 Models 页点Show file location就能看到。问Windows 安装提示安全警告 / 录音没声音未签名的警告是正常现象更多信息 → 仍要运行。录音没声音多半是系统隐私设置挡住了 Buzz 的麦克风权限另外 CPU 需要支持 AVX2太老的机器跑不了。 技术底座大白话架构与扩展入口一句话概括PyQt6 桌面应用 本地 SQLite 数据库 可插拔的转录后端。数据层转录历史和设置全存在本地 SQLite实体定义与数据访问在 buzz/db/。后端层Whisper、Whisper.cpp、Faster Whisper、Hugging Face、OpenAI API 五种后端在 buzz/transcriber/ 目录里各占一个文件接新后端从这里入手最清楚。插件层一个插件就是一个文件夹plugin.py 里定义一个BuzzPlugin子类挂进转录前/转录后钩子。内置了 AI 摘要、DOCX 导出、字幕自动调整等见 buzz/plugins/。命令行全参数docs/docs/cli.md 列了完整选项和示例。 去哪找更多资料官方文档 docs/docs/ 目录按场景组织文件导入、实时录音、翻译、编辑调整、说话人识别、查看器、插件卡住时按场景翻对应一篇。模型选择、GPU 加速、离线使用这些高频问题在 FAQ 里都写得很细。遇到 bug 或有改进想法直接去项目 Issues 页提交维护者更新频率很高。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表