ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Buzz 本地语音转文字:45 分钟录音离线转录,5 分钟跑通全流程

Buzz 本地语音转文字:45 分钟录音离线转录,5 分钟跑通全流程 Buzz 本地语音转文字45 分钟录音离线转录5 分钟跑通全流程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz刚结束一场访谈录音笔里躺着一段 45 分钟的对话需要转成文字。上传给在线服务的话谈话内容得先经过别人家的服务器。Buzz 就是为这种场景做的离线音频转录全部跑在你自己的电脑上由 Whisper 模型驱动音频文件不出设备转完还能直接导出 SRT 字幕。Buzz 能做什么一句话定位Buzz 是一个桌面应用用 Whisper 在本地把音频、视频转成文字和字幕然后交给你在界面上编辑导出。功能一句话说明典型用途离线转录本地 Whisper 模型处理 MP3、WAV、M4A、MP4 等文件会议录音、访谈素材批量处理多个文件排队依次转录进度实时可见播客、课程系列批量归档实时录音麦克风边录边转文本随说话显示现场会议、课堂笔记字幕编辑与导出逐段改时间轴和文字导出 SRT / VTT / TXT给视频补字幕多语言识别支持 99 种以上语言可指定语言或自动检测外语材料、多语种内容整条链路从读取音频到生成文本都在本机完成敏感录音不用担心被上传。Buzz 安装步骤5 分钟跑起来按平台选一种方式命令都合在下面一个代码块里。Windows从发行版页面下载安装包双击安装程序未签名遇到警告点更多信息→仍要运行。macOS下载 .dmg拖进应用程序首次启动允许打开即可Intel 和 Apple silicon 都支持。Linux推荐 Snap 版先装 portaudio 等依赖也可以走 Flatpak。Python需要系统里已有 ffmpeg装完包直接用模块方式启动。# Windows下载安装包后双击安装未签名弹窗选更多信息 → 仍要运行 # macOS下载 .dmg 拖入应用程序文件夹 # LinuxSnap sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz sudo snap connect buzz:password-manager-service # LinuxFlatpak 备选 flatpak install flathub io.github.chidiwilliams.Buzz # Python跨平台需先装好 ffmpeg pip install buzz-captions python -m buzz第一次转录只有 3 步点主界面左上角的 或按 CtrlO选中音频文件在任务行里选好模型语言可以先留自动检测点该行右侧的播放按钮开始文本会实时出现在列表里第一次选择模型时会自动下载到本地缓存目录~/.cache/Buzz/models/建议在网络稳定的时候先跑一次。Buzz 主界面导入的文件排在任务列表里每行可单独控制模型、语言和进度Buzz 功能拆解从转录到字幕基础转录单个文件出文本最核心的链路——把文件丢进去拿回全文和字幕文件。导入文件在任务行设置模型、语言和输出格式TXT / SRT / VTT点播放开始进度按段落推进可以边跑边看文字完成后用导出菜单选择格式和保存位置实用技巧语言框除了自动检测也可以手动指定语种初始提示Initial prompt里写上人名、产品名这类背景词专有名词的识别会明显更稳。批量队列一次丢多个文件文件多就排队让队列自己按顺序跑完。选择文件时按住 CtrlmacOS 用 Cmd多选一次性入队任务按列表顺序依次执行每行有独立的暂停、停止按钮调整队列顺序即可改变处理优先级实用技巧配置一般的机器不建议手动并行多个任务顺序跑完更稳内存占用也可控。实时录音转录边说边出字 适合会议和讲座录完即得文本。在顶部录音区选好输入设备、模型和语言点录音按钮开始文本逐句显示点停止结束录音与转录结果存为任务后续导出方式和普通转录一样实用技巧开始前把输出设备指向正确的会议室音箱避免录进回音和系统提示音。Buzz 字幕制作编辑与格式导出转录完先别急着导出在查看器里过一遍时间轴。点击转录任务打开转录查看器每段都有开始/结束时间和文本双击修改文字拖动调整时间边界用字幕调整器把过长的段落切分成目标长度从导出菜单选择 SRT、VTT 或 TXT 保存实用技巧SRT 适合剪辑软件VTT 适合网页播放TXT 适合直接当文稿用导出菜单里三类都能选。Buzz 转录结果查看器每段字幕的时间与文本可以直接编辑Buzz Whisper 模型档位怎么选档位速度内存占用精度推荐场景Tiny最快1GB基础快速草稿、实时转录Base快~1GB良好日常使用、平衡之选Medium中等~3GB优秀重要内容、正式转录Large慢~8GB最佳高精度要求、学术研究建议先用 Base 出草稿确认内容没问题正式产出再换 Medium 或 Large 重跑有 NVIDIA 显卡时跑 Large 的时间成本比想象中低。Buzz 调优真正值得改的几项设置模型管理模型设置页可以按需搜索并下载不同档位的 Whisper 模型平时只留 1–2 个常用档位。偏好设置里改三项默认输出目录、导出文件名模板可包含日期、源文件名等变量、常用操作快捷键。字幕参数目标长度 40–50 个字符是屏读上限合并间隔 0.2–0.5 秒比较自然长句多时启用按标点分割。模型偏好页按需搜索并下载 Whisper 各档位模型偏好设置页导出文件名模板在这里配置两个落地工作流会议实时转录录音结束就有纪要开会前打开 Buzz录音设备指向会议室音箱用 Base 模型开始实时录音转录会议内容实时上屏会后在转录查看器里修正关键人名和数字纪要需要文字就导出 TXT录像需要配字幕就导出 SRT视频补字幕MP4 直接进SRT 直接出课程视频的 MP4 直接导入Buzz 通过 ffmpeg 处理音频选 Medium 模型跑完整转录拿到逐段时间戳用字幕调整器把长段切成 40–50 字符抽查几处时间轴不吻合的地方微调导出 SRT 交给剪辑软件字幕调整器控制每段字幕的切分长度Buzz 常见问题排障Q安装后启动报错提示缺少依赖A多数是系统库缺失Linux 下 pip 安装最容易碰到。补装 ffmpeg、libportaudio 等依赖后重启基本能解决。Q模型下载失败或特别慢A先确认网络后重试仍不行的话手动把模型文件放到缓存目录~/.cache/Buzz/models/再启动程序。Q转录速度太慢A换成 Tiny 或 Base 模型并关掉占内存的程序有 NVIDIA 显卡的话启用 GPU 推理提升最明显。Q识别准确率不理想A换更大的模型并保证源音频背景噪音少把高频专有名词写进初始提示也能明显改善。更多细节可以查 官方文档安装方式和各平台注意事项都有说明。Buzz 装好后随便找一段手头的短音频点 导入选 Base 点开始一两分钟后你就能看到第一行转录结果。之后的事只是换模型、改时间轴、导出 SRT 这三个动作的组合。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表