ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

faster-whisper模型选型:8GB显存能跑多快?tiny到large-v3的选型结论

faster-whisper模型选型:8GB显存能跑多快?tiny到large-v3的选型结论 faster-whisper模型选型8GB显存能跑多快tiny到large-v3的选型结论【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper显存只有8GB、字幕今晚必须批量跑完faster-whisper模型选型的第一步不是写代码而是决定加载哪个模型tiny太笨、large-v3太重中间怎么平衡这篇文章把 tiny/base/small/medium/large-v2/large-v3 六档一次讲透。 30秒秒选你的硬件该配哪个模型目的明确的读者看这张表就够了手里的硬件典型场景推荐档位一句话理由≥8GB 显存 GPU批量字幕、会议转录large-v3 int8_float16实测13分钟音频仅占2.9GB显存精度封顶4~8GB 显存 GPU批量、追求速度large-v2 或 medium int8少一档的显存多一分速度≤4GB 显存 GPU快响应、轻量服务base int8_float16速度仍是音频时长的1/10量级纯 CPU 台式机离线批处理small int8实测13分钟音频1分42秒跑完4GB 内存设备/NAS边缘、监控tiny.en int8内存占用500MB以内只认英语另外记住一条只处理英语就把档位名加.en后缀同一档里文件更小、解码更快。 六个模型逐个点评每档是什么人设tiny39M 参数速度王但是体验版。模型文件约75MBint8 量化后几百MB内存就能跑代价是 LibriSpeech 干净英语朗读集上 WER字错率越低越好约 9.7%是 base 的两倍。适合先有再优的管道验证。base74M实时场景的默认项。WER 5.4%文件约145MB耗时约为 small 的一半。如果你的产品要求首字延迟短、音频以清晰人声为主base.en 往往够用。small244M我心中的性价比拐点。官方 README 在 8 线程 i7-12700K 上实测13分钟音频 int8 跑 1分42秒、内存1477MB换 batch_size8 批处理 51秒跑完内存涨到3608MB。WER 4.8%能直接用和听起来很顺的分界线就在这一档。medium769M6GB 显存卡的舒适上限。WER 3.6%int8 下显存占用约1GB配 batch 还有大量余量。多说话人、有背景噪音的音频从这一档开始明显更稳。large-v21550M精度老兵benchmark 数据最多。官方在 RTX 3070 Ti 上实测 13分钟音频fp16 用 1分03秒、占4525MBint8 只要59秒、2926MBint8 batch_size8 仅16秒。faster-whisper 的速度比 openai 原版实现最高快4倍大头都省在这一档。large-v31550M当前默认多语言最强。训练数据比 v2 多约65%多语种和复杂场景的精度有实质性提升显存要求和 v2 同档int8 约3GB。只跑英语、把速度放第一的话可以看看仓库里同样支持的turbolarge-v3-turbo8位蒸馏版GPU 上快约8倍精度略低于 v3。 数据的边际回报每升一档到底买到什么先看准确率这条线LibriSpeech 干净英语朗读集WERtiny 9.7% → base 5.4% → small 4.8% → medium 3.6% → large 2.7%拆开看每升一档的差值tiny→base 砍掉 4.3 个百分点这是全部曲线里最肥的一段base→small 只降 0.6 个点但速度代价约2倍small→medium 降 1.2 个点显存需求从几百MB跳到1GB量级medium→large 再降 0.9 个点耗时和显存又上一个台阶。速度侧几乎每档×2从 tiny 到 large同一台 CPU 上要慢约 30~40 倍而 WER 只从 9.7% 走到 2.7%。我的判断是拐点在 small。预算允许、要能上线的转录质量WER5%到 small 就该停手只有当你需要 WER4% 的业务级干净才值得为 medium 多花一档资源。large 档的价值不在干净英语——那里 v2 和 v3 只差零点几个点——而在多语言、口音重、专业术语多的真实语料large-v3 相对 v2 的收益集中在这类场景。 三类硬件三套配置消费级 GPU以8GB为例large-v3 int8_float16。int8_float16表示权重8位存储、FP16计算是显存和精度的平衡点——仓库实测 large-v2 档 int8 跑13分钟音频仅2926MB显存开 batch_size8 也才4500MB8GB 卡余量充足。from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typeint8_float16) segments, info model.transcribe(meeting.mp4, beam_size5, vad_filterTrue) text .join(seg.text for seg in segments)纯 CPUsmall int8 限线程。int8 把内存从 2257MB 压到 1477MBbeam_size1比默认的 5 快一倍左右cpu_threads8和外部OMP_NUM_THREADS对齐避免超线程抢核。想拿内存换速度时用 BatchedInferencePipeline 批处理13分钟音频能从1分42秒压到51秒。from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8, cpu_threads8) segments, _ model.transcribe(interview.wav, languagezh, beam_size1)低内存设备4GB内存的NAS、边缘盒子tiny.en 单核级线程。int8 下 tiny.en 内存占用在500MB以内without_timestampsTrue让解码不再生成时间戳 token进一步省算力。这一档别期待高精度——WER 9.7%定位是大致能用。from faster_whisper import WhisperModel model WhisperModel(tiny.en, devicecpu, compute_typeint8, cpu_threads2) segments, _ model.transcribe(memo.m4a, languageen, without_timestampsTrue)⚠️ 避坑指南4个高频坑现象转录反复输出同一句话、时间戳越漂越远。原因condition_on_previous_text默认 True上一窗口的输出会回灌成下一段的上下文遇到坏音频模型会陷入循环。 解法传condition_on_previous_textFalse并开vad_filterTrue把长静音切掉。现象中文音频被检测成英语。原因默认只用前30秒做语言检测开头有音乐、噪音就容易被带偏。 解法直接传languagezh跳过检测还省掉开头的检测开销。现象8GB 卡上 large-v3 直接 OOM。原因fp16 权重加批处理占用翻倍。 解法compute_typeint8_float16实测同任务显存从4.5GB档降到2.9GB档。现象调完 transcribe() 感觉什么都没发生。原因segments是生成器只有开始迭代时才真正执行转录。 解法用list(segments)包一层或写 for 循环进度才会出现。✅ 收尾上线前做三件事我的建议8GB 卡直接 large-v3 int8_float16纯 CPU 用 small int8纯英语场景一律选.en版本。上线前拿一段1分钟真实音频small 和 large-v3 各跑一遍用你自己数据上的 WER 和耗时决定那一档值不值。需要调解码细节时完整参数清单就在 faster_whisper/transcribe.py 里。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表