用 faster-whisper 离线转写 1 小时音频:CPU 与 GPU 实操备忘

发布时间:2026/9/5 23:29:52

用 faster-whisper 离线转写 1 小时音频:CPU 与 GPU 实操备忘
用 faster-whisper 离线转写 1 小时音频CPU 与 GPU 实操备忘【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper周五下午 4 点你手里有一段 47 分钟的访谈录音周一早会前要交文字稿。逐字听打一整个下午都未必完稿交给在线服务又要权衡录音内容的保密性。faster-whisper 是基于 CTranslate2 重写 OpenAI Whisper 的 Python 库在本地把音频转写为文本官方 README 给出的结论是相同准确率下比 openai/whisper 快至 4 倍且更省内存8 位量化还能进一步压缩开销。一张表看清能力边界与资源开销维度表现依据速度相同准确率下较 openai/whisper 快至 4 倍README 原文up to 4 times官方 READMEGPU 资源large-v2int8 占显存 2926MBfp16 占 4525MBREADME 基准RTX 3070 TiCPU 资源small 模型 int8 内存占用 1477MBREADME 基准i7-12700K精度distil-large-v3 的 WER 为 13.527对照 transformers 同环境 14.801README 基准YT Commons语言覆盖多语言支持默认按前 30 秒音频自动检测语言也可显式指定源码transcribe.py部署方式支持 / 部分支持 / 不支持离线转写支持批量推理支持说话人分离不支持GUI 不支持README 与社区清单适合需要离线批量处理录音、且手里有 GPU 或高性能 CPU 的团队不适合想零代码点鼠标出结果、或指望它直接做说话人分离的使用者。按使用强度选模型档位与计算类型先判断自己属于哪种强度再定档位而不是上来就装最大的模型轻量试用每月几条录音CPU 即可模型base或smallcompute_typeint8硬件门槛4 核以上 CPU、8GB 内存small int8 占用 1477MBREADME 基准预期耗时13 分钟音频在 i7-12700K 上 int8 用时 1m42s折算 1 小时录音约 8 分钟按 README 数字推算日常生产每日会议、字幕批量转写推荐 GPU模型large-v3或turbocompute_typefloat16显存紧张改int8_float16硬件门槛8GB 显存的 NVIDIA GPUlarge-v2 fp16 4525MB、int8 2926MBREADME 基准预期耗时batch_size8时 13 分钟音频 17 秒折算 1 小时约 80 秒按 README 数字推算高并发服务给团队开批量转写任务模型GPU BatchedInferencePipelineREADME 基准中 distil-large-v3 用了batch_size16硬件门槛batch_size8需 6090MB 显存README 基准更大批次建议 16GB 显存部署仓库docker/目录提供示例 Dockerfile 与infer.py可作为容器化起点15 行跑通基础转写pip install faster-whisperfrom faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(interview.mp3, beam_size5) print(语言:, info.language, 概率:, info.language_probability) for segment in segments: # 注意遍历前不会真正开始转写 print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})适用边界单文件、单机、一次性产出文字稿的场景够用需要说话人分离或流式字幕时要再套一层外部项目README 的社区集成清单里有现成方案。常用参数速查默认值来自 1.2.1 版本transcribe签名参数默认值什么时候调vad_filterTrue内置 Silero VAD 默认只过滤超过 2 秒的静音可用vad_parameters收紧word_timestampsFalse做字幕时必须开输出词级起止时间language自动检测中文等语种显式传languagezh更稳tasktranscribe设为translate输出目标语言译文hotwordsNone固定人名、产品名、术语的识别condition_on_previous_textTrue长音频出现滚雪球式误识别时置Falsebatch_size8仅批量推理管线生效越大越快、显存越高两个可直接照搬的工作流一CPU 上把 1 小时访谈压进 10 分钟工具链faster-whisper 内置 Silero VAD 笔记软件。录音导出为 mp3库加载时经 PyAV 解码无需系统安装 FFmpeg自动重采样为 16kHz 单声道见源码faster_whisper/audio.pytranscribe(path, vad_filterTrue)默认滤掉超过 2 秒的静音段遍历 segments 落盘为纯文本粘进笔记软件校对专有名词。可量化收益small 模型 int8 下 13 分钟音频用时 1m42sREADME 基准i7-12700K 八线程1 小时录音约 8 分钟出初稿。二GPU 上批量生成词级字幕工具链BatchedInferencePipelinect2-transformers-converter SRT 导出脚本。模型权重首次运行自动从 Hugging Face Hub 下载也可用转换器把自有微调模型转为 CTranslate2 格式batched_model.transcribe(path, batch_size8, word_timestampsTrue)从segment.words逐词导出 SRT导入剪辑软件对齐校对。可量化收益large-v2 在 RTX 3070 Ti 上 fp16、batch_size8时 13 分钟音频仅需 17 秒README 基准2 小时长片推理约 2.5 分钟。对照根因表排查高频故障现象根因处理动作初始化报 cuBLAS/cuDNN 缺失新版 ctranslate2 仅支持 CUDA 12 cuDNN 9装 CUDA 12 的 cuBLAS/cuDNNCUDA 11 环境按 README 降级 ctranslate2 到 3.24.0首次运行卡在模型下载权重默认从 Hugging Face Hub 拉取手动下载 Systran 模型放到本地WhisperModel直接传本地目录CPU 转写明显慢于预期未量化、线程数未受控换compute_typeint8用OMP_NUM_THREADS固定线程数再对比长音频同一句反复滚雪球式误识别condition_on_previous_text让错误累积置False或改用 distil-large-v3README 示例即如此拿到 segments 却打印不出任何内容transcribe返回生成器遍历前不执行list(segments)或放进 for 循环README 明确警告GPU 显存不足大模型用了 fp16改compute_typeint8_float16large-v2 显存从 4525MB 降到 2926MBREADME已知能力边界本项目暂不支持原生说话人分离也不提供真正的实时流式推理接口与任何图形界面——流式字幕和分离需要外挂社区项目README 社区清单列有 Whisper-Streaming、whisper-diarize 等它也不是训练框架微调得到的 checkpoint 需先用ct2-transformers-converter转成 CTranslate2 格式才能加载。三周从试用走到稳定生产第 1 周跑通确认 Python ≥ 3.9装库后用base int8 在自己 2~3 段真实录音上跑通transcribe人工抽查准确率同时确认机器走 CPU 还是 GPU 路线GPU 需核对 cuBLAS/cuDNN 版本。第 2 周调参跑通 benchmark/ 下的脚本在自己机器上测出实时比基准打开word_timestamps、hotwords解决专有名词与字幕对齐问题有 GPU 时切到large-v3/turbo fp16 复测耗时。第 3 周固化把转写封装为批处理脚本或 Docker 服务输出 SRT/Markdown 归档对识别不稳的领域微调模型后转换为 CTranslate2 格式接入。参数细节随时查 faster_whisper/transcribe.py 的transcribe签名那里有全部选项的默认值与说明。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

用calibre把电子书转成EPUB,三步搞定

用calibre把电子书转成EPUB,三步搞定

2026/9/5 23:29:52

用calibre把电子书转成EPUB,三步搞定 【免费下载链接】calibre The official source code repository for the calibre ebook manager 项目地址: https://gitcode.com/GitHub_Trending/ca/calibre calibre 是一款开源电子书管理软件,能把主流格式…

spotDL:3 步把 Spotify 歌单离线保存为带封面的本地音乐

spotDL:3 步把 Spotify 歌单离线保存为带封面的本地音乐

2026/9/5 23:29:52

spotDL:3 步把 Spotify 歌单离线保存为带封面的本地音乐 【免费下载链接】spotify-downloader Download your Spotify playlists and songs along with album art and metadata (from YouTube if a match is found). 项目地址: https://gitcode.com/GitHub_Trendi…

yfinance 完整指南:三步在 Python 中获取与可视化金融数据

yfinance 完整指南:三步在 Python 中获取与可视化金融数据

2026/9/5 23:29:52

yfinance 完整指南:三步在 Python 中获取与可视化金融数据 【免费下载链接】yfinance Download market data from Yahoo! Finances API 项目地址: https://gitcode.com/GitHub_Trending/yf/yfinance yfinance 是一个从 Yahoo Finance 拉取金融数据的 Python …

调试记录2026

调试记录2026

2026/9/5 23:59:53

2026年7月20日 Depth Anything V3生成的点云,效果看上去还可以 在Photoshop中进行高斯模糊(模拟失焦)后再检测,依然可以保持尺相对度: 更大的高斯模糊 在图片中添加纯色块 2026年8月10日 MUJOCO动力学仿真

AI Agent之后,企业真正需要的不是一个机器人,而是一支AI员工团队

AI Agent之后,企业真正需要的不是一个机器人,而是一支AI员工团队

2026/9/5 23:59:53

系列文章目录 《AI Agent之后,企业真正需要的不是一个机器人,而是一支AI员工团队》 《为什么很多企业用了AI工具,却没有真正实现AI转型?》 《未来企业组织架构:人类员工 AI数字员工》 《企业建设AI Agent&#xff0c…

基于CNN的调制信号识别:MATLAB实现时频图分类实战

基于CNN的调制信号识别:MATLAB实现时频图分类实战

2026/9/5 23:59:53

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

2026/9/5 23:59:53

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

2026/9/5 23:59:53

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

电商后端重构实战:代码分层、数据库治理与缓存异步化改造

电商后端重构实战:代码分层、数据库治理与缓存异步化改造

2026/9/5 23:49:52

如果你维护过电商类后端系统,应该不会对下面的场景感到陌生:新同学入职后问“订单状态存在哪几个表”,没人能一句话回答;加一个商品标签,要牵连十几个类;核心订单接口响应时好时坏,却说不清慢在…

远程协作的工作台整理

远程协作的工作台整理

2026/9/3 6:56:24

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/4 7:42:10

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/5 23:14:13

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…