EarScribe

Whisper 在线

免费在线使用 OpenAI Whisper 语音转文字

EarScribe 借助 Transformers.js 和 ONNX Runtime Web,直接在浏览器标签页里运行 OpenAI 开源的 Whisper 模型。选好模型和音频文件,就能得到 Whisper 带时间戳的转写结果,不用装 Python,也不用为 API 付费。

  • 无需 API Key、Python 或安装
  • Tiny、Base、Small、Large v3 Turbo 任选
  • 支持 WebGPU,没有时自动改用 CPU
拖入音频文件,或点击浏览
MP3、WAV、M4A、OGG、FLAC、WebM;可处理长度取决于设备内存

导出前先核对文字和时间戳

在浏览器里免费使用 Whisper

1

选择音频文件

EarScribe 在浏览器里解码 MP3、WAV、M4A、OGG、FLAC 和 WebM,再把 16 kHz 单声道音频交给 Whisper。

2

选择 Whisper 模型

大多数录音推荐 Base。也可以对比四个模型,在下载体积、速度和准确率之间取舍。

3

核对 Whisper 的结果

每一段都带有 Whisper 给出的时间戳,可以回听、修改,并导出 TXT、SRT、VTT 或 JSON。

在浏览器中由 Whisper 生成的带时间戳文字稿

whisper 在线

该选哪个 Whisper 模型,能期待什么

Whisper 是 OpenAI 在 2022 年开源的一系列语音识别模型,用 68 万小时的多语言音频训练。模型大小是最主要的取舍:越大越准,运行也越吃力。

EarScribe 里的四个模型

Tiny(3900 万参数)最快、下载最小,适合手机和快速出草稿。Base(7400 万参数)是清晰人声的推荐选择。Small(2.44 亿参数)更能应付口音和噪音,但需要更多内存,最好有 WebGPU。

Large v3 Turbo(8.09 亿参数)是 Whisper 最大模型的提速版,解码器从 32 层缩减到 4 层。它是这里最准的选项,需要性能较好的设备,建议有约 6 GB 内存和 WebGPU。

WebGPU 还是 WebAssembly

浏览器支持 WebGPU 时,模型在显卡上运行,大模型会快很多;不支持时,EarScribe 改用 CPU 上的 WebAssembly,几乎哪里都能跑,只是更慢。

较新版本的 Chrome 和 Edge 已支持 WebGPU,其他浏览器也在陆续跟进。如果 Small 或 Large v3 Turbo 感觉很慢,通常是走了 CPU。

Whisper 不擅长的地方

在静音或音乐段,Whisper 可能生成看似合理的文字、重复某句话,或在多人抢话时漏词。它也不会标注说话人。

时间戳是按段落给出的,不是逐字。发布前,用它们跳回原音频核对重要内容。

在 EarScribe 中选择 Whisper Tiny、Base、Small 或 Large v3 Turbo
在 EarScribe 中选择 Whisper Tiny、Base、Small 或 Large v3 Turbo

导出前先核对文字和时间戳

怎么选模型

  1. 1

    手机或旧电脑

    从 Tiny 或 Base 开始。

  2. 2

    人声清晰

    Base 通常就够。

  3. 3

    口音或噪音

    在 4 GB 以上内存的设备上试试 Small。

  4. 4

    追求最高准确率

    Large v3 Turbo,搭配 WebGPU 和 6 GB 以上内存。

浏览器里运行 Whisper 做不到的事

  • 速度完全取决于你的设备,没有服务器替你处理长文件。
  • 不支持实时流式转写、翻译和说话人标注。

用好 Whisper 的几个要点

  • Whisper 根据前 30 秒判断语言,文件开头最好是人声,而不是很长的片头音乐。

  • 静音和音乐可能让 Whisper 凭空生成短句,剪掉长静音,并检查文字稿的开头和结尾。

  • 大模型主要在口音、噪音和专业词汇上更有优势;清晰人声用 Base 往往就够了。

常见问题

这是真正的 OpenAI Whisper 吗?

是的。EarScribe 使用 onnx-community 在 Hugging Face 上发布的 ONNX 版 Whisper 权重,通过 Transformers.js 运行。模型相同,只是运行环境不同。

可以用哪些 Whisper 模型?

Tiny、Base、Small 和 Large v3 Turbo。开始前,模型选择器会显示每个模型的下载大小和内存建议。

和 OpenAI API 有什么区别?

API 需要把文件上传到 OpenAI、要有 API Key,并按音频时长计费。这里模型在你的设备上运行,没有 Key 也没有费用,但速度取决于你的硬件。

为什么第一次比较慢?

浏览器第一次要下载模型并缓存,之后在同一台设备和浏览器上启动会快很多。

相关音频工具