EarScribe

Whisper 文字起こし

OpenAIのWhisperをブラウザで無料で使って文字起こし

EarScribeは、OpenAIがオープンソースで公開したWhisperモデルを、Transformers.jsとONNX Runtime Webでブラウザのタブ内で直接動かします。モデルと音声ファイルを選ぶだけで、Pythonのインストールや有料APIなしに、Whisperのタイムスタンプ付き文字起こしが得られます。

  • APIキー・Python・インストール不要
  • Tiny・Base・Small・Large v3 Turboから選べる
  • WebGPUがなければCPUで動作
音声ファイルをドロップ、またはクリックして選択
MP3、WAV、M4A、OGG、FLAC、WebM。処理できる長さは端末のメモリによります

書き出す前に文字とタイムスタンプを確認

ブラウザでWhisperを無料で使う流れ

1

音声ファイルを選ぶ

EarScribeがMP3・WAV・M4A・OGG・FLAC・WebMをブラウザでデコードし、16 kHzモノラルの音声をWhisperに渡します。

2

Whisperのモデルを選ぶ

多くの録音にはBaseがおすすめです。4つのモデルを比べて、ダウンロード容量・速度・精度のバランスを選べます。

3

Whisperの結果を確認する

各区間にWhisperのタイムスタンプが付きます。聞き直して修正し、TXT・SRT・VTT・JSONで書き出します。

ブラウザ上のWhisperで作成したタイムスタンプ付き文字起こし

whisper 文字起こし

どのWhisperモデルを選び、何を期待できるか

Whisperは、OpenAIが2022年にオープンソースで公開した音声認識モデルのシリーズで、多言語の音声68万時間で学習されています。いちばん大きな選択肢はモデルの大きさで、大きいほど正確ですが、動かすのも重くなります。

EarScribeで使える4つのモデル

Tiny(3,900万パラメータ)は最速でダウンロードも最小なので、スマートフォンや下書きに向いています。Base(7,400万)ははっきりした声におすすめのバランス型です。Small(2億4,400万)は訛りや雑音に強くなりますが、メモリを多く使い、WebGPUがあると快適です。

Large v3 Turbo(8億900万パラメータ)は、Whisperの最大モデルのデコーダを32層から4層に減らした高速版です。ここで最も精度が高い選択肢で、約6 GBのメモリとWebGPUのある端末をおすすめします。

WebGPUかWebAssemblyか

ブラウザがWebGPUに対応していれば、モデルはGPUで動き、大きいモデルほど速くなります。対応していない場合はCPU上のWebAssemblyに切り替わり、ほとんどの環境で動きますが遅くなります。

WebGPUは最近のChromeとEdgeで使え、ほかのブラウザでも対応が進んでいます。SmallやLarge v3 Turboが遅いと感じたら、多くの場合CPUで動いています。

Whisperが苦手なこと

無音や音楽の部分でそれらしい文を作ったり、同じフレーズを繰り返したり、発言が重なると単語を落としたりすることがあります。話者の区別もしません。

タイムスタンプは単語ごとではなく区間ごとです。公開前に、重要な箇所はタイムスタンプから聞き直して確認してください。

EarScribeでWhisperのTiny・Base・Small・Large v3 Turboを選ぶ画面
EarScribeでWhisperのTiny・Base・Small・Large v3 Turboを選ぶ画面

書き出す前に文字とタイムスタンプを確認

モデルの選び方

  1. 1

    スマートフォンや古いPC

    TinyかBaseから始める。

  2. 2

    はっきりした声

    たいていBaseで十分。

  3. 3

    訛りや雑音

    メモリ4 GB以上の端末でSmallを試す。

  4. 4

    最高の精度

    Large v3 Turboを、WebGPUとメモリ6 GB以上で。

ブラウザのWhisperでできないこと

  • 速度は端末次第です。長いファイルを代わりに処理するサーバーはありません。
  • リアルタイムのストリーミング文字起こし、翻訳、話者ラベルには対応していません。

Whisperをうまく使うコツ

  • Whisperは最初の30秒で言語を判定します。長いBGMではなく、話し声から始まるファイルが向いています。

  • 無音や音楽の部分で、Whisperが短い文をでっち上げることがあります。長い無音は削り、最初と最後を確認しましょう。

  • 大きいモデルが効くのは訛り・雑音・専門用語です。はっきりした声ならBaseで十分なことが多いです。

この使い方についての質問

本物のOpenAI Whisperですか?

はい。onnx-communityがHugging Faceで公開しているONNX版のWhisperの重みを、Transformers.jsで動かしています。モデルは同じで、実行環境だけが違います。

どのWhisperモデルが使えますか?

Tiny、Base、Small、Large v3 Turboです。開始前にモデル選択画面で各モデルのダウンロード容量とメモリの目安を確認できます。

OpenAIのAPIとは何が違いますか?

APIはファイルをOpenAIにアップロードし、APIキーが必要で、音声の長さに応じて課金されます。EarScribeは端末上でモデルを動かすので、キーも料金も不要ですが、速度はハードウェア次第です。

初回が遅いのはなぜですか?

ブラウザが最初にモデルをダウンロードしてキャッシュするためです。同じ端末とブラウザなら、2回目以降はずっと速く始まります。

関連する音声ツール