EarScribe

WAV 文字起こし

WAVファイルを無料で文字起こし(アップロード不要)

フィールドレコーダー、DAW、Audacityが書き出すWAVは非圧縮で容量が大きい形式です。EarScribeはWAVを手元の端末で読み込むので、大きなファイルをアップロードする必要がありません。確認して書き出せるタイムスタンプ付きの文字にします。

  • 大きなWAVも端末から出さない
  • 区間ごとにタイムスタンプから再生
  • TXT・SRT・VTT・JSONで書き出し
音声ファイルをドロップ、またはクリックして選択
MP3、WAV、M4A、OGG、FLAC、WebM。処理できる長さは端末のメモリによります

書き出す前に文字とタイムスタンプを確認

WAV録音を無料で文字起こしする手順

1

ファイルサイズを確認する

CD音質のステレオWAVは1時間で約635 MBになり、1 GBを超えるファイルは受け付けません。長い録音は分割するか、モノラル版を書き出してください。

2

端末に合うモデルを選ぶ

多くの録音はバランス型で十分です。メモリが少ない場合はTinyを。大きいモデルほどメモリを使います。

3

確認して書き出す

自信のない箇所をタイムスタンプから聞き直して修正し、必要な形式で書き出します。

WAV録音をタイムスタンプ付きテキストに変換した画面と書き出しボタン

wav 文字起こし

WAVファイルがほかの形式と違う理由

WAVは多くの場合非圧縮のPCM音声で、デコードは簡単ですがメモリを大きく使います。前もって考えるべきなのはファイルサイズで、文字起こし自体は難しくありません。

サイズはサンプリングレート・ビット深度・チャンネル数で増える

CD音質のステレオWAV(16-bit、44.1 kHz)は1分あたり約10.6 MB、24-bit・48 kHzのステレオは約17.3 MBで、1時間ほどでEarScribeの上限の1 GBに達します。16 kHz・16-bitのモノラルなら1分2 MB未満で、音声認識に必要な情報はすべて残ります。

EarScribeはブラウザ内でファイル全体をデコードし、16 kHzのモノラルに変換してWhisperに渡します。アップロードはしませんが、元のファイルとデコード後の音声を同時にメモリに置くため、長時間の高解像度WAVはスマートフォンで失敗しやすくなります。

先に小さいコピーを作るべきとき

1時間を超える録音や、24-bit・48 kHzのステレオ録音は、編集ソフトで16 kHzモノラルのWAVか高品質のMP3を書き出してから文字起こししてください。モデルが使う情報は失われません。

元のWAVは編集と保管用のマスターとして残しましょう。コピーの開始位置が同じなら、文字起こしのタイムスタンプは元ファイルとも一致します。

チャンネルとマルチトラック

左右のチャンネルは認識前に1つにまとめられます。2人を別々のチャンネルで録っていても、文字起こしは話者ラベルのない1つの会話になります。

トラックを分けて録ったポッドキャストやインタビューは、概要欄用なら最終ミックスを、誰が話したかを正確に残したいならトラックごとに文字起こしします。

WAV録音のタイムスタンプ付き文字起こしと書き出しオプション
WAV録音のタイムスタンプ付き文字起こしと書き出しオプション

書き出す前に文字とタイムスタンプを確認

WAV文字起こしのチェックリスト

  1. 1

    長さ

    スマートフォンや低メモリのPCでは、1時間を超える録音を分割する。

  2. 2

    エンコード

    標準の16-bitか24-bit PCMを使い、圧縮形式は変換する。

  3. 3

    作業用コピー

    元が大きすぎる場合は16 kHzモノラル版を文字起こしし、元ファイルは残す。

  4. 4

    確認

    書き出す前に人名・数字・専門用語を聞き直す。

知っておきたい制限

  • 1 GBを超えるファイルは受け付けず、実際の上限は端末のメモリです。代わりに処理するサーバーはありません。
  • EarScribeは話者やトラックを区別しません。マルチトラックはミックスダウンするか、トラックごとにファイルを分けてください。

効くWAV設定と効かない設定

  • 16 kHzを超えるサンプリングレートや24-bitは、Whisperの精度を上げません。認識の前に16 kHzモノラルへ変換されます。

  • 話し声ならモノラルで十分です。ステレオの左右チャンネルは文字起こし前に1つにまとめられます。

  • マイクの位置と静かな部屋のほうが、高解像度のファイルよりずっと結果を良くします。

この使い方についての質問

WAVのほうがMP3より正確に文字起こしできますか?

大きな差はないことがほとんどです。Whisperは16 kHzのモノラル音声を聞くので、はっきりした声なら品質の良いMP3でもほぼ同じ結果になります。雑音の多い録音をさらに圧縮したくない場合はWAVが有利です。

どのくらい大きなWAVまで処理できますか?

1 GBまでのファイルを受け付けますが、実際の上限は端末のメモリです。ブラウザは元のファイルとデコード後の音声を同時に保持するため、1時間のステレオWAVでは1 GBを大きく超えるメモリが必要になることがあります。長い録音は分割するか、16 kHzモノラル版を書き出してください。

WAVファイルが開けないのはなぜですか?

標準的なPCMのWAVなら主要なブラウザで開けます。録音機や電話システムの中には、WAVにADPCMなどの圧縮形式を入れるものがあります。16-bit PCMのWAVかMP3に変換してください。

マルチトラックの録音も文字起こしできますか?

まず1つにミックスしたWAVを書き出してください。誰が話したかを正確に知りたい場合は、トラックごとにファイルを分けます。EarScribeは1ファイルずつ処理します。

関連する音声ツール