ファイルサイズを確認する
CD音質のステレオWAVは1時間で約635 MBになり、1 GBを超えるファイルは受け付けません。長い録音は分割するか、モノラル版を書き出してください。
WAV 文字起こし
フィールドレコーダー、DAW、Audacityが書き出すWAVは非圧縮で容量が大きい形式です。EarScribeはWAVを手元の端末で読み込むので、大きなファイルをアップロードする必要がありません。確認して書き出せるタイムスタンプ付きの文字にします。
書き出す前に文字とタイムスタンプを確認
CD音質のステレオWAVは1時間で約635 MBになり、1 GBを超えるファイルは受け付けません。長い録音は分割するか、モノラル版を書き出してください。
多くの録音はバランス型で十分です。メモリが少ない場合はTinyを。大きいモデルほどメモリを使います。
自信のない箇所をタイムスタンプから聞き直して修正し、必要な形式で書き出します。

wav 文字起こし
WAVは多くの場合非圧縮のPCM音声で、デコードは簡単ですがメモリを大きく使います。前もって考えるべきなのはファイルサイズで、文字起こし自体は難しくありません。
CD音質のステレオWAV(16-bit、44.1 kHz)は1分あたり約10.6 MB、24-bit・48 kHzのステレオは約17.3 MBで、1時間ほどでEarScribeの上限の1 GBに達します。16 kHz・16-bitのモノラルなら1分2 MB未満で、音声認識に必要な情報はすべて残ります。
EarScribeはブラウザ内でファイル全体をデコードし、16 kHzのモノラルに変換してWhisperに渡します。アップロードはしませんが、元のファイルとデコード後の音声を同時にメモリに置くため、長時間の高解像度WAVはスマートフォンで失敗しやすくなります。
1時間を超える録音や、24-bit・48 kHzのステレオ録音は、編集ソフトで16 kHzモノラルのWAVか高品質のMP3を書き出してから文字起こししてください。モデルが使う情報は失われません。
元のWAVは編集と保管用のマスターとして残しましょう。コピーの開始位置が同じなら、文字起こしのタイムスタンプは元ファイルとも一致します。
左右のチャンネルは認識前に1つにまとめられます。2人を別々のチャンネルで録っていても、文字起こしは話者ラベルのない1つの会話になります。
トラックを分けて録ったポッドキャストやインタビューは、概要欄用なら最終ミックスを、誰が話したかを正確に残したいならトラックごとに文字起こしします。

書き出す前に文字とタイムスタンプを確認
スマートフォンや低メモリのPCでは、1時間を超える録音を分割する。
標準の16-bitか24-bit PCMを使い、圧縮形式は変換する。
元が大きすぎる場合は16 kHzモノラル版を文字起こしし、元ファイルは残す。
書き出す前に人名・数字・専門用語を聞き直す。
16 kHzを超えるサンプリングレートや24-bitは、Whisperの精度を上げません。認識の前に16 kHzモノラルへ変換されます。
話し声ならモノラルで十分です。ステレオの左右チャンネルは文字起こし前に1つにまとめられます。
マイクの位置と静かな部屋のほうが、高解像度のファイルよりずっと結果を良くします。
大きな差はないことがほとんどです。Whisperは16 kHzのモノラル音声を聞くので、はっきりした声なら品質の良いMP3でもほぼ同じ結果になります。雑音の多い録音をさらに圧縮したくない場合はWAVが有利です。
1 GBまでのファイルを受け付けますが、実際の上限は端末のメモリです。ブラウザは元のファイルとデコード後の音声を同時に保持するため、1時間のステレオWAVでは1 GBを大きく超えるメモリが必要になることがあります。長い録音は分割するか、16 kHzモノラル版を書き出してください。
標準的なPCMのWAVなら主要なブラウザで開けます。録音機や電話システムの中には、WAVにADPCMなどの圧縮形式を入れるものがあります。16-bit PCMのWAVかMP3に変換してください。
まず1つにミックスしたWAVを書き出してください。誰が話したかを正確に知りたい場合は、トラックごとにファイルを分けます。EarScribeは1ファイルずつ処理します。