EarScribe

WAV 转文字工具

免费 WAV 转文字:大文件不用上传

录音笔、音频工作站和 Audacity 导出的通常是 WAV:不压缩,体积很大。EarScribe 在你自己的设备上读取 WAV,大文件不必上传,直接生成可以核对和导出的带时间戳文字。

  • 大 WAV 文件留在本机
  • 每段文字都能按时间戳回听
  • 导出 TXT、SRT、VTT 或 JSON
拖入音频文件,或点击浏览
MP3、WAV、M4A、OGG、FLAC、WebM;可处理长度取决于设备内存

导出前先核对文字和时间戳

免费转写 WAV 录音的步骤

1

先看文件大小

一小时 CD 音质的立体声 WAV 约 635 MB,超过 1 GB 的文件会被拒绝。长录音请先拆分,或导出一份单声道副本。

2

选适合设备的模型

大多数录音用均衡模型即可。内存紧张时用 Tiny,大模型需要更多内存。

3

核对并导出

从时间戳回听没把握的句子,改正后导出需要的格式。

WAV 录音转成的带时间戳文字,含波形和导出按钮

wav转文字

为什么 WAV 文件和别的格式不一样

WAV 通常是不压缩的 PCM 音频,解码容易,但很占内存。真正要提前规划的是文件大小,转写本身反而是简单的部分。

体积随采样率、位深和声道增长

CD 音质的立体声 WAV(16-bit、44.1 kHz)每分钟约 10.6 MB,24-bit、48 kHz 立体声每分钟约 17.3 MB,大约一小时就会达到 EarScribe 1 GB 的文件上限。16 kHz、16-bit 单声道 WAV 每分钟不到 2 MB,语音识别需要的信息一点不少。

EarScribe 会在浏览器里解码整个文件,并转成 16 kHz 单声道交给 Whisper。文件不上传,但浏览器要同时存放原文件和解码后的音频,所以长时间的高规格 WAV 在手机上容易失败。

什么时候先导出一个小副本

录音超过一小时,或者是 24-bit、48 kHz 立体声时,先在剪辑软件里导出 16 kHz 单声道 WAV 或高质量 MP3 再转写。模型用得到的信息不会损失。

原始 WAV 留作剪辑和归档的母版。只要副本的起点相同,文字稿的时间戳就和原文件对得上。

声道和多轨录音

识别前两个声道会合成一个。如果两个人分别录在左右声道,文字稿仍然是一段连续对话,不会标注说话人。

分轨录制的播客或采访,写节目笔记时转写最终混音即可;需要准确区分谁说了什么时,再逐个音轨单独转写。

WAV 录音转成的带时间戳文字稿和导出选项
WAV 录音转成的带时间戳文字稿和导出选项

导出前先核对文字和时间戳

WAV 转写清单

  1. 1

    时长

    在手机和低内存电脑上,超过一小时的录音先拆分。

  2. 2

    编码

    使用标准 16-bit 或 24-bit PCM WAV,压缩变体先转换。

  3. 3

    工作副本

    原文件太大时转写 16 kHz 单声道副本,原文件保留。

  4. 4

    核对

    导出前回听人名、数字和专业术语。

需要注意的限制

  • 超过 1 GB 的文件会被拒绝,实际上限取决于设备内存,没有服务器替你处理。
  • EarScribe 不区分说话人或音轨,多轨录音需要先混音,或每轨导出一个文件。

哪些 WAV 参数有用,哪些没用

  • 高于 16 kHz 的采样率和 24-bit 位深不会让 Whisper 更准,识别前音频都会转成 16 kHz 单声道。

  • 人声用单声道就够了。立体声的两个声道会在转写前合成一个声道。

  • 麦克风摆位和安静的环境,比更高规格的文件更能提升效果。

常见问题

WAV 转文字比 MP3 更准吗?

通常差别不大。Whisper 处理的是 16 kHz 单声道音频,清晰人声的高质量 MP3 识别效果差不多。WAV 主要在嘈杂录音不宜再压缩时更有优势。

多大的 WAV 可以转文字?

EarScribe 接受 1 GB 以内的文件,真正的上限是设备内存。浏览器要同时保存原文件和解码后的音频,一小时的立体声 WAV 可能需要超过 1 GB 内存。更长的录音请拆分,或导出 16 kHz 单声道副本。

为什么 WAV 文件打不开?

标准 PCM 格式的 WAV 主流浏览器都能打开。有些录音设备和电话系统会在 WAV 里存放 ADPCM 等压缩编码,请先转成 16-bit PCM WAV 或 MP3。

多轨录音能直接转写吗?

请先导出一个混音后的 WAV;如果需要准确知道谁说了什么,就每个音轨单独导出一个文件。EarScribe 每次处理一个文件。

相关音频工具