从文字定位原音
搜索文字稿,点击任意时间戳即可回听录音中的对应片段。
EarScribe
EarScribe 把录音整理成可搜索、可编辑、带时间戳的文字稿和字幕,让用户先拿到结果,不被注册流程打断。
默认推荐均衡设置,新手可以直接开始;模型对比、文字编辑和字幕检查按需展开,熟悉后再使用更多控制。
基于 Transformers.js、ONNX Runtime Web 和 OpenAI 开源 Whisper 模型构建。

从录音到可交付结果
搜索文字稿,点击任意时间戳即可回听录音中的对应片段。
默认使用均衡推荐;只有需要更小下载或更高精度时,再展开高级模型。
采访、课程和播客可自动识别音频语言,无需先手动选择。
在工作台中修正人名、引语、数字和术语,复制与导出都会使用最新内容。
集中检查空白、过长、阅读过快、重复和时间重叠的字幕,并优化断行。
复制文字,或导出 TXT、SRT、VTT、JSON。免费、无限使用,无需注册。
免费、无限使用的音频转文字,无需注册或账号。支持 MP3 转文字、WAV 转文字、M4A 转文字及更多常见音频格式。
Whisper 支持 99 种语言的音频转文字,模型会自动识别音频语言,无需手动选择。
浏览器音频转文字
很多音频转文字工具在屏幕上出现一段文字后就结束了。EarScribe 解决的是下一步:这句话在原录音的哪一秒?可搜索的分段、可点击的时间戳和原地编辑,让你复制或发布前始终能回到证据。
因此它更适合需要认真核对的一段录音:采访引语、课堂术语、播客片段或字幕文件。它没有把自己做成复杂的团队会议系统,也不只是返回一段无法继续处理的 API 文本。

02
浏览器会解码你选择的音频,并通过 Transformers.js 和 ONNX Runtime Web 运行 Whisper 模型。文件不会进入 EarScribe 的上传队列。首次运行需要把模型下载到浏览器缓存;同一设备和浏览器再次使用时,可能直接复用缓存。
本地处理可以减少录音上传暴露面,但不等于浏览器天然绝对安全。设备、扩展程序、浏览器存储和导出文件仍需要正常管理。实际能处理多长的音频取决于设备内存和算力,旧手机上使用更小模型或先裁掉静音通常更稳。
03
大多数清晰人声直接使用均衡模式即可。Tiny 适合优先考虑速度和下载体积的场景;Small 在设备有余量时对口音或噪音可能更有帮助;Turbo 对内存和 WebGPU 要求更高。模型选择器把这些取舍直接展示出来,不要求新手一开始就比较四个下载包。
任何模型都无法找回被爆音、音乐或多人重叠说话遮住的词。录音质量、麦克风距离和最后一次回听,往往比单纯升级一个模型更能改善结果。
04
如果你要自己核对并导出一段录音,EarScribe 就适合这个流程。如果你需要共享项目、团队留存策略或自动管理说话人,托管团队软件可能更合适。如果结果必须嵌入自己的产品,转录 API 通常更合适。
EarScribe 不承诺实时课堂字幕、自动说话人标签、AI 会议总结、把字幕烧录进视频或直接发布到平台。把边界说清楚,可以让你在处理文件前就选对工作流。
浏览器音频转文字
按任务选择合适的工作方式
对比浏览器工作台、转录 API 和托管转录软件分别适合什么任务。
| 功能 | EarScribe | 转录 API | 托管软件 |
|---|---|---|---|
| 无需账号即可开始 | 是 | 否 | 否 |
| 无需 API 集成即可使用 | 是 | 否 | 是 |
| 包含可编辑的文字稿工作台 | 是 | 否 | 是 |
| 在哪里工作 | 浏览器内 | 你的产品内 | 托管应用内 |
| 包含带时间戳的文字 | 是 | 是 | 是 |
| 点击时间戳回听原音 | 是 | 否 | 是 |
| 可选择模型 | 是 | 是 | 因产品而异 |