先检查原始录音
普通单声道或立体声 MP3 都可以。码率过低、降噪过重可能已经损失部分人声细节。
MP3 转文字
选择录音笔、播客、会议或手机里的 MP3,EarScribe 会在浏览器中解码,自动识别语言,并生成可以和原音逐段核对的文字。
导出前先核对文字和时间戳
普通单声道或立体声 MP3 都可以。码率过低、降噪过重可能已经损失部分人声细节。
首次使用需要下载语音模型,之后同一浏览器可以复用缓存模型。
搜索人名、日期、价格和专业词,点击时间戳回听原音,确认后再导出。

MP3转文字
手里的文件已经是 MP3,就不该为了识别再转一次格式。直接选择 MP3,生成带时间戳文字,核对后再导出文字稿或字幕。
录音笔、播客、会议或手机里的 MP3 都可以直接选择。浏览器会在本地解码,模型会自动识别录音语言。
把已经压缩过的 MP3 转成 WAV,不能找回压缩时丢掉的细节。如果文件里有很长的静音,先裁剪往往比改容器更能减少内存压力。
搜索人名、日期、价格和专业词,再点击时间戳回听。与其重新听完整录音,不如先定位最需要人工判断的片段。
高码率只有在保留更清楚的人声时才有帮助。麦克风距离、背景噪音和多人同时说话,通常影响更大。
TXT 适合阅读和整理,SRT 或 VTT 适合剪辑和网页视频。核对后的分段会在不同格式中保留时间轴。
文字和字幕确认前不要覆盖原始 MP3。之后遇到疑似错词时,原文件就是最快的证据。

导出前先核对文字和时间戳
处理前复制一份,不要覆盖原始录音。
特别长的空白段可以先裁掉。
用时间戳核对人名、数字和不常见词。
阅读用 TXT,字幕用 SRT 或 VTT。
把已经压缩过的 MP3 转成 WAV,并不能找回丢失的人声细节。
如果录音里有很长的静音,先裁掉可以减少内存占用。
完成文字和字幕核对前,建议保留原始 MP3。
可以。选中的 MP3 会在浏览器中解码和识别,不会发送到 EarScribe 服务器。
只有在更好地保留人声时才有帮助。麦克风距离、噪音和多人同时说话通常影响更大。
可以。核对带时间戳的结果后,可以直接导出 SRT 或 VTT。