EarScribe

音频转 SRT 字幕工具

免费把音频转换成 SRT 字幕

从 MP3、WAV、M4A 等音频生成 SRT 或 VTT。EarScribe 会保留 Whisper 时间戳,标出常见的可读性问题,并在导出前帮助你优化断行。

  • 检查过长、过快、重复、空白和时间重叠字幕
  • 点击字幕即可回听原音,再决定是否修改
  • 同一结果可导出 SRT、VTT、TXT 和 JSON
拖入音频文件,或点击浏览
MP3、WAV、M4A、OGG、FLAC、WebM;可处理长度取决于设备内存

导出前先核对文字和时间戳

免费从音频做出可发布的字幕

1

生成带时间轴的字幕

识别音频,并保留模型为每个片段生成的时间范围。

2

运行字幕体检

集中检查过长、阅读过快、重复、空白或时间重叠的字幕。

3

完整预览后导出

优化断行,回听重点片段,再导出 SRT 或 VTT 到剪辑软件和视频平台。

EarScribe 字幕体检界面,显示时间戳字幕和 SRT 导出

音频转SRT

从音频生成 SRT 字幕,再把字幕做得可读

自动生成字幕只是第一步。真正能交付的 SRT 还要检查断行、阅读速度、时间重叠,并回听模型无法从声音判断的专名和数字。

先生成带时间轴的字幕片段

选择 MP3、WAV、M4A 等音频,EarScribe 会保留分段时间信息,同一份结果可以导出 SRT、VTT、TXT 或 JSON。

这里解决的是音频到字幕文件,不是把字幕烧录到视频里,也不是替代剪辑软件。你可以把文件交给控制画面和样式的下一步工具。

导出前做一次字幕体检

集中查看过长、阅读过快、空白、重复和时间重叠的字幕。这些问题会让观众读不完,即使单词本身识别正确。

点击字幕回听原音,修改文字后再次检查。重要视频仍应完整预览一遍。

按使用场景选择 SRT 或 VTT

SRT 被大多数剪辑软件和视频平台支持;VTT 更适合网页视频。只需要阅读文字时,导出 TXT 即可。

先在工作台中修改,再导出所有格式,可以让文字和时间轴保持一致。

用于检查时间轴并导出 SRT 字幕的时间戳文字工作台
用于检查时间轴并导出 SRT 字幕的时间戳文字工作台

导出前先核对文字和时间戳

字幕发布前检查清单

  1. 1

    长度

    过长的字幕要拆分或精简,确保正常屏幕上读得完。

  2. 2

    速度

    回听过快片段,只在不改变原意时精简措辞。

  3. 3

    时间

    检查空白、重复和重叠字幕。

  4. 4

    语境

    人名、数字和专业术语不要只看字面,要回听原音。

音频转 SRT 工具的边界

  • EarScribe 生成字幕文件,不负责给视频加字幕样式、烧录画面或直接发布到平台。
  • 公开、教育、法律或安全相关视频,自动时间轴和文字都应该经过人工复核。

字幕可读性的基本原则

  • 两行短字幕通常比一整行长句更容易阅读。

  • 语速很快时,可能需要精简文字或更合理地拆分时间段。

  • 人名、数字和画面里的专有词,发布前应人工核对。

常见问题

SRT 和 VTT 有什么区别?

两者都保存带时间轴的字幕。SRT 被多数剪辑软件和平台支持;VTT 更适合网页视频,并支持更多 Web 字幕能力。

EarScribe 能自动修好所有字幕吗?

它可以优化断行并标出常见问题,但重要视频仍应完整预览,人工确认措辞和时间。

下载前可以修改字幕文字吗?

可以。先编辑带时间戳的文字,再回到字幕体检,导出更新后的 SRT 或 VTT。

相关音频工具