跳到主要内容

快速入门视频

观看快速演示,然后按照以下步骤操作。

AI语音识别 - 从音视频转录并编辑字幕

Quantum Subtitle 语音识别会将音频或视频中的口语转换为带时间码的字幕文本。您可以选择识别不同说话人和非语音声音事件,在字幕编辑器中校对转录结果,然后下载 SRT 文件。

语音识别也称为语音转文字或 ASR,它转录媒体音轨中的对白。若视频画面中已有烧录字幕并要将其转为文字,请使用字幕提取器的 OCR,而不是语音识别。若不确定音频语言,可保留“自动”设置。

当前功能:

  • 说话人识别:按不同说话人整理转录片段,并可在编辑器中重命名标签。
  • 声音事件:可选择将非语音声音事件加入转录结果。
  • 标点设置:可选择保留或移除标点。
  • SRT 导出:保留字幕时间范围并下载标准 SRT 文件。
输入格式限制输出
MP3、WAV、M4A、MP4、MOV、AVI、MKV每批最多 10 个文件;每个文件最多 5 GB可编辑转录文本和 SRT

识别效果会受到录音质量、背景噪声、多人重叠说话,以及人名或专业术语的影响。发布前请检查转录结果。

分步指南​

  1. 上传媒体文件:选择一个或多个支持格式的音频或视频文件。每批最多 10 个文件,每个文件最大为 5 GB。
  2. 设置音频语言:不确定时保留“自动”;也可以选择录音中使用的语言。
  3. 设置识别选项:按需开启“说话人识别”或“声音事件”,并选择是否保留标点。
  4. 开始识别:提交任务并等待处理完成。
  5. 校对并导出:在字幕编辑器中检查转录内容,需要时更正字幕文字或分配说话人,然后下载 SRT。

获得最佳效果的提示​

  • 清晰的音频质量:确保您的视频/音频具有清晰的语音,没有背景噪音
  • 单一语言:为获得最佳准确性,请使用单一主要语言的内容
  • 适当的音量:确保语音音量足以进行识别
  • 文件大小:较大的文件可能需要更长的处理时间,但仍能有效工作

校对转录文本与说话人标签​

开启说话人识别后,编辑器会按识别出的说话人整理转录片段。您可以重命名说话人、修改单条字幕文字,或将字幕行重新分配给其他说话人。只有在没有字幕片段或声音事件关联到该说话人时,才可以删除该说话人。编辑器会自动保存更改;保存失败时可以重试。

下载 SRT 时,每条字幕都会保留时间范围。若开启了说话人识别,说话人名称会出现在字幕文本中;若开启声音事件识别,声音事件也可能作为字幕条目导出。发布前请检查人名、重叠语音和事件标签。

打开语音识别工具创建任务;校对完成后,也可以使用在线 SRT 翻译器。