AI语音识别新增说话人识别、声音事件与标点控制
· 阅读需 3 分钟
QuantumSubtitle 语音识别可将音频和视频中的语音转换为带时间码的字幕文本。新增的识别选项让您进一步控制每句字幕对应的说话人、是否包含非语音声音,以及字幕是否保留标点。
语音识别新增了哪些控制选项?
创建识别任务时,您可以按需设置以下选项:
- **说话人识别:**区分不同声音,并为对应的字幕片段添加说话人标签。识别完成后可在字幕编辑器中重命名标签。
- **声音事件:**将笑声、掌声和背景声音等非语音事件加入转录结果。您可以在字幕查看器中过滤或编辑事件字幕。
- **标点控制:**选择字幕文本是否显示标点符号;该设置会应用于复制或导出的文本。
说话人识别的作用是区分声音并添加标签,不会自动判断说话人的真实姓名。查看转录结果后,您可以自行重命名标签。
如何使用这些选项
- 打开语音识别,上传音频或视频文件。
- 选择音频语言;不确定时可保留“自动”设置。
- 按需要开启说话人识别或声音事件检测,并选择是否保留标点。
- 开始识别,然后在字幕编辑器中检查带时间码的转录结果。
- 校正文本、重命名说话人,并在下载 SRT 文件或复制文本前过滤或编辑事件字幕。
这些选项适用于访谈、播客、课程、网络研讨会等场景,尤其适合需要区分多位说话人,或需要呈现对白之外重要声音的内容。清晰的录音和人工校对仍有助于修正人名、重叠语音及识别错误。
常见问题
什么是说话人识别或说话人分离?
说话人分离会区分录音中的不同声音,并为对应的字幕片段分配标签。您可以在编辑器中重命名这些标签。
能检测哪些声音事件?
可将笑声、掌声和背景声音等非语音事件加入结果,并在字幕查看器中过滤或编辑。
可以移除字幕中的标点吗?
可以。您可以开启或关闭标点显示;复制或导出字幕文本时会应用此设置。
可以将转录结果导出为 SRT 吗?
可以。检查转录结果后,即可下载 SRT 字幕文件。
