跳至主要内容

快速入門影片

觀看快速示範,然後按照以下步驟操作。

AI 語音識別:從音訊與影片轉錄並編輯字幕

Quantum Subtitle 語音識別會將音訊或影片中的口語轉換成帶時間碼的字幕文字。您可以選擇識別不同說話者和非語音聲音事件,在字幕編輯器校對轉錄結果,然後下載 SRT 檔案。

語音識別也稱為語音轉文字或 ASR,它轉錄媒體音軌中的對白。若影片畫面中已有燒錄字幕並要將其轉成文字,請使用字幕提取器的 OCR,而非語音識別。若不確定音訊語言,可保留「自動」設定。

目前功能:

  • 說話者識別:依不同說話者整理轉錄片段,並可在編輯器重新命名標籤。
  • 聲音事件:可選擇將非語音聲音事件加入轉錄結果。
  • 標點設定:可選擇保留或移除標點。
  • SRT 匯出:保留字幕時間範圍並下載標準 SRT 檔案。
輸入格式限制輸出
MP3、WAV、M4A、MP4、MOV、AVI、MKV每批最多 10 個檔案;每個檔案最多 5 GB可編輯轉錄文字和 SRT

識別效果會受到錄音品質、背景雜音、多人重疊說話,以及人名或專業術語的影響。發布前請檢查轉錄結果。

逐步指南​

  1. 上傳媒體檔案:選擇一個或多個支援格式的音訊或影片檔案。每批最多 10 個檔案,每個檔案最大為 5 GB。
  2. 設定音訊語言:不確定時保留「自動」;也可以選擇錄音中使用的語言。
  3. 設定識別選項:依需求開啟「說話者識別」或「聲音事件」,並選擇是否保留標點。
  4. 開始識別:提交任務並等待處理完成。
  5. 校對並匯出:在字幕編輯器檢查轉錄內容,必要時更正字幕文字或指派說話者,接著下載 SRT。

獲得最佳結果的提示​

  • 清晰的音訊品質:確保您的影片/音訊具有清晰的語音且沒有背景噪音
  • 單一語言:為了獲得最佳準確度,請使用單一主要語言的內容
  • 適當的音量:確保語音音量足以進行辨識
  • 檔案大小:較大的檔案可能需要較長的時間處理,但仍能有效運作

校對轉錄文字與說話者標籤​

開啟說話者識別後,編輯器會依偵測到的說話者整理轉錄片段。您可以重新命名說話者、修改單筆字幕文字,或將字幕列重新指派給其他說話者。只有在沒有字幕片段或聲音事件與該說話者關聯時,才能刪除該說話者。編輯器會自動儲存變更;若儲存失敗,可以重試。

下載 SRT 時,每則字幕都會保留時間範圍。若開啟說話者識別,說話者名稱會包含在字幕文字中;若開啟聲音事件識別,事件也可能匯出為字幕列。發布前請檢查人名、重疊語音和事件標籤。

開啟語音識別工具建立任務;校對完成後,也可以使用線上 SRT 翻譯器。