跳到主要內容

問題排解

自動轉錄為什麼不準,以及如何修正

排查語言選錯、噪音、重疊說話、姓名和說話人錯誤,並在 Transcrever 中對照錄音修正。

作者:Transcrever閱讀約 2 分鐘
帶噪音的音訊波形經過多個診斷點後變成已校對文字

自動轉錄不準時,先檢查出錯片段,不要盲目重做整個檔案。在 Transcrever 編輯器搜尋某個詞,或打開出錯時間,播放前後幾秒並對照文字。錯誤類型會指向下一步:修正姓名、確認說話者、更換語言,或尋找更好的來源檔案。

快速診斷:出了什麼問題?

文字症狀可能原因首先要做的事
大量句子沒有意義選擇的語言不符檢查語言後必要時重送
某段內容消失聲音太小、截斷、噪音或遮蓋聽缺口前後的錄音
姓名變成常見詞專有名詞缺少上下文查看議程或參與者名單
說話者分錯聲音相似、音量不等或重疊跨越切換點回聽,並修改該片段的說話者
整體效果很差來源遠、失真或過度壓縮尋找更接近原始的檔案

用於定位片段、播放錄音、修正文字和檢查說話人的 Transcrever 編輯器

1. 逐句修改前先檢查語言

錯誤語言會改變系統認為可能的詞。返回上傳頁,確認錄音的主要語言,不要在檢查此設定前修改數百行文字。

Transcrever 上傳前的語言選擇與說話人分離

2. 聽噪音、距離和回音是否遮蓋人聲

麥克風距離遠時,會收錄更多環境聲。交通、風扇、鍵盤和其他人聲會與主要語音競爭,回音也會讓輔音和詞尾模糊。可參考 Google Cloud 的語音資料建議

3. 把重疊說話當作必須回聽的點

兩人同時說話時,文字可能漏詞、合併兩句或標錯說話者。說話者區分可以整理初稿,但不能保證每段歸屬。應從上一輪發言聽到回答結束。如果只有一個片段歸屬錯誤,可以單獨修改該片段的說話者;不需要顯示姓名時,可以移除標籤。只有同一標籤需要在全文統一更名時,才使用全域重新命名。

如果一個片段同時包含上一位和下一位說話者的內容,可以把游標放在交界處拆分。兩個連續碎片只有在說話者相同時才能合併。先用錄音確認邊界,不要只是為了讓文字看起來整齊而改動結構。

4. 用其他資料核對姓名、縮寫和數字

上傳前準備參與者、機構、專案、日期和專業術語清單。在上傳區開啟「自訂詞彙」,用逗號或換行分隔這些詞。詞彙表只用來提示辨識,並不保證每個詞都會正確出現,仍需對照錄音和上下文校對。

結果產生後,在 Transcrever 搜尋這些詞,回聽完整片段後再修正拼寫。如果同一個字面錯誤重複出現,可以使用「尋找與取代」:它會在所有片段文字中進行不區分大小寫的字面取代,並顯示取代數量。它不會修改錄音、說話者或時間碼。套用到全文前,至少先核對一處;參考清單用於確認拼法,不能用來補寫聽不清楚的內容。

5. 在 Transcrever 中按順序修正

  1. 搜尋姓名、數字、日期和否定詞;
  2. 播放包含上下文的片段;
  3. 只修改能確認的文字,只有每個字面符合項目都需要相同修正時才全部取代;
  4. 修改單一片段的說話者,移除不需要的標籤,並在錄音支援時拆分或合併片段;
  5. 確認某個片段不應保留後再刪除;
  6. 只有播放證明同步有誤時才修改開始和結束時間,編輯器會拒絕無效或重疊範圍;
  7. 再讀一次片段,並為下一步選擇檔案。

上傳錄音、校對文字並選擇匯出檔案的流程

需要純文字時下載 TXT,需要在文件軟體中繼續編輯時下載 DOCX,需要 SubRip 字幕時下載 SRT,平台使用 WebVTT 時下載 VTT。SRT 和 VTT 會保留校對後的時間範圍,但不會設定字幕樣式、位置,也不會把字幕燒錄進影片。發佈前仍要把字幕檔和最終影片一起播放檢查。

可從音訊轉文字開始;多人錄音可參考會議轉錄

6. 決定是修改、重送還是更換錄音

錯誤集中在少數可聽清片段時,直接修改。語言選錯或找到更好來源時,重新提交。人聲長時間無法辨識時,尋找其他錄音。

常見問題

調大音量能改善轉錄嗎?

可能更容易聽,但也會放大噪音,無法恢復已丟失的頻率或失真。

降噪一定有用嗎?

不一定。過強濾波可能把人聲一起刪除,應在副本測試。

錄音清楚時姓名為什麼還會錯?

姓名比常見詞缺少可預測上下文。上傳前可以把預計出現的姓名加入自訂詞彙來提示辨識,結果產生後仍要查證拼法並回聽完整片段。詞彙表不能取代校對。

自訂詞彙和全部取代有什麼差別?

自訂詞彙隨錄音一起提交,用來提示可能出現的姓名和術語,但不保證辨識結果。全部取代在轉錄完成後執行,只改變已產生文字中的字面符合項目。前者提供辨識上下文,後者應在確認所有符合項目都需要相同修正後使用。

如何更快校對長錄音?

先處理將被使用的姓名、數字、日期、引用和說話人切換。

繼續閱讀

查看全部文章