跳到主要內容

音訊轉錄

如何將音訊轉為文字並完成校對

準備錄音並產生轉錄文字,重點核對姓名、數字、說話者和存疑片段,再依用途選擇 TXT、DOCX、SRT 或 VTT。

更新於 2026年8月31日

要把錄音轉換成真正可用的文字,先保留原始檔案,明確文字用途,選擇錄音中的主要語言,再一邊播放原音訊,一邊核對高風險片段。自動轉錄可以省去大量輸入工作,但姓名、數字、引文和多人同時說話的部分仍需人工確認。

如果你手上有訪談、課程錄音、會議、語音備忘錄或 Podcast 錄音,並希望取得可搜尋的文字,可以按照本文完成準備、上傳、校對和匯出。

快速結論: 先產生完整初稿,再依風險校對。優先檢查專有名詞、金額、日期、決定和引文,因為這些位置一旦出錯,可能直接改變文字的用途。

音訊或影片檔案經過上傳、校對,最後選擇匯出檔案的流程

選擇合適的轉錄方式

方式適合情況主要工作常見結果
手動聽打片段很短,或必須逐字精細編輯反覆播放、暫停和輸入在聽取過程中直接修正的文字
語音輸入重新口述內容或創作新文字再說一次並修改與原始錄音沒有穩定對應關係的文字
檔案轉錄已有錄音需要搜尋、校對或製作字幕上傳並核對可配合播放檢查的完整初稿

語音輸入記錄的是你現在對著麥克風說的話;檔案轉錄處理的是已經存在、需要作為核對依據的錄音。MP3 檔案可以直接開啟 MP3 轉文字,其他支援的錄音可使用 音訊轉文字

上傳前先檢查錄音

盡量使用最接近原始版本的檔案。多次轉換格式無法找回沒有被錄下的聲音,還可能增加新的損失。

上傳前完成六項檢查:

  1. 播放開頭和結尾;
  2. 確認時間長度和內容完整;
  3. 確認主要說話聲可以聽清;
  4. 判斷錄音中的主要語言;
  5. 記錄預計會出現的人名、縮寫和專業術語;
  6. 留意是否有多人同時說話。

交通噪音、音樂、回音、距離過遠的麥克風和聲音重疊,都會讓部分詞語難以判斷。如果原始音訊本身不確定,轉錄結果也必須保留這種不確定性。

分五步完成音訊轉錄

1. 明確文字用途

僅供個人搜尋的文字和準備公開引用的文字,校對標準並不相同。先確定結果用於會議決定、訪談分析、課程複習、Podcast 製作、字幕還是歸檔搜尋,再決定哪些片段必須逐字核對。

2. 上傳檔案並選擇錄音語言

選擇錄音檔案和其中主要使用的語言。這裡選擇的是音訊裡的語言,不是瀏覽器介面語言,也不是錄製地點。如果錄音頻繁切換語言,應重點檢查切換位置以及外語姓名和縮寫。

開啟「自訂詞彙」,用逗號或換行加入預計出現的人名、公司名、縮寫和專業術語。最多可以加入 100 條,每條最多 50 個字元和 6 個詞。詞彙表只用於提示辨識,不保證每個詞都會正確出現;請把重要詞留在校對清單中。

Transcrever 繁體中文上傳區,包含檔案選擇、錄音語言和區分說話者設定

3. 先確認結果是否完整

處理結束後,先檢查開頭、中間和結尾是否都存在,再開始逐句編輯。多人錄音中的講者區分可以協助定位,但在引用或分配責任之前,仍需回聽並確認講者。

4. 依風險分層校對

優先核對:

  • 人名、機構名、產品名;
  • 日期、時間、金額、百分比和地址;
  • 決定、負責人和截止時間;
  • 準備公開發佈或引用的原話;
  • 說話者切換和聲音重疊;
  • 專業詞彙和縮寫。

接著再處理遺漏、標點、分段和統一用詞。只從頭到尾依序閱讀,容易在簡單片段上花費太多時間,卻漏掉真正影響結果的錯誤。

回聽以後,依錯誤類型選擇操作:

  • 修改單一片段;同一個字面錯誤重複出現時使用「尋找並取代」。符合項目不區分大小寫,只改變片段文字,並顯示取代數量;
  • 修改單一片段的說話者,或在不需要姓名時選擇「移除標籤」。沒有說話者的片段會在匯出時省略標籤和冒號;
  • 一個片段混合了兩段發言或不同意思時,把游標放在真正邊界並選擇「在游標處分割」;
  • 只有兩個片段相鄰且說話者相同時,才能選擇「與下一段合併」。如果屬於不同的人,應回聽並修正歸屬,不要強制合併;
  • 刪除片段前必須確認。刪除後它不會出現在之後的匯出中;僅剩的最後一個片段不能刪除;
  • 只有播放證明時間有誤時才修改開始和結束。編輯器會拒絕負數、開始不早於結束、與相鄰片段重疊以及超出錄音時間長度的範圍。

Transcrever 繁體中文編輯器,包含帶時間的片段以及播放和校對控制項

5. 依後續工作匯出

需要純文字時選擇 TXT,需要在文件軟體中繼續編輯時選擇 DOCX,需要 SubRip 字幕時選擇 SRT,目標平台要求 WebVTT 時選擇 VTT。SRT 和 VTT 會保留校對後的時間範圍。在匯出的檔案進入實際工作流程並確認可用之前,不要刪除原始錄音。

Transcrever 不設定字幕字型、顏色或位置,也不會把字幕燒錄進影片。樣式和燒錄需要在交付媒體所用的編輯器或發佈平台完成。

選擇 TXT、DOCX、SRT 還是 VTT

你需要選擇原因
用於搜尋、複製或歸檔的純文字TXT不包含字幕語法或文件樣式
繼續編輯和排版的文件DOCX可在文件軟體中開啟,並保留片段和說話者
帶時間範圍的 SubRip 字幕SRT每條字幕保留已校對的開始和結束時間
目標平台要求的 WebVTT 字幕VTT使用 WebVTT 語法寫出已校對的時間範圍

四輪校對方法

  1. 完整性: 確認沒有缺少整段內容。
  2. 關鍵事實: 對照音訊核對姓名、數字、日期和引文。
  3. 說話者與含義: 確認每段話屬於誰,並修復聲音重疊造成的斷句。
  4. 交付: 整理標點和格式,再測試匯出的檔案。

當音訊無法支援可靠判斷時,應明確標記存疑,而不是猜測。看得見的不確定性,比看似確定、實際杜撰的文字更安全。

常見問題排查

問題檢查內容處理方式
無法開始上傳副檔名、檔案大小、檔案能否在本機播放使用支援的原始檔,或真正轉換格式
姓名辨識錯誤對應時間點和正確拼法回聽後統一修改全文
說話者混在一起聲音切換前後的邊界回放邊界並修改該片段的說話者
標點不自然停頓、句意和段落關係在不改變原意的前提下編輯
某段內容缺失原音訊中是否能聽到語音標記存疑,或尋找更清晰的錄音

常見問答

自動轉錄可以不校對直接使用嗎?

低風險的個人搜尋有時可以直接使用初稿;公開引用、記錄決定、確認說話者或使用數字之前必須校對。校對強度應取決於錯誤會造成什麼後果。

轉錄前需要先降噪嗎?

如果原始檔完整且可以聽清,優先使用原始檔。過度處理可能讓語音失真。如果製作了降噪版本,應保留原件,並抽查幾個片段確認處理後的版本確實更好。

聽不清楚的內容應該怎麼辦?

回放前後語境,並檢查是否有其他錄音或文字來源。如果仍無法確認,應標記為聽不清楚,而不是補寫一個沒有證據的答案。

什麼時候使用自訂詞彙,什麼時候使用全部取代?

上傳前加入自訂詞彙,用來提示可能出現的姓名和術語。它可以引導辨識,但不保證結果。轉錄完成後,只有確認文字中的所有字面符合項目都需要相同修正時,才使用「尋找並取代」;它不會修改錄音、說話者或時間碼。

應該選擇哪種匯出格式?

純文字選擇 TXT,工作文件選擇 DOCX,SubRip 字幕選擇 SRT,使用 WebVTT 的目標平台選擇 VTT。發佈前請把 SRT 或 VTT 和最終媒體一起播放測試。

下一步

開啟 音訊轉文字,上傳錄音,並按照本文的風險清單核對結果。確認重要片段與原始音訊一致後,再匯出到後續工作中。

其他說明文章

查看全部文章