音訊轉錄
如何將音訊轉為文字並完成校對
準備錄音並產生轉錄文字,重點核對姓名、數字、說話者和存疑片段,再依用途選擇 TXT、DOCX、SRT 或 VTT。
更新於 2026年8月31日
要把錄音轉換成真正可用的文字,先保留原始檔案,明確文字用途,選擇錄音中的主要語言,再一邊播放原音訊,一邊核對高風險片段。自動轉錄可以省去大量輸入工作,但姓名、數字、引文和多人同時說話的部分仍需人工確認。
如果你手上有訪談、課程錄音、會議、語音備忘錄或 Podcast 錄音,並希望取得可搜尋的文字,可以按照本文完成準備、上傳、校對和匯出。
快速結論: 先產生完整初稿,再依風險校對。優先檢查專有名詞、金額、日期、決定和引文,因為這些位置一旦出錯,可能直接改變文字的用途。

選擇合適的轉錄方式
| 方式 | 適合情況 | 主要工作 | 常見結果 |
|---|---|---|---|
| 手動聽打 | 片段很短,或必須逐字精細編輯 | 反覆播放、暫停和輸入 | 在聽取過程中直接修正的文字 |
| 語音輸入 | 重新口述內容或創作新文字 | 再說一次並修改 | 與原始錄音沒有穩定對應關係的文字 |
| 檔案轉錄 | 已有錄音需要搜尋、校對或製作字幕 | 上傳並核對 | 可配合播放檢查的完整初稿 |
語音輸入記錄的是你現在對著麥克風說的話;檔案轉錄處理的是已經存在、需要作為核對依據的錄音。MP3 檔案可以直接開啟 MP3 轉文字,其他支援的錄音可使用 音訊轉文字。
上傳前先檢查錄音
盡量使用最接近原始版本的檔案。多次轉換格式無法找回沒有被錄下的聲音,還可能增加新的損失。
上傳前完成六項檢查:
- 播放開頭和結尾;
- 確認時間長度和內容完整;
- 確認主要說話聲可以聽清;
- 判斷錄音中的主要語言;
- 記錄預計會出現的人名、縮寫和專業術語;
- 留意是否有多人同時說話。
交通噪音、音樂、回音、距離過遠的麥克風和聲音重疊,都會讓部分詞語難以判斷。如果原始音訊本身不確定,轉錄結果也必須保留這種不確定性。
分五步完成音訊轉錄
1. 明確文字用途
僅供個人搜尋的文字和準備公開引用的文字,校對標準並不相同。先確定結果用於會議決定、訪談分析、課程複習、Podcast 製作、字幕還是歸檔搜尋,再決定哪些片段必須逐字核對。
2. 上傳檔案並選擇錄音語言
選擇錄音檔案和其中主要使用的語言。這裡選擇的是音訊裡的語言,不是瀏覽器介面語言,也不是錄製地點。如果錄音頻繁切換語言,應重點檢查切換位置以及外語姓名和縮寫。
開啟「自訂詞彙」,用逗號或換行加入預計出現的人名、公司名、縮寫和專業術語。最多可以加入 100 條,每條最多 50 個字元和 6 個詞。詞彙表只用於提示辨識,不保證每個詞都會正確出現;請把重要詞留在校對清單中。

3. 先確認結果是否完整
處理結束後,先檢查開頭、中間和結尾是否都存在,再開始逐句編輯。多人錄音中的講者區分可以協助定位,但在引用或分配責任之前,仍需回聽並確認講者。
4. 依風險分層校對
優先核對:
- 人名、機構名、產品名;
- 日期、時間、金額、百分比和地址;
- 決定、負責人和截止時間;
- 準備公開發佈或引用的原話;
- 說話者切換和聲音重疊;
- 專業詞彙和縮寫。
接著再處理遺漏、標點、分段和統一用詞。只從頭到尾依序閱讀,容易在簡單片段上花費太多時間,卻漏掉真正影響結果的錯誤。
回聽以後,依錯誤類型選擇操作:
- 修改單一片段;同一個字面錯誤重複出現時使用「尋找並取代」。符合項目不區分大小寫,只改變片段文字,並顯示取代數量;
- 修改單一片段的說話者,或在不需要姓名時選擇「移除標籤」。沒有說話者的片段會在匯出時省略標籤和冒號;
- 一個片段混合了兩段發言或不同意思時,把游標放在真正邊界並選擇「在游標處分割」;
- 只有兩個片段相鄰且說話者相同時,才能選擇「與下一段合併」。如果屬於不同的人,應回聽並修正歸屬,不要強制合併;
- 刪除片段前必須確認。刪除後它不會出現在之後的匯出中;僅剩的最後一個片段不能刪除;
- 只有播放證明時間有誤時才修改開始和結束。編輯器會拒絕負數、開始不早於結束、與相鄰片段重疊以及超出錄音時間長度的範圍。

5. 依後續工作匯出
需要純文字時選擇 TXT,需要在文件軟體中繼續編輯時選擇 DOCX,需要 SubRip 字幕時選擇 SRT,目標平台要求 WebVTT 時選擇 VTT。SRT 和 VTT 會保留校對後的時間範圍。在匯出的檔案進入實際工作流程並確認可用之前,不要刪除原始錄音。
Transcrever 不設定字幕字型、顏色或位置,也不會把字幕燒錄進影片。樣式和燒錄需要在交付媒體所用的編輯器或發佈平台完成。
選擇 TXT、DOCX、SRT 還是 VTT
| 你需要 | 選擇 | 原因 |
|---|---|---|
| 用於搜尋、複製或歸檔的純文字 | TXT | 不包含字幕語法或文件樣式 |
| 繼續編輯和排版的文件 | DOCX | 可在文件軟體中開啟,並保留片段和說話者 |
| 帶時間範圍的 SubRip 字幕 | SRT | 每條字幕保留已校對的開始和結束時間 |
| 目標平台要求的 WebVTT 字幕 | VTT | 使用 WebVTT 語法寫出已校對的時間範圍 |
四輪校對方法
- 完整性: 確認沒有缺少整段內容。
- 關鍵事實: 對照音訊核對姓名、數字、日期和引文。
- 說話者與含義: 確認每段話屬於誰,並修復聲音重疊造成的斷句。
- 交付: 整理標點和格式,再測試匯出的檔案。
當音訊無法支援可靠判斷時,應明確標記存疑,而不是猜測。看得見的不確定性,比看似確定、實際杜撰的文字更安全。
常見問題排查
| 問題 | 檢查內容 | 處理方式 |
|---|---|---|
| 無法開始上傳 | 副檔名、檔案大小、檔案能否在本機播放 | 使用支援的原始檔,或真正轉換格式 |
| 姓名辨識錯誤 | 對應時間點和正確拼法 | 回聽後統一修改全文 |
| 說話者混在一起 | 聲音切換前後的邊界 | 回放邊界並修改該片段的說話者 |
| 標點不自然 | 停頓、句意和段落關係 | 在不改變原意的前提下編輯 |
| 某段內容缺失 | 原音訊中是否能聽到語音 | 標記存疑,或尋找更清晰的錄音 |
常見問答
自動轉錄可以不校對直接使用嗎?
低風險的個人搜尋有時可以直接使用初稿;公開引用、記錄決定、確認說話者或使用數字之前必須校對。校對強度應取決於錯誤會造成什麼後果。
轉錄前需要先降噪嗎?
如果原始檔完整且可以聽清,優先使用原始檔。過度處理可能讓語音失真。如果製作了降噪版本,應保留原件,並抽查幾個片段確認處理後的版本確實更好。
聽不清楚的內容應該怎麼辦?
回放前後語境,並檢查是否有其他錄音或文字來源。如果仍無法確認,應標記為聽不清楚,而不是補寫一個沒有證據的答案。
什麼時候使用自訂詞彙,什麼時候使用全部取代?
上傳前加入自訂詞彙,用來提示可能出現的姓名和術語。它可以引導辨識,但不保證結果。轉錄完成後,只有確認文字中的所有字面符合項目都需要相同修正時,才使用「尋找並取代」;它不會修改錄音、說話者或時間碼。
應該選擇哪種匯出格式?
純文字選擇 TXT,工作文件選擇 DOCX,SubRip 字幕選擇 SRT,使用 WebVTT 的目標平台選擇 VTT。發佈前請把 SRT 或 VTT 和最終媒體一起播放測試。
下一步
開啟 音訊轉文字,上傳錄音,並按照本文的風險清單核對結果。確認重要片段與原始音訊一致後,再匯出到後續工作中。