音频转录
如何将音频转为文字并完成校对
准备录音并生成转录文本,重点核对姓名、数字、说话人和存疑片段,再根据用途选择 TXT、DOCX、SRT 或 VTT。
更新于 2026年8月31日
要把录音转换成真正可用的文字,先保留原始文件,明确文字的用途,选择录音中的主要语言,再一边播放原音频,一边核对高风险片段。自动转录可以省去大量打字工作,但姓名、数字、引语和多人同时说话的部分仍然需要人工确认。
如果你手上有访谈、课程录音、会议、语音备忘录或播客录音,并希望得到可搜索的文字,可以按照本文完成准备、上传、校对和导出。
快速结论: 先生成完整初稿,再按风险校对。优先检查专有名词、金额、日期、决定和引语,因为这些位置一旦出错,可能直接改变文字的用途。

选择合适的转录方式
| 方式 | 适合情况 | 主要工作 | 常见结果 |
|---|---|---|---|
| 手工听写 | 片段很短,或必须逐字精细编辑 | 反复播放、暂停和输入 | 在听取过程中直接修正的文字 |
| 语音输入 | 重新口述内容或创作新文本 | 再说一遍并修改 | 与原始录音没有稳定对应关系的文字 |
| 文件转录 | 已有录音需要搜索、校对或制作字幕 | 上传并核对 | 可结合播放检查的完整初稿 |
语音输入记录的是你现在对着麦克风说的话;文件转录处理的是已经存在、需要作为核对依据的录音。MP3 文件可以直接打开 MP3 转文字,其他支持的录音可使用 音频转文字。
上传前先检查录音
尽量使用最接近原始版本的文件。多次转换格式无法找回没有被录下的声音,还可能增加新的损失。
上传前完成六项检查:
- 播放开头和结尾;
- 确认时长和内容完整;
- 确认主要说话声可以听清;
- 判断录音中的主要语言;
- 记录预计会出现的人名、缩写和专业术语;
- 留意是否有多人同时说话。
交通噪声、音乐、回声、距离过远的麦克风和声音重叠都会让部分词语难以判断。如果原始音频本身不确定,转录结果也必须保留这种不确定性。
分五步完成音频转录
1. 明确文字的用途
仅供个人搜索的文本和准备公开引用的文本,校对标准并不相同。先确定结果用于会议决定、访谈分析、课程复习、播客制作、字幕还是归档搜索,再决定哪些片段必须逐字核对。
2. 上传文件并选择录音语言
选择录音文件和其中主要使用的语言。这里选择的是音频里的语言,不是浏览器界面语言,也不是录制地点。如果录音频繁切换语言,应重点检查切换位置以及外语姓名和缩写。
打开“自定义词汇”,用逗号或换行添加预计出现的人名、公司名、缩写和专业术语。最多可以添加 100 条,每条最多 50 个字符和 6 个词。词汇表只用于提示识别,不保证每个词都会正确出现;请把重要词留在校对清单中。

3. 先确认结果是否完整
处理结束后,先检查开头、中间和结尾是否都存在,再开始逐句编辑。多人录音中的说话人分离可以帮助定位,但在引用或分配责任之前,仍需回听并确认说话人。
4. 按风险分层校对
优先核对:
- 人名、机构名、产品名;
- 日期、时间、金额、百分比和地址;
- 决定、负责人和截止时间;
- 准备公开发布或引用的原话;
- 说话人切换和声音重叠;
- 专业词汇和缩写。
然后再处理遗漏、标点、分段和统一用词。只从头到尾顺序阅读,容易在简单片段上花费过多时间,却漏掉真正影响结果的错误。
回听以后,按错误类型选择操作:
- 修改单个片段;同一个字面错误重复出现时使用“查找并替换”。匹配不区分大小写,只改变片段文字,并显示替换数量;
- 修改单个片段的说话人,或在不需要姓名时选择“移除标签”。没有说话人的片段会在导出时省略标签和冒号;
- 一个片段混合了两段发言或不同意思时,把光标放在真实边界并选择“在光标处分割”;
- 只有两个片段相邻且说话人相同时,才能选择“与下一段合并”。如果属于不同的人,应回听并修正归属,不要强行合并;
- 删除片段前必须确认。删除后它不会出现在之后的导出中;仅剩的最后一个片段不能删除;
- 只有播放证明时间有误时才修改开始和结束。编辑器会拒绝负数、开始不早于结束、与相邻片段重叠以及超出录音时长的范围。

5. 根据后续任务导出
需要纯文本时选择 TXT,需要在文档软件中继续编辑时选择 DOCX,需要 SubRip 字幕时选择 SRT,目标平台要求 WebVTT 时选择 VTT。SRT 和 VTT 会保留校对后的时间范围。在导出的文件进入实际工作流程并确认可用之前,不要删除原始录音。
Transcrever 不设置字幕字体、颜色或位置,也不会把字幕烧录进视频。样式和烧录需要在交付媒体所用的编辑器或发布平台完成。
选择 TXT、DOCX、SRT 还是 VTT
| 你需要 | 选择 | 原因 |
|---|---|---|
| 用于搜索、复制或归档的纯文本 | TXT | 不包含字幕语法或文档样式 |
| 继续编辑和排版的文档 | DOCX | 可在文档软件中打开,并保留片段和说话人 |
| 带时间范围的 SubRip 字幕 | SRT | 每条字幕保留已校对的开始和结束时间 |
| 目标平台要求的 WebVTT 字幕 | VTT | 使用 WebVTT 语法写出已校对的时间范围 |
四轮校对方法
- 完整性: 确认没有缺少整段内容。
- 关键事实: 对照音频核对姓名、数字、日期和引语。
- 说话人与含义: 确认每段话属于谁,并修复声音重叠造成的断句。
- 交付: 整理标点和格式,再测试导出的文件。
当音频无法支持可靠判断时,应明确标记存疑,而不是猜测。可见的不确定性比看似确定、实际编造的文字更安全。
常见问题排查
| 问题 | 检查内容 | 处理方式 |
|---|---|---|
| 无法开始上传 | 扩展名、文件大小、文件能否在本地播放 | 使用受支持的原文件,或真正转换格式 |
| 姓名识别错误 | 对应时间点和正确拼写 | 回听后统一修改全文 |
| 说话人混在一起 | 声音切换前后的边界 | 回放边界并修改该片段的说话人 |
| 标点不自然 | 停顿、句意和段落关系 | 在不改变原意的前提下编辑 |
| 某段内容缺失 | 原音频中是否能听到语音 | 标记存疑,或寻找更清晰的录音 |
常见问答
自动转录可以不校对直接使用吗?
低风险的个人搜索有时可以直接使用初稿;公开引用、记录决定、确认说话人或使用数字之前必须校对。校对强度应取决于错误会造成什么后果。
转录前需要先降噪吗?
如果原文件完整且可以听清,优先使用原文件。过度处理可能让语音失真。如果制作了降噪版本,应保留原件,并抽查几个片段确认处理后的版本确实更好。
听不清的内容应该怎么办?
回放前后语境,并检查是否有其他录音或文字来源。如果仍无法确认,应标记为听不清,而不是补写一个没有证据的答案。
什么时候使用自定义词汇,什么时候使用全部替换?
上传前添加自定义词汇,用来提示可能出现的姓名和术语。它可以引导识别,但不保证结果。转录完成后,只有确认文字中的所有字面匹配都需要同样修正时,才使用“查找并替换”;它不会修改录音、说话人或时间码。
应该选择哪种导出格式?
纯文本选择 TXT,工作文档选择 DOCX,SubRip 字幕选择 SRT,使用 WebVTT 的目标平台选择 VTT。发布前请把 SRT 或 VTT 和最终媒体一起播放测试。
下一步
打开 音频转文字,上传录音,并按照本文的风险清单核对结果。确认重要片段与原始音频一致后,再导出到后续工作中。