VoiceText 声文智转 · 使用技巧
识别准确度一半靠模型、一半靠「怎么录」。下面这些技巧,能把你的语音转文字结果再拔高一截。
一、收音是第一生产力
语音识别的本质是「听清」,再好的模型也救不了听不清的录音。
- 靠近音源:说话人离麦克风 20–40 厘米最佳,越近越清晰。
- 减少回声与背景乐:空旷房间、大混响、BGM 都会拉低准确度,尽量在相对安静环境录制。
- 口音重 / 方言:尽量用标准普通话或英文清晰表达;模型对中文普通话、英文主力语种支持最好。
经验:同样的素材,靠近麦克风重录一次,往往比反复改后处理更省时间。
二、嘈杂 / 远场:先用「纯人声分离」降噪
现场录音、远场开会、带背景音乐的素材,直接转写容易被噪声带偏。先开启纯人声分离,软件会提取干净人声、压低背景噪声,再送识别,准确度明显提升。
三、多人说话:开「区分说话人」
会议、访谈、圆桌讨论里多个角色交替发言,开启区分说话人后,文字会自动标注「谁在说」,方便你整理成带署名的纪要,而不是一大段分不清归属的纯文本。
四、需要外挂字幕:导出 SRT
转写完成后可一键导出 SRT 字幕文件(纯文本、通用),直接拖进剪映、Premiere、必剪等剪辑软件即可生成可编辑字幕轨。详见《导出 SRT 字幕并烧录到视频》。
五、中英混说:开「双语字幕」
内容里中英文夹杂(如专业术语、品牌名、代码),可开启双语字幕,原文与目标语言同屏呈现,避免专有名词被误转成近似中文。
六、大批量:用「批量模式」
几十上百个音频 / 视频要处理,用批量模式一次性丢进去,软件自动逐个转写并各自导出结果,无需人工守着。