区分说话人:多人对话自动拆分,谁说的清清楚楚
一段会议录音转成文字后,如果所有内容挤在一起、分不清谁说的,整理起来很痛苦。区分说话人(Speaker Diarization)就是解决这个问题:软件自动判断「这句话是 A 说的,那句是 B 说的」,把多人对话按人拆开并标注。本文讲清它是什么、用在哪儿、以及用 VoiceText 怎么操作。
一、区分说话人是什么
通俗地说,普通语音转文字只负责「声音→文字」,但不关心「谁说的」。区分说话人在转写之外多做一步:给每一段话贴上发言人标签。
- 「发言人1:我们这周先把方案定了。」
- 「发言人2:好,我负责写初稿。」
- 「发言人1:周五前发我看看。」
这样整段对话按人分段,后续整理纪要、追责、回看都方便得多。它和「语音转文字」是配套能力——VoiceText 声文智转在转写的同时就完成区分说话人,且在你电脑本地完成。
二、哪些场景特别需要它
- 会议 / 周会:几人讨论,转完直接知道谁承诺了什么,整理纪要快几倍。
- 访谈 / 播客:主持人和嘉宾的问答天然分人,方便出逐字稿和金句摘录。
- 网课 / 讲座:讲师和学生的互动、多人连麦,按人拆分后更好做笔记。
- 电话录音 / 客服:客户与坐席的对话区分开,便于质检和复盘。
- 论坛 / 圆桌:多位嘉宾发言,自动标注发言人让文字稿可读。
三、VoiceText 怎么做区分说话人(4 步)
导入多人对话录音
把会议、访谈的录音(mp3 / wav / m4a 等)拖进软件窗口。多人对话、现场录音都支持。
开启区分说话人
在识别选项中打开区分说话人。软件会在本地模型里同时做「转写」和「区分发言人」两件事。
等待本地识别完成
识别在你电脑本地完成,文件不上传。录音越长越久,但本地处理、隐私不出本机。
查看分段结果并导出
右侧文字按「发言人1 / 发言人2 …」分段展示。可直接复制,或导出按人分段的文稿,拿去做纪要、字幕都行。
四、区分说话人 ≠ 说话人识别
有个常见混淆要厘清:
- 区分说话人(Diarization):只区分「这是不同的人」,标成发言人1、发言人2,但不一定知道真名。
- 说话人识别(Identification):进一步把声音对应到具体某人(需提前录入声纹)。
VoiceText 当前提供的是区分说话人——自动把对话按人拆段并标注,适合绝大多数「理清谁说了啥」的需求;如果需要对应真名,可在导出后手动把「发言人1」改成实际姓名。
五、常见问题(FAQ)
几个人以内的对话分得清?
日常会议、访谈常见的几人对话都能有效拆分。人数越多、互相打断越频繁,拆分难度越大;录音清晰、少重叠时效果最好。
能导出「按人分段」的文稿吗?
能。识别完成后可直接复制带发言人标签的文字,或导出带分段标记的文稿,便于后续整理。
和「离线语音转文字」是一回事吗?
是配套能力:离线转写负责「声音变文字」,区分说话人在本地一并完成「谁说的」。两者都不出本机。详见离线语音转文字专题。
长会议录音也能分离吗?
能。几小时的会议、网课同样支持,配合长音频转写一次处理完。
六、相关专题
区分说话人在 VoiceText 声文智转中在您电脑本地运行,适合会议、访谈、网课等多人场景。