首页专题 › 区分说话人

区分说话人:多人对话自动拆分,谁说的清清楚楚

一段会议录音转成文字后,如果所有内容挤在一起、分不清谁说的,整理起来很痛苦。区分说话人(Speaker Diarization)就是解决这个问题:软件自动判断「这句话是 A 说的,那句是 B 说的」,把多人对话按人拆开并标注。本文讲清它是什么、用在哪儿、以及用 VoiceText 怎么操作。

一、区分说话人是什么

通俗地说,普通语音转文字只负责「声音→文字」,但不关心「谁说的」。区分说话人在转写之外多做一步:给每一段话贴上发言人标签

这样整段对话按人分段,后续整理纪要、追责、回看都方便得多。它和「语音转文字」是配套能力——VoiceText 声文智转在转写的同时就完成区分说话人,且在你电脑本地完成。

二、哪些场景特别需要它

💡 一句话:只要是「两个及以上人说话」的录音,区分说话人都能省你大量手工标注的时间。

三、VoiceText 怎么做区分说话人(4 步)

1

导入多人对话录音

把会议、访谈的录音(mp3 / wav / m4a 等)拖进软件窗口。多人对话、现场录音都支持。

把音视频拖进软件窗口示意图
把文件拖进主界面虚线框 / 或点「选择文件」
2

开启区分说话人

在识别选项中打开区分说话人。软件会在本地模型里同时做「转写」和「区分发言人」两件事。

3

等待本地识别完成

识别在你电脑本地完成,文件不上传。录音越长越久,但本地处理、隐私不出本机。

4

查看分段结果并导出

右侧文字按「发言人1 / 发言人2 …」分段展示。可直接复制,或导出按人分段的文稿,拿去做纪要、字幕都行。

四、区分说话人 ≠ 说话人识别

有个常见混淆要厘清:

VoiceText 当前提供的是区分说话人——自动把对话按人拆段并标注,适合绝大多数「理清谁说了啥」的需求;如果需要对应真名,可在导出后手动把「发言人1」改成实际姓名。

五、常见问题(FAQ)

几个人以内的对话分得清?

日常会议、访谈常见的几人对话都能有效拆分。人数越多、互相打断越频繁,拆分难度越大;录音清晰、少重叠时效果最好。

能导出「按人分段」的文稿吗?

能。识别完成后可直接复制带发言人标签的文字,或导出带分段标记的文稿,便于后续整理。

和「离线语音转文字」是一回事吗?

是配套能力:离线转写负责「声音变文字」,区分说话人在本地一并完成「谁说的」。两者都不出本机。详见离线语音转文字专题

长会议录音也能分离吗?

能。几小时的会议、网课同样支持,配合长音频转写一次处理完。

六、相关专题

区分说话人在 VoiceText 声文智转中在您电脑本地运行,适合会议、访谈、网课等多人场景。