说话人分离技术详解
什么是说话人分离
说话人分离(Speaker Diarization,也叫“区分说话人”)回答的问题是:这段音频里,谁在什么时候说话。软件基于声纹聚类自动判断说话人数,不需要你手动填写。
它和人声分离不一样
- 区分说话人(说话人分离):判断“谁说的”,输出带说话人标签的文字稿。
- 纯人声分离:从音乐 + 人声混合的音轨里提取人声,是音频处理,不是文字。
两者解决不同问题,不要混淆。
典型用途
多人会议记录、访谈整理、辩论 / 对话类内容归档。
说话人分离(Speaker Diarization,也叫“区分说话人”)回答的问题是:这段音频里,谁在什么时候说话。软件基于声纹聚类自动判断说话人数,不需要你手动填写。
两者解决不同问题,不要混淆。
多人会议记录、访谈整理、辩论 / 对话类内容归档。