人声分离技术的分析
引言
随着语音识别技术的不断发展, 越来越多的智能设备通过语音识别等语音相关的技术实现人机交互的功能, 例如 音箱, 手机等设备, 通过这些设备, 人们可以更方便的通过语音来进行设备的相关操作。
在现实生活中, 通常我们会遇到这样的场景, 就是我们需要进行语音识别的音频中, 包含了多个说话人的语音, 此时如果我们直接进行语音识别, 可能会将其他人员的语音也识别到结果当中, 影响了语音识别的准确率
所以这里我们需要通过深度学习构建模型的方法, 将同一个音频中, 不同说话人语音分离开, 然后每个说话人的语音单独保存为一段音频, 我们将这种技术称为 “人声分离”。
人声分离技术的历史背景
“鸡尾酒会问题”(Cocktail Party Problem)诞生于 1953 年,是语音识别领域的经典问题, 该问题是指人们在鸡尾酒会中交谈的时候, 由于多个人同时说话, 同一段语音当中包含多个人的说话语音, 如果直接进行语音识别, 可能导致识别的结果不准确。
在一片嘈杂中听到自己想注意的声音,是人类的本能,但这对机器来说可没有那么容易。
所以在使用计算机解决鸡尾酒问题的时候, 研究人员尝试让计算机模拟人类的听觉系统, 利用神经网络训练出Mask掩码, 然后将Mask掩码与原始的音频进行相乘, Mask的功能就在于过于无关声音, 只保留网络关注的声音, 从而实现人声分离的效果。
还有一种实现的思路是通过使用麦克风阵列, 然后利用空间上的信息来判断出不同声源的说话位置, 从而实现人声分离。
人声分离技术的应用场景介绍
呼叫客服中心电话信道 : 在呼叫客服中心的通话音频中, 通常同时包含有客户的语音和客服的语音, 当我们需要对客户和客服的说话内容进行语音识别时, 我们就需要将客户和客服的语音分离开来, 然后分别单独进行语音识别
会议内容纪要 : 在会议完成后, 我们通常会希望将会议中的语音内容保存下来, 并识别成文字, 然后保存为会议纪要的形式, 但是通常一段音频当中会包含多个说话人的语音, 此时如果我们直接将整段语音进行识别, 就无法分出各段内容来自哪个说话人, 此时我们将需要通过人声分离技术将一段会议的录音中各个说话人的语音分离出来, 然后单独进行语音识别, 从而形成有效的会议纪要。
智能音箱 : 在家庭环境中使用智能音箱时, 常常周围会同时有其他人在讲话, 这时如果音箱直接对当前语音进行语音识别, 会导致识别的结果当中混杂了其他说话人的语音内容, 导致识别的错误, 此时我们就需要通过人声分离的技术将语音中主要说话人的语音分离出来, 然后单独进行语音识别, 从而避免语音识别的内容被周围语音干扰。
