最新新闻资讯
了解音乐新动态 把握技巧新进展

如何评价【Google攻破的人声分离技术】,会给我们生活、生产带来哪些变化?

作者:
发布时间:
关键字:
音频处理软件音频分离技术去消除掉与噪音语音提取高音频段噪音

其实这项技术在掌握深度学习,强化学习,等人工智能技术之后并不是很难实现。。有些食品国内的朋友可能看不到哦,等到有搬运工了再更新一些其他的内容吧。。反正我第一时间的感受是不服的,这个技术中国也是完全有能力自己开发的,清北复交只要汇集相关计算机科学,人工智能,录音专业领域的技术人才也能实现该课题的自主研发,华南理工大学的声学也一直紧随国际领先技术,然后在我们国家研究经费之类的问题肯定不用愁,只要领导点头(嗯当然这个假设非常理想化)。。。。反正硬件和技术上上要跟上其实并不难。。只不过非常遗憾的又让美国人抢先了。。。。其实本身在人类的生物听觉和认知系统里耶是具备一定程度的次要信息过滤分离能力,只不过没有人工智能做的那么高效。。所以这项技术带来的是舒适度的提升,而并非一项本质性的革新。。。。但是也已经具有重大的划时代意义了。。相信不久以后各个音频处理软件都会相继出现优化后的降噪功能。。因为自从1857年人类历史上第一次出现录音技术以来,都无法实现已经混音之后的音频分离技术。。直到人工智能的出现给了我们一丝希望。。大致的看了一眼他们的paper,在可以看到的11页内容里,目前看来该技术还是依赖于画面辅助,并且分离的范畴还仅限于语音分离,因为需要大量的语音识别技术作为基础。。毕竟语音识别领域的开发和应用要远远的超过其他技术。。。。其实针对现代录音技术的基本数学工具很早以前就有了,基于傅立叶函数就可以实现离散采样的叠加和分离问题,只不过面对每秒四万八千个采样点要分析出不断变化的信息,对于人类来说这个计算量太过庞大了,根本无法实现。。以往的的工具是使用的“降噪”,即提取一段噪音样本,然后利用反消除的原理去消除掉与噪音样本相类似的噪音。。而人声分离技术则是完全不同的概念,撇开各种技术术语,算法等。。用人话说就是根据图像识别和语音识别的技术为基础,判断出那个人物正在说话,判断出口型可能的发音,判断出音频里面根该发音相关的频段变化,然后提取这些频段,再学习出这些频段的规律,组建出一个相对可靠的该人物的发声频段,再从这些频段里进行强化学习,重组出语音内容,最后实现出一个相对干净的语音信息。算法上用的就是最典型的深度学习里的监督学习解决回归问题,神经网络算法,K平均算法,强化学习等等。。这些在阿尔法狗打败李世石以前就有了。。。。这种功能可以颠覆传统的降噪理念,改为直接提取需要的语音语音分离的最终效果比原来的降噪当然要好得多。从结果上看来是非常爆炸性的,完整视频分为四个部分,第一部分是结果展示,针对多种情况实现了非常理想的语音提取。。第二部分展示了与传统的纯音频识别技术相比,视频输入加入了许多更加靠谱的语音参数。也就是说,在学习语音之前,人工智能已经充分学习过画面内可能的发音了,然后再进行提取,就解决了。。非常厉害的一点就是能够做到即使是同一个人声音相互叠加,也能够很好的分离出所需要的内容。。第三部分就是与同类研究进行了比对,比单纯使用神经网络进行深度学习的结果要好很多(废话嘛多了一条视频参数,基本等于抄着答案去考试)。并且特定情况下Google的结果会更好一些。。并且还能应用于过爆情况的还原,该团队的结果非常厉害的是从一个比较强的回声+噪声环境中提取原声。。传统的人工智“障”还不能理解回声等基本的声学原理,由于回声所产生的声音现象,而导致最终处理结果出现卷积失真。。第四部分则是说明了如果加入一个智商更高的语音识别(YouTube语音识别)系统之后,其语音分离的准确率还会得到进一步提升。

另一方面来评判的话目前该技术还需要依赖于画面,并且仅限于英语。似乎男性样本的识别率显然要更高一些。。。。可能因为男性的频段比较偏低,与高频段的唇齿音相对更容易辨别,另外女性的语言在唇齿和面部表情的变化更加多样一些,会给学习造成更大困难。毕竟女人是很难懂的。此外,战术出来的视频里目标音源都是相对较近,并且说话者自身也都拥有比较准确的发音和语言能力。。

目前这项技术还有很多需要完善的地方,比如两个在餐厅的视频里,频段的分离并不是非常理想,第一个餐厅里的语音提取结果依旧残留了大量的高音频段噪音,甚至可以很清楚的听到高音频段的噪音几乎没有得到处理。。第二个在餐厅里打电话的视频,显然频段的分离非常的单一,在一个稳定的语调里的处理效果较好,而相对的女性语调变化比较大的情况下,即使捕捉到了口型,但是相关的识别率还是受到了非常大的限制。。该技术可以将语音和相关发音分离出来,但是很难保证原本的音量,音质清晰度,音高语调变化,等表现。。还是有待进步的。