爱扒谱是如何提高其音频分离结果的
尽管上传到我们服务的许多歌曲都被分成了人声和器乐音轨,而且精确度非常高。音轨分离精度并不完全取决于这些或任何其他类似服务的工作。每个单独的音轨的声音和母带质量是分裂的精确程度的关键因素。
随着爱扒谱用户数量的迅速增长,要求改善这首或那首歌曲的干系分离结果的请求也越来越多。尽管我们很想这样做,但我们对特定音轨的分离质量没有直接影响。人声和器乐干是由神经网络提取的,而不是由人工输入的。
爱扒谱的人工智能如何运作
正如之前所确定的,人工智能的创造需要以下条件。
一个适当的模型(在AI/ML中也被称为 "模型")。
一个适当的模型优化过程(在AI/ML领域称为 "训练 "或 "学习")。
爱扒谱两者都有。我们使用的模型是独特的、非常复杂的。该网络处理来自各种输入音频格式的立体声,然后将其转化为两个音干。该网络生成一个数据片段,描述人声和乐器部分在原始输入信号中的位置。之后,该数据片段被传递给另一个简单得多的算法,将输入信号转换为独立的人声和伴奏干。
看起来很微不足道?是的!是的。只要设计好了核心,应用它就很容易了......如果这是你用来执行几十亿次数学运算的词的话。不过,网络训练过程是一个相当大的挑战。
就像一个小孩子需要做几次才能学会如何正确地做,而且不需要成人的帮助,神经网络需要处理一百甚至数千条音轨,以学习如何正确地进行干系分离。数以千计的歌曲可以很容易地等于几十GB的训练数据。
仅仅分割一秒钟的音轨就需要数以亿计的数学运算。考虑到一首平均长度约为三分钟的歌曲,分离其人声和器乐轨道需要数十亿次数学运算。纠正错误和改进分割模型使这几十亿乘以一百,导致近四百亿次运算!想象一下,需要多少计算资源?想象一下,要设计一个像爱扒谱这样的神经网络需要多少计算资源。
当涉及到机器学习和人工智能时,你必须大干一场。数据量、所需的计算能力、用于训练和优化的时间--一切都很庞大。但是,如果你准备投入这么多的资源,你可以取得令人难以置信的结果
如何提高爱扒谱的分离结果
调整音频处理水平。一些歌曲可能需要额外的抛光,因为包含母带的特殊性和错误,只有在分离后才能听得见。将电平从默认的Normal模式改为Aggressive模式,并检查分离后的主干声音如何。
找到并上传歌曲的另一个版本,或尝试另一个轨道。寻找相同的歌曲,但要有更高的比特率或无损的格式。也有可能是有问题的轨道有替代的录音室录音,这些版本可以进行更精细的茎干提取。
我们还计划在不久的将来实施一个反馈系统。用户将能够选择分离得不好的特定茎干部分。我们确信,这一更新将大大改善整体的分离质量,并解决特定音轨出现的问题。
