机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

huomingfei

2017-09-26

背景

随着人工智能的算法发展，对于非结构化数据的处理能力越来越受到重视，这里面的关键一环就是语音数据的处理。目前，许多关于语音识别的应用案例已经影响着我们的生活，例如一些智能音箱中利用语音发送指令，一些搜索工具利用语音输出文本代替键盘录入。

本文我们将针对语音识别中最简单的案例“男女声音”识别，结合本地的R工具以及机器学习PAI，为大家进行介绍。通过本案例，可以将任何用户的语音数据标记出性别，并且保持高准确率。我们把整个实验流程切分为两部分，第一部分是声音信号的特征提取，通过R的信号处理工具实现；第二部分通过机器学习PAI实现男女声音分类模型的训练，本实验需要事先积累男女声音的录音数据，本文已经提供处理好的3000条语音数据，文章末尾提供下载。

声音信号特征提取

语音数据与图像数据以及文本数据不同，如果经常使用K歌软件或者是语音合成软件，不难理解语音数据通常成信号状分布。

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

为了有效的通过算法处理这种波形数据，需要首先通过信号处理工具对语音信号进行处理。本文我们选用的是R语言的warbleR包，warbleR包含大量的频谱处理工具，可以通过其中的频谱处理函数提取出关于声音的以下特征信息，因为男生和女生在声音频率、振幅的方面一定有很大区别，所以要通过提取以下特征帮助我们进行分类：

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

接下来会讲解如何提取这些声音信号的特征：

1.安装R

首先安装R语言包，warbleR需要R的版本是3.2以上，这里强烈建议大家使用3.3.3版本（博主在使用3.4的时候遇到错误）。具体R的安装方式网上有很多介绍，这里就不详细介绍了。

2.安装warbleR

安装完R之后，进入R命令行，需要通过以下命令安装warbleR：

install.packages("warbleR") 
library(warbleR)

这里需要注意的是镜像最好使用美国的默认镜像服务，需要翻*，不然很有可能会安装不成功，因为国内的镜像会缺少某些依赖包。

3.特征提取

首先把需要处理的录音数据（必须是wav格式）按照男声、女声分装在male和female两个文件夹中，然后执行笔者提供的R脚本代码（文末提供了下载链接）。需要将代码中以下两个文件路径改为自己建立的male以及female文件路径即可：

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

执行这个R脚本，就会将wav格式的声音文件转化为结构化数据，数据会存储为一个CSV文件。文件部分截图：

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

PAI训练男女声音分类模型

1.导入数据

将通过R处理后的数据导入PAI平台，也可以直接将文末提供的处理好的数据导入。具体方法可以看：https://help.aliyun.com/video_detail/54945.html

数据导入后，可以看到有20个特征以及1列label列，

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

2.建立分类模型

通过拖拉PAI平台的组件搭建实验，实验流程图：

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

voice_classify:为数据读入源
拆分:将数据集拆分为训练集以及预测集
线性支持向量机：通过SVM算法训练生成模型
预测组件：通过模型对预测集预测
混淆矩阵：用来评估

这是一个比较简单的二分类场景，具体也可以参看之前的一些文章：https://yq.aliyun.com/articles/54260

3.评估

最终“混淆矩阵”组件会显示如下图的分类评估：

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

通过混淆矩阵，可以看到男女声音的分类还是非常精准的。

总结

本文通过使用R脚本以及机器学习PAI实现了男女声音分类的案例，最终的准确率达到百分之九十八左右。在实际使用过程中，用户需要执行以下几步：

（1）首先积累需要分类的声音文件，数据越多越好，存储为wav格式。

（2）然后通过R脚本对打标好的声音文件进行特征提取。

（3）将处理后的数据上传PAI，建立分类模型即可。

PAI地址：https://data.aliyun.com/product/learn

企业服务咨询：https://survey.aliyun.com/survey/AMgL8_Pm5

数据下载（代码及数据来自warbleR社区开源提供）：https://github.com/jimenbian/PAI_voice_classify

机器学习特征提取声音处理

安科网

机器学习PAI通过声音分辨男女（含语音特征提取相关数据和代码）

huomingfei

huomingfei

相关推荐

TensorFlow为新旧Mac特供新版本，速度最高提升7倍

如何通过7个步骤构建机器学习模型

机器学习新风暴：如何用ML模型预测房价？

关于机器学习管道需要了解什么?

为什么所有的机器学习模型有90％从没有投入生产

LinkedIn开源Dagli，发布Java机器学习函数库

关于机器学习算法的16个技巧

全面解读谷歌云人工智能如何为机器学习提供帮助

关于感知器的故事：机器学习是如何发展到如今这一程度的呢？

需要知识的后深度学习时代，如何高效自动构建知识图谱

10个丰富自我的机器学习项目

机器学习如何颠覆金融行业

24个提高知识和技能极限的机器学习项目

IT自动化和人工智能将在2021年走向何方？

无监督机器学习的重要指南

机器学习概念和经典算法，我用大白话给你讲清楚了！入门必看

理解AI：为什么要在人工智能系统中寻求可解释性呢？

机器学习的未来就在这里：高斯过程和神经网络是等价的

Python 用5行代码学机器学习—线性回归

微软和谷歌分别开源分布式深度学习框架，各自厉害在哪？

huomingfei