【基于TinyML的声音识别检测技术综述2700字】_第1页
【基于TinyML的声音识别检测技术综述2700字】_第2页
【基于TinyML的声音识别检测技术综述2700字】_第3页
【基于TinyML的声音识别检测技术综述2700字】_第4页
【基于TinyML的声音识别检测技术综述2700字】_第5页
已阅读5页,还剩5页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于TinyML的声音识别检测技术综述基于TinyML的声音识别检测技术综述 11.1TinyML概述 11.2机器学习概述 21.2.1神经网络模型 21.2.2卷积神经网络 31.3摔倒声音检测技术 41.3.1技术框架 51.3.2时域与频域 51.3.3短时傅里叶变换(STFT)与梅尔语谱 51.1TinyML概述TinyML(微型机器学习)是在低功耗微控制器上,实现机器学习(如神经网络、支持向量机、决策树、随机森林等)的新型技术,其功耗低于1mW,可机器学习框架)的一个重要部分,是一个专门针对移动设备的轻量级机器学习框预处理将输入转换为模型兼容的格式TFLite解释器解释模型输出输出处理使用设备功能相应预测被训练用于根据数据做出预测输入数据模型机器学习是指在不经过明确编程的情况下所运行的科学16,近十年来,机习大致经历过两次发展浪潮,分别是浅层学习和深度学习17]。浅层学习的模型包括Boosting、支持向量机(SVM)、逻辑回归等,深度学习的模型包括深度神经网络(DNN)、循环神经网络(RNN)和卷积神经网络(CNN)等。作原理进行演化和自我学习的一种数据工作方法。神经网络模型可以分为3层:几十到上百个不等,根据不同的训练场景调整具体的神经元数量。图2.2展示了表示第i个神经元的索引,表示最后的输出。ReLU函数等,表达式如下:0和1之间,因此常用于二元分类的输出层,其输出结果可以理解为是概率,其他层大多数默认选择ReLU函数,图2.3展示了常见的三种激活函数的图像。500×500像素的RGB图像包含750000个特征值,因此对于常规的全连接神经需要一个softmax层来获取各个类别的概率分布情况,图2.4展示了卷积神经网卷积层1池化层1卷积层2池化层2全连接层1全连接层2深度通常为1,而RGB图像模式的深度通常为3。根据卷积核(或者叫过滤器)所确定,通常为3×3或5×5,输出的数值越大表明可能探测到了某些特定的特征。卷积层输出矩阵的深度由卷积核(过滤器)的个数决定,图2.5展示了卷积操作。图2.5卷积操作图2.6池化操作数据预处理模型训练型训练所需的音频特征。对于音频的特征提取常见的方法有:语谱图 而频域是描述信号振幅与频率的关系,图2.8展示了时域和频域之间的关系。时2获取梅尔语谱首先需要对音频数据进行短时傅里叶变换(STFT),短时傅里叶变(1)对音频进行分帧(2)将这一帧数据乘以Hann窗□进行过滤以减少窗口两端对采样的影响(3)对过滤后的数据进行快速傅里叶变换(FFT)人类很容易发现500Hz和1000Hz之间的区别,但是很难发现7500Hz和8000Hz类对于不同频率的感知特点。梅尔标度在1000Hz以下呈现线性增长,在1000Hz以上呈现对数增长,使用梅尔标度来赋予较低频率更多的权重,图2.9展示了梅最后再将生成的语谱图乘上梅尔标度生成梅尔语谱,图2.10展示了梅尔语谱的生成过程,其中帧大小为30ms,滑动尺寸为

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论