3.3-语音合成与语音识别案例_第1页
3.3-语音合成与语音识别案例_第2页
3.3-语音合成与语音识别案例_第3页
3.3-语音合成与语音识别案例_第4页
3.3-语音合成与语音识别案例_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

3.3语音合成与语音识别案例信息工程学院2025年9月1日Xxx老师发展历史应用与未来开源工具案例目录(1)发展历史克里斯蒂安·哥特利布·克拉岑斯坦发明了用机械结构模拟人类发生器官的机器同一时期,冯·肯佩伦设计了一台发声机器,各部件结构与人类声道构造高度相似,但需要同时熟练操作多个部件1780s后来复现的冯·肯佩说话机器1846年乔瑟夫·费伯在伦敦埃及厅展示了说话机器Euphonia,其正前方有一个女性面具,学术界以及媒体对该发明大加赞赏,但公众对该装置评价不高机械装置时代TTSARS贝尔实验室研究员构建了Audrey,是最早的基于电子计算机的语音识别系统,能识别10个英文数字1952年Euphonia照片NTT的S.Saito和名古屋大学的F.Itakura提出了线性预测编码(LCP),极大地压缩了数据量,为后续的语音分析、编码和识别奠定了基础1966年Audrey照片模式匹配时代1939年贝尔实验室在世博会上展示第一台电子合成器VODER,首次尝试将人声分解成电子合成人声,证明了电子电路可以生成清晰可辨的语音。1950年哈斯金斯实验室研制出了Patternplayback,利用光读取频率模式并将其转化为声音。研制的成功验证了关键的声学理论,为未来的技术发展奠定了基础。1961年贝尔实验室使用IBM704计算机成功合成了歌曲DaisyBell,该场景被写入《2001:太空漫游》剧本中,成为影史经典片段。电子设备时代Voder结构示意Patternplayback装置苏联研究员发明了动态时间规整(DTW)算法,并利用该算法创建了一个能够处理200个单词词汇的识别器,解决了语音速度变化的匹配问题。1960s隐马尔科夫模型(HMM)被应用于语音识别,并再次基础上不断改进,引领了后续三十年的ASR技术方向。1980s-1990s统计模型时代2016年谷歌DeepMind发布WaveNet,标志着语音合成发展史上的一个里程碑,开启了深度学习语音合成领域。人工智能时代2017年谷歌发布Tacotron,是第一个真正意义上的端到端TTS,直接从文本到音频波形,避免了中间复杂的语音学和声学模块1979年麻省理工大学开发了MITalkSystem,成为第一个可以自动将文本转化为语音的系统,成为TTS技术发展史张的一次重大飞跃。端到端模型逐渐兴起,模型直接学习从音频输入到文本输出的过程,省去了中间的独立模块。Wav2Vec等模型开始使用大规无标注音频数据进行自监督训练,降低了对海量标注数据的依赖,并显著提高了准确性、速度和可扩展性。2014长短期记忆网络(LSTM)、卷积神经网络(CNN)逐渐取代HMM。虽然上世纪80年代就有相关研究,但指导2000年以后才成为主流。2000s深度学习时代(2)应用与未来语音识别实时字幕视频合成数字人3(3)开源工具案例——CosyVoice跨语种克隆12输入合成文本选择推理模式上传示例音频上传对应文本点击生成音频45示例音频生成音频(3)开源工具案例——Whisper选择上传音频方式来自URL来自文件录制点击设置选择模型显示多语言选项显示量化模型选择原语言选择任务类型

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论