版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能通识课模块三:人工智能如何读懂世界目录一授课目标二第8章语言智能的演进与挑战三第9章文本表示与处理技术基础四五第10章Transformer建模六第11章文本分类与情感分析内容提要七第12章生成式AI与预训练模型o内容提要一本模块系统阐述了人工智能中语言智能从基础处理到生成创作的完整技术体系,涵盖自然语言处理(NLP)的定义、发展历程、核心技术及应用实践。内容包括:NLP的研究范畴(自然语言理解与生成)与发展阶段(从规则驱动到数据驱动,再到预训练模型范式);文本表示方法的演进(从词袋模型、TF-IDF等离散表示到Word2Vec、BERT等分布式表示);序列建模技术(RNN/LSTM的原理与局限,Transformer架构的革命性突破);文本分类与情感分析的技术流程(数据预处理、模型构建、评估优化);生成式AI与预训练模型(BERT、GPT等模型的工作原理及AIGC在内容创作中的应用)o授课目标二(1)知识目标理解自然语言处理的定义、研究范畴及发展历程。掌握文本表示的核心方法:离散表示,分布式表示的技术细节。熟悉序列建模技术:RNN/LSTM的结构、梯度消失问题及门控机制,Transformer的架构及优势。了解文本分类与情感分析的完整流程:数据预处理、特征工程、模型选择及评估指标。掌握生成式AI与预训练模型的原理:BERT、GPT的预训练-微调范式,AIGC的解码策略及应用场景。o授课目标二(2)能力目标运用Python工具(如scikit-learn、TensorFlow/Keras)实现文本预处理(分词、向量化)和基础模型训练(如基于TF-IDF+SVM的文本分类)的基本能力。构建LSTM/Transformer模型解决序列任务(如情感分析)的基本能力。能够使用预训练模型(如BERT、GPT)完成文本分类、情感分析或文本生成任务的基本能力。o授课目标二(3)素质目标培养数据思维:能够分析文本数据特征,选择合适的预处理与特征工程方法。提升技术认知:理解NLP技术的演进逻辑,认识技术创新对AI发展的推动作用。强化伦理意识:关注AIGC应用中的潜在风险,树立负责任的技术应用观念。具备问题解决能力:面对实际NLP任务,能够定位问题并提出优化方案。三
语言智能的演进与挑战(1自然语言处理的定义与研究范畴)自然语言处理(NaturalLanguageProcessing,NLP)作为人工智能的核心分支,致力于建立能够使计算机理解、解释和生成人类语言的技术体系,从而实现人机之间的自然语言交互。从学科本质来看,NLP
是计算机科学、人工智能与语言学的交叉领域,其研究目标是弥合人类语言的复杂性与计算机逻辑之间的鸿沟。NLP
的核心挑战在于如何使计算机不仅能处理语言的符号形式,更能理解其深层语义和语用含义。三
语言智能的演进与挑战(1自然语言处理的定义与研究范畴)NLP的研究范畴可分为自然语言理解和自然语言生成两大核心任务体系。自然语言理解关注计算机对语言的解析能力,主要包括:基础处理任务(分词、词性标注、命名实体识别)、句法分析(短语结构分析、依存句法分析)、语义理解(词义消歧、语义角色标注、关系抽取)、篇章理解(指代消解、discourse分析)等层次。自然语言生成则关注计算机生成符合语言规范且有意义的文本的能力,主要包括:文本摘要、机器翻译、对话系统、文本创作等任务。这两大任务体系共同构成了NLP技术的核心框架,使计算机能够从“读懂”语言到“运用”语言,最终实现与人类的自然交互。三
语言智能的演进与挑战(2自然语言处理的发展历程与技术突破)自然语言处理的发展历程是一部从规则驱动到数据驱动,从浅层理解到深层语义建模的技术演进史。这一历程大致可分为四个关键阶段。萌芽期(1950s-1980s):以符号主义为主导,依赖人工编写的语法规则和词典。发展期(1990s-2010s):见证了从符号主义向统计方法的范式转变。随着计算机计算能力的提升和大规模语料库的出现,统计方法开始在
NLP领域占据主导地位。这一时期的技术核心是通过从大规模文本数据中学习语言规律,而非依赖人工编写的规则。繁荣期(2010s):是深度学习在
NLP领域的爆发期,各种神经网络模型的提出极大地推动了NLP
技术的发展。爆发期(2017年至今):以
Transformer架构为标志,开启了预训练模型的新时代。三
语言智能的演进与挑战(2自然语言处理的发展历程与技术突破)从技术演进的脉络来看,可以清晰地观察到
NLP技术的三大转变:从规则驱动到数据驱动,从人工特征工程到自动特征学习,从任务特定模型到通用预训练模型。这些转变不仅推动了NLP技术性能的持续提升,也改变了
NLP
的研究范式和应用方式。随着技术的不断进步,NLP
系统正逐步从“理解语言
”向“理解世界
”迈进,为人工智能的全面发展奠定了坚实的语言基础。三
语言智能的演进与挑战(3语言智能的应用场景与教育价值)在日常生活服务领域,NLP技术已经成为人机交互的重要桥梁。智能音箱(如亚马逊Echo、小米小爱同学等)手机输入法的智能联想功能基于语言模型技术,能够预测用户的输入意图,显著提高输入效率。智能客服系统通过自然语言理解和对话管理技术,能够自动处理常见咨询问题,为用户提供24小时不间断服务。在行业应用领域,NLP技术正在重塑各个专业领域的工作方式。在金融行业,NLP技术被广泛应用于舆情分析、风险评估和智能投顾。在医疗健康领域,NLP技术能够从电子病历、医学文献中提取关键信息,辅助疾病诊断和治疗方案制定。在法律领域,NLP技术可以自动审查合同条款,识别潜在风险,提高法律工作效率。三
语言智能的演进与挑战(3语言智能的应用场景与教育价值)在内容创作与信息传播领域,NLP技术正在改变内容生产和消费的方式。新闻媒体利用NLP技术实现自动化写作,特别是在财经、体育等结构化信息丰富的领域。在广告营销领域,NLP技术能够根据产品特点和目标受众生成个性化广告文案。在教育出版领域,NLP技术被用于智能内容生成和个性化学习。三
语言智能的演进与挑战(3语言智能的应用场景与教育价值)从教育价值的角度来看,学习NLP技术有助于培养三种核心能力:技术原理认知能力、工具应用能力和伦理评估能力。技术原理认知能力指理解NLP的基本概念和工作原理,如文本表示、序列建模、注意力机制等,这是理解人工智能如何“读懂世界”的基础。工具应用能力指能够使用NLP工具和平台解决实际问题,如使用预训练模型API进行文本分类,利用开源框架开发简单的对话系统等。随着低代码平台的发展,即使是非技术专业的学习者也能通过简单的API调用实现复杂的NLP功能。伦理评估能力指能够识别NLP应用中的潜在风险和伦理问题,如算法偏见、隐私泄露、信息真实性等。四
文本表示与处理技术基础自然语言处理(NaturalLanguageProcessing,NLP)是计算机科学、人工智能(AI)和语言学领域的一个交叉学科,主要研究如何让计算机能够理解、处理、生成和模拟人类语言,从而实现与人类进行自然对话的能力。研究对象:人类社会的语言信息(比如语音和文本等)研究目的:实现人机之间的有效通信。让计算机理解、解释和生成人类语言。研究分类:自然语言理解(NaturalLanguageUnderstanding,NLU)、自然语言生成(NaturalLanguageGeneration,NLG)四
文本表示与处理技术基础(1文本的离散表示方法BoW)需要计算机能够处理和理解人类语言,首先需要将非结构化的文本数据转换为结构化的数值表示。文本的离散表示方法是最早发展起来的文本表示技术,其核心思想是将文本视为词语的集合或序列,通过统计词语的出现频率或重要性来表示文本的特征。(1)词袋模型(Bagof
Words,BoW)基本假设是:文档的含义主要由其中包含的词语及其出现频率决定,而与词语的顺序和语法结构无关。词袋模型的构建过程主要包括两个步骤:首先,构建一个包含语料库中所有不重复词语的词汇表(Vocabulary);然后,为每个文档生成一个向量,向量的维度等于词汇表的大小,每个维度的值表示对应词语在该文档中出现的次数。BoW(BagofWords):表示文档中单词出现的文本词袋模型数学中最简单的文本表示形式无逻辑顺序放置关注是否出现已知的单词YousaygoodbyeandIsayhello.YousayGoodbyeandIhello.1234567One-hotencoding(独热编码)将每个词映射为相互不同的单位向量词表中不同词的个数为N,则索引范围为0~N-1One-hot表示中,仅有一个元素是1,其余均为0You1000000say0100000①Johnlikestowatchmovies,Marylikesmoviestoo.②Johnalsolikestowatchfootballgames.仅表示词是否存在,稀疏性较高(大部分为0)四
文本表示与处理技术基础(1文本的离散表示方法BoW)BoW(BagofWords)表示文档中单词出现的文本按字母顺序排列alsofootballgamesjohnlikesmarymoviestotoowatch①0001212111②1111100101①Johnlikestowatchmovies,Marylikesmoviestoo.②Johnalsolikestowatchfootballgames.BoW缺点:不考虑单词之间的顺序无法反映出一个句子的关键词
Johnlikestoplayfootball,Marylikestoo.[‘football’,‘john’,‘likes’,‘mary’,‘play’,‘to’,‘too’][1121111]likesfootball四
文本表示与处理技术基础(1文本的离散表示方法BoW)四
文本表示与处理技术基础(1文本的离散表示方法TF-IDF)2.TF-IDF(TermFrequency-InverseDocumentFrequency)技术为了解决词袋模型对高频无意义词汇的过度加权问题,TF-IDF
技术被提出
。
TF-IDF
的核心思想是:一个词语对文档的重要性不仅取决于它在该文档中出现的频率(词频,TermFrequency,TF),还取决于它在整个语料库中的分布情况(逆文档率,
Inverse
Document
Frequency,IDF)TF-IDFTF-IDFTermFrequency词频(针对每一篇文档)
Inversedocumentfrequency逆文本频率(针对整个语料库而言)
TF-IDFTF-IDF值越大说明这个词越重要,也可以说这个词是关键词
①Thisisthefirst
document.②Thisdocumentistheseconddocument.③Andthisisthethirdone.④Isthisthefirstdocument?
四
文本表示与处理技术基础(1文本的离散表示方法TF-IDF)四
文本表示与处理技术基础(1文本的离散表示方法n-gram)3.n-gram模型n-gram模型是对词袋模型和
TF-IDF
的扩展,它通过考虑连续的
n个词语组成的序列(n-gram)来捕捉局部的词语顺序信息。常用的
n-gram包括unigram(n=
1
,即单个词语)、bigram(n=2
,即两个连续词语)和
trigram(n=3
,即三个连续词语)。n-gram模型。例如,对于句子“人工智能改变世界
”,其
bigram
序列为["人工智能改变",
"改变世界"]。n-gram模型的基本思想是,相邻的词语之间存在语义关联,通过考虑这些关联可以更好地表示文本的特征。N-gram例子搜索引擎的词语联想输入法生僻词输入N-gram将文本拆分成若干个连续的n个词的序列统计文本中连续n个词的序列(或“词组”)出现的频率Isawamanonahillwithatelescope.生成的3-grams如下:isawasawamanamanonmanonaonahillahillwithhillwithawithatelescope.2-gram*今天天气不错。今吃是看同哦。2-gram今天天气不错。今天天天天气气不不错0.820.210.630.110.46今吃是看同哦。今吃吃是是看看同同哦0.050.030.060.010.09一个句子是否合理,和概率息息相关四
文本表示与处理技术基础(1文本的离散表示方法n-gram)四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)词向量技术的理论基础是分布式假设(DistributionalHypothesis),该假设由语言学家
Firth
在
l957年提出,其核心思想是:“一个词的含义由其所处的上下文决定
”
(Youshallknowawordbythecompanyitkeeps)。换句话说,如果两个词语经常出现在相似的上下文环境中,那么它们很可能具有相似的语义。基于这一假设,词向量模型通过学习词语在大规模语料库中的上下文分布规律,将词语映射到低维向量空间中,使得语义相似的词语在向量空间中距离相近。20l3年,Google
的
Mikolov等人提出的
Word2Vec模型是词向量技术发展的里程碑。Word2Vec主要包含两种训练架构:连续词袋模型(ContinuousBagofWords,CBOW)和Skip-Gram模型
Word2vecWord2vec—分布式表示将每个词映射到一个固定长度的向量能够更好地表达不同词之间的相似性和类比关系一组用于生成词向量的浅层神经网络模型大脑神经元人工神经元四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)Word2vec—CBOW模型
该模型的目标是根据词语的上下文预测中心词。四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)例如:在设置上下文窗口长度为
1
时,“Weareabouttostudytheidea
of
deep
learning.
”句子中,study
的上下文就
to和
the这
2个词,如果长度设为
2
,那么
study
的上下文就是about
、to
、the和
idea这
4个词。对于
CBOW模型,它实际上是一个神经网络,该神经网络会接收上下文词语,并将上下文词语转换为最有可能得目标词,在设置上下文窗口长度为
2
时,能通过
about
、to
、the和
idea这
4个词预测
study这个词。Word2vec—Skip-Gram
模型四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)Skip-Gram
模型则与CBOW
相反,它的目标是根据中心词预测其上下文词语。给定一个中心词,Skip-Gram模型会训练神经网络来预测在一定窗口内可能出现的上下文词语。与
CBOW相比,Skip-Gram模型通常在小规模语料库上表现更好,并且能够更好地处理稀有词语。实践:在
Python
中,我们可以使用
Gensim库来训练和使用
Word2Vec模型。四
文本表示与处理技术基础(3文本预处理的标准化流程)原始文本数据通常包含大量噪声和无关信息,直接用于模型训练会影响模型性能。文本预处理作为
NLP
流水线的第一步,旨在清洗和标准化文本数据,为后续的特征提取和模型训练做准备。一个标准化的文本预处理流程通常包括文本清洗、分词、去停用词、标准化等步骤,每个步骤都有其特定的目标和方法。
(1)WHY?TomwaswatchingTVinhisroom.Marycameintotheroom.Marysaidhito_______?Tom/him以CBOW解决,上下文长度必须到Tom(第18个单词)CBOW忽略了单词顺序RNN(RecurrentNeuralNetwork)四
文本表示与处理技术基础(4循环神经网络(RNN))
(2)RNN模型RNN中使用的层称为“RNN”层通过循环结构和时间步展开有效处理序列数据,捕捉上下文信息适合处理文本、时间序列任务之前发生了什么“现在”正在发生什么四
文本表示与处理技术基础(4循环神经网络(RNN))
(3)RNN结构循环:反复并持续环路RNN中使用的层称为“RNN”层
处理句子时输入为单词的分布式表示
四
文本表示与处理技术基础(4循环神经网络(RNN))
(1)WHY?LSTM(LongShort-TermMemory)TomwaswatchingTVinhisroom.Marycameintotheroom.Marysaidhito_______?梯度爆炸梯度消失5
长短期记忆网络(LSTM)的门控机制四
文本表示与处理技术基础(5长短期记忆网络(LSTM))
(2)LSTM结构与传统
RNN相比,LSTM在处理长序列时表现出显著优势。研究表明,在包含长距离依赖关系的任务中,LSTM
能够比传统
RNN保留更多的历史信息,梯度消失问题得到明显缓解。例如,在处理长度为
100
的序列时,传统的
RNN可能只能有效利用最后
20个时间步的信息,而
LSTM
能够利用整个序列的信息。四
文本表示与处理技术基础(5长短期记忆网络(LSTM))五Transformer开启序列建模新时代1Transformer
的诞生背景与技术变革在
2017年之前,人工智能处理语言、语音等序列数据时,长期依赖循环神经网络(RNN)及其改进版
LSTM
、GRU
。这些模型像工厂流水线一样,必须按顺序处理每个元素。这种“排队等待
”的工作方式,导致两个严重问题:一是遇到长句子时,早期信息会像传话游戏中逐渐失真的悄悄话,传到后面几乎完全模糊(梯度消失问题);二是无法同时处理多个词语,就像单车道堵车,即使有强大的
GPU
,也只能眼睁睁看着计算资源闲置(并行计算困境)。2017年,Google提出了
Transformer架构,该架构的核心创新——自注意力机制,它让每个词都能动态关注序列中所有其他词,无论距离远近。从技术角度看,Transformer是当代大语言模型的“发动机”。从应用范围看,Transformer已从语言领域“跨界”到计算机视觉(ViT模型让图像识别准确率超越传统CNN)、生物科学(AlphaFold用它预测蛋白质结构,解决了50年难题)、语音识别(手机语音转文字准确率提升15%)、推荐系统(视频平台用它分析你的观看习惯,推荐更合口味的内容)等多个领域。五Transformer开启序列建模新时代2Transformer整体架构与注意力机制Transformer
的整体架构像一家高效的“翻译公司
”,由“编码器部门
”和“解码器部门
”组成,如图所示。编码器负责“理解原文
”,把输入序列(比如中文句子)转换成包含所有语义信息的“语义矩阵”;解码器负责“生成译文”,根据编码器的语义矩阵,一步步生成目标序列(比如英文句子)。五Transformer开启序列建模新时代3Transformer编码器Transformer
编码器Transformer
的编码器的作用是把输入序列(比如中文句子)转换成富含上下文信息的“语义矩阵
”,就像“深度加工厂
”——把原始矿石(原始文本)一步步提炼成高纯度金属(语义向量)。编码器由6个相同的“编码器层
”堆叠而成,每个编码器层又包含“多头自注意力层
”和“前馈神经网络层
”,中间用“残差连接
”和“层归一化
”连接。五Transformer开启序列建模新时代4Transformer解码器Transformer
解码器Transformer
的解码器的任务是基于编码器输出的语义矩阵,生成目标序列(比如英文翻译结果),就像“逻辑管家
”——根据主人的需求(编码器语义),有条理地安排事务(生成序列)。解码器同样由
6个“解码器层
”堆叠,每个解码器层比编码器层多了“掩码多头自注意力
”和“编码器-解码器交叉注意力
”两个模块。五Transformer开启序列建模新时代5Transformer进行文字翻译Transformer
没有任何循环结构,所有词可以同时处理。如果说
RNN是“一个翻译员逐字读原文
”,Transformer就是“6个翻译员同时从不同角度分析整段原文
”。Transformer
进行文字翻译五Transformer开启序列建模新时代6Transformer
的应用与影响NLP领域:从理解到生成的全面突破计算机视觉:从“卷积”到“注意力”
的跨越多模态任务:跨领域的“语义桥梁”其他领域:生物、语音与推荐系统六
文本分类与情感分析:语言理解的实践1
文本分类的完整技术流程文本分类是自然语言处理中最基础也最常用的任务之一,其目标是将文本自动分配到预定义的类别中。从新闻主题分类、垃圾邮件检测到情感分析、意图识别,文本分类技术在信息过滤、内容推荐、舆情监控等领域有着广泛的应用。构建一个高性能的文本分类系统需要遵循标准化的技术流程,包括数据准备、特征工程、模型构建、模型评估和优化等步骤。数据准备是文本分类流程的第一步,也是影响最终性能的关键因素之一。高质量的数据集是构建高性能分类系统的基础,数据准备通常包括数据收集、数据清洗、数据标注和数据集划分等子步骤。六
文本分类与情感分析:语言理解的实践1
文本分类的完整技术流程特征工程是将原始文本转换为模型可接受的数值特征的过程,直接影响模型性能。文本分类的特征工程主要包括文本表示和特征选择两个方面。文本表示方法包括离散表示(如词袋模型、TF-IDF)和分布式表示(如
Word2Vec、
GloVe、BERT嵌入)。离散表示简单直观,但忽略语义信息;分布式表示能够捕捉语义关系,但计算成本较高。在实际应用中,可以根据数据集大小和模型复杂度选择合适的表示方法。对于小规模数据集,TF-IDF通常表现较好;对于大规模数据集,可以考虑使用预训练词向量或上下文相关嵌入。特征选择旨在降低特征维度,去除冗余和噪声特征,提高模型效率和泛化能力。六
文本分类与情感分析:语言理解的实践1
文本分类的完整技术流程模型构建是选择合适的分类算法并训练模型的过程。文本分类模型可分为传统机器学习模型和深度学习模型两大类。传统机器学习模型包括朴素贝叶斯、支持向量机(SVM)、逻辑回归、决策树和随机森林等。这些模型通常与
TF-IDF等离散特征结合使用,具有训练速度快、可解释性强的优点,适用于小规模数据集或资源受限的场景。其中,SVM和逻辑回归在文本
分类任务中表现尤为出色,是传统方法中的首选模型。深度学习模型包括卷积神经网络(CNN)、循环神经网络(RNN/LSTM/GRU)、
Transformer等。模型训练过程中需要设置合适的超参数,如学习率、批大小、迭代次数等。超参数调优方法包括网格搜索、随机搜索和贝叶斯优化等。网格搜索遍历所有可能的参数组合,结果最可靠但计算成本最高;随机搜索随机采样参数组合,效率更高;贝叶斯优化基于先验结果自适应采样参数,平衡了效率和性能,是大规模超参数调优的首选方法。六
文本分类与情感分析:语言理解的实践模型评估是通过测试集评估模型性能的过程
,常用的评估指标包括准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1值(F1-Score)和混淆矩阵(ConfusionMatrix)等。准确率:正确分类的样本占总样本的比例,适用于平衡数据集。精确率:预测为正类的样本中实际为正类的比例,衡量模型的精确性。召回率:实际为正类的样本中被正确预测的比例,衡量模型的完整性。F1值:精确率和召回率的调和平均,综合评价模型性能。混淆矩阵:展示各类别之间的预测结果,帮助分析错误类型1
文本分类的完整技术流程六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法情感分析(SentimentAnalysis)作为文本分类的一个重要应用方向,旨在识别和提取文本中表达的主观情感、态度和观点。随着社交媒体、电商平台和在线评论的普及,情感分析技术在舆情监控、产品推荐、客户反馈分析等领域得到了广泛应用。情感分析的核心技术包括情感极性分类、情感强度分析、情感实体识别和细粒度情感分析等,实现方法涵盖了从传统机器学习到深度学习的多种技术路径。情感分析任务可以根据粒度和目标分为多个层次:文档级情感分析;句子级情感分析;Aspect级情感分析;情感强度分析;情感原因分析。情感分析的技术方法可以分为三大类:基于词典的方法、基于传统机器学习的方法和基于深度学习的方法。六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法基于词典的方法是最早的情感分析方法,通过情感词典计算文本的情感得分。其基本步骤包括:(1)
构建或选择情感词典,如英文的
WordNet-Affect
、SentiWordNet
,中文的BosonNLP
情感词典、知网情感词典等。情感词典通常包含词语及其对应的情感极性(积极、消极、中性)和情感强度。(2)对文本进行分词和预处理,去除停用词和噪声。(3)根据情感词典对文本中的情感词进行匹配和加权求和,计算文本的整体情感得分。得分大于
0表示积极情感,小于
0表示消极情感,接近
0表示中性情感。六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法基于传统机器学习的情感分析方法将情感分析视为文本分类问题,通过特征工程和分类算法实现情感识别。其基本步骤包括:l.数据准备:收集和标注带有情感标签的文本数据。2.特征提取:将文本转换为数值特征,如词袋模型、TF-IDF
、n-gram等。3.模型训练:使用分类算法(如朴素贝叶斯、SVM
、逻辑回归)训练情感分类模型。4.模型评估和优化:使用测试集评估模型性能,并进行特征选择和参数调优。六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法基于深度学习的情感分析方法通过神经网络自动学习文本特征,避免了手动特征工程,在大规模数据集上表现出优越性能。常用的深度学习模型包括:(1)卷积神经网络(CNN):通过卷积层和池化层捕捉文本中的局部情感特征,如情感词和短语。TextCNN是一种经典的文本分类模型,在情感分析任务上表现出色。(2)循环神经网络(RNN/LSTM/GRU):通过循环连接捕捉文本中的时序依赖关系,适合处理长文本和上下文相关的情感表达。LSTM
和
GRU
能够有效解决传统RNN
的梯度消失问题,更好地捕捉长距离情感依赖。(3)双向循环神经网络(Bi-RNN):同时利用前向和后向上下文信息,提高情感识别的准确性,特别是在包含转折关系的文本中。(4)注意力机制(AttentionMechanism):允许模型关注文本中对情感表达最重要的部分,如情感词或修饰语,提高模型的可解释性。(5)预训练语言模型(如
BERT、RoBERTa):在大规模文本语料上预训练的语言模型,通过微调能够在小规模情感分析数据集上取得最先进的性能。预训练模型能够捕捉深层语义关系和语境依赖的情感表达,是当前情感分析的最佳选择。六
文本分类与情感分析:语言理解的实践3文本分类的评估与优化策略文本分类的评估需要综合考虑多个指标,以全面反映模型的性能。除了基本的准确率(Accuracy)外,针对不同的应用场景和数据特点,还需要关注精确率(Precision)、召回率(Recall)、F1值(F1-Score)、混淆矩阵(Confusion
Matrix)、ROC
曲线和AUC值等指标。
1生成式AI
生成式AI是一种基于深度学习技术的人工智能分支,能够通过分析大量数据中的模式自动生成新的原创内容(如文本、图像、音频、视频等),而非仅对现有数据进行分类或决策。其核心在于“从无到有”的创造能力。七
生成式AI与预训练模型:从理解到创作大模GPT(生成式模型)的工作过程:单字接龙模型输入:我们模型输出:发明了一个新的和简单的模型文本生成的过程本质就是单字接龙。思考:单字接龙为什么可以产生
这么大的威力?GPT我们发明了一个新的和简单的模型发明了一个新的和简单的模型end
2预训练模型GPT(GenerativePre-trainedTransformer)
是一种基于
Transformer架构
的自然语言处理模型,由OpenAI开发。其核心思想是通过大规模预训练和微调来实现强大的文本生成和理解能力。七
生成式AI与预训练模型:从理解到创作GPT的核心思想GPT的核心思想是
生成式预训练+微调:预训练(Pre-training):在大规模文本数据上训练模型,学习语言的统计规律和上下文关系。使用
自回归语言模型
目标,即根据前面的词预测下一个词。例如:
给定句子"Iloveto__",
模型会预测下一个词可能是"eat"或"play"。微调(Fine-tuning):
在特定任务(如文本分类、问答、翻译)上对预训练模型进行微调。通过少量标注数据,使模型适应具体任务。七
生成式AI与预训练模型:从理解到创作GPT的训练过程输入表示:
将文本转换为词向量(TokenEmbeddings),并添加位置编码。自回归生成:
模型从左到右逐词生成文本,每一步都基于前面的词预测下一个词。
例如,生成句子"Ilovetoeat"的过程:
输入"I",预测"love";
输入"Ilove",预测"to";
输入"Iloveto",预测"eat"。损失函数:
使用交叉熵损失函数,衡量模型预测的词与真实词的差异。七
生成式AI与预训练模型:从理解到创作七
生成式AI与预训练模型:从理解到创作
3生成式文本创作的技术原理近年来,基于
Transformer解码器的自回归语言模型成为生成式文本创作的主流技术,如
GPT
系列模型。Transformer解码器通过自注意力机制能够有效捕捉长距离依赖关系,并行计算能力也大幅提升了训练效率。
自回归语言模型的生成过程是递归的:从一个初始序列(如<|endoftext|>或用户提供的提示)开始,模型预测下一个词语的概率分布,然后根据某种解码策略选择一个词语添加到序列中,重复这一过程直到生成结束符或达到最大长度。七
生成式AI与预训练模型:从理解到创作
3生成式文本创作的技术原理生成式文本创作的关键技术包括训练目标设计、解码策略选择、质量评估和模型优化等方面。
训练目标设计是生成式语言模型学习文本规律的基础。主流的训练目标包括:(1)自回归语言模型(ALM)(2)掩码语言模型(MLM)(3)序列到序列(Seq2Seq)(4)对比学习
解码策略是生成式文本创作的关键环节,决定了如何从模型预测的概率分布中选择下一个词语,直接影响生成文本的质量、多样性和连贯性。常用的解码策略包括:(1)贪婪搜索(GreedySearch)(2)束搜索(BeamSearch)(3)随机采样(RandomSampling)(4)温度采样(TemperatureSampling)(5)Top-K采样(6)Top-P采样生成式文本创作的质量评估是一个具有挑战性的问题,因为文本质量不仅涉及语法正确性和连贯性,还包括创造性、相关性、信息量等主观维度。常用的评估方法包括:(1)自动评估指标(2)人工评估(3)基于参考的评估(4)无参考评估。七
生成式AI与预训练模型:从理解到创作4AIGC在内容创作中的应用实践人工智能生成内容(ArtificialIntelligenceGeneratedContent,
AIGC)正深刻改变着内容创作的方式和格局。从文本、图像到音频、视频,AIGC技术在各个内容领域展现出巨大潜力,特别是在文本创作领域,基于预训练语言模型的生成式
AI
已经能够完成从简单文案到复杂创作的各种任务。AIGC在内容创作中的应用实践涵盖了创意写作、商业文案、学术辅助、个性化推荐等多个领域,通过人机协同的方式提高创作效率、丰富内容形式、降低创作门槛。通过相关案例展示AIGC文本生成效果。七
生成式AI与预训练模型:从理解到创作4AIGC在内容创作中的应用实践通过相关案例展示AIGC文本生成效果。输入提示:创作一首关于"人工智能"的七言绝句,风格模仿李白,押韵ABAB。输入提示:创作一个科幻侦探故事的开篇章节,设定:2077年上海,人工智能侦探"灵犀"与人类侦探李伟合作调查一起机器人谋杀案。输入提示:为一款新型智能手表生成电商产品描述,突出健康监测、长续航和时尚设计三大卖点,目标受众为25-35岁都市白领。使用智能体、AI编码等。相关知识课程小结基础定义与场景自然语言处理相当于机器语言和人类语言之间的翻译,通过模型解析文本语言信息,广泛应用于机器翻译、情感分析、文本分类与摘要、信息抽取等领域。文本处理核心将文本转换为数值特征。即文本向量化(词袋BOW模型、Word2Vec)RNN与LSTM模型循环神经网络(RNN)和长短期记忆网络(LSTM)基本结构、原理,以及在文本处理相关领域的使用。文本分类与情感分析理解文本处理应用场景中机器翻译、情感分析和文本分类的流程和模型使用。生成式AI文本内容创作GPT预训练和微调模型结合语料token,提示词通过大模型,实现文本内容的自动化创作。0102030405THANKS人工智能通识课模块四:人工智能如何听懂世界目录语音识别技术一语音信号处理基础二面向语音处理的深度学习模型与应用三生成式AI与语音合成技术(AIGC)四五总结与答疑一
语音识别技术如何能够进行“自然的交流”呢?智能语音技术,就是为了实现人机语言的这种自然通信。其中最重要的两个技术领域,就是语音识别技术和语音合成技术。而这两个技术,分别解决了语言交流中最重要的两个问题:语音识别技术将人类的语音中的词汇内容转换为计算机可读的输入:听的懂人话。语音合成技术通过机械的、电子的方法产生人造语音:像人一样回应。机器怎样才能算听的懂人话?语音识别语音合成一
语音识别技术语音识别系统从讲叙方式角度可分为孤立词、连接词和连续语音三种。从服务对象的角度可分为特定人与非特定人。即系统只针对一个用户或可用于任意用户.语音识别研究的目的就是让机器“听懂”人类口述的语言。孤立词、连接词、连续语音一
语音识别技术语音识别概述
语音识别的目的就是让机器明白你说什么,而语音识别的过程就是机器模拟人类的听觉系统的过程。因此,语音识别技术就是让机器通过识别和理解过程把语音信号转变为文本和指令的技术。语音识别技术主要包括特征提取技术、模式匹配准则及模型训练技术三个方面。一
语音识别技术智能语音交互智能语音是人工智能技术的重要组成部分,实现了人机语言的通信,其主要技术包括了语音识别(AutomaticSpeechRecognition,ASR)和语音合成(Text-To-Speech,TTS)。语音识别是让机器能够“听见”周围的声音实现机器感知智能;语音合成则是让机器模仿人类“说出”给定的文字内容。因此,智能语音技术既模拟了人类的耳朵又模拟了人类的嘴巴一
语音识别技术语音识别发展简史早期探索阶段(1950s–1980s)技术特征基于声学特征的模板匹配,依赖人工设计的特征提取规则,识别范围局限于孤立词和小词汇量1952年Audry系统贝尔实验室首次实现10个英文孤立数字识别,通过模拟电路提取共振峰频率特征1960s动态规划与LPC技术技术突破解决语音时长不固定问题,将语音信号压缩为10-15个线性预测系数1976年Harpy系统卡内基梅隆大学采用DTW算法和语法规则,实现1000词汇量孤立词识别,错误率降至5%以内局限性无法处理连续语音对说话人依赖性强仅限实验室环境使用一
语音识别技术语音识别发展简史统计模型阶段(1980–2010年)关键里程碑技术特征HMM双重随机过程:将语音建模为隐藏状态与观测输出的双重随机过程GMM复杂分布:捕捉语音特征的复杂概率分布,成为统计语音识别标准框架1983年HMM引入Baker和Jelinek分别将HMM应用于语音识别,证明其在连续语音识别中的优势1990年ViaVoice系统(IBM)采用GMM-HMM模型和大词汇量语言模型,支持30,000词汇量,错误率约15%,实现商业化应用2009年DragonNaturallySpeaking(Nuance)在普通PC上实现99%孤立词识别准确率,连续语音识别错误率降至8%20%-30%区分性训练使系统错误率相对降低局限性依赖人工设计的声学特征,难以捕捉语音信号的深层非线性关系一
语音识别技术语音识别发展简史深度学习阶段(2011年至今)技术特征DNN自动学习语音特征RNN建模时序依赖关系Transformer并行处理与长距离依赖捕捉关键里程碑2011DNN替代GMMHinton团队·TIMIT数据集·23%音素错误率·相对降低30%2015DeepSpeech系统百度·深度双向LSTM+CTC·端到端识别·错误率16.5%2022Whisper模型OpenAI·Transformer预训练·99种语言·英文错误率10.8%国内突破科大讯飞DFCNN2018年·错误率相对降低15%百度SMLTA2019年·在线性能相对提升15%字节豆包大模型2025年·中文7.2%·13种方言技术演进对比自动学习时序建模并行处理7.2%中文识别错误率13种方言支持字节跳动豆包大模型2025一
语音识别技术语音识别核心技术框架一
语音识别技术语音识别简单应用车载助手智能音响语音输入一
语音识别技术经典案例微信语音转文本微信语音转文本动画一
语音识别技术相关技术面临挑战上文内容对语音信号的语义产生的影响;发音人的口音、发音的方式与习惯会导致语音特征在参数空间分布的不同;发音人心理和生理变化直接影响了语音信号的变化;环境及各种突发的干扰等因素造成的语音信号失真问题。二语音信号处理基础语音信号基本特征(时域特征)振幅(能量)对应声音的响度,单位为分贝(dB)短时能量:一帧信号的平方和,用于区分语音段与静音段元音能量比辅音高10-20dB基频(F0)声带振动的频率,对应音调,单位为赫兹(Hz)男性:80-180Hz,女性:160-340Hz,儿童:200-500Hz应用于语音合成、情感识别过零率单位时间内信号波形穿过零电平的次数清音过零率高于浊音,反映频率特性与短时能量结合用于语音端点检测二语音信号处理基础语音信号基本特征(频域特征)谐波结构连续噪声频谱信号能量在不同频率上的分布通过傅里叶变换(FT)或短时傅里叶变换(STFT)获得元音频谱具有谐波结构,辅音频谱呈连续噪声特性频谱包络频谱的平滑轮廓,反映声道的滤波特性通过倒谱分析或线性预测分析提取MFCC特征的重要依据共振峰关键特征F1200-900Hz与舌位高低相关F2800-2500Hz与舌位前后相关F31500-3500Hz与唇形圆展相关声道共振产生的频谱峰值,区分不同元音的关键特征F1F2F3包络曲线二语音信号处理基础语音信号基本特征(时频域特征)语谱图(Spectrogram)时间-频率-能量的三维表示横轴为时间,纵轴为频率像素亮度表示能量语谱图的动态特性浊音段:水平方向的谐波条纹,对应基频的整数倍频率清音段:较杂乱的灰度分布,呈现噪声特性爆破音:垂直方向的宽带脉冲,瞬间能量爆发应用价值语音信号的"可视化语言"将抽象音频转化为直观图像深度学习模型(如CNN)的输入作为神经网络的标准输入格式通过学习时频模式识别音素和词语端到端的语音理解能力二语音信号处理基础语音信号预处理技术(分帧、加窗、滤波)
在人工智能领域中,特别是在语音识别、语音合成及其它相关的语音信号处理任务中,分帧、加窗和滤波是预处理阶段的重要步骤。它们的作用主要是为了适应人类语音信号的时变特性以及方便后续的分析和特征提取。分帧(FrameSegmentation)原因:语音信号本身是连续的,但在短时间内(例如10到30毫秒)可以被视为近似平稳。为了提取有意义且相对稳定的特征,我们需要将连续的语音信号分割成一段段小的时间窗口,即“帧”。做法:通常每帧的长度选择在20至30毫秒之间,这样能够捕捉到语音信号的基本频率特性。相邻帧之间会有部分重叠(帧移),重叠的比例通常是帧长的一半或者三分之一,以保证连续性,同时减少因分帧带来的边界效应。二语音信号处理基础语音信号预处理技术(分帧、加窗、滤波)加窗(Windowing)原因:我们处理信号的方法都要求信号是连续条件,但是分帧处理的时候每一帧的开始和结束都会出现间断,因此分割的帧越多,与原始信号的误差就越大,直接对分好的帧做分析会导致帧的开始和结束部分产生突变,影响后续分析如频谱计算等的准确性。
做法:为了满足条件,我们就将分好的帧数据乘一段同长度的数据,这段数据就是窗函数整个周期内的数据,通过加窗可以在帧的边缘引入平滑过渡,使成帧后的信号变得连续,并且每一帧都会表现出周期函数的特性。二语音信号处理基础语音信号预处理技术(分帧、加窗、滤波)滤波(Filtering)原因:语音其实是一种声波,声波是一种物质波。滤波的字面意思为过滤一些不同频率的波。我们知道任意波可以分解为几种正弦波和余弦波的叠加,从概率论的角度,滤波即加权,滤波的作用就是给不同的信号分量不同的权重。例如最简单的losspassfilter,
就是把低频的信号给0权重,给高频部分1权重。做法:当允许信号中较高频率的成分通过滤波器时,这种滤波器叫做高通滤波器。
当允许信号中较低频率的成分通过滤波器时,这种滤波器叫做低通滤波器。
当只允许信号中某个频率范围内的成分通过滤波器时,这种滤波器叫做带通滤波器。
当不允许信号中某个频率范围内的成分通过滤波器时,这种滤波器叫做带阻滤波器。二语音信号处理基础语音特征提取方法(梅尔频率倒谱系数(MFCC))→→→→→•设计原理:模拟人耳对频率的非线性•将线性频谱转换为梅尔频谱,再提取倒谱系数1预加重分帧μ=0.9725ms帧长10ms帧移2STFT短时傅里叶变换计算功率谱3梅尔滤波器组20-40个滤波器覆盖0-8kHz4对数能量取对数压缩动态范围5DCT离散余弦变换提取12-13系数6差分扩展39D一阶/二阶差分扩展至39维优势:对噪声和个体差异具有一定鲁棒性局限:在深度学习时代逐渐被FBank取代二语音信号处理基础语音特征提取方法(滤波器组特征(FBank))核心特点不进行离散余弦变换(DCT),直接保留对数梅尔频谱作为特征40维80维维度=滤波器数量应用实例深度学习语音识别的默认特征OpenAI的Whisper模型采用80维FBank特征在多语言识别任务中取得优异性能与MFCC对比保留更多频谱细节,未经过DCT降维更适合深度学习模型(CNN、Transformer)学习高层特征5%-10%语音识别错误率相对降低逐渐取代MFCC成为主流特征二语音信号处理基础语音特征提取方法(谱质心(SpectralCentroid))频谱能量的重心频率SC=Σ[f(k)·P(k)]/ΣP(k)f(k)为频率值,P(k)为功率谱能量~1kHz元音/a/~4kHz清辅音/s/定义频谱能量的重心频率反映语音信号的"明暗"程度应用价值高频能量占比高→谱质心大(声音明亮)低频能量占比高→谱质心小(声音低沉)
常作为辅助特征与MFCC或FBank结合使用三
面向语音处理的深度学习模型与应用面向语音处理的主流深度学习模型卷积神经网络(CNN)核心优势局部感知和参数共享特性,擅长提取局部时频特征应用方式作为前端特征提取器,处理FBank或MFCC时频图典型案例GoogleDeepSpeech2模型,通过3个卷积层提取特征,错误率相对降低8%-12%三
面向语音处理的深度学习模型与应用面向语音处理的主流深度学习模型RNN/LSTMRNN特点LSTM突破应用价值通过循环连接建模时序依赖,处理任意长度序列通过细胞状态和门控机制,解决梯度消失/爆炸问题捕捉语音中的韵律和上下文依赖,如“苹果”在不同语境下的含义Transformer注意力机制自注意力并行计算,全局依赖建模,突破序列长度限制架构演进Encoder-Decoder结构,奠定现代语音识别基础框架三
深度学习在语音识别中的应用81深度学习在语音识别中的应用主要体现在以下几个方面:自动语音识别(ASR):深度学习模型如循环神经网络(RNN)、长短期记忆网络(LSTM)和卷积神经网络(CNN)等被广泛应用于自动语音识别任务,能够实现高精度的语音到文本转换。语音合成:深度学习也被用于语音合成,生成自然度更高的语音。这种技术常用于语音助手、虚拟人物和机器人的语音生成。情感分析:深度学习模型能够分析语音中的情感,对于情感机器人、智能客服等应用场景具有重要意义。语音降噪:深度学习可以帮助消除语音信号中的背景噪声,提高语音识别的准确性。三
深度学习在语音识别中的应用卷积神经网络(ConvolutionalNeuralNetwork,缩写CNN)是神经网络的一种特殊类型。除了包含输入层、隐藏层和输出层外,隐藏层中还包含了卷积层、池化层等特殊结构,这些特殊层的存在使得CNN能够更有效地处理具有空间或时间结构的数据大脑神经元神经网络三
深度学习在语音识别中的应用83卷积神经网络(CNN):案例:手写数字卷积神经网络识别过程1.输入图形2.卷积核3.卷积后提取捺
横
竖
撇
的特征100010001000111000010010010001010100三
深度学习在语音识别中的应用84卷积神经网络(CNN):案例:手写数字卷积神经网络识别过程4.推广到语音(波形图——频谱图)三
深度学习在语音识别中的应用85卷积神经网络(CNN):案例:手写数字卷积神经网络识别过程4.推广到语音(波形图——频谱图)三
深度学习在语音识别中的应用86卷积神经网络(CNN):案例:手写数字卷积神经网络识别过程4.推广到语音(波形图——频谱图)三
深度学习在语音识别中的应用87卷积神经网络(CNN):案例:手写数字卷积神经网络识别过程5.频谱图6.卷积核7.卷积后提取声音的特征,和声音库比较,识别出相应声音。100010001000111000010010010001010100三
深度学习在语音识别中的应用88循环神经网络(RNN)RNN是一种适合处理序列数据的神经网络,能够捕捉语音信号的时间依赖性三
深度学习在语音识别中的应用89循环神经网络(RNN)RNN是一种适合处理序列数据的神经网络,能够捕捉语音信号的时间依赖性图像识别是前一张识别是苹果,并不会对
语言识别是词语的顺序对识别影响比较大。
认出下一张是梨造成影响。
三
深度学习在语音识别中的应用90循环神经网络(RNN)RNN是一种适合处理序列数据的神经网络,能够捕捉语音信号的时间依赖性
音频是一种自然的序列,你可以将音频频谱图分成块并将其馈入RNN三
深度学习在语音识别中的应用91循环神经网络(RNN)RNN如何实现时间依赖性,序列数据DATA1.....DATA3.....。每次输入一个数据,就产生一个隐藏信息存在E中,输入下一个数据时,E也参与神经网络的推导。
在RNN中,每个时间步都有一个隐藏状态(hiddenstate),它可以接收当前时间步的输入和上一个时间步的隐藏状态作为输入。隐藏状态的输出不仅取决于当前时间步的输入,还取决于之前所有时间步的输入。三
深度学习在语音识别中的应用92循环神经网络(RNN)
案例:1.假设用户输入:whattimeisit?首先,我们将句子分解为单个单词。RNN按顺序工作,所以我们一次只能输入一个字。
三
深度学习在语音识别中的应用93循环神经网络(RNN)
案例:2.第一步是将“What”输入RNN,RNN编码“what”并产生输出。
三
深度学习在语音识别中的应用94循环神经网络(RNN)
案例:3.对于下一步,我们提供单词“time”和上一步中的隐藏状态。RNN现在有关于“what”和“time”这两个词的信息。
三
深度学习在语音识别中的应用95循环神经网络(RNN)
案例:4.我们重复这个过程,直到最后一步。你可以通过最后一步看到RNN编码了前面步骤中所有单词的信息。
三
深度学习在语音识别中的应用96循环神经网络(RNN)
案例:5.由于最终输出是从序列的部分创建的,因此我们应该能够获取最终输出并将其传递给前馈层以对意图进行分类。
三
深度学习在语音识别中的应用97循环神经网络(RNN)
案例:6.RNN控制流的伪代码
三
深度学习在语音识别中的应用98长短期记忆网络(LSTM)
长短期记忆网络(LSTM,LongShort-TermMemory)是一种时间循环神经网络,是为了解决一般的RNN(循环神经网络)存在的长距离依赖问题而专门设计出来的。三
深度学习在语音识别中的应用99长短期记忆网络(LSTM)
如何实现,引入输入门、遗忘门、输出门。用神经网络训练三个门的控制信号。记忆单元输出门遗忘门输入门LSTM输出门控制信号输入门控制信号遗忘门控制信号三
深度学习在语音识别中的应用100长短期记忆网络(LSTM)
案例:例如“今天天气很好”音素为jintiantianqih今天天气很好今天天气很好enhao三
深度学习在语音识别中的应用101长短期记忆网络(LSTM)
案例:例如“今天天气很好”音素为记忆单元输出门遗忘门输入门
LSTM输出门控制信号输入门控制信号遗忘门控制信号jintiantianqihenhao110记忆单元输出门遗忘门输入门
LSTM输出门控制信号输入门控制信号遗忘门控制信号110记忆单元输出门遗忘门输入门
LSTM输出门控制信号输入门控制信号遗忘门控制信号111记忆单元输出门遗忘门输入门
LSTM输出门控制信号输入门控制信号遗忘门控制信号110三
深度学习在语音识别中的应用102长短期记忆网络(LSTM)
案例:例如“今天天气很好”音素为LSTM通过神经网络训练三个门的通过控制开关例如:
“今天”的“今”音素
对“天”影响大,所以就要保留到隐藏模块中,在识别后面的字的时候,产生影响。
“今天”的“今天”音素
对“天气”影响就不大,所以就可以遗忘。
jintiantianqihenhao三
深度学习在语音识别中的应用103长短期记忆网络(LSTM)Python代码实现
三
面向语音处理的深度学习模型与应用模型训练与优化技术——数据准备与增强常用数据集数据增强技术技术价值与趋势1000小时LibriSpeech英文语音识别基准1小时TIMIT音素标注标准30小时THCHS-30中文语音开源178小时AISHELL中文语音数据库68万小时OpenAIWhisper·覆盖99种语言加性噪声SNR0-20dB错误率降低20%-30%语速调整0.8-1.2倍速增强语速变化鲁棒性音高变换±20%模拟不同说话人房间脉冲响应RIR模拟不同声学环境鲁棒性提升通过多样化变换,模型对噪声、语速、说话人差异的适应能力显著增强数据效率有限标注数据通过增强技术可等效扩展数倍,降低数据采集成本规模化趋势Whisper68万小时多语言数据证明:数据规模与模型能力正相关数据准备与增强三
面向语音处理的深度学习模型与应用模型训练与优化技术——损失函数设计CTC损失函数引入空白符,允许对未对齐序列直接训练通过动态规划计算所有可能对齐路径概率之和成为端到端语音识别标准DeepSpeechwav2vec注意力损失函数性能更优通过注意力机制动态对齐输入特征与输出文本显式建模输入输出对齐关系长句子识别性能优于CTC计算复杂度更高混合损失函数训练初期使用CTC快速收敛,后期用注意力优化细节模型错误率相对降低5%-8%三
面向语音处理的深度学习模型与应用模型训练与优化技术——优化算法与模型压缩优化技术效果对比批量归一化30%-50%效率提升量化4-8倍体积压缩优化算法与训练策略Adam优化器初始学习率0.001学习率调度余弦退火、ReduceLROnPlateau正则化技术Dropoutrate=0.2L2正则化、早停策略批量归一化训练轮数减少30%-50%模型压缩方法知识蒸馏100M参数压缩至10M,性能损失<5%量化32位浮点转8位整数,体积缩小4-8倍,推理速度提升2-3倍剪枝参数减少40%-60%,推理速度提升1.5-2倍低秩分解减少参数和计算量典型案例百度DeepSpeech:1.2GB→150MB,延迟<300ms三
面向语音处理的深度学习模型与应用典型应用场景智能家居场景小米AI音箱多麦克风阵列+波束成形技术,支持远场拾音和多轮对话92%50dB背景噪声下识别准确率85%多轮对话成功率车载系统场景端到端深度学习模型,CNN+LSTM+CTC架构<300ms89%<0.1特斯拉Autopilot响应延迟100km/h车速下识别准确率次/小时误唤醒率多模态交互:结合车速信息提升驾驶安全性智能客服场景声学回声消除+FBank特征+Transformer模型+BERT意图分类<8%WER词错误率95%意图分类准确率60s→15s响应时间缩短70%常规咨询自动化完成业务价值:大幅提升服务效率与用户体验什么是语音合成技术四、生成式AI与语音合成(AIGC)——语音合成技术概述语音合成技术(Text-to-Speech,简称TTS)是一种将文本信息转化为自然语音的技术,其核心目标是生成接近人类自然发音的语音输出。这项技术在人工智能、智能助手、有声读物、导航系统等领域得到了广泛应用,并且随着深度学习的发展,语音合成的效果和自然度得到了显著提升。神经语音合成技术演进四、生成式AI与语音合成(AIGC)——语音合成技术概述2016波形建模突破WaveNet首次通过深度学习直接生成语音波形核心创新:扩张因果卷积,建模长距离时间依赖感受野指数增长:10层网络达1023样本点(约64ms)自回归生成:逐样本预测波形概率分布局限
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 第9课 制作员工销量统计图
- FPGA与人工智能融合
- 护士健康宣教讲课不足
- 电厂安全术语词典讲解
- 2026年下教资笔试学科知识与能力高频真题模拟(完整版)
- 火工品管理检查要点
- 付款条件修订供应商正式函4篇范文
- 大学人工智能通识基础 课件 模块四:人工智能如何听懂世界
- 生物制药研发合作意向函签署6篇
- 人工智能通识第19课 – 5.2自动语音识别
- 2026年《医疗器械经营监督管理办法》培训试卷(+答案)
- 1.1 书写恢弘史诗 课件 2025-2026学年统编版道德与法治 九年级上册
- 《中华人民共和国生态环境法典》测试题
- 2026庐山云雾茶产业集团有限公司社会招聘工作人员16人备考题库含答案详解(研优卷)
- 2026年农药经营许可测试题及答案
- JJF(石化)084-2023润滑油蒸发损失测定仪(诺亚克法)校准规范
- 建筑加固工程全套资料
- 江苏省建设工程监理现场用表(第七版修订版)
- 2026年上海市社工岗位面试题及详细解析
- 小儿补液课件
- 监理单位安全生产责任制度范本
评论
0/150
提交评论