版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能通识课模块三:人工智能如何读懂世界目录一授课目标二第8章语言智能的演进与挑战三第9章文本表示与处理技术基础四五第10章Transformer建模六第11章文本分类与情感分析内容提要七第12章生成式AI与预训练模型o内容提要一本模块系统阐述了人工智能中语言智能从基础处理到生成创作的完整技术体系,涵盖自然语言处理(NLP)的定义、发展历程、核心技术及应用实践。内容包括:NLP的研究范畴(自然语言理解与生成)与发展阶段(从规则驱动到数据驱动,再到预训练模型范式);文本表示方法的演进(从词袋模型、TF-IDF等离散表示到Word2Vec、BERT等分布式表示);序列建模技术(RNN/LSTM的原理与局限,Transformer架构的革命性突破);文本分类与情感分析的技术流程(数据预处理、模型构建、评估优化);生成式AI与预训练模型(BERT、GPT等模型的工作原理及AIGC在内容创作中的应用)o授课目标二(1)知识目标理解自然语言处理的定义、研究范畴及发展历程。掌握文本表示的核心方法:离散表示,分布式表示的技术细节。熟悉序列建模技术:RNN/LSTM的结构、梯度消失问题及门控机制,Transformer的架构及优势。了解文本分类与情感分析的完整流程:数据预处理、特征工程、模型选择及评估指标。掌握生成式AI与预训练模型的原理:BERT、GPT的预训练-微调范式,AIGC的解码策略及应用场景。o授课目标二(2)能力目标运用Python工具(如scikit-learn、TensorFlow/Keras)实现文本预处理(分词、向量化)和基础模型训练(如基于TF-IDF+SVM的文本分类)的基本能力。构建LSTM/Transformer模型解决序列任务(如情感分析)的基本能力。能够使用预训练模型(如BERT、GPT)完成文本分类、情感分析或文本生成任务的基本能力。o授课目标二(3)素质目标培养数据思维:能够分析文本数据特征,选择合适的预处理与特征工程方法。提升技术认知:理解NLP技术的演进逻辑,认识技术创新对AI发展的推动作用。强化伦理意识:关注AIGC应用中的潜在风险,树立负责任的技术应用观念。具备问题解决能力:面对实际NLP任务,能够定位问题并提出优化方案。三
语言智能的演进与挑战(1自然语言处理的定义与研究范畴)自然语言处理(NaturalLanguageProcessing,NLP)作为人工智能的核心分支,致力于建立能够使计算机理解、解释和生成人类语言的技术体系,从而实现人机之间的自然语言交互。从学科本质来看,NLP
是计算机科学、人工智能与语言学的交叉领域,其研究目标是弥合人类语言的复杂性与计算机逻辑之间的鸿沟。NLP
的核心挑战在于如何使计算机不仅能处理语言的符号形式,更能理解其深层语义和语用含义。三
语言智能的演进与挑战(1自然语言处理的定义与研究范畴)NLP的研究范畴可分为自然语言理解和自然语言生成两大核心任务体系。自然语言理解关注计算机对语言的解析能力,主要包括:基础处理任务(分词、词性标注、命名实体识别)、句法分析(短语结构分析、依存句法分析)、语义理解(词义消歧、语义角色标注、关系抽取)、篇章理解(指代消解、discourse分析)等层次。自然语言生成则关注计算机生成符合语言规范且有意义的文本的能力,主要包括:文本摘要、机器翻译、对话系统、文本创作等任务。这两大任务体系共同构成了NLP技术的核心框架,使计算机能够从“读懂”语言到“运用”语言,最终实现与人类的自然交互。三
语言智能的演进与挑战(2自然语言处理的发展历程与技术突破)自然语言处理的发展历程是一部从规则驱动到数据驱动,从浅层理解到深层语义建模的技术演进史。这一历程大致可分为四个关键阶段。萌芽期(1950s-1980s):以符号主义为主导,依赖人工编写的语法规则和词典。发展期(1990s-2010s):见证了从符号主义向统计方法的范式转变。随着计算机计算能力的提升和大规模语料库的出现,统计方法开始在
NLP领域占据主导地位。这一时期的技术核心是通过从大规模文本数据中学习语言规律,而非依赖人工编写的规则。繁荣期(2010s):是深度学习在
NLP领域的爆发期,各种神经网络模型的提出极大地推动了NLP
技术的发展。爆发期(2017年至今):以
Transformer架构为标志,开启了预训练模型的新时代。三
语言智能的演进与挑战(2自然语言处理的发展历程与技术突破)从技术演进的脉络来看,可以清晰地观察到
NLP技术的三大转变:从规则驱动到数据驱动,从人工特征工程到自动特征学习,从任务特定模型到通用预训练模型。这些转变不仅推动了NLP技术性能的持续提升,也改变了
NLP
的研究范式和应用方式。随着技术的不断进步,NLP
系统正逐步从“理解语言
”向“理解世界
”迈进,为人工智能的全面发展奠定了坚实的语言基础。三
语言智能的演进与挑战(3语言智能的应用场景与教育价值)在日常生活服务领域,NLP技术已经成为人机交互的重要桥梁。智能音箱(如亚马逊Echo、小米小爱同学等)手机输入法的智能联想功能基于语言模型技术,能够预测用户的输入意图,显著提高输入效率。智能客服系统通过自然语言理解和对话管理技术,能够自动处理常见咨询问题,为用户提供24小时不间断服务。在行业应用领域,NLP技术正在重塑各个专业领域的工作方式。在金融行业,NLP技术被广泛应用于舆情分析、风险评估和智能投顾。在医疗健康领域,NLP技术能够从电子病历、医学文献中提取关键信息,辅助疾病诊断和治疗方案制定。在法律领域,NLP技术可以自动审查合同条款,识别潜在风险,提高法律工作效率。三
语言智能的演进与挑战(3语言智能的应用场景与教育价值)在内容创作与信息传播领域,NLP技术正在改变内容生产和消费的方式。新闻媒体利用NLP技术实现自动化写作,特别是在财经、体育等结构化信息丰富的领域。在广告营销领域,NLP技术能够根据产品特点和目标受众生成个性化广告文案。在教育出版领域,NLP技术被用于智能内容生成和个性化学习。三
语言智能的演进与挑战(3语言智能的应用场景与教育价值)从教育价值的角度来看,学习NLP技术有助于培养三种核心能力:技术原理认知能力、工具应用能力和伦理评估能力。技术原理认知能力指理解NLP的基本概念和工作原理,如文本表示、序列建模、注意力机制等,这是理解人工智能如何“读懂世界”的基础。工具应用能力指能够使用NLP工具和平台解决实际问题,如使用预训练模型API进行文本分类,利用开源框架开发简单的对话系统等。随着低代码平台的发展,即使是非技术专业的学习者也能通过简单的API调用实现复杂的NLP功能。伦理评估能力指能够识别NLP应用中的潜在风险和伦理问题,如算法偏见、隐私泄露、信息真实性等。四
文本表示与处理技术基础自然语言处理(NaturalLanguageProcessing,NLP)是计算机科学、人工智能(AI)和语言学领域的一个交叉学科,主要研究如何让计算机能够理解、处理、生成和模拟人类语言,从而实现与人类进行自然对话的能力。研究对象:人类社会的语言信息(比如语音和文本等)研究目的:实现人机之间的有效通信。让计算机理解、解释和生成人类语言。研究分类:自然语言理解(NaturalLanguageUnderstanding,NLU)、自然语言生成(NaturalLanguageGeneration,NLG)四
文本表示与处理技术基础(1文本的离散表示方法BoW)需要计算机能够处理和理解人类语言,首先需要将非结构化的文本数据转换为结构化的数值表示。文本的离散表示方法是最早发展起来的文本表示技术,其核心思想是将文本视为词语的集合或序列,通过统计词语的出现频率或重要性来表示文本的特征。(1)词袋模型(Bagof
Words,BoW)基本假设是:文档的含义主要由其中包含的词语及其出现频率决定,而与词语的顺序和语法结构无关。词袋模型的构建过程主要包括两个步骤:首先,构建一个包含语料库中所有不重复词语的词汇表(Vocabulary);然后,为每个文档生成一个向量,向量的维度等于词汇表的大小,每个维度的值表示对应词语在该文档中出现的次数。BoW(BagofWords):表示文档中单词出现的文本词袋模型数学中最简单的文本表示形式无逻辑顺序放置关注是否出现已知的单词YousaygoodbyeandIsayhello.YousayGoodbyeandIhello.1234567One-hotencoding(独热编码)将每个词映射为相互不同的单位向量词表中不同词的个数为N,则索引范围为0~N-1One-hot表示中,仅有一个元素是1,其余均为0You1000000say0100000①Johnlikestowatchmovies,Marylikesmoviestoo.②Johnalsolikestowatchfootballgames.仅表示词是否存在,稀疏性较高(大部分为0)四
文本表示与处理技术基础(1文本的离散表示方法BoW)BoW(BagofWords)表示文档中单词出现的文本按字母顺序排列alsofootballgamesjohnlikesmarymoviestotoowatch①0001212111②1111100101①Johnlikestowatchmovies,Marylikesmoviestoo.②Johnalsolikestowatchfootballgames.BoW缺点:不考虑单词之间的顺序无法反映出一个句子的关键词
Johnlikestoplayfootball,Marylikestoo.[‘football’,‘john’,‘likes’,‘mary’,‘play’,‘to’,‘too’][1121111]likesfootball四
文本表示与处理技术基础(1文本的离散表示方法BoW)四
文本表示与处理技术基础(1文本的离散表示方法TF-IDF)2.TF-IDF(TermFrequency-InverseDocumentFrequency)技术为了解决词袋模型对高频无意义词汇的过度加权问题,TF-IDF
技术被提出
。
TF-IDF
的核心思想是:一个词语对文档的重要性不仅取决于它在该文档中出现的频率(词频,TermFrequency,TF),还取决于它在整个语料库中的分布情况(逆文档率,
Inverse
Document
Frequency,IDF)TF-IDFTF-IDFTermFrequency词频(针对每一篇文档)
Inversedocumentfrequency逆文本频率(针对整个语料库而言)
TF-IDFTF-IDF值越大说明这个词越重要,也可以说这个词是关键词
①Thisisthefirst
document.②Thisdocumentistheseconddocument.③Andthisisthethirdone.④Isthisthefirstdocument?
四
文本表示与处理技术基础(1文本的离散表示方法TF-IDF)四
文本表示与处理技术基础(1文本的离散表示方法n-gram)3.n-gram模型n-gram模型是对词袋模型和
TF-IDF
的扩展,它通过考虑连续的
n个词语组成的序列(n-gram)来捕捉局部的词语顺序信息。常用的
n-gram包括unigram(n=
1
,即单个词语)、bigram(n=2
,即两个连续词语)和
trigram(n=3
,即三个连续词语)。n-gram模型。例如,对于句子“人工智能改变世界
”,其
bigram
序列为["人工智能改变",
"改变世界"]。n-gram模型的基本思想是,相邻的词语之间存在语义关联,通过考虑这些关联可以更好地表示文本的特征。N-gram例子搜索引擎的词语联想输入法生僻词输入N-gram将文本拆分成若干个连续的n个词的序列统计文本中连续n个词的序列(或“词组”)出现的频率Isawamanonahillwithatelescope.生成的3-grams如下:isawasawamanamanonmanonaonahillahillwithhillwithawithatelescope.2-gram*今天天气不错。今吃是看同哦。2-gram今天天气不错。今天天天天气气不不错0.820.210.630.110.46今吃是看同哦。今吃吃是是看看同同哦0.050.030.060.010.09一个句子是否合理,和概率息息相关四
文本表示与处理技术基础(1文本的离散表示方法n-gram)四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)词向量技术的理论基础是分布式假设(DistributionalHypothesis),该假设由语言学家
Firth
在
l957年提出,其核心思想是:“一个词的含义由其所处的上下文决定
”
(Youshallknowawordbythecompanyitkeeps)。换句话说,如果两个词语经常出现在相似的上下文环境中,那么它们很可能具有相似的语义。基于这一假设,词向量模型通过学习词语在大规模语料库中的上下文分布规律,将词语映射到低维向量空间中,使得语义相似的词语在向量空间中距离相近。20l3年,Google
的
Mikolov等人提出的
Word2Vec模型是词向量技术发展的里程碑。Word2Vec主要包含两种训练架构:连续词袋模型(ContinuousBagofWords,CBOW)和Skip-Gram模型
Word2vecWord2vec—分布式表示将每个词映射到一个固定长度的向量能够更好地表达不同词之间的相似性和类比关系一组用于生成词向量的浅层神经网络模型大脑神经元人工神经元四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)Word2vec—CBOW模型
该模型的目标是根据词语的上下文预测中心词。四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)例如:在设置上下文窗口长度为
1
时,“Weareabouttostudytheidea
of
deep
learning.
”句子中,study
的上下文就
to和
the这
2个词,如果长度设为
2
,那么
study
的上下文就是about
、to
、the和
idea这
4个词。对于
CBOW模型,它实际上是一个神经网络,该神经网络会接收上下文词语,并将上下文词语转换为最有可能得目标词,在设置上下文窗口长度为
2
时,能通过
about
、to
、the和
idea这
4个词预测
study这个词。Word2vec—Skip-Gram
模型四
文本表示与处理技术基础(2文本的分布式表示:词向量技术)Skip-Gram
模型则与CBOW
相反,它的目标是根据中心词预测其上下文词语。给定一个中心词,Skip-Gram模型会训练神经网络来预测在一定窗口内可能出现的上下文词语。与
CBOW相比,Skip-Gram模型通常在小规模语料库上表现更好,并且能够更好地处理稀有词语。实践:在
Python
中,我们可以使用
Gensim库来训练和使用
Word2Vec模型。四
文本表示与处理技术基础(3文本预处理的标准化流程)原始文本数据通常包含大量噪声和无关信息,直接用于模型训练会影响模型性能。文本预处理作为
NLP
流水线的第一步,旨在清洗和标准化文本数据,为后续的特征提取和模型训练做准备。一个标准化的文本预处理流程通常包括文本清洗、分词、去停用词、标准化等步骤,每个步骤都有其特定的目标和方法。
(1)WHY?TomwaswatchingTVinhisroom.Marycameintotheroom.Marysaidhito_______?Tom/him以CBOW解决,上下文长度必须到Tom(第18个单词)CBOW忽略了单词顺序RNN(RecurrentNeuralNetwork)四
文本表示与处理技术基础(4循环神经网络(RNN))
(2)RNN模型RNN中使用的层称为“RNN”层通过循环结构和时间步展开有效处理序列数据,捕捉上下文信息适合处理文本、时间序列任务之前发生了什么“现在”正在发生什么四
文本表示与处理技术基础(4循环神经网络(RNN))
(3)RNN结构循环:反复并持续环路RNN中使用的层称为“RNN”层
处理句子时输入为单词的分布式表示
四
文本表示与处理技术基础(4循环神经网络(RNN))
(1)WHY?LSTM(LongShort-TermMemory)TomwaswatchingTVinhisroom.Marycameintotheroom.Marysaidhito_______?梯度爆炸梯度消失5
长短期记忆网络(LSTM)的门控机制四
文本表示与处理技术基础(5长短期记忆网络(LSTM))
(2)LSTM结构与传统
RNN相比,LSTM在处理长序列时表现出显著优势。研究表明,在包含长距离依赖关系的任务中,LSTM
能够比传统
RNN保留更多的历史信息,梯度消失问题得到明显缓解。例如,在处理长度为
100
的序列时,传统的
RNN可能只能有效利用最后
20个时间步的信息,而
LSTM
能够利用整个序列的信息。四
文本表示与处理技术基础(5长短期记忆网络(LSTM))五Transformer开启序列建模新时代1Transformer
的诞生背景与技术变革在
2017年之前,人工智能处理语言、语音等序列数据时,长期依赖循环神经网络(RNN)及其改进版
LSTM
、GRU
。这些模型像工厂流水线一样,必须按顺序处理每个元素。这种“排队等待
”的工作方式,导致两个严重问题:一是遇到长句子时,早期信息会像传话游戏中逐渐失真的悄悄话,传到后面几乎完全模糊(梯度消失问题);二是无法同时处理多个词语,就像单车道堵车,即使有强大的
GPU
,也只能眼睁睁看着计算资源闲置(并行计算困境)。2017年,Google提出了
Transformer架构,该架构的核心创新——自注意力机制,它让每个词都能动态关注序列中所有其他词,无论距离远近。从技术角度看,Transformer是当代大语言模型的“发动机”。从应用范围看,Transformer已从语言领域“跨界”到计算机视觉(ViT模型让图像识别准确率超越传统CNN)、生物科学(AlphaFold用它预测蛋白质结构,解决了50年难题)、语音识别(手机语音转文字准确率提升15%)、推荐系统(视频平台用它分析你的观看习惯,推荐更合口味的内容)等多个领域。五Transformer开启序列建模新时代2Transformer整体架构与注意力机制Transformer
的整体架构像一家高效的“翻译公司
”,由“编码器部门
”和“解码器部门
”组成,如图所示。编码器负责“理解原文
”,把输入序列(比如中文句子)转换成包含所有语义信息的“语义矩阵”;解码器负责“生成译文”,根据编码器的语义矩阵,一步步生成目标序列(比如英文句子)。五Transformer开启序列建模新时代3Transformer编码器Transformer
编码器Transformer
的编码器的作用是把输入序列(比如中文句子)转换成富含上下文信息的“语义矩阵
”,就像“深度加工厂
”——把原始矿石(原始文本)一步步提炼成高纯度金属(语义向量)。编码器由6个相同的“编码器层
”堆叠而成,每个编码器层又包含“多头自注意力层
”和“前馈神经网络层
”,中间用“残差连接
”和“层归一化
”连接。五Transformer开启序列建模新时代4Transformer解码器Transformer
解码器Transformer
的解码器的任务是基于编码器输出的语义矩阵,生成目标序列(比如英文翻译结果),就像“逻辑管家
”——根据主人的需求(编码器语义),有条理地安排事务(生成序列)。解码器同样由
6个“解码器层
”堆叠,每个解码器层比编码器层多了“掩码多头自注意力
”和“编码器-解码器交叉注意力
”两个模块。五Transformer开启序列建模新时代5Transformer进行文字翻译Transformer
没有任何循环结构,所有词可以同时处理。如果说
RNN是“一个翻译员逐字读原文
”,Transformer就是“6个翻译员同时从不同角度分析整段原文
”。Transformer
进行文字翻译五Transformer开启序列建模新时代6Transformer
的应用与影响NLP领域:从理解到生成的全面突破计算机视觉:从“卷积”到“注意力”
的跨越多模态任务:跨领域的“语义桥梁”其他领域:生物、语音与推荐系统六
文本分类与情感分析:语言理解的实践1
文本分类的完整技术流程文本分类是自然语言处理中最基础也最常用的任务之一,其目标是将文本自动分配到预定义的类别中。从新闻主题分类、垃圾邮件检测到情感分析、意图识别,文本分类技术在信息过滤、内容推荐、舆情监控等领域有着广泛的应用。构建一个高性能的文本分类系统需要遵循标准化的技术流程,包括数据准备、特征工程、模型构建、模型评估和优化等步骤。数据准备是文本分类流程的第一步,也是影响最终性能的关键因素之一。高质量的数据集是构建高性能分类系统的基础,数据准备通常包括数据收集、数据清洗、数据标注和数据集划分等子步骤。六
文本分类与情感分析:语言理解的实践1
文本分类的完整技术流程特征工程是将原始文本转换为模型可接受的数值特征的过程,直接影响模型性能。文本分类的特征工程主要包括文本表示和特征选择两个方面。文本表示方法包括离散表示(如词袋模型、TF-IDF)和分布式表示(如
Word2Vec、
GloVe、BERT嵌入)。离散表示简单直观,但忽略语义信息;分布式表示能够捕捉语义关系,但计算成本较高。在实际应用中,可以根据数据集大小和模型复杂度选择合适的表示方法。对于小规模数据集,TF-IDF通常表现较好;对于大规模数据集,可以考虑使用预训练词向量或上下文相关嵌入。特征选择旨在降低特征维度,去除冗余和噪声特征,提高模型效率和泛化能力。六
文本分类与情感分析:语言理解的实践1
文本分类的完整技术流程模型构建是选择合适的分类算法并训练模型的过程。文本分类模型可分为传统机器学习模型和深度学习模型两大类。传统机器学习模型包括朴素贝叶斯、支持向量机(SVM)、逻辑回归、决策树和随机森林等。这些模型通常与
TF-IDF等离散特征结合使用,具有训练速度快、可解释性强的优点,适用于小规模数据集或资源受限的场景。其中,SVM和逻辑回归在文本
分类任务中表现尤为出色,是传统方法中的首选模型。深度学习模型包括卷积神经网络(CNN)、循环神经网络(RNN/LSTM/GRU)、
Transformer等。模型训练过程中需要设置合适的超参数,如学习率、批大小、迭代次数等。超参数调优方法包括网格搜索、随机搜索和贝叶斯优化等。网格搜索遍历所有可能的参数组合,结果最可靠但计算成本最高;随机搜索随机采样参数组合,效率更高;贝叶斯优化基于先验结果自适应采样参数,平衡了效率和性能,是大规模超参数调优的首选方法。六
文本分类与情感分析:语言理解的实践模型评估是通过测试集评估模型性能的过程
,常用的评估指标包括准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1值(F1-Score)和混淆矩阵(ConfusionMatrix)等。准确率:正确分类的样本占总样本的比例,适用于平衡数据集。精确率:预测为正类的样本中实际为正类的比例,衡量模型的精确性。召回率:实际为正类的样本中被正确预测的比例,衡量模型的完整性。F1值:精确率和召回率的调和平均,综合评价模型性能。混淆矩阵:展示各类别之间的预测结果,帮助分析错误类型1
文本分类的完整技术流程六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法情感分析(SentimentAnalysis)作为文本分类的一个重要应用方向,旨在识别和提取文本中表达的主观情感、态度和观点。随着社交媒体、电商平台和在线评论的普及,情感分析技术在舆情监控、产品推荐、客户反馈分析等领域得到了广泛应用。情感分析的核心技术包括情感极性分类、情感强度分析、情感实体识别和细粒度情感分析等,实现方法涵盖了从传统机器学习到深度学习的多种技术路径。情感分析任务可以根据粒度和目标分为多个层次:文档级情感分析;句子级情感分析;Aspect级情感分析;情感强度分析;情感原因分析。情感分析的技术方法可以分为三大类:基于词典的方法、基于传统机器学习的方法和基于深度学习的方法。六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法基于词典的方法是最早的情感分析方法,通过情感词典计算文本的情感得分。其基本步骤包括:(1)
构建或选择情感词典,如英文的
WordNet-Affect
、SentiWordNet
,中文的BosonNLP
情感词典、知网情感词典等。情感词典通常包含词语及其对应的情感极性(积极、消极、中性)和情感强度。(2)对文本进行分词和预处理,去除停用词和噪声。(3)根据情感词典对文本中的情感词进行匹配和加权求和,计算文本的整体情感得分。得分大于
0表示积极情感,小于
0表示消极情感,接近
0表示中性情感。六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法基于传统机器学习的情感分析方法将情感分析视为文本分类问题,通过特征工程和分类算法实现情感识别。其基本步骤包括:l.数据准备:收集和标注带有情感标签的文本数据。2.特征提取:将文本转换为数值特征,如词袋模型、TF-IDF
、n-gram等。3.模型训练:使用分类算法(如朴素贝叶斯、SVM
、逻辑回归)训练情感分类模型。4.模型评估和优化:使用测试集评估模型性能,并进行特征选择和参数调优。六
文本分类与情感分析:语言理解的实践2情感分析的核心技术与实现方法基于深度学习的情感分析方法通过神经网络自动学习文本特征,避免了手动特征工程,在大规模数据集上表现出优越性能。常用的深度学习模型包括:(1)卷积神经网络(CNN):通过卷积层和池化层捕捉文本中的局部情感特征,如情感词和短语。TextCNN是一种经典的文本分类模型,在情感分析任务上表现出色。(2)循环神经网络(RNN/LSTM/GRU):通过循环连接捕捉文本中的时序依赖关系,适合处理长文本和上下文相关的情感表达。LSTM
和
GRU
能够有效解决传统RNN
的梯度消失问题,更好地捕捉长距离情感依赖。(3)双向循环神经网络(Bi-RNN):同时利用前向和后向上下文信息,提高情感识别的准确性,特别是在包含转折关系的文本中。(4)注意力机制(AttentionMechanism):允许模型关注文本中对情感表达最重要的部分,如情感词或修饰语,提高模型的可解释性。(5)预训练语言模型(如
BERT、RoBERTa):在大规模文本语料上预训练的语言模型,通过微调能够在小规模情感分析数据集上取得最先进的性能。预训练模型能够捕捉深层语义关系和语境依赖的情感表达,是当前情感分析的最佳选择。六
文本分类与情感分析:语言理解的实践3文本分类的评估与优化策略文本分类的评估需要综合考虑多个指标,以全面反映模型的性能。除了基本的准确率(Accuracy)外,针对不同的应用场景和数据特点,还需要关注精确率(Precision)、召回率(Recall)、F1值(F1-Score)、混淆矩阵(Confusion
Matrix)、ROC
曲线和AUC值等指标。
1生成式AI
生成式AI是一种基于深度学习技术的人工智能分支,能够通过分析大量数据中的模式自动生成新的原创内容(如文本、图像、音频、视频等),而非仅对现有数据进行分类或决策。其核心在于“从无到有”的创造能力。七
生成式AI与预训练模型:从理解到创作大模GPT(生成式模型)的工作过程:单字接龙模型输入:我们模型输出:发明了一个新的和简单的模型文本生成的过程本质就是单字接龙。思考:单字接龙为什么可以产生
这么大的威力?GPT我们发明了一个新的和简单的模型发明了一个新的和简单的模型end
2预训练模型GPT(GenerativePre-trainedTransformer)
是一种基于
Transformer架构
的自然语言处理模型,由OpenAI开发。其核心思想是通过大规模预训练和微调来实现强大的文本生成和理解能力。七
生成式AI与预训练模型:从理解到创作GPT的核心思想GPT的核心思想是
生成式预训练+微调:预训练(Pre-training):在大规模文本数据上训练模型,学习语言的统计规律和上下文关系。使用
自回归语言模型
目标,即根据前面的词预测下一个词。例如:
给定句子"Iloveto__",
模型会预测下一个词可能是"eat"或"play"。微调(Fine-tuning):
在特定任务(如文本分类、问答、翻译)上对预训练模型进行微调。通过少量标注数据,使模型适应具体任务。七
生成式AI与预训练模型:从理解到创作GPT的训练过程输入表示:
将文本转换为词向量(TokenEmbeddings),并添加位置编码。自回归生成:
模型从左到右逐词生成文本,每一步都基于前面的词预测下一个词。
例如,生成句子"Ilovetoeat"的过程:
输入"I",预测"love";
输入"Ilove",预测"to";
输入"Iloveto",预测"eat"。损失函数:
使用交叉熵损失函数,衡量模型预测的词与真实词的差异。七
生成式AI与预训练模型:从理解到创作七
生成式AI与预训练模型:从理解到创作
3生成式文本创作的技术原理近年来,基于
Transformer解码器的自回归语言模型成为生成式文本创作的主流技术,如
GPT
系列模型。Transfor
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 数据恢复服务审核结果通知函5篇范文
- 医药企业生产线调整通知函6篇
- 人工智能通识第34课 – 8.4智慧医疗应用
- 人工智能通识第18课 – 5.1语音发音与智能语音基础
- 新零售行业无人超市技术实现及运营策略
- 教育产品价格调整商议函(3篇)
- 互联网教育创新实践手册
- 分层作业教学资源配置标准
- 2026年专业技术人员沟通能力公需科目题库及答案
- 2026年中式烹调师(中级)模拟试卷及答案
- 搅拌站应急演练方案记录
- 2025年大唐集团招聘笔试试题及答案
- 《彩虹》课件 部编版语文二年级上册
- 云南省楚雄州2024-2025学年高一下学期期末考试数学
- 农行声誉风险管理办法
- 土方作业安全注意事项及施工安全管理
- 2024年陕西延长石油集团招聘笔试真题
- 《湖南省房屋建筑和市政工程消防质量控制技术标准》
- 老年病科基础护理
- 陕西祁泽鑫金属材料有限公司金属表面处理项目环境影响报告表
- 消防应急疏散演练主题课件
评论
0/150
提交评论