版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第2章生成式人工智能的基础技术与体系结构授课教师:时间:2025.01.01目录CONTENTS01机器学习与深度学习基础02自然语言处理核心技术03计算机视觉与生成任务04多模态技术与具身智能05总结与展望人工智能的核心机器学习深度学习自然语言处理计算机视觉机器学习与深度学习基础01自监督学习通过构造伪任务来学习数据内部结构,具备强大的泛化能力。它结合了有监督学习的可控性和无监督学习的灵活性,是生成式人工智能的重要发展方向。三种范式的融合机制能够充分发挥各自的优势,提升生成效果。01有监督学习在生成式任务中适用于输入输出强匹配的场景,如图像描述生成与语音合成。它依赖于高质量的标注数据,通过学习输入与输出之间的映射关系来生成内容。虽然生成效果较好,但标注成本高,限制了其在大规模开放域任务中的应用。02无监督学习通过建模数据的潜在分布来实现内容生成,无需标注数据。它适用于大规模开放域任务,能够生成多样化的结果。然而,生成内容的可控性较差,需要通过其他机制进行优化。03有监督学习无监督学习自监督学习机器学习范式与生成式任务人工智能的核心监督学习的目标是用“已知的”数据来训练机器,机器通过这些带有标签的数据学会预测新的数据的标签。机器学习-监督学习人工智能的核心无监督学习是让机器从没有标签的数据中找出模式或结构。无监督学习的“学习”过程完全依赖数据本身的内在特征。机器学习-无监督学习人工智能的核心强化学习通过奖励和惩罚来训练机器。机器学习-强化学习前馈神经网络是最基本的神经网络结构,适用于固定维度的输入输出问题。它常用于构建生成器或解码器,通过多层神经元的组合实现复杂的映射关系。虽然结构简单,但在处理复杂任务时能力有限。前馈神经网络卷积神经网络在图像生成任务中发挥重要作用,通过卷积层提取图像的空间特征,能够支持图像级别的细节还原。循环神经网络则用于处理时序数据,为自然语言生成与语音建模提供语义连续性保障。随着技术发展,Transformer架构逐渐替代了传统循环结构,成为序列建模的主流框架。卷积神经网络与循环神经网络神经网络基础结构词向量通过上下文学习捕捉词汇的语义关联性,将词汇映射到低维向量空间。它在自然语言处理中广泛应用,能够为文本生成提供语义基础,支持语言模型理解词汇之间的关系。词向量图像向量将图像映射到低维语义空间,支持图像生成与图文理解。通过提取图像的关键特征,图像向量能够实现图像之间的相似性比较和语义对齐,为多模态任务提供支持。图像向量多模态嵌入实现不同模态数据的语义对齐,是跨模态生成与检索的关键。它通过将文本、图像等多种模态的数据映射到同一语义空间,使模型能够理解和生成跨模态的内容。多模态嵌入嵌入空间具有语义连续性、多样性表达、任务迁移性与可控性等特性。这些特性对生成应用至关重要,能够提升生成内容的质量和多样性,支持模型在不同任务之间的迁移和优化。嵌入空间的特性表示学习与嵌入空间人工智能的核心机器学习(MachineLearning)让机器通过大量数据进行学习,不需要明确编程。机器学习可以从数据中自动提取数据的模式并改进决策。特点通过算法自动学习,能够提高预测和分类的准确性,适用于大数据环境。人工智能的核心深度学习(DeepLearning)深度学习是机器学习的一种,通过人工神经网络来进行学习,模拟人脑处理信息的方式。它在处理大规模数据和复杂任务时表现出色。特点通过多层神经网络进行特征提取,适用于图像、语音、自然语言处理等领域。人工智能是指让机器表现出“智能行为”的技术,比如能思考、能决策、能与人交流、能识别图片或声音等。目标是让机器像人一样完成智能任务。机器学习是实现AI的一种方式,它不依赖人去写死规则,而是让机器“从数据中学习”规律。核心思想是给机器一堆数据,它自己找出规律,然后根据这些规律来预测或判断新数据。深度学习是机器学习中的一种方法,它模仿人脑神经网络的结构来处理数据。用“神经网络”模型处理大量数据,自动提取特征,非常擅长处理图像、语音、自然语言等复杂任务。例如让AI自动识别图片中的人脸,翻译一段话,甚至创作一幅画就是深度学习的成果。人工智能的核心人工智能与机器学习、深度学习的关系包括市总工会的互联网营销师自然语言处理核心技术02人工智能的核心它帮助计算机理解文本的含义,从而可以自动化地完成很多任务,比如分类文章、提取新闻中的关键信息等。文本分析语言生成是指计算机根据输入的内容或上下文生成合适的语言。语言生成情感分析是让计算机分析文本中的情绪(比如:积极、消极、中立),并判断这些情绪的强度。情感分析自然语言处理自然语言处理对话系统自动翻译文本生成人工智能的核心人工智能的核心TransformerTransformer是一种基于自注意力机制的深度学习模型架构,2017年由Google团队在提出,主要用于处理序列数据,是现代自然语言处理(NLP)领域的革命性技术,也是大语言模型的核心基础。“小明告诉小红,她昨天买的书很好看。”01n-gram模型基于统计概率,适用于简单短语生成。它通过计算词序列的概率分布来生成文本,虽然简单高效,但无法捕捉长距离的上下文信息,生成内容的连贯性较差。n-gram模型02循环神经网络引入上下文记忆,能够生成结构化语言内容。它通过循环结构保存历史信息,为文本生成提供语义连续性。然而,循环神经网络在处理长序列时容易出现梯度消失或爆炸的问题。循环神经网络03Transformer模型基于自注意力机制,具备强大的语言结构与语义理解能力。它能够同时处理序列中的所有位置信息,捕捉长距离的依赖关系,是当前主流的序列建模框架,广泛应用于机器翻译、文本摘要、对话生成等任务。Transformer模型序列建模与语言建模BERT为双向编码器结构,侧重语义理解;GPT为单向解码器结构,专注文本生成;T5为完整的编码器-解码器结构,强调任务统一与广谱适应性。三者在预训练目标、上下文建模方式、输入输出格式与适用任务类型等方面存在差异,分别适用于不同的生成式人工智能任务。BERT、GPT与T5的对比预训练语言模型计算机视觉与生成任务03人工智能的核心让计算机自动“看懂”图像内容并识别出其中的物体、场景或特征的技术。图像识别通过算法对图像进行修改、增强、转换、去噪等操作,目的是提高图像质量,或者使图像更适合进一步分析。图像处理计算机视觉图像识别与生成图像识别影像分析图像生成人工智能的核心变分自编码器结构清晰,通过编码器将图像压缩为潜在空间的分布,再通过解码器重建图像。然而,其生成质量受限,生成的图像可能较为模糊,细节不够丰富。变分自编码器01生成对抗网络通过对抗训练提升图像真实感。生成器生成图像,判别器判断真假,两者相互对抗,最终生成高质量的图像。该模型在图像生成领域取得了显著成果,但训练过程较为复杂。生成对抗网络02扩散模型通过加噪与去噪过程建模图像分布,具有训练稳定、细节丰富等优势。它逐步去除图像中的噪声,生成高质量的图像,是当前图像生成领域的前沿技术。扩散模型03图像生成模型视觉Transformer利用自注意力机制建模图像空间结构与语义关系。它在风格转换、图像修复与图文生成等任务中表现出色,能够捕捉图像中的细节信息,生成高质量的图像内容。视觉Transformer01CLIP模型通过对比学习训练机制实现多模态对齐,能够将文本与图像映射到同一语义空间。它在文本驱动图像生成中发挥重要作用,通过零样本预测流程引导生成内容,实现语义控制。CLIP模型02视觉Transformer与CLIP图像-文本联合建模BLIP支持判别与生成任务双向训练,适用于图文检索与图像字幕生成。它通过联合建模图像与文本的语义信息,实现高效的图文匹配与生成。BLIPImagen语义理解能力强,生成的图像细节与语义一致性优越。它通过先进的生成模型架构,实现高质量的图像生成,推动了图文协同生成技术的发展。ImagenDALL·E支持开放语义生成,风格控制力强。它能够根据文本描述生成高质量的图像,支持多种风格的生成,为创意设计提供了强大的工具。DALL·E多模态技术与具身智能04联合建模通过构建共享语义空间实现模态间的信息交互与整合。它将不同模态的数据映射到同一空间,使模型能够同时处理多种模态的信息,提升跨模态任务的性能。联合建模对比学习通过构造正负样本对提升跨模态语义对齐能力。它通过学习区分相似与不相似的样本,增强模型对语义的理解,广泛应用于多模态任务中。对比学习注意力机制根据某一模态的信息动态调整对其他模态的关注程度,实现信息过滤与语义强化。它使模型能够聚焦于重要的信息,提升多模态融合的效果。注意力机制多模态融合机制具身智能强调智能体通过感知、交互与反馈形成动态适应与目标导向行为。它模拟人类的感知与行为模式,使智能体能够在复杂环境中实现自主决策与行为生成。具身智能的概念在虚拟环境中,通过交互式训练平台构建具身智能,实现从语言到行为的生成闭环。在实体机器人中,生成模型可用于任务描述转指令映射、自然语言控制与多模态感知融合等任务,体现生成式AI与机器人技术的深度融合。具身智能的应用具身智能简介生成式人工智能与具身智能的融合基础在于语言生成与行为规划的统一建模。通过构建从语言指令到行为序列的生成机制,实现语言控制机器人等应用,推动智能体的自主行为生成。融合基础关键技术涉及多模态感知与世界模型的结合。使智能体具备预测能力与策略规划能力,能够根据环境信息做出合理的决策,提升智能体的适应性。关键技术未来趋势聚焦于从虚拟仿真到现实部署的迁移能力,包括感知鲁棒性提升、跨平台部署支持与低样本任务泛化等关键能力。推动AI系统由生成内容向生成行为演化,最终走向通用智能体。未来趋势生成式模型在具身智能中的作用机制包括策略生成与语言-行为对齐。通过生成模型为智能体提供行为策略,实现语言指令与具体行为的无缝对接。作用机制具身智能与生成式AI融合多模态文生三维文生视频图片搜索人工智能的核心Deepseek案例05DeepSeek
厚积薄发,震动全球特别的头脑:特别的经历:特别的财富:特别的屯卡:特别的理念:特别的成就:2023 202420252024
年12月26日:DeepSeek
发布
DeepSeek-V3
模型2025年1
月20日:DeepSeek
发布
DeepSeek-R1
模型2023
12
月:梁文峰创立DeepSeek专注大模型研发。DeepSeek模型家族,优异能力短缺催生的智慧:DS的算法创新混合专家-多头注意力-PTX指令优化-双Token预测
...DeepSeek成功因素彻底开源,半月霸榜开源即代码层面开源,可以调用与进行二次开发。开源免费调用有助于先行占据市场份额,成为规则制定者,率先拓展生态粘性。DeepSeek
V3与R1模型实现了开源,采用MIT协议。对大模型发展:这提升了世界对中国AI大模型能力的认知,一定程度打破了OpenAI与Anthropic等高级闭源模型的封闭生态。DeepSeek
R1在多个测试指标中对标OpenAI
o1,通过模型开源,也将大模型平均水平提升至类OpenAIo1等级。对下游生态:优质的开源模型可更好用于垂类场景,即使用者针对自身需求蒸馏,或用自有数据训练,从而适合具体下游场景;此外,模型训推成本降低,将带来使用场景的普及,带动AIGC、端侧等供给和需求。成本屠夫,低价冲击DeepSeek
V3模型训练成本达278.8万H800小时,共花费557.6万美元。对比OpenAI、Anthropic、LlaMA3等模型,DeepSeek
V3单次训练成本显著降低,主要系DeepSeek通过优化模型结构、模型训练方法、针对性GPU优化等部分,提升了模型训练过程中的算力使用效率。降低算力成本:DeepSeek
凭借创新技术,显著降低模型训练,特别是推理与运行的算力成本,提高资源利用效率,减轻行业算力负担。提升低性能芯片兼容性:
打破依赖高端芯片的传统局限,
DeepSeek
的模型对低性能芯片兼容性良好,拓宽算力设备选择范围,使更多企业和机构能基于现有硬件开展AI
工作。出现
LPU
破局者:在
LPU
领域新的发展格局。国内AI模型方:震荡洗牌模型方“六小龙”应对举措零一万物不再追求训练超级大模型,开发轻量化模型;与阿里云联合成立
“产业大模型联合实验室”;与苏州高新区联合成立产业大模型基地,重点打造多领域行业大模型解决方案,探索产业化路径,联合产业链上下游
7
家企业共同推进月之暗面月之暗面宣布大幅缩减产品投放预算,而此前每月投放达3亿元之巨,据报道,缩减广告后,下载量并非明显减少。百川智能发布全场景推理大模型
Baichuan
-
M1
-
preview,具备语言、视觉和搜索领域推理能力,解锁医疗循证模式;以
Baichuan-
M1
为底座打造的
“AI
儿科医生”
上岗,可进行临床推理阶跃星辰DeepSeek
-
R1
发布当天发布多款模型,包括
Step
-
2
-
miniStep
-
2
文学大师版,随后又发布
Step
-1o
Audio、Step
-1o
Vision、Step
-
Video
V2;旗下应用
“跃问”
推出跃问
AI创意板;计划在
2
月
21
日举办的首届
“Step
Up
生态开放日”
上揭晓后续动作智谱华章与三星合作将
Agentic
GLM嵌入
GalaxyS25
系列手机;与二次元
AI
画图应用
“捏
ta”
展开合作,在自家应用中上线捏ta
功能,并发起联名活动MiniMax1
月
20
日发布了T2A
-
01
系列语音模型和海螺语音产品;创始人强调开源的重要性,MiniMax
-
01
模型发布会即开源;MiniMax
-
01
系列通过大规模扩展新型Lightning
Attention
架构,提升模型处理能力、模型方“六巨龙”应对举措腾讯多款产品接入
DeepSeek
-
R1,如腾讯元宝、微信、ima、腾讯文档、QQ
浏览器、QQ
音乐等;微信开启灰度测试
“AI
搜索”功能。百度宣布
4
月1日起文心一言免费用,下一代文心模型决定开源。华为发布数据智能解决方案
5.0,通过场景创新、多样智能、融合产线和智算底座四大关键举措。从器件、节点到集群,全面提升系统级的性能与可靠性;提供业界最完整的
AI
工具链,实现零代码的大模型开发与
agent
应用的流程编排;基于华为盘古
5.0在
NLP
大模型之上,进一步打造预测、多模态等能力。阿里发布千问2.5MAX。坚持云和
AI
协同发展,高强度投入人工智能基础设施建设,推动算力成本持续降低,“通义千问”
API调用价格一年间下降了
97%;努力提高自研基础模型
“通义”系列的能力,坚持全尺寸、全模态开源,促进技术创新,与生态伙伴一起,推动把
AI
能力转化成为千行百业的生产力。字节跳动字节跳动
CEO
梁汝波反思跟进速度问题,提出
2025
年在
AI业务上追求
“智能”
上限、探索新的交互和加强规模效应。科大讯飞2
月
10
日,DeepSeek
全系大模型正式上线讯飞开放平台,支持公有云API
调用、一键部署专属模型。2
月
20
日,推出星火DeepSeek
塔式一体机与星火
DeepSeek
一体机。正在训练的星火
X1
新版本预计
3
月内完成,实现数学答题和过程思维链能力对标甚至超过世界一流同行。,没有终点的竞跑:智能世界加速到来总结与展望06本章回顾了生成式人工智能的基础技术体系,包括机器学习与深度神经网络的结构原理
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026手足口病知识试题及答案
- 肩关节结核护理查房
- 2026年秋季小学二年级体育教学工作计划
- 小学四年级数学思维拓展冲刺押题卷2026秋季
- 7 田忌赛马小学语文
- (正式版)DB13∕T 1201-2010 《污染治理设施运行操作技术规范 除尘设施》
- 2026-2027年医学常识专项训练题库
- 2025-2026年法治素养提升测试题库
- 2025-2026年针灸学经络腧穴知识测试卷
- 2026年压力容器巡检维护考试试卷试题及答案
- 2025年西藏自治区法院聘用制书记员笔试模拟卷
- 第3课时 认识更大的数2026-2027学年北师大版四年级数学上册
- 新版2026秋新教科版科学六年级上册全册核心素养教案教学设计合集
- 3.1《坚强的领导核心》课件2026-2027学年统编版 道德与法治九年级上册
- 2024年新人教版一年级上册数学课件 第一单元5以内数的认识和加、减法 2. 1~5的加、减法 第1课时加法
- 《犬猫实验室检查》课件
- 首都经济贸易大学《微积分》2021-2022学年第一学期期末试卷
- DZ∕T 0207-2020 矿产地质勘查规范 硅质原料类(正式版)
- 电工技术基础与技能(中职电子电气电力类等专业)全套教学课件
- 文化项目创意与策划
- 《大学生劳动教育》考试复习题库(含答案)
评论
0/150
提交评论