现代深度学习教程 课件 第11章基础模型进阶与应用_第1页
现代深度学习教程 课件 第11章基础模型进阶与应用_第2页
现代深度学习教程 课件 第11章基础模型进阶与应用_第3页
现代深度学习教程 课件 第11章基础模型进阶与应用_第4页
现代深度学习教程 课件 第11章基础模型进阶与应用_第5页
已阅读5页,还剩82页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《现代深度学习教程》第11章

基础模型进阶与应用主讲:XXX时间:2026/9/21目录CONTENTS01NLP基础模型02视觉基础模型03多模态基础模型04生物医学基础模型05材料科学基础模型06遥感解译基础模型07具身智能机器人AI11.1NLP基础模型11.1NLP基础模型自然语言处理领域的基础模型正在定义智能系统与人类语言交互的新范式。本节介绍6个代表性模型,它们的强大之处在于深度理解和生成语言的能力,推动了语音识别、文本理解、翻译和内容创作的创新。AudioLM谷歌开发的音频语言模型,可通过“听到”的音频生成其后续音频(逼真的音乐和语音)。PaLM谷歌5400亿参数规模的大语言模型,利用Pathways(路径)架构训练。LLaMAMeta发布的开放且高效的语言模型系列,含7B/13B/33B/65B四个版本。GLM通用语言模型,采用自回归空白填充预训练技术。腾讯混元大模型腾讯研发的大语言模型,具备复杂语境下的逻辑推理与可靠任务执行能力。DeepSeek深度求索研发的开源大语言模型系列,实现高性能与低成本的平衡。这些NLP基础模型不仅在学术研究中展现了前所未有的复杂语言处理能力,也为智能客服、自动化内容审核和辅助写作等商业应用提供了强大支持。4/8711.1.1AudioLM:语言建模思路AudioLM是谷歌开发的大语言模型,可以理解和生成音频,能够通过“听到”的音频生成其后续音频(逼真的音乐和语音)。它将语言建模的原理应用于音频生成领域:通过将输入音频映射到一系列离散的标记,并把音频生成视为一种语言建模任务。①输入和分词化音频经分词器模型处理后映射到离散标记序列,实现显著降维。②使用词进行语言建模仅解码器Transformer最大化条件概率,自回归生成标记序列。③词解码为音频解码器模型将标记映射回音频,重建波形。图11.1AudioLM采用的两种分词方法的关系示意5/8711.1.1AudioLM:两种分词与应用AudioLM采用声学分词和语义分词两种分词方法,二者相互补充。声学分词(AcousticTokens)由SoundStream(端到端神经音频编解码器)结构和残差向量量化器(RVQ)生成,实现高质量的音频合成。语义分词(SemanticTokens)源自W2v-BERT中间层生成的表示,使用K-Means聚类得到一组离散分词,实现长期结构一致性。工作流程:先生成语义分词,再在这些语义分词的基础上生成声学分词,以确保最终音频的连贯性和质量。应用领域●音乐生成:创作新的音乐作品●语音合成:生成自然、流畅的人类语音●媒体、游戏或虚拟环境的音频内容●辅助技术:为语言障碍者生成自然流畅的语音挑战与展望●确保生成的音频具有高质量和连贯性●培训和生成需要大量计算资源,可能限制可访问性●AI生成音频领域正迅速发展,未来会有更复杂、实用的应用落地6/8711.1.2PaLM:六项改进(一)PaLM是谷歌2022年提出的5400亿参数规模的大语言模型,利用Pathways(路径)架构,使用Transformer解码器架构,但做了以下修改。式(11.1)(1)采用SwiGLU激活函数,提供更好的性能和梯度流动性;其中⊙表示逐元素乘法,Swish是逐元素非线性激活函数式(11.2)(2)传统Transformer块中多层感知机和注意力机制串行计算的标准公式式(11.3)并行层(ParallelLayers):多层感知机和注意力机制并行计算,速度提高约15%在80亿参数规模的削减实验中PaLM有轻微质量下降,但在620亿参数规模时没有质量损失,因此可以推断在5400亿参数规模时使用并行层不会影响模型质量。7/8711.1.2PaLM:六项改进(二)式(11.4)(4)位置嵌入使用旋转位置编码(RoPE),在长文本上性能更好;R为旋转嵌入矩阵(3)共享键/查询的映射多查询注意力机制中,键/值投影对每个头共享(投影到[h]形状),查询仍投影到[k,h]。对模型质量影响较小,但显著提升训练速度,自回归解码时也能显著节省成本。(5)共享输入输出嵌入输入、输出嵌入矩阵共享,让输入和输出共享语义信息,表示更加一致和相互关联,使模型更好地理解输入与输出之间的语义关系。(6)不使用偏置在密集内核(DenseKernel)或层归一化(LayerNormalization)中都没有使用偏置,提高了大模型的训练稳定性。8/8711.1.2PaLM:Pathways架构与PaLM2PaLM利用

Pathways架构开发。该架构专为高效地在成千上万的加速器芯片上训练大型神经网络而设计,包括跨多个TPUv4Pod分布的网络。跨设备扩展性允许跨越多个硬件单元进行训练,不仅提高训练速度,也提高模型处理复杂任务的能力,是处理多任务学习和大数据集的关键。少样本学习能力在多个自然语言处理、代码理解和数学推理任务上取得突破性表现,可以使用很少的样本快速适应和解决新任务。PaLM2:更新了模型架构和训练目标,改进数据集混合方式并使用计算优化缩放技术,比PaLM参数量更小但效率更高——更快的推理、更少的服务参数和更低的服务成本;擅长代码和数学、分类和问答、翻译和自然语言生成。9/8711.1.3LLaMA:模型版本与训练数据LLaMA是Meta发布的开放且高效的语言模型系列,包含70亿(7B)、130亿(13B)、330亿(33B)和650亿(65B)四个版本,全部基于公开数据集训练,训练数据如表11.1所示。标记化处理后整个训练数据集约含1.4万亿(1.4T)个标记。表11.1LLaMA训练数据数据集样本比例轮次所占磁盘大小CommonCrawl67.0%1.103.3TBC415.0%1.06783GBGithub4.5%0.64328GBWikipedia4.5%2.4583GBBooksCorpus4.5%2.2385GBArXiv2.5%1.0692GBStackExchange2.0%1.0378GB具有130亿参数的LLaMA在多数基准测试中超过GPT-3,并能在单个V100GPU上运行;650亿参数的LLaMA可与Chinchilla-70B和PaLM-540B相媲美。10/8711.1.3LLaMA:架构修改与RMSNormLLaMA也基于自监督训练方法,利用Transformer架构并进行若干修改。(1)预标准化将层归一化应用于子层的输入而非输出;RMSNorm表示均方根归一化。(2)SwiGLU激活函数标准ReLU非线性激活函数被带门控激活函数SwiGLU取代。(3)旋转位置编码网络每一层中,绝对位置嵌入被旋转位置编码替代。式(11.5)①计算输入向量的均值式(11.6)②计算输入向量的均方根式(11.7)③对每个元素进行标准化,其中1≤i≤n11/8711.1.3LLaMA2:分组查询注意力(GQA)2023年7月Meta开源了LLaMA2,参数规模有7B/13B/70B三种,其中700亿参数模型使用了分组查询注意力(Grouped-QueryAttention,GQA)机制。标准自注意力对每一对元素执行操作,时间和空间复杂度都是序列长度的平方级别O(n²)。式(11.8)标准自注意力机制计算,Q、K、V是输入序列X经不同线性变换得到的查询、键和值矩阵式(11.9)GQA将查询Q分成g组,每组只与所有键K计算注意力得分,减少必须计算的注意力得分数量效果:每个查询只与部分键计算注意力,降低了计算复杂度,使模型能够更高效地处理长序列,总体上提供了在保持模型性能的同时提高效率的方法。12/8711.1.3LLaMA2-Chat:微调与训练过程LLaMA2-Chat是LLaMA2的微调版本,针对对话用例进行优化。微调过程包括以下三方面。①监督微调使用人类标注的数据对模型进行初步的精调。②安全奖励模型通过收集人类偏好数据构建安全和帮助性的奖励模型。③强化学习使用RLHF方法(拒绝采样和PPO)迭代细化,并应用幽灵注意力(GAtt)机制控制多回合对话的连贯性。图11.2LLaMA2-Chat的训练过程LLaMA2-Chat通过自监督学习完成预训练,再通过监督式精调和RLHF优化,在对话用例中表现出色,成为开源模型的一个强有力的竞争者。13/8711.1.4GLM:自回归空白填充GLM采用自回归空白填充(AutoregressiveBlankInfilling)预训练技术:在文本中插入空白标记,模型以自回归方式预测空白处的原始文本内容,结合了自回归语言建模与掩码语言建模。主要步骤:①

插入空白;②

上下文编码;③

自回归预测。式(11.10)预训练目标:Z_m是长度为m的索引序列的所有可能置换集合,E表示数学期望式(11.11)生成一个片段s_z的概率分解14/8711.1.4GLM:预训练过程与五项修改图11.3GLM模型的自回归空白填充预训练过程GLM采用了Transformer架构并做关键修改:(1)层归一化和残差连接顺序重新排列;(2)输出标记预测使用单个线性层;(3)ReLU被替换为GELU;(4)引入二维位置编码;(5)使用自注意力机制与掩码。式(11.12)层归一化与残差连接重新排列式(11.13)单个线性层预测输出标记,h_n为最终隐藏状态,W_o为输出层权重矩阵,b_o为偏置式(11.14)二维位置编码:e_pos1为受损文本中的位置嵌入,e_pos2为跨度内部位置的嵌入15/8711.1.5腾讯混元大模型腾讯混元大模型是由腾讯公司研发的大语言模型,具有在复杂语境下的逻辑推理能力以及可靠的任务执行能力。●多轮对话:具备上下文理解和长文记忆能力,流畅完成各专业领域的多轮问答●内容创作:支持文学创作、文本摘要、角色扮演,流畅、规范、中立、客观●逻辑推理:准确理解用户意图,基于输入数据或信息进行推理、分析●知识增强:有效解决事实性、时效性问题,显著提升内容生成效果图11.4混元助手用户互动界面图11.5混元助手生成图片界面混元助手提供“创建指令”与图片生成功能;“清除上下文关联”按钮可避免误导、保护隐私、提高效率,但可能导致理解不准确、对话不连贯。16/8711.1.6DeepSeek:系列发展DeepSeek(深度求索)是杭州深度求索公司研发的开源大语言模型系列,核心目标是通过技术创新实现高性能与低成本的平衡。●DeepSeekLLM(2023.11):分组查询注意力、多步学习速率调度器,67B性能超越LLaMA270B●DeepSeekMoE(2024.1):细粒度专家分割与共享专家隔离,16B可单卡部署●DeepSeek-V2(2024.5):多头潜在注意力MLA、YaRN扩展上下文窗口●DeepSeek-V3(2024.12):无辅助损失负载均衡、FP8混合精度训练,成本仅同类1/3●DeepSeek-R1(2025.1):无需监督微调,推理性能对标OpenAI-o1图11.6DeepSeek系列模型发展17/8711.1.6DeepSeek-V3:整体构造DeepSeek-V3通过6710亿参数的动态稀疏激活设计,在保持顶尖性能(数学/代码任务超越GPT-4)的同时将推理速度提升至传统稠密模型的3倍;结合FP8低精度计算与硬件协同技术,训练成本仅为同类模型的1/3,成为首个实现高性能、低成本、低能耗三重突破的开源大模型。图11.7所示为DeepSeek-V3中每层Transformer的基本构造,主要包括

MLA

DeepSeekMoE

机制以及RMSNorm。MLA:对Key和Value进行低秩联合压缩,推理时大幅减少键-值(KV)缓存的存储需求。DeepSeekMoE:更细粒度的专家划分,并将部分专家设置为共享专家,其余为路由专家。图11.7DeepSeek-V3的基本构造18/8711.1.6MLA:Key/Value低秩压缩用d_model表示嵌入维度,n_h表示注意力头数量,d_h表示每个头的维度,h_t表示第t个标记在某一注意力层的输入。MLA对Key和Value进行低秩联合压缩:式(11.15)通过降维投影矩阵W^DKV得到压缩后的键-值潜在向量式(11.16)通过升维投影矩阵W^UK还原为键的主分量并拆分为每个头的键式(11.17)利用另一投影矩阵W^KR和RoPE得到解耦的键分量式(11.18)每个头的键由主分量和解耦分量拼接而成式(11.19)值同样先通过升维投影矩阵W^UV得到主分量推理生成时只需缓存c^KV_t和k^R_t,极大减少KV缓存的存储量,同时保持与标准多头注意力(MHA)相当的性能。19/8711.1.6MLA:Query压缩与注意力输出对于Query,同样采用低秩压缩,具体步骤如下。式(11.20)通过降维矩阵W^DQ得到压缩后的Query潜在向量式(11.21)通过升维矩阵W^UQ得到Query主分量并拆分为每个头式(11.22)通过W^QR和RoPE得到解耦的Query分量式(11.23)每个头的Query由主分量和解耦分量拼接而成式(11.24)Query、Key、Value共同作用得到注意力输出式(11.25)经输出投影矩阵W^O得到最终输出20/8711.1.6DeepSeekMoE机制DeepSeek-V3在FFN部分采用DeepSeekMoE机制:更细粒度的专家划分,并将部分专家设置为共享专家,其余为路由专家——所有标记都能从共享专家中受益,提升泛化能力;路由专家通过动态分配增强表达能力与计算效率。式(11.26)第t个标记的FFN输出:N_s共享专家数、N_r路由专家数,g_{i,t}为门控值式(11.27)亲和度分数:e_i是第i个路由专家的中心向量,σ

为Sigmoid激活函数式(11.28)只选亲和度分数最高的K_r个路由专家参与计算,并对其门控值归一化“共享专家+路由专家”的组合既保证泛化能力,又通过动态路由提升表达能力和计算效率;细粒度划分和门控归一化有效避免专家负载不均。21/87AI11.2视觉基础模型11.2视觉基础模型视觉基础模型的兴起标志着机器视觉理解能力的重大突破。这些模型依托深度学习的强大功能,在图像识别、场景解析和目标分割等任务中取得了卓越成果,也为自动驾驶、遥感监测、医学影像等领域奠定了坚实基础。1ViT-22B谷歌最大的ViT模型,220亿参数,视觉感知力直逼人类。2SAMMeta发布的分割一切模型,可对图片或视频中的任意对象一键分割。3Painter及SegGPT智源研究院提出的视觉通用模型,以图像作为输入和输出。4SEEM处处分割一切模型,可通过提示进行交互式全方位分割。5LVM伯克利大学提出的大型视觉模型,在没有任何语言数据的情况下学习。本节要点理解各模型如何通过架构创新提升规模、泛化能力与交互性。23/8711.2.1ViT-22B:任务与核心技术ViT-22B包含

220亿参数,是对ViT模型的扩展,可执行图像分类、图像分割、单目深度估计、视频分类等任务。研究人员通过对原始Transformer架构进行微小且关键的修改,实现了更高的硬件利用率和训练稳定性。(a)图像分类(b)图像分割(c)单目深度估计图11.8ViT-22B的任务●①并行层设计:同时应用注意力和MLP●②QK归一化:稳定注意力对数概率●③修改偏置:提高硬件利用率3%●④异步并行线性运算:提高运算效率与训练稳定性24/8711.2.1ViT-22B:并行层设计ViT-22B在每个块中采用并行结构来同时应用注意力和MLP,而不是像标准Transformer那样依次执行这两个子模块。式(11.29)设x为该块的输入特征,首先通过层归一化得到归一化后的表示式(11.30)将同一个归一化表示y′同时送入MLP与Attention,并与残差连接相加通过结合注意力块和MLP的线性投影实现额外的并行化:自注意力中Q、K、V的矩阵乘法与MLP第1个线性层被融合到一个单独的操作中;自注意力输出投影与MLP第2个线性层也融合。该方法最初由PaLM提出,在不降低性能的情况下将最大模型的训练速度提高了

15%。图11.9ViT-22B的并行层设计25/8711.2.1ViT-22B:QK归一化与其他改进②QK归一化:在80亿参数模型训练中,注意力对数概率数值过大会引起不稳定(零熵注意力权重)。将层归一化应用于自注意力中Q和K的计算,防止训练发散。图11.10QK归一化对8B参数模型的影响③修改偏置从QKV投影中删除偏置,但对所有MLP层使用偏置,且所有层归一化中没有偏置和中心化,硬件利用率提高3%,质量没有下降。④异步并行线性运算一边在矩阵乘法单元中计算,一边对设备之间的激活和权值进行通信,最小化等待传入通信的时间,提高设备效率。(a)矩阵A跨设备按行分片(b)矩阵A跨设备按列分片图11.11异步并行线性运算(y=Ax)26/8711.2.2SAM:交互式分割Meta于2023年4月发布第一个具有提示能力的图像分割基础模型

SAM,能对图片或视频中的任意对象一键分割,并零样本迁移到其他任务;可根据文本提示词、关键点、边界框等多模态提示执行交互式分割与自动分割。(a)点交互分割(b)自动分割(c)不确定分割(d)文本提示分割图11.12SAM的交互式分割示例SAM也可以为视频中的任何物体生成掩码,并可从增强现实/虚拟现实设备获取用户的注视以选择对象。27/8711.2.2SAM:项目交互体验流程SAM项目交互体验不需要注册账号,整体流程如下。图11.13选择图片图11.14选择交互方式图11.15Everything:自动分割所有目标图11.16Cut-Outs:结果提取●①选择图片:支持数据库图片与用户上传两种方式●②选择交互方式:Hover&Click、Box、Everything、Cut-Outs●③Everything:自动分割图片中的所有目标●④Cut-Outs:在图片上右键“将图片另存为”提取结果28/8711.2.2SAM:总体架构与三个组件SAM在SA-1B数据集上训练。其总体架构包含三个组件,协同工作以返回有效的分割掩码。图11.17SAM的总体架构图像编码器使用MAE预训练的ViT(ViT-H/16),生成一次性图像嵌入;1024×1024输入分辨率,输出为输入图像1/16的编码。提示编码器将背景点、掩码、边界框或文本实时编码嵌入:稀疏提示(点、框、文本)映射为256维向量;文本使用CLIP文本编码器。轻量级掩码解码器根据图像与提示编码器的嵌入向量预测分割掩码,使用提示自注意和交叉注意力机制。29/8711.2.2SAM:SA-1B数据集与局限SA-1B由Meta发布,由

1100万张多样化、高分辨率、保护隐私的图像及

11亿个高质量分割掩码组成。①数据具有多样性涵盖自然场景、城市环境、医学影像、卫星图像等广泛领域,确保模型泛化到不同任务。②数据规模大1100万张高质量注释图像,为模型提供充足的训练数据,学习复杂的模式和表示。③高质量的注释RAI分析调查了公平问题;包含至少2800万个掩码,是之前任何数据集掩码总数的10倍。局限●使用大图像编码器时整体性能并非实时●文本-掩码任务的尝试是探索性的,不完全稳健●如何设计简单提示实现语义和全景分割尚不清楚●一些特定领域工具在各自领域中优于SAM开源价值●激发计算机视觉的进一步研究和开发●成为增强现实(AR)、虚拟现实(VR)、内容创建、科学领域和更通用AI系统的强大组件30/8711.2.3Painter:以图像为中心的通用模型北京智源人工智能研究院提出

Painter:利用图像本身作为输入和输出,通过少量提示和示例进行上下文学习。传统视觉任务(深度估计、语义分割、实例分割、关键点检测、图像恢复)被重构成图像填充问题,任务输出仍定义在图像空间,每个输出像素与输入图像像素对应,但用RGB空间表示。Painter采取掩码图像建模(MIM)训练:训练样本由同一任务的两对图像拼接而成,在任务输出图像中随机选择区域进行掩码,模型预测掩码区域中缺失的像素,采用块状掩码策略,用可学习的标记向量替换每个掩码补丁。模型架构:标准的ViT,由多个Transformer块组成;损失函数使用平滑损失,在掩码像素上计算。图11.18Painter模型训练过程31/8711.2.3SegGPT:上下文着色在Painter基础上提出的通用视觉分割大模型

SegGPT:Painter中每个任务的颜色空间预先定义,可能使模型过度依赖多任务学习方案。SegGPT采用创新的上下文着色技术,通过在类似上下文中随机映射颜色,使模型能够从更广泛的上下文信息中学习。①随机选择上下文随机选择与输入图像具有相似上下文的图像。②随机颜色映射从该图像中随机选取一组颜色并随机映射到新颜色,产生两组上下文对。③混合上下文训练将共享相同颜色映射的图像拼接,通过随机裁剪和调整大小生成训练样本。SegGPT为不同数据类型定义多样化上下文环境:语义分割中随机选取类别、实例分割中随机确定目标实例数量。训练后能够通过上下文推断执行图像或视频的任何分割任务,在少样本语义分割、视频目标分割、语义分割和全景分割等任务上表现出色。32/8711.2.4SEEM:全方位交互式分割SEEM(SegmentEverythingEverywhereModel)是一个可通过提示进行交互的模型,用于在图像中全方位地进行分割。它将所有空间查询编码成视觉提示,文本查询转换成文本提示,通过交叉注意力促进协同,预训练后在所有分割任务中都取得富有竞争力的性能。图11.19生成分割蒙版和类别标签图11.20根据文字生成分割蒙版图11.21根据参考图片生成分割蒙版●单击/滑动:生成分割蒙版及对应类别标签(cheetah、building)●文本提示:输入“blackdog”输出黑狗的分割蒙版●参考图片:单击参考图中的目标,自动分割其他图片中相似语义对象●视频蒙版:无需对视频数据训练即可按查询分割视频33/8711.2.4SEEM:四大设计特点图11.22视频蒙版示例图11.23SEEM解码器模型示意多功能性处理所有非文本输入(点、框、涂鸦等区域);视觉采样器将所有类型非文本查询转换为同一视觉嵌入空间中的视觉提示。组合性支持无提示、单一类型或视觉与文本提示组合;通过将视觉提示与文本提示分别与掩码嵌入或类嵌入匹配来缓解嵌入空间差异。交互性提出记忆提示(MemoryPrompts)传递前一次迭代的掩码知识,通过掩码引导的交叉注意力层编码历史信息,实现多轮交互细化。语义感知性不仅识别物体边界,还能理解和标注语义信息;在零样本情况下根据提示组合生成与掩码对应的语义标签。34/8711.2.5LVM:纯视觉序列建模LVM(LargeVisionModel)是一个新颖的序列建模方法,能够在没有任何语言数据的情况下学习,将多样的视觉数据(含4200亿个标记)表示为序列,训练模型最小化交叉熵损失以预测下一个标记。●①图像标记化:用VQGAN将图像转换为视觉标记序列●②视觉句子的生成:将多个图像的离散标记串联成一维序列●③自回归Transformer:用交叉熵损失预测下一个标记●④应用于下游任务:测试时构建部分视觉句子并生成输出LVM在没有明确任务指示的情况下,通过观察和学习视觉数据的上下文信息生成新的视觉内容。图11.24LVM训练方法和架构示意(EOS为结束标记,BOS为开始标记)35/87AI11.3多模态基础模型11.3多模态基础模型在多模态理解领域,基础模型的兴起标志着人工智能技术的跨越式进步。这些模型融合了先进的视觉与语言处理能力,能够理解和生成图像、文本、语音等多种信息形式,显著提升了机器对复杂场景的理解和创造能力。●CLIP:对比语言-图像预训练(OpenAI,2021)●GLIP:基于语言-图像预训练的目标检测(微软,2022)●VisualChatGPT:集成多种视觉基础模型的对话系统(微软亚研,2023)●Gemini:谷歌多模态大模型(2023)●ImageBind:7种模态联合嵌入(Meta,2023)●文心大模型:百度推出的多系列大模型●通义千问:阿里云发布的大语言模型(2023)●讯飞星火认知大模型:科大讯飞以中文为核心的认知智能大模型●Sora:文本生成视频的大模型(OpenAI,2024)在这些多模态基础模型的推动下,人工智能技术正快速渗透医疗、教育、内容创作等领域,开启了人工智能与生活深度融合的新纪元。37/8711.3.1CLIP:对比语言-图像预训练CLIP是OpenAI于2021年开发的多模态大模型,通过对图像和文本数据的联合预训练来理解和关联视觉内容与自然语言。核心是对图像和文本嵌入空间进行对比学习,联合训练一个图像编码器和一个文本编码器来预测一批(图像,文本)正确配对。式(11.31)对比损失函数:N是批次大小,τ

是温度参数,v_i·t_i表示第i个图像和文本对的特征向量的点积图11.25CLIP模型流程38/8711.3.1CLIP:零样本预测由于其训练方式,CLIP能够在没有额外微调的情况下(即零样本学习)在多种视觉任务上表现出色。在测试时,CLIP使用学习到的文本编码器生成零样本线性分类器。零样本预测包括以下两步。1构建类别描述文本根据任务的分类标签构建每个类别的描述文本,送入预训练的文本编码器得到对应的文本特征;若类别数目为N,则得到N个文本特征。2计算缩放余弦相似度将要预测的图像送入预训练的图像编码器得到图像特征,与N个文本特征计算缩放的余弦相似度,选择相似度最大的文本对应类别作为预测结果;相似度可看成逻辑值,送入Softmax得到每个类别的预测概率。CLIP模型对图像和文本特征空间进行联合预训练,并利用对比学习在这两种模态之间建立联系,从而获得理解和关联视觉内容与自然语言描述的能力。39/8711.3.2GLIP:目标检测的短语定位GLIP(GroundLanguage-ImagePre-Training,微软2022)创造性地将目标检测任务转换为短语定位任务:把标签用句号隔开拼接成一句话,使所有目标检测数据集都转化为短语定位数据集。每个区域/框不是分类到c个类别中,而是与文本提示中的c个短语进行对齐。式(11.32)对齐分数计算:O为区域特征向量,P为单词特征向量,Enc_I与Enc_L分别为图像与语言编码器式(11.33)深度融合编码器:跨模态通信通过跨模态多头注意力(X-MHA)模块实现,随后在单模态融合中更新图11.26GLIP模型流程40/8711.3.3VisualChatGPT:系统架构VisualChatGPT(微软亚洲研究院,2023.3)在ChatGPT基础上集成多种视觉基础模型(VFMs),实现多模态交互。它可以接收和发送文本和图像;提供复杂视觉问答或视觉编辑指令;具有提供反馈、总结答案、纠正结果、主动询问模糊指令等功能。图11.27VisualChatGPT的系统架构图11.28VisualChatGPT多轮对话系统架构由用户查询、提示管理器(PromptManager)、视觉基础模型、调用ChatGPTAPI系统和推理模块、用户输出模块构成。41/8711.3.3VisualChatGPT:数学表达与挑战对于由多个问题-答案对构成的集合,要从第i轮对话中得到答案,需要经过一系列VFMs和中间输出。式(11.34)VisualChatGPT的数学表达式:P系统原理、F视觉基础模型、M(H)对话历史、M(Q)用户输入、M(R)推理历史①依赖ChatGPT及视觉基础模型性能在很大程度上受到这些模型的准确性和有效性的影响。②需要大量提示信息需要用户提供大量提示信息才能将VFMs转换为语言并使这些模型描述可区分。③实时能力有限可能调用多个VFMs,与特定任务中的专家模型相比实时能力有限。④词向量长度限制最大词向量长度可能限制可以使用的基础视觉模型的数量。⑤安全和隐私移植性较强可能会引发安全和隐私问题,尤其是对于通过API访问的远程模型。意义扩展了聊天机器人的输入和输出范围,可以处理文本和图像信息,并根据用户需求生成相应格式的回复。42/8711.3.4Gemini:三种模型尺寸谷歌2023年10月发布多模态大模型

Gemini(预览版),具有跨文本、图像、视频、音频多种模态和代码处理的能力。系列模型建立在Transformer解码器基础上,支持32000参数的上下文长度,采用多查询注意力等有效注意力机制。Ultra性能较强,能在广泛的高复杂性任务中提供较先进的性能;在32项学术基准中有30项超过同期最先进水平。Pro在成本和延迟方面进行了性能优化,在广泛任务中提供良好性能,展现强大的推理性能和广泛的多模态能力。Nano设计用于在设备上运行的最高效模型,有1.8B的Nano-1和3.25B的Nano-2两个版本。图11.29Gemini模型流程示意43/8711.3.4Gemini:多模态能力与1.5Pro图11.30根据视频生成代码图11.31根据图片和问题生成文本和图像图11.32根据视频和问题生成文本描述Gemini1.5建立在谷歌对Transformer和MoE架构的领先研究之上,MoE模型学会有选择性地仅激活其神经网络中最相关的专家路径。Gemini1.5Pro

的核心功能:●①基于先进架构:Transformer+MoE,按输入类型自动选择最相关的专家路径●②扩展的上下文窗口:标准128000个标记,最多处理高达1百万个标记●③高度复杂的信息处理能力:处理、分析和总结大量文本、代码、视频和音频数据●④跨模态理解和推理:准确分析视频内容、解析大量代码并识别细节和模式44/8711.3.5ImageBind:联合嵌入空间ImageBind(图像绑定)是Meta于2023年5月推出的创新模型,旨在学习

7种模态(图像、视频、文本、音频、深度图、热力图和IMU数据)之间的联合嵌入。研究表明并不需要所有配对数据的组合来训练这样的联合嵌入,与图像配对的数据足够将这些模态联系起来。式(11.35)InfoNCE损失:τ

为温度标量,j表示不相关的观测值(负样本),将嵌入q_i和k_i在联合嵌入空间中拉近图11.33ImageBind模型处理多模态数据45/8711.3.5ImageBind:应用示例●①使用图像检索音频:在海滩图像上添加海浪的声音●②使用音频检索图像:从鸟叫声录音输出鸟可能的外观图像●③使用文本检索图像和音频:检索与文本相关的图像和音频剪辑●④音频和图像检索图像:检索与视觉和听觉元素都相关的图像●⑤使用音频生成图像:与其他生成模型结合,从雨声生成下雨场景图11.34ImageBind模型官方演示示例图11.35ImageBind模型音频生成图像示例即使只使用与图像配对的形式(I,M1)和(I,M2)训练网络,嵌入空间中也会出现将两对模态(M1,M2)对齐的新颖行为,使模型能够执行各种零样本和跨模态检索任务。46/8711.3.6文心大模型与文心一言百度推出的文心大模型已衍生出NLP、视觉、跨模态、生物计算及行业大模型等多个系列,以飞桨(PaddlePaddle)深度学习平台为基石。文心一言于2023年3月发布,具备文学创作、商业文案创作、数理逻辑推算、中文理解、多模态图片生成五大能力。图11.36文心大模型的界面图11.38ERNIE3.0Zeus预训练框架ERNIE3.0将自回归网络和自编码网络融合进行预训练并引入大规模知识图谱类数据;ERNIE3.0Zeus提出层次化提示学习技术,通过层次化的文本提示库与软提示建模不同任务之间的共性与特性。47/87图11.37ERNIE3.0多范式统一预训练框架11.3.6文心一言:交互与插件图11.39文心一言界面图11.40文心一言图片分析图11.41文心一言图片风格转换图11.42文心大模型系列●知识增强:知识内化(将知识学习到模型参数中)与知识外用(引入外部多源异构知识)●其他技术:有监督精调、RLHF、提示学习、检索增强和对话增强48/8711.3.7通义千问通义千问由阿里云在2023年4月11日的阿里云峰会上正式发布;2023年11月发布2.0版本,参数规模跃升至千亿级别。支持文本问答、图片理解及文档解析(支持PDF格式)三种互动方式,也可建立多轮对话。图11.43通义千问项目界面图11.44通义千问界面图11.45通义千问图片分析●Qwen-7B:在超过2.2万亿个标记上预训练,上下文长度2048,架构类似LLaMA●Qwen-VL:扩展Qwen-7B的视觉能力;Qwen-VL-Chat支持多图像输入、多轮对话和定位能力49/8711.3.7Qwen-VL:特点与训练①强大的性能在零样本字幕、VQA、DocVQA和定位等任务上性能优越。②文本识别和定位自然支持英语、汉语等多语言对话,推动中英双语文本及图像中的实例端到端识别和定位。③多图像交错对话允许输入和比较多个图像,以及指定与图像相关的问题并实现多图像讲故事。④细粒度识别和理解首个开源的448×448分辨率的LVLM模型(其他开源LVLM使用224×224),提升细粒度文字识别能力。网络架构:视觉编码器(19亿参数)+视觉语言适配器(0.8亿)+大语言模型(77亿,采用Qwen-7B)。适配器:单层交叉注意力模块将图像特征压缩到固定长度256,并将二维绝对位置编码融入注意力以保留位置细节。训练由三个阶段组成:两个预训练阶段(大规模弱标记图像-文本对→高质量细粒度VL注释数据)和一个指令微调阶段,得到交互式的Qwen-VL-Chat模型。50/8711.3.8讯飞星火认知大模型讯飞星火认知大模型是科大讯飞推出的以中文为核心的新一代认知智能大模型,通过对海量文本、代码和知识的学习,具备跨领域、多任务、类人的理解和生成能力,支持文本问答、图片理解及语音问答三种互动方式,并包含智能PPT生成、内容运营大师等内置插件。图11.46讯飞星火认知大模型界面图11.47“指令优化”功能“指令优化”功能:当用户输入“请帮我写一个菜谱”并单击“指令优化”按钮时,大模型会自动补充菜品名称、原材料清单、烹饪步骤、搭配建议等细节,使提问内容更精确,从而得到更符合预期的答案。图11.48模型回复与语音输出51/8711.3.8讯飞星火:图文交互与开源模型图11.49图片上传界面图11.50图文交互界面当用户输入雪景图片与“请帮我描述这张图片”文本时,相对于文心一言和通义千问的回答,讯飞星火认知大模型的图片分析较为简短而且比较准确。iFlytekSpark-13B:科大讯飞开源的模型,拥有130亿参数,基于Transformer架构,不仅具备聊天、问答、文本提取和分类等通用任务处理能力,还具备数据分析和代码生成等功能;团队在学习辅助、数学、推理等领域进行了深度优化。52/8711.3.9Sora:文本生成视频大模型OpenAI于2024年2月16日发布文本生成视频的大模型

Sora,能根据文本描述生成长达60秒的高清视频。Sora将原始视频视觉编码到潜在空间形成潜在时空图像块,运用扩散Transformer训练和生成,再将生成的潜在时空图像块视觉解码到像素空间。图11.51Sora将视觉数据转换为视觉块图11.52Sora预测原始的“干净”块●①视觉数据转换为图像块:利用视觉编码器将视频压缩到低维潜在空间●②视频压缩网络:输出在时间和空间上都被压缩的潜在表示●③潜在空间时空编码块:编码块充当变换器标记,图像可看作单帧视频●④扩展Transformers用于视频生成:扩散Transformer随训练计算增加显著提升质量53/8711.3.9Sora:优势与局限与传统视频生成模型相比,Sora在以下方面展现出显著优势。①多模态输入能理解和处理文本、图片和视频提示。②时空统一表示将视频分解为时空图像块,同一框架处理不同分辨率、时长和宽高比。③涌现能力生成具有连贯三维空间运动的视频,模拟物体间的物理交互。④采样灵活性支持宽屏1920×1080、竖屏1080×1920及之间所有格式。⑤语言理解与提示采用DALL-E3的重新标注技术;支持文本、图片与视频等多种输入提示。局限并未准确模拟许多基本互动的物理效应(如玻璃破碎);长时间样本中可能出现不连贯性或物体的自发出现。Sora通过将视频和图像数据转换为标准化的块表示,充分发挥Transformer架构和扩散模型的优势,为构建通用的物理世界模拟器提供了一条颇具前景的技术路径。54/87AI11.4生物医学基础模型11.4生物医学基础模型生物医学基础模型代表了人工智能在生物医学领域的重要突破,部分生物医学基础模型的信息如表11.2所示。AlphaFold模型以其革命性的蛋白质结构预测能力,极大地推动了药物研发和生命科学研究的进展。Geneformer模型通过融合基因组信息与多层次生物数据,实现了对基因功能的精准预测。Med-PaLM2模型则专注于个性化医疗,为药物剂量调整提供了科学依据。RadFM模型在医学影像分析领域带来了显著的提升,助力疾病诊断与治疗方案优化。最后,尽管GPT-4在生物医学文献分析和信息提取方面表现突出,但本节将主要聚焦于除GPT-4以外的其他模型。这些生物医学大模型的广泛应用,正推动着生物医学研究与临床实践迈向新的高度。表11.2部分生物医学基础模型名称开发团队性质特点AlphaFold谷歌被训练来执行两个任务:预测蛋白质的3D结构和预测蛋白质的相互作用,提供了在线访问渠道,显示出在蛋白质结构预测领域取得的显著突破RadFM上海交通大学、上海AI实验室开源的多模态基础模型,支持2D/3D放射影像(如CT、MRI等),以及图像/文本混合输入。可以进行模态识别、疾病诊断、医疗问答、报告生成和归因分析Geneformer美国多家机构用于疾病候选靶点预测、解释拷贝数目变异(CNV)、基因网络连接、基因网络层次编码、染色质动力学预测等计算生物学领域Med-PaLM2谷歌协助医疗保健专业人员诊断,构建“医生级”专业医疗问题。可以传递多模态信息,如胸部X射线、乳腺X射线检查等图像中的信息,也可用于皮肤病学、病理学、健康记录和基因组学GPT-4OpenAI具备处理专业生物文件格式(如FASTQ等)的能力,擅长生物信息学分析,如信号肽预测;对各种生物学主题有广泛理解,还具备根据生物学观察推理出机制的能力56/8711.4.1AlphaFold:蛋白质结构预测AlphaFold模型是一款由谷歌开发的蛋白质结构预测软件。2018年,AlphaFold模型在第13届蛋白质结构预测关键评估(CASP13)中获得了第一名,在2020年CASP14中再次获得了第一名,其准确性远远超过了之前的其他模型。AlphaFold是一种深度学习模型,它使用了一种称为多任务学习的方法,被训练来执行两个任务,分别是预测蛋白质的结构和预测蛋白质的相互作用。这两项任务相互关联,可以帮助模型更好地理解蛋白质的结构。AlphaFold的训练数据集包括来自实验测量的蛋白质结构。DeepMind团队使用AlphaFold预测了人类蛋白组的结构。此外常见的模式生物如小鼠、斑马鱼,植物中的水稻、拟南芥,微生物如大肠杆菌等的蛋白组都被预测过了。(a)蛋白质结构搜索查询(b)预测的3D结构及对齐误差图11.53AlphaFold模型进行蛋白质结构搜索的过程AlphaFold模型也在Colab平台提供了在线使用的代码接口,进入Colab平台界面后,只需要输入想预测的蛋白质序列和项目名称,然后运行代码即可在线得到蛋白质的结构图。57/8711.4.1AlphaFold:模型架构与表现AlphaFold模型架构和表现如图11.54所示。模型将蛋白质的主要氨基酸序列和同源蛋白质的序列(来自基因数据库搜索和多重序列比对)作为输入,还利用结构数据库搜索将已知结构纳入预测过程。进化形体(Evoformer)块处理输入,创建两个表示多重序列比对(MSA)和残基对的数组,包含基于注意力和其他组件的混合,使网络能够推理蛋白质序列内的空间和进化关系。结构模块引入明确的3D结构,以每个残基的全局刚体坐标系的旋转和平移的形式呈现;它从一个简单的初始化开始,然后迭代地细化,以开发出精确的原子级结构。迭代细化的概念是AlphaFold模型设计的核心,最终的损失反复应用于输出,然后递归地反馈到网络中进行进一步的细化。图11.54AlphaFold模型架构和表现AlphaFold模型的架构利用注意力机制,使网络能够集中关注MSA和残基对的特定部分,从而有助于模型基于空间信息进行蛋白质折叠的预测。这个组件帮助网络隐含地考虑到没有明确表示的侧链原子的位置。网络输出蛋白质的预测3D结构,以及属性和置信度水平的分布,提供了对蛋白质预测构象的全面概述;模型直接从输入数据中预测蛋白质中所有重原子的3D坐标,并通过其网络架构迭代地细化这些预测,还为每个预测残基的位置提供置信度度量。图11.54(a)~(d)分别提供了模型在CASP14数据集上的表现;CASP14靶标T1049(PDB6Y4F)预测结构和实验测量结构的对比;CASP14靶标T1056(PDB6YJ1)的锌离子结合位点预测;CASP靶标T1044(PDB6VR4)超大单链蛋白结构预测。可以看出AlphaFold模型的优势。58/8711.4.2GeneformerGeneformer模型是2023年发表在Nature(《自然》)杂志上的一项研究中提出的一种基于注意力的深度学习模型。它是转录组计算生物学领域的第一个大模型,可以通过迁移学习在有限数据的网络生物学中进行预测。它采用自注意力机制关注每个单细胞转录组中表达的基因,优化给定学习目标内的预测准确性。其架构允许对不同细胞类型、发育时间点或疾病状态下的网络动力学进行上下文特定预测。它在下游有限数据预测任务包括疾病候选靶点预测、解释CNV、关键基因网络调控因子、基因网络层次编码、染色质动力学预测上表现出经过实验验证的准确率,可以作为强有力的计算生物工具。具体而言,模型在名为

Genecorpus-30M

的庞大语料库上进行预训练,该语料库包含大约3000万个单细胞转录组,涵盖各种人类组织。这种预训练是自监督的,模型可以自己学习理解基因网络动态,而不需要带标记的数据;它通过使用掩码学习目标来实现,涉及隐藏部分数据并对其进行预测,类似于填充句子中缺失的单词。通过这个过程,模型将基因网络的分层结构编码到其注意力权重中。在预训练之后,模型的学习权重被复制到为特定任务量身定制的新模型中,这些新模型通过少量特定于任务的数据进行微调,微调层被添加到模型中,以使其适应特定的下游任务。图11.55Geneformer模型如图11.55(b)所示,Geneformer模型的架构包括多层Transformer编码器单元。每个单细胞转录组都被编码为一个秩值编码。输入大小为2048,嵌入维度为256,每层4个注意力头,前馈神经网络的隐层维度为512。它使用全密集的自注意力机制,允许其针对每个预测考虑整个输入序列。模型的输出包括上下文相关的基因和细胞编码、注意力权重和预测。59/8711.4.3Med-PaLM2Med-PaLM2模型是一款由谷歌开发的医疗大模型,是PaLM2模型的变体,专门用于医疗领域。它在3000亿参数的医学文本和代码数据集上进行预训练,能够执行多种医学任务,包括医学文本生成、医学问题回答(见图11.56)、医学实体识别及医学推理等任务。Med-PaLM2模型建立在PaLM2模型之上,而PaLM2本身是谷歌的PaLM的一个迭代版本。模型经历指令微调,使用MultiMedQA数据集的训练拆分,如MedQA、MedMCQA、HealthSearchQA、LiveQA和MedicationQA,使用经验确定的数据集混合比例,优化了适用于所有这些数据集的统一模型的性能。通过仅在多项选择问题上进行微调,研发人员还创建了Med-PaLM2模型的变体,在基准测试中显示出了改进的结果。模型的评估策略包括:①少样本提示,在最终输入之前向模型提供示例输入和输出,以帮助提高其性能;②思维链提示,每个少样本示例都与逐步推理一起增强,帮助模型更好地处理复杂的多步医学问题;③自一致性(Self-Consistency,SC),从模型中采样多个解释和答案,最终答案是出现频率最高的那个答案,这种策略利用了模型探索不同推理路径以收敛于最准确答案的能力。图11.56医学问题回答注意,Med-PaLM2模型具有集成细化(EnsembleRefinement,ER)策略。如图11.57所示,在ER中输入被引入模型,模型通过多个推理路径(推理1到N)处理输入,探索解决问题的不同途径;这些推理路径以某种形式进行聚合,然后再次输入Med-PaLM2模型,以获得最终精练的答案。图11.57ER策略示意60/8711.4.4RadFMRadFM模型是2023年发表在NatureCommunications(《自然通讯》)杂志上的一项研究中提出的一种基于注意力的深度学习模型。它是用于放射影像分析的第一个大模型,在约10亿张放射影像图像的大模型语料库上进行预训练,可以通过迁移学习在各种放射影像分析任务中进行预测。它采用自注意力机制,关注放射影像中的不同特征,整合了包括2D和3D医学扫描在内的多模态数据,用于解决各种放射学任务,在下游任务包括病灶分割、病灶检测、病理类型分类中表现出经过实验验证的准确率。(1)病灶分割可以用于自动分割放射影像中的病灶,帮助放射科医生更准确地诊断疾病。(2)病灶检测可以用于检测放射影像中的潜在病灶,帮助放射科医生更早地发现疾病。(3)病理类型分类可以用于分类放射影像中的病理类型,帮助放射科医生更准确地制订治疗方案。RadFM模型利用了一个大规模的医学多模态数据集

MedMD,包括1600万份2D和3D医学扫描;这个数据集首次包括了3D医学扫描,数据涵盖了广泛的放射学模态和各种解剖区域。其架构允许进行视觉条件生成预训练,可以处理与文本交错的视觉输入(包括2D和3D扫描),以生成放射学任务的响应。模型架构如图11.58(a)所示,包括视觉编码器和大语言模型两部分:视觉编码器称为

Perceiver,旨在对视觉扫描进行编码,然后与文本输入交错;大语言模型组件由一系列Transformer解码器块组成,用于处理交错的视觉和文本信息,以生成最终的输出文本。训练始于对MedMD数据集的预训练,随后在RadMD数据集(含300万份放射学扫描)上进行精细调整,如图11.58(b)所示。图11.58RadFM模型架构与训练阶段61/8711.4.5慧影:大规模多组学数据随着医疗数据的爆炸性增长及算力的显著提升,深度学习模型在医学影像分析、疾病诊断、治疗规划和患者监护等领域正发挥着日益重要的作用。大模型通过自动学习和提取图像中的关键特征,显著提升了病变区域识别与定位的精确性,从而为医学界提供了重要的技术支持。针对医学基础模型研究中数据集多样、模型验证成本高、实际应用落地困难等挑战性问题,西安电子科技大学人工智能学院IPIU(智能感知与图像理解教育部重点实验室)提出了医学影像智慧解译基础模型“慧影”,旨在打造覆盖全身多部位、多病种、多模态的智慧医学基础模型库。●①多种前沿基础模型结构:配备完整、可复现的训练范式,以及全面的预训练权重,为下游应用快速适配提供支持●②IPIU智慧医学基础模型库:涵盖超过50种基础模型结构、5大类核心训练范式,以及300余种覆盖全身不同部位、病种和模态的影像分析模块●③医学影像大模型实时诊疗系统:可有效辅助医生快速诊断病情,为智慧医疗的发展提供了坚实的基础●大规模多组学数据:以影像学数据为核心(占比80%),涵盖常见医学2D和3D影像的12种主要模态数据,按功能划分为多器官、脑部、病灶、血管和骨骼五大基础部分;数据来源于超过120个数据集,包含5.4万例3D影像和12万例2D影像此外,15%的数据为文本数据,主要包括影像文本的描述及诊断报告,进一步丰富了影像的语义信息;剩余5%的数据为专家知识数据,涵盖病患特征、形态学及流体力学参数等规则信息,提供了医学知识的结构化补充,从多维度提升了数据质量与医学模型的适配能力。62/87图11.59大规模多组学数据示例11.4.5慧影:基础模型库与辅助诊疗系统如图11.60所示,“慧影”模型构建了全国规模最大的医学分割通用多结构框架,系统性地覆盖了医学影像分割的全流程,包括影像预处理、前沿骨干模型矩阵、丰富的推理架构及标准化模型验证。该模型支持50余种基于CNN、Transformer、Mamba、LSTM和SAM等的医学骨干网络,模型参数量从1M(100万)到1.4B(14亿)不等,为研究者提供了多样化的模型选择与对比基准。图11.60智慧医学基础模型库针对医疗影像模态复杂、边缘模糊及数据量有限等实际挑战,“慧影”开发了一套高效的医学影像辅助诊疗系统。该系统结合了先进的智能算法与实际应用场景需求,不仅能够处理多种类型的医学影像数据,还能够准确定位并分析病灶信息。图11.61所示为“慧影”模型对胸腔图像的处理。通过实时诊断和辅助决策,该系统显著提高了诊疗效率和诊断准确性,优化了患者的就医体验。图11.61“慧影”模型对胸腔图像的处理系统的设计目标是推动智能医疗的发展,为医疗行业提供精准、高效的技术支持,助力医生从容应对复杂病例的诊断与治疗需求,进一步提升医疗行业的智能化水平。63/87AI11.5材料科学基础模型11.5材料科学基础模型材料科学基础模型代表了材料科学领域的前沿突破,涵盖了用于材料探索的图网络(GraphNetworksforMaterialsExploration,GNoME)、DARWIN(达尔文)及GPT-4等具有代表性的模型。这些模型融合了深度学习技术与材料科学的专业知识,极大地推动了新材料的发现与设计进程。凭借卓越的智能化能力和精准的预测性能,它们不仅加速了材料的性能优化和结构生成的效率,以及新材料发现与设计的进程,也为科研人员提供了强有力的辅助工具,支持材料知识问答和创新设计。通过本节内容的学习,读者将深入理解这些材料科学大模型的核心原理、关键技术及其在实际应用中的广泛价值,充分认识它们在推动材料科学研究与创新中的重要作用。GNoME谷歌DeepMind开发的AI工具,能够预测新材料的稳定性,已成功预测220万种晶体结构,其中38万种特性相对较稳定。用于分析稳定晶体和相关相图、实现静态GNN和预测原子间势能。DARWIN(达尔文)澳大利亚新南威尔士大学等合作推出,针对物理学、化学和材料科学应用的大模型套件,在开源LLaMA7B基础上构建,旨在通过人工智能驱动的自动化来增强和加速探索性的发现过程。65/8711.5.1GNoME谷歌旗下的DeepMind(深度思维)公司开发了全新AI工具GNoME模型,能够预测新材料的稳定性,大幅度提高了新材料发现的速度和效率。目前该模型已经成功预测了

220万种晶体结构。220万种晶体中,有38万种是特性相对较稳定的,有潜力成为未来变革性技术的材料,为超导体、电动汽车电池研发,以及超算供电等领域提供能源动力。GNoME模型用于分析稳定晶体和相关相图、实现静态GNN和预测原子间势能。如图11.62所示,GNoME模型利用主动学习来进行预测、验证和数据库增强的循环,以发现稳定的材料结构。图11.62GNoME模型流程示意(1)候选生成包括结构流程和成分流程:结构流程从现有晶体生成结构候选项,然后将候选项表示为图形;成分流程根据化学式生成候选项并表示为图形。(2)稳定性预测两个流程都使用GNN来预测生成候选项的稳定性,GNN经过训练可以理解并根据图形格式中的结构或成分来预测材料的性质。(3)能量计算和验证使用密度泛函理论(DFT)计算来验证候选项的预测稳定性,为材料提供能量模型,有助于确认或否定GNoME模型的预测。(4)数据库更新在验证后将结果添加到GNoME数据库中,数据库随着每次迭代而增长,可以改善模型的预测能力。(5)原子间势能和能量模型随着数据库的不断更新,模型可以提供更好的能量模型和原子间势能,这对准确预测新材料的性质至关重要。(6)主动学习循环该过程是循环的,来自DFT的新验证和计算数据用于进一步训练模型,提高其对下一轮候选生成和测试的预测准确性。66/8711.5.2DARWIN澳大利亚新南威尔士大学(UNSW)的人工智能研究所与澳大利亚国家计算基础设施和GreenDynamics(律动造物)合作,推出了DARWIN模型。这一专门针对物理学、化学和材料科学应用的大模型套件在开源

LLaMA7B(参数量是70亿)的基础上构建,已在多个科学任务中取得了最新的研究成果。DARWIN利用两个基础模型Vicuna-7B和LLaMA-7B进行了监督微调,开发了一个综合的训练流程,以在性能和成本效益之间取得平衡,包括构建三个模型:DARWIN-SIG、DARWIN-BASE和DARWIN-MDP。DARWIN-SIG科学指令生成模型:将完整的科学论文转化为问题-答案对用作训练指令,比LLM自动生成的数据更可信;通过“[TBC]”(继续)标记规避LLaMA固有的标记输入限制,使模型能够处理冗长的文本输入。DARWIN-BASE从SciQ数据集中创建基于知识的指令数据,生成问题-答案对;数据集中的答案包括正确选项,提供了坚实的支持,可用作背景知识输入或解释推理过程的支持。DARWIN-MDP执行科学问题和答案任务,还利用16个FAIR数据集生成额外指令以进一步微调DARWIN-BASE,可执行材料和设备预测(MDP)任务,如分类、回归和设计。图11.63DARWIN-MDP模型的分类应用图11.64DARWIN-MDP模型的回归应用图11.63所示为模型判别输入分子是否具有玻璃形成的特性;图11.64所示为DARWIN-MDP模型在回归过程中预测给定SMILES分子的溶解度。作为对比,LLM在回归任务中可能不会预测高度精确的实数,但通过在训练过程中采用四舍五入的值,它们仍然可以产生具有可接受准确性的预测。67/87AI11.6遥感解译基础模型11.6遥感解译基础模型遥感技术的进步标志着人类对地球系统洞察力的全新纪元,其中大模型正变得至关重要,以其卓越能力解读丰富的地球观测数据。本节我们将深入探讨包括西安电子科技大学的悟瞳:遥感大模型理论研究与应用框架、武汉大学的旋转多尺寸注意力(RVSA)遥感大模型、西北工业大学的SkyEyeGPT、阿里巴巴的AIE-SEG,以及盘古气象大模型在内的经典遥感大模型。悟瞳(RSFM)西安电子科技大学:遥感大模型理论研究与应用框架,集视觉、语言与多模态于一体,取得“一库解决万物”的应用成果。空天·灵眸(RVSA)武汉大学:面向遥感任务设计的大规模视觉基础模型,引入旋转多尺寸注意力机制处理任意朝向目标。SkyEyeGPT西北工业大学:为遥感视觉-语言理解专门设计的统一多模态大模型。AIE-SEG阿里巴巴:AI地球遥感分割基础模型,可快速提取“万物零样本”,识别近百种遥感地物。盘古气象大模型华为云:首个精度超过传统数值预报方法的大模型,比传统数值预报提速10000倍以上。共同价值这些遥感大模型不仅丰富了我们对地球多维复杂性的认识,还提升了对未来地球状态的预测能力。伴随着技术的演进和海量数据的蓄积,这些遥感大模型在环境监测、资源管理和地球科学的研究中扮演着日益重要的角色,对全球可持续发展与环境保护的贡献不可估量。69/8711.6.1悟瞳:RSFM框架针对当前遥感领域在感知、生成与解译方面存在的规范化基准缺乏、数据闭源等问题,西安电子科技大学人工智能学院IPIU开展了一系列具有创新性和实用性的研究,研发了遥感大模型“悟瞳”,其核心框架为遥感大模型理论研究与应用框架(RemoteSensingFoundationModel,RSFM)。RSFM是集视觉、语言与多模态于一体的框架,取得了“一库解决万物”的应

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论