版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第2章
大模型产品概述CONTENTS目录01
大模型产品概述02
人工智能的重要领域——自然语言处理03
大模型的特点04
大模型的优势CONTENTS目录05
大模型的不足06
大模型的飞速发展和趋势07
大模型产品在中国的发展08
总结与展望01大模型产品概述大模型热潮的兴起
ChatGPT引爆大模型时代2022年11月30日,ChatGPT横空出世,凭借强大的自然语言处理能力引发全球关注,标志着人工智能大模型热潮正式开启。
技术突破与产品爆发DeepSeek等模型的出现带来技术惊喜,推动大模型产品在功能和性能上实现爆发式突破,各类应用场景不断拓展。
中国的引领地位中国在人工智能赛道一直是引领者之一,在大模型竞争中,国内企业积极布局,推出众多具有竞争力的产品,展现出强劲的发展势头。学习目标
了解相关基础知识了解自然语言处理的起因、由来和主要技术,以及大模型的特点、优势和不足,构建对大模型的整体认知框架。
理解核心技术发展理解自然语言处理的发展历程和主流技术,把握大模型技术演进的脉络和关键节点。
掌握应用方法掌握大模型的发展历程和使用方式,能够将大模型应用于实际场景,发挥其在各领域的价值。02人工智能的重要领域——自然语言处理自然语言处理问题的由来核心假设:语言蕴含知识与认知人工智能领域假设世界知识和人类认知能力蕴含于人类语言中,这一强假设推动了自然语言处理的探索。三大关键问题的提出基于假设产生三个问题:能否对人类自然语言建模以表述语言本身、知识及认知能力;语言模型能否作为世界知识模型;语言模型是否具有人类认知与思考能力。语言模型构建的本质构建语言模型本质是对人脑的反向工程,通过观察人脑生成物(如语言、文字),训练人工神经网络模拟人脑功能,DeepSeek、豆包、文心一言等证明该路径可行。语言智能的探索历程20世纪50年代:符号规则阶段
通过人工设定规则,对数据应用规则模拟自然语言理解,是语言智能探索的早期尝试。统计机器学习阶段
在人工标注语料上进行特征工程,训练小模型,推动语言处理向数据驱动转变。神经网络阶段
利用神经网络在大量数据上训练,学习更灵活的模型,提升语言处理的适应性。2016年:预训练语言模型阶段
采用自监督方式,用大量语料训练模型,开启语言模型规模化发展的新篇章。2022年:超大规模语言模型阶段
模型规模大幅提升,出现诸多新能力,模型功能、泛化能力及任务求解能力显著增强。统计语言模型——大模型的基础
统计语言模型的本质从语言中自动学习统计模型,可计算一句话出现的概率,相较基于规则的方法有巨大进步。
存在的核心问题面临组合爆炸问题,当词和窗口增多时尤为明显;泛化性差,字词间缺乏关联;关键制约因素是数据算力不足,无法构建大规模统计模型。生成式语言模型
“文字接龙”核心任务通过预测句子中被盖住的最后一个词,在大量语料上训练以提升预测能力,实现词语和句子组合的准确预测。
注意力机制的突破解决长程上下文依赖问题,在提升准确率的同时控制计算量和模型大小,提高计算效率。
多层神经网络抽象的作用借助深度学习的层层抽象,学习高层语义,实现概念泛化,是技术上的重要进步。
海量数据与巨大算力的支撑在万亿级token上训练,依赖GPU等算力进展,技术、数据与算力的共同进步促成大模型的构建。掩码语言模型“完形填空”式训练方式以BERT模型为代表,通过随机遮掉句子中的词,让模型根据上下文猜测被遮词,经大量语料训练提高准确率。与生成式模型的核心区别掩码语言模型根据上下文猜测,生成式模型仅根据上文猜测;生成式模型因生成过程接近自然生成、大语料下仅看前文效果不差而胜出。技术路线的发展渊源掩码模型由Google开创,生成式模型由OpenAI推动,现代模型发展始于2013年Word2Vec,2017年Transformer架构成为大模型支撑性神经网络架构。中国大模型的技术路线
融合创新、实用优先的独特路径中国团队不简单追随Google掩码路线或OpenAI生成式路线,立足中文场景特性与产业需求,传承掩码模型语义理解优势,突破生成式模型应用边界,形成多技术路线并行格局。
掩码技术的本土化创新百度2019年推出ERNIE,以BERT双向理解能力为基础,提出“知识增强”掩码策略,设计三阶知识掩码体系,提升模型对真实世界语义关联的掌握,如回答知识密集型问题准确率较传统BERT提升40%以上。
与生成式模型的技术融合百度文心一言将ERNIE知识增强能力与生成式架构深度结合,实现“掩码理解+生成创作”双模协同,在医疗等场景表现出色,2023年IDC评测中文能力指标获满分,综合评分超越ChatGPT。
“基础研究+行业落地”双轮驱动华为盘古大模型构建“5+N+X”分层架构,保障行业数据理解精度并输出场景化解决方案;阿里通义千问优化中文生成流畅度,引入掩码预训练提升长文本理解能力,在C-EVAL中文基准测试中获最高分。中国大模型的技术路线
开放协同的生态优势百度、华为、阿里等开源模型,降低中小企业使用成本,依托自主框架实现全栈优化,提升推理速度和调用量,印证技术路线实用价值。03大模型的特点知识广博
海量训练数据支撑大模型通常在万亿级token的语料上训练,涵盖天文、地理、文学、代码等多领域知识,训练数据量远超人类一生所能接触的信息总量。
跨领域任务处理能力具备多领域知识应用能力,不仅能撰写各类文章,还可进行代码编写,实现从文本创作到技术开发的跨场景任务支持。有条有理
知识整合与任务执行区别于传统大数据模型难以整合知识的局限,大模型能将广泛知识融会贯通,针对具体问题形成系统性答案,实现知识的有效利用。
推理能力的展现通过训练,模型能理解上下文,进行逻辑推理,解决复杂问题,展现出一定的智能行为。
知识整合与任务执行单击此处添加项正文
知识整合与任务执行单击此处添加项正文04大模型的优势规模大
大模型的规模实现基础大模型通过大数据、大算力得以实现大规模参数。如GPT-3参数量达1750亿,训练一次消耗约1200万美元;DeepSeek-V3总参数6710亿,实际激活约370亿,采用MoE架构。
模型参数与人脑的对比模型参数可类比人脑神经元间的突触,人脑约有100万亿突触,大模型已达千亿级,GPT-4参数量1.8万亿,与人脑突触仅差两个数量级。
参数量增长带来的能力“涌现”随着模型参数量增长,人类认知中的很多能力会“涌现”出来。如阿里2025年11月发布的Qwen3系列高阶早期预览版参数量突破1万亿,蚂蚁百灵、KimiK2等模型参数量也达1万亿左右。思维链/逻辑训练
思维链思想的提出Google在2022年提出思维链(chainofthought)思想,即通过告诉模型思维的全过程,让其形成自己的思维链。训练到一定程度时,让其“一步步思考”就能激发模型的思维链。
代码能力培养模型逻辑性的猜想有一种猜想认为思维链能力来自代码能力,因为写程序解决问题需通过逻辑结构一步步完成,模型能学到这种思考过程。
模型逻辑训练的作用逻辑训练可让模型具有逻辑性,能把知识组合起来完成复杂任务,提升模型在复杂问题处理上的表现。价值观对齐价值观对齐的定义价值观对齐指通过技术手段使大模型输出与人类伦理、文化及法律规范保持一致,解决其可能产生的歧视、虚假信息等风险。价值观对齐的重要性当大模型能力强大到一定程度时,若不对其进行价值观驯化而放任发展,会非常危险,可能带来不良社会影响。价值观对齐的实现方式OpenAI通过RLHF(基于人类反馈的强化学习),聘请人员进行数据标注实现价值观对齐;DeepSeek则通过混合专家架构和伦理审计实现中文文化适配,引导模型按人类价值观回答问题。05大模型的不足大模型的核心不足01知识更新滞后:高成本下的“信息时差”困境美国大模型单次完整预训练需消耗数千张A100显卡、数月时间,成本高达数十亿甚至上百亿美元,“重预训练、轻更新”模式导致模型无法实时纳入新知识,如2025年发布的某旗舰模型可能无法精准回答2024年下半年的行业政策调整等时效性问题,且全量重训成本高,增量微调易引发“灾难性遗忘”。02知识深度不足:“广博”与“专精”失衡大模型依托万亿级语料实现知识广度,但垂直领域深度挖掘能力不足,如医疗领域能列举常见疾病症状却无法结合患者既往病史、基因特征给出个性化诊疗建议,计算机编程领域能生成基础功能代码却难以应对大型项目的代码兼容性、架构优化等深层需求,根源在于预训练语料“泛而不精”及缺乏垂直领域结构化知识注入。大模型的核心不足推理能力薄弱:复杂任务中的“逻辑断点”大模型在简单因果判断或常识推理中表现尚可,在复杂逻辑推理(如法律条文解读、多条件决策)与数学问题(如高等代数、微积分运算)中常出现“逻辑跳跃”或“计算错误”,其“推理”本质是基于语料统计的概率预测,缺乏人类的“分步思考”与“错误修正”能力。模态单一与算力冗余:资源消耗与价值输出的错配早期大模型多局限于文本生成,无法直接处理图像、语音、视频等多模态信息,且纯文本任务算力消耗惊人,生成1000字文本可能需要消耗相当于一台普通计算机数小时的算力。工程化破局:技术路径与落地进展
知识更新:从“全量重训”到“增量学习”的成本革命通过LoRA、PrefixTuning等参数高效微调技术,仅训练少量新增参数实现知识更新,更新2024年行业数据仅需训练模型0.1%的参数,成本较全量重训降低99%以上;“检索增强生成(RAG)”技术让模型生成回答前先获取最新数据,更新延迟从“数月”缩短至“秒级”。
知识深化:垂直领域的“结构化赋能”方案采用“通用基座+领域微调”双层架构,通用预训练阶段引入“知识图谱”提升结构化知识理解能力,如将医疗领域“疾病—症状—药物”关联关系嵌入语料;领域适配阶段利用垂直行业高质量数据微调并结合“人类反馈强化学习(RLHF)”,国内某医疗大模型在肺结节影像诊断与病历解读任务中准确率接近副主任医师水平。工程化破局:技术路径与落地进展
推理增强:“分步思考”与“工具协同”的双重提升引入思维链(CoT)、思维树(ToT)等提示技术,引导模型拆解复杂问题逐步推理,数学竞赛题测试中准确率较传统方法提升40%以上;构建“模型+工具”协同体系,让模型调用计算器、代码解释器等外部工具,专注“任务规划”与“结果整合”,如企业财务报表分析中自动调用Excel插件提取数据、用计算器完成税率计算。
多模态与算力优化:从“重”到“轻”的落地突破多模态融合方面,GPT-4o、Gemini等模型通过“跨模态注意力机制”实现文本、图像、语音、视频统一处理;算力优化上,模型量化将参数从32位浮点数量化为4位整数,模型体积缩小8倍,推理速度提升5倍以上,准确率损失控制在5%以内,“知识蒸馏”使千亿参数大模型能力迁移到十亿参数小模型,实现移动端部署。06大模型的飞速发展和趋势技术进展方向
01增强实时性和真实性通过检索增强生成(RAG)技术,模型可实时获取最新数据,如实时新闻、政策文件等,更新延迟从“数月”缩短至“秒级”,解决知识更新滞后问题。
02支持多模态融合以GPT-4o、Gemini为代表的模型实现文本、图像、语音、视频的统一处理,通过“跨模态注意力机制”学习不同模态数据关联特征,如根据语音描述生成图像与文本方案。
03扩展知识和技能引入外部工具补全语言模型局限性,如Toolformer遇见计算题时调用计算器,将结果加入生成内容,增强模型处理算数等非语言擅长任务的能力。
04改进复杂推理能力采用思维链(CoT)、思维树(ToT)等提示技术,引导模型拆解复杂问题逐步推理,结合“模型+工具”协同体系,调用计算器、代码解释器等外部工具提升推理准确性。重要事件与应用
Toolformer:外部工具增强模型能力2023年2月Meta发表Toolformer相关文章,提出通过外部知识和工具补全语言模型局限性,如调用计算器解决算数问题,拓展模型知识与技能边界。
微软连接物理世界实验2023年2月微软研究院将ChatGPT作为“大脑”安装在机器人上,通过自然语言完成任务规划,将高层指令转化为动作,推动大模型进入物理世界应用。
GPT-4发布及多模态突破2023年3月15日GPT-4发布,实现文字图片结合推理的多模态能力,逻辑性和准确性大幅提升,在SAT、GRE测试中取得高分,同年3月16日全面接入Office,支持自然语言处理办公需求。
ChatGPT插件商店构建应用生态2023年3月23日ChatGPT发布插件商店,通过语言模型与外部插件工具配合完成复杂任务,建立以大模型为中心的应用生态,拓展模型应用场景。发展现状与数据01基础科学大模型快速发展2020年AlphaFold2破解蛋白质折叠难题,2022年华为盘古气象大模型精度超传统数值预报且速度提速10000倍以上,2023年DeepMindGNoME两周发现220万种晶体结构,“风乌”模型实现0.09°全球气象预报。02飞桨框架3.0发布与技术突破2025年4月1日飞桨框架3.0正式发布,具备动静统一自动并行、大模型训推一体、科学计算高阶微分等五大新特性,推动大模型技术底层优化。03媒体行业大模型应用普及截至2025年4月,国内主流媒体已将大模型应用于内容生产全链条,使用水平呈现县级、市州级、省级、中央级媒体逐级递增特点,从业者对技术接受度高,年龄、学历为显著影响因素。04全球及中国大模型发展规模截至2025年7月,全球已发布大模型3755个,中国贡献1509个居全球首位;全球人工智能企业超3.5万家,中国超5100家占比约15%,独角兽企业271家,中国71家占比约26%。发展现状与数据
中国生成式AI用户规模增长截至2025年6月,中国生成式人工智能用户规模达5.15亿人,较2024年12月增长2.66亿人,半年翻番,普及率达36.5%,显示市场应用快速渗透。07大模型产品在中国的发展中国大模型发展驱动与特点技术自主突破驱动基于自主优化的Transformer架构持续迭代参数规模与模型效率,深度适配中文语境及国内行业场景,支持多模态输入与输出。国内市场需求驱动满足日益增长的智能交互需求,在对话式AI、内容创作、搜索引擎等场景大幅提升效率,推动各行业智能化转型。中美人工智能竞争特色美国高度依赖算力,投入大量资金建设硬件资源,投资呈大体量特点;中国积极研发替代产品,更注重算法优化,在硬件性能有限情况下提升智能水平。爆款产品DeepSeek
上线时间与下载量2025年1月15日正式上线,上线至2月9日累计下载量超1.1亿次,1月27日-2月2日周下载量飙升至6300万次,环比增长超2700%。
核心技术优势在推理、自然语言理解与生成、图像与视频分析、语音识别与合成、个性化推荐、大数据处理与分析、跨模态学习、实时交互与响应八大领域表现出色。
文科与理科产品特点文科产品DeepSeekV3,偏向人机对话的聊天模型,可写文章;理科产品DeepSeek-R1,通过小额投入产生客观推理效果,完全开源免费,性能与OpenAI的GPT-o1相当,成本仅为对手3%。主流大模型核心特点及应用
01百度文心一言(ERNIEBot)开发背景:依托飞桨深度学习平台与文心知识增强大模型打造,填补国内类似ChatGPT产品市场空白。技术特点:融合知识增强、检索增强和对话增强技术。应用场景:文学创作、商业文案创作、数理逻辑推算、中文理解、多模态生成。
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年烟草制品购销员(二级)专业能力试卷及答案
- DB32/T 4703-2024大口黑鲈工厂化繁育技术规范
- DB32/T 4749-2024萝卜网室杂交制种角额壁蜂授粉技术规程
- 扶贫岗事业编高频考题试卷及解析
- 规划建设岗事业编必刷题试卷及解析
- 税务稽查岗事业编专项训练试卷
- 会员制农场项目可行性研究报告
- 《高血压患者教育》课件
- 人力资源第八章薪酬管理
- 国家二级田径裁判培训资料
- 2026年机械加工企业安全考试题库及答案
- 常见老年慢性病患者的居家护理
- 2027届浙江省七彩阳光、浙南名校、精诚联盟、金兰教育高三上学期8月开学联考物理+答案
- 第9课 安全文明上网 第2课时 课件(内嵌视频)2026-2027学年道德与法治四年级上册统编版
- 2026世界互联网大会文化遗产数字化案例集
- 2026年水利安全员b证考试题库及答案解析
- 供应链协同管理方法论文
- 中国结石用药市场需求前景规模及未来前景展望研究报告
- 高中英语3500词(带音标2026新高考版)
- GB/T 18915.1-2013镀膜玻璃第1部分:阳光控制镀膜玻璃
- GA 360-2009警服材料精梳毛涤混纺织品
评论
0/150
提交评论