版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第二章
人工智能核心支撑要素目录数据:AI的基石01算法:AI的“大脑”02算力:AI的“引擎”03PART01数据:AI的基石0102大数据的4V特征海量(Volume)、高速(Velocity)、多样(Variety)、低价值密度(Value)。数据量从TB跃升至PB甚至ZB级别,类型涵盖结构化、半结构化和非结构化数据,且通过挖掘才能提取高价值信息。数据来源多样化互联网与移动互联网(搜索、社交、点击流)、物联网设备(传感器、智能家居)、传统企业系统(ERP、CRM)、公共数据源(政府开放数据、学术数据集)。多源异构数据需整合才能构建完整数据源。大数据时代的特征与挑战数据生命周期关键阶段包括采集、预处理、存储、分析与可视化。每一阶段需配套技术手段与制度保障,形成闭环治理体系,确保数据被有效管理、保护并创造价值。数据安全合规挑战过度采集、来源合法性不明等风险突出。国内已制定《个人信息保护法》《数据安全法》,但实践中仍面临“知情同意难落实”“匿名化标准缺失”等挑战。数据生命周期与安全合规02数据清洗(处理缺失值、异常值)、数据集成(消除冗余矛盾)、数据变换(规范化、离散化、特征构造)、数据归约(降维PCA、数据压缩)。预处理是连接原始数据与有效分析的桥梁。预处理四大步骤结构化数据采集(如ETL工具从MySQL、Oracle同步)、非结构化数据采集(网络爬虫文本、边缘设备视频、传感器音频)、实时流数据采集(Flink、Kafka处理毫秒级数据)。01三类采集场景数据采集与预处理技术传统存储与大数据存储对比存储架构差异特性传统存储(如SAN/NAS)大数据存储扩展模式纵向扩展,存在上限横向扩展,理论上无限数据模型以结构化数据为主,强schema支持结构化、半结构化、非结构化,schema灵活处理模式数据移动到计算计算移动到数据,减少传输开销硬件基础专用高可靠硬件商用x86服务器,软件层保证可靠性核心目标保证事务性、强一致性、低延迟保证高吞吐、高扩展、容错性,可接受最终一致性四大分析类型常用可视化工具描述性分析(均值、分布直方图)、诊断性分析(相关性分析)、预测性分析(时间序列预测趋势)、规范性分析(特征重要性筛选)。分析结果指导模型训练方向。编程类:Matplotlib、Seaborn、Echarts、D3.js。非编程类:Tableau、PowerBI。核心图表:直方图、箱型图、散点图、热力图、折线图、饼图、混淆矩阵等。数据分析与可视化PART02算法:AI的“大脑”1956年AI概念提出,1980年代CNN雏形,1998年LeNet-5奠定基础。此阶段依赖浅层模型。萌芽期(1950–2005)深度学习复兴:2006年深度信念网络,2012年AlexNet夺冠,2017年Transformer提出,2018年GPT-1、BERT发布,预训练大模型成为主流。沉淀期(2006–2019)2020年GPT-3(1750亿参数)实现零样本学习,2022年ChatGPT引爆生成式AI,2023年GPT-4支持多模态。参数规模跃至万亿级,Transformer为主流架构。爆发期(2020至今)算法发展简史无监督学习处理无标签数据,用于聚类(K-means)和降维(PCA)。半监督学习结合少量标签与大量无标签数据,提高效率。使用带标签数据,用于分类和回归。常见算法:线性回归、逻辑回归、决策树、随机森林、SVM、KNN。通过与环境交互试错,最大化奖励。适用于游戏、机器人控制,代表算法Q-learning、DQN。监督学习无监督与半监督学习强化学习机器学习算法分类处理序列数据,隐层状态传递实现记忆。变种LSTM/GRU解决梯度消失问题,适用于语音识别、机器翻译。RNN(循环神经网络)基于自注意力机制,并行处理序列,避免RNN序列依赖。Encoder-Decoder结构,支持长距离依赖捕获,成为大模型核心。TransformerCNN(卷积神经网络)擅长图像处理,通过卷积层提取局部特征,池化层降维。典型应用:图像分类、目标检测。深度学习关键算法预训练+微调范式MoE(混合专家模型)多模态模型架构思想为“分而治之”与“稀疏激活”。包含多个“专家”(小神经网络)和一个路由网络,对每个输入动态选择1-2个专家处理,输出加权组合。适用于万亿参数模型。预训练在通用大规模数据上以自监督学习训练基础模型(通才),微调使用特定领域标注数据调整参数(专才)。此范式降低对标注数据依赖,提升泛化能力。融合文本、图像、视频等模态。常见方法:视觉编码器+LLM连接器,或CLIP式对比学习。支持图像描述、视觉问答等任务。大模型核心原理完整流程示例算法实现案例:随机森林分类Iris#核心流程代码示例:从数据加载到模型评估的极简实现fromsklearn.datasetsimportload_iris;fromsklearn.model_selectionimporttrain_test_splitX,y=load_iris().data,load_iris().target#加载数据并分离特征与标签X_tr,X_te,y_tr,y_te=train_test_split(X,y,test_size=0.2,random_state=42)clf=RandomForestClassifier(n_estimators=100).fit(X_tr,y_tr)#训练随机森林模型print("模型测试准确率:{:.2f}%".format(accuracy_score(y_te,clf.predict(X_te))*100))01数据加载导入经典鸢尾花数据集,提取花瓣、花萼的形态特征数据,作为模型的输入基础。02数据集划分按8:2比例随机切分数据,大部分用于模型训练学习规律,小部分用于测试验证。03模型构建训练04预测与评估利用测试集检验模型的泛化能力,计算分类准确率,量化模型的预测效果。选用随机森林算法,让模型在训练数据中自主学习特征与鸢尾花品种之间的关联。PART03算力:AI的“引擎”浮点运算能力(FLOPS)、能效比、互联带宽。训练大模型需万卡集群,推理需低功耗边缘芯片。核心指标从CPU通用计算→GPU并行加速→专用AI芯片。算力需求呈指数增长,驱动模型规模从亿级到万亿级参数。演进趋势算力的核心指标与演进CPU擅长串行逻辑控制,但并行能力弱,面对深度学习海量矩阵运算效率低下。早期AI算法简单时可应对。2006年NVIDIA推出CUDA支持通用编程,2012年AlexNet使用GPU训练夺冠。GPU拥有数千个小核心,擅长大规模并行浮点运算,比CPU快几十到上千倍,成为AI训练主流。CPU的局限GPU的崛起从CPU到GPU的变革Google2016年发布,采用脉动阵列架构,专为张量运算优化,低精度计算,能效高。同等任务比GPU快15-30倍,能效高30-80倍。最新v6支持万芯片集群。TPU(张量处理单元)专注边缘/移动端推理,低功耗。优化卷积、激活等操作,支持低精度混合精度。代表:华为麒麟NPU、苹果NeuralEngine、高通AIEngine,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 海外投资风险控制协议2026
- 4《金属》课件解析
- 2026年青岛科技大学人工智能期末考试题试卷及答案
- 安全生产与效益提升讲解
- 水产安全措施指南讲解
- AI类股投资分析
- 顺逆结合施工钢筋笼工序穿插管控
- 学校突发事件应急预案
- 人工智能指数深度解读
- 叠合板施工技术交底
- 2026年中国融通旅发秋季社会招聘10人笔试历年备考题库附带答案详解
- 幼儿多动症早期康复训练指导手册
- 2026年重庆市检察院刑事检察业务竞赛真题及答案解析
- 血液透析机常见报警原因及处理
- 江苏太仓市城市发展集团有限公司招聘笔试题库2026
- 铜业企业制氧站、输氧管道防火安全管理规章制度
- 区域创伤救治体系与黄金一小时响应机制
- 代账业务内部规范制度
- T∕CNCA 127-2025 煤炭建设工程造价参考指标
- 医院重点单位重要部位安全技术防范系统要求
- 物业顶岗制度规范
评论
0/150
提交评论