大数据导论 第3版 实验汇 杨尊琦 第2-12章 云端在线数据处理与可视化分析实验-人口统计特征与旅游行为的关联分析_第1页
大数据导论 第3版 实验汇 杨尊琦 第2-12章 云端在线数据处理与可视化分析实验-人口统计特征与旅游行为的关联分析_第2页
大数据导论 第3版 实验汇 杨尊琦 第2-12章 云端在线数据处理与可视化分析实验-人口统计特征与旅游行为的关联分析_第3页
大数据导论 第3版 实验汇 杨尊琦 第2-12章 云端在线数据处理与可视化分析实验-人口统计特征与旅游行为的关联分析_第4页
大数据导论 第3版 实验汇 杨尊琦 第2-12章 云端在线数据处理与可视化分析实验-人口统计特征与旅游行为的关联分析_第5页
已阅读5页,还剩69页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《第二章大数据下的云计算》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称云端在线数据处理与可视化分析实验任务目标掌握云计算平台在线存储、数据处理、可视化的基本流程;理解云计算为大数据提供弹性算力、分布式处理的支撑作用;具备云端数据清洗、统计分析、图表可视化的基础实操能力。成果要求提交完整实验操作截图(上传、清洗、计算、可视化界面);提交清洗后数据集、两张及以上规范可视化图表;简要总结云端大数据处理的特点与云计算的优势。实验报告实验任务云端新建项目,上传并预览原始数据集;完成云端数据清洗:去重、去空值、过滤异常数据;对清洗后数据完成云端统计计算(均值、最值、分组统计等);生成至少两种数据可视化图表,分析数据规律并导出成果。实验环境联网计算机、在线云端数据分析平台(免部署、免代码、零配置)、CSV格式结构化数据集。实验原理云计算依托云端分布式资源,脱离本地硬件限制,可在线完成数据上传、清洗、批量计算与可视化生成,是大数据快速处理的基础支撑技术,具备按需服务、高效、便捷的特点任务完成及步骤步骤1:登录平台:浏览器进入云端数据分析平台,新建个人实验项目步骤2:数据上传:上传CSV数据集,查看云端数据结构与数据总量步骤3:数据清洗:使用平台工具删除重复行、清除空值、筛选异常数据,生成标准数据集步骤4:云端计算:利用在线统计功能,完成数据批量统计与数值计算步骤5:可视化制作:根据统计结果生成柱状图、折线图/饼图,完善图表格式步骤6:成果保存:导出清洗后数据、可视化图表,保存关键操作截图实验结果与分析实验总结与心得体会ADDINCNKISM.UserStyle《大数据导论》实验任务报告实践章节:学生姓名: 专业班级: 学号: 机械工业出版社《第三章大数据处理》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称基于八爪鱼采集器的图书评论信息的采集与处理任务目标(1)理解网络爬虫的工作原理,熟悉八爪鱼采集器的核心功能模块;(2)具备运用八爪鱼采集器配置自动化采集任务,完成从目标网页上抓取结构化的评论数据的能力;(3)能够根据需求对抓取的原始数据进行简单的清洗和格式化处理;(4)培养学生数据获取意识,理解网络数据采集的价值与应用场景,并在实践操作中强化规范、严谨和高效的解决问题能力。成果要求(1)在八爪鱼采集器中成功构建并调试好本次实验的数据采集流程图;(2)采集至少2页豆瓣图书评论数据,并正确导出为一份Excel文件;(3)撰写一份实验报告,详细描述实验过程、遇到的问题及解决方案、实验结果等,并对采集到的数据进行简要分析或提出应用设想。实验报告实验任务利用八爪鱼采集器,构建一个能够自动采集‌豆瓣读书网站特定图书短评页面‌上所有评论信息的采集任务。任务需实现翻页功能,采集多页数据,并对“作品名”、“评论时间”、“评论内容”和“星级”四个字段进行格式化处理。实验环境(1)硬件环境:‌联网的个人计算机。(2)软件环境:‌Windows10/11操作系统,八爪鱼采集器,可访问互联网的浏览器,MicrosoftExcel。实验原理本实验是一个针对特定网站的垂直爬虫应用。通过模拟人工在浏览器中访问网页、查看内容、翻页等行为,自动化地遍历并提取目标网页上的结构化信息。八爪鱼采集器通过其内置的渲染引擎加载网页,并利用XPath、CSS选择器等技术自动或手动定位页面中的HTML元素,从而提取其中的文本、属性等信息。数据采集与处理任务遵循“提取—转换—加载”的典型流程。任务完成及步骤分解任务1——实验准备步骤1:登录八爪鱼采集器官网,下载软件安装包。步骤2:双击已下载的安装包,启动安装向导;阅读并同意用户许可协议,自定义选择软件安装路径;按照向导提示完成安装,等待安装进度条走完后,勾选“启动八爪鱼采集器”,点击【完成】按钮。步骤3:启动八爪鱼采集器。步骤4:熟悉豆瓣读书短评页面的布局和需要采集的数据字段。分解任务2——数据采集步骤1:创建自定义采集任务在八爪鱼采集器主界面,点击【新建】按钮,选择【自定义采集】模式,进入任务配置界面;在网址输入框中,粘贴该链接/subject/38421846/reviews,点击【保存设置】,等待软件完成目标网页的加载,生成网页预览界面。步骤2:进行核心字段元素定位与提取配置(1)创建【循环列表】,采集所有图书评论列表中的数据。选中页面上1个评论列表(注意一定要选中整个列表,包含所有所需字段),在黄色操作提示框中点击【选中全部子元素】→【选择全部子元素】→【元素中数据内容】,【循环-提取数据】创建完成。【循环】中的项,对应着页面上所有图书评论列表,【提取数据】中的字段,对应着每个图书评论列表中的字段。启动采集以后,八爪鱼就会按照循环中的顺序依次提取每个列表中的字段。(2)编辑字段。在【当前页面数据预览】面板中,删除不需要的字段,同时修改字段名称。手动添加更多字段,选中作品名,在操作提示框中,点击【文本内容】。添加作品名后,把作品名字段移动到字段最左边,这样字段的显示顺序就变成了作品名在最前面。选中星级,在操作提示框中,点击【OuterHtml】。(3)格式化数据。点击【作品名】字段后的...按钮→【格式化数据】→【添加步骤】→【替换】,将【短评】替换为【空】,然后保存设置。点击【星级】字段后的...按钮→【格式化数据】→【添加步骤】→【正则表达式匹配】→匹配user-stars和rating之间的数据→【确定】,得到【allstar50】,即评分为50。(4)创建【循环翻页】。如果需要翻页以采集多页数据,选择页面中的【后页】按钮,在操作提示上单击【循环点击单个链接】,创建【循环翻页】。然后,八爪鱼会自动点击【下一页】按钮进行翻页,从第1页,第2页直到最后1页。如果只需采集特定页的数据,可在八爪鱼中设置循环翻页的次数。修改【循环翻页】的XPath,进入【循环翻页】设置页面,修改XPath为://a[@data="next"][contains(text(),'后页')]注:默认的XPath会在第二页重复翻页,不断采集第一页的内容。步骤3:生成采集设置确认字段筛选无误、循环规则配置正确后,点击界面下方的【生成采集设置】按钮,软件将自动完成采集规则的编译与优化,生成可执行的采集任务,跳转至采集启动界面,确保采集器可以进行自动翻页后点击【应用】。分解任务3——数据处理步骤1:启动采集任务完成采集设置生成后,点击界面右上角的【采集】按钮,在弹出的采集模式选择窗口中,选择【本地采集】-【普通模式】,软件将启动自动化采集,实时展示采集进度、已采集数据条数与字段内容。步骤2:采集启停控制实时监控采集进度,当界面显示已成功采集所需有效影评数据时,立即点击采集界面的【停止】按钮,终止采集任务,确保采集数据量符合实验要求。核对无误后,点击界面【导出数据】按钮,在导出设置中选择文件格式为Excel(.xlsx),设置本地保存路径与文件名,点击【确定】完成导出。步骤3:缺失值处理点击查看保存好的影评数据文件,检查是否存在空值,将存在空值的数据整条数据删除。步骤4:优化排版布局选中标题和内容两列,设置为自动换行。选中所有数据单元格为垂直居中,设置一个符合你审美的表样式。实验结果与分析实验总结与心得体会《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称基于YOLOv8的火焰烟雾检测任务目标理解卷积神经网络在目标检测任务中的作用,掌握YOLOv8单阶段目标检测模型的基本结构;能够完成图像数据集整理、模型训练、模型推理与检测结果分析;形成“数据准备—模型训练—模型评估—结果解释”的完整实验思路。具体任务内容围绕火焰与烟雾图像数据,完成数据集整理与划分,配置YOLOv8训练文件,使用Python环境调用UltralyticsYOLOv8模型进行训练,并利用训练后的权重文件对测试图像进行火焰和烟雾目标检测。实验过程中需要记录训练过程、检测结果、评价指标以及典型误检或漏检现象。成果要求提交完整实验报告。报告应包含实验目的、实验原理、实验环境、数据集说明、实验步骤、关键代码、训练或推理截图、检测结果图、评价指标表和实验总结。实验报告一、实验名称基于YOLOv8的火焰烟雾检测实验。二、实验目的(1)理解卷积神经网络(CNN)在图像特征提取和目标检测任务中的应用价值。(2)掌握YOLOv8目标检测模型的基本组成,理解Backbone、Neck和Head在检测流程中的作用。(3)能够使用Python环境完成数据集配置、模型训练、模型推理和检测结果分析。(4)结合火焰烟雾检测场景,认识大数据与智能分析方法在应急监控、安全预警等领域中的实际意义。三、实验原理1.卷积神经网络与目标检测卷积神经网络能够通过卷积核在图像上滑动,自动提取边缘、纹理、颜色、轮廓和语义区域等多层次视觉特征。火焰和烟雾图像通常具有背景复杂、形态变化大、边界模糊等特点,传统人工特征难以稳定表达,而CNN能够从大量图像样本中学习更具泛化能力的特征表示。2.YOLOv8模型结构YOLOv8属于单阶段目标检测网络,能够直接从输入图像中预测目标类别和边界框位置,具有检测速度快、部署方便的特点。其结构主要包括Backbone、Neck和Head三部分:Backbone负责提取多层次图像特征;Neck通过FPN与PAN等结构融合不同尺度的特征;Head在多尺度特征图上输出目标类别、边界框和置信度。图1YOLOv8网络结构图3.评价指标目标检测模型通常从定位准确性和分类准确性两个角度进行评价。IoU用于衡量预测框与真实框的重合程度;Precision表示预测为正样本的目标中有多少是真正目标;Recall表示真实目标中有多少被模型成功检出;mAP则综合衡量不同类别在不同置信度或IoU阈值下的检测性能。IoU=Area(B_pred∩B_gt)/Area(B_pred∪B_gt)

Precision=TP/(TP+FP)

Recall=TP/(TP+FN)四、实验环境项目配置或说明操作系统Windows/Linux均可开发语言Python3.8及以上深度学习框架PyTorch目标检测工具UltralyticsYOLOv8主要依赖库ultralytics、opencv-python、numpy、matplotlib硬件建议支持CUDA的NVIDIAGPU;若无GPU,可使用CPU进行小规模推理验证五、实验数据实验数据来源于包含多种火焰与烟雾图像的公开数据集,覆盖室内、室外、光照变化和背景干扰等复杂场景。数据集共包含13890张图片,按照7:2:1的比例划分为训练集、验证集和测试集。数据集比例图片数量用途训练集70%9723张用于模型参数学习验证集20%2778张用于训练过程中的性能验证和参数选择测试集10%1389张用于最终检测效果评估图2火焰烟雾数据集示例本实验检测类别设置为fire和smoke。学生在实际操作时,需要确保图像文件与标注文件一一对应,并检查YOLO格式标签是否正确。YOLO标签一般由“类别编号、目标中心点横坐标、目标中心点纵坐标、目标宽度、目标高度”五部分组成,坐标均为归一化数值。六、实验步骤1.数据准备与目录整理建立统一的数据目录,将图片与标签分别放入train、val、test文件夹中,保证训练集、验证集和测试集的图片与标签路径一致。参考目录结构如下:fire_smoke_dataset/

├─images/

│├─train/

│├─val/

│└─test/

├─labels/

│├─train/

│├─val/

│└─test/

└─fire_smoke.yaml2.配置数据集文件在fire_smoke.yaml文件中设置训练集、验证集、测试集路径以及类别名称。类别顺序必须与标签文件中的类别编号保持一致。path:./fire_smoke_dataset

train:images/train

val:images/val

test:images/test

names:

0:fire

1:smoke3.环境安装在Python环境中安装YOLOv8相关依赖。若使用GPU训练,需要提前配置与显卡匹配的CUDA和PyTorch版本。pipinstallultralyticsopencv-pythonmatplotlib4.模型训练调用YOLOv8预训练模型进行迁移学习。根据设备性能选择yolov8n.pt、yolov8s.pt等不同规模模型。若课堂实验时间有限,可降低epochs或仅完成推理验证。yolodetecttrainmodel=yolov8n.ptdata=fire_smoke.yamlepochs=50imgsz=640batch=165.模型检测与结果保存训练完成后,加载best.pt权重文件,对测试集或指定图像进行检测。模型会输出火焰与烟雾的类别名称、边界框位置和置信度。yolodetectpredictmodel=runs/detect/train/weights/best.ptsource=fire_smoke_dataset/images/testconf=0.25save=True6.结果记录与分析记录模型训练后的Precision、Recall、mAP50、mAP50-95等指标,并选取若干典型检测图片进行分析。对于漏检、误检样本,应从光照变化、烟雾边界模糊、小目标、遮挡和背景干扰等角度说明原因。七、实验结果与分析图3基于YOLOv8的火焰烟雾检测结果从检测结果可以看到,YOLOv8能够在复杂场景中对火焰和烟雾目标进行定位,并给出相应类别与置信度。对于火焰目标,模型通常能较好捕捉明亮区域及其边界;对于烟雾目标,由于其边缘扩散、透明度变化和背景相似性较强,检测难度相对更高。学生应根据实际训练输出填写下表。若只完成推理演示,也可将表格中的指标栏改为“检测现象记录”,重点分析模型能否正确识别fire与smoke,以及是否存在误检或漏检。类别PrecisionRecallmAP50mAP50-95结果分析fire________________________________smoke________________________________整体________________________________结果分析可从以下几个方面展开:第一,比较fire与smoke两类目标的检测难度;第二,观察模型在夜间、强光、遮挡、远距离、小目标等场景下的稳定性;第三,说明数据增强、样本数量和标注质量对模型效果的影响;第四,提出改进方向,如增加复杂场景样本、调整置信度阈值、使用更大规模模型或引入视频时序信息。八、实验总结本实验以火焰烟雾检测为应用场景,将卷积神经网络、目标检测模型和数据挖掘流程结合起来。通过实验可以看到,YOLOv8能够从非结构化图像数据中自动提取关键特征,并实现火焰与烟雾目标的定位和分类,体现了深度学习在安全监控和应急预警中的应用价值。实验的关键不只是运行模型,更在于理解数据准备、模型训练、指标评价和结果解释之间的逻辑关系。在后续改进中,可以进一步扩大数据规模,补充低照度、远距离、小火点、薄烟雾等复杂样本;也可以尝试比较不同YOLOv8模型规模、训练轮次、图像输入尺寸和数据增强策略对检测效果的影响,从而获得更加稳定和可靠的火焰烟雾检测模型。九、思考题(1)为什么YOLOv8适合应用于火焰烟雾检测这类实时性要求较高的任务?(2)烟雾检测相比火焰检测有哪些更明显的难点?应如何通过数据或模型改进来缓解?(3)如果将本实验部署到校园、工厂或森林防火监控系统中,还需要考虑哪些工程问题?(4)请尝试比较yolov8n、yolov8s和yolov8m在速度、精度和硬件需求方面的差异。《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《大数据导论》课程实验姓名学号班级实验地点指导教师时间实验任务一、实验基本信息1.实验名称:基于超市数据集的时间序列数据可视化分析2.实验工具:TableauDesktop(任意主流版本)3.实验数据:Tableau自带「示例-超市」数据集(Superstore)4.实验时长:90分钟5.实验核心目标:掌握Tableau时间字段处理方法、时间序列图表绘制技巧,学会通过时序可视化分析超市经营数据的时间变化趋势、周期性规律、波动特征,具备基础的时序数据洞察与可视化呈现能力。二、实验目的1.熟练掌握Tableau自带超市数据集的导入、字段识别方法,区分维度、度量、时间字段的数据属性。2.掌握时间字段的分层拆分(年、季度、月、日)、连续/离散时间切换等核心操作。3.熟练绘制折线图、面积图、周期对比图等主流时间序列可视化图表。4.能够基于时序图表,分析超市销售额、利润、订单量的年度趋势、季度波动、月度周期规律。5.学会添加参考线、趋势线、预测线,实现时序数据的基础统计分析与未来数据预测。6.完成可视化仪表盘整合,形成完整的时序数据分析成果,规范输出实验结果。三、实验环境与数据说明(一)实验环境Windows/macOS系统,安装正版TableauDesktop软件,软件可正常加载自带示例数据集,无功能限制。(二)数据集说明本次实验使用Tableau内置示例-超市数据集,无需额外导入,数据集包含超市订单、客户、产品、区域四大类数据,核心时序关键字段如下:1.订单日期:核心时间序列字段,包含2016-2019年完整订单数据,支持年、季、月、日分层解析。2.销售额:核心度量字段,反映门店经营营收情况。3.利润:核心度量字段,反映经营盈利水平。4.订单ID:计数维度,可统计订单数量变化趋势。5.产品类别、区域:辅助维度,用于多维度时序对比分析。四、实验要求(一)基础操作要求1.正确调取Tableau自带超市数据集,准确识别时间、维度、度量字段,无字段调用错误。2.熟练完成连续时间、离散时间的切换,可自由拆分时间粒度(年/季度/月/日)。3.独立完成各类时间序列图表的创建、样式优化、字段映射,图表无数据错乱、维度混淆问题。(二)可视化成果要求1.完成4类核心时序图表:年度趋势折线图、月度周期面积图、季度利润波动对比图、分品类时序对比折线图。2.为图表添加坐标轴标题、图例、数据标签、备注说明,配色简洁清晰,符合数据可视化规范。3.为核心时序图表添加趋势线、平均值参考线,直观标注数据波动与整体规律。4.利用Tableau预测功能,生成销售额未来12个月的时序预测曲线。5.将所有时序图表整合至统一仪表盘,调整布局、尺寸,实现可视化成果一体化展示。(三)数据分析要求1.能够准确总结2016-2019年超市整体销售额、利润的年度增长/下降趋势。2.分析全年经营数据的月度周期性特征(旺季、淡季分布)。3.对比不同产品类别(办公用品、技术、家具)的时序经营差异。4.结合参考线、预测结果,分析数据异常波动节点及未来经营趋势。(四)实验报告要求1.记录每一步核心操作流程,截图保存关键操作界面与最终可视化成果。2.针对每一张时序图表,撰写对应的数据分析结论,做到图文对应、逻辑清晰。3.总结实验过程中遇到的问题、解决方法及本次实验的知识点收获。五、详细实验指令(分步操作任务)任务一:数据集调取与时间字段预处理(15分钟)1.打开TableauDesktop软件,在起始页面点击「示例-超市」,自动加载数据集,进入工作表编辑界面。2.在数据面板中,找到「订单日期」字段,确认字段类型为「日期」维度字段。3.右键点击「订单日期」,完成两项核心设置:◦分别切换连续日期和离散日期,观察工作表坐标轴变化差异;◦拆分时间粒度,依次展示「年、年-季度、年-月份、日期」四级时间层级。4.熟悉核心度量字段:销售额、利润、订单数量,明确字段聚合方式(求和、计数)。任务二:年度时间序列趋势可视化(20分钟)1.新建工作表,构建年度销售额、利润趋势折线图。2.操作指令:将「订单日期(年)」拖至列功能区,将「销售额(求和)」「利润(求和)」拖至行功能区。3.标记卡选择「线」类型,开启数据标签,显示每年具体销售额、利润数值。4.右键图表,添加整体趋势线(线性趋势),观察四年整体经营增长趋势。5.完成分析:记录2016-2019年超市销售额和利润的整体变化规律。任务三:月度周期性时序可视化(20分钟)1.新建工作表,构建月度销售额周期面积图,分析全年经营淡旺季。2.操作指令:将「订单日期(月份)」拖至列功能区(离散月份,1-12月),「销售额(求和)」拖至行功能区。3.标记卡修改为「面积图」,调整配色,提升可视化效果。4.添加销售额平均值参考线,区分高于均值、低于均值的月份。5.完成分析:标注全年销售旺季、淡季,总结超市月度经营周期性特征。任务四:多维度时序对比可视化(20分钟)1.新建工作表,构建分产品类别季度利润对比折线图。2.操作指令:◦列功能区:订单日期(年-季度);◦行功能区:利润(求和);◦颜色卡:拖拽「产品类别」,实现三类产品时序数据差异化配色展示。3.为图表添加图例、坐标轴名称,区分办公用品、技术、家具的季度利润波动差异。4.筛选异常季度数据,分析不同品类的经营稳定性。任务五:时序数据预测与仪表盘整合(10分钟)1.回到年度销售额折线图工作表,选中图表,点击顶部菜单栏「分析」-「预测」-「显示预测」。2.设置预测周期为未来12个月,生成销售额时序预测曲线,观察未来经营预估趋势。3.新建仪表盘,将以上4张时序图表(年度趋势图、月度面积图、品类对比图、预测分析图)统一添加至仪表盘。4.调整仪表盘布局为自适应布局,统一图表尺寸,添加仪表盘标题「超市数据集时间序列可视化分析报告」。任务六:实验总结与结果输出(5分钟)1.逐一核对所有图表完整性、数据准确性、可视化规范性。2.保存Tableau工作簿文件,命名为「时间序列可视化-超市数据集实验.twbx」。3.整理所有图表截图、数据分析结论,完成实验报告撰写。六、实验考核标准1.基础操作(30分):数据集调取正确、时间字段处理规范、时间粒度切换熟练。2.可视化成果(40分):4类时序图表完整、样式规范、标签齐全、预测功能正常使用,仪表盘布局美观。3.数据分析(20分):能够准确总结时序趋势、周期规律、品类差异,分析逻辑合理。4.实验规范(10分):文件命名规范、操作流程完整、实验报告内容详实。七、实验注意事项1.所有时间序列分析必须基于「订单日期」字段,禁止使用其他日期字段替代。2.区分连续时间与离散时间的使用场景:趋势分析用连续时间,周期对比用离散时间。3.图表配色简洁统一,避免色彩杂乱,数据标签清晰不重叠。4.预测功能仅针对连续时序数据生效,操作前需确认日期字段为连续格式。5.保存文件时选择.twbx格式,可完整保留数据集、图表及仪表盘成果,避免数据丢失。实验报告《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《大数据导论》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称朋友圈‘可见’问题及SNA可视化任务目标掌握社会网络可视化的基本内容,包括社会网络的概念、原理、分析及应用。通过有关朋友圈‘可见’问题的实验,对微信使用者在朋友圈这一社交功能平台上的连接强弱程度做出分析,帮助用户了解自己在微信好友中的定位并做出相应反应。在此实验的基础上,完成对社会网络分析可视化更深层次的理解。具体任务内容(1)问题的提出(2)数据收集和处理(3)模型构建与可视化分析成果要求实验报告一、实验名称《朋友圈‘可见’问题及SNA可视化实验报告》二、实验任务及目的掌握社会网络可视化的基本内容,包括社会网络的概念、原理、分析及应用。通过有关朋友圈‘可见’问题的实验,对微信使用者在朋友圈这一社交功能平台上的连接强弱程度做出分析,帮助用户了解自己在微信好友中的定位并做出相应反应。在此实验的基础上,完成对社会网络分析可视化更深层次的理解。三、实验环境MicrosoftExcel2010、UCINET6、NetDraw四、实验内容与过程11UCINETKExcel1)文件,如图3所示。“Ucinet6forWindowsExcel图4所示。④点击确定后生成“OutputLog#7”文本文档,文档中包含Excel文件中的矩阵以及和“.##d”文件,如图5所示。2)7终得到生成的朋友圈的“可见”对象网络图,如图10所示。3)数据的中心度分析setnodesizesbyBetweenness,点击“OK”完成操作。其中操作流程图分别如图11、12、13所示。1213生活感悟化。A只对朋友、同学/同事可见,F、H只对家人、朋友可见,其他使用者都属于接近全开1215专业知识趣味话题化。A、B、F、G、H愿意“对其可见”的范围都较小,其共同点是都对朋友可见,其他使12位微信使用者对朋友都选择对其可见,而对老师/领导、陌埋怨吐槽较低,其中仅全开放朋友圈的使用者K对老师/领导可见。如图18所示。私人生活度较低。如图19所示。广告拉票四、实验结果及分析////五、实验总结Ucinet绘制社会关系网络图,同时应用了数据预处理的相关知识、加深了SNA可视化的学习也有了初步的了解实验,希望通过后续的SNA可视化有更深入的了解与发现。《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《第八章健康大数据在公共卫生领域的实践》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称模拟居民体检大数据整理与公共卫生健康风险分析实验任务目标掌握公共卫生体检大数据结构,理解数据预处理、群体风险筛查在疾控工作中的应用原理;独立完成体检脏数据清洗和人群分层统计与健康风险分级,并制作可视化图表并输出公共卫生分析结论;建立“海量体检数据识别群体健康隐患、支撑精准公共卫生防控”的大数据思维。成果要求文件:原始数据集、清洗后标准化CSV数据集;图表:年龄分布柱状图、健康风险占比饼图;材料:清洗、统计、可视化操作截图;文档:简短分析报告,包含人群风险特征与社区健康干预建议;合格标准:数据无无效脏数据,风险分级准确,图表可清晰反映区域健康问题。实验报告实验任务掌握公共卫生体检大数据结构,理解数据预处理、群体风险筛查在疾控工作中的应用原理;数据清洗:去重、清理空值、过滤生理极值,生成标准化数据集;风险统计:利用数据透视表按年龄、性别分组,批量判定居民健康风险等级;可视化与研判:制作两类图表,分析群体健康隐患,撰写公共卫生干预建议。实验环境设备:联网电脑;软件:Excel/WPS表格(数据透视表、函数、图表工具)、Word;数据:模拟社区居民体检CSV数据集(约千条,自带空值、重复、生理异常脏数据)。实验原理居民体检结构化数据经过聚合整合后,能够有效挖掘区域群体慢病特征与各年龄段健康风险规律,为公共卫生健康筛查与精准防控提供数据依据。由于原始体检数据普遍存在录入重复、字段缺失和生理异常极值等脏数据问题,必须通过去重、清理空值、过滤异常数据完成数据预处理,以此保障后续统计分析结果真实有效。实验依托国家通用健康指标阈值,对大批量居民体检数据进行批量判定,实现人群健康风险分层分级,再通过数据可视化技术将海量数字化信息转化为直观图形,快速定位社区重点干预人群,完成公共卫生健康风险研判。任务完成及步骤步骤1:数据导入探查打开表格导入体检CSV,查看字段与数据总量,标记空白、重复、异常数据,截图记录原始数据问题。步骤2:统一清洗数据删除重复居民档案;剔除核心指标空值行;过滤血压、血糖等超出人体合理区间的异常数据,另存清洗后数据集。步骤3:分组统计与风险分级插入数据透视表,按年龄段、性别统计人数;使用IF函数新增风险等级字段,自动划分高、中、低风险人群,统计各类人群数量。步骤4:绘制可视化图表基于分层统计数据制作年龄分布柱状图;依据风险人数制作占比饼图,完善图表标注并截图。步骤5:图表格式成果整理输出结合图表分析社区高发慢病、高风险人群特征,撰写健康干预建议,并导出数据集、图表,整理全部操作截图,整合生成实验报告。实验结果与分析实验总结与心得体会《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《第九章大数据在绿色发展中的应用》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称基于中创碳知小程序的低碳主题数字化学习实践任务目标体验碳垂直大模型面向普通学生的轻量化使用流程,对比通用大模型与专业碳AI在双碳学习上的差异;依托小程序完成校园低碳课题数据检索、碳足迹测算、政策案例搜集全流程实操;验证轻量化碳大模型在高校低碳通识、社会实践中的应用价值;分析和总结实验结果,提出大学生低碳数字化学习优化建议。成果要求实验报告一份,记录实验流程。实验报告实验任务随着通用大模型与碳领域垂直大模型持续迭代,传统AI碳减排应用存在的数据割裂、多源数据整合难度大、专业碳研判效率偏低等痛点得到有效破解。大模型可统筹海量能源、碳排放、政策行业数据,实现多场景一体化智能分析。实验环境设备:智能手机、微信客户端;预习任务:确定实验研究课题,如《高校校园低碳建设路径研究》;预设操作模块:知识答疑、双碳政策检索、零碳校园案例调取、个人/校园碳足迹测算等。实验原理以通用大模型为底座,融合低碳行业数据库与专业双碳报告,采用RAG检索增强技术构建垂直碳知识库,面向普通用户开放政策解读、碳核算、案例查询、文稿生成、多语种问答功能,无需专业碳系统账号,微信小程序即可免费使用,解决传统低碳学习资料零散、核算标准不统一、专业资料获取门槛高的痛点。任务完成及步骤步骤1:基础概念打开中创碳知小程序,依次输入提问:双碳目标、CCUS技术、碳汇、碳足迹、校园碳普惠标准定义;校园建筑、食堂、通勤、生活垃圾四类碳排放核算国标因子;模型调取官方核算方法学,输出标准化数据,纠正网络碎片化错误科普。步骤2:检索高校低碳相关政策文件指令:输出教育部绿色校园建设政策、高校碳中和行动指导文件、近三年高校零碳建设相关通知;小程序自动梳理完整政策原文、核心考核指标,自动分类整理,省去多官网检索流程。步骤3:调取全国零碳高校落地实证案例提问:国内高校光伏、校园储能、学生碳账户、垃圾分类减碳典型案例,附能耗、减排量化数据;模型输出清华、浙大、地方应用型高校完整建设方案、年度减碳量、改造成本数据,作为论文实证素材。步骤4:校园/个人碳足迹量化测算输入本校宿舍日均用电、食堂餐食消耗、学生通勤方式、校园垃圾年产量,测算校园基础碳排放;录入个人一周出行、饮食、用电数据,生成个人碳足迹对比图谱,输出低成本校园减排方案。步骤5:对比对照实验同一套问题分别向其他通用大模型提问,记录数据准确度、政策时效性、案例专业度差异。实验结果与分析实验总结与心得体会《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称基于AIGC的金融资讯智能投研报告生成任务目标理解金融大数据、生成式人工智能(AIGC)与智能投研的融合逻辑;掌握通过提示工程和检索增强生成(RAG)思路,对金融资讯、公告、研报和财务指标进行结构化分析的方法;能够生成摘要、关键数据提取、风险提示与合规说明。具体任务内容围绕一则金融资讯或企业公告,整理配套财务指标与背景材料,设计结构化提示词,调用AIGC工具生成智能投研摘要;对生成结果进行事实核验、来源追溯、风险识别与合规审查,比较AIGC输出与人工分析之间的差异。成果要求提交完整实验报告。报告应包含实验目的、实验原理、实验环境、数据来源、提示词设计、AIGC生成结果、人工核验记录、风险提示、评价指标表、实验总结和思考题。实验结果不得直接形成买入或卖出建议,应明确“仅用于教学分析,不构成投资建议”。实验报告一、实验名称基于AIGC的金融资讯智能投研报告生成实验。二、实验目的理解金融大数据在银行、保险、证券等场景中的应用价值,认识数据作为智能金融基础资源的重要作用。掌握AIGC在金融资讯摘要、观点提炼、风险提示和投研报告生成中的基本应用方法。能够围绕金融文本与指标数据设计结构化提示词,并对大模型生成内容进行事实核验和合规审查。形成“数据获取—提示词设计—AIGC生成—人工核验—结果评价”的完整实验思路。三、实验背景与原理1.金融大数据与智能金融金融行业天然具有数据密集特征,业务过程中会持续产生交易、客户、账户、风控、资讯、舆情等多源数据。第十章指出,金融大数据不仅能够服务于精准营销、风险控制和运营优化,也为人工智能模型提供训练素材,使金融服务逐步从“数据驱动”迈向“智能驱动”。在银行场景中,大数据可用于客户画像、精准营销、风险管控和运营优化;在证券场景中,金融资讯、公告、研报和社交媒体文本可用于股价预测、客户关系管理和投资景气指数分析。AIGC的引入进一步提高了金融文本处理、信息摘要与知识生成效率。2.AIGC与智能投研AIGC是生成式人工智能在内容生成任务中的应用形式。面向金融投研任务时,大语言模型可以对资讯、公告、研报和指标表进行语义理解,完成摘要生成、关键数据提取、观点归纳、风险提示和报告撰写等任务。为了降低大模型“幻觉”风险,本实验引入检索增强生成(Retrieval-AugmentedGeneration,RAG)的思想:先给模型提供可追溯的原始材料,再要求模型只基于给定材料生成结论。这样可以提高输出内容的可核验性和可信度。图1AIGC+金融智能投研实验流程3.合规与风险提示金融场景对准确性、审慎性和合规性要求较高。AIGC可以辅助完成信息整理和分析报告初稿,但不能替代专业投资判断。实验中应避免让模型直接给出“买入、卖出、保证收益”等结论,所有输出均应标明“仅用于教学分析,不构成投资建议”。图2东方财富“妙想”智能投研平台界面示意四、实验环境项目配置或说明操作系统Windows/macOS/Linux均可实验工具支持长文本处理的大语言模型平台,如DeepSeek、通义千问、Kimi、ChatGPT或校内AIGC平台辅助工具Word、Excel、浏览器;可选Python进行文本清洗和提示词调用数据类型金融资讯文本、企业公告片段、研报摘要、财务指标表、行业背景材料核心技术提示工程、RAG思想、文本摘要、信息抽取、风险提示生成、人工核验合规要求不得使用真实个人敏感金融数据;实验结论仅用于教学分析,不构成投资建议五、实验数据本实验采用“金融资讯文本+财务指标表+风险核验清单”的组合数据。教师可提供统一样例,学生也可从公开财经新闻、上市公司公告或机构研报中截取一段材料。为避免投资误导,课堂实验建议优先使用教学模拟数据或已经公开披露的历史材料。数据类型示例内容用途注意事项金融资讯文本某商业银行发布季度经营情况,提到营收、净利润、贷款投放、风险控制等信息用于摘要生成和主题提炼必须保留来源和日期财务指标表营收增速、净利润增速、不良贷款率、拨备覆盖率、资本充足率等用于关键数据提取和趋势判断不得虚构真实上市公司数据行业背景材料利率变化、监管政策、宏观经济环境、同业竞争情况用于影响分析和风险提示区分事实与推测人工核验清单来源是否可追溯、数据是否一致、表述是否合规、是否存在投资建议用于评价AIGC输出质量核验结果需写入报告六、实验步骤1.明确分析任务:确定本次AIGC需要完成的任务,例如“生成金融资讯摘要”“提炼关键财务数据”“分析潜在影响”“生成风险提示”等。2.整理输入材料:将资讯正文、公告片段、财务指标表和背景材料整理为统一格式。文本较长时可按“标题、来源、日期、正文、指标表、补充背景”分段。3.设计结构化提示词:在提示词中设置模型角色、输入材料、输出格式、限制条件和合规要求。要求模型只基于给定材料回答,不能编造事实或给出直接投资建议。4.调用AIGC生成结果:将提示词和数据输入大语言模型,生成“摘要、关键数据、影响分析、风险提示、结论说明”等结构化内容。5.人工核验与修正:对照原始材料检查模型是否遗漏关键数据、是否错误引用、是否夸大结论、是否存在不合规表述。必要时重新调整提示词并再次生成。6.输出实验报告:将最终输出内容、提示词、核验记录和评价表写入实验报告,并总结AIGC在金融分析中的优势与局限。七、提示词设计与关键代码本实验的关键在于提示词设计。提示词既要给出清晰任务,也要给出边界条件,尤其要强调数据来源、事实核验和合规表达。下面给出一个可直接用于课堂实验的提示词模板。角色:你是一名金融数据分析助教,负责根据给定材料生成教学用途的智能投研摘要。

输入材料:

1.金融资讯或公司公告正文:{news_text}

2.财务指标表:{indicator_table}

3.行业背景材料:{background_text}

任务要求:

1.用150字以内概括资讯核心内容;

2.提取5个以内关键数据,并说明每个数据反映的含义;

3.从经营表现、风险控制、行业环境三个角度分析潜在影响;

4.生成不少于3条风险提示;

5.明确区分“材料事实”和“分析推断”;

6.不得给出买入、卖出、保证收益等投资建议;

7.结尾必须写明:本结果仅用于教学分析,不构成投资建议。

输出格式:

一、核心摘要

二、关键数据

三、影响分析

四、风险提示

五、合规说明若教师希望学生通过Python体验自动化流程,可采用如下伪代码组织输入、拼接提示词并保存模型输出。实际API地址和密钥需由教学平台或教师统一提供。importjson

news_text=open("finance_news.txt","r",encoding="utf-8").read()

indicator_table=open("indicators.csv","r",encoding="utf-8").read()

background_text=open("background.txt","r",encoding="utf-8").read()

prompt=f"""

请基于以下材料生成教学用途的金融资讯智能投研摘要。

【资讯正文】{news_text}

【财务指标】{indicator_table}

【行业背景】{background_text}

要求:只基于材料回答;不得给出买入/卖出建议;输出摘要、关键数据、影响分析和风险提示。

"""

#response=call_llm_api(prompt)#由教师提供模型接口或使用网页端AIGC工具

#open("aigc_report.txt","w",encoding="utf-8").write(response)八、实验结果与分析1.AIGC生成结果示例以下内容为教学模拟输出,学生应根据实际输入材料和模型返回结果进行替换。一、核心摘要

材料显示,某商业银行本期经营保持稳健增长,营收和净利润均实现同比提升,贷款投放继续向小微企业和消费金融领域倾斜。资产质量总体稳定,但在净息差收窄、宏观环境波动和同业竞争加剧背景下,后续盈利能力与风险控制仍需持续关注。

二、关键数据

1.营收同比增长8.2%:说明主营业务规模仍在扩大。

2.净利润同比增长5.6%:盈利保持增长,但增速低于营收增速,可能受到成本或息差压力影响。

3.不良贷款率1.21%:资产质量整体可控,但仍需关注重点行业和小微客户风险。

4.拨备覆盖率250%:风险抵补能力较强。

5.小微贷款余额增长12.4%:体现普惠金融业务扩张,也可能带来更高的贷后管理要求。

三、影响分析

经营表现方面,业务规模扩张对收入增长形成支撑;风险控制方面,不良贷款率和拨备覆盖率显示短期风险可控;行业环境方面,若利率下行和竞争加剧持续存在,银行净息差和盈利弹性可能受到影响。

四、风险提示

1.宏观经济波动可能影响企业和个人客户偿债能力。

2.小微贷款增长较快,需关注贷后管理和逾期风险。

3.若净息差继续收窄,可能压缩盈利空间。

4.AIGC输出依赖输入材料质量,若材料缺失或过时,分析结论可能存在偏差。

五、合规说明

以上内容仅基于给定材料进行教学分析,不构成任何投资建议。2.输出结果评价评价维度评价重点示例评分主要问题改进方式准确性关键数据是否与原文一致4/5个别指标解释略笼统补充指标含义和来源完整性是否覆盖摘要、数据、影响、风险、合规说明5/5结构完整保持固定输出模板可追溯性是否能对应到原始材料3/5未逐条标注来源位置增加“来源段落/页码”字段风险意识是否充分提示不确定性和潜在风险4/5对市场风险说明较概括补充行业与监管风险合规性是否避免直接投资建议和保证性表述5/5无明显违规表述保留免责声明从实验结果可以看出,AIGC在金融资讯摘要、结构化表达和风险提示生成方面具有较高效率,能够快速把长文本转化为条理清晰的报告。但其不足也比较明显:第一,模型可能对未提供的数据进行推测;第二,来源追溯能力依赖输入材料组织方式;第三,金融结论容易受到提示词引导影响。因此,在金融场景中使用AIGC时,必须保留人工核验环节。九、实验总结本实验围绕第十章“大数据时代智能金融的挑战与机遇”展开,将金融大数据、AIGC、提示工程和智能投研任务结合起来。通过实验可以看到,AIGC能够提升金融文本处理效率,帮助完成资讯摘要、关键数据提取、观点提炼和风险提示等工作,适合用于投研辅助、智能客服、舆情分析和金融知识服务等场景。同时,金融业务具有高风险和强监管属性,AIGC的输出不能简单等同于专业结论。实验的重点不只是“让模型生成一段文字”,更是训练学生理解数据来源、提示词约束、事实核验、合规表达和人工审查之间的关系。只有将大模型生成能力与金融数据治理、风险控制和合规机制结合起来,才能真正发挥AIGC在智能金融中的价值。十、思考题(1)AIGC在金融资讯摘要和传统人工摘要相比,有哪些优势和不足?(2)为什么金融场景下不能直接相信大模型生成的投研结论?应如何进行事实核验?(3)RAG思想如何降低AIGC在金融分析中的“幻觉”风险?(4)如果将本实验扩展为智能投顾系统,还需要增加哪些数据、模型和合规模块?(5)请结合第十章案例,分析大语言模型在智能风控、智能投研和精准营销中的不同应用方式。《大数据导论》实验任务报告实验章节:学生姓名: 专业班级: 学号: 机械工业出版社《第十二章大数据在旅游业的应用》课程实验姓名学号班级实验地点指导教师时间实验任务任务名称人口统计特征与旅游行为的关联分析任务目标掌握旅游业数据的结构特点。熟练完成大数据读取、清洗、异常值处理、特征构造等全流程操作。分析访问网站游客年龄,家庭类型与旅游行为的关联。挖掘成人身份、家庭人数与旅游行为、产品购买的规律,支撑旅游平台精准运营。具体任务内容(1)数据收集与预处理(2)统计与分析(3)对策分析成果要求分析报告一份,如《人口统计特征与旅游行为关系分析报告》,报告需包含4张可视化图表(成人对比、家庭对比各2张),3条数据结论,2~3条旅游平台运营建议。实验报告实验任务通过分析旅游网站用户行为,挖掘成人身份、家庭人数与旅游行为、产品购买的规律,支撑旅游平台精准运营。实验环境硬件:计算机一台软件:PyCharm+Python3.7+依赖库:pandas、matplotlib实验数据:可在和鲸社区下载旅游网站用户行为数据集。本次实验使用关键字段:(1)人口统计特征Adult_flag:是否成人(1=成人,0=非成人)member_in_family:家庭成员数(2)旅游行为Yearly_avg_view_on_travel_page:年均浏览旅游页面次数Daily_Avg_mins_spend_on_traveling_page:日均停留时长yearly_avg_Outstation_checkins:年均异地签到次数preferred_location_type:偏好旅游地点类型Taken_product:是否购买旅游产品(核心转化)(3)互动行为评论数、点赞数、关注行为任务完成及步骤步骤1:数据加载与基础清洗。任务:读取数据、处理缺失值、统一格式。importpandasaspdimportmatplotlib.pyplotaspltimportnumpyasnp#解决中文显示plt.rcParams['font.sans-serif']=['SimHei']plt.rcParams['axes.unicode_minus']=False#1.读取数据、清洗df=pd.read_csv('路径/文件')#清洗Adult_flag:只保留0和1,缺失值填众数df['Adult_flag']=pd.to_numeric(df['Adult_flag'

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论