Python爬虫与网络数据采集案例实践(微课视频版)课件 第1-5章 爬虫与网络数据采集概述-爬虫数据的存储_第1页
Python爬虫与网络数据采集案例实践(微课视频版)课件 第1-5章 爬虫与网络数据采集概述-爬虫数据的存储_第2页
Python爬虫与网络数据采集案例实践(微课视频版)课件 第1-5章 爬虫与网络数据采集概述-爬虫数据的存储_第3页
Python爬虫与网络数据采集案例实践(微课视频版)课件 第1-5章 爬虫与网络数据采集概述-爬虫数据的存储_第4页
Python爬虫与网络数据采集案例实践(微课视频版)课件 第1-5章 爬虫与网络数据采集概述-爬虫数据的存储_第5页
已阅读5页,还剩291页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第1章

爬虫与网络数据采集概述学习目标知识目标(1)理解数据采集与网络爬虫的概念。(2)了解数据采集的来源与方法。(3)熟悉网络爬虫的分类与应用场景。(4)掌握网络数据采集的原理与流程。(5)了解网络数据采集的实现技术。(6)掌握Python网络爬虫环境的安装与配置。(7)掌握常用网络爬虫可视化工具的安装。学习目标能力目标(1)能够区分通用网络爬虫与聚焦网络爬虫。(2)能够概括网络爬虫采集网页的原理与流程。(3)能够安装与配置网络爬虫集成开发环境。(4)能够使用网络爬虫可视化工具完成数据采集。素质目标(1)学习数据采集的法律法规,培养法律意识与法治观念。(2)知法守法,在数据采集过程中遵循Robots协议、合理获取数据。思维导图章节内容行业PPT模板/hangye/1.21.31.4走近网络爬虫网络数据采集的工作原理与流程网络数据采集的实现技术1.51.6网络数据采集的合法性Python爬虫环境搭建1.1认识数据采集1.7综合案例—采集豆瓣读书“小说”类图书信息PATR01认识数据采集数据采集的概念数据采集:是从不同来源收集所需数据的过程。网络数据采集任务的关键步骤(1)明确采集目标:定义要获取的数据和数据的用途。(2)选择采集工具:选择合适的采集工具。(3)设置采集规则:设定适当的访问频率、定义抓取的深度和广度。(4)分析网站结构:分析目标网站的页面结构。(5)实施数据抓取:从目标网站抓取数据。(6)数据清洗:对采集的数据进行清洗和转换。(7)数据存储:存储清洗后的数据。1.1.1常见的数据来源常见的数据来源有九种:(1)网页(WebPages)(2)应用程序接口(ApplicationProgrammingInterface,API)(3)数据库(Databases)(4)日志文件(LogFiles)(5)社交媒体(SocialMedia)(6)传感器数据(SensorData)(7)开放数据集(OpenDatasets)(8)文件(Files)(9)人工采集(ManualCollection)1.1.2数据采集的方法

数据库的采集方法:SQL查询、ETL工具、数据库导出功能、编程语言接口、ORM框架和实时数据流技术。系统日志的采集方法:ApacheFlume、ELKStack、Syslog服务、容器化环境的日志采集。网络数据的采集方法:网络爬虫(WebCrawler/Spider)、API调用、RSS订阅和可视化Web数据抓取工具。感知设备数据的采集方法:传感器直接读数、数据记录仪、物联网平台和无线传感网络。1.1.2PATR02走近网络爬虫网络爬虫的概念与分类网络爬虫(WebCrawler/WebSpider):也称为网页蜘蛛或网络机器人(WebRobot),本质上是一种按照特定规则自动浏览万维网并抓取信息的计算机程序或自动化脚本。网络爬虫分类(1)通用爬虫(GeneralPurposeWebCrawler/UniversalWebCrawler):广泛地爬取整个万维网的页面,限定特定的主题。(2)聚焦爬虫(FocusedCrawler/TopicalCrawler):爬取特定主题相关的网页。(3)增量式爬虫(IncrementalWebCrawler):采集新出现的或内容发生变化的网页。(4)深层网络爬虫(DeepWebCrawler):用来尝试自动提交表单、模拟登录、处理验证过程等,以访问和抓取这类“隐藏”信息的爬虫。1.2.1爬虫的应用场景搜索引擎构建爬虫最为人熟知的应用领域。新闻聚合与内容追踪自动从各类新闻门户、博客、论坛等信息源聚合新闻文章,为用户提供一站式的信息获取途径。数据挖掘与舆情监控采集大量数据,用于分析市场动态、跟踪竞争对手情报、洞察用户反馈及消费趋势。社交媒体洞察理解用户行为趋势、评估品牌公众形象、发现新兴热门话题以及把握网络文化脉络。01030204网络安全与事件响应利用爬虫扫描网站,以监测潜在的安全风险。05教学实践与学术研究专业的教学和自动化收集特定领域的学术论文、研究报告或公开数据集,用以提升文献调研和资料获取的效率。061.2.2PATR03网络数据采集的工作原理与流程网络数据采集的工作原理发起请求采集程序模拟浏览器向目标网站的服务器发送一个请求,表明获取特定页面的内容或数据。接收响应网站服务器在接收并处理请求后,会返回一个响应。常见的响应内容是HTML代码、JSON格式的数据,或者图片、视频。解析内容使用HTML解析库,并通过XPath或CSS选择器等定位技术,从响应内容中提取目标元素。处理和存储清洗和转换提取的内容,使其规整和可用,并存储处理后干净数据。循环和遍历采集重复执行请求、接收、解析、存储的流程,访问不同网页链接实现数据的批量获取。处理反爬虫机制为了完成数据采集任务,采集程序有时需要采取反反爬策略来规避反爬虫限制。1.3.1网络数据采集的流程1.3.2网络数据采集的流程确定目标确定数据来源、数据内容、采集范围、更新频率和合法性。选择采集工具或编写代码选择实现采集需求的工具或编程语言。制定数据采集策略02采集规划、反爬虫应对、数据处理计划和规则遵循。发起请求获取数据构建HTTP请求、发送HTTP请求、等待响应、处理响应、处理异常情况、处理响应内容。010304解析和提取数据使用解析库和定位技术,从响应内容中提取数据。05数据清洗和处理对提取的数据进行清洗、转换和整理。06数据存储根据数据类型选择存储数据的格式。07

处理反爬虫机制根据反爬机制实施相应的应对措施。08监控和维护监控和维护是保障采集任务长期稳定运行的持续性工作,它与主要流程并行。091.3.2PATR04网络数据采集的实现技术网络数据采集的编程语言PythonJavaGoPHPJavaScriptRubyScalaKotlin1.4.1

网络数据采集的可视化工具八爪鱼采集器火车采集器八爪鱼是一款全网通用的互联网数据采集器,通过模拟人类浏览网页的行为,只需简单的页面点选操作,生成自动化的采集流程,进而将网页数据转换为结构化数据,并存储为EXCEL或数据库等多种形式。火车采集器是一款专业的互联网数据抓取、处理、分析及挖掘软件,能够灵活、快速且高效地从互联网抓取网页信息,并存储至本地或远程数据库,之后经过一系列的分析与处理流程,精准挖掘出所需数据。集搜客是国内早期出现的网络爬虫工具之一,可协助用户抓取各类网站信息,并进行结构化处理与分析。它具备强大的定制化能力,用户可以根据需求设置爬虫规则,对抓取到的数据进行清洗、筛选、转换等操作GooSeeker集搜客1.4.2

网络数据采集的可视化工具后羿采集器ParseHub后羿采集器是一款基于人工智能技术的数据采集软件,通过计算机视觉技术与概念自动识别采集内容,用户无任何编程基础,也可以完成数据采集工作。ParseHub是一款免费且无需编码的云端可视化爬虫工具。用户通过点选与操作来定义数据提取规则,支持运用了AJAX、JavaScript、Cookie等技术的网站抓取数据。Octoparse是八爪鱼的海外版本,这款桌面应用软件具备强大的可视化操作界面,该工具提供XPath设置,可精准定位网页数据元素,支持导出多种格式的数据文件,如CSV、Excle、XML等。Octoparse1.4.2

网络数据采集的可视化工具ScrapyHubApifyScrapyHub是一个基于Scrapy框架的云端爬虫平台。它提供了一个简洁易用的Web界面,便于用户管理与运行自身的爬虫。Apify是全球较大的免费网络爬虫平台之一。它支持JavaScript和Node.js开发,提供了一个便捷易用的API和Web界面,使用户能够快速构建自身的爬虫。1.4.2PATR05网络数据采集的合法性Robtos协议Robots.txt:是一种存置于网站根目录下的文本文件,其主要用途在于向网络爬虫指明哪些页面能够被访问,哪些页面不应被访问。Robots.txt文件的常见用途与格式有如下几个方面:(1)指定爬虫访问权限:通过指定User-Agent和Disallow字段,对不同爬虫对网站的访问权限予以规定。(2)允许访问的路径:允许搜索引擎访问的路径与页面可以通过Allow字段予以指定。(3)特殊指令:除了Disallow和Allow指令之外,还存在其他一些特殊指令。例如,Sitemap指令可用于指定网站地图的位置。1.5.1Robtos协议【例1-1】Robots.txt文件。1 User-Agent:*2 Disallow:/private/3 Disallow:/admin/4 Allow:/public/5 Sitemap:/sitemap.xml1.5.1防爬虫的措施Robots.txt文件网站可运用Robots.txt文件来指示搜索引擎爬虫能够爬取的目标网站页面。验证码和人机验证在网站上设置验证码或人机验证机制,要求用户进行验证之后方可访问特定页面。IP封锁和限制访问频率网站可能会对访问频率予以监控,并限制来自单个IP地址的访问频率。动态页面加载和渲染部分网站采用JavaScript或动态加载内容的方式来呈现页面内容,这会可能让爬虫较难获取完整数据。01030204Cookie验证和会话跟踪网站可能借助Cookie进行用户识别与会话跟踪,未携带合适Cookie信息的访问可能会被视作非法访。05User-Agent检测和反爬虫算法网站可能会检测访问请求中的User-Agent信息,以此识别出可能的爬虫程序。061.5.2数据采集合法性案例数据采集的合法性是网络爬虫技术应用与数据科学实践中的基石。它不仅关乎个人隐私权益与企业商业利益的保护,更是企业建立公信力、实现长期可持续发展的核心保障。忽视数据采集的法律边界,可能给企业带来严峻的法律制裁、经济损失乃至声誉危机,对其发展轨迹产生深远负面影响。一个突出的反面案例发生在2022年。科技巨头Google公司与美国40个州的检察长联盟达成了一项总额高达3.915亿美元的和解协议。1.5.3PATR06Python爬虫环境搭建Python版本简介与安装1.6.1Python发展历程概述1)3.5引入async/await,革新异步编程。2)3.6带来f-strings,简化字符串格式化。3)3.7保证字典插入顺序,并优化性能。4)3.8加入赋值表达式(海象运算符:=)。5)3.9新增字典合并操作符,改进类型提示。6)3.10引入结构化模式匹配(match/case)。7)3.11对CPython解释器进行重大性能优化,引入异常组。8)3.12继续性能改进,增强f-string功能,提升子解释器隔离性。9)3.13则在探索移除全局解释器锁(GIL)以支持更精细的并行能力、引入可选的JIT编译器、进一步优化性能等方面持续推进。Python版本简介与安装1.6.1Python3.13的安装

访问Python官方网站下载并安装Python3.13。PyCharm的安装与配置1.6.2常见的PythonIDE概述PyCharmVisualStudioCode由JetBrains公司开发的强大PythonIDE。本书将会介绍其安装与配置,且书中爬虫代码均在PyCharm开发环境中编写与调试。微软推出的轻量级、免费且开源的软件。支持MacOS、Windows、Linux等多平台运行,保障开发人员工作效率与可移植性。面向数据科学的PythonIDE,集成IPython控制台、变量浏览器、绘图工具等。SpyderJupyterNotebook基于网页的交互计算应用程序,可应用于开发、文档编写、代码运行与结果展示的全过程。Python的官方IDE,随Python安装附带。IDLEPyCharm的安装与配置1.6.2安装PyCharm(1)打开PyCharm官方网站,单击Download按钮。(2)选择Windows系统的“PyCharmCommuntityEdition”,再次单击Download按钮下载安装包。(3)下载完成后,双击安装包,如pycharm-community-2024.3.5.exe,打开PyCharm安装界面。(4)设置PyCharm的安装路径,然后单击“下一步”按钮。(5)勾选在新界面中所有安装选项。(6)单击“安装”按钮,开始默认安装PyCharm。安装完成后单击“完成”按钮结束安装流程。PyCharm的安装与配置1.6.2配置PyCharm(1)双击打开PyCharm,选择“NewProject”选项创建新项目。(2)打开“NewProject”窗口,设置项目存储路径,如C:\BigData\crawlProject,新项目名称设定为“crawlProject”,IDE会默认关联Python解释器,再单击“Create”按钮创建新项目。PyCharm的安装与配置1.6.2配置PyCharm(3)进入PyCharm界面后,可以设置主题。选择File→Settings...选项,如下图所示。PyCharm的安装与配置1.6.2配置PyCharm(4)进入“Settings”界面后,选择Appearance&Behavior->Appearance选项,在该界面中从“Theme”下拉列表中选择界面的主题,以及在“Editorcolorscheme:”下拉列表中选择编辑器颜色风格,如下图所示。PyCharm的安装与配置1.6.2配置PyCharm(5)在“Setting”界面中,依次选择Project:CrawlProject->PythonInterpreter选项,在“PythonInterpreter”选项中设置项目的Python解释器为“Python3.13”,如下图所示。PyCharm的安装与配置1.6.2使用PyCharm

配置完PyCharm后,通过创建一个test.py文件来演示PyCharmr使用,操作步骤如下。(1)在打开的新建项目“CrawlProject”界面中,右击“CrawlProject”项目名,在弹出的快捷菜单中选择New->PythonFile选项,如右图所示。PyCharm的安装与配置1.6.2使用PyCharm(2)在弹出的“NewPythonfile”对话框中输入文件名“test”,即可新建test.py文件,如右图所示。(3)按“Enter”键打开test.py文件,进入PyCharm界面,在代码编辑区输入测试代码“print("Haveagoodday!")”,然后单击工具栏中的“运行”按钮,输出的运行结果为“Haveagoodday!”(4)PyCharm界面由菜单栏、工具栏、项目结构区、代码编辑区和信息显示区构成。Python爬虫相关库的简介与安装1.6.3常用爬虫相关库的简介

常用的爬虫相关库如表1-1所示。类型库名称描述主要用途链接请求库Requests轻量级的HTTP库,用于发送HTTP请求和处理响应。发送HTTP请求,处理响应,用于网页内容的获取/en/latest/urllibPython内置的库,用于执行与URL相关的各种操作用于操作网页URL,并对网页的内容进行抓取处理/3/library/urllib.htmlSelenium自动化浏览器操作工具,用于模拟用户在网页上的交互。处理动态加载的网页内容,支持模拟用户行为,例如点击、填写表单等https://www.selenium.dev/解析库lxml高性能的XML和HTML解析库,支持XPath和CSS选择器。快速解析HTML/XML文档,提供XPath和CSS选择器,方便数据提取https://lxml.de/BeautifulSoupHTML和XML解析库,用于从网页中提取数据。解析HTML/XML文档,提取所需数据/software/BeautifulSoup/PyQuery类似于jQuery的库,用于解析HTML文档并提供类似于jQuery的选择器语法。简化在HTML文档中查找和处理数据的过程/pyquery/爬虫框架Scrapy强大的开源网络爬虫框架,用于高效地提取数据。构建爬虫项目,支持模块化结构、并发请求、中间件、管道等功能/PySpider网络爬虫系统,具有WebUI、脚本编辑器、任务监控器、项目管理以及结果处理器。构建分布式、大规模的数据抓取、清洗、处理、存储和导出,配置和监控爬虫任务/en/latest/存储库PyMySQLPython中操作MySQL数据库的一个库。将爬虫数据存储到数据MySQL数据库,可对数据库和表进行增、删、查、改等操作https://pymysql.readthedocs.io/en/latest/PyMongoPython中操作MongoDB数据库的一个库。提供Python语言访问MongoDB服务器的接口/project/pymongo/Redisredis-py是一个用于连接和操作Redis数据库的Python客户端库。使用Python脚本与Redis服务器进行通信,执行如存储、检索和删除数据等操作/project/redis/3.3.6/1.6.3常用爬虫库的安装下面介绍Requests、Selenium、lxml、BeautifulSoup、PyQuery、Scrapy和PySpider库的安装的不同安装方法。(1)使用pip工具安装爬虫库。①

无镜像安装:执行“pipinstall库名”命令。在Windows任务栏的搜索框中输入cmd,打开命令提示符,于命令提示窗口输入“pipinstallrequests”,按Enter键,便可安装requests库。若安装成功,将会提示“successfully”,如右图所示。Python爬虫相关库的简介与安装1.6.3常用爬虫相关库的安装②

镜像安装:执行“pipinstall-i镜像源地址

库名”命令。例如,使用清华大学镜像源“/simple”安装lxml库,在命令提示窗口输入“pipinstall-i/simplelxml”,按Enter键,即可成功安装lxml库,如下图所示。Python爬虫相关库的简介与安装1.6.3常用爬虫相关库的安装(2)在PyCharm中安装爬虫库。①

安装单个库1)在PyCharm界面中,选择“File”->“Settings”命令,在打开的“Settings”对话框中选择“PythonInterpreter”命令,接着单击右侧窗口的“+”,如右图所示。Python爬虫相关库的简介与安装1.6.3常用爬虫相关库的安装(2)在PyCharm中安装爬虫库。2)在打开的“AvailablePackages”窗口的搜索框中输入“bs4”,然后单击窗口左下方的“InstallPackage”按钮。安装成功后,会在窗口的下方显示“Package‘bs4’installsuccessfully”信息,如右图所示。Python爬虫相关库的简介与安装1.6.3常用爬虫相关库的安装②

批量安装库。1)在工程文件的根目录“CrawlProject”新建一个txt文件,如library.txt(文件名可自定义),在library.txt文件中输入需要安装的爬虫库名称:Selenium、PyQuery、Scrapy,如右图所示。Python爬虫相关库的简介与安装1.6.3常用爬虫相关库的安装②

批量安装库。2)打开PyCharm底部工具栏的terminal(终端)窗口,在终端窗口中输入“pipinstall-rlibrary”命令,如下图所示。按回车键执行命令即可成功安装Selenium、PyQuery、Scrapy这三个库。Python爬虫相关库的简介与安装1.6.4八爪鱼采集器(Octoparse)作为一款用于抓取网页数据的网络爬虫工具,能够便捷且迅速地将网页数据转换为结构化数据,并存储于EXCEL或数据库等多种形式之中。同时,它还提供基于云计算的大数据云采集解决方案,可达成精准、高效且大规模的数据采集任务,广泛应用于数据挖掘、竞争情报、市场研究、数据分析等诸多领域。其安装步骤如下:(1)打开八爪鱼采集器的官方网站,选择“产品”选项,选定“SaaS版”,在新打开的页面中单击“免费下载按钮。(2)双击下载的软件安装包,如“OctopusSetup8.7.2.exe”,开启“Octopus安装”窗口,在“目标文件夹”处设置安装路径,然后单击“安装”按钮。(3)等待软件安装完成后,单击“完成”按钮。(4)双击“打开八爪鱼采集器”快捷方式,打开八爪鱼采集器界面。八爪鱼采集器的安装PATR07综合案例—采集豆瓣读书“小说”类图书信息1本案例旨在采集豆瓣读书栏目中“小说”类别的图书信息,打开目标网站地址/tag/%E5%B0%8F%E8%AF%B4,需要采集的图书字段包括作者、出版社、出版时间、价格、评分、评价人数以及简介,相关信息展示如下图所示,要求采集涵盖所有“小说”类图书信息。数据采集需求2(1)启动八爪鱼采集器,点击左侧菜单栏的“新建”命令,选取“自定义任务”。在弹出的“任务:新建任务”窗口中,在任务组文本框内输入:采集豆瓣读书“小说”图书信息,并在“网址”列表输入采集的目标网址,如下图所示,随后单击“保存设置”按钮。

数据采集实现2(2)八爪鱼采集器将自动识别网页数据并配置采集规则。在生成预设的采集规则后,用户需检查页面底部“数据预览”中的数据字段是否与采集需求相符,如下图所示。确认采集字段无误后,单击“生成采集设置”按钮。

数据采集实现2(3)此时,用户可在客户端右侧查看到采集规则,底部绿色的预选字段将变为白色,单击右侧的“点击翻页”按键,可以查看并预览下一页面的图书采集信息,如下图所示,接着,单击“保存并开始采集”按钮,启动采集页面。

数据采集实现2(4)在新弹出的对话框中选择采集方式,即本地采集或者云采集,此处选择“本地采集”中的“普通模式”,如下图所示。

数据采集实现2单击图1的“普通模式”按钮,用户可以观察到数据采集正在进行,如图2所示。

数据采集实现图1图22(5)当数据采集完成后,从下图的对话框中能够得知共采集到280条记录。单击中的“导出数据”按钮,打开“导出本地数据(豆瓣图书标签:小说)”对话框,在该对话框内选择导出文件类型,例如选择导出文件类型为“CSV文件”。将采集到的280条“小说”类图书信息存储至“豆瓣读书“小说”类图书信息.csv”文件。

数据采集实现网络数据采集活动常置于复杂的法律、伦理与商业情境之中。作为数据采集项目的参与者或负责人,既要服务于企业获取竞争优势的需求,又必须严格遵守相关法律法规与职业道德。请结合本章所学内容,思考以下问题:(1)在规划网络数据采集项目时,为了确保其合法性、合乎道德且能平衡相关方的权益,需要从哪些关键维度审慎确定数据的采集范围、内容与技术实现方式?(2)当采集目标为竞争对手的公开信息时,如何依据《反不正当竞争法》等相关法律法规及公认的商业道德准则,来界定合法的采集边界?请阐述在制定具体采集策略时,应如何平衡企业信息需求与避免构成不正当竞争行为,并分析可能遇到的技术或法律挑战及应对思路。(3)假设在项目执行中,面临紧迫的业务需求或进度压力,团队成员提议采用“边缘性”或存在法律合法争议的技术手段以获取数据。作为团队一员或负责人,你应如何基于职业道德规范与社会责任感,有效地说服团队放弃此类高风险方案,并引导项目回归合法的技术路径?请列出具体的沟通策略与行动步骤。(4)探讨企业可以采取哪些长效机制,以系统性地提升数据采集团队及相关人员的法律意识、技术规范认知与道德素养,从而在组织层面保障数据采集活动的正当性与可持续性?可结合具体实例或设想场景进行说明。

思考题实训1Python网络爬虫环境搭建与配置1.实训目标(1)掌握在Windows操作系统上安装Python解释器。(2)掌握在Windows操作系统上安装Python集成开发环境PyCharm。(3)学会通过Settings设置PyCharm环境、PythonInterpreter。(4)能够使用pip安装Python网络爬虫常用库,如requests、lxml等。(5)掌握在PyCharm中安装Python网络爬虫常用库,如Scrapy、BeautifulSoup等。

课后实训案例实训1Python网络爬虫环境搭建与配置2.实训内容(1)在个人计算机上安装Python3.13以及PyCharm2024.3.5软件。(2)对PyCharm的主题、字体、字号等环境参数进行设置,将PythonInterpreter选定为Python3.13,并尝试运用PyCharm编写代码,使其输出:Hello,Spider。(3)借助pip工具在“命令提示符”环境中安装requests、lxml等常用爬虫库。(4)在PyCharm中安装常用爬虫库BeautifulSoup、Scrapy、PyQuery、Selenium等。

课后实训案例实训1Python网络爬虫环境搭建与配置3.实训思路与步骤(1)依据1.6.1小节内容,完成Python3.13的下载与安装操作。(2)参照1.6.2小节内容,完成PyCharm2024.3.5的下载、安装与配置流程。(3)运用pip工具依序完成requests、lxml等库的安装操作。(4)采用PyCharm单个安装方式完成BeautifulSoup库的安装。(5)利用PyCharm批量安装功能完成Scrapy、PyQuery、Selenium等库的安装。

课后实训案例实训2新浪微博搜索关键词信息采集1.实训目标(1)深入理解网络数据采集的工作原理。(2)熟练掌握网络数据采集的基本流程。(3)熟练掌握网络数据采集可视化工具的安装方法。(4)熟悉网络数据采集可视化工具的使用技巧。(5)能够依据数据采集需求精准明确采集目标、深入分析采集思路并确定合理的采集规则。(6)学会运用网络数据采集可视化工具高效地实现数据采集任务。

课后实训案例实训2新浪微博搜索关键词信息采集2.实训内容(1)在用户计算机上完成网络数据采集可视化工具(如八爪鱼采集器)的下载与安装。(2)运用八爪鱼采集器在新浪微博网站(/weibo?q=%E7%BD%91%E7%BB%9C%E7%88%AC%E8%99%AB)中采集搜索关键词为“网络爬虫”的发帖信息,需抓取的字段包括发帖的用户名、头像链接、标题、发表时间、发表内容、分享数、评论数以及点赞数。。

课后实训案例实训2新浪微博搜索关键词信息采集3.实训思路与步骤(1)参照1.6.4小节,完成八爪鱼采集器的下载与安装。(2)深入分析新浪微博搜索关键词“网络爬虫”的采集需求与采集思路。(3)依据1.7节内容,运用八爪鱼采集器实现新浪微博搜索关键词“网络爬虫”的发帖信息采集操作。

课后实训案例谢谢听聆第2章网络爬虫基础知识学习目标知识目标(1)深入理解浏览器加载网页的详细过程及其内在机制。(2)全面了解网页的基本构成要素、相关技术与架构等基础知识。(3)牢固掌握HTTP协议的核心概念、原理、请求与响应机制等基础知识。(4)对Google开发者工具的功能、用途与操作方法有清晰的认知。学习目标能力目标(1)能够区分网页数据的多种不同格式,并能依据格式特点进行有效处理与分析。(2)能够总结网络HTTP基础知识,构建完整的知识体系并能灵活运用。(3)能够构建网络爬虫工作流程的整体认知框架,理解各环节的关键作用与相互关系。素质目标(1)通过学习网页基础知识,深刻领悟基本的网络原理与知识体系,熟练掌握常见的网络相关概念及其内涵。(2)熟练运用常见的HTML标签和属性,精通CSS选择器的使用技巧与应用场景。(3)在网络爬虫的实践应用过程中,牢固树立相关的法律法规和道德准则意识,自觉规范行为,确保合法合规操作。思维导图章节内容行业PPT模板/hangye/2.22.32.4网页基础知识HTTP基础知识Google开发者工具2.5综合案例-采集2024中国大学排名2.1浏览器加载网页的过程PATR01浏览器加载网页的过程网页基础知识关键概念2.1HTML(HypertextMarkupLanguage)HTML作为一种标记语言,用于构建网页的结构与内容框架。其文档由一系列HTML标签构成,各标签负责界定页面的不同组成部分,诸如标题、段落、链接等元素CSS(CascadingStyleSheets)CSS专注于描述网页的样式呈现与布局规划,能够为HTML元素赋予丰富多样的样式属性,涵盖字体样式、颜色设定、布局模式等方面JavaScript属于脚本语言,主要用于实现网页的交互功能与动态效果展示。通过JavaScrip能够灵活操作DOM及时响应用户的各类操作行为,并有效进行数据交互处理DOM(DocumentObjectModel)DOM是HTML和XML文档的编程接口,它将文档以树状结构进行表征,其中每个节点均对应文档中的一个特定元素HTTP(HypertextTransferProtocol)HTTP是在Web浏览器与服务器之间进行数据传输的协议规范。浏览器借助HTTP协议向服务器发起网页资源请求,服务器则依据该协议响应并传输相应数据资源HTTPS(HypertextTransferProtocolSecure)HTTPS是HTTP的安全增强版本,通过在HTTP基础上融入SSL/TLS协议,达成对传输数据的加密处理与通信双方的身份验证,显著提升通信过程的安全性与保密性URL(UniformResourceLocator)URL作为用于定位与访问Web资源的地址标识,涵盖协议类型(如http或https)、域名、路径等关键信息要素DNS(DomainNameSystem)DNS负责将域名映射为对应的IP地址。在浏览器加载网页时,需进行DNS解析操作,以将用户输入的域名转换为服务器的实际IP地址,从而建立有效的网络连接TCP(TransmissionControlProtocol)TCP是一种传输层协议,其核心作用在于保障网络上数据传输的可靠性与稳定性。浏览器与服务器之间通过建立TCP连接来实现HTTP请求与响应的可靠传输。浏览器加载网页的过程2.1PATR02网页基础知识网络开发技术-前端开发技术2.2.1123

3HTML/CSS/JavaScriptHTML用于界定网页的结构框架,涵盖标题、段落、链接、表单等基础元素。CSS负责网页的视觉呈现与布局样式设定。JavaScript为网页赋予动态交互特性,可响应诸如用户点击、输入、滚动等操作行为。前端框架和库React:由Facebook开发的用于构建用户界面的JavaScript库,支持组件化开发模式。Angular:Google开发的完整前端框架,配备一整套工具与架构体系,适用于构建大型单页应用程序。Vue.js:一款渐进式JavaScript框架,具有易于上手的特性,能够迅速搭建交互式界面。Ajax(AsynchronousJavaScriptandXML)可在不重新加载整个网页的情形下,与服务器异步交互数据的技术手段,显著优化了用户体验,使网页能够局部动态更新内容而无需整页刷新。网络开发技术-后端开发技术2.2.1MySQL一个流行的关系型数据库管理系统,用于存储结构化数据MongoDB一种NoSQL数据库,适用于存储和处理非结构化或半结构化数据SpringSpring是基于Java的后端开发框架,广泛应用于企业级开发。它提供了一整套解决方案,包括依赖注入、AOP、事务管理等。Spring的核心模块包括SpringCore、SpringMVC和SpringBoot等,适用于构建高度可维护和扩展的应用。Node.jsNode.js是一个基于JavaScript的后端开发环境,允许在服务器端运行JavaScript代码。它采用事件驱动和非阻塞I/O模型,特别适合高并发应用,如实时聊天或流媒体服务DjangoDjango是基于Python的Web框架,提供了大量内置功能,如ORM、表单处理和用户认证,并且自带一个强大的管理后台。它遵循MVC模式,旨在快速开发复杂的Web应用程序FlaskFlask也是基于Python的Web框架,提供一个轻量级、灵活的开发环境。与Django相比,Flask更加简洁,允许开发者根据需要集成其他库,适合中小型项目和需要高度自定义的开发RubyonRails一个基于Ruby语言的Web框架,采用"约定优于配置"的原则,通过简化配置工作来提高开发效率。它提供了ORM功能,并适用于快速构建Web应用程序后端技术数据库技术APIAPI定义了不同软件组件如何相互通信,用于不同软件组件之间进行通信和交换数据的接口WebSocketWebSocket是一种能够在单个TCP连接上实现全双工通信的协议,特别契合实时性要求较高的应用场景,如在线聊天和实时通知等功能的实现服务器管理工具如Docker和Kubernetes,用于应用程序的部署、管理与扩展操作,有助于提升运维效率与系统可靠性安全性和身份验证采用诸如加密、OAuth等技术确保数据安全性,有效防范数据泄露与非法访问风险通信与安全技术网页的结构2.2.2-01-<!DOCTYPEhtml>HTML文档声明-02-<htmllang="en">根元素<html>标签是整个HTML文档的根元素,所有的网页内容都必须包含在<html>和</html>标签之间。该元素通常带有语言属性,如lang="en",用于指定文档的语言。-03-<head><metacharset="UTF-8"><metaname="viewport"content="width=device-width,initial-scale=1.0"><title>MyWebPage</title></head>头部元素<head>标签是HTML文档的头部元素,包含网页的元数据(metadata),包含标题(<title>)、字符集声明(<metacharset=“UTF-8”>)、视口设置(<metaname=“viewport”>),以及通过<link>和<script>标签引入外部样式表和脚本文件网页的结构2.2.2-05-<p>Thisisaparagraphoftext.</p>段落元素段落元素<p>用于定义文本文段,它是网页中最基本的文本块标签。每个段落之间会有默认的空隙,以便清晰展示内容-04-<body></body>主体元素<body>标签是HTML文档的主题元素,包含了网页的主要可见内容,如文本、图像、链接等。爬虫在抓取数据时,主要是从<body>部分提取信息,因为这是用户实际浏览时看到的内容-06-<h1>这是一级标题(h1)</h1><h2>这是二级标题(h2)</h2><h3>这是三级标题(h3)</h3><h4>这是四级标题(h4)</h4><h5>这是五级标题(h5)</h5><h6>这是六级标题(h6)</h6>标题元素HTML提供了六级标题元素(<h1>到<h6>),用来定义网页的标题层次网页的结构2.2.2-08-<ahref="">VisitE</a>链接元素链接通过<a>标签定义,href属性指定链接的目标地址-07-<ul><li>Item1</li><li>Item2</li></ul>列表元素HTML提供两种常用的列表:(1)有序列表(<ol>):带有序号的列表。(2)无序列表(<ul>):使用圆点符号的列表。列表项由<li>标签定义。-09-<imgsrc="example.jpg"alt="ExampleImage">图像元素图像通过<img>标签插入网页,src属性指定图像文件的路径,alt属性提供替代文本,用于当图像无法显示时提示用户网页的结构2.2.2-10-<table><tr><th>Header1</th><th>Header2</th></tr><tr><td>Data1</td><td>Data2</td></tr></table>表格元素表格使用<table>标签定义,由表格行(<tr>)、表格单元格(<td>)和表格标题(<th>)组成。表格常用于结构化数据的展示。网页的结构2.2.2-11-<formaction="/submit"method="post"><inputtype="text"name="username"placeholder="Enteryourname"><buttontype="submit">Submit</button></form>表单元素表单通过<form>标签定义,包含输入字段、按钮、下拉菜单等元素,通常用于用户提交数据。表单是网络爬虫常见的数据提交和抓取来源。-12-<!--Thisisacomment-->注释注释通过<!--注释内容-->添加,不会在网页中显示。它们用于对HTML代码进行说明,方便开发者阅读和维护。网页的结构2.2.2-一个简单的HTML网页结构-<!DOCTYPEhtml><htmllang="en"><head><metacharset="UTF-8"><metaname="viewport"content="width=device-width,initial-scale=1.0"><title>MyWebPage</title></head><body><h1>WelcometoMyWebPage</h1><p>Thisisaparagraphoftest</p><ul><li>Item1</li><li>Item2</li></ul><imgsrc="example.jpg"alt="ExampleImage"><ahref="">VisitE</a></body></html>2.2.3网页的分类类型优点挑战适用场景静态网页结构简单、加载速度快、爬取容易。无动态生成过程,爬虫易抓取。公司简介、个人博客、小型网站等。动态网页能够实时生成个性化内容。爬虫需要处理页面的动态生成过程,或通过API获取数据。电子商务网站、社交媒体平台、内容管理系统等。响应式网页跨设备优化,用户体验一致。可能存在布局差异,爬虫需要确保提取的是正确内容。企业官网、电商平台、新闻网站等。单页应用用户体验更流畅,减少了页面跳转。依赖JavaScript进行内容加载,爬虫需模拟浏览器行为或分析API请求。实时应用、社交媒体、复杂的Web应用程序等。网页的分类这些网页分类之间并非相互隔绝、界限分明。一个网站往往能够同时展现出多种不同的特性.以一个典型的现代化电子商务网站为例,有可能借助动态网页技术来达成个性化商品推荐的功能,同时,还可能采用响应式设计理念,以确保网站页面在各类移动设备上都能够实现良好的适配效果,此外,在网站的部分页面中,还可能运用单页应用技术,从而实现更为流畅的用户交互过程,减少页面刷新带来的等待时间与视觉中断,使用户在浏览商品详情、进行购物车操作等过程中感受到无缝衔接的流畅性。2.2.3网页数据的格式2.2.4HTML作为网页的基础结构格式,借助标签对文本、图像等内容予以组织并呈现。HTML的树状结构(DOM树)对于网络爬虫意义重大1.HTML图2-3HTML文档结构示意图CSS主要用于管控网页的样式与布局,开发者可借此定义网页元素的外观特性,诸如字体、颜色、间距、对齐方式等。在解析网页时,爬虫需要明晰CSS类名和ID选择器的效用,以便精准定位HTML中的特定元素2.CSS/*设置页面背景颜色*/body{background-color:#f0f0f0;font-family:Arial,sans-serif;}/*设置标题的样式*/h1{color:#2c3e50;font-size:36px;text-align:center;margin-bottom:20px;}/*设置按钮样式*/button{background-color:#3498db;color:white;padding:10px20px;border-radius:5px;cursor:pointer;}网页数据的格式2.2.4JavaScript通过操作DOM,实现对网页内容的动态修改、响应用户操作以及异步加载数据等功能。由JavaScript生成的动态内容对网络爬虫构成一定挑战,尤其针对那些依赖JavaScript加载的数据,通常要求爬虫配合模拟浏览器行为(如借助Selenium工具)或直接抓取JavaScript请求的数据源,方可实现有效数据采集。3.JavaScript<!DOCTYPEhtml><htmllang="en"><head><metacharset="UTF-8"><metaname="viewport"content="width=device-width,initial-scale=1.0"><title>JavaScript示例</title></head><body><h1>欢迎使用JavaScript示例</h1><buttonid="myButton">点击我</button><script>//获取按钮元素

constbutton=document.getElementById('myButton');//为按钮添加点击事件

button.addEventListener('click',function(){alert('按钮已被点击!');});</script></body></html>网页数据的格式2.2.4JSON(JavaScriptObjectNotation)是一种轻量级的数据交换格式,普遍应用于客户端与服务器之间的数据传输作业。它以键值对的形式组织数据,具备易于阅读、编写以及便于机器解析和生成的特性。在网络爬虫抓取动态网页时,常常需处理JSON格式的数据,例如通过API接口获取信息。JSON的结构化特点使其极为适合存储与传输复杂的嵌套数据。4.JSON{"name":"John","age":30,"city":"NewYork"}网页数据的格式2.2.4XML(eXtensibleMarkupLanguage)属于一种可扩展的标记语言,广泛应用于描述与传输数据。与HTML类似,XML同样运用标签定义数据,但更侧重于数据的结构化描述,而非展示功能。XML常见于Web服务的数据交换场景,网络爬虫可通过解析XML获取并处理结构化数据右侧是一个简单的XML示例,表示一本书的信息,<bookstore>是根元素,包含多个<book>元素。每个<book>元素包含书名<title>、作者<author>、出版年份<year>和价格<price>等子元素。在<title>元素中,使用了lang属性来表示书名的语言(例如"en"表示英文,"zh"表示中文)5.XML<?xmlversion="1.0"encoding="UTF-8"?><bookstore><book><titlelang="en">LearningXML</title><author>JohnDoe</author><year>2024</year><price>29.99</price></book>

<book><titlelang="zh">学习XML</title><author>张伟</author><year>2023</year><price>39.99</price></book></bookstore>网页数据的格式2.2.4CSV是一种简单的文本格式,用于存储表格数据。每一行代表一条记录,每个字段之间由逗号分隔。CSV格式被广泛用于数据导出和导入,因其结构简单且易于解析,网络爬虫在处理数据表格时,可能会遇到以CSV格式提供的数据文件。6.JSONName,Age,CityJohn,30,NewYorkRDF(ResourceDescriptionFramework)是一种用于描述资源及其关系的数据模型,主要应用于语义网技术领域。RDF格式的数据不仅能够呈现资源的属性,还可表达资源之间的关联关系,常见于知识图谱、语义搜索等高级应用场景。尽管RDF在常规网页中的应用相对较少,但在特定领域(如图书馆数据或LinkedData)却具有重要地位。7.RDF<?xmlversion="1.0"?><rdf:RDFxmlns:rdf="/1999/02/22-rdf-syntax-ns#"xmlns:dc="/dc/elements/1.1/"><!--资源URI表示一本书--><rdf:Descriptionrdf:about="/book/12345"><dc:title>LearningRDF</dc:title><dc:creator>JohnDoe</dc:creator><dc:date>2024</dc:date><dc:language>en</dc:language><dc:publisher>ExamplePublisher</dc:publisher></rdf:Description></rdf:RDF>网页数据的格式2.2.4Markdown作为一种轻量级标记语言,常被用于编写格式简单的文档,如README文件或博客文章等。它能够便捷地转换为HTML格式,进而在网页上予以显示。Markdown在开发者社区应用广泛,尤其在内容管理系统和文档工具领域,其简洁性与易用性使其成为众多静态网页生成器的首选格式。8.Markdown#Heading1##Heading2-Listitem1-Listitem2不同格式的网页数据在各自的应用场景中均发挥着重要作用。网络爬虫在实际操作过程中,需依据网页所采用的不同数据格式,选取适宜的解析与处理方式。例如,爬虫可直接解析HTML结构以提取内容,亦能通过剖析JSON或XML数据接口抓取动态生成的数据。理解这些常见数据格式有助于爬虫更高效地进行数据采集和处理。PATR03HTTP基础知识URL简介2.3.1片段标识符以#开头,标识资源中的特定部分,常用于直接跳转到页面中的特定位置。协议(Protocol)指定访问资源所使用的协议,例如HTTP、HTTPS、FTP等)主机(Host)表示资源所在服务器的域名或IP地址,如。它指向资源的存储位置路径(Path)表示服务器上资源的具体位置,通常类似于文件系统中的文件路径查询参数包含在URL中的键值对,用于传递额外信息,如搜索关键字或过滤条件。它们以?开头,多个参数用&分隔端口(Port)用于指定连接到主机的端口号,是可选的。:8080/path/to/resource?param1=value1¶m2=value2#section1示例:HTTP与HTTPS2.3.2HTTPSHTTPHTTP(超文本传输协议)是客户端与服务器之间传输数据的标准协议HTTP依托TCP/IP通信协议来传递网页数据,涵盖HTML文件、图像、查询结果等各类信息HTTP的主要特性为无状态性,即每个请求均相互独立HTTP的URL以“http://”开头,默认借助端口80开展通信HTTP传输的数据呈明文形式,未施加加密保护措施,故而易于被截取或窃听,不适宜用于传输敏感信息,诸如登录凭据、信用卡号等HTTPS是HTTP的安全强化版本,具备加密与身份验证机制,保障数据在传输进程中的安全性借助TLS或SSL对数据进行加密处理,有效防止数据在传输途中被窃取或篡改HTTPS的URL以“https://”开头,适用于需要保护用户隐私和敏感数据的场景,如登录页面、在线支付平台等。随着互联网安全需求的提升,HTTPS已经成为默认标准,提供了更高的保护,减少了数据泄露的风险。因此,在进行网络爬虫设计时,特别是在抓取需要登录的网站时,了解并使用HTTPS至关重要。HTTP请求格式2.3.3

04

03

02

01请求行作为HTTP请求的起始行,涵盖三个核心部分:请求方法:GET、POST、PUT、DELETE请求的资源路径(URL):明确指示所请求资源在服务器端的具体路径所使用的协议版本:指定当前请求所采用的HTTP版本,如HTTP/1.1

请求行请求头部包含一系列键值对,Host:用于指定请求的目标主机名User-Agent:提供客户端的浏览器类型以及操作系统相关信息Accept:指示客户端能够处理的响应内容类型请求头部在请求头部和请求体之间,有一个空行用于分隔它们。这个空行非常重要,标志着请求头部的结束和请求体的开始

空行请求体主要用于承载要发送给服务器的数据,通常在POST或PUT请求中发挥作用。请求体可包含多种格式的数据,如表单数据、JSON数据

请求体GET/index.htmlHTTP/1.1Host:User-Agent:Mozilla/5.0(WindowsNT10.0;Win64;x64)AppleWebKit/537.36(KHTML,likeGecko)Chrome/91.0.4472.124Safari/537.36Accept:text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8username=johndoe&password=pass123HTTP请求示例在例2-25中,请求行表示客户端使用GET方法请求服务器上的/index.html资源,使用的协议版本为HTTP/1.1。请求头部包含了主机信息、客户端信息(如浏览器类型),以及客户端可接受的响应格式。在例2-25中没有请求体,因为GET请求通常不包含请求体,但对于POST等其他方法,请求体可能包含用户提交的数据理解HTTP请求格式是编写和调试网络爬虫的重要基础。通过准确构造HTTP请求,爬虫可以有效地与服务器进行通信,获取所需的数据。实际的HTTP请求可能会包含更多的头部信息和请求体内容,这取决于具体的请求类型和用途2.3.3GET/index.htmlHTTP/1.1Host:User-Agent:Mozilla/5.0(WindowsNT10.0;Win64;x64)AppleWebKit/537.36(KHTML,likeGecko)Chrome/91.0.4472.124Safari/537.36Accept:text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8HTTP响应格式2.3.4

04

03

02

01状态行包含了HTTP协议版本、状态码以及状态消息,其核心作用在于指示服务器对请求的处理结果状态码:由三位数字组成,用于表示响应的处理状态状态消息:与状态码对应的描述性短语

状态行响应头部包含了与服务器和响应相关的各类信息,例如服务器类型、响应日期、内容的类型等Server:用于表示服务器类型及其版本信息Date:指示响应生成的具体时间Content-Type:明确返回数据的类型及字符编码方式响应头部空行用于分隔响应头部和响应体。它是响应头部结束的标志,紧接在空行后面的部分是响应体(如果有)

空行响应体包含了服务器返回给客户端的实际数据,其数据格式可能为HTML、JSON、XML、图片等多种类型。在网络爬虫的作业流程中,响应体是爬虫抓取的核心数据部分。

响应体HTTP/1.1200OKServer:Apache/2.4.29(Unix)Date:Sat,01Jan202312:00:00GMTContent-Type:text/html;charset=utf-8完整的HTTP响应案例2.3.4HTTP/1.1200OKServer:Apache/2.4.29(Unix)Date:Sat,01Jan202312:00:00GMTContent-Type:text/html;charset=utf-8<!DOCTYPEhtml><html><head><title>ExamplePage</title></head><body><h1>Hello,World!</h1></body></html>在左侧案例中所包含的信息如下。(1)状态行:HTTP/1.1200OK,表示请求成功处理并返回相应内容。(2)响应头部:涵盖服务器信息、响应生成时间以及内容类型等关键信息。(3)响应体:服务器返回的HTML文档。HTTP状态码2.3.4200OK:请求成功,并返回相应的内容。201Created:请求成功,并创建了新的资源。204NoContent:请求成功,但没有返回任何内容。2xx成功301MovedPermanently:请求的资源已永久移动到新的URL。302Found/303SeeOther:请求的资源暂时移动到新的URL。304NotModified:客户端缓存的资源为最新版本,不需要重新传输。3xx重定向400BadRequest:请求无效或参数错误。401Unauthorized:需要身份验证才能访问资源。404NotFound:请求的资源不存在。4xx客户端错误500InternalServerError:服务器遇到了意外错误,无法完成请求。503ServiceUnavailable:服务器暂时无法处理请求,通常是因为过载或维护。5xx服务器错误Cookie简介Cookie是一种存储在用户计算机上的小型文本文件,它主要用于跟踪用户的会话信息、记录用户的偏好设置,以及实现其他与用户相关的功能。Cookie通常由服务器在HTTP响应的Set-Cookie头部中发送给浏览器,然后浏览器在后续的HTTP请求中通过Cookie头部将这些信息发送回服务器。Cookie的基本结构如下所示name=value:存储在Cookie中的数据,以键值对的形式表示。name是Cookie的名称,value是其对应的值。expires=date:Cookie的过期日期,超过这个日期后,浏览器将不再发送该Cookie。未指定expires时,Cookie的有效期通常为会话结束。path=path:指定Cookie有效的路径,只有当请求的路径匹配该值时,浏览器才会发送Cookie。domain=domain:指定Cookie有效的域名,只有当请求的域名匹配该值时,浏览器才会发送Cookie。secure:表示该Cookie只能通过HTTPS协议传输,确保数据安全性。2.3.5Set-Cookie:name=value;expires=date;path=path;domain=domain;secureCookie实例Cookie实例sessionId=abc123:这是一个名为sessionId的Cookie,值为abc123。expires:Cookie将在2024年6月9日过期,之后浏览器将不再发送此Cookie。path=/:Cookie在整个网站(所有路径)下均有效。domain=:此Cookie仅在域及其子域名下有效。secure:该Cookie只能通过HTTPS传输,增强了安全性。2.3.5Set-Cookie:sessionId=abc123;expires=Wed,09Jun202410:18:14GMT;path=/;domain=;secure注意Cookie是实现用户识别和会话管理的重要工具。理解其结构和机制,能够帮助开发者在Web开发和网络爬虫设计中合理使用Cookie。虽然Cookie在Web应用中非常有用,但滥用Cookie可能会引发用户隐私方面的担忧。尤其是在涉及跟踪用户行为或跨站点请求时,开发者需要谨慎。PATR04Google开发者工具Google开发者工具简述2.4DevToolsGoogle开发者工具(GoogleDeveloperTools),通常简称为DevTools,是由GoogleChrome浏览器提供的一组内置的开发者工具,用于在浏览器中进行调试、分析和优化网页。DevTools打开方式2.4123

3快捷键在Windows/Linux系统下,按F12键或Ctrl+Shift+I键。在Mac系统下,按Cmd+Option+I键。菜单单击Chrome浏览器右上角的菜单按钮(三个竖点),选择“更多工具”->“开发者工具”右键菜单在网页上右击,选择“检查”在GoogleChrome浏览器中可以通过多种方式打开DevT

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论