编写简单爬虫程序_第1页
编写简单爬虫程序_第2页
编写简单爬虫程序_第3页
编写简单爬虫程序_第4页
编写简单爬虫程序_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

编写简单爬虫程序XPath和LxmlLxml是使用XPath语法帮助我们解析HTML、XML文件,快速定位,搜索、获取特定内容的Python库。XPath是一门在XML文档中查找信息的语言。XPath使用路径表达式在XML文档中进行导航。XPath包含一个标准函数库。XPath是XSLT中的主要元素。XPath是一个W3C标准。用Lxml解析数据

用新浪股票为例:/sh601989.html,这个是打开中国重工的股票页面,针对页面的数据例如想抓取股票名称、代码、股票价格。待抓取股票信息

<divclass="qphoxheader_titlemb7"style="z-index:11;">

<h2class="header-title-h2fl"id="name">中国重工</h2><bclass="header-title-cfl"id="code">601989</b><divstyle="float:left;height:39px;"class="stock-msg"><spanid="rongi"class="rongiflml5"title="该股票为融资融券标的"><ahref="/rzrq/detail/601989.html"target="_blank"><b>两融</b></a></span><divid="stock_change_name"class="exName"><spanclass="rongi"style="position:relative"><b>更名</b></span><divclass="comNameExInfo"style="display:none;"><iclass="arrowUp"></i><iclass="closeBtn"></i><h3class="exNameTitile">公司名称变更信息</h3><divclass="exNameMsg"><divclass="shorthand"><spanclass="shorthandEx">简称变更:</span><pclass="shorthandInfo"></p></div></div></div></div>用Lxml解析数据用Lxml解析数据抓取股票名称和股票代码运行效果网络爬虫外部数据的获取可以采用网络爬取和数据平台直接获取等方式。例如,我们可以从上交所网站、深交所网站、东方财富网Choice数据平台爬取不同行业和企业、不同年度的资产负债表、利润表、现金流量表等年报和季报数据,也可使用网站自带EXCEL插件功能将财务数据导出到Excel。另外还可使用万得Wind数据库、国泰安CSMAR数据库下载相关财务数据。网络爬虫(又称为网页蜘蛛,网络机器人),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。使用某种技术(如正则表达式、XPath等)提取页面中我们感兴趣的信息;高效地识别响应页面中的链接信息,顺着这些链接递归执行此处介绍的前面步骤;使用多线程有效地管理网络通信交互。外部数据网络爬取流程网络爬虫网络爬虫的核心工作:网络爬虫

向URL发送请求,获取服务器响应内容。这个核心工作其实是所有网络爬虫都需要做的通用工作。一般来说,通用工作应该由爬虫框架来实现,这样可以提供更稳定的性能,开发效率更高。取页面中我们感兴趣的信息。这个核心工作不是通用的!每个项目感兴趣的信息都可能有所不同,但使用正则表达式提取信息是非常低效的,原因是正则表达式的设计初衷主要是处理文本信息,而HTML文档不仅是文本文档,而且是结构化文档,因此使用正则表达式来处理HTML文档并不合适。使用XPath提取信息的效率要高得多。

多线程管理:这个核心工作是通用的,应该由框架来完成。

识别响应页面中的链接信息。使用正则表达式可以实现这个核心工作,但是效率太低,使用XPath会更高效。xxx是我们需要安装库的名称。比如安装requests库

使用pip安装第三方库,命令行中执行:pipinstallxxx。Pip是Python官方推荐的包管理工具,提供了对Python包的查找、下载、安装、卸载的功能,属于python的一部分。Python3.0以上的版本都是自带pip的,无需再次下载安装。XPath与Request工具包安装XPath与Request工具包安装用文本编辑工具或者Pycharm工具新建一个P

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论