版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要STEAM作为一个近几年来玩家数量剧增的游戏平台,它的热度提高也带来了饰品交易量的巨大增长,饰品从一个游戏的装饰道具逐渐变成了商品性质的道具,玩家之间饰品交易越来越多。既然饰品有了商品性质,那么必然会有市场交易的形成,玩家之间的饰品交换难免会出现欺诈问题,然而STEAM平台自身的市场交易所带来的资金只能用于再次在STEAM市场地消费,再加上市场本身高额的手续费,每一单交易会收取5%的手续费,这对于很多玩家来说很不方便。第三方平台交易相比STEAM市场交易少了手续费,也能够将交易所获资金提现。但是不同平台之间有着价格差异,分析相同饰品在不同平台的不同价格需要同时获取不同平台的很多价格数据,利用专业知识,设计一个爬虫程序来获取价格数据,只要能获得相应数据那就对具体项目目的分析有很大帮助,本项目系统对于玩家进行饰品分析有着良好的前景。基于爬虫程序的STEAM市场数据分析及应用,项目包括爬虫数据获取端和前端数据展示页面。爬虫数据获取部分实现对于饰品价格数据的获取功能,前端页面展示相应饰品价格数据。爬虫程序采用JAVA语言编程,前端页面展示实现利用HTML、css等技术。关键词:STEAM市场;网络爬虫技术;前端技术第1章绪论1.1设计背景及意义STEAM作为PC游戏界最大的数码发行平台之一,玩家用户可以在该平台购买、下载游戏软件,还能在玩家社区对于游戏内容进行讨论和分享。同时STEAM平台也有自己的一套市场交易体系,方便玩家之间交易各种游戏以及游戏衍生品。STEAM平台最为人所熟知的游戏就是半条命了,作为1998年推出的第一个科幻类型的第一人称射击游戏,开创了FPS即射击游戏的新规范。近几年来,STEAM平台玩家数量激增,最高时同时在线玩家人数达到了2300万。各种游戏以及衍生品的交易次数也呈现几何式增长,但是由于STEAM平台的交易限制,玩家在交易中获得的虚拟货币只能用于在平台中购买游戏或者游戏饰品,并不能进行提现,并且每一笔在STEAM市场的交易都会收取13%的手续费。这就导致了众多的第三方平台的出现,在众多第三方平台里网易BUFF、IGXE属于规模较大的第三方平台,每天的成交量,成交金额巨大。游戏饰品根据它的珍稀程度有着不同的价值,近几年来由于玩家数的突增,以及游戏的热度提升,导致游戏饰品的价格飞涨。第三方平台的出现,玩家能够在饰品的交易从中获利,是因为各种平台存在着价格差异,不同平台之间同样的游戏饰品价格差异很大,同时饰品的价格还在不断波动的变化中。整个STEAM市场交易的发展前景非常可观,玩家数量一直在增长,交易额每日都有提升。因此如果能够利用爬虫程序去分析STEAM市场与第三方平台之间的价格数据差异,就能利用相应的数据信息分析来获取相对优惠的价格。所以整个项目重要的部分就是爬虫程序实现关于价格数据的获取。同时怎样去设计一个高性能的网络爬虫系统框架是一个很复杂的工作,对于系统的改良从未停止过。设计一个高性能的网络爬虫方案项目需要考虑以下几个方面的问题:1)一个高性能的爬虫程序需要有能够进行海量数据抓取的能力,并且可以通过增加硬件资源数量使得性能得到提高;2)需要提高下载质量,在规定时间内,抓取互联网上比较有价值的网页,不丢失重要数据;3)在设计爬虫时,要能在有限的带宽以及时间内,要确保信息的更新效率;4)现在越来越多的动态网页数量,进行爬取实现的话,服务器端会产生很多垃圾页面。需要设计一个成本较低、高效的方法用来应对处理垃圾页面,也是现在网络爬虫需要面对和解决的问题;5)爬虫的规范,爬虫程序不能够在短时间内进行大数据量地访问一个主机下的网页,这样的情况可能会影响普通用户的正常访问,现在很多网页都设置了反爬虫功能;6)安全性是网络爬虫一直需要考虑的问题,它在会占用网络带宽,增加WEB服务器的处理成本。甚至有些恶意用户会利用爬虫程序对服务器进行DOS攻击,也可能对各种敏感数据进行获取,如用户的个人信息,一旦泄露对用户的个人信息安全,可能会进行诈骗、社交攻击等等。更严重的可能泄露用户的密码,账号等机密信息,因此,采取适当的措施限制网络爬虫的访问权限,用来保持网页的正常运行、同时对于保护用户的隐私有重要意义。当然网络爬虫存在的问题也不能否认它在信息筛选收集方面的高效率,低成本。所以在考虑了爬虫技术在数据处理的很多方面的优异性,打算利用此技术获取,个人参考了网上的很多帖子,也获取到了相应的STEAM市场以及第三方平台的接口,得到接口之后,就是利用相应的技术进行爬取、过滤、筛选。数据分析以后再提取可用的数据。1.2国内外研究现状分析在游戏热度不断提高的今日,同时在线玩家数不断提高,如图1.1所示。玩家对于第三方平台的饰品价格数据的分析的需求不断提高。网易BUFF作为现在国内最大的第三方饰品交易平台,每天的成交量与日俱增,玩家也为了能够做到将饰品的价格变现,更多的玩家选择第三方交易平台进行交易,网易作为现在最大的第三方平台,对于交易的保护,玩家的数据保护都做的很到位。因为考虑各种货币之间的汇率,第三方平台的价格普遍是STEAM平台的价格的75%,但是还是会有部分饰品价格不太相同,也有很多人对不同的平台之间的价格数据分析,利用不同平台之间的差价来赚取差价,这个工作需要对不同平台的价格数据做到及时获取,及时分析对比。所以整个项目就有很好的前景,不仅能方便玩家,也能帮助玩家以更优惠的价格来买到自己心仪的饰品。图1.1STEAM玩家数增长图所以在相关市场不断发展的同时,不断涌现出了基于市场的第三方服务平台,他们也是对原STEAM平台的数据进行获取、整合、处理之后作为平台的运营数据基础,所以第三方平台也需要实现对STEAM数据的获取。既然整个过程中最为重要的就是对数据的获取,理所应当的怎样设计利用爬虫程序是整个项目的重点。同时也介绍一下爬虫程序具体的特点和原理。网络爬虫分为两种类型:传统网络爬虫和聚焦网络爬虫。在传统网络爬虫中,爬虫从给定网页的URL地址,抓取网页的URL;然后,在抓取中,爬虫程序会地从当前处理页面提取新的URL放入队列中,直到满足系统设置的终止条件为止。聚焦网络爬虫:聚焦爬虫更加注重网页抓取的精确性,其利用所编写的网页分析算法过滤掉与所需主题无关的网页链接,从而最大程度上保留所需要的链接并使其进入到待抓取的URL队列中;系统根据设定的搜索策略从队列中挑选接下来要抓取的网页URL。一直重复上述过程,直到可以达到设定的终止条件。因此,文中也将利用该爬虫技术进行后续的系统设计。聚焦网络爬虫中的搜索策略包括3种,广度优先搜索、深度优先搜索和最佳优先搜索。在早期搜索引擎时代,查准率低、查全率低、内容不符等问题,人们对于搜索有了新的需求,为了满足这些需求爬虫应运而生,不仅能过滤无关内容,还具有更好的效率,可以极大的减少时间空间成本。1.3主要研究内容和研究目标STEAM平台有着一套自己的交易体系,以及市场体系,但由于玩家在市场交易所获得的货币无法提现,且有高额的手续费,因此很多玩家只能将货币用于购买STEAM游戏或者与游戏相关的饰品。正是这种原因导致很多的第三方平台出现,但是由于第三方平台众多,同样的饰品价格在不同的第三方平台上价格差异较大。因此打算设计一个爬虫程序,爬取不同第三方平台的价格数据进行比较分析。为了解决对不同平台价格数据的统计对比问题,本项目基于JAVA语言爬虫程序技术,对STEAM游戏饰品在不同的第三方平台的价格数据进行分析及应用,设计一套基于爬虫技术的STEAM市场数据分析系统,实验结果表明,该项目的爬取数据功能均能正常运行,方便玩家对价格的分析。关于STEAM市场以及第三方市场的API接口的反爬虫机制,以及程本身的设计对数据的筛选。目前大多数网站都对于爬虫机制有着相应的反爬虫机制,可能会被封禁IP地址,所以得需要设置相关选项来防止触发反爬虫机制,尽量爬取访问时间间隔久一点,次数少一些,以及采取一些特殊方法。部分网站不想被爬虫爬取就会检查http请求头的该字段内容,检查http协议中的UA部分,头部协议部分,通过判断该部分字段来分辨发送请求的浏览器类型、版本、内核。Url地址方面有时候可能会存在中文,如果不进行编码也会出现问题,出现乱码等问题。第二对于获取到的饰品价格相应数据还要进行相应处理才能正确显示。1.4论文组织结构论文包括六个章节,每个章节的安排如下:第一章主要介绍论文项目开发背景及意义、项目研究现状、项目实验所需要解决的问题。第二章介绍了项目所用的相关技术,WEB技术、Maven项目管理工具、网络爬虫技术。第三章具体阐述网络爬虫技术的数据获取方法相应细节及原理,网络爬虫技术的相关种类,它们相应的搜索方式策略。第四章阐述了整个项目的系统结构以及项目的可行性分析。第五章主要是进行系统测试.第六章是对文章的总结以及项目的不足之处。
第2章相关技术2.1JAVAHttpClient包HttpClient是ApacheJakartaCommon下的一个子项目。它是用来提供一个高效的、最新的和功能丰富的客户端编程包支持HTTP协议,同时还支持HTTP协议最新的版本和建议。HttpClient已经应用在很多的项目中,比如ApacheJakarta上很出名的两个开源项目Cactus和HTMLUnit中都使用了HttpClient包。在项目中正是利用相关包封装的代码功能实现数据获取。此类Jar包有着以下特性:第一这个包是基于JAVA,可以实现Http1.0和Htpp1.1的相应功能;第二有着可以拓展的面向对象的结构的Http方法;第三它支持HTPPS协议;第四能通过Htpp代理建立连接。2.2正则表达式正则筛选介绍正则表达式是通过对字符串(包括普通字符(例如,a到z之间的字母)和特殊字符(称为“元字符”))进行操作的一种逻辑公式,它使用一些预先定义的特定字符及特定字符的组合组成一个“规则字符串”,这个“规则字符串”用来表述一种字符串的过滤逻辑。正则表达式是描述搜索文本时要匹配的一个或多个字符串的文本模式。正则表达式特点第一,这个方式很灵活,有逻辑性和功能性;同时可以很快地用极其简单的方式做到对字符串的复杂控制。但是也有着一定缺点,对于刚接触的人来说,比较晦涩难懂。正则表达式目的:正则表达式的目的主要是对给定的字符串是否符合正则表达式的过滤逻辑(称作“匹配”)。通过正则表达式的方法,我们可以从字符串中获取我们想要的特定部分。正则表达式在本项目中主要负责对于数据的处理工作,正则表达式几乎可以用在所有语言中,前端JavaScript和后端的Java都提供相应的接口用来支持正则表达式。正则的一些基础用法:第一:元字符,元字符是构造正则表达式的一种基本元素,如图2.1下面一些常用的元字符。图2.1:元字符第二:重复限定符,对于一些无规律的重复的元字符,正则表达式通过使用重复限定符把重复部分筛选出。如图2.2所示。图2.2重复限定符第三:分组,正则表达式中利用小括号()来进行分组,也就是将括号中的内容作为一个整体。第四:转义,如果需要进行匹配的字符串本身就包括小括号,就需要在字符前面加一个\进行转义。第五:区间,正则同时提供了利用[]来表示区间条件。2.3Maven管理项目框架Maven项目管理工具是本项目使用的管理框架,Maven项目对象模型(POM)可以通过一小段描述信息来管理项目的构建,报告和文档的项目管理工具软件,在此项目中它可以更好的管理项目文件结构。作为一个项目管理工具,Maven包括一个项目对象模型、一组标准的集合、一个项目生命周期、一个依赖管理系统,以及于运行和定义在生命周期阶段中的插件目标的逻辑。当你使用Maven时,你用一个明确的定义项目的对象模型来描述你的项目,Maven可以应用横切的逻辑,更好的细致划分了项目代码中的各种依赖关系,这样就可以更好地防止在开发过程中的混乱问题。Maven管理框架优点Maven管理框架在项目构建中主要用来简化构建过程,用一种标准化的方式构建项目,一个清晰的方式项目的组成。Maven可以轻松地帮助个人管理项目报告、生成站点和管理JAR文件。2.4Idea开发软件本项目主要采用IDEA作为开发平台,IDEA作为一个JAVA开发的集成环境,提供了各类工具,以及各种插件支持众多语言。同时,IDEA也是一个高效、专业、实用的JAVA开发集成环境工具,它可以帮助用户在电脑上轻松地进行编程,提高程序员的开发速度,节约系统开发的时间成本,它同时也能更好的生成代码结构。IDEA同时支持JavaEE、Junit等版本工具。IDEA软件特点IDEA支持各种插件,支持很多语言开发;第二它的代码提示功能对于程序开发很有帮助;第三它有各种参数提示功能;最后它能够快速完成语句。作为一个开发环境它的体积相对较小,可以对JAVA、Javascript、Ajax等相关技术进行调整。2.5移动Web技术近些年来,移动WEB开发技术迅速发展,比如HTML技术等。全新的HTML技术能够很好地解决跨平台问题,能够更好的适应网络端。新的HTML技术相对于以前的技术运行效率得到了优化,成本更低。Web系统框架主要是让用户可以通过相应浏览器浏览网页并且获取到网页的相应资源。JS技术在其中起着很大的作用,此技术将前端页面的数据请求发送到后台,后台进行处理之后再通过JS技术返回给前端页面。本项目主要使用了HTML、CSS、Javascript、Jquery技术,其中JQuery是一个js脚本的框架包,类似脚本库,有着更好的兼容性。JQuery里的功能函数库能够帮助开发人员轻松实现相应功能,使代码更加简洁,结构更清晰。同时对于代码存在的兼容问题,一般需要对不同的浏览器编写不同的代码,但是JQuery有着更好的兼容性,能够很好地解决不同浏览器的兼容问题。
第3章网络爬虫技术网络爬虫工作原理如图3.1所示。网络爬虫是一种按照一定规则来自动获取网页数据的程序或脚本。它的具体工作流程:首先从选取的网站上读取网页上的信息,对每一个需要访问的URL地址进行数据获取。图3.1爬虫工作原理3.1网络爬虫种类①批量型爬虫批量型爬虫有一个非常明确的爬取目标,一旦爬虫程序到达目标节点,它就会停止抓取任务;同时批量型爬虫的目标也有很多不同种类,可以是一定数量的网页,也可以是一定的时间单位。②增量型爬虫相比于批量型爬虫没有很多限制,网页可能信息是不断更新的,所以增量型爬虫可以不断的进行爬取,不断的获取实时有效信息,这种类型的爬虫主要用于搜索引擎,这样就能够及时的获取实时信息,满足用户的需求。③主题爬虫主题爬虫又称聚焦爬虫,主题爬虫主要获取那些与设置的主题相关的信息,减少不必要的搜索操作,缩短爬取时间,同时也减少了资源的浪费。3.2网络爬虫搜索方式3.2.1深度优先遍历深度优先遍历实现搜索没有任何超链打的叶子节点,它的实现过程为:先在文件中选一个超链,搜索它所链接的HTML文件,这就是深度优先搜索,因为需要搜索一条完整的超链。搜索HTML文件的叶子节点。然后返回HTML文件,按照上述流程重复搜索文件其余的超链。如图3.2所示。图3.2深度优先遍历根据深度优先遍历的方式,那遍历路径就为:A、B、D、H、C、E、I、J、F。3.2.2广度优先遍历广度优先遍历操作相应简单一点,它的实现过程为:先完成对当前页面的所有的URL的抓取,再搜索下一层,一层一层的实现搜索,直到搜索到最后一层。如果某一层有很多分支的话,只会任意选择其中一个处理,处理完成后返回,再继续。如图3.3所示。图3.3广度优先遍历根据上图广度优先遍历方式,遍历路径为:A、B、C、D、E、G、F。3.2.3聚焦式搜索特定时间,对于搜索有特定的顺序,相当于最佳优先搜索,选取最优的方式,选择性忽略其他不太重要的内容。3.3网络爬虫框架体系HtmlUnit爬虫框架HtmlUnit爬虫框架是利用JAVA语言编写的网页浏览器,它可以实现提交表单等一些高级操作。它其中使用的技术主要包括:HTTP连接技术、Javascript、Css解析器、Apche相关技术支持。HtmlUnit的实现原理是从服务器请求,服务器返回数据,HtmlUnit使用Table等HTML的标识符,将数据进行处理。HtmlUnit使用HttpClient相应的方法,在使用时创建WebClient对象,再根据URL地址创建URL对象,使用HttpClient中的Get方法获取到相关信息。相比其他方法,它有着更高级的API接口,能够最快实现WEB渲染。JsoupHtml解析器Jsoup作为一种HTML解析器,可以直接解析任何的一个URL地址,它使用起来相对节省时间成本,并且操作十分简单。它的解析流程如下:先获取URL地址,从中解析出相对于的网页。通过css选择器进行遍历,获取需要的数据。解析HTML页面的相应元素、属性、文本。通过正则表达式进行过滤,获取到用户需要的信息,能根据用户的需要过滤字符串,符号等无关信息。按照规范格式输出HTML数据。如图3.4所示。图3.4Jsoup解析流程图爬取网站信息数据的步骤如下:首先输入指定的URL,跳转到目标页面;同时需要配置好相关环境配置,利用JS脚本绑定搜索按钮,编写JS脚本实现搜索饰品价格数据,正则进行筛选,过滤无关信息;再在后台对数据进行处理,再前端页面进行显示。
第4章系统设计及可行性4.1系统架构设计整个项目主要是以搜索功能为基础,同时数据也是整个项目很重要的一部分,所以项目如何获取相应数据的环节也十分重要。用户希望搜索到的饰品价格数据做到及时同步相应第三方平台,所以需要它的及时性。为了能够对比STEAM平台,需要在前端页面有一个对比显示的效果,这样用户就能清晰的了解到不同平台中间的价格差距以及相应比例。经过相关分析以后,本项目基于STEAM市场价格数据,主要由三个部分组成:前端查询与数据显示模块、后端数据爬取程序脚本模块、以及数据处理模块。系统结构图如4.1所示。图4.1系统结构图本项目可以分为两层。前端页面作为交互层,主要是负责用户的搜索饰品价格数据功能以及搜索完成以后的数据展示,相应用户的相应操作。后端爬取数据的模块和数据处理里模块则是数据层,主要实现对数据的获取以及处理工作,通过JS语言和HTML基础技术实现两个不同层面之间的数据交互传输。4.2功能模块设计4.2.1前端功能模块设计前端页面功能模块即一个完整的网页页面。用户可以在页面实现对特定的饰品物品价格的搜索,根据从不同的平台得到的对应饰品物品价格数据予以展示。可以将它分为两个部分:用户查询、数据展示。相应查询流程如图4.2所示。图4.2查询流程图用户在使用前端查询页面模块时,需要输入自己所需要查询的饰品名称,根据用户输入的饰品名称在后台进行处理在第三方平台的接口处获取到相应名称的价格数据,再由后台进行一定的处理,在前端页面的另一部分,展示页面予以显示。中间对于用户输入的字符进行处理需要依靠正则进行过滤,获取到有用的字符部分,再对接到第三方接口,获取数据。数据展示模块,用户需要能够很快的获取到有用的信息,也能有相应的对比不同平台的功能,用户能快速了解到一样的饰品,到底哪个平台的价格最低。需要设计一个简洁明了的展示窗口,同时也需要能够很好的契合搜索模块。4.2.2后端爬取模块设计后端爬取模块主要实现对第三方平台的接口进行数据获取,主要利用JS脚本来完成数据获取,JS作为一种轻量级的脚本语言,能够很大程度上的契合前端页面的数据交互。后端爬取模块主要完成整个项目的数据获取工作,保证数据的准确性、及时性。它需要同时获取多个平台的同一物品的数据,不同平台之间的数据不能混淆出错,需要对代码的设计结构考虑完善。同时数据的传输也是需要考虑的问题,不能出现数据传输中出现错误的情况。利用JS脚本语言能够轻松实现数据传递,保证数据的正确性传递。具体爬取流程如图4.3所示。图4.3爬取功能流程图4.2.3数据处理模块设计对于用户输入的信息,获取到的数据,都需要进行数据处理,再经过传输到页面展示。本项目对于数据的处理方式主要是利用正则过滤,正则过滤用户输入的信息,来对接正确的平台接口API地址,同时对于爬虫程序获取到的饰品价格数据也需要进行处理,不同平台之间的差别,将一些异常的数据或者无用数据筛选剔除,让用户能够直接获取到自己需要的信息。同时该模块主要是对前两个模块之间进行衔接,使用前文中的爬虫算法程序,首先根据用户输入的名称,使用正则过滤无关字符串,以及数据获取到之后的相应处理。具体数据处理流程如图4.4所示。图4.4数据处理流程4.3系统需求分析整个STEAM市场爬虫项目需要分析与对比几个第三方平台与STEAM平台各种饰品价格数据,这是整个项目的目标实现的必要措施。在STEAM平台饰品价格数据不断变动的情况下,每天的价格波动也十分明显,所以整个数据量也是不断变化的。正是由于平台热度的不断提高,整个STEAM平台饰品价格在近几年来飞涨。作为一个玩家自然是希望能够以一个较低的价格买到自己中意的饰品。所以整个项目的需求就是通过项目程序帮助玩家分析第三方平台价格,进行对比来找到有着最低价格的平台。4.4系统可行性分析可行性分析的目的在于从整个项目建设的内容和其条件分析论证项目是否可行,以及其中可能存在的问题。这是整个项目开展前一项十分重要的工作。对于遇到的问题和风险进行分析,能够有效降低项目成本。整个项目通过程序分析数据,可以仅仅使用普通的笔记本电脑和台式电脑就能完成项目的配置,不需要很高的成本,开发时间以及费用相对较少、周期也相应较短。在经济可行性方面有更好的前景。技术方面的可行性分析,不需要复杂的技术,通过网络爬虫技术爬取网页端数据,利用java相应的网络技术包,完成数据交互。4.5系统实现4.5.1前端页面实现搜索模块:搜索模块能让用户快速检索,主要实现的功能也是搜索。整个搜索模块设计依赖与HTML语言,CSS结构设计。用户在在搜索框中输入需要检索的饰品名称,通过正则筛选,传递到爬取程序模块。搜索模块如图4.5所示。图4.5搜索模块结果展示模块:对于搜索结果的显示,需要做到简洁明了,在用户完成搜索之后,能够清晰的展示不同平台的价格数据,他们之间的差价,与STEAM市场的比例为多少。帮助用户更好分析价格数据。结果展示模块如图4.6所示。图4.6结果模块4.5.2数据获取实现数据获取是整个系统的重要部分,是系统完成工作的核心。该模块主要利用JQuery脚本库,编写JS脚本开发,获取第三方平台后台API接口,进行对接。获取到API接口传递的数据。主要利用是网络爬虫相关算法,完成高效爬取数据过程。在获取到相应数据信息之后,信息主要分为三个部分饰品ID、价格数据、平台名称。数据获取相应代码如图4.7所示图4.7数据获取代码图4.5.3数据处理实现对于获取到的数据,需要对数据进行预处理,首先得要使用正则过滤算法。剔除无关信息,相关处理方法如图4.8所示图4.8数据处理图完成数据处理之后就能对获取到的数据进行输出,在前端搜索结果页面进行展示。
第5章系统测试5.1环境配置整个项目运行在网页上,后台管理可通过相关软件查看代码层面,进行修改。下面介绍系统运行环境。个人电脑运行环境,windows系统,相应电脑配置如图5.1所示。图5.1Windows系统配置JDK作为JAVA语言必要的安装包,所以同时也需要安装JDK。安装过程如下:第一步:下载相应JDK版本包,解锁安装。第二步:配置环境变量,JAVA_HOME即为JDK安装位置。如图5.2所示。图5.2JDK配置IDEA开发软件配置,IDEA作为一个简洁的开发软件,配置过程也十分简单,安装和创建项目过程如图5.3所示。图5.3IDEA软件配置5.2功能测试5.2.1前端模块功能测试前端主要实现搜索和展示,具体为搜索和展示两部分。搜索功能与展示功能测试结果如表5-1所示。主要测试了搜索页面打开和进行搜索所需时间。表5-1搜索功能模块测试测试功能操作步骤目标结果搜索输入名称进行搜索完成搜索通过结果显示搜索之后打开结果正常显示通过5.2.2数据获取功能测试数据获取作为系统重要一环,其性能要求更能反映整个系统的性能。用户输入完毕需要搜索的内容,点击搜索之后,获取到展示数据的过程需要多久,能够很好体现性能。测试结果如表5-2所示。表5-2数据获取功能测试测试功能操作步骤目标结果数据爬取运行JS脚本正常获取数据在2至3秒内获取数据5.2.3数据处理功能测试数据处理测试结果与硬件配置相关,高配置的硬件数据处理速度更快,当然JS语言的设计结构也是有部分的影响。测试涉及到正则筛选的算法设计。数据处理功能测试结果如下表5-3所示。表5-3数据处理功能测试测试功能操作步骤目标结果数据处理在输入框输入名称,获取数据处理能够正确筛选输入内容,过滤无关内容。正常处理数据
第6章结论6.1总结本项目融合网络爬虫技术的STEAM市场价格数据分析,在功能方面做到了简单实现。基于数据获取的实时性,能够很大程度上帮助玩家分析饰品价格变化以及波动走向,做到简单的为玩家用户省时。也算是利用自己的一个专业知识能力去做一个自己感兴趣的方面,当然功能或许不够完善,中间还有很多需要进一步完善的地方。项目结合了Html相关知识,完成页面设计,功能实现,CSS进行样式渲染、JS脚本实现交互工作,数据获取功能。本项目也就STEAM市场不断增长的玩家数进行分析,基于该研究背景,选择了项目研究方向。更研究了相关爬虫算法以及实现程序,通过对食品价格数据的爬取,实现了项目功能,完成整个项目工作。目前项目的功能也只是做到了初步实现,还是希望在以后的的的花时间里能够对项目开发出更多能够解决用户和玩家实际问题的功能。参考文献[1]刘金
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 听说读写课堂活动组织规范
- 眼镜钟表门店销售服务规范
- 2026年人力资源的专员笔试试的题目及答案详解
- 微生物概述测试题及答案
- 2026年汉字听写大会竞赛考试题库(附答案)
- 2026年全国叉车司机作业证理论考试题库(含答案)
- 2026年卫生计生系统人员“针对性普法”考试(医护人员)题库及答案
- 2026年10月自考07111交通运输经济法规押题及答案(北京)
- 2026下半年高中生物教资面试生态保护结构化答辩题库
- 危化品领用储存检查登记台账
- 老年护理专科考试题库及答案
- 国学礼仪课程课件大纲
- 山东省潍坊市寿光市2026届中考二模英语试题含答案
- 医疗结构化面试经典100题及答案
- 汽修店章程范本
- 绿色内河货运对水生态的影响
- GA/T 2097-2023执法办案管理场所信息应用技术要求
- 2024届中国五环工程限公司校园招聘高频考题难、易错点模拟试题(共500题)附带答案详解
- 过敏性紫癜课件PPT
- 执业医师聘用证明
- 浙江省通用安装工程预算定额第四册
评论
0/150
提交评论