【《合肥市网约车时间分布研究》10000字】_第1页
【《合肥市网约车时间分布研究》10000字】_第2页
【《合肥市网约车时间分布研究》10000字】_第3页
【《合肥市网约车时间分布研究》10000字】_第4页
【《合肥市网约车时间分布研究》10000字】_第5页
已阅读5页,还剩32页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

合肥市网约车时间分布研究目录TOC\o"1-3"\h\u6829合肥市网约车时间分布研究 1227991.1合肥市网约车基本情况 159921.2数据的来源 378881.3数据的处理 3298071.1.1数据清洗 4221411.1.2将含时间信息的字符串转成时间戳 7215681.1.3导出数据 8187181.4数据分析 11210561.4.1描述性分析 11105211.4.2方差分析 1244851.4.3聚类分析 1616081.5网约车时间分布的K近邻法预测 25325391.5.1研究数据 25111961.4.2定义评价函数和预测函数 27192571.5.3K值的选择 28318941.5.4预测结果比较分析 291.1合肥市网约车基本情况合肥位于中国的华东地区,长江三角洲的西端,在江淮、安徽省中部、六安市的西部、淮南市的北部、滁州市的东北、马鞍山市、芜湖市的东南部、西南邻、安庆市和铜陵市之间。合肥总面积11445.1平方公里,合肥市的卫星地图和行政地图如图3和图4所示。自合肥市实施3个网上租车牌照以来,截至目前,已有26家网上租车平台公司获得牌照,43931名司机获得了网上租车或游轮车驾驶执照(游轮车司机可以开通网上租车),22730辆汽车申请了网上叫车运输许可证。目前,合肥市每天大约完成20万份订单。网上订车已成为全市综合客运体系的重要组成部分,市场供需逐步平衡。同时,各网络约车平台公司将接入网络服务平台的车辆及驾驶员信息、车辆实时位置信息及行驶轨迹、货运标准、订单信息、运营信息等数据,服务质量评价信息到合肥市道路运输动态监管服务系统平台。我市交通管理部门将加强对已取得网上售车运输许可证的车辆在营运期间和营运后的动态准确监管。图SEQ图\*ARABIC3合肥市卫星图图SEQ图\*ARABIC4合肥市行政区域图1.2数据的来源本论文数据来源于网约车监管平台,数据采集周期为2019年8月1日至2021年2月4日。共554天,每30分钟生成一个订单数据,一天之内生成48个订单数据,原始数据共包括两个字段,第一列为“日期”、第二列为“时刻”、第三列为订单量,数据共有40000多条,数据量较大。部分样本数据见下表2。表SEQ表\*ARABIC2网约车订单量12345...482019/8/1983775580407336...12132019/8/21243766537365311...16412019/8/31178843614451395...18792019/8/41311916689535458...13662019/8/51078645515432322...11192019/8/91064713527427326...17012019/8/101231799673509391...18462019/8/111391906699563536...12942019/8/12769646557432327...14472019/8/131006697503367327...13382019/8/141068732527382329...13812019/8/151096696511392319...13352019/8/16951687575423350...21132019/8/171378943667580463...17982019/8/181250828672538466...15652021/2/32866178211901139923...3462由于2020年疫情防控影响实行交通管制未有网约车订单生成该时间段内数据的有效性无法得到保障,本文经数据处理之后再进行分析研究。1.3数据的处理本文研究的网约车数据量较大,由于EXCEL处理数据量有限,数量较多时处理速度也变得慢,SPSS处理数据并不能显示个性化图形情况,无法满足原始数据的处理需求,本文采用python

对数据进行初始的数据处理。1.1.1数据清洗数据清洗主要是删除原始数据中的不相关数据、重复数据、平滑噪声数据,过滤掉与建模目的无关的数据,处理缺失值和异常值。1、缺失值处理除了明显的缺失值(单元格处无值),还有一个无形的缺失值来分析从2018到2021年4月的每日订单情况,需要找出订单情况缺失的时间。处理缺失值的方法分为3类:删除、插补、不处理。(1)删除缺失值如果通过删除小部分的数据就可以达到目标,那么这无疑是最简单高效的办法。但是考虑到数据采集的不易,因此一般不会轻易删除数据。(2)插补缺失值表SEQ表\*ARABIC3常见的插补方法插补方法方法描述均值/中位数/众数插补根据质性值的类型.用该属性取值的平均数/中位数/众数进行插补使用固定值将缺失的质性債用一个常栖替换。最近临桶补在记录中找到与缺失样本最接近的样本的该属性值插补冋归方法对带有缺失值的变敏,根据已有数据和与其有关的R他变址(因变址)的数据建立拟合模型来预测缺失的属性偵常见的插补方法:不处理缺失值研究所使用的网约车原始数据也有部分缺失数据。为了便于集成计算,不影响数据的真实性,采用删除缺失值的方法,部分删除数据如下表4所示。表SEQ表\*ARABIC4部分缺失值删除2019/12/511220010120213...2019/12/612311200001113...2019/12/712310100000104...2019/12/813341131000222...2019/12/910211010000164...2019/12/1013121311001012...2019/12/1111201030112033...2019/12/1211000011110154...2019/12/1322102100112052...2019/12/1443021211010251...2019/12/1557310001222133...2019/12/1631342313000259...2019/12/1734111300102022...2020/3/141110010404336...2020/3/250224001011214...2020/3/333321100110221...2020/3/472122100022735...2020/3/523123130201344...2020/3/637321333213107...2、重复值处理在Pandas中,.duplicate()表示找到重复的行。默认情况下,对所有列进行判断,并返回布尔结果。对于完全没有重复的行返回False,对于重复的行返回False,对于第一行返回False,对于其余行返回True。对应于duplicated(),drop_duplicates()表示去重复,即删除所有具有Trueboolean类型的行。默认情况下,对所有列进行判断。3、异常值处理在数据清理过程中对异常值的处理取决于是消除还是用其他值替换它们。一些异常值可能包含一些信息,需要经过仔细考虑后进行处理。常见的异常值处理办法:表SEQ表\*ARABIC5异常值处理方法异常值处理方法方法描述删除含有异常值的记录直接将含有异常值的记录删除视为缺失值将异常值视为缺失值,利用缺失值处理的方法处理平均值修正可用前后两个观测值的平均值修正该异常值不处理直接在具有异常值的数据集上进行挖掘建模本文采取删除异常值的方法,部分异常值如下表6。表SEQ表\*ARABIC6删除异常值1234567...482019/8/185888604548247241602055213883...17412019/8/19109210519041400153828831579...7652019/8/201391130914092427240123971841...12082019/8/217048680045156927577456514180...16092019/8/2251516652655435...222019/8/2351594251565238...142019/8/2467767373714843...212019/8/259897127130887255...202019/8/26160168207214193161143...612019/8/27270302306357306307223...852019/8/28484543511505465521464...2272019/8/293571369228694303416435992660...15182019/8/306256573548296860551547863300...14162019/8/316190605755387051547147343590...13684、去除空格和回车由于原始数据每行都有一个“\n”,影响数据的读取,为了更直观的分析数据,将处理之后的数据进行再处理,去除每行的回车键,并且以空格为标识分解符号,使每个数据独立出现。算法的具体步骤如下:data=[]forlineinlines:line=line.rstrip("\n")#去掉每行的回车键ls=line.split('')#以空格为标识分解符号data.append(ls)dataprint(data)1.1.2将含时间信息的字符串转成时间戳调整数据格式,使每部分数据去除回车键和进行分解之后,为了进一步整合分析每一天的波形变化,分析时间规律,需要将含有时间信息的字符串转换成时间戳。把分散在不同列不同行的数据整合到一起,使之成为每一天一整组数据,每组数据一天24小时之内的每半小时一个数据,形成48个订单量数据,方便后续的网约车时间分布分析。算法的具体步骤如下:#转换成时间序列df2=pd.DataFrame(coLumns=range(1,49))groups=df1.groupby('date')print(groups)forname,groupingroups:ifLen(group)==48:volume=group.drop(['date','time'],axis=1).TvoLume.index=[name]voLume.coLumns=range(1,49)df2=pd.concat([df2,voLume])df2转换为时间戳之后,基于此划分为一天一组数据。表SEQ表\*ARABIC7转化为时间戳之后的数据形式123456789...482019-08-01983775580407336258174157166...12132019-08-021243766537365311218176136150...16412019-08-031178843614451395285252230199...18792019-08-041311916689535458302255240227...13662019-08-051078645515432322231226158167...11192021-01-30364624121818138112301014869679604...35622021-01-3134662340182613521239825709622516...38142021-02-0140181904144012471136823664509493...37942021-02-0230001730148210471050705601520444...32192021-02-032866178211901139923744601506449...34621.1.3导出数据本文截取了部分数据如表8,详细数据见附表1。表SEQ表\*ARABIC8部分处理之后的网约车订单数据123456789101112131415...2019/8/19837755804073362581741571661714071021149128765650...2019/8/21243766537365311218176136150188356866151326485347...2019/8/311788436144513952852522301992324231051162623144171...2019/8/41311916689535458302255240227234420781137518813272...2019/8/51078645515432322231226158167183381985180629146224...2019/8/61015657496369295234205167154147406904163826785783...2019/8/7977715540439318234198150176215364794160926065769...2019/8/81326952670485379279256185188214411884163228845953...2019/8/91064713527427326236215182153225433911159825835760...2019/8/101231799673509391330266189195234432865164328065308...2019/8/111391906699563536322325244241270442734129319593233...2019/8/127696465574323272521911561962153971045194533546620...2019/8/131006697503367327253212163173206395904171327355465...2019/8/141068732527382329225183162161215359870154426295720...2019/8/151096696511392319255212183164182357961173326795635...123456789101112131415...2019/8/1713789436675804633543082172242405081060178627154505...2019/8/181250828672538466339259226194304422884140720953607...2019/8/1911387485953883602162241921662484551058197432346482...2019/8/20970671505426341236218143193191384999174228435839...2019/8/211067707540419335250217192198190389963179428326048...2019/8/221050682576380333257205161168220365956171327605665...2019/8/23967680560413454243177153216217353875165428865727...2019/8/2413429516894954343272972212352464331093189927614942...2019/8/251325871709539474299278246221257433839143821113717...2019/8/261040720520418336257217142180240389984198532316500...2019/8/27943717552422363241212177161212332863165430335953...2019/8/281017674580401349262178148178195375943174934898327...2019/8/291012703522415353249198156179197320826161230326215...2019/8/301125819614465398269215175176206375936182231306328...2019/8/3114039437886385013773112402462845091076196429675179...1.4数据分析1.4.1描述性分析描述性分析是调查统计分析的第一步。对调查获得的大量数据进行初步整理和总结,找出这些数据的内在规律--集中趋势和分散趋势。单因素分析主要借助各种数据表示的统计量进行,如均值、百分比等。(1)早高峰晚高峰分析对于网约车来说,本文选取了合肥市2019年网约车订单(每半小时生成一个订单)的数据进行了表格分析。首先选取随机一周的数据分析发现一天内早高峰主要集中在8:00-9:30,订单量一般可以达到10800左右,晚高峰主要集中在17:30-19:00,订单量大概在9500,低峰期主要集中在夜间23:30至凌晨7:00,此时的订单量只有不到1000,如图5。图SEQ图\*ARABIC5一周高峰时刻柱状图(2)工作日非工作日分析以2019年8月份为例,对比分析工作日和非工作日的网约车订单数量(如图6),由柱状图可以看出这一个月内工作日与非工作日对网约车订单数量并没有叫明显的影响。图SEQ图\*ARABIC62019年8月高峰时刻柱状图1.4.2方差分析方差分析(ANOVA)是一种统计方法,用于分析每类变量(例如,位置)对数字变量(例如,销售)的影响本文以2019年10月的约车订单量为例,将1-48列数据进行求和,得到这个月每天总的网约车订单量,再进行工作日与非工作日的整合,如表9。拿到不同时间网约车订单量的数据,在α=0.05的显著性水平下,检验是否是工作日对订单量是否有显著性影响。因此数据只有一个类别变量,故为单因素方差分析。表SEQ表\*ARABIC9工作日与非工作日订单量时间订单量工作日1252707工作日2202773工作日3198248工作日4195068工作日5240145工作日6256757工作日7259153工作日8222037工作日9207121工作日10203933工作日11214643工作日12245267工作日13236088工作日14187222工作日15215788工作日16221331工作日17218190工作日18260536工作日19294661非工作日1277917非工作日2200689非工作日3217090非工作日4219325非工作日5227006非工作日6257154非工作日7316905非工作日8279314非工作日9210118非工作日10227477非工作日11219788非工作日12234434设时间对订单量的影响效应分别为a1、aH0H1使用SPSS进行分析:①分析→一般线性模型→单变量图SEQ图\*ARABIC7一般线性模型的单变量分析②将因变量选入因变量,自变量选入固定因子图SEQ图\*ARABIC8确定自变量和因变量③点击绘制,选择因子(时间)进入横轴,点击添加,点击继续回到主对话框,这里我们需要方差同质性检验、残差图等输出,所以直接检查描述性统计、同质性检验、残差图、参数估计。表SEQ表\*ARABIC10误差方差的莱文等同性检验莱文统计自由度1自由度2显著性订单量基于平均值0.6461290.428基于中位数0.1061290.747基于中位数并具有调整后自由度0.106124.3900.748基于剪除后平均值0.4861290.491检验“各个组中的因变量误差方差相等”这一原假设。因变量:订单量设计:截距+时间表SEQ表\*ARABIC11主体间效应检验因变量:订单量源Ш类平方和自由度均方F显著性修正模型1171157992111711579921.2330.276截距1.615E+1211.615E+121699.7470.000时间1171157992111711579921.2330.276误差2.755E+1029950087424.5总计1.710E+1231修正后总计2.872E+1030a.R方=0.041(调整后R方=0.008)可以看到时间对应的p值=0.276,故应该拒绝原假设,也就是说是否是工作日对网约车订单量有影响,在看到R方0.041,这说明订单量的差异有4.1%是由是否是工作日造成的,但是影响较小,不是影响网约车订单量大小的主要因素,剩余由随机误差造成。1.4.3聚类分析聚类分析是指将一个数据对象集合分组为由相似对象组成的多个类的分析过程。群集将所有数据实例组织成相似的组,这些组称为群集。同一集群中的数据实例彼此相同,并且通过定义距离或相似系数来区分这种相似性。目前,聚类算法很多,算法的选择取决于数据的类型、目的和具体应用。使用K均值聚类分析法,该方法主要有三个步骤:(1)为待聚类的点寻找聚类中心。(2)计算从每个点到聚类中心的距离,并将每个点到最靠近该点的聚类中心聚类。(3)计算每个点到群集中点的平均坐标值,并将其用作新的群集中心。多次迭代上述步骤,直到集群中心不再广泛移动或集群数量满足要求。打开SPSS软件,在变量视图中设置变量信息,在数据视图中导入数据。使用K-均值聚类分析法,根据上文描述性分析中的高峰时刻柱状图,分析订单内数量并且对选择的2019年8月至10月份的网约车订单进行分类,将一天24小时分为时段1(0:00-4:00)、时段2(4:00-8:00)、时段3(8:00-12:00)、时段4(12:00-16:00)、时段5(16:00-20:00)、时段6(20:00-24:00)这六个时段,数据初步处理并导入结果如下,其中V1表示日期,V2-V7表示时段1-时段6。表SEQ表\*ARABIC12聚类分析数据V1V2V3V4V5V6V71-Aug-19367021186605464628653855317222-Aug-19375219701613365141263883365533-Aug-19424816256507794827858834398414-Aug-19470612859460504909754142349395-Aug-19360721826567634853653609309316-Aug-19343820908608555188056846347737-Aug-19357120756646455370478823475658-Aug-19453221509630975171960399356829-Aug-193690208806079952987687434020310-Aug-194388193756604854292667804297111-Aug-194986129284529147896534023520812-Aug-193330231415823249376553083127213-Aug-193528206095927250009622873250414-Aug-193608206156117049669584223282415-Aug-193664208195978649718567023179516-Aug-193639219756590957598732044352917-Aug-194910177075833853211628353845818-Aug-194578139815623360251651334085219-Aug-193861162566079554300600263235020-Aug-193510214576366754530613213470821-Aug-193727216226390252729602383501622-Aug-193644208206055051410591563339923-Aug-193647210216282757259735334256824-Aug-194756187385944055220662234099325-Aug-194741142595281557514638894155126-Aug-193650232176546556419614233341427-Aug-193627212636197852785654793433328-Aug-193609282557733058318605703521829-Aug-1936082175716413056812668313885530-Aug-194080227866928766403795624829231-Aug-195201193786515570684805344669301-Sep-195381165585722466553800543565102-Sep-193562244935610447832552712972203-Sep-193447307986491146889585773272104-Sep-193287215715460146156558753212605-Sep-193624215705617146387556023196206-Sep-193581223685985155289779784551807-Sep-194956208996504363774742334450708-Sep-195145155835930265035670123558309-Sep-193466240335849248989561933079010-Sep-193602222875886547553609643346411-Sep-193603212655658550570620633474512-Sep-193932243096913370374705855129913-Sep-196098223455870157994688653974314-Sep-194360132194526651999574313583415-Sep-194442134234695062903688233774116-Sep-193490242005155847028527002845717-Sep-193321180035071244910528282860718-Sep-193463206055271945085515272962419-Sep-193490211265251543506498152908520-Sep-193498206145374848902656003865921-Sep-194741197595575655463672003892422-Sep-194683155985224259730588493095823-Sep-193300228995228143422427602335124-Sep-193258201575031041989486022707125-Sep-193298199925030643520494292830326-Sep-193381205835236742832506203062127-Sep-193623209195464346896641424049128-Sep-194839116044923550672561813595529-Sep-193722221765723150057527373160930-Sep-194454265716090961484660085024901-Oct-197249242045867259127601804327502-Oct-194963139294706148611511653704403-Oct-194223135684489846795536563510804-Oct-194136112344359648568522443529005-Oct-194047128805123956945748974013706-Oct-194472155465164461222727275114607-Oct-195985166775522068882721284026108-Oct-193653252965783749216573512868409-Oct-193386539064590054345280845390610-Oct-193439523784400453926293235237811-Oct-193704539944574658252303975399412-Oct-193842585364940769061421095853613-Oct-195367556636317664320321045566314-Oct-193570535074322245143221665350715-Oct-193483538064486458670330115380616-Oct-193690557874596060234354505578717-Oct-193534535984580859426344205359818-Oct-193755612545533472211449186125419-Oct-195139681206534084489484356812020-Oct-195261589267521680454400405892621-Oct-193757531394374951813288445313922-Oct-193324541184469059325340525411823-Oct-193714547284693658454333325472824-Oct-193900575124801359855345435751225-Oct-193978608176485069835474486081726-Oct-195343745677193587699520107456727-Oct-195525630837204278017418606308328-Oct-194066561434793253100233575614329-Oct-193586583174803461134333815831730-Oct-193751561804838457075356805618031-Oct-1938725747249510630443782757472接着进行k均值聚类分析法。设置聚类数为5类,迭代次数10次,得到以下聚类分析结果如下表13、表14所示。表SEQ表\*ARABIC13初始聚类中心聚类12345时段153433609362333005381时段22535128255209192289916558时段37456777330546435228157224时段47193558318468964342266553时段58769960570641424276080054时段65201035218404912335135651表SEQ表\*ARABIC14历史迭代记录12345110048.1926590.7057626.3809001.4439619.14920.0004558.712979.8083694.0992284.06131889.4222095.6931021.0681255.5492081.62742035.2981425.233759.3340.0001168.76151171.895641.1611070.455868.215731.34060.000662.037777.1091026.0720.00070.0000.0000.0000.0000.000由于聚类中心中不存在变动或者仅有小幅变动,因此实现了收敛。任何中心的最大绝对坐标变动为0.000。当前迭代为7。初始中心之间的最小距离为26301.814。表SEQ表\*ARABIC15最终聚类中心聚类12345时段149303732369438724589时段22158423290213291819018607时段36666464661567205016258281时段46947153591486654603758804时段57944761875586445174169897时段64664234885336393031441958表SEQ表\*ARABIC16每个聚类中的个案数目聚类18.000210.000331.000420.000521.000有效92.000缺失0.000由上述聚类结果可以看到,将聚类数目K设置为5,迭代7次,92组网约车订单数据可以分为5类,如下图9所示。图SEQ图\*ARABIC9K近邻下的网约车订单量分布图图(a)类型1:8月7日、8月26日、9月8日、10月5日等时间图(b)类型2:8月21日、8月22日、9月16日、10月31日等时间图(c)类型3:8月13日、9月4日、9月15日、10月14日等时间图(d)类型4:8月2日、9月23日、10月3日、10月16日等时间图(e)类型5:8月1日、8月24日、9月30日、10月1日等时间图SEQ图\*ARABIC10各类型订单均值变化图由五类图形趋势来看,时段1至时段3都呈现出急剧上升的趋势,这是由于时段1与时段2处于低峰期,时间为夜间或者凌晨,相比于时段3-时段5所处的高峰期或者平峰期,出行人数会有明显的减少,所以不做重点研究。下面主要介绍时段3-时段6的变化趋势与相互对比。由图(a)可见,除时段6外,类型1的网约车订单的趋势整体呈现的变化幅度较小,早高峰至晚高峰网约车订单量呈现出缓步上升的趋势,但是时段6的订单数量急剧下降,具体下降幅度约33000单,下降幅度很大;类型1中的样本数量仅有8天,达到总体的8.7%,时段1-时段6的平均订单量为4930、21584、66664、69471、79447、46642单。由图(b)可见,类型2的订单流量的趋势与类型1较为不一致,整体呈现出凹的线形变化,其表现为时段3-时段5变化明显不同,首先是数值上较类型相比1都呈现下降趋势,并且早高峰之后的平峰期呈现明显下降趋势,直至晚高峰时段又急剧上升,最后到时段6与类型1减少幅度持平;类型2中的样本数量为10天,达到总体的10.9%,平均订单量为3732、23290、64661、53591、61875、34885单,订单数量低于模式1。由图(c)可见,类型3的订单流量的趋势与类型2较为一致,也整体呈现出凹的线形变化,然后上升在高峰期达到峰值,时段6再急剧下降,不同点在于此类型的晚高峰期要明显高于早高峰期;类型3中的样本共20天,达到总体的21.7%,平均订单量为3872、18190、50162、46037、51741、30314单。由图(d)可见,类型4的订单流量趋势变化与类型3类似,但是“凹”的程度较小,先小幅度下降至时段4,再小幅度上升至时段5,并且至时段6的变化幅度较小与类型3,约为20000单;类型4中的样本数量达到31天,占总体的31.7%,平均订单量为3694、21329、56720、48665、58644、33639单,整体订单量较少。类型4虽然与类型3相似,但是同一时段的订单量相差约达15000单。由图(e)可见,类型5的订单流量与类型1较为相似,时段3至时段4订单量几乎持平,但时段5有明显上升,而至时段6又急剧下降约30000单;类型5中的样本共23天,达到总体的25%,平均订单量为4589、18607、58281、58804、69897、41958单。结合上述规律特性分析和各类样本订单均值对比图来看。类型1与类型4整体表现平缓变幅度较小,类型5变化比较独特;而类型2、3的整体变化趋势较为一致,仅在流量均值上表现一定的差异,这两类模式共占总体的44.6%;因此可发现合肥市每天网约车订单量变化类型大致符合2、4类型的发展趋势。1.5网约车时间分布的K近邻法预测1.5.1研究数据选取合肥市某网约车平台的2018年8月1日至2021年2月3日的订单数据作为供需研究的主要数据。原始订单数据主要包括日期和每半小时的订单量,共12788组数据,部分原始数据可见下如表17所示。表SEQ表\*ARABIC17原始网约车订单量信息12345...482019/8/1983775580407336...12132019/8/21243766537365311...16412019/8/31178843614451395...18792019/8/41311916689535458...13662019/8/51078645515432322...11192019/8/61015657496369295...13322019/8/7977715540439318...21072019/8/81326952670485379...13722019/8/91064713527427326...17012019/8/101231799673509391...18462019/8/111391906699563536...12942019/8/12769646557432327...14472019/8/131006697503367327...13382019/8/141068732527382329...13812019/8/151096696511392319...13352019/8/16951687575423350...21132019/8/171378943667580463...17982021/2/32866178211901139923...3462原始数据不符合直接分析的条件,需要进行处理,将其转换为标准实验数据。首先,观察原始订单数据,发现订单数据中存在空值和异常值。其次,基于研究目的,去掉不相关的字段,只保留订单数量列和时间列;再次,考虑到2020初疫情期间的数据差异较大,只保留非疫情期间的数据;最后,结合网约车订单的特点和短时交通流量的预测方法,需要将原始数据转换为标准的时间序列,用于后期分析。具体处理数据流程如下所示:(1)读取历史原始数据;(2)将含时间信息的字符串转成时间戳;(3)根据时间戳划分为天;(4)转成以天为时间序列的数据集;(5)删除含空值及异常值的时间序列;(6)删除受疫情影响的时间序列。处理过后的标准实验数据共保留266组订单数据,如下表18所示。表SEQ表\*ARABIC18标准化实验数据样本时间12345678……2019/8/1983775580407336258174157……2019/8/21243766537365311218176136……2019/8/31178843614451395285252230…………2021/2/32866178211901139923744601506……1.4.2定义评价函数和预测函数常用的评价模型指标有平均绝对误差(MAE)、均方误差(MSE)、平均绝对百分比误差(MAPE)和均方百分比误差(MSPE)。MAPE在其他评价指标的基础上进行了标准化,其结果以百分比的形式可以更直观地反映出该模型的预测精度和差异性,更易于理解,具有良好的适应性,因此本文以平均绝对百分比误差(MAPE)指标作为模型的性能评价指标,MAPE越小,模型效果越好。公式如下:(1.1)式中n为样本数;为样本实际值;为样本预测值。定义评价函数和预测函数的算法具体步骤如下:#定义评价函数MAPEdefmape(y._true,Y_pred):returnnp.mean(np.abs((y_pred-y_true)/y_true))*100#定义预测函数predict()x=np.arange(0,24,0.5)Defpredict(Y,i):TO=Y[-1,:5].reshape(1,-1)fortinrange(5,48):X1=Y[:-1,:t]y1=Y[:-1,t]T1=Y[-1,:t].reshape(1,-1)knn=neighbors.KNeighborsRegressor(i,weights="distance")#基于sklearlknn.fit(X1,y1)y_=knn.predict(T1)TO=np.append(T0,y_)returnTOTO=predict(Y,5)1.5.3K值的选择基于标准化266周数据,采用自适应K值算法,计算出K=1至K=30的相应的平均绝对百分比误差值,并绘出MAPE随k的变化趋势的数据变化图,如下图11所示。图SEQ图\*ARABIC11平均绝对百分比误差与K值的关系由图11可见,K近邻预测下的K值与其对应的平均绝对百分比误差呈现一定的波动情况,但整体而言K值越小,预测效果与实际观测值就会越接近。K取到1到5时,平均绝对百分比误差由7.1%降到6.4%,精确度提高了0.7个百分点;K取5到8时,平均绝对百分比误差几乎没有变化,精确度没有提高;K取8到15时,平均绝对百分比误差由6.4%变为6.7%,精确度不降反升;K取15到31时,平均绝对百分比误差小幅度下降,但总体而言精确度提升不大。因此本文选取K=5对网约车订单量进行预测。通过预测2021年2月3日的网约车订单量与当日实际的网约车订单量对比,由图可见,K取到5时,平均绝对百分比误差为6.41%,网约车订单量的预测结果与实际结果相似程度较为一致,预测结果比较理想。图SEQ图\*ARABIC12K取5时预测订单量与实际订单量对比图1.5.4预测结果比较分析时间序列预测法可用于短期、中期和长期预测。根据数据分析方法的不同,可分为:简单序贯平均法、加权序贯平均法、移动平均法、加权移动平均法、趋势预测法、指数平滑法、季节趋势预测法、市场寿命周期预测法等。为了更好地说明预测效果,本文采用简单序列平均法和一次指数平滑法与K近邻法进行比较。由表可见,预测订单量和实际订单量相差过大,原因则是因为简单序时平均数法预测网约车订单量时,突出了时间因素在预测中的作用,暂不考虑外界具体因素的影响,所以当遇到疫情因素影响的网页车订单量时,预测结果就可能相差过大,导致预测结果非常不理想。一次指数平滑法是通过计算指数平滑值,用一定的时间序列预测模型来预测网约车的未来。首先确定平滑系数α,一般来说,应按如下方式处理:1.如果观察值的长期趋势变化接近稳定常数,则应取中心α值(一般为0.6-0.4),以使观察值在指数平滑中具有接近大小的权重;2.如果观测值表现出明显的季节变化,建议取较大的α值(一般0.60.9),这样近期的观测值在指数平滑中的作用较大,从而使近期的观测值在未来的预测中迅速得到反映;1.如果观测的长期趋势较慢,建议取一个较小的α值(一般为0.1-0.4),这样长期观测的特征也可以反映在指数平滑值中。根据观察网约车原始订单量数据,设置α为0.3,1月1日的指数平滑预测值用1月1日至1月3日的真实值平均数替代。由表可知,由于指数平滑系数是人为设置,受主观影响较大,再加上受疫情因素影响,平均绝对百分比误差呈现高低不一的现象。表SEQ表\*ARABIC193种预测方法的平均MAPE图日期MAPEK近邻算法简单序时平均数法一次指数平滑法平均值6.41%1103%55%表数据显示:K近邻算法、简单序时平均数法、与一次指数平滑的平均绝对百分比误差分别为6.41%、1103%、55%与其他两种预测方法相比,K最近邻算法具有最高的预测精度、更强的自适应能力,并且可以实时预测数据的变化趋势。进一步分析表明,K-最近邻算法随着预测环境的复杂性和突变性,通过调整搜索算法和相关参数,可以满足真实的实时预测要求。综上所述,比较三种预测方法,基于K-最近邻算法的预测模型在短期城市配送订单需求预测中的预测精度在94%左右,具有较高的预测精度和较好的适用性。

表SEQ表\*ARABIC20简单序时平均法日期订单量时间313233343536373839404142434445464748预测值1.15902627564267168794880497879595947964431444044054622426739502875180411631.25143518852995239533359985998486341843826390237964336367337762710177012261.35508568858546450745279178245661755785086507847765333500644313296200612831.4399439544005426944274809452933663014285630053002334930632842206912718031.5320031703316345639954548431434002929260927042371287526122390174610806961.635023484365938704323470947374088349931353263299134093241293121711387889真实值真实值1.1218215233262297272249257198222205225221201178144115611.22132462562693303883952892702302602422842753012802181281.34785345706237108097736275225265485325085175864472752211.4898295439815103891257916

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论