版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
评委一评分,签名及备注队号:20024评委三评分,签名及备注评委二评分,签名及备注选题:B评委四评分,签名及备注题目:网上书店图书推荐摘要在如今大数据时代,信息过载已成为购书者与择书之间的主要矛盾。针对这一问题,结合spss,excel,matlab,yaahp等软件,研究用户与书籍、书籍与标签之间的关系,本文构建对购书者进行书籍推荐的模型算法。本文要求根据给出数据,先需要解决三方面问题。首先,通过user_social.txt,book_tag.txt,user_book_score.txt分析出影响用户对书籍评分的因素,再用excel表格处理已知数据后,从而得到具体的影响数值。然后,根据得出的影响数值推测用户评分的计算公式,再对公式进行检验其正确性,从而计算出评分结果。根据评分公式计算出用户所喜爱类书籍中书籍的分数,依照分数高低进行推荐。针对问题一,用excel表格对用户的社会关系、书籍与标签关系、用户对书籍评分处理分析得出用户对书籍的评价。从而,假设出影响因素分别是用户所感兴趣的书籍、书籍受欢迎程度、其他用户对该书的评价。用yaahp软件处理用户对书籍的评分与书籍的受欢迎程度、用户的兴趣爱好、及书的综合评分的关系,得出各影响因素的权重,从而证明假设的成立,得到用户对书籍评分的影响因素。针对问题二,根据问题一中得到的影响因素,用excel表格处理书籍ID与标签的数据、用户ID与关系好友数据和用户ID与用户评分数据三种数据,从而得到具体的影响数值。根据得出的影响数值推测用户评分的计算公式,运用user_score.txt中的评分数据检验用户评分公式的正确性。针对问题三,运用问题二中所建立的模型,在用户所感兴趣的书籍分类中筛选出一部分书籍,综合书籍受欢迎程度、其他用户对该书的评价两项因素,根据公式计算所筛选书籍的分数,将筛选出的书籍的评分最高的三本书书推荐给用户。关键字:聚类分析法,随机抽样法网上书店图书推荐1问题重述在大数据时代,信息过载已成读者最重要的问题。针对这一问题我们为网上购买书籍的读者进行书籍推荐。随着信息技术和互联网的发展,已经是消费者和生产者日益头疼的事情。推荐,就是解决这一矛盾的重要工具,在互联网的产品及其应用中被广泛采用,包括大家经常使用的相关搜索、话题推荐、电子商务的各种产品推荐、社交网络上的交友推荐等。我们获得了一个著名网上书店的用户行为信息,包括对于书籍的评分数据,书籍的标签信息以及用户的社交关系,根据数据完成以下问题。1.1问题一分析影响用户对书籍评分的因素;1.2问题二建立一个模型,预测predict.txt附件中的用户对未看过书籍的评分;1.3问题三针对predict.txt附件中的用户,给每个用户推荐3本没看过的书籍。2问题分析随着信息技术和互联网的不断发展,信息过剩已成为生产者和消费者的主要矛盾。然而,推荐是可以解决这种问题的优良工具,在互联网的产品和消费中被广泛应用。但是,在使用过程中还需要不断的优化。对于问题一,本文通过book_tag.txt中的已知数据书籍ID和标签,进行标签数量统计和处理,最终得到了一份准确的书籍和书籍受欢迎程度的关系图,得出影响用户对书籍评价的影响因素,建立影响因素和评分的层次分析法模型,并且运用yaahp软件判断影响因素和评分的一致性,得到各影响因素的权值。对于问题二,根据模型一已经确定的影响因素,用excel表格对user_social.txt分析处理用户ID和关系好友ID数据,得到用户的好友数量与其兴趣爱好准确数值关系,用excel表格对book_tag.txt分析处理书籍ID和标签这两个数据,得到书籍的受欢迎程度与书籍的标签个数的准确数值关系,用excel表格对user_book_score.txt处理score数据,用户对该书籍的评价,总结出了用户在这些因素下评价所占的比例,得到用户对未看过书籍的评分关系式,需要用户对未看过书籍的预测评价较多,根据分析和处理出的评价因素,在Matlab中依据确定的用户ID和书籍ID建立预测用户评分模型。最终,计算出用户对未书籍的评分。对于问题三,运用聚类分析法对书籍及用户的兴趣爱好进行分类,以确定用户兴趣所属类别。根据问题二所建立的模型,考虑三种因素,对书籍进行评分,因素一,分数较高的书籍;因素二,书籍所属类别是否是用户所喜爱书籍的类别;因素三,书籍的受欢迎程度。根据这三个因素确定比重,运用加权的思想来对书籍进行最终评分,选择评分高的三本书籍推荐给用户。模型的假设假设这一网站的数据具有一定的可信度。2.假设在大量具有相同标签的用户中,无论随机选取那几个进行分析,筛选,研究,对最终的结果都没有影响。3.假设在处理预测predict.txt附件中的用户对未看过书籍评分时,带入建立的模型求解时无数据遗漏。4符号说明R书籍受欢迎程度P标签个数Q为标签的总个数N用户对该书的评价M其他用户对该书籍的评分K加权兴趣爱好L该用户好友数量O所有好友数量5模型的建立与求解5.1模型一:应用层次分析法对影响因素的分析5.1.1模型的建立用excel表格分别对user_social.tx中的好友数量数据,对user_score.txt中的用户对书籍的评分数据,对book_tag.txt中的标签个数的数据统计处理,得到下图的关系:用户好友数量越多用户好友数量越多兴趣爱好越广对书籍评分影响书籍所对应标签的个数该书籍受欢迎程度对书籍评分影响其他用户对书籍评分的均值对书籍评分影响在进一步分析所给数据,将书籍受欢迎程度与标签的个数(附录1)两者进行对比,规定:极不受欢迎书籍(标签个数为1~10),一般受欢迎书籍(标签个数为11~30),很受欢迎书籍(标签个数为31~40),非常受欢迎书籍(标签个数为41~50)的数据,excel表格部分数据示例如表2表2标签个数(不受欢迎)书籍ID标签个数(很受欢迎)书籍ID标签个数(一般受欢迎)书籍ID标签个数(非常受欢迎)书籍ID6163860345778391298661241274044616592434614043129870654130810361668343465716912988748413448466168268346859061498895141494356616855934692757149917794164225661726443469689914992258423469356174218347376271499226342743366617863634741844149924544281853161806663476292414993711428910726188994348770641499964042917092619314934906498151029864297985861934713511001415106465431792784195382351530551510649143231082可以准确得出影响用户对书籍评价的因素主要有:书籍受欢迎程度、用户的兴趣爱好、其他用户对某书的评价这三个因素。因此用yaahp软件处理评分与书籍受欢迎度、兴趣爱好、其他用户对该书的评价之间关系如图2所示。图2影响因素与最终评分的关系图5.1.2模型的求解模型优化后通过运用yaahp软件对评分与书籍受欢迎度、用户兴趣爱好、其他用户对该书的评价三者之间关系做层析分析处理得到影响因素的权重如表3所示:表3权重的影响因素表影响因素权重其他用户对该书籍的评分0.1085书籍受欢迎度0.3445用户兴趣爱好0.5469 表3直接说明书籍受欢迎程度、用户兴趣爱好、其他用户对该书籍的评价这三方面中用户对书籍评价这一因素对评分影响最大。5.2模型二:预测用户对书籍评分模型5.2.1模型的建立在模型一中已经得到用户对书籍的评分与书籍受欢迎程度、用户兴趣爱好、其他用户对该书籍的评价三个影响因素有关,分别对这三个因素进行分析,过程如下:用户的兴趣爱好:用excel表格对user_sociaI.txt中的用户ID和关系好友ID个数两个数据整理分析,发现用户的好友数量越多,用户兴趣爱好越广泛,对用户评分的影响越大,具体关系如表4所示。计算关系式:其中K为加权兴趣爱好,L为该用户好友数量,O为所有好友的数量表4用户和兴趣爱好的关系图用户ID6363474865086173401421572977655371627962221048694兴趣爱好3.3%16.3%45.6%22.8%9.8%39.1%32.6%用户ID4980857183513265537251002088996160170780814325398兴趣爱好9.8%19.5%26.0%6.5%3.3%13.0%13.0%2.书籍受欢迎程度:用excel表格对book_tag.txt中书籍ID与标签数量统计处理,由前两者之间的关系不难看出,标签越多,书籍受欢迎程度越高,对书籍评分影响越大。书籍ID与书籍受欢迎程度的关系如下表5表5书籍的受欢迎程度书籍ID169509264062420913868975240941659378954484书籍受欢迎程度1.06%1.06%1.58%1.36%1.89%1.81%1.28%书籍ID568717809022758331234149792521366825449772书籍受欢迎程度1.21%0.83%2.04%0.83%2.34%1.06%1.21%其中R为书籍受欢迎程度,P为标签个数,Q为标签总个数。3.其他用户对该书籍的评价M:用excel对user_book_score.txt中用户ID、评分两个数据进行整理分析过程如下:1)利用excel对第一个用户筛选2)将用户对评分求取平均值3)对每一个用户重复上述操作。发现所有用户的评分均近似为4,其他用户对书的评分为M,所以4.用户评分在三种影响因素中用户的兴趣爱好占的比例较大,经分析后其他两个影响因素在用户对书籍的评价的过程可以抽象的表示出来,用matlab软件建立用户、书籍、标签三者关系的数据库,由计算过程:N=5F×0.3445R×0.1085M×0.5469K其中R为书籍受欢迎程度,N为评分,M为其他用户对该书的评分,K为加权兴趣爱好,F为系数。将user_score.txt中的评分数据、用户ID、书籍ID代入matlab程序,从而得出F的近似值F=177778。5.2.1模型的求解:用excel表格处理Predict.txt中的用户ID.书籍ID数据带入matlab程序中可以预测predict.txt附件中的用户对书籍的评分近似值为:表5用户ID书籍ID预测评分用户ID书籍ID预测评分76252254736903762522542469137625225929118476252259164694762522523533847625225793936576252254246913415665817503147625225916469441566584227113762522579393654156658585783441566581750314415665841299024156658422711341566581340032415665858578344156658443948141566584129902599783434693524156658134003259978341447183415665844394815997834827305476252254736903599783421956027625225929118459978342420573762522523533845.3模型三:对用户进行书籍推荐模型5.3.1模型的建立问题三中要求针对predict.txt附件中的用户,给每个用户推荐3本没看过的书籍,据题意确立聚类分析模型:根据spss软件的功能,运用分析工具中的系统聚类工具将题所给附件book_tag.txt中的书籍ID、标签数据进行处理,将书籍ID类型处理为字符串,书籍标签的类型处理为数值,运行系统聚类程序,得到的数据及图表,(由于数据量较大,所以图片其中一部分举例进行说明)运行图书推荐程序得到三本推荐书籍:聚类表6案例处理汇总a案例有效缺失总计N百分比N百分比N百分比1271.5824298.58369100.0a.平均联结(组之间)平均联结(组之间)表7聚类表阶群集组合系数首次出现阶群集下一阶群集1群集2群集1群集2157716192147242923.0000062244396815161340446.000005731162552164166115.0000016452675282168006424.0000011518774708169471026.000005668055093177916221.0000074717596503179102451.0000055819017984181309867.000006198303778184692578.00000631048107030186547317.00000271152676516194516107.00040471249427180196511468.00000381345897821199639761.000003114216275201565531.00000691523815737202021686.0000072图3图3群集类数图图1图1图4图4聚类树状图5.3.2模型的求解根据聚类树状图4中书籍分为八类,运用从八类书籍随机抽取得出下表:(说明:表中数字为书籍ID,下表中数据仅为所有书籍分类中的一部分,以这些随机样本代替总样本数据。)表8第一类第二类第三类第四类第五类第六类第七类第八类884743101745102986551643688187426364754767589998100009103782129881820784223691355073787684590146102706104237134305231082770141229939198312196951102725110658143586722671234942131744690361754189105962121087157550560582131872590521493772819779106524134003199101921583525258754413397065928548107332135549200059987277263412328814659891932942114170143060215360331959775739165179562050918448114362175523252244528760165274787907169073448022120925176010256409725510329141229187660723689336122820191971265634234262475428755214421442689680131620219766302667824572526197788626431614264062134100244004316087235338723083625361431616394874136436267990317957242462535649429982529928886668138892283989350675400664428853790439857871886726138979285950366773368136197094921652497692690124144718307516368034171996724071102794208596231821147432310747403836991905199801463355825795100916151357319219406318468251560404627501268745821844154093326576408945337843855350999640170547494481156825338076429153305472986612912354826008854951173339342102430748830061135305103496847643593008175368357403444506207515168093595026301819691672175598358808448779339247331989955890629687298462177508369249472122651953921863923530307021265832186718379543499604930066233832858105269545921213186722385074522532766799823758859106499231921289189056385819535384373630758341531592761443823006194667393789538665603182168785171218827275954211196630408656540544537695496726138518569349856054206953412572548210243094103535864171172132594081207095415774568348308966693536237464760796692757按照问题二中所建立的模型,推荐书籍考虑用户的兴趣、大众对书籍的评分和书籍的受欢迎程度。根据以上因素,依据用户的兴趣喜好,找到用户喜爱书籍所在类,在类中查找书籍,对用户进行书籍推荐。根据模型推测,得书籍推荐如表8所示。用户ID书籍ID72454814057852475748088393762522542915368303773090141566582310827433669798585997834429153891072307078892140783214499163773194612515537226571709644139769表96模型的评价6.1模型的优点根据要求解的问题,从已知数据book_tag.txt中书籍的受欢迎程度作为出发点,并且建立了层次分析法模型来验证,更加准确的描述了影响因素的准确度,从而增加了人们在评价时的准确度。根据各因素抽象出评价时所占的比例具有一定的可信度。6.2模型的缺点从给予的大量数据中只是进行了相应的筛选.处理后,得到最终的影响因素,没有从多角度出发来分析这个问题的因素,表现的有点片面,得到的影响因素可能在某种程度上不能达到每个人都想要的结果。未对数据进行检验、筛除,所执行模型的结果存在一定误差。7参考文献[1]邓雪,李家铭,曾浩健,陈俊羊,赵俊峰.层次分析法权重计算方法分析及其应用研究[J].数学的实践与认识,2012,07:93-100.[2]宋媛.聚类分析中确定最佳聚类数的若干问题研究[D].延边大学,2013.[3]黄杏模.谈谈简单随机抽样法及估计问题[J].云南林业调查规划设计,1995.[4]胡守信,李柏年.基于MATLAB的数学实验.北京:科学出版社,2004[5]吴礼斌,李柏年.数学实验与建模.北京:高等教育出版社,2006[6]胡良剑,孙晓君.MATLAB与数学实验.北京:高等教育出版社,2006[7]龚纯,王正林.MALAB语言常用算法程序集.北京:电子工业出版社,2008[8]江世宏.MATLAB语言与数学实验.北京:科学出版社,20078附录附录1.附录1.1书籍ID884743851976589835165852327696557075163860196630688152524320196644622630360490753709786479693598688187589884910215786499262213196682917579327764524376524378753761852074458861721007360565491638131191524413950401852102426124196753622747426142458915950437327846464241983210589998890368557244950462书籍受欢迎程度0.9%11.1%0.9%13.9%20.3%13.9%3.7%26.8%15.7%7.4%13.9%9.2%11.1%12.9%16.6%12.9%12.9%6.5%10.2%19.4%30.5%12.9%12.9%6.5%10.2%12.0%12.0%2.8%16.6%12.0%21.2%18.5%8.3%0.9%11.1%6.5%6.5%12.0%13.9%12.9%18.5%12.0%10.2%19.4%0.9%1.8%12.9%10.2%14.8%附录1.2用户ID63634748650861734014215729776553716279622210486943.3%16.3%45.6%22.8%9.8%39.1%32.6%49808571835132655372510020889961601707808143253989.8%19.5%26.0%6.5%3.3%13.0%13.0%附录2:Biaoqian.xls部分数据实例书籍ID169509264062420913868975240941659378954484568717809022792521366825449772受欢迎程度0.010.010.020.010.020.020.010.010.010.020.010.01用户ID629145752428825505027707789283886194194320664098491750592359322262147260293458912931兴趣爱好0.490.160.130.200.460.070.160.290.130.070.130.07matable执行程序M=xlsread('biaoqian.xls',-1);L=xlsread('biaoqian.xls',-1);a=find(M==169509);a=M(2,a)b=find(L==6291457);b=L(4,b)c=4*1/3;e=a*b*5*c 附录3:#include<stdio.h>main(){intmax=0;ID=0;biaoqian=0;n=0;%打开book_tag.txt和user_book_score.txta[][3]=fopen(g:\数模\user_book_score.txt);b[][]=fopen(g:\数模\book_tag.txt);%查找用户评分最高的书籍for(i=0;i>=0;i++){while(a[i][0]==a[i+1][0]){if(a[i][2]>a[i+1][2]){max=a[i][2];ID=a[i][1];}else{max=a[i+1][2];ID=a[i+1][1];}}%调出与高分书籍相应的标签for(i=0;i>=0;i++){if(ID==a[i][0])biaoqian=a[i][1];}%查找含有此标签的书籍IDfor(i=0;i>=0;i++){for(j=0;j>=0;j++){While(n<3){%输出三本书籍if(b[i][j]=biaoqian)&&if(b[i][j]!=ID)%排除已看过的书,得到未看过的书{printf(“%d\n”);n++;}}}}}}平均联结(组之间)聚类表阶群集组合系数首次出现阶群集下一阶群集1群集2群集1群集2157716192147242923.0000062244396815161340446.000005731162552164166115.0000016452675282168006424.0000011518774708169471026.000005668055093177916221.0000074717596503179102451.0000055819017984181309867.000006198303778184692578.00000631048107030186547317.00000271152676516194516107.00040471249427180196511468.00000381345897821199639761.000003114216275201565531.00000691523815737202021686.0000072161164613203018603.50030471712074899203328586.00000351844845610204248228.00000941918126919205180442.00000492030155185206541327.00000432134707563207911533.0000070225574010208939126.0000050237614348212082691.00000642426674255214451948.00000892516405319214680928.00000592622628268217888726.0000079275454810218927827.500010782839184249219598994.00000762934087955221020638.00000523012837572222411381.00000423130384589224366696.500013833243516410224892017.00000513330647717226284816.00000533417115367228207619.00000633512077836228485357.00017066367218195229087801.00000763731915482229971675.00000443832794942235646981.000012703956295682238971362.00000694051467941239019700.00000804113867627239390677.00000614212832804240754142.500300894330157591244099236.500200904431916668245464110.500370854534497528246856465.00000734611262239248357043.0000092471165267248450846.7781611564830364471252326094.0000084493561812252551460.00001987505576226252913923.000220845142184351253905301.500032805234086332255657622.000290745310883064261308215.00003375541398057262663025.00000775517593118263283222.5007083561161877263533341.333475675744395575264906782.00020905850666002266849064.000001095916405821267490404.0002501066058666757268312641.000001126113861901268641977.00041886625485771270363319.5000192638301711272118893.00093488647615713273679938.500230936540915053276426098.0000091664711207279057505.00003579671167878279942617.875560986816574386280188229.0000010369215629281346893.5001439977032793470281596505.50038211017168877856285128885.000001047223812495285249771.0001501177316733449286119344.500045117748053408289787917.167652947510881378289973264.667530107767213918292021041.000362895771398321292807609.500540114785454508297992604.33327098794712262298030884.2506626998042185146298686328.33351401028144544907301243314.000001138255608189301891468.000001268317593038304557200.444553195845573036304705904.3335048118858093191304727679.667044100861771386304945798.00006199873566811305452283.33349010488444830307466020.2500631008912832667310452092.66742241069030154439312946956.00043571019140918228313295560.000650102925481126315404930.83362469393548761321636985.4009264111948054484323701668.8007418107957211759326860308.83376831099659447791329073760.0000012497215183331956408.25069011298116545334818397.750677810399177471335452137.7008679108100444809336132641.050888510810130153279336467075.733907010510240914218338360907.20091801051031161657347128550.65498681101043566887347396273.250877111310530154091351935186.0
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- GB/T 6346.17-2026电子设备用固定电容器第17部分:分规范金属化聚丙烯膜介质交流和脉冲固定电容器
- T/SDEPI 047-2024高浓度有机废水处理及回用技术规范
- T/ZSM 0076-2024发热伴血小板减少综合征村(社区)综合预防控制规范
- T/CAWAORG 010-2023县域肿瘤防治中心评估标准
- T/CADERM 6003-2021大型冰雪赛事应急医疗救援转运救治装备品量配置要求
- T/CACE 0165-2024废生物制药溶媒回收乙腈技术规范 超重力粗分耦合精馏法
- T/JSGS 020-2025春玉米覆膜浅埋智慧滴灌技术规程
- T/HNXY 0002-2024诚信示范单位评定规范
- T/CMEEEA 032-2025电气设备甚高频脉冲电流法绝缘在线监测装置技术规范
- T/CIE 285-2024民航客运销售富媒体数据及应用规范 第2部分:客票搜索应用接口
- 水电厂、水电站运行维护岗理论题库及答案
- 第二单元自测练习卷-2026-2027学年三年级数学上册人教版(含答案)
- 新教材高中政治 第二课 第二框 社会主义制度在中国的确立教学设计 部编版第一册
- 2026年高考政治选择题主观题满分答题技巧
- 《信息技术基础》课件-人工智能技术及应用
- 2026年事业单位招聘考试(党史党建基础知识)测试题及答案
- 销售人员绩效考核方案
- 聘请住家保姆协议书
- 2026年凉山州领导干部任前廉政法规考试题库及答案
- (正式版)DB15∕T 4344-2026 《全固废充填采矿胶凝材料用于尾矿充填技术规范》
- 中班-科学-奇妙的大树
评论
0/150
提交评论