版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
15MapReduce”的内容,因为作者写作hadoopHadooppythonMapReduce程文章内容分为以下几个部分:(本文的代码和用到的数据集可以在这里)设有一组数字(x1,x2,xn),这组数字的均值和方差如下:meanx1x2xnn(xn(x2n(x22meanxmean2 2varnnnisum1就是(xxx,sum2就是(x2x2x2map 每个部分的{count(元素个数)、sum1/count、sum2/count}reducemap端值mean的平方,就得到了方差var.importfromnumpyimportimportfromnumpyimportmat,mean,defforlineininputread_input(sys.stdin)#input[float(line)forlineininput#floatnumInputs=len(input)input=mat(input)print"%d\t%f\t%f"%(numInputs,mean(input),read()方法,会导致不可预测的内存占用。好的方法是利用固定长度的缓冲区来不断文件内容。通过yield,我们不再需要编写读文件的迭代类,就可mapperOut=[line.split('\t')forlineinmapperOut=[line.split('\t')forlinein#importfromnumpyimportmat,mean,defforlineinyieldinput=print"%d\t%f\t%f"%(cumN,mean,forinstanceincumN+=njPythonHadoop这里是桌面的文件夹:/home/hadoop/Desktop/python_doc中)2py文件要输入命令:od+x文件名,修改其权限变成可执行文件。启动HDFS,进入 (也就是hadoop的安装目录,我的/验证HDFS是否启动,在MasterNode上输入以下命令,将会出现:NameNode、SecondaryNameNode和DataNode 注意:在hadoop2.2.0的版本中,streaming.jar 发生了改变,保存在1)mapred.map.tasks:maptask数目2)mapred.reduce.tasks:reducetask数目Found2 2hadoop 02016-03-1616:45/user/hadoop/mr- 2hadoop [hadoop@hadoop1[hadoop@hadoop1Desktop]$hadoopfs-cat/user/hadoop/mr-ouput13/part-withcode1”的错误odxsudoyumsudoyum-yinstallgccgcc-c++numpypython-develPython2.6.6(r266:84292,Jul232015,[GCC (RedHat4.4.7-11)]onType"help","copyright","credits"or"license"formore>>>fromnumpyimport要确保jar文件的路径正确,hadoop2.2版本的该文件是保存在:$HADOOPHOME/share/hadoop/tools/lib/hadoop-streaming-2.2.0.jarHDFS中的输出文件夹(HDFS下的/user/hadoop/mr-ouput13,一定要是一个新的(之前不存在)的文件夹,因为即使上条HadoopStreaming命令没有执行成参数–file后面是map和reduce的,路径是详细的绝对路径(我这里/home/hadoop/Deskoppython_doc/Mappe
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 泉州海洋职业学院《外科护理学》2025-2026学年期末试卷
- 福建理工大学《服装材料学》2025-2026学年期末试卷
- 民办合肥滨湖职业技术学院《外科学总论》2025-2026学年期末试卷
- 地质勘查公司样品质量管理办法
- 2026年800米考试题库及答案
- 2026年6级乐理考试题库及答案
- 2026年4年级英语阅读测试卷及答案
- 2026年54消防笔试题答案
- 2026年abc三类人员模式考试题答案
- 2026年2o15年c照科一试题及答案
- 砂石料供应质量控制及保证措施
- 《制药用水检查指南》2026
- 2026年施工现场防汛应急救援预案方案
- 2026年阿里巴巴人才测试题及答案
- 全国税务机关信访工作规则
- 武汉城投公司笔试题库
- 重庆辅警笔试题目及答案
- 2025年江苏信息职业技术学院辅导员招聘备考题库附答案
- 辅警面试100题及答案解析
- 安徽2021-2025真题及答案
- 2025年空间生态农业示范项目可行性研究报告
评论
0/150
提交评论