《UCI数据集和源代码》.docx_第1页
《UCI数据集和源代码》.docx_第2页
《UCI数据集和源代码》.docx_第3页
《UCI数据集和源代码》.docx_第4页
《UCI数据集和源代码》.docx_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

UCI数据集和源代码UCI数据集是一个常用的标准测试数据集,下载地址在/mlearn/MLRepository.html我的主页上也有整理好的一些UCI数据集(arff格式):/yuy/files/download/UCI_arff.zip在看别人的论文时,别人使用的数据集会给出数据集的出处或下载地址(除非是很机密的数据,例如与国家安全有关)。如果你看的论文没有给出数据集的出处,请立即停止看这篇论文,并且停止看刊发这篇论文的期刊上的所有文章。因为可以断定这些文章质量很差。关于源代码,网上有很多公开源码的算法包,例如最为著名的Weka,MLC+等。Weka还在不断的更新其算法,下载地址:http:/www.cs.waikato.ac.nz/ml/weka/很多的机器学习的经典算法都在里面。而且公布源程序,易于修改。如果作者没有公布源程序,可以到作者主页找找,也可以写信给作者要,一般论文开头都会有作者的email地址。写信的时候要注意要很有礼貌,否则作者,尤其是著名学者,很有可能不会理睬。如果算法简单,可以自己实现。关于论文的下载,如果能够访问电子图书馆是最好的,很多学校都买了IEEE,Elsevier,Kluwer等,上面的期刊都不错。有一些很好的期刊是免费的,像JAIR和JMLR,分别在:/research/jair/home.html/如果能访问的免费期刊太少,可以到CiteSeer上搜索(/),上面搜集了很多免费论文(但是要注意,论文的质量参差不齐),或者用G)搜索。再嘱咐两点,要做研究,首先要打好基础,例如数学基础和程序设计能力,要学会熟练使用google等搜索引擎,还有一定要看高质量的论文。数据挖掘的数据集资源大家做数据挖掘研究时,常常为找不到合适的数据而发愁。在KDNuggets上有Datasets栏目,提供一些数据集,网址为:/datasets/还有另外一个很好的资源网址为:/,里面包含的数据资源如下(按应用领域划分):Direct Marketing KDD CUP 1998 DataGIS Forest CoverTypeIndexing Corel Image Features Pseudo Periodic Synthetic Time SeriesIntrusion Detection KDD CUP 1999 DataProcess Control Synthetic Control Chart Time SeriesRecommendation Systems Entree Chicago Recommendation DataRobots Pioneer-1 Mobile Robot Data Robot Execution FailuresSign Language Recognition Australian Sign Language Data High-quality Australian Sign Language DataText Categorization 20 Newsgroups Data Reuters-21578 Text Categorization Collection NSF Research Awards Abstracts 199 0-2003World Wide Web Microsoft Anonymous Web Data MSNBC Anonymous Web Data Syskill Webert Web Data转:/blog/more.asp?name=DMman&id=240431、气候监测数据集/ftp/ndp026b2、几个实用的测试数据集下载的网站/roweis/data.html/roweis/data.html/summary.task.type.html/afs//project/theo-20/www/data//afs//project/theo-11/www/wwkb/http:/www.phys.uni.torun.pl/duch/software.html在下面的网址可以找到reuters数据集/lewis/reuters21578.html以下网址上有各种数据集:/summary.data.type.html进行文本分类,还有一个数据集是可以用的,即rainbow的数据集/afs/cs/project/theo-11/www/naive-bayes.html3、找了很多测试数据集,写论文的同志们肯定需要的,至少能用来检验算法的效果可能有一些不能访问,但是总有能访问的吧:UCI收集的机器学习数据集//mlearn/MLRepository.htmstatlib/SCILAB/scilabindexgb.htm/样本数据库//mlearn/MLRepository.html关于基金的数据挖掘的网站/index.asp/strehl/reuters数据集/lewis/reuters21578.html各种数据集:/summary.data.type.html/cgi-bin/mlnetois.pl/?File=datasets.html/datasets//adaptive/datasets/http:/fimi.cs.helsinki.fi/data//software/quest/Resources/index.shtmlr.it/palmeri/datam/DCI/进行文本分类&WEB/afs/cs/project/theo-11/www/naive-bayes.html/TR/WD-logfile-960221.html/Daemon/User/Config/Logging.html#AccessLog/1998/11/05/WC-workshop/Papers/bala2.html/afs//project/theo-11/www/wwkb//traces-logs.html/webkbhttp:/www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf/projects/kddcup/index.html时间序列数据的网址/reinsel/bjr-data/apriori算法的测试数据/cs/quest/syndata.html数据生成器的链接.hk/kdd/data_collection.html/cs/quest/syndata.html关联:/sourceforge/weka/regression-datasets.jar/software/quest/Resources/datasets/syndata.html#assocSynDataWEKA:/sourceforge/weka/regression-datasets.jar1。A jarfile containing 37 classification problems, originally obtained from the UCI repository/weka/datasets-UCI.jar2。A jarfile containing 37 regression problems, obtained from various sources/weka/datasets-numeric.jar3。A jarfile containing 30 regression datasets collected by Luis Torgo/weka/regression-datasets.jar癌症基因:/cgi-bin/cancer/datasets.cgi金融数据:http:/lisp.vse.cz/pkdd99/Challenge/chall.htm另一个人提供的/roweis/data.html/summary.task.type.html/afs//project/theo-20/www/data//afs//project/theo-11/www/wwkb/http:/www.phys.uni.torun.pl/duch/software.html在下面的网址可以找到reuters数据集/lewis/reuters21578.html以下网址上有各种数据集:/summary.data.type.html进行文本分类,还有一个数据集是可以用的,即rainbow的数据集/afs/cs/project/theo-11/www/naive-bayes.htmlDownload the Financial Data (17.5M zipped file, 67M unzipped data)Download the Medical Data (2M zipped file, 6M unzipped data)http:/lisp.vse.cz/pkdd99/Challenge/chall.htmkdnuggets 相关链接数据集(借花献佛了):/datasets/index.html你也可以到/blog/more.asp?name=idmer&id=24017察看kdnuggets 数据集资源的详细介绍。数据挖掘相关比赛以及数据集2005 University of California data mining contest, predicting bad accounts and their churn date using real-world CRM data, deadline June 30, 2005. ILP 2005 Challenge, on the prediction of functional classes of genes. KDD Cup 2005, on classifying internet user search queries, deadline July 8. Data Mining Cup 2005 (Chemnitz, Germany), for students; topic: How data mining can ascertain the risk of loss of payments and reduce this risk. KDD Cup 2004, focuses on data-mi

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论