论文评审原版论文刘铎9本1230106012301060开题报告_第1页
论文评审原版论文刘铎9本1230106012301060开题报告_第2页
论文评审原版论文刘铎9本1230106012301060开题报告_第3页
论文评审原版论文刘铎9本1230106012301060开题报告_第4页
免费预览已结束,剩余1页可下载查看

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、 北京交通大学毕业设计(论文)开题报告题 目 :基于新闻类数据的大数据分析应用报道日历的设计与实现学院: 软件学院专业:软件工程学生姓名: XXXX学号: XXXXXXX1项目概述:u 项目来源及背景 随着信息时代的兴起,人们的生活中充斥着各种各样的信息,带来方便的同时也带来了一些不便,爆炸式的信息或许将用户真正想看到的信息淹没了,使得获取信息的效率显著降低,带来了更多的时间成本,而这一点对于视“时效性”与文章质量为生命的新闻工作者来说,无疑是一个很大打击。于是,一个能够对海量数据进行筛选、分析, 甚至能够在一定程度上提前预测信息产生的系统,成为了一个迫在眉睫的需求。 u 项目与实习的关系 本

2、项目的提出与跟进源于笔者所在的北京拓尔思信息技术股份 ,由笔者负责主要功能的开发。软件的开发、设计与实现,依赖于本公司的文本挖掘软件TRS CKM SOAP SERVER V5.0,以及 TRS 海贝大数据管理系统。 u 项目开发意义、必要性与现实价值 在新闻工作的开展中,由于“时效性”和新闻质量极为重要,对于一些新闻既需要能够尽快发出,也需要能够有一定质量的历史、背景分析,而这两点在海量数据的背景下往往会难以兼顾。 为了解决这一问题,我们注意到,每年或者每隔一定周期都会发生一些固定的重 这样不仅可以利用软件对大量的数据进行分析处理,提高信息的精确度,更能够对相同主题的新闻进行追踪,甚至预先提

3、醒编辑进行一些报道的准备工作。从而提高工作效率,让大量的数据成为优势。 北京交通大学毕业设计(论文)开题报告2u 本设计的主要内容 1. 根据软件过程的要求规划软件的开发,合理安排各个阶段的任务,首先形成需求分析,其次设计 UI 界面,随后编码开发,最后测试软件。 2. 通过对新闻结构化数据的合理筛选与精炼,去除相似新闻与他国语言新闻, 缩小数据集。 3. 通过 TRS CKM 文本挖掘引擎的使用,对有效数据集进行文本分析,实现关键词抽取、实体抽取、文本分类、常识校对褒贬分析等数据处理功能,进一步对新闻进行分类,按类别缩小数据集。 4. 实现算法,使得系统可以对同一类别的新闻按重要程度排序。

4、5. 运用 Spring MVC 的 WEB 架构,将文本处理结果有效显示于 WEB 页面,页面部分主要使用 bootstrap 框架搭建,关键词墙、时间线主要使用 Echarts 框架实现。 6. 将系统部署在 Linux 服务介质上,测试运行,进行监控、运维工作。 u 重点、难点和特色 本项目的重点首先在于数据筛选,将千万级的新闻数据筛选精炼至十万级以下, 以便之后高效处理;其次在于系统对新闻的分析、聚类;最后在于通过一定的机器智能将新闻按照重要程度进行排序,对未来可能发生的新闻进行预测。 本项目的难点主要在于数据集的精炼以及智能排序和新闻预测。 报道日历的特色之一是日历可以自动将大量新闻

5、数据进行精简分析,聚类分类, 并通过一定的智能算法来根据重要程度进行排序。 特色之二是系统可以对新闻进行常识校对、褒贬分析等处理。 特色之三是表现力上的冲击感,将以时间排序的新闻稿件通过日历这种表现形式展现出来,对相同话题的新闻可以提供按时间线追踪的视图,主要在可视化技术方面有所创新,使系统 UI 流畅美观,布局适宜。 最后,若时间允许,则加入日历的提醒功能,通过历史上一些特定 的发生规律进行预测,将未来可能发生的事作为计划定义到日历中。 北京交通大学毕业设计(论文)开题报告3设计方案:u 项目背景及理论基础 本系统能够满足当前新闻工作者的实际需要,不仅可以提高工作效率,更能够提高工作质量。同

6、时,对于非新闻工作者,也能够迅速获取相关新闻信息,甚至能够获得新闻本身之外的有效信息。 本项目采用 B/S 架构,使用架设于 Linux 上的 Tomcat8.0 apache 作为 HTTP 服务器,采用 Spring MVC 的 Web 架构,使用笔者所在公司提供的 TRS 海贝检索型数据库提供数据源、TRS CKM 文本挖掘引擎对文本类新闻数据进行分析。 u 解决问题的方法与步骤 1. 熟悉掌握开发环境及工具,包括 Java、Eclipse、Maven、Tomcat 2. 熟练掌握基于 Spring MVC 的 Web 架构 3. 掌握 TRS Server、TRS Hybase 两种全

7、文检索数据库,实现数据的导入、导出、检索、统计等实验。 4. 掌握 TRS CKM 文本挖掘引擎的使用,实现关键词抽取、实体抽取、文本分类、相似性检索、常识校对、褒贬分析等试验。 5. 熟练掌握在 Linux 操作系统,各种应用引擎、服务介质的部署、监控、运维。 6. 根据需求分析完成概要设计、详细设计,确立具体功能需求的基本实现方案。 7. 进行项目编码,并做好系统的测试工作。 u 预期成果 1. 完成系统的全部功能点,可以有效提高新闻工作者的工作效率与工作质量。 2. 系统性能优良,吞吐量大,响应时间短。 3. 界面友好,布局合理美观,能够有效突出重点新闻与新闻的时间线。 4. 在此项目的

8、设计与开发工作的基础上,完成毕业设计论文的撰写。 北京交通大学毕业设计(论文)开题报告4主要参考文献:1 陈晓云. 文本挖掘若干关键技术研究D.复旦大学,2005. 2 谌志群, 张国煊 . 文本挖掘与中文文本挖掘模型研究 J. 情报科学,2007,07:1046 - 1051. 3 王志明,沙莎. Web 文本挖掘技术在新闻主题检测中的应用研究J. 长沙大学学报,2007,05:58-60. 4 李健. 聚类分析及其在文本挖掘中的应用D.西安电子科技大学,2005. 5张兆中. WEB 文本挖掘的聚类分析D.山东科技大学,2005. 6 易高翔. Web 文本挖掘研究与实现D.武汉科技大学,

9、2004. 7 梁维铿. 基于 Hadoop 的分布式文本聚类研究D.华南理工大学,2011. 8刘智勇. 基于云计算的文本挖掘算法研究D.电子科技大学,2011. 9 陈伟. 基于时序文本挖掘的新闻内容理解与推荐技术研究D. 浙江大学,2010. 10 . 对分 布式计 算、网 格运算 和云计 算分析 J. 科 技信息,2013,09:87-88. 11 林子雨, 赖永炫, 林琛, 谢怡, 邹权 . 云数据库研究 J. 软件学报, 2 0 1 2 , 0 5 : 1 1 4 8 - 1166. 12 王小妮,高学东,倪晓明. 基于云计算的分布式数据挖掘平台架构J. 北京信息科技大学学报(自然科学版),2011,05:19-24. 13 陈磊,王鹏,董静宜,任超. 基于云计算架构的分布式数据挖掘研究J. 成都信息工程学院学报,2010,06:577-579. 毕业设计(论文)进度安排:序号毕业设计(论文)各阶段内容时间安排备注1 了解项目内容与背景,形成需求分析,学习相关基础理论知识 2016.1.11-2016.2.21 2 根据项目的功能点编写试验 Demo 程序,用于统计、筛选数据,并测试功能的实现效果 2016.2.22-2016.3.27 3 完成概要设计、详细设计,编写代码,实现所有业务流程及相关功能 2016.3.28-2016.4.24 4 测试

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论