电脑自动的新闻与技术_第1页
电脑自动的新闻与技术_第2页
电脑自动的新闻与技术_第3页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

电脑自动的新闻与技术

成立于第一个一年的研究机构,并与芝加哥大学工程和新闻学院合作。这项研究项目是一份用电子手段自动撰写的新闻报道。第一个项目的主题是北京中医药大学的支球队。每次赛季结束,系统将以手稿的形式自动生成整个赛季的总结。虽然“报道”中有错误,但它是一个可怕的步骤。西北大学电脑与新闻教授KrisHammond,也是这个研究机构的创始人之一,简述这项技术的背后逻辑,并预估15年后,有90%的新闻会由电脑自动产生。我们今天所谈的“内容”,是从储存的“数据”撷取而来,这些数据是明确、固定、电脑可以解读的数据。今天的环境,每天有无数这样的数据注入网络,如体育,财经、房地产、政府、企业等的统计,这一趋势不但不会停止,每天还有无数的交易在网上进行,这些交易的数据,也都登录成为资料。用这么多的数据,来描述我们今天世界的运作。当这一趋势继续加速,便制造了“开凿”(Mining)这些数据的机会,利用电脑软件,把数据的内涵转换成文字叙述的形态。有了这一步骤,今天以数据为主的新闻,就可以由电脑处理,产生叙述的文字,来描述这些事件。这是技术进展的第一步,把原始的硬性数据转换成软性的文字叙述。但每天进入网络的不止固定的数据,还有大量的叙述文稿,这些文稿只有人能理解,电脑还不能理解,所以要在技术上开发另一处理步骤,那就是把前一项反向作业,借着语言理解与撷取技术的发展,把叙述文字转换成电脑可以理解的固定数据,然后再把这些数据做为驱动器,注入不断扩张的数据来源,来产生新的叙述文字。固定数据与文字叙述的不断循环,电脑的智能就会不断提升,以人力导引的电脑系统,就能自动产生更丰富的叙述文稿。例如今天以球赛结果为主的报导,那时就自动产生场外球员的动态;今天以股市为主的报导,那时就自动产生营运的策略;今天有关失业的报道,那时就会自动产生政府应对措施的新闻。今天的新闻,越来越趋向分众,类别越分越细、越窄,但每一类别仅对少数人有兴趣、有价值,这一趋势在今天新闻的制作上无法做到,因为不可能大量制作各个狭窄领域的新闻,而每一领域仅供少数读者阅读。但如果有了巨大的数据量,电脑又能理解叙述的文稿,那就有机会来解决这一问题。事实上,这样的电脑系统也是产生大量多领域新闻的唯一方式,这些内容多是今天的新闻媒体力不从心所忽视的领域。这一技术的运用,所产生的不仅满足小群人的需求,还可以产生个人化、与自己更相关、更有意义的新闻内容,让每个人都能以全新的方式来体验新闻。KrisHammond教授说,15年以后90%的新闻会由电脑产生,不但可能,而且不可避免。在21世纪,15年是很长很长的一段时间,什么事都可能发生,即使五年以后的事也难以预料。我的预测是不需要15年就会发生,而且由非新闻媒体主导。[以上文章转载《自崭新电子报》那福忠先“网络论坛”2011/12/22栏目]像“有机”蔬菜或是“环保”包装盒一样,以后本栏目势必得注明“这一篇文章不是电脑写的,作者某某某身份证字号1234567890……”,万一大部分读者认为电脑写的文章比人写得更有趣,更有知识性的时候,这一段注明编辑就会被改成“本栏目作者为某某——本杂志社的机器人”,杂志从此省下了稿费,最后连编辑也可以省了。除非机器人已经可以替代记者去采访,否则就派个机器人记者去采访对象的机器人公关,记者也不是不可取代的。如果故事科学公司(NarrativeScience)的技术再成熟的话,一个专业新闻网站确实不需要聘请记者和编辑,只要在茫茫网络大海,设定一个主旨,例如“台湾领导人选举”,可以轻易地摄取到庞大的材料,来自各个的新闻单位或是博客、微博,整理出选举的时间地点,结果谁赢谁输了,得票数据,当事人的发言,不相干的人或单位的意见等,足够写出一篇精彩的新闻故事。其实,今天许多新闻单位的记者或撰稿人,也是从各方的信息中,整理分析,然后撰写出一篇篇我们每天阅读的新闻。故事科学这套系统的流程分为四阶段:摄取数据→语法概念拆解→分析→产生故事,摄取任何文字内容,就像我们人类在写文章前读取各种材料一样,不同的是电脑必须先从数据中,拆解出人事物并归类,还要学习其中特定词句的概念,例如,球赛的“命中率”、“盖帽”、“点球”等,不是这些词的定义,概念是文章中传达准确信息的重要因素,在一篇篮球报导里面,“盖帽”能传递防守好、表现佳、弹力强、甚至扭转比赛胜负的信息,如果不用“盖帽”而以“在别人投篮出手的瞬间,用手拍下来”来叙述的话,读者恐怕受不了。有了合适概念的元素,再分析相互的关系,从中取出符合一篇文章的文字,注入故事的框架,和任何新闻记者的思路是一样的,因为故事科学团队是由科学家和作家团队组成的。如果你仔细分析大作家的同系列作品,例如琼瑶的爱情小说,男女主角多是俊男美女,两人身世背景反差特大,在罗曼蒂克的场景相遇而相恋,因误会而分分合合,某一方或双方不可回避的反对力量,造成两人被拆散严重的,合理或不合理的情节轮番上阵,结局视作者的需要再来决定悲剧还是喜剧收场,读者看得眼泪鼻涕纵横,哪在乎理由牵强不牵强。哈利波特的作者罗琳(J.K.Rowling)女士写了7集,都是有很厉害很坏的反派巫师,坏人越坏结局越容易感动人,哈利波特从第一页开始就受到一连串的冤屈,冤屈越冤,读者越不忍中断,主角屡屡险处逢生,直到版面足够了,就拨云见日,如果你看了几集都没能看出罗琳女士的故事模型,那你一定是十足的哈利波特迷了。水浒传108个好汉,也不过只有三、五个角色模型,如果你分析一下,从出场到加入梁山泊的剧情,林冲和武松就属于同一模型,还有鲁智深,是不是也可以归于同一模型?长篇小说的难度是在角色模型和整体框架的应用后,还要能引人入胜才行,新闻报导的文章框架本来固定,电脑从新闻稿或短篇故事开始尝试,绝对可行,故事科学团队计划要提供给客户的一个低成本的工具,不是头上有天线的机器人,纯粹是一个软件,去年底美国大学美式足球赛结束后60秒钟,新闻网站利用故事科学发出这一场比赛新闻快报,内容和现场文字记者一样简洁明了,没有一个错字。到今天为止,故事科学已经为20几家客户公司或政府单位服务,从内部的数据库中开凿出合适的材料,写出适合的文章。著名的FoxNetworks旗下的TheBigTenNetwork从2010年春天开始,采用这套技术来报导垒球和棒球比赛,比赛完毕后一两钟TheBigTenNetwork的新闻网站就能发表比赛的新闻稿,故事科学软件不是“看”完比赛现场后,就把比赛亮点编成的新闻稿,其实最重要的是软件得以在FoxNetworks的体育数据库中摄取内容材料,球队和球员的各种历史数据都是补充篇幅的好材料。我们可以想象参考越多的数据和内容,一个好新闻记者就可以制作越精彩的新闻故事,故事科学软件可以搜索全球网络世界,比任何认真的记者找到更快、更多的材料,这就是推测“15年后,90%的新闻报道都会由电脑来写”的理论基础。本文产生的过程中,拜访了NarrativeScience网站,和以下网页:商业周刊2010/4/29:运动新闻还需要文字记者?(AreSportswrittersIsNecessary?)纽约时报2011/9/10:或许你怀疑,本栏目是真人写的7(InCaseYouWondered,ARealHumanWroteThisColumn?)纽约时报2011/9/12:写作机器的用途和意义。(WritingMachine,TheirUsesandMeanin

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论