版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、生物多样性信息学研究进展与发展趋势许哲平1,陈彬1,王利松1,乔慧捷2,刘凤红1,覃海宁1,纪力强2,马克平11 中国科学院植物研究所,北京 1000932 中国科学院动物研究所,北京 100101摘要 随着大数据时代的来临,传统的生物多样性研究开始逐渐向数据密集型的科研方式过渡。国际上,生物多样性信息学在不同类型的数据库平台(名录、标本、文献、照片、社区等)建设、分析和建模方法、集成式的学科思想趋势和产品等方面都有较好的发展。近年来,我国对基础性科技平台项目的支持力度快速加强,在专业数据库平台(物种生物多样性相关平台、遗传多样性相关平台和专业文献平台等)、公民科学平台和国际合作等方面取得了良
2、好进展,在生物标本数字化、生物物种名录的编研和公民科学平台等方面具有一定的优势。未来的生物多样性信息学将会在全球生物多样性信息学展望(GBIO)的整体框架下,加强与物种相关的宏观和微观数据的整合,充分利用开放的技术和云平台,建立和管理科学工作流,推动生物多样性科学的信息化和现代化。我国未来则需要在资源整合和挖掘、数据共享和公民科学平台等方面继续加强建设,并通过亚洲生物多样性保护与信息网络(ABCDNet)等渠道向亚洲区域辐射,不断增强国际影响力。关键词:生物多样性信息学;公民科学;物种名录;数据挖掘;信息服务;科学工作流;1. 引言当前,由于全球环境变化,特别是生物多样性快速丧失,引起国际社会
3、和各国政府的广泛关注。人们对生物多样性重要性认识越来越深刻。而随着信息技术在生物多样性研究领域的不断渗透和大数据时代的到来,生物多样性研究与信息技术融合产生的新学科生物多样性信息学(biodiversity informatics) 也逐步形成和发展。这是一门利用信息技术,对生物多样性基础数据的采集收藏、存储管理、检索共享和分析解释的新学科,其内容覆盖了系统学、进化生物学、居群生物学、行为科学,以及从传粉生物学到寄生病学和植物群落学等领域(王利松等,2010)。目前,生物多样性信息学的核心问题是解决 有什么、在哪里和怎么用的问题。有什么主要通过生物物种名录来回答,包括分类学名称的处理及其系统结
4、构,序列信息,特别是条形码数据,主要用于分类和构建系统树;在哪里主要通过标本数字化/地标化、文献数字化、公民科学的观察数据、遥感影像解译出的生态系统/生境结构和分布数据、模型预测的物种潜在分布信息等;怎么用主要通过在线工具和科学工作流等eScience平台,实现生物多样性信息整合和深度挖掘,为相关学科的研究人员、决策者和管理者提供个性化服务。为了实现这三个目标,需要信息学的帮助,主要是数据标准、在线管理与共享平台,包括可视化等方面的技术。近年来,国际上生物多样性信息学发展非常迅速。在数据方面,物种名录从Species 2000的135万条物种名称(2013年版),到uBio(http:/www
5、.)的1110万条生物名称,再到GNA(Global Name Architecture)的2000多万条名称。在标本数据方面,GBIF(Global Biodiversity Information Facility)已经累计有4亿条各类生物观测数据。在文献方面,BHL(Biodiversity Heritage Library)已经扫描上线了11.6万册(4131万页)的生物多样性文献资料。在DNA条形码数据方面,目前iBOL(The International Barcode of Life)已经积累了18.1万种的224.3万条测序,距离2015年底完成50万种500万
6、条测序的目标还有一段距离,但是总体看完成任务难度不大;而NCBI(National Center for Biotechnology Information)上面有近1.35亿条序列可以开放获取。数据增长和应用的需求必须要有数据标准相适应,灵活性和兼容性都很强的Darwin Core Archive则为多源数据的使用和集成提供了良好的便利,GBIF等项目也为其提供了多种处理和分析工具。数据和工具在科研工作中是基础环节,需要更多科研和政策需求的驱动。随着Species 2000、GBIF等以数据积累为目标的生物多样性信息学项目或网络体系的不断发展,一些新项目和网站开始出现, 包括国际对地观测组织
7、生物多样性观测网络(GEO BON)、欧盟的生物多样性e-Science项目(LifeWatch)、澳大利亚的Atlas of Living Australia项目和美国的DataONE观测项目。在项目发展方面,公民科学项目不断涌现,成为传统项目的有益补充。这些项目都从不同方面来完善和补充生物多样性的数据,并提供个性化的功能和工具。此外,国际学术会议也为各国同行的交流提供了良好的平台,TDWG(Biodiversity Information Standards)每年的年会都是一次很好的技术交流分享机会。2009年的第一届e-Biosphere全球大会在英国伦敦举行,来自69个国家的503位生
8、物多样性信息学研究人员参加了会议。会议成果将对未来几年的生物多样性信息学发展产生重要影响。2012年7月在丹麦哥本哈根举行的全球生物多样性信息学大会上,100多位来自生物多样性信息学、遗传学、地表观测、自然历史馆藏、生物多样性领域的专家学者聚集一堂,就充分利用信息技术、社交网络来支持生物多样性知识库建设和决策制定等问题进行了积极探讨,并形成了一个重要的报告Global Biodiversity Informatics Outlook (全球生物多样性信息学展望,简称GBIO)。为未来十年全球生物多样性信息学的发展指明方向。在我国,从20世纪80年代末开始进行物种数据库建设,到20世纪90年代在
9、世界银行贷款(BRIM)等项目的资助下开始建设中国生物多样性信息系统(CBIS),由中国科学院的15个研究所参加,形成了覆盖全国的生物多样性信息网络。21世纪初,中国科学院生物标本馆网络信息系统建设项目开始启动(马克平等,2010),并进一步得到科技部“标本资源的标准化整理、整合与共享平台建设项目”的持续支持,形成目前国家标本资源共享平台近1000万份标本数据的生物多样性信息共享平台。2005年以来,在中国科学院生物多样性委员会等相关组织的大力推动下,积极与国际著名的生物多样性信息学项目(如Species 2000、EOL、BHL、GBIF、iBOL等)合作,大力提升了中国在这个领域的影响力。
10、并于2009年开始组织召开两年一次的 “全国生物多样性信息学研讨会”,搭建了专业的学术交流平台,推动该学科在国内的发展。在我国,生物多样性信息学已经在分类学基础研究、濒危物种评估、生物地理格局认知、生物资源本底调查和监测等方面的工作中得到了较好的应用和推广。大数据时代的来临已经是大势所趋。2012年无疑是大数据从理论走向实际应用的元年。这一年,从达沃斯世界经济论坛发布的大数据,大影响:全球发展新的可能性、美国发布的大数据研究和发展倡议和联合国Global Pulse倡议项目发布的大数据的发展:挑战与机遇的一系列报告将以前学术界讨论的“大数据”概念落地,也将会在今后的几年里对相关的学术界和产业界
11、产生重大影响。生物多样性信息学身处其中,也将面临更多的机遇和挑战。2. 重要进展评述2.1生物物种名录生物物种名录既是生物分类学研究的核心问题之一,也是生物多样性保护与利用所依赖的科学基础。名录应该包括如下5个方面的基本信息:接受名及其原始发表文献;异名及其原始发表文献,异名与接受名的关联关系;最近的专家审核情况(包括审核人和审核时间);地理分布信息;信息来源(数据的提供者或参考文献) (Patonet al., 2008)。据粗略估计,全球有花植物约22万40万种,涉及的学名(拉丁名)达百万以上(Govaerts, 2003; Kier et al., 2009)。物种编目信息的数字化工作见
12、证了计算机信息技术在生物多样性领域应用的发展历程。从20世纪80年代初的邱园索引(Index Kewensis)到90年代由许多国际组织联合建立的国际植物学名索引 (International Plant Name Index,IPNI)、整合分类学信息系统 (Integrated Taxonomic Information System,ITIS)、美国密苏里植物园的TROPICOS,以及近些年在全球编目数据库中占有重要地位的全球生物物种名录(Catalogue of Life, CoL)和世界植物名录(The Plant List, TPL)等全球性电子名录;以及以类群为主的国际豆科植物信
13、息系统 (International Legume Database & Information Service,ILDIS)、全球菊科植物名录(Global Compositae Checklist)、鱼类数据库(FishBase)和以地区为主的非洲植物名录数据库项目 (African Plant Checklist and Database project,APCD)(Klopper et al., 2007)、澳大利亚植物名称索引 (Australia Plant Names Index,APNI)、北美植物志整合系统 (Synthesis of the North Americ
14、an Flora,SNAF)和中国生物物种名录(CoL-China)等。近年来,信息技术的发展极大地改善了传统分类编目研究的工作模式,使科学家们开始思考在网络信息时代的分类学研究(Wheeler, 2004; Alves et al., 2007)。提出了诸如电子分类学(etaxonomy)(Mayo, 2008)、全球统一分类(Unitary taxonomy)( Scoble, 2004)等概念和项目。也有多个世界著名研究机构在积极开展电子分类学的实践活动,例如:由英国自然环境研究理事会(Natural Environment Research Council, NERC)资助,英国自然历
15、史博物馆(The Natural History Museum)、牛津大学(University of Oxford)和英国皇家植物园邱园(Royal Botanic Gardens Kew)联合发起的CATE (Creating a Taxonomic E-Science)项目;世界茄科植物数据库(Solanaceae Source);世界禾草数据库(GrassBase);以及欧洲分布式分类学研究所(European Distributed Institute of Taxonomy,EDIT)等。要实现网络环境下的分类学协同工作环境,关键是要建立起科学和合理的分类编目信息基础。首先,需要区
16、别目前信息化实践中两类名称数据系统:索引数据库和分类学数据库。前者只包括学名及其名称来源,后者包括异名处理、分类阶元、地理分布等信息(Lughadha, 2004; Page, 2006)。其次,如何探知分类学实践中分类观点的异同,并有效展示这些差异,为信息组分间准确的关联和追溯奠定基础。近几年相当多的信息化实践都集中在这个部分,比如生物分类树工具(Taxonomic Tree Tool ,TTT)和Taxonomic Name Resolution Service (TNRS)。生物分类树工具是中国科学院动物研究所生物多样性信息学研究组开发的基于Web的管理和比较各种生物分类树的工具。TTT
17、提供多种方法让用户建立自己的分类树并与其他用户共享,还提供分类树比较功能,发现并用图形化方式标注出差异,能够帮助分类学家摆脱单阶元对单阶元的分类系统比较模式,提高对大数据量的分类体系比较的效率。目前TTT已经被国际知名的生物多样性信息学网站GNA(/)在首页中引用。GNA由GBIF发起建设,目的是要建立一个多层次的名称数据体系,为将来更为广泛的生物学信息整合奠定基础。GBIF开展这项工作的原因主要是:整合GBIF网络中所有数据记录层面的名称记录;将名称和分类信息组织到分类阶元中,为浏览和访问物种相关的信息提供一个组织框架;将物种在不同语种中的本地名称或
18、俗名整合到物种或高阶的类群信息中。2.2 物种分布数据我们掌握的物种分布信息与其实际分布信息总有差距。Yang等(2012)利用423.6万条标本和文献记录中的2.9万个本地植物物种,评估了2377个中国县级的维管植物分布信息,发现有91%的县植物分布信息不充分。中国植物采集的地理格局受自然环境、社会和历史等诸多因素的共同作用和影响,其中山地程度、生物多样性水平和人口密度是决定中国植物采集地理格局的主要因素,同时也导致了地理偏差的存在。物种分布数据是了解历史上物种动态变迁、未来趋势预测的非常重要的资料,甚至有时成为物种评估项目的唯一可接受指标。尽管目前有大量的数据存在于标本馆/博物馆或各类相关
19、的信息平台中,但是情况仍然堪忧。以GBIF为例,GBIF目前有4亿多条各类物种观测记录,来自全球450个数据提供者的10 000多个数据集。一些常见种的记录非常多,但是一些特殊类群的记录,如国际自然保护联盟(IUCN)红色名录、入侵种等的记录仍然非常有限。在数据的空间分布上也存在较大的缺失,GBIF目前有超过100多万的物种名称,但是只有58%的物种有至少1个以上的地标化记录,22%的物种有10个以上的地标化记录。而只有6%的物种有100个以上的出现记录。馆藏标本和已出版的各类植物志包含了丰富的物种分布及相关的生态信息, 经常是获得评估依据的主要甚至是唯一来源(Schatz, 2002, 20
20、09; Willis et al., 2003)。虽然评估依据的很多量化参数实际都是估计得出的, 但这种估计并非简单的“经验性”估计, 而是基于调查数据和科学方法的估计。美国农业部植物数据库(/)对收录的分布更新数据要求分布地给出城市或城镇名,或者更详细的地理信息,比如经纬度100m范围以内或指定UTM坐标;对于数据源,则指定了已鉴定的照片、馆藏标本、已发表文献和植物园名录4种类型。Jetz等(2012)列举了12种主要的物种分布相关的数据类型:地区性物种名录(regional checklist)、专家整理的分布区地图(expert range ma
21、p)、模型预测的潜在分布(modeled distribution)、焦点物种的分布点记录(focal species point record)、近缘种分布点记录(allied species point record)、特定区域名录(area inventory)、野外调查和制图数据(survey and atlas data)、生境偏好(habitat preference)、物种依赖性(species dependency)、扩散能力和相关特性(dispersal capacity and related trait)、可检测性(detectability)和谱系关系(phylogen
22、etic relationship)。通过这些参数的组合,能够指示物种分布最终的存在(P)或缺失(A)状态。随着便携式GPS设备和数码相机的不断融合发展,社交网络的图片或观测数据的积累要远远快于传统的标本采集、制作、整理和发布的流程,而且以“无损伤”的方式进行,得到了广大用户的青睐。英国邱园的GeoCAT(地理空间保护评估工具,Geospatial Conservation Assessment Tool)项目(/)专业分析工具,是一个利用基础生物数据进行IUCN红色名录评估和分析的在线工具(Bachman,2011),已经将Flickr作为一个良好的补
23、充数据源。2.3生态系统数据生物多样性信息学的研究一旦涉及较大尺度的分析时,就离不开生态系统数据的支持。这里最重要的就是遥感数据和各类环境因子数据,GBIO中也强调未来生物多样性信息学向宏观的遥感数据和微观的DNA条码数据延伸的重要性和必要性。随着遥感数据产品的多样化和精度的日益增加,基于遥感监测的地面特征进行生物多样性研究已成为目前区域或全球生物多样性研究的重要方法。一般认为,生物多样性遥感研究有两个基本方法:一是使用传感器直接遥感监测生物个体、种群或群落;二是利用遥感反演的信息进行生物多样性预测和评估(Turner et al.,2003)。近年来发展起来的成像光谱技术,也称作高光谱遥感,
24、就可以为生物多样性制图提供新方法。该方法可以提供冠层详细的信息,包括:冠层水分含量,叶色素、氮、纤维素、木质素等的浓度(赵德华等,2003)。综合应用多种环境要素进行物种丰富度的空间变异预测。Ranjeet等(2008)利用MODIS数据对内蒙古植物物种丰富度的县域分布进行了估计。发现在草原区,用净初级生产力(gross primary production, GPP)预测植物丰富度分布效果较好;在森林区,反应地表水分状况的NDSVI预测植物物种丰富度的效果较好;而在荒漠区,则反应地表水分状况的LSWI效果较好。在土耳其安卡拉省,Dogan等(2006)研究了森林生态系统Shannon-Wie
25、ner多样性指数,Simpson指数,物种丰富度与地形、地质、土壤、气候、NDVI、土地覆盖等因子关系。结果表明,海拔与气候因子是决定植物物种多样性的重要因素。不同生物多样性指数模型适用的区域不同,Shannon-Wiener指数与丰富度指数模型在高海拔、居民点和农田少、土地覆盖类型少的区域更适合;而 Simpson指数模型在低海拔、居民点和农田多、单一优势群体的植被覆盖区更适合。在一些特定的区域或需要更高精度数据的场合,传统遥感技术显得力不从心。激光雷达(LiDAR)是近年来发展迅速的主动式遥感技术,能够得到森林的三维结构参数,可以应用在森林生物物理参数反演、生物量及碳储量估测方面(李德仁等
26、,2012)。Bergen等(2009)在讨论植被三维结构、生物多样性和生境之间关系的基础上,提出了将植被三维结构整合到生物多样性和生境研究和管理工作中,这为未来进行生境和生物多样性研究提供了新途径。此外,如何发现和挖掘现有公众数据的专业研究价值也是一项值得尝试的工作。目前,一些特定类型的生境仍然需要费时费力的地面调查环节,在大区域展开工作仍然难度很大。悬崖是一种特殊的生境类型,提供了丰富的生物多样性环境,特别是为猛禽。但是,由于坡度陡峭,不容易被遥感数据体现出来,给许多生物多样性的研究和管理工作造成了困难。Olea等(2013)通过Google 街景的方式(免费的在线工具),远程识别和评估西
27、班牙东北部两个悬崖带的生境。旨在:远程识别物种的潜在生境;提取精细尺度的生境信息。Google 街景影像覆盖了调查区域(7000km2)49%的道路。虽然Google 街景的分析结果精度低于地面调查,但是可以节省大量的时间(36%)和经费(49.5%)。2.4遗传多样性数据随着 PCR 技术的出现和普及,以及 DNA 测序技术的快速发展,利用 DNA 数据探讨植物系统发育关系已被研究者广泛接受和采纳。通过各国植物学家近20 年的通力合作, 被子植物在科级水平上的生命树已基本建成。生命树已广泛应用于植物科学的多个领域(李德铢等,2012),如物种进化、基因组多样化与物种多样化相关性、植物的功能发
28、生和演化、物种分化和生态群落的形成和系统发育关系、动植物互作、预测未来气候变化对物种性状演化和群落形成的影响,以及物种保护和生态恢复、农业和外来物种入侵等多个方面。DNA条形码是一种快速有效的生物标本鉴定方法。全球范围内的DNA条形码数据增长很快。Barcode of Life Data Portal(BDP,/index.php)将目前生物多样性信息学技术与微观的DNA条形码测序数据结合起来。通过建立数据标准,基于生命条形码联盟(CBOL)数据分析工作组(DAWG),BDP提供了一个整合现在和下一代DNA条形码分析的基础(Sarkar et al,2011)
29、,能够整合iBOL、Genbank和自身的测序数据,同时提供在线的分析工具和数据集。该项目整合3个数据源:NCBI Genbank(符合CBOL的条形码数据标准)、BOLD(生命条码数据系统,通过web service聚合数据)和个人的非开放性数据。在统一到聚合的数据库之后,再由用户自己定义组织,形成数据集,最后通过鉴定和分析工具进行处理,并能对外共享,允许指定用户浏览或编辑数据集。在2013年的第12届太平洋科学大会中期会议(12th Pacific Science Association Inter-Congress)上,提出了“链接太平洋地区生物多样性馆藏标本:利用DNA条形码和信息学进
30、行数字化”的主题,这为古老的标本与新兴的DNA条形码技术结合提供了良好的协作通道。2.5公民科学平台准确了解生物多样性状态与变化并提出合理的保护与利用对策,依赖于高质量的科学数据。收集和整理数据,往往需要耗费大量时间和精力,仅靠科学家是不够的,甚至有些数据是科学家无法获得的。公民科学(citizen science),也称公众参与式科学研究(public participation in scientific research),是指包含了非职业科学家、科学爱好者和个人志愿者参与的科研活动。其范围涵盖科学问题探索、新技术发展、数据收集与分析等。和传统的科研项目相比,公民科学项目一般由公众和科学
31、家合作发起,公众广泛参与是其鲜明的特征,公众参与科学数据的收集、整理和分析,形成对专业科学研究有效的补充,节省很多时间和经费,促进科学普及。特别是进入到21世纪以后,利用网络信息系统进行信息共享和在线协作,建立了大量公民科学信息平台,极大推动了公民科学的发展。若干典型案例介绍如下。 “网络生命大百科”平台(Encyclopedia of Life,EOL,/),基于生物物种名录,为每个物种建立了可以展示分类系统、多媒体、文字描述等信息的物种页面,用户可以参与物种页面的信息维护。目前建立了135万个物种页面,以253个内容合作伙伴为主提供相关的物种信息和180多万张图像
32、数据,注册用户6万多个。2013年上半年,每个月访问用户在100万人以上,访问物种页面在19万以上。为了更广泛地搜集物种图像,EOL在Flickr网站上还建立了专门的群组,用户可以上传物种照片并通过应用程序编程接口(API)展示到物种页面中,目前在Flickr搜集到的照片达到18万张。 在北美,奥杜邦学会于1900年创立的圣诞季观鸟(Christmas Bird Count,CBC)活动是持续至今的历史最悠久的公民科学项目,从1900年的27名观鸟者到近年的数万名参与者。1998年,所有的观测数据都建成了数据库,通过互联网发布共享,新的观测数据可在线提交。至今至少有326篇论文、报告和专著使用
33、了CBC的观测数据 (Audubon, 2013)。奥杜邦学会和康奈尔大学鸟类学实验室共同建立的eBird针对所有的观鸟活动,是目前最大的生态公民科学项目(Sullivan,2009)。每月新增200万300万条物种日期地点记录,很多记录都来自北美地区。该项目具有明确的数据处理流程和技术方案,确保了数据质量,并开发了一系列的分析工具和软件。美国的鸟类知识网(Avian Knowledge Network, AKN, Core标准与GBIF等外部平台进行数据共享。美国国家物候网(USA National Phenology Network ,USA-NPN)则在专业人员和大众共同参与的基础上,扩
34、大了监测范围,能够对物候、气候、景观和生物多样性进行监测,并共享数据。iNaturalist则试图整合Flickr的海量生物观测图片,借助于公民科学的力量,从多源数据中过滤高质量的专业数据,避免单纯地原始数据积累。截至2013年8月,iNaturalist已积累了34万多个观测数据,包括凭证照片、观测人、观测地点、观测时间等信息,且在不断增长之中。此外,还有一些国家或区域性的专业观测站点,如英国的iSpot(.uk/)和澳大利亚的BowerBird(.au)。2013年,在欧洲环境署(European Environm
35、ent Agency,EEA)发布的115个生物多样性公民科学行动计划中(包括24个国家),22%是传统的植物和动物研究,19%是鸟类观测,13%是外来入侵种研究,8%是蝴蝶观测,还有8%是海洋生物多样性监测。这类区域性的大规模公民科学项目群为今后更高层次的观测数据整合提供了良好的基础。在专门的公民科学平台之外,Flickr图像分享平台也是大量用户保存和分享生物观测数据的重要平台,几个与生物多样性相关的群组都拥有很大的数据量和用户数,如Birds, Birds Birds群组(2.88万名会员,78.9万张照片)、Flower Photography群组(3.07万名会员,72.6万张相片)、
36、FLOWERS群组(9.2万名会员,121.2万张照片)、Insect Photography(1.89万会员,30万张照片)和fungi群组(0.7万名会员,6.37万张照片)。这些数据已成为GeoCAT、iNaturalist等项目的数据源。除了直接实施公民科学的信息平台,还出现了专门搜集、登记整理公民科学项目的平台。康奈尔大学鸟类学实验室长期关注公民科学的发展,建立了“公民科学中心”网站(/citscitoolkit),登记了植物,哺乳动物,鸟类,鱼类,无脊椎动物 (蜜蜂、蝴蝶、蛾类等) ,入侵种,气候变化,水质量,大气质量,光污染等
37、不同类别的公民科学项目162个,绝大部分都建立了自己的网络平台。在信息技术的支持下,这些活跃开展的公民科学成为生物多样性信息学海量数据积累的重要来源之一。2.6生物多样性文献数字化及数据发布生物多样性相关的文献信息(包括未发表的采集记录等)中包含了大量的物种名称、形态特征、生态环境、用途、空间分布等信息,是生物多样性信息学研究的一个非常重要的数据源。生物多样性领域的文献挖掘和标注工作一直都在进行(Cui,2008)。其规范的提取信息也能在多种场合应用,如基于TaxonX规范的基础上,瑞士的生物多样性文献数字化项目plazi从分类学文献中提取了描述和分布等信息(Catapano,2010)。截至
38、2013年8月16日,该项目已经在GBIF上共享了2325条文献中的物种观测记录。此外,红色名录的元数据文档中也提到了如何解析文献中的分布地信息并进行空间数据处理的方案。如何利用生物多样性信息学的技术和方案来深入挖掘历史文献的信息并为其他项目所用是一个重要的研究方向。目前,生物多样性领域的最大文献数字化项目为生物多样性历史文献图书馆(BHL),其主要成员机构是来自美国和英国的15家自然历史博物馆图书馆、植物园图书馆及研究机构等。目前,BHL总共扫描上线了图书11.6万册,4131万页。虽然有着巨大的数据量,但是现阶段而言,BHL更多的是一个数据仓储的作用,通过各类API为EOL等项目提供文献支
39、撑和关联作用。随着数据的重要性得到越来越多的重视和认同,一些新的数据发布形式开始出现。第一篇生物多样性领域的数据论文(data paper)于2011年发布在开放获取期刊Pensoft公司的Zookeys上(Narwade,2011),文章描述了印度北部地区2400条鸟类观测记录,跨越了整整一个世纪。目前,Pensoft公司的系列期刊支持的数据论文包括描述物种发现数据、类群名录、基因序列数据和生物多样性相关的软件工具等。随着数据论文的理念逐渐成熟和发展,Pensoft在ZooKeys、PhytoKeys 和 MycoKeys的基础上于2012年底推出了生物多样性数据期刊Biodiversity
40、 Data Journal。Biodiversity Data Journal(BDJ, IPT、Dryad、NCBI GenBank、Pangaea、TreeBASE、Morphbank等在线平台中,然后以Darwin Core等数据标准进行共享和同步。为了从源头上解决版权和使用协议问题,BDJ采取了多种方法:对于发表的文本信息,均采用Creative Commons Attribution License 3.0 (CC-BY),在署名原始作者的前提下,能够对数据进行免费试用;对于发布的数据,默认采用的是开放数据共享署名许可(open data commons attribution li
41、cense), 允许用户在引用数据创建者的前提下免费共享和修改,使用发布的数据库。此外,数据发布协议还包含共有领域(CC0,Creative Commons CC-Zero)或者开放数据共用领域许可(open data commons public domain dedication and license)。2.7数据标准、使用和传输协议生物多样性信息学有着广泛而复杂的数据源,在数据整合和共享过程中,数据标准显得尤为重要。如果没有相应的数据标准来整合的话,将极大地阻碍信息融合学科发展。当前标准包括名称和概念交换,以及标本和观测信息的访问和交换,包括标本数据(Darwin Core和ABCD)
42、、分类学数据 (Taxon Concept Schema,TCS)、结构化描述数据 (Structured Descriptive Data,SDD)、机构/馆藏元数据(Natural Collections Description)、数据交换协议 (DiGIR / BioCASe / TAPIR)。这里重点介绍物种名录、观测数据(标本和照片)、文献数据和DNA条形码数据的标准规范。生物名录数据库目前最有影响力的为物种2000 (Species 2000)与整合分类学信息系统(Integrated Taxonomic Information System,ITIS)合作集成的全球生物物种名录(
43、 CoL),其目标是收集全世界已经发表的生物物种分类学信息,建立一个电子化的全球生物物种名录,作为全球生物多样性的基础信息,支持全世界范围的生物多样性保护和持续利用活动。该名录及分类系统已经被国际上很多著名的生物多样性数据管理组织,如GBIF和EOL等作为核心数据使用。该数据库通过以下13个字段集来进行组织和管理:参考文献的接受名、附有参考文献的异名、附有参考文献的俗名、属以上的分类信息、分布、生境、其他数据(可选)、数据源名称和版本、最新的分类审核信息(专家和日期)、CoL的生命科学标示符(LSID)、来自全球数据库(GSD)的分类全球唯一标识符(GUID)、名称全球唯一标识符、在线资源链接
44、。以网站动态数据共享和年度光盘共享两种方式发布数据,CoL的2013年版包括了132个专题数据库提供的135万种生物的信息(/)。在物种观测数据方面,主要由ABCD(Access to Biological Collection Data)和Darwin Core两个标准,其中后者由于相对简单,得到更广泛的应用。Darwin Core经过数十年的发展,在2009年10月正式成为国际标准。Darwin Core有很强的扩展性,其应用范围非常广泛,描述生物多样性特征的核心数据集合,能够很好地扩展到其他生物领域(分子、基因、古生物、标本馆管理
45、)。随着观测数据的更加多源化和集成度的增加,单一的Darwin Core标准在观测数据进行网络传输和共享时已经显得过于冗余,于是又出现DwC(Darwin Core Archive,达尔文核心档案)。DwC( Core 文本指南的规则定义的。它不再仅仅限于物种出现数据,还紧紧地与Dublin Core联系。GBIF将其用来对生物名称、类群、物种信息、分布和出版物等资料进行编码和关联。档案格式的核心思想是通过一个核心数据文件和多个扩展文件的关联进行结构的组织。每个扩展记录指向核心文件中的一条记录。由此,多个扩展记录都可以以每个单独核心记录的形式存在,能够极大地减少数据冗余,压缩数据集的大小。关于
46、生物多样性的文献数据,目前有3个规范可以参考:TaxonX、TaxPub和taXMLit。TaxonX是一个轻量级的面向对象的规范(只有30多项),有专门的软件(GoldenGATE)对文档进行标注,能够以SPM标准导出到EOL或其他平台中,比较适合从历史文档对分类学信息进行处理。TaxPub更多用于期刊的发行工作,其主要应用场景包括:通过PMT工具来标注分类学论文、导出新发表的物种到EOL、将所有的分类学文档导出到Plazi、归档到PubMedCentral、为出版物创建一个语义增强型的HTML版本。taXMLit是一个文档为中心、非常详细的规范,用于生物学文献信息提取,但是与TaxonX相
47、比,过于复杂。对于DNA条形码数据,目前主要有两个规范。一个是CBOL数据库工作组在2009年形成的修订版本(/pdf/dwg_data_standards-final.pdf),目前作为数据标准应用于CBOL的数据管理中。该推荐的标准分为5个部分:保留关键字的创建、必填的数据项、强烈推荐的数据项、测序质量和覆盖范围项、管理规则。该标准有效地对传统的标本数据与DNA条形码数据结合在一起。另外一个是基于TDWG 的ABCD标准的ABCDDNA扩展标准,目前在德国的DNA Bank Network项目应用。2012年的TDWG年会提出在GBIF IPT工
48、具包中完成对Darwin Core标准的映射和扩展。2.8分析和建模方法随着数据搜集工作的深入,特别是伴随着科技发展带来的新的采样手段,极大地丰富了生物多样性数据的数量和种类。生物多样性数据分析与生态学理论和研究方法互为促进,成为目前进化生物学、大尺度生物地理学和生物多样性信息学研究中最热门的领域之一。随着 SDM(Species Distribution Model,物种分布模型)工作的进展,研究者先后开发出近二十种不同的模型。按照其使用的数学理论不同,大体可分为以下3种类型(Rangel et al.,2012)。第一类是以 BIOCLIM(Busby 1991)、ENFA(Hirzel
49、et al., 2002)为代表的简单包络模型;第二类是以数理统计、概率为理论基础的统计学模型,如 GLM(Guisan et al., 2002)、GAM、MARS(Friedman,1991)等,这是一种更加复杂的包络模型;最后一类是基于复杂的统计机器学习方法的机器学习模型,如Maxent(Phillips et al., 2008)、GARP(Stockwell, 1999)等,这类方法的使用率高,影响力大。根据Google Scholar 的统计,近5 年发表的文章中,使用 Maxent 作为主要研究手段的实验性文章已经占到了 70%以上。其中主要的原因是曾经有数据证明过 Maxent
50、在一定程度上是效果最好的 SDM(Elith et al., 2006),而且 Maxent 提供了一个“傻瓜型(Click and run)”的方便工具。然而,随着建模结果与实际情况不相符的情况增多,单一的建模结果受到的质疑也越来越多。故此,更多的研究者建议使用包含多个模型的平台,如 BIOMOD(Thuiller et al., 2009)、OpenModeller(Muñoz et al., 2011)、Dismo(Hijmans et al., 2012)、mMWeb(Qiao et al., 2012)和BIOENSEMBLES(Diniz-Filho et al., 20
51、09)。并且使用较客观的评价指标对模型进行评估,而不是都集中在简单的通过传统的受试者反应曲线,或者敏感度与特殊度等来简单的比较或评价模型(Peterson et al., 2008)。在数据分析和建模的过程中,越来越强调用户的交互以及对中间环节的控制和调整。其发展经历了3个阶段。阶段1:用户不能参与交互,只能输入数据集,然后经过模型的“黑箱处理”之后,得到结果。如在GBIF的标本查询的结果页面,通过Create: Niche Model链接,单击后会得到经过openModeller算法处理的模型结果,但是用户对这个过程的参数不能做任何调整。阶段2:用户能够对多源数据进行汇总后在线建模。如邱园的
52、GeoCat红色名录物种评估在线工具(/),能够整合GBIF和flickr的同一物种数据,加载自定义的本地数据和自然保护区图层。然后进行EOO和AOO的建模结果显示,并对结果进行在线调整。阶段3:用户能够对建模中间过程进行调整和控制,并对建模结果进行共享和他人重现。如欧盟的BioVeL(Biodiversity Virtual e-Laboratory,生物多样性虚拟数字化实验室)项目提供的建模功能:自定义输入,输入参数(环境图层、物种数据等),用户能够共享建模过程,其他用户能够重现(re-use)建模流程(与重现实验室流程类似)等;这方面要结合一些工作
53、流程管理工具来具体实施才好操作,BioVel是基于开源产品Taverna的。BioVeL的出现就是为了寻找生物多样性信息学研究中可以重复的部分加以整理和统一,以期能够尽量简化和规范科学行为,为科学家节省更多的精力。BioVeL的核心是工作流(workflow),其他部分都是为了工作流服务的。工作流可以将服务组合在一起,完成一个既定的科学任务(数据分析和建模)。目前BioVeL中已经搜集、整理并建立包括生态位模型工作流在内的6个类型8个工作流。一个设计精细的工作流确实可以为研究者节约很多时间和精力,但是也要看到,一个“click and run”软件也会禁锢科学研究的自由思维,从而限制专业学科研
54、究领域的创新和发展。Joppa等(2013)最近发表在Science上的文章引发了较大的争议:文章通过生态位模型领域的一个典型现象推出,“科学软件中的盲目信任”问题。因此,如何在模型的便利性和科研的严谨合理性之间找到一个平衡点,是发展工作流时需要注意的问题。2.9多样化不同层次的组织协调生物多样性信息学的蓬勃发展首先得益于各种以数据积累为目标的项目和系统。随着物种2000、GBIF等以数据积累为目标的生物多样性信息学项目或网络体系的不断发展, 一些新项目和网站开始出现, 包括生态学知识库科学环境(Science Environment for Ecological Knowledge, SEE
55、K, /)、国际对地观测组织生物多样性观测网络(Group on Earth Observations Biodiversity Observation Network, GEO BON, /geobon.shtml ) 、欧盟的生命监测体系(LifeWatch, http:/www.lifewatch.eu)、澳大利亚生物多样性信息系统(Atlas of Living Australia, ALA, .au)和生命与环境数 据 网 络 (
56、Data Observation Network for Earth, DataONE, )等。这些项目和系统通常有特定的目标和框架结构:SEEK计划用5年时间为生态、环境和生物多样性研究和教育构建信息化基础设施, 该平台由3个子系统组成: EcoGrid(一个数据访问开放结构)、基于特定领域的本体协调系统和支持语义集成工作流程的分析和建模系统(Michener et al., 2007); 作为一种全新的全球合作模式, GEO BON计划对全球生物多样性相关的数据进行采集、管理、分析和共享,目标是将基因资源、物种和生态系统中的观测信息整合起来构建一个
57、全球性的平台(Scholes et al., 2007); LifeWatch是欧盟第七框架计划(FP7)下的一个生物多样性e-Science项目, 目标是建设基于生物多样性数据和观测网络的e-Science平台和技术基础设施。它预计用8年时间(20062014年)构建一个洲内的生物多样性e-Science平台;ALA主要开发生物多样性数据管理系统, 连接知识库、科学和农业文献资料和其他生物信息管理者, 对外提供权威、开放的联邦式数据访问; DataONE在各参与单位多年积累专业数据基础上,建立进一步的专业合作关系, 在更广泛的领域开展合作:档案记录、图书馆、环境观测系统和研究网络、数据和信息管理、科学集成中心和专业社区等。除了上述合作项目之外,2009年的第一届e-Biosphere全球大会在英国伦敦举行,来自69个国家的503位生物多样性信息学研究人员参
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国化工物流行业兼并收购典型案例解析报告
- 2026充电桩行业环保要求与可持续发展路径研究报告
- 2026电力电子行业市场深度调研及前景趋势与投资研究报告
- 2026基因治疗药物临床转化难点与政策支持研究
- 2026中国高端装备核心零部件市场调研与投资价值分析报告
- 2026畜禽应激期专用饲料营养调控方案专家共识报告
- 2026中国集成电路关键材料市场格局与竞争策略研究报告
- 2026中国抗菌分离膜在食品包装领域市场渗透率调查
- 2026年动物疫病防控岗位试题及答案解析
- 道路可行性研究报告编制时间
- 高考生物500个判断题集锦含逐题解析
- 热成像技术教学课件
- 曲臂登高车安全培训课件
- 人工智能通识导论 课件 王万良 第1-9章 人工智能概论-连接主义:人工神经网络
- GB/T 45898.1-2025医用气体管道系统终端第1部分:用于压缩医用气体和真空的终端
- 服务期间与其他单位部门综合协调方案
- 鸿蒙应用开发案例实战(ArkTS版)(AI助学)(微课版) 课件全套 项目1-7 初探HarmonyOS开发 个性化设置应用 - 融会贯通 七彩天气App开发之旅
- 小学生劳动最光荣课件下载
- 高钾血症疑难病例讨论
- 河南省开封市五校2024-2025学年高二上学期11月期中联考数学试题
- 消防安全教育培训记录
评论
0/150
提交评论