(地图制图学与地理信息工程专业论文)城市地址编码的技术及应用.pdf_第1页
(地图制图学与地理信息工程专业论文)城市地址编码的技术及应用.pdf_第2页
(地图制图学与地理信息工程专业论文)城市地址编码的技术及应用.pdf_第3页
(地图制图学与地理信息工程专业论文)城市地址编码的技术及应用.pdf_第4页
(地图制图学与地理信息工程专业论文)城市地址编码的技术及应用.pdf_第5页
已阅读5页,还剩64页未读 继续免费阅读

(地图制图学与地理信息工程专业论文)城市地址编码的技术及应用.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 地址编码技术是数字城市的项基础性的关键技术。它是指将自然语言描述的地址 位置信息根据既定的地址模型和编码规则,生成在计算机中存储的编码,再将其与空间 坐标相关联,使得可以在地图上确定此地址数据所代表的地理实体的位置。通过高精度 的地址编码技术,大量的社会经济数据将变成带有空间坐标的空间信息,城市生活中的 信息将空间化,从而进行更有效、更深刻的空间分析和决策应用。 本文以国家科技支撑计划项目“城市社会经济信息空间化技术研究及城市空间信息 共享平台应用示范 ( 2 0 0 6 b a j l 5 8 0 2 ) 为背景,在武汉市进行研究的综合示范,利用地 址编码技术实现对城市空间数据的集中统一管理,建立地址数据库,实现社会经济数据 的空间化、地址的快速匹配和查询。 研究过程中主要完成的内容和取得的成果如下: ( 1 ) 研究了国内地址的特点并根据实际情况对其进行拆分与标准化,借鉴国内外的 地址模型,建立了符合我国城市地址现状的八层标准地址树模型,为地址数据的标准化 提供了参考依据; ( 2 ) 完成了地址编码数据库的逻辑模型设计,分析了地址编码数据库的建库流程, 根据八层标准地址数据模型设计了一种可以保存分层地址信息的数据库结构;并且对地 址数据的采集、更新、管理进行了分析; ( 3 ) 根据国内地址模型的研究成果,设计了门牌号类、楼牌号类、区域类、标志物 类和其他地址五种基本的地址匹配方法,重点研究了常见的门牌号类和区域类匹配方 法。 ( 4 ) 运用c 群编程语言,调用了a r ce n g i n e l 均相关组件和类库,开发实现了地址编码 系统各个功能模块。主要包括查询检索、数据显示与统计以及地址转换与匹配等模块。 关键词:地址标准化,地址编码,地址模型,数据库,地址匹配 t e c h n i q u e so ng e o c o d i n gi nd i g i t a lc i t i e sa n dt h e i ra p p l i c a t i o n s y ch a i b o ( m a p p i n ga n dg e o g r a p h i c a li n f o r m a t i o ne n g i n e e r i n g ) d i r e c t e db yp r o f w a nj i a n h u aa n dl i uw e n b a o a b s t r a c t g e o c o d i n gi so n eo ft h em o s tf u n d a m e n t a lt e c h n o l o g i e si nd e v e l o p i n gd i g i t a lc i t i e s i ti s ap r o c e s si nw h i c ht h ei n f o r m a t i o no fa d d r e s sl o c a t i o nd e s c r i b e di nn a t u r a ll a n g u a g e si s c o n v e r t e di n t ot h ec o m p u t e r - s t o r e dc o d e su s i n gc o d i n gm o d e l sa n dr u l e sa s s o c i a t e dw i t h s p a t i a lc o o r d i n a t e s w et h e nc a nd e t e r m i n es u c ha d d r e s st h a tr e p r e s e n t st h el o c a t i o no f g e o g r a p h i c a le n t i t i e so nam a p u s i n gg e o c o d i n g 、析t hh i g h p r e c i s i o n , s o c i a l e c o n o m i cd a t a c a nb el i n k e dt o s p a t i a lc o o r d i n a t e s ,t h u sm a k i n gi n t e n s i v es p a t i a la n a l y s i sp o s s i b l ea n d s p a t i a ld e c i s i o n m a k i n ge f f e c t i v e t h ep a p e rt a k e s r e s e a r c ho nt h ea p p l i c a t i o no fs p a t i a l i z a t i o nt e c h n o l o g yf o rc i t y s o c i o - e c o n o m i c i n f o r m a t i o n ”p r o j e c t a sab a c k g r o u n d ,a n dt a k e sw u h a nc i t ya sa c o m p r e h e n s i v ed e m o n s t r a t i o na r e a ,u s i n gt h ea d d r e s sc o d i n gt e c h n o l o g yo fc i t ys p a t i a ld a t a c e n t r a l i z e da n du n i f i e d m a n a g e m e n t ,t h ee s t a b l i s h m e n to ft h ea d d r e s sd a t a b a s e ,t h e r e a l i z a t i o no fs o c i o - e c o n o m i cd a t ao ft h es p a c e ,a d d r e s sm a t c h i n ga n dr a p i dq u e r y t h em a i nc o n t r i b u t i o n so ft h i st h e s i sa r e : ( 1 ) t h ec h a r a c t e r i s t i c so fd o m e s t i ca d d r e s sw e r ef i r s t l ys t u d i e d ,a n dt h es t a n d a r d i z a t i o n a n ds e p a r a t i o no fa d d r e s s e sw e r er e a l i z e da c c o r d i n gt ot h er e a l w o r l ds i t u a t i o n t h e nt h e s t a n d a r da d d r e s st r e em o d e lw i t he i g h tl a y e r sw a sb u i l tt of i tf o ra d d r e s s e si nc h i n e s ec i t i e s b yd r a w i n go nf o r e i g na d d r e s sm o d e l t h i sm o d e lc a l l b e u s e da sr e f e r e n c e st ot h e s t a n d a r d i z a t i o no fa d d r e s sd a t a ( 2 ) t h el o g i cm o d e ld e s i g no ft h ea d d r e s sg e o c o d i n gd a t a b a s ew a sc o m p l e t e d ,a n dt h e p r o c e s so fb u i l d i n gt h ed a t a b a s ew a sa n a l y z e d a c c o r d i n gt ot h ee i g h ts t a n d a r dd a t am o d e l , t h ed a t a b a s es t r u c t u r ew h i c hc a l ls a v eh i e r a r c h i c a la d d r e s si n f o r m a t i o nw a sd e s i g n e d a l s oi t e x p o u n d st hec o l l e c t i o n ,u p d a t i n g ,m a n a g e m e n to fa d d r e s sd a t a ; ( 3 ) a c c o r d i n gt od o m e s t i ca d d r e s s e sm o d e l s ,f i v et y p e so fb a s i cm e t h o d sf o ra d d r e s s m a t c h i n gw e r ed e s i g n e d ,i n c l u d i n gt y p e so fh o u s e h o l dn u m b e rt a b l e t ,b u i l d i n gn u m b e rt a b l e t , l a n d m a r k ,r e g i o n a lc a t e g o r i e s ,a n do t h e ra d d r e s s e s ,f a m i l i a rh o u s e h o l dn u m b e rt a b l e ta n d r e g i o n a lc a t e g o r i e sa lef o c u s e do n ( 4 ) u s i n gt h ec 撑p r o g r a m m i n gl a n g u a g ea n da r ce n g i n e ,t h i st h e s i sd e v e l o p e daa d d r e s s g e o c o d i n gs y s t c m ,m a i n l yc o n t a i n i n gi n q u i r i n ga n ds e a r c h i n gu n i t ,d a t as h o w i n ga n ds t a t i s t i c d a t eu n i t s ,a d d r e s st r a n s f o r m i n ga n dm a t c h i n gu n i t sa n ds oo n k e yw o r d s :a d d r e s ss t a n d a r d i z a t i o n ,g e o c o d i n g ,a d d r e s sm o d e l ,d a t a b a s e ,a d d r e s s m a t c h i n g 关于学位论文的独创性声明 本人郑重声明:所呈交的论文是本人在指导教师指导下独立进行研究工作所取 得的成果,论文中有关资料和数据是实事求是的。尽我所知,除文中已经加以标注 和致谢外,本论文不包含其他人已经发表或撰写的研究成果,也不包含本人或他人 为获得中国石油大学( 华东) 或其它教育机构的学位或学历证书而使用过的材料。 与我一同工作的同志对研究所做的任何贡献均已在论文中作出了明确的说明。 若有不实之处,本人愿意承担相关法律责任。 学位论文作者签名:茸址 日期:川年月厂日 学位论文使用授权书 本人完全同意中国石油大学( 华东) 有权使用本学位论文( 包括但不限于 其印刷版和电子版) ,使用方式包括但不限于:保留学位论文,按规定向国家有 关部门( 机构) 送交学位论文,以学术交流为目的赠送和交换学位论文,允许 学位论文被查阅、借阅和复印,将学位论文的全部或部分内容编入有关数据库 进行检索,采用影印、缩印或其他复制手段保存学位论文。 保密学位论文在解密后的使用授权同上。 学位论文作者签名:丑叟堕 指导教师签名: 日期:如67 r 年6 月厂日 日期:妒7 年6 月厂日 中国石油大学( 华东) 硕,l 学位论文 1 1 研究背景及意义 第一章绪言 1 1 1 研究背景 随着地理信息系统在各行业的广泛应用、我国城市规模的不断发展扩大以及街区范 围的逐渐增大,城市管理部门对空间数据与非空间数据共享整合的要求日益迫切;同时, 也产生了新的技术问题,就是对地理实体的标识问题。目前,城市各行各业都搜集、保 存着大量与空间位置有关的信息。这类信息多数包含位置信息,一般是地址。地址信息 实际上是一种空间信息,合理利用这些信息无疑会给城市数字化的发展和社会生活带来 很多便利。 由于地址信息并不直接等同于空间的地理位置,所以需要有一个将描述日常使用的 地址、门牌、建筑物名称、企事业单位等空间位置的自然语言描述自动的转化为计算机 能够识别的地理坐标方式,这就是地址地理编码( a d d r e s sg e o e o d i n g ) 工作或技术【1 1 。 目前对于地址编码技术的理解,国内有关部门不尽相同。本文研究的地址编码,是指将 自然语言描述的地址位置信息根据既定的地址模型和编码规则,生成在计算机中存储的 编码,再将其与空间坐标相关联,使得可以在地图上确定此地址数据所代表的地理实体 的位置1 2 埘。在传统g i s 中,也需要将各种用户需求、各行业的属性数据对应到地形图上 f 5 1 ,这两者从本质来说是一致的。利用地址地理编码技术可以建立空间信息与非空间信 息之间的联系,实现在各种地址空间范围( 行政区、街区等) 内进行信息的整合1 6 j ,因 此,地址地理编码技术在城市空间定位和分析领域具有非常广泛的应用前景。 本论文结合国家科技支撑计划子项目“城市社会经济信息空间化技术研究及城市空 间信息共享平台应用示范”( 2 0 0 6 b a j l 5 8 0 2 ) 。 1 1 2 研究意义 在城市中,地址数据是非常普遍的,城市地址已经成为人们首先使用的重要方式来 表达他们感兴趣点的位置,包括他们办公和居住的地方,这些地址成为城市空间索引关 键字就很自然了7 ,引。例如,我用“青岛经济技术开发区长江西路6 6 号 来表示中国石 油大学的位置。在地理信息系统中,计算机是无法通过诸如以上文字叙述来直接找到目 标的位置的,所寻找目标的位置是由其所在地的地理空问坐标确定的,如该地的经度和 第一章绪占 纬度,或是其在规定的大地平面坐标系中的x 、y 值。然而,经度、纬度或是x 、y 坐标 对于普通用户来说,只是空洞的数字而没有丝毫意义。虽然现在可以通过全球定位系统 ( g p s ) 接收机来获得自己所在位置的地理坐标,但是这一串数字也远不如街道名、路名 或者门牌号实在。因此,地理信息系统需要一座沟通计算机中地理信息与用户的桥梁, 进行用户的现实世界语言与计算机空间信息语言之间的转换,而且大多数信息系统中都 包含了地址、联系方式这样的字段,各个行业或机构也都以某种形式采集、处理和传播 空间信息。地址编码正是建立空间信息和非空间信息之间联系的最重要、最实用的手段 1 9 1 。城市地址编码的主要意义就在于将城市空间对象的地理位置可视化,使单纯的属性 数据表与空间数据集成,从而可以进一步进行诸如叠置分析或者缓冲区分析等空间分 析。 虽然国内一些地图网站也提供类似于地址地理编码的功能,比如输入“武汉大学”, 或者“武昌区八一路2 9 9 号”也可以定位到地图上。但是如果用身份证或企业名录中的 地址查询,则匹配率和精度都会变得很低。从数字城市的角度讲,如果实现了高匹配率 和高精度地址地理编码技术,那么大量的社会经济数据,比如人口、工商、医疗、公安 等信息就变成了带有空间坐标的空间信息了。通过地址编码技术,能够将工商、税务、 信用、规划、建设等社会经济部门的资料和数据库中的地址转换为真实的地理坐标( 经 纬度) ,并映射到地图、遥感影像上,实现地址名称与空间信息的整合,进而可以完成 对社会经济信息的分析、统计、管理、制图和可视化表示,为所有的部门提供实时、准 确和权威的集成与融合工具,以支持政府的管理和决策i l0 1 。 对于普通公众来说,它将能带来很多便利。首先如果解决了地址地理编码技术,那 么现有地图网站本地搜索的内容规模会增加一个数量级。如果和移动通讯以及智能手机 结合,还可以在人们出行的时候提供实时的空间信息检索。其他的一些政府和企业网站 也可以充分利用地址地理编码技术,比如目前一些银行网站上的营业厅和a t m 网点查询 给出的都是列表,有了地址地理编码技术,这些网站可以轻松的把网点标到地图上,使 得人们使用起来更加方便。 从政府的角度来看,很多带有地址地名的数字资源可以迅速变成空间信息资源,可 以为城市管理、公共安全等应用提供必要的基础数据支撑。 2 中国石油人学( 华东) 硕土学位论文 1 2 研究现状 1 2 1 国外研究现状 发达国家的数字化进程起步比较早,发展也比较快,这里简要介绍美国的地址编码 情况。美国的人口调查和统计主要由美国国情普查局( c e n s u s b u r e a u ) 负责。多年来该 局在地址编码方面做了很多工作,对美国推动地理信息系统技术的广泛应用发挥了重要 的作用。 早在六十年代中期,为了挖掘统计信息的潜力,推广其应用,美国国情普查局成立 了专门的委员会。经过研究提出人口普查信息应具有空间定位信息。为配合1 9 7 0 年的 人口普查,在1 9 6 7 年研究发展了“双重独立地图编码系统”( d u a li n d e p e n d e n tm a p e n c o d i n g ,d i m e ) t 】,并成功应用于1 9 7 0 年的人1 :3 普查。d i m e 的基本思想是按照各要 素的拓扑关系来组织数据,形成一个地理基础文件系统( g e o g r a p h i cb a s ef i l e ,g b f ) t 1 2 】。 特别值得一提的是,在城市道路中心线的每个弧段均带有道路左右两边的门牌起止信 息,为地址信息的定位奠定了基础i l3 1 。在随后进行的人1 :3 普查工作中普查的分区及调查、 数据的整理,都以这个地理基础文件系统为参照。d i m e 的开发在地理信息系统技术的 发展史上具有里程碑的意义。一批以地址编码为主业的企业随之诞生,一些著名的g i s 软件公司以d i m e 的基本思想形成了其软件的基本数据结构。 八十年代后期,为了准备1 9 9 0 年的国情普查,美国国情普查局将d i m e 系统发展 为t i g e r ( t o p o l o g i c a l l yi n t e g r a t e dg e o g r a p h i ce n c o d i n ga n dr e f e r e n c i n g ) 系统,意为拓扑 集成的地理编码与参照系统【1 4 , 1 5 】。t i g e r 数据库是1 9 9 0 年人1 :3 调查用的覆盖全国的所 有地图的资料库。t i g e r 系统包括一个称为t i g e r l i n e 文件集的主体l l 引,它是一个包 括全美诸如公路、铁路、河流、湖泊、法定边界等地理特征的数据库,它还详细记录了 这些地理特征的一些重要信息【1 7 1 。其中地址数据是以线性文件组织,包括街道名字、起 始点标识、地址门牌号范围、街道中心线左右门牌号的起始点坐标以及属性数据和方向 1 8 , 1 9 】,其中方向包括“左 、“右”。这个矢量结构信息包含了丰富的信息,可以进行大 区域范围的交通事故定位分析、城市经济分析、公交路线分析等1 2 0 1 。为了满足人口调查 时对地图的需要,以便为统计数据、居民和雇员的地址等数据空间定位提供合适的地理 结构,t i g e r 数据库的内容处于不断更新之中,差不多每两年就有一个新版本发布。 t i g e r 数据库以多种形式的t i g e r l i n e 文件向社会公众提供。只需要付一定的工本费, 就可以方便地得到所需地域的t i g e r 数据。 3 第一章绪占 由于t i g e r 数据库覆盖范围广、精度高、更新有保证,而且费用较低比较容易得 到,所以作为地址编码的参照系,在美国已经成为一种公认的标准,其影响是非常大的。 目前,美国类似技术已绎成熟,现在美国已经在网上发布有免费地址匹配系统,基 本能够满足美国以及西欧各大洲和各个城市的匹配,如g o o g l em a p ,在g o o g l em a p 里 也可对中国主要城市通过输入城市拼音检索来进行匹配。 自从1 9 9 0 年以来,澳大利亚开始意识到了广泛的高质量的地址编码数据库的需要。 经过多年的计划合作和发展,g - n a f ( ag e o c o d e dn a t i o n a la d d r e s sf i l e ) 终于在2 0 0 4 年 三月问世了。1 3 个团体组织将近3 2 ,0 0 0 ,0 0 0 条地址记录用来5 步清洗和集成,产生 了一个包括2 2 常态下的文件【2 1 1 。 在加拿大、德国、以色列等国家,很早就对地理编码技术做了大量而细致的研究工 作和实际应用,如美国一样,这些成果在对各自国家的规划、行政、测绘等工作中起到 了积极的作用1 2 2 。 此外,国外在进行地址编码项目开发时,有专门的部门或公司依据地址数据内容标 准和规范负责区域性地址数据的采集和维护工作。例如,美国的g e o g r a p h i cd a t a t e c h n o l o g i e s ( g d t ) 公司,在很多g i s 开发和应用项目中都负责生产和维护项目所需要 的地址数据产品1 2 3 1 。另外,国外有很多关于地址数据的内容标准和规范说明,例如: 联邦地理数据委员会( f g d c ) 的文化和入口数据附属委员会在2 0 0 3 年4 月发布的地址数 据内容标准公共草案,美国南卡罗莱纳州信息资源委员会在2 0 0 0 年4 月发布的地址数 据库和地址道路中心线内容标准,以及美国邮政管理局在2 0 0 0 年1 1 月发布的邮政地址 数据内容标准等。这些标准和规范对地址结构、地址类型、别名、地址表达目的、地址 相关描述信息、地址规范化标准和地址表达形式标准等作了详细的说明和描述。 1 。2 2 国内研究现状 在中国,从八十年代开始,一部分城市的规划、测绘及管理部门对城市地址编码问 题相继开展了研究工作。北京市城市规划设计研究院在八十年代末期即着手研究北京市 的地址编码问题,上海、广州、深圳、常州等一些城市在建立城市地理信息系统的同时 也开展了相应的研列2 4 1 。目前为止,国内也没有建成通用和标准的地址数据库,造成国 内地址编码技术仅仅局限于个别领域,难以推广。目前,香港特别行政区的地理编码数 据库精确度可达到街道门牌及建筑物层面,台湾省精确度达到街道及主要景点层面,而 大陆地区精确度只能达到省市层f 2 5 】。 4 中国石油大学( 华东) 硕l j 学位论文 首先,由于现有的地名、地址体系异常复杂,地名相对混乱、规律性低等原因,造 成国内目前在地址编码技术方面还仅仅局限于专业领域和部门内部,难以推广和普及。 例如,北大方正的“小红帽物流管理系统”和北京市s a r s 疫情防控g i s 分析决策指挥 系统等。 其次,目前国内还没有针对地址数据内容方面的标准和规范,地址数据内容描述不 统一,地址表达方式多样,造成个别部门和公司在开发地址编码软件工具时,地址数据 重复采集。地址数据模型不一致,地址数据采集和整理方法各异,地址匹配信息重复生 成等问题,给地址数据资源开发和利用带来了巨大的浪费。例如,北大方正数码公司在 开发和完成m a p s e a r c h 项目时提出了1 7 种城市地址数据表达方式和类型1 2 6 1 ,北京朝夕 科技有限公司与北京市信息资源管理中心合作完成的“北京市地址编码数据库系统建 设”项目种也提出了2 8 类地址数据类型和表达方式等【2 7 】。 再者,国内的g i s 软件厂商所开发的地址匹配和定位软件还没有提出适合国内信息 系统应用的地址模型和标准,都没有建立标准的地理参考作用的地理编码数据库系统。 因此,适合中国国情的地理编码技术应用还处于起步和探索阶段。例如,北大方正公司 在m a p l n f om a p m a r k e r 的基础上开发了m a p s e a r c h - - 地址编码管理器,试图实现基于北 京市全境地图数据和地址数据、依据地址字符串智能匹配出地理坐标值。但是,地址编 码管理器采用的地址模型太过复杂,加上软件功能开发太过简单,在具体应用中地址匹 配率不高。例如,现有的国内g i s 软件在进行地址编码查询时,对某词条“解放路”的 查询就有多于5 条符合条件的查询记录:“济南市解放路”、“常州市解放路”、“武汉 市解放路、“江山市解放路”、“宜昌市解放路”这些重复名称的街道在查询过程中 会给用户带来不便;另外不规范的地名写法也会造成查询匹配失败,如武汉市的“研口 区 ,在很多场合已写成“桥口区”,用户输入时可能会输入错误。因此,在用户进行地 址编码查询时,对上下文信息进行分析,并利用多信息源进行交叉判断处理,对于提高 匹配命中率和准确率是极有帮助和现实意义的【z 引。 因此可以说我国g i s 领域在地址编码技术应用和标准化方面还处于起步和探索阶 段,适合中国国情的地址编码解决方案至今仍然是一块空白。我很有必要在地址数据内 容和描述、地址数据采集和整理、地址数据模型和地址数据库构建、地址编码软件工具 开发以及地址编码应用服务规范等方面进行标准化的研究和探索。 5 第一章绪言 1 3 研究内容 由于我国农村地区地址极不完善,所以目前全面的数字化工作暂时无法开展,本文 主要聚焦我国城市地址的计算机表达、处理与定位。不过本文的解决方案对于已经赋址 的乡村地区应该一样适用。其主要研究内容如下: 1 、地址数据解析 开发相应的地址解析模块实现地址解析,主要原理是按照地址要素的要素通名( 如: 省、市、区等) 将其拆分成标准的地址字段值。在地址匹配阶段中通名将被按照一定的 规则进行组合并与参照数据中相应的字段值进行匹配进而实现地址编码。地址匹配时主 要根据相关“通名 字段。 2 、研究城市、地名层次模型的建立 为了准确地分析并描述地址模型,需确定最小地址要素,并给出最小地址要素对应 的层级。 3 、城市地址数据分类与编码 在确定了地址的模型后,如何对地址进行编码,为每一个地理实体确定一个唯一的 标识符,并利用此编码进行地址信息交换和共享是一个十分重要的问题,这方面各行各 业都已经做了大量工作。例如:邮政编码、行政区域代码、道路代码、河流代码等。对 于数字城市来讲,在代码方面有很多不够完善和相互矛盾的地方。为了准确提供位置信 息即地址信息,就必须进行规范化、标准化地名分类与编码。 4 、地址匹配算法的研究 地址匹配算法是匹配引擎的核心。匹配算法效率的高低决定着地址编码系统的匹配 概率、匹配准确率、匹配响应时间等。 5 、地址编码系统的开发实现 1 4 论文结构 6 中国石油人学( 华东) 硕士学位论文 1 5 本章小结 图l - 1 论文结构 f i g l - i t h e s i ss t r u c t u r e 本章阐述了地址编码的研究背景以及意义,同时论述了地址编码技术的国内外研究 现状和存在的问题,并提出了论文的研究内容和结构。 7 第_ 二章地址编码标准和模型 第二章地址编码标准和模型 地址提供一种关于人、建( 构) 筑物及其他空间物体的定位实现,是用来唯一标识特 定兴趣点、存取和投递到特定地点、及基于地点定位地理数据的一种实现【2 9 1 。由于不同 的行业和机构根据自身的需求不同,以不同的方式采集、利用地址信息,它们的格式、 质量都不统一。因此在将这些不同来源的地址信息进行地址编码之前,需要按照统一的 路街巷名称、门牌号码编排规范进行标准化,用一致的形式表现出来。通常中文地址存 在以下特点: 1 、很多地址不是街道门址类型,如:北京市海淀区北京大学中关园5 0 丙楼3 0 2 室, 通常在一个区寻找某个地址难度比较大,正确的门址类型应该为北京市海淀区颐和园路 5 号( 街道门址) ,这样具体到街道的话寻址就比较方便。 2 、东方语言没有分隔符,拆分困难,不像国外地址,中间有逗号或者空格相隔离, 如:3 0m a i ns t r e e t ,b o s t o n ,m a 0 2 1 1 5 。 3 、有些地址使用不规范,如北京大学4 5 甲学生公寓物美超市西厅、广州市先烈中 路1 0 0 号1 5 栋之一4 楼。由于历史的原因,过去采取的是分散而凌乱的命名方式,而 忽视了地名规划,导致了城市地名的混乱,甚至重名。 2 1 地址数据的拆分与标准化 地址数据的拆分和标准化是关系到地址匹配最终成功与否的关键因素。要实现地址 的地理编码和地址的成功匹配,就必须遵循标准地址编码的规范,建立标准地址模型, 去除非地址信息、冗余信息等人为的复杂性,依据标准地址编码的数据模型来进行地址 字符串的拆分,实现地址的标准化。地址拆分和标准化工作也成为我们首先要面对和解 决的问题。 2 1 1 地址要素 地址标准化,又称地址规范化,就是将一般形式的地址字符串转化为计算机能够理 解的结构化的单词组【3 0 l 。为了描述问题的方便,在此引入地址要素概念。地址要素是指 在某一限定区域内,可以指定一个具体范围的地址要素,如武汉市与其下属区县的关系, 相对武汉市,汉阳区、武昌区、青山区、东西湖区才有意义。 为了准确地分析并描述地址模型,在此引入最小地址要素的概念,并给出武汉市可 8 中国石油人学( 华东) 硕 学位论文 能的最小地址要素的类型,最小地址要素是指不可再分的地址要素,具有最小的地址意 义【3 l l 。如:香江路就是一个最小地址要素,如再将香江路拆分为香、江和路就不具有任 何意义了。 建立地址模型,首先应该明确什么是地址要素和非地址要素,在图2 1 中,我们可 以明确在本项目中地址要素的种类。 i 地址( 子地址) :一: 图2 - 1 地址要素与非地址要素 f i 9 2 - 1 a d d r e s se l e m e n t sa n dn o n - a d d r e s se l e m e n t s 同时,在许多地方洞、公路、规划、河流、湖潭、公园、环岛、纪念地、建筑物、 交通站场、街巷、开发区、名胜古迹、桥梁、泉、山峰、山脉、水库、水渠、隧道、体 育设施、铁路、政区、住宅区、自然村、地片、楼名、门址等都被视为地址要素,在本 项目中作为地址或组成地址的要素主要有:公路、街巷、开发区、政区、社区、住宅区、 楼民、门址,其他均为非地址要素。 每个地址要素都由关键词和专名两部分组成,每类地址要素的通名都近似相同,但 专名都不相同。例如“武汉市青山区工业二路5 8 号 ,其专名和通名如下所示: 武汉市( 地址要素) = 武汉( 专名) + 市( 通名) 工业二路( 地址要素) = 工业二( 专名) + 路( 通名) 2 1 2 地址要素的分类 按照地址的类别性质,在地址编码项目中将地址要素分为5 类,分类如下。 9 第二章地址编码标准和模型 l 、行政区界 在地址编码项目中,行政区划部分:用于标注地址的行政级别,描述地址所属行政 范围,反映地址数据的粗粒度信息,该部分不包括街道办事处,这部分不可以为空。它 包括四层: 国家层:表明地址所属的国家; 省级层:表明地址所属省的名字,没有则为空。通名:省; 市级层:表明地址所属市的名字,不能为空。通名:市; 区县层:表明地址所属区县的名字,没有则为空。通名:区、县。 2 、地址部分:它是一条地址数据的核心组成部分,描述地址的具休内容,反映地 址数据的中粒度信息。这部分不可以为空。它主要包括:道路和门牌号。 道路通名:路、街、大路、道、大街、胡同、巷、弄、条、里。在武汉市青山区, 道路主要以街命名,如钢花村街、冶金街。 f - j r 通名:号、撑。 3 、子地址部分:它是一条地址数据中剩余的部分,描述地址的补充信息,反映地 址数据细粒度信息的部分。该部分可以为空。它包括楼牌号、住宅小区、社区。 社区通名:社区、园。 住宅小区通名:小区、公寓、苑、花园、街坊。例:翠园小区。 楼牌号通名:门、栋、号楼、楼、馆、堂。例:1 3 号楼、逸夫楼。 4 、别名部分:由于某些原因,一些城市或者道路可能有两个名称,虽然行政规划 上有一个正式的名称,但是也有可能有约定俗成或者历史遗留下来的名称。 5 、补充部分:这是对地址信息的补充,在对上述地址查询的时候,如果出现模糊 的问题,或者多个地址重名的情况,可以结合这一部分进行交叉查询。 邮政编码,例:2 6 6 5 5 5 。 i p 号区段,以及电话号码等。 地址是由上述各类地址实体的名称段组合构成,而且最终实现地址匹配的时候也是 需要这些关键字段,所以地址拆分所需要的地址字典库的结构是根据这些名称段的分类 信息来设计的。字典库共包括省、市、区( 县) 、道路、房屋、社区、街道、标志物等各 类地址名称表,各个表中的记录都与其标准名称相关联。地址拆分采用基于字符串匹配 方法的最大逆序匹配算法,做到对地址字符串进行准确,完整的拆分,而且可以在拆分 1 0 中国石油人学( 华东) 硕上学位论文 的同时获得拆分出的地址关键字段的分类信息并输出标准地址名称,使得在地址匹配阶 段获得正确的地址宁段信剧3 2 1 。 此地址字符串的拆分和标准化步骤如下图2 2 所示: 从以上过程可以看出,实际的地址数据被拆分成标准的地址字段值,它们将被按照 一定的规则进行组合并与参照数据中相应的字段值进行匹配进而实现地址编码。 ,。o 。_ 。一、r 。- - 。_ _ _ o 。o o 。o o 。_ - _ - 。_ 。_ _ o _ l 原始地址字符串0 武汉青山i x j 业二路5 8l 1 _ _ - _ _ - _ - _ _ _ _ 。_ _ - _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ _ - - _ _ _ - _ - _ - _ _ _ 。_ ,l _ _ _ _ _ _ _ _ - _ _ _ - _ _ _ _ _ _ _ _ _ _ _ - _ - _ _ - - _ _ _ _ _ - _ _ _ _ - _ _ _ _ - _ _ _ _ _ _ _ _ _ _ _ - _ _ _ _ _ _ _ _ _ _ _ _ _ _ - _ - _ _ _ _ _ - _ _ _ _ - _ _ _ _ _ _ 一 匹巫 匝亟夏至口 匡互 匝亟互至困 【市】:武汉市【区县】:青山区 【路街】:工业二路【号】:5 8 号 图2 - 2 地址的拆分和标准化步骤图 f i 9 2 - 2a d d r e s ss e p a r a t i o na n ds t a n d a r d i z a t i o n 2 1 3 标准地址数据的形式化表达 1 、标准地址模型的b n f 范式表达方式 在计算机科学中,一般采用b n f 范式( 巴克斯范式) 【3 3 1 来表达语法,上面的标准地 址的b n f 范式表达式如下: := ( “:= 表示构成) := 国名 l 省份 市名 l 区名l 县名 := 地址基本组成部分i i 地址扩展部分 := 子地址基本组成部分l l 子地址扩展部分 2 、标准地址模型的x m ls c h e m a l 3 4 1 表达方式 x m l 表达方式是数据共享和交互的基础,故对标准地址模型采用该方式进行表达, 其表达方式如图2 3 : 第二章地址编码标准和模型 :一j 孝匠醋j 图2 - 3 标准地址编码模型( x m ls c h e m a 表达方式) f i 9 2 - 3 n o r m a t i v ea d d r e s sm o d e l ( x m ls c h e m ae x p r e s s i o n ) 2 2 标准地址模型的建立 词组结构化的组成方式就是地址模型,不同的国家和地区具有不同的地址表述方 式,也就有不同的地址模型【3 5 】。由于地址涉及各个方面的基础信息要素,而目前这些基 础信息要素尚没有一个编码标准,因此本论文参照国际标准或发达国家标准进行地址编 码模型的设计,这一过程还需要参考相关业务部门的意见,不断讨论和深化。 2 2 1d i m e 模型与t i g e r 模型 d i m e 地理基础文件和t i g e r 模型都是曾经在美国人口普查过程中成功应用的地 理编码模型f 3 6 3 7 1 ,对于后来的地址编码模型的建立都具有重要的参考意义。这两种模 型都不存储单独的地址,是以“地址范围”为基础【3 8 ,街道由线段序列表示,若一个连 续的线段序列,除断点外没有其他交点,并且每条线段明确关联了左右多边形及始末节 点信息,则在t i g e r 的拓扑结构中被称作“完整链 ,完整链的首尾点称作s t a r tn o d e 与e n dn o d e 。术语“地址范围 是指相对完整链的结点编号方向,第一个与最后一个 可能的沿街门牌号对,即地址范围包含了号码可能的全部范围,即便被标识为某号码的 地物实际并不存在。 组成地址范围的地址号码般为城市类型地址”的号码【3 9 1 ,最简单的“城市类型 地址 由号码、街道名以及5 位邮政编码组成,例如“3 1 2m a i ns t9 0 2 1 0 ,通常一条 地址还提供更多的其他信息。 1 2 中国石油入学( 华东) 硕上学位论文 2 2 2e s r i 模型 本文同时参考了e s r i 公司基于, m c g i s 平台的g e o d a t a b a s e f 4 0 1 ,它是为加拿大卡尔 加罩市设计的地址数据模型。g e o d a t a b a s e 是建立在d b m s 之上的针对空间数据与属性 数据的统一的数据库设计接口,g e o d a t a b a s e 不是e s r i 的一个独立产品,而是实现于 a r c g i s 平台的a r c s d e 、a r c c a t a l o g 等产品或组件之内的一个设计接i :1 。在g e o d a t a b a s e 之上可以对对象与非空间的属性表进行统一的数据模型设计,由a r c g i s 平台转换为后 台数据库系统的表结构【4 1 1 。因此该数据模型是完全基于d b m s 的。 该模型由a d d r e s s e s 、n a m e s 、z o n e s 、a d d r e s s a b l eo b j e c t 四个逻辑分组构成,每个 组由多个表或者c l a s s 组成,组与组之间的相关表或c l a s s 由关系表连接,可实现一对 多以及多对多关联。a d d r e s s 表示地址的实体及地址的派生实体,包括子地址( s u b a d d r e s s ) 及地址范围( a d d r e s s r a n g e ) 。该组的c l a s s 或表并没有街道名称字段但沿街号码存储于 该组。s u b a d d r e s s 有一个引用指向a d d r e s s ,为a d d r e s s 划分更细的下一级地址单元。 a d d r e s s r a n g e 与d i m e 、t i g e r 模型功能类似。n a m e s 可以赋值给地址的名称、以及组 成这些名称的最小元素。g e o n a m e 为一条地址的全部的字符部分( 除去数字号码部分) , b a s e n a m e 字段为地址字符的核心部分。z o n e s 各级行政区划及邮编区划单元,这些信 息与地址相关联。主要包括p r o v i n c e 、c i t y 、p o s t a c o d e 、z o n e 4 2 1 ,其中z o n e 由指向p r o v i n c e 、 c i t y 、p o s t a c o d e 记录的引用( 在数据库中以外键来实现) 组成,表示一个合理的p r o v i n c e 、 c i t y 、p o s t a c o d e 组合。几个组之间由a d d r e s s e s h a v e n a m e s 、a d d r e s s e s h a v e z o n e s 等关 系表关联。a d d r e s s a b l eo b j e c t s 包括所有拥有地址信息的实体。包括b u l i d i n g 、 o w n e r s h i p p a r c e l 、c o m m u n i t y f a c i l i t y 、s t r e e t 。他们都为空间实体c l a s s ,都有一个s h a p e 字段存储空间数据。b u l i d i n g 、o w n e r s h i p p a r c e l 、c o m m u n i t y f a c i l i t y 分别通过关系表与 a d d r e s s 、s u b a d d r e s s 关联,s t r e e t 通过关系表与a d d r e s s r a n g e 关联。这样含有图形数 据的空间实体便与地址信息建立了关联。 2 2 3 国内地址模型的建立研究 本节从国外的地址模型中吸取经验,结合我国城市地址的特点,以武汉市为例,建 立我国的地址编码模型。 通过对武汉市的标准地址的分析,可以认为武汉市的地址模型是一种复杂的层次模 型1 4 3 】。地址由各个地址要素组

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论