(概率论与数理统计专业论文)基于混合患病兄弟对的连锁分析研究.pdf_第1页
(概率论与数理统计专业论文)基于混合患病兄弟对的连锁分析研究.pdf_第2页
(概率论与数理统计专业论文)基于混合患病兄弟对的连锁分析研究.pdf_第3页
(概率论与数理统计专业论文)基于混合患病兄弟对的连锁分析研究.pdf_第4页
(概率论与数理统计专业论文)基于混合患病兄弟对的连锁分析研究.pdf_第5页
已阅读5页,还剩30页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 患病兄弟对( a f f e c t e ds i b - p a i r ,a s p ) i 受计在遗传统计中有着广泛的应用,这种设计 针对的是完全兄弟对( f u l l s i b ) 而在实际问题中被抽样的患病兄弟对中常会混有一定 数目的半兄弟对( h a l f - s i b ) 。本文对这种基于i b d 信息的混有半兄弟对的a s p ( 称) b m i x e d a f f e c t e ds i b - p a i r ,简记m a s p ) 新数据类型进行连锁分析,特别是对似然比检验进行了 详细的讨论。研究表明仅有i b d 信息的m a s p 数据,所得到的统计模型是不可识别的, 且a s p 设计中普遍采用的比例检验和均值检验不能使用。本文通过追加信息的手段解 决了上述的不可识别性,随后对模型参数的估计给出了b m 算法,证明了似然比检验的 渐近零分布服从自由度为3 的卡方分布。此外还将对比例检验和均值检验进行修正。 最后进行了大量的统计模拟研究模拟结果显示所给的检验方法在小样本情形下具有 良好的表现。 关键词:患病兄弟对,连锁分析,似然比检验,混合模型,e m 算法,可识别性 a b s t r a c t a f f e c t e ds i bp a i r ( a s p ) d e s i g nh a sab r o a da p p l i c a t i o ni n g e n e t i cs t a t i s t i c s i n p r a c t i c e ,h o w e v e r ,t h ea s ps a m p l e sw a sm o s t l ym i x e dw i t hac e r t a i nn u m b e ro fh a l fs i b p a i r ( h s p ) ,w ec a l lt h i st y p eo fd a t a 豁m i x e da f f e c t e ds i bp a i r ( m a s p ) t h i sa r t i c l ef o c u s o nl i n k a g ea n a l y s i sf o rm a s pi b dd a t a r e s e a r c hs h o w st h a tc o r r e s p o n d i n gm i x t u r e m o d e lb a s e do no n l yi b di n f o r m a t i o ni sn o n - i d e n t i f i a b l e f u r t h e r m o r e ,b o t hm e a nt e s t a n dp r o p o r t i o nt e s t ,t h ep o p u l a ra p p r o a c h e so fl i n k a g ea n a l y s i sf o ra s p , a r eu n a v a i l a b l e f o rm a s po n l yi ft h ep r o p o r t i o no fh a l f - s i b - p a i r s a m o n gm a s pb e i n gn o tz e r o i n o r d e rt oo v e r c o m et h en o n i d e n t i f i a b i l i t y ,a na p p r o a c hi sp r o p o s e dt h r o u g ha d d i n gp a r t o fs i b l i n g r e l a t i o n s h i pi n f o r m a t i o n ,a n dt h ec o r r e s p o n d i n gp a r a m e t e r sc a nb ee s t i m a t e d b ye - ma l g o r i t h mw h i c hh a sb e e nd e m o n s t r a t e dt oh o l dv e r yf a s tc o n v e r g e n c er a t ei n c o m m o nc a s e f o rl i n k a g et e s t ,u n d e rt h ec o m p o s i t en u l lh y p o t h e s i sw i t han u i s a n c e p a r a m e t e re x p r e s s i n gt h ep r o p o r t i o no fh s po v e ra l lm a s p s ,t h el a r g en u l ld i s t r i b u t i o n o ft h el i k e l i h o o dr a t i ot e s t ( l r t ) s t a t i s t i cf o rt h ei d e n t i f i a b l em o d e li st h ec h i - s q u a r e d d i s t r i b u t i o nw i t haf i x e dd e g r e eo ff r e e d o m i na d d i t i o n a l ,w ew i l lm o d i f yt h ep r o p o r t i o n a n dm e a nt e s t s s i m u l a t i o ns t u d i e sa t ec o n d u c t e dt oa s s e ! st h ep e r f o r m a n c e so ft h e p r o p o s e da p p r o a c h ,a n dt h er e s u l t ss h o wt h a tt h el r th a sc o r r e c tt y p eie r r o rr a t e s a n ds a t i s f a c t o r yp o w e r s k e y w o r d s :a f f e c t e ds i bp a i r ,l i k e l i h o o dr a t i ot e s t ,l i n k a g ea n a l y s i s ,m i x t u r em o d e l e ma l g o r i t h m ,i d e n t i f i a b i l i t y i l l 中国科学技术大学学位论文相关声明 本人声明所呈交的学位论文,是本人在导师指导下进行研究 工作所取得的成果。除已特别加以标注和致谢的地方外,论文中 不包含任何他人已经发表或撰写过的研究成果。与我一同工作的 同志对本研究所做的贡献均已在论文中作了明确的说明。 本人授权中国科学技术大学拥有学位论文的部分使用权, 即:学校有权按有关规定向国家有关部门或机构送交论文的复印 件和电子版,允许论文被查阅和借阅,可以将学位论文编入有关 数据库进行检索,可以采用影印、缩印或扫描等复制手段保存、 汇编学位论文。, 保密的学位论文在解密后也遵守此规定。 作者签名: 劢书,7 苍钆 年r 月7 日 , 致谢 在完成这篇论文的过程中,我得到了许多老师和同学的大力支持和帮助。在此,我 想对他们致以深深的谢意! 首先,要感谢我的导师崔文泉老师。三年来,崔老师从专业知识,研究方法,治学 态度等多个方面,给予我悉心的指导使我从一个本科生,慢慢成长为一个合格的研究 生。他对学生的循循善诱,让我受益匪浅:他对每一项工作的认真细心。令我深受感动。 这些都是我人生中最有益的影响之一也是我今后学习工作中最好的榜样。在此,我向 崔老师表示我最衷心的感谢! 其次,我想向缪柏其教授,赵林城教授,苏淳教授,韦来生教授,胡太忠教授吴 耀华教授和杨亚宁教授表达我由衷的感激之情。他们悉心的传授各门专业课知识,将我 一步步引进概率论与数理统计这个学科的殿堂让我在吸收这方面知识的同时。也教给 了我运用它们的工具和方法。此外,在我的研究生阶段,还得到了系里许多老师,包括 张洪老师和夏红卫老师的不少帮助,在此一并向他们表示我最诚挚的谢意。 同时我还要感谢其他同学和老师。在他们的鼓励和支持下,我才克服了种种困难。 并最终完成了我的硕士学业。 最后,我将特别的感激之情献给我的家人。他们无私的爱永远是我前进的最大动 力! 谨以此文献给所有关心和帮助过我的人! 第一章引言 在遗传学中统计方法一直起着极为重要的作用。例如,遗传学之父孟德尔发现 的孟德尔第一、第二定律就需要用到离散分布的拟合诜度检验。目前用于寻找疾 病基因的两种主要统计方法是连锁分析和关联分析。连锁分析( 1 i n k a g ea n a l y s i s ) 通过 对一些数据的分析来寻找基因的位置,估计并检验重组率,寻找标记位点和性状位 点之间的连接证据。h a s e m a n 和e i s t o n 1 研究了兄弟对设计中定量性状的线性回归方 法,r j s c h 和z h a n g 2 提出的极值兄弟对方法则可以有效减少定量性状连锁分析的实验 工作量,并讨论对应的统计量的性质。在医学和流行病学中,常常遇到一些定性性状, 例如某一个体是否患有某种疾病。是通过各种临床诊断确定的而并非由某一定量指 标来确定。在定性性状连锁分析中,我们常用的统计方法有p e n r o s e l 3 4 】的患病兄弟对 方法( a f f e c t e ds i b - p a i r ,简称a s p ) ,r i s c h l 5 1 【6 】【7 l 的患病亲属对方法和w a l d 【8 】的对数计分 法( l o d ) ,本文将重点介绍的a s p 设计。 s u a r e z 等【9 1 在讨论了重组率( 用口记之) 、人群中的发生率以及可加遗传方差和显 性遗传方差后推导出同源( i d 朗t i c a i b y - d e s c e n t ) 等位基因值( 简称, i b d 数) 的概率分布。 若标记位点的重组率为;则说明该标记位点与致病位点不连锁,对于a s p 设计,此 时患病兄弟对i b d 取值为o ,1 ,2 的概率分别为 , , 基于患病兄弟对i b d 信息进行连锁 分析,常用的非参数的方法有均值检验( m e a nt e s t ) d 比例检验( p r o p o r t i o nt e s t ) 。在 零假设 b :口= ;为真时,均值检验统计量以及比例检验统计量均渐近服从标准正 态分布。由于这两种检验方法具有方便使用且在一些情形下检验的功效比较高等优点 ( 1 1 0 j ,1 1 1 1 ) 。使得它们在基于患病兄弟对i b d 数据的连锁分析中得到了广泛的研究和应 用。r i s c h 5 、h o l m a l l s 【1 2 】和w h i t t e m o r e 【1 3 】等研究了似然比检验,研究结果表明t 在一 些场合尤其是隐性遗传模式下,似然比检验比均值检验和比例检验常常有着更高的功 效( 1 1 4 1 ) 。还有的学者对a s p 设计进行了扩展,例如,b i a c k w e i d e r 和e l s t o n l l 5 研究了家 庭中两个以上的患病兄弟。因此,患病兄弟对方法在遗传统计中得到了广泛的应用。 而在实际问题中,被抽样的患病兄弟对中常会混有一定数目的半兄弟对( h a l fs i b - 】 中国科技大学硕士论文 p a i r ) 1 6 】,我们称之为混合患病兄弟对( m i x e da f f e c t e ds i b - p a i r ,简i ? 。m a s p ) 。在过去的 研究中,总是忽略半兄弟对的存在,而仍然利用基于a s p 设计的检验方法进行连锁分析。 本文将指出这种做法不妥:对于a s p 中广泛使用的比例检验和均值捡验,当m a s p 中含 有半兄弟对时t 这两个检验的i 型错误随着样本容量趋于无限大而趋于1 :仅有i b d 数据 的m a s p 模型参数相对于似然函数而言足不可识别的。本文将研究获得参数可识别性 的方法,主要途径是追加一部分兄弟对类型信息,我们称之为完全信息。 第二章介绍有关遗传统计的基本知识并对有关符号加以说明。 第三章首先指出基于混合患病兄弟对时,过去常用的非参数的方法( 均值检验和比 例检验) 无法运用,随后证明仅有i b d 数据时。m a s p 模型参数相应于似然函数不可识 别。 第四章提出了一种通过追加信息获得参数可识别性的方法,并给出求解参数极大 似然估计的d m 算法,证明追加信息后的似然比检验统计量的渐近零分布是服从自由 度为3 的卡方分布,最后则是对经典非参数方法的修正。 第五章进行了大量的统计模拟结果显示小样本时似然比检验具有良好的表现。 第六章是结束语,总结本文工作。 2 第二章基本概念 本章主要是对本文将要讨论的问题作一些基本准备。2 i 总结并归纳我们熟知的遗 传学的基本概念,对各种概念之间的关系进行把握:2 ,2 在前人工作的基础上阐述连锁、 重组和连锁分析的定义;2 3 介绍本文的着重研究的连锁分析方法:患病兄弟对设计, 并对相关记号加以说明。 2 1 遗传学的基本概念 人类有2 3 对染色体,包括2 2 对常染色体和1 对性染色体。我们可阻把一对染色体想 象成为两条平行直线,染色体上的一个给定位置叫做一个位点( 1 0 c u s ) ,在同一位点上不 同形式的d n a 序列叫做等位基因( a l l e l e ) 通常用英文字母如a a 表示。在一个给定位点 上,每个人有两个等位基因位于两条同源( i d e n t i c a l b y d e s c e n t ) 染色体这两个等位基因 作为一个整体称为基因型( g e n e t y p e ) 。如果某位点上的两个等位基因相同,如a a 或a a , 则称此基因型为纯合的:如果不同,如a a ,则称此基因型为杂合的。同一位点上的两个 等位基因可以通过实验测出,这样就确定了基因型。很多性状是受某一位点上的基因 型控制的这些由基因型控制而又可以观察到的形状的不同形态称为表现型。如果基因 型a a 和a a 有同样的表现型,但和a a 的表现型不同则称a m 对于a 是显性 勺( d o m i n a n t ) , 或者说a 相对于a 是隐形的( r e c e s s i v e ) ,与a a 和a a 对应的表现型称为显性的,与a a 相对 应的表现型称为隐性的。如果杂合基因型a a 对应的表现型及不同于a a 的表现型,也不 同于a a 的表现型,则称a 和a 是共显性的( c o d o m i n a n t ) 。 孟德尔通过豌豆实验总结出如下猜想:母本( 或父本) 遗传两个等位基因中的任何 一个给后代的概率都是相等的( 都是1 2 ) ,并且母本与父本的等位基因遗传是独立的, 这便是孟德尔第一定律或独立分离原理。考虑一个位点,有两个等位基因a 和a 。假设两 3 中国科技大学硕士论文 个等位基因在亲代群体中的概率分别为 p ( a ) = p ,p ( a ) = 1 一p = q 此外,孟德尔在研究中发现,如果两个位点位于不同的染色体上,则两个位点上的等位 基因的传递是相互独立的这种自由组合原理称为孟德尔第二定律。 如果群体中的三种基因的概率与等位基因的概率关系为 p ( a a ) = 矿,p ( a a ) = 2 p q ,p ( a a ) = q 2 , 则称此群体在该位点出的基因型具有哈代温伯格比例。如果亲代的基因型撅率具有哈 代温伯格比例在随机婚配的假定下以后每一代的基因概率型不变,因此等位基因 概率也不变,而且以后每代都满足哈代,温伯格比例。而如果亲代的基因型概率并不具 有哈代一温伯格比例,在亲代随机婚配的假定下子代的基因型概率也都满足哈代温伯 格比例。这便是哈代一温伯格平衡定律。 亲属( r e l a t i v e ) 是指有血缘关系的人,在遗传学中意味着有共同的祖先。我们讨论的 血缘关系是相对的,一般指三代以内的亲属关系如父子、兄妹、祖孙称为亲属对。由 于亲属对可能共享等位基因,因此他们的基因型不是独立的。在本文中,将着重讨论兄 弟对( s i b - p a i r ) 基因型,由于考虑的基因在常染色体上,与性别无关,因此兄弟对基因型 同样适用于兄妹对、姐妹对和姐弟对。在遗传学中,用来度量亲属对的血缘关系远近程 度的是同源等位基因。令a 是亲属对中的一个体的一个等位基因,b 足另一个体的一个等 位基因如果a 和b 来自同一祖辈,则称a 和b 为同源等位基因。例如,一对父母的基因婚 配类型为a l a 2xa 3 a 4 。他们生了两个儿子如果第一个儿子的基因型为a l a 3 第二个 儿子的基因型为a l a 4 ,则两兄弟共享一个同源等位基因a 1 ,而a 3 和a 4 不是同源等位基 因。在实际应用中,我们有可能不能完全确定同源等位基因的个数,但是可以计算同源 等位基因的概率分布。从遗传学的角度来看亲属对同源等位基因个数越多,这对亲属 的血缘关系就越近。 4 第二章基本概念 2 2 连锁、重组和连锁分析 如果两个位点在同一条染色体上它们的位置比较近则称两个位点上的等位基因 遗传给下一代是不独立的,这一现象在遗传学中成为连锁( 1 i n k a g e ) 。相互连锁的两个基 因位于同一个染色体的不同位置,如果这两个位置之间发生交换,就导致这两个基因的 重组( r e c o m b i n a t i o n ) 。减数分裂时同源染色体间发生交换的频率称为重组率,由盂德尔 第二定律。p 应满足不等式0 fs ;若两个位点距离紧密,则共同分离的概率较大 重组概率较小,例如,两个位点重合时,口= 0 若两个位点距离很远,则发生交换机会 就多,重组概率较大,此时口= ; 连锁分析( 1 i n k a g ea n a l y s i s ) 是通过对一些数据的分析来寻找基因的位置。也称为基 因作图。通常,人们研究的位点,大部分不是候选疾病位点( d i s e a s el o c u s ) ,而是标记位 点( m a r k e rl o c u s ) ,标记位点有可能临近控制性状的位点( t r a i tl o c u s ) ,但它并不直接控制 所研究的性状位点。而标记位点和性状位点的关系可以用重组率来籀述,记i b d t 为兄 弟对在性状位点上的i b d 数,记i b d m 为兄弟对在标记位点上的i b d 数。如果父母的婚 配类型为a i a 2 a 3 a 4 ,则各种兄弟对基因型对应的i b d 数如下表: 表2 1 各种基因型i b d 数 弟 兄 a i a 3a l a 4 a 2 a 3a 2 a 4 a i a a 2110 a l 山 l 2o l a 2 a 3 l021 a 2 a 4 0l i 2 由此得到兄弟对的i b d 数的概率分布: p ( i b d = o ) = i 1 ,p ( i b d = 1 ) = ;,p ( i b d = 2 ) = ; h a m a n 和e l s t o n f l l 给出了兄弟对的性状位点的同源等位比例( q t ) 和标记位点的同源等 5 中国科技大学硕士论文 位比例( 丌j 。) 的联合分布。如尸( t = 1 ,码。= 1 ) = p ( i b d t = 2 ,i b d m = 2 ) ,表2 2 列 出了和和丌j 。的联合分布,其中令霍= 日2 + ( i 一口) 2 表2 2 7 f j 和丌j 。的联合分布 口j ” 鸶翱 t 0 i 2 1 0 啦2 4m ( 1 一屯) 2( 1 一啦) 2 4 t 1 4 1 2皿( 1 一口) 2 ( 1 2 1 1 , + 2 m 2 ) 1 2皿( 1 一霍) 21 1 2 1 ( i 一田) 2 4口( 1 一电) 2m 2 41 4 总和 1 41 21 4 i 我们感兴趣的问题是寻找与疾病相关的基因的精确位置,从统计学的角度讲就是 估计重组率p ,从而确定标记位点和性状位点之间的距离。通过图谱函数可以将口转换成 基因距离 1 7 1 或者做假设检验( 零假设为凰:p = 1 2 ( 没有连锁) h l :p 1 2 ( 有连 锁) ) 。在定性性状连锁分析中常用的统计方法有p e n r o s e 的患病兄弟对方法( a f f e c t e d s i b - p a i r ,简称a s p ) ,r i s c h 的患病亲属对方法和w a l d 的对数计分法( l o d ) ,下面将介绍 的a s p 设计。 2 3 患病兄弟对方法 在实际问题中。最常见的定性性状是二值性状。如患病和正常两种状态。a s p 方法 的抽样准则是。在群体中抽取两成员都有病的兄弟对,然后找到他们的父母,对父母兄 弟的基因数据进行连锁分析。用z 来定义取值0 和l 的示性随机变量,它表示某个体是否 具有某种性状,比如说是否患某种疾病即 z : 1 若? 尊患堂, io 若个体正常 考虑一个具有两个等位基因b 和b 的性状位点。两个等位基因的概率分别为尸( b ) = p 和 p ( b ) = 口= l p 用“a f f ”表示患病定义如下的条件概率: p ( a f flb b ) = f o ,p ( a f flb b ) = f l ,p ( a f fib b ) = ,2 6 第二章基本概念 在遗传学里,上述三个条件概率称为渗透率,他们表示具有特定基因型的群体患病的比 例。如果用g 表示基因型则 p ( y = llg = b b ) = ,o , f ( y = lg = b b ) = , p ( y = 1 i g = b b ) = 如 在哈代一温伯格平衡定律成立的假定下,e ( y l g ) 取值,0 , ,2 的概率分别为矿,2 p q ,口2 定 义定性性状的遗传方差【1 8 】【1 9 】为 露= v a r ( e ( zlg ) ) = 2 + 以, ( 2 3 1 ) 其中程= 2 m f ( , 一,2 ) + q ( f o 一 ) 1 2 为可加遗传方差。口:= p 2 q 2 阮一2 ,l + f o l 2 为显性 遗传方差。 群体的流行率是指从群体中随机抽取的一个体患病的概率,设为k p ,由全概率公 式。群体的流行率可表示为 k p = e z = p ( z = 1 1 = p ( z = 1ib b ) p ( b b ) + p ( z = 1ib b ) p ( b b ) + p ( z = lib b ) p ( b b ) = 矿厶+ 2 职 + q 2 知( 2 3 2 ) 如果抽取到的兄弟对两成员均患病。即他们有相同的表现型或相同的性状,则兄弟对在 形状位点上的同源等位基因的数目应该偏多。如果性状位点与某一标记位点很近,则 因为性状位点上的i b d 数与标记位点上的i b d 数呈正相关性所以兄弟对在标记位点 的i b d 数也应该比较多。我们需要知道在给定兄弟对患病的条件下,兄弟对在标记位点 上的i b d 数的概率分布。 用a 表示兄弟对中患病成员的个数。s u a r e z 等人在讨论了重组率、人群中的发生率 以及可加遗传方差和显性遗传方差后,推导出i b d 的概率分布。表2 3 给出了条件概率分 布p ( a = 七l i b d t = i ) 7 中国科技大学硕士论文 表2 3 条件概率分布 k 21o 2 1 0 暑+ + 口:k 暑+ f :2k 暑 2 ( 巧一k ;一口:一程)2 k p 一2 k ;一d :2 ( k ;一k ;) i 一2 坼+ ;+ 口:+ 口;i 一2 k p + ;+ 口:2l 一2 k p + 砟 由全概率公式和表2 ,3 ,易得: p ( a = 2 1 = p ( a = 2ii b d t = 2 ) p ( i b d t = 2 ) + p ( a = 2i b d t = 1 ) p ( i b d r = 1 ) + p ( a = 2 i i b 协= o ) p ( i b d t = 0 ) = :( k ;+ 盯:+ ) + j l t n p 2 + 仃:2 ) + ;砩 = k ;+ ;以十和1 ( 2 3 3 ) 由于控制性状的位点是未知的,因此兄弟对在性状位点上的同源等位基因是不可观察 的。但我们能观察到或估计兄弟对在标记位点的同源等位基因数日i b d m 的基因数据。 现在我们给出i b d m 的条件概率分布: p ( i b d m = j ia = k ) 1 p ( a = k ) p ( i b d z = 鼻a = 七) = 可是丽喜尸( a = 七i i b 肼) p ( i b d t = i , i b d m = j ) ,( 2 3 4 ) 尸= 七j ,b d r ) 和p ( ,b d t = l ,i b d m = j ) 分别有表2 3 ,2 2 给出,设d 2 = p ( z = 2 ) ,这样可以得到患病兄弟对标记位点l b d 数的概率分布: p p p f b d m = 2 la = 2 b d m = 1 la = 2 i b d m = 0a = 2 1 = 五十 1 2 = ! 一 4 ( m l 2 ) a :+ ( m 2 1 4 ) 司 4 d 2 2 f 皿2 一田+ l 4 ) g : 4 d 2 ( 皿一1 2 ) 口:+ 【2 一2 3 4 ) a : 8 ( 2 3 5 ) 第二章基本概念 其中母= p 2 十( 1 p ) 2 条件概率分布p ( i b d m ;jla = 2 ) 可以用来检验零假 设h o :p = l 2 在零假设0 成立条件下,p ( i b d j i f = 2la = 2 ) = 1 4 ,p ( i b d m = 1 ia = 2 ) = 1 2 ,p ( 1 b d m = 0ia = 2 ) = 1 4 由于基因疾病大多数不是很常 见,因此d 2 相对较小,这种抽样所获得的信息最多,上述方法称为患病兄弟对方法,简 称a s p ( a f f e c ts i b - p a i r ) 方法。 在实际问题中,被抽样的患病兄弟对中常会混有一定数目的半兄弟对 1 5 1 即患病兄 弟对为同父异母或同母异父。例如,某兄弟对父母的婚配类型分别为a l a 2 x a 3 a 4 和a 1 a 2 x a 5 a 6 ,则各种兄弟对基因型对应的i b d 数如下表: 表2 4 各种基因型i b d 数 弟 兄 a i a 3a l a 4a 2 a aa 2 a 4 a l a s ll00 a l 凡 1l0o a 2 a 5 0oi l 2 a 6 oo1l 那么,半兄弟对i b d 数的概率分布为: p ( i b d = o ) = 否1 ,p ( i b d = 1 ) = ; 我们称这样的兄弟对为混合患病兄弟对( m i x e da f f e c t e x ls i b - p a i r ,简记m a s p ) 。s c h a i d 等 人【2 0 】研究了基于m a s p 的定量性状连锁分析,本文讨论的则是定性性状连锁分析。 为方便起见。定义如下记号:令丌表示m a s p e p 半兄弟对所占的比例,即 r = p ( x = o ) ,其中x 来定义取值0 和1 的示性随机变量,它表示某兄弟对是否为半兄弟对即 x = 。1 :篡盒i ;凳耋冕蓁筹 i , m a s p 为全兄弟对 i b d 取值用y 表示,记 乃= p ( y = k l x = j ) ,u ,k ) = ( 0 ,o ) ,( 0 ,1 ) ,( 1 ,o ) ,( 1 ,1 ) ,( 1 ,2 ) 9 中国科技大学硕士论文 从总体中取一样本容量为的样本 k ) :l ,其中k 表示第i 对患病兄弟对的i b d 取值, 令m = 孝d :k = j ,i = 1 ,”) ( j = 0 ,1 ,2 ) ( 榉a 表示有限集合a 的元素个数) , b p j l v 对患病兄弟对中i b d 取值为j 的个数。 1 0 第三章经典方法处理m a s p i b d 数据的问题讨论 患病兄弟对连锁分析常用的检验有均值检验,比例检验以及似然比检验。如果从 群体中抽取n 对患病兄弟对,并确定它们在标记位点同源等位基因的数目。兄弟对根 据i b d m = 2 ,1 ,0 - 7 分为三类相应的对数分别为n 2 ,1 1 , l ,n o ( n 2 ,n l ,珊) 服从三项分布, 并r n 2 服从二项分布1 i 1 3 n 2 一e ( n ,) ,其中= n 0 + 竹l + n 2 , e = ;+ 筹涝端铲 叭, 在凰成立的前提下,有e = 1 4 ,于是有e n , ( 2 ) = ,4 ,v a r n o ( n 2 ) = 3 n 1 6 n i l t ,统 计量 b :丝生( 3 n 2 ) p 2 一 t ) z j 、卷4 t t z , u 近似服从标准正态分布可用来检验零假设是否成立,该检验称为比例检验( p r o p o r t i o n s t e s t ) 目前比较流行的还有均值检验( m e a n st e s t ) ,检验统计量为 = ( n 2 + 等) 一譬 、髻 ( 3 0 3 ) 文献1 9 1 f 1 0 1 研究了检验统计量7 k 的功效,结果表明功效不错。在实际应用中。常常先由 已有的信息估计i b d _ l l f 的均值,从而得到“2 和n l 的估计值碗2 和h l ,然后在上述检验统计 量瓦和7 k 中。用估计值而2 和元l 替换n 2 和n l ,从而得到实用的统计量。r i s c h 5 、h o l m a n s 1 2 l f 铂w h i t t e m o r e 1 3 等还研究了似然比检验研究结果表明,在一些场合尤其是隐性遗传 模式下,似然比检验比均值检验和比例检验常常有着更高的功效( 【1 4 1 ) 。 在基于m a s p 的连锁分析研究中,由于半兄弟对信息的获得意味着涉及个人隐私 和提高抽样成本,如果忽略了忽略半兄弟对的存在,仍然采用传统a s p 设计的检验方法 进行连锁分析是不妥的。3 1 通过计算发现,对于a s p 中广泛使用的比例检验和均值检 验。当m a s p 中含有半兄弟对时,这两个检验的i 型错误随着样本容量趋于无限大而趋 于1 :3 2 n 证明了仅有i b d 信息的m a s p ,模型参数相对于似然函数而言是不可识别的。 中国科技大学硕士论文 3 1基于混合患病兄弟对的非参数方法 均值检验统计量7 m 和比例检验统计量l 分别为: 靠= 掣,乃= 等 ( 3 ) 、? 鼍、i 若不含有半兄弟对,则在零假设风:p = 为真时,7 m 、己渐近服从标准正态分布而 在m a s p 中这一结论并不成立。在给定x 的条件下y 的条件分布率分别为: p w = 引x = o ) = f n ( y ;p o o ) = ( p 0 0 ) 7 ( p 2 0 ) ( 1 一姗) ( 口2 n , p ( y = 口l x = 1 ) = f f ( v ;p l o ,p 1 1 ) = 0 l o ) m 2 0 ( p 1 1 ) 砌2 1 ( 1 一p l o p n ) 地。 ( 3 1 2 ) 进而由全概率公式,可得y 的概率函数: p ( y = v ) = ,( ; i f ,p o o ,p m ,p h ) = ”抽( 骈p o o ) + ( 1 一f ) ,f ( y ;p r o ,p h ) = ( 霄p + ( i 一7 r ) p l o ) 7 ( v = o ) ( 霄( 1 一瑚) + ( 1 一 r ) p 1 1 ) 。( ,= 1 ) ( ( 1 一耳) ( 1 一p l o p 1 1 ) ) 。( ,= 2 ) ( 3 1 3 ) 由此可得,( ,( ,= o ) ,i ( y = 1 ) 。,( y = 2 ) ) 1 t 从三项分布t r i n o m ( 1 ;p o ,尸i ,岛) ,其中, p o = 7 r 细+ ( 1 一”) p l o , 只= 7 r p o l + ( 1 7 r ) p l i = 7 r ( 1 一p o o ) 十( 1 7 r ) p l l , b = ( 1 一丌) p 1 2 = ( 1 7 r ) ( 1 一p m p n ) ( 3 1 4 ) 那么,( n o ,n 1 ,憋) 服从三项分布t r i n o r n ( n ;蜀,r ,尸2 ) 在零假设下,( p o o ,p l o p 1 1 ) = ( 1 2 ,1 4 ,1 2 ) ,代入( 3 1 4 ) 得: ( 局,p i ,p 2 ) = ( ( 1 + n - ) 4 ,l 2 ,( 1 一r ) 4 ) ,( 3 1 5 ) 代入( 3 1 1 ) ,对统计量7 m 和乃分子部分求期望,得, e n o ( n :+ 等) _ 百n l _ _ 删4 , e h 文n t n q = 一n | 4 1 舢 第三章经典方法处理m a s p i b d 数据的问题讨论 方差为: v a r h o 【( 2 + 丁n i ) 一虿n j = ( 2 - - 2 ) n 1 6 , v a t h o ( r 2 一4 ) = ( 1 一丌) ( 3 + ”) 1 6 ( 3 i 7 ) 进而统计量7 m 和l 的期望为: ( ) = 一”何以,e o ( t p ) = 一丌何以( 3 这就表明,由于半兄弟对占有一定比例,上述统计量的偏会随样本容量的增大而趋 于一o o ,在检验中i 型错误接近l ,n e m e 等【2 1 】也曾系统研究过这一问题。因此,在m a s p 中 均值检验和比例检验不适合作连锁分析。若想继续采用这些方法,必须加以修正,这将 在4 。4 介绍。 3 2 模型可识别性的讨论 基于混合患病兄弟对我们不能忽视参数的可识别性( i d e n t i f i a b l e ) i 一j 题,我们先给 出相关的定义: 定义3 1 我们说参数相对于一混合分布组d 是可识别的,如果对所有的( x ) d ,若 有 则对所有的i 1 ,p 有 ( ”,咖) 三( 7 r ,五) 同上节( 3 1 3 ) y 的概率函数为 p ( y = ) = ( y ;- ,p 0 0 ,p l o ,p 1 1 ) = ,h ( ”;p ) + ( 1 一 ) 扣( y ;p l o ,p 1 1 ) = ( 7 r p o o + ( 1 一丌) p l o ) 7 ( 翟= o ) ( - c 1 一姗) + ( 1 一丌) p 1 1 ) ( p = 1 ) ( ( 1 一丌) ( 1 一p l o p 1 1 ) ) ( v = 2 ) 1 3 z “ 丌 。:l | l 血 z g巩 。谢 = p, 中国科技大学硕士论文 ( t ( y = o ) i ( y = 1 ) ,1 ( y = 2 ) ) 服从三项分布丁一n l ( 1 ;岛,p l ,p 2 ) 其中t 岛,尸l ,b 的 推导结果亦同上。令= ( ”,p o o ,p l o ,p n ) r ,f ( v ,砂) 垒,( ;,p 0 d ,p 1 0 ,p 1 1 ) 由此得到参数 空间圣: 圣= 妒= ( 丌,p o o ,p i o ,p 1 1 ) r i o 7 r l ,0 p o o ,p 1 0 ,p 1 l o ,b kl p k = 1 ) ,p k = 孤( 咖) ,圣,若参数空间垂的自由度不小于k ,那么参数对于m u 砒n 卯l ( n ;p i , p k ) 是不可识别的。 设从总体y 中取一样本容量为n 的样本 k ) 譬i 其中k 表示第i 对患病兄弟对的i b d 取 值,令嘶= 铲 i :k = j ,i = l ,n ( j = 0 ,l ,2 ) ( 社4 表示有限集合,4 的元素个数) , e p n 对患病兄弟对中i b d 取值为z 的个数。( k :l 的似然方程为: 二。( 妒) 皇。 ; 玑 墨1 ) = 1 7 ,( 玑;妒) z = i = 1 7 ( ”p o o + ( 1 一”) p i o ) ( p l f f i o ( r ( 1 一p o o ) + ( 1 一”) p 1 1 ) 7 “。1 ( ( 1 一口) ( 1 - p i o p l i ) ) 虮2 2 = ( a p o o + ( 1 一丌) p l o ) “o ( 7 r ( 1 一p o o ) + ( 1 一, o p n ) “1 ( ( 1 7 r ) ( 1 一p l o p 1 i ) ) “2 ( 3 2 3 ) 第三章经典方法处理m a s p i b d 数据的问题讨论 ( n o ,n l ,n 2 ) 服从三项分布t r i n o m ( n ;p o ,p l ,b ) 与定理3 2 类似,不难得到推论3 3 推论3 3 参数q b w i f l 。( ) i 圣 是不- i i 只n 的。 j e l l s :对于给定的矿= ( ”,嘞,p 孙,拼1 ) 圣,v g 及n o ,n 1 7 2 若存在,使得。( 庐) = l 。( 妒) ,那么: l l r p o o + ( 1 一 r ) p l o = 7 r * p ;o + ( 1 7 r * ) p 0 ”( 1 一p o o ) + ( 1 一 r ) p n = l r * ( 1 一哦) + ( 1 一 r + ) 肼l ( 3 2 4 ) l ( 1 一订) ( 1 一p l o p 1 1 ) = ( 1 一 r ) ( 1 一p :o 一班1 ) 即: 丌1 9 0 0 + ( 1 一咖l o 2 ”墙+ ( 1 彳) p 孙 ( 3 矧 【,r ( 1 一p o o ) + ( 1 7 r ) p n = r 。( 1 一f ) + ( 1 一 r ) p :l 、 该方程有无穷多组解,参数西对于( l 。( 毋) i 母圣 是不可识别的,定理得证。 _ 可识别性为统计检验的重要问题如果似然函数相对于参数不可识别,那么许多工 作尤其是似然比检验无法进行。接下来的章节我们将介绍一种方法来解决不可识别性 的问题。 1 5 第四章主要方法介绍 在上一章中,我们探讨了这样两个问题:仅有i b d 信息的m a s p 数据,所得到的统 计模型是不可识别的,且a s p 设计中普遍采用的比例检验和均值检验不能使用。在本章 中,将研究一种方法,使得我们能够获得参数的可识别性,从而得到基于m a s p 的似然 比检验。41 将介绍这种方法,在获得参数可识别性之后,4 2 给出相应的似然比检验 统计量,并证明该统计量的渐近零分布服从自由度为3 的卡方分布。4 3 将给出求解极 大似然估计的b m 算法。44 对比例检验和均值检验进行修正。 4 1 获得参数可识别性的一种方法 由前面的讨论得知,对于m a s p 而言,只要其中混有半兄弟对,即只要丌不为0 ,则 仅有i b d 信息是无法利用似然比检验进行连锁分析的。必须在获得更多信息的基础上, 才能进行基于似然方法的统计推断研究。下面的研究表明,在已知i b d 信息的基础上。 只要知道一些兄弟对的兄弟关系的信息,即可获得参数的可识别性。 假设追加了m 对m a s p ,获得的信息为( x i ,k ) 釜。+ l ( = 竹+ m ) ,如此我们得到了 一个样本容量为的样本 磊) 墨i ,其中 五2 。意,: 显见 磊 甚。+ l 为独立同分布于僻,y ) 。且 五 嚣= i 与( 磊) 篓。+ l 相互独立。令a = t ( o ,o ) , ( 0 ,1 ) ,( 1 ,o ) ,( 1 ,1 ) ,( 1 ,2 ) ,x c f ( j ,) a ,记m 批= 带 i :( 置,k ) = ( 七) ,i = ,l + 1 。, ,m e = r o o k + m l k ( 自= 0 ,1 ,2 ) ,m o = m + t o o l ,m l = m l o + r o l l + m 1 2 不难求得( x ,y ) 的联合分布率为: p ( x = 霉,y = y ) = ( 7 r p o o ) 7 ( 。,) 皇( o 川( 丌( 1 一m ) ) 7 。神;f 0 , i ( ( 1 一丌) p l o ) 7 扛口) = ( 1 o ( ( 1 一丌) p

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论