云南农业大学生物统计附试验设计课件第二章 资料的整_第1页
云南农业大学生物统计附试验设计课件第二章 资料的整_第2页
云南农业大学生物统计附试验设计课件第二章 资料的整_第3页
云南农业大学生物统计附试验设计课件第二章 资料的整_第4页
云南农业大学生物统计附试验设计课件第二章 资料的整_第5页
已阅读5页,还剩30页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

云南农业大学·生物统计附试验设计第二章资料的整理数据的收集、分类、汇总与可视化呈现Contents本章目录资料的整理是生物统计分析的基础环节,涵盖数据类型识别、分布表编制与图表规范应用。01试验数据的类型与特征02次数分布表的编制03次数分布图的绘制04质量性状资料的整理05数据变换与标准化处理06统计图表的规范应用07数据整理实践与案例Chapter01试验数据的类型与特征认识数据分类体系,理解数量性状与质量性状的根本差异DATACLASSIFICATION试验数据的基本分类生物统计中的试验数据按性质分为定量资料(数值度量)和定性资料(类别划分)两大体系,不同数据类型决定了不同的整理方法与统计分析策略,是选择后续分析路径的根本依据。定量资料(数值型)连续型数据可在某一区间内取任意值,如株高85.3cm、穗长18.6cm、千粒重42.5g等,通常由测量工具获得,具有精密的数值特征。离散型数据只能取整数或有限个值,如每穗粒数238粒、有效分蘖数5个、叶片数12片等,通常由计数获得,表现为不连续的数值。核心应用定量资料是生物统计分析的核心对象,适用于计算平均数、标准差、变异系数等统计量,是参数估计和假设检验的主要数据来源。定性资料(分类型)无序分类数据各类别间无等级关系,如花色(红、白、粉)、血型(A、B、O、AB)、品种名称等,类别之间没有大小或优劣之分。有序分类数据各类别间存在等级或程度关系,如抗病性分级(高抗、中抗、感病、高感)、肉色评分等级等,类别间有明确的顺序差异。核心应用定性资料通常以次数(频数)形式呈现,通过统计各类别的个体数目来描述群体特征,适用于卡方检验、Fisher精确检验等非参数方法。COMPARISON·资料整理基础数量性状与质量性状的比较数量性状与质量性状在变异特征、遗传基础、环境影响和数据获取方式上存在根本差异,前者表现为连续变异、受多基因控制,后者表现为不连续变异、受少数主效基因控制。数量性状的特征01105cm连续分布,无法明确分类02QTL位点共同决定03差异可达30%以上04和分布图质量性状的特征01两种,无过渡类型02制,后代呈可预测分离比03养条件下基本一致04主,如表2-1毛色统计Chapter02·资料的整理资料的两大统计特征任何一组试验数据都同时具有集中趋势与离散趋势两大统计特征,前者反映数据的中心位置,后者反映数据的变异程度,数据整理的核心目的就是通过分组制表使这两大特征直观显现。集中趋势指标01算术平均数—所有观测值之和除以观测值个数,是最常用的集中趋势指标,对极端值敏感,适用于正态或近似正态分布的资料02中位数—将所有观测值从小到大排列后位于中间位置的数值,不受极端值影响,适用于偏态分布或存在异常值的资料03众数—出现次数最多的观测值或组段,适用于描述分类数据或大致判断连续数据的集中区域,一组数据可能存在多个众数离散趋势指标01极差—最大值与最小值之差,计算简单但仅利用了两个极端值信息,容易受样本容量影响,不宜用于样本间变异程度的精确比较02方差与标准差—利用全部观测值计算的变异度量,标准差的单位与原数据一致便于比较,是生物统计中最核心的离散度指标03变异系数—标准差与平均数的比值(百分数形式),消除了量纲和平均数水平的影响,适用于比较不同性状或不同群体间的相对变异程度CHAPTER02次数分布表的编制将杂乱无章的原始数据转化为结构清晰、规律可辨的统计表格Chapter2·DataOrganization次数分布的基本概念次数分布是将原始数据按一定规则分组后统计各组段内观测值个数的系统化方法,其核心价值在于将大量无序数据转化为结构化信息,使数据的集中趋势、离散程度和分布形态一目了然,是后续一切统计分析的基础准备工作。频数某一组段内包含的观测值个数,反映该组段数据出现的频繁程度,所有组段次数之和等于总观测值个数nƒ频率各组段次数与总观测值个数的比值,以百分数或小数表示,反映各组段在总体中所占比例,所有频率之和等于1P=100%累计分布从最小或最大组段开始逐组累加的次数或频率,用于回答"某值以下或以上有多少个观测值"的问题Σ编制目的发现数据分布规律与异常值、判断正态分布、为加权统计量与次数分布图的绘制提供数据基础四项核心PROCEDURE·编制流程连续型资料次数分布表的编制步骤连续型定量资料编制次数分布表遵循求极差→确定组数→确定组距→确定组限→归组→统计次数六步流程,其中组数和组距的合理选择直接影响分布表的科学性和信息保留程度,是编制过程中最需要经验判断的关键环节。STEP01求极差找出最大值(Max)与最小值(Min),极差R=Max−Min,反映数据变异的总范围R=Max−MinSTEP02确定组数参考斯特基斯公式k=1+3.322·lg(n),或按经验法则取值k组STEP03确定组距极差除以组数后向上取整为整齐数字,便于后续运算i=R/kSTEP04确定组限第一组下限略低于最小值,各组上限=下限+组距,采用上组限不含惯例组段边界STEP05逐一归组按大小将每个观测值归入相应组段,可采用划记法或电子表格排序筛选划记法STEP06统计次数数出各组段内观测值个数填入表中,验证各组次数之和等于总数nΣf=nMETHOD组数确定的经验法则与公式组数的确定需要平衡信息保留度与规律可见性,过多则噪音大,过少则细节丢失。斯特基斯(Sturges)公式公式为k=1+3.322×lg(n),其中n为样本容量、k为建议组数,假设数据近似正态分布,是统计学中最常用的组数参考公式。应用举例:n=50时k≈6.6→取7组;n=100时k≈7.6→取8组;n=200时k≈8.6→取9~10组。k=1+3.322·lg(n)经验分组法参考表n=30~50分5~7组;n=50~100分7~10组;n=100~200分10~15组;n=200~500分15~20组;n>500分20~30组。农业试验常见样本30~200,通常8~15组,可先按公式计算再上下浮动1~2组。8~15组组距确定原则组距=极差÷组数,结果向上取整为便于运算的整数或0.5的倍数,如3.7取4,2.3取2.5或3。确定后需反向验证:组距×组数应略大于极差,确保所有数据均纳入分组范围。极差÷组数资料整理·次数分布表组限确定方法与归组规则组限的确定遵循"首组下限略低于最小值且取整、等距递增"原则,归组采用"左闭右开"惯例(含下限不含上限),确保每个观测值恰好归入一个组段,这是保证次数分布表科学性和数据完整性的基本规范。01首组下限确定略低于最小值,取整数或0.5倍数,如最小值72.5则首组下限取7002各组组限递推各组下限=前组下限+组距,逐组递增,最高组上限须≥数据最大值03"左闭右开"归组惯例含下限不含上限,如[70,75)含70.0~74.9,等于75归入[75,80)04组中值计算代表值=(下限+上限)÷2,如[70,75)组中值72.5,用于加权均值与标准差05特殊情况处理存在自然断点或整数边界(年龄、生育天数)时,可适当调整组限与生物学意义对齐生物统计·第二章资料的整理次数分布表示例:140行水稻小区产量140行水稻小区产量数据经分组整理后呈现典型的近似正态分布特征,产量主要集中在38~50g/行区间(占总数的74.3%),组段41~44g为分布峰值(25行,占17.9%),两端频数渐少,说明该品种产量性状表现稳定且变异程度适中。140行水稻小区产量(g/行)次数分布表组段组中值(y)次数(f)频率(%)累计次数累计频率(%)26~2927.521.421.429~3230.542.964.332~3533.585.71410.035~3836.51510.72920.738~4139.52215.75136.441~4442.52517.97654.344~4745.52215.79870.047~5048.51812.911682.950~5351.51510.713193.653~5654.596.4140100.0140行水稻产量数据呈近似正态分布,集中趋势在38~50g区间,峰值出现在41~44g组段。资料整理离散型资料的次数分布表编制离散型定量资料的次数分布表编制策略取决于取值范围的大小:取值较少时直接统计,取值范围较大时需合并分组。取值较少时单项分组01取值种类不超过15~20个时,以每个具体取值为独立组段,如有效分蘖数1~8各为一组,不做任何合并02直接统计每个取值出现的次数,编制简单次数分布表,信息无损失,适用于分类计数数据适用场景≤20个取值取值较多时合并分组01取值超过20个时,参照连续型数据方法合并分组,如每穗粒数100~350可按组距30分为9~10组02组段边界设在整数间自然间隙(如99.5~129.5),确保每个整数观测值归入唯一组段03组中值仍取整数(如99.5~129.5的组中值为115),便于计算加权统计量边界原则整数间隙分组CHAPTER03次数分布图的绘制用图形直观展现数据的分布形态、集中趋势与离散程度CHAPTER02·资料的整理直方图的绘制方法与解读直方图以相邻矩形展示连续型数据在各组段的次数分布,矩形宽度代表组距、高度代表次数或频率,是最直观展现数据分布形态的统计图形。01坐标轴设定横轴为等距组段,纵轴为次数或频率且须从0起始f≥002矩形绘制规则相邻无间隔,宽=组距、高=次数,面积∝次数S∝f03分布形态判读对称→正态;左偏→低值集中;右偏→高值拖尾Skew04异常值识别孤立低矮矩形提示异常观测,需回溯核查Outlier05组数影响过少丢细节,过多生噪音,需反复调试Bins水稻田间试验测产现场·科研数据采集第二章·资料的整理多边形图与次数分布曲线图多边形图以折线连接各组段顶部中点展示分布轮廓,适合在同一图上叠加比较多个样本;次数分布曲线图则将折线平滑化,在样本容量足够大时逼近总体真实分布,是从样本推断总体的重要视觉桥梁。多边形图(频率多边形)绘制方法:取每个组段的组中值对应的次数坐标点,用直线依次连接各点,两端延伸至相邻的空组段(次数=0处),形成封闭多边形比较优势:可在同一坐标系内叠加多条折线,直观比较不同处理、不同品种或不同年份的数据分布差异,不产生直方图的重叠遮挡问题适用场景:样本容量中等(n=50~200)、分组适中的连续型资料,尤其适用于两组或多组数据的分布形态对比分析次数分布曲线图(平滑曲线)绘制方法:在多边形图基础上用光滑曲线替代折线连接各点,曲线的峰度、偏度和对称性反映数据的分布特征理论意义:当样本容量趋近无穷大且组距趋近于零时,次数分布曲线趋近于概率密度函数曲线(如正态分布的钟形曲线),是统计推断的几何基础实际应用:在农业科研论文和报告中,平滑曲线图常用于展示产量、品质等关键性状的群体分布规律,比直方图更美观且更易于读取趋势CumulativeFrequency·Ogive累计频率分布图(Ogive)累计频率分布图以单调递增的S形曲线展示数据从小到大的累积过程,能够直观回答"某值以下(或以上)有多少观测值"的实用问题,是确定分位数、阈值和达标比例的重要图形工具,在农业质量标准制定中有广泛应用。01绘制方法:横轴为各组段的上限值,纵轴为累计频率(%),从第一组开始逐组累加频率并在对应上界处描点,用光滑曲线或折线连接各点形成S形曲线S-CURVE02分位数读取:从纵轴找到目标百分比(如50%、75%、90%)位置画水平线与曲线交点,再向横轴作垂线即可读出对应分位数值,如中位数、上四分位数等P50·P7503达标比例估算:从横轴找到质量标准阈值位置画垂线与曲线交点,再向纵轴作水平线读出累计频率,用100%减去该值即为达标比例100%−F04多组比较:可在同一图上叠加多条Ogive曲线,直观比较不同品种或处理间的分布位置差异,曲线整体偏左说明数值偏小,偏右说明数值偏大COMPARECHAPTER04质量性状资料的整理分类计数、评分量化与次数分布——非数值型数据的系统整理方法质量性状·资料整理归类计数法与次数分布表质量性状资料的基本整理方法是归类计数法——按性状类别将观测个体分组并统计各类别的个体数目(次数),形成次数分布表。01确定分类标准后逐一观察每个个体,归入相应类别并统计数目,编制次数分布表。02白猪与黑猪杂交子二代按毛色分类统计头数,形成含类别、次数和频率的分布表。03实际频率与孟德尔理论分离比(如3∶1、9∶3∶3∶1)比较,为卡方适合性检验提供数据基础。04分类标准须在观察前统一确定,每个个体只归入一个类别,类别数通常2~8个。F₂猪毛色次数分布类别次数(头)频率白猪560.571黑猪220.224花猪200.204合计981.000不同毛色猪只——归类计数法将个体按毛色归入白猪、黑猪、花猪类别生物统计·资料的整理评分法:质量性状的量化策略评分法通过对质量性状的不同等级赋予数值分数,将定性描述转化为可计算的定量数据,使原本无法进行统计分析的分类信息能够参与平均数计算、方差分析和相关分析,是连接定性观察与定量统计的重要方法桥梁。评分法的原理与应用01对某一质量性状的不同类别或等级,按照其程度差异分别赋予递增或递减的数值分数,使定性描述转化为可运算的定量数据02典型案例:猪肉色评分1~5分;水稻抗病性分级0~9级;果实外观品质评级优良中差对应4、3、2、1分03评分后可按定量资料处理,计算平均得分比较品种间差异,也可做方差分析检验处理效应,或计算与其他性状的相关系数评分标准的制定原则01等级划分应覆盖所有可能的表现型,不留空白也不重叠;各等级间的间距尽量等距,使分数差异能近似反映性状差异的幅度02评分标准需事先以文字和图片详细说明,如抗病性0~9级的典型症状描述,确保不同观察者、不同时间的评分具有一致性和可重复性03评分过程应遵循盲法原则,避免观察者主观偏好影响;多人评分时需进行一致性检验,确保评分结果的客观可靠性数据可视化质量性状的图形展示:条形图与饼图质量性状资料主要采用条形图和饼图进行可视化展示:条形图以独立条形的高度比较各类别的次数或频率,适合类别间的绝对量对比;饼图以扇形面积展示各类别在总体中的占比,适合呈现结构组成。两者互补使用能全面揭示分类数据的分布特征。条形图(柱形图)绘制规则:横轴为各类别名称(非数值轴),纵轴为次数或频率,各类别上方画等宽竖条,高度对应次数,条形之间留有间隔以体现类别的独立性与直方图区别:条形图横轴为分类变量、条形间有间隔;直方图横轴为连续数值变量,矩形紧密相连无间隔扩展形式:复式条形图并排展示多样本次数便于组间比较;堆叠条形图上下堆叠展示总体构成饼图(扇形图)绘制规则:整圆代表全部观测值,各扇形圆心角=360°×该类别频率,面积直观反映在总体中所占比例适用场景:类别数不超过6~8个时效果最佳,常用于展示品种构成、土地利用结构、病害类型占比等注意事项:饼图不能比较不同样本间差异,也不适合展示有序分类数据的等级趋势CHAPTER05数据变换与标准化处理对数变换、平方根变换、反正弦变换与Z-score标准化方法DATATRANSFORMATION常用数据变换方法对数变换、平方根变换和反正弦变换是生物统计中最常用的三种数据变换方法,分别适用于右偏分布数据、泊松分布计数数据和百分比数据,核心目的是满足参数检验前提假设。对数变换lgx或lnx,适用于CV恒定的右偏资料,如昆虫种群密度、土壤微生物数量lgx平方根变换√x,适用于泊松分布计数资料,如杂草株数、每叶虫卵数、视野细胞数√x反正弦变换arcsin√p,适用于二项分布百分数资料,如发病率、发芽率、成活率arcsin√p选择原则根据分布特征和方差-均值关系选择;不满足时可组合变换或改用非参数方法分布驱动报告规范在变换数据上分析,报告时反变换回原始尺度,便于生物学解释与实际应用原始尺度DATAPREPROCESSINGZ-score标准化处理Z-score标准化通过公式Z=(x-x̄)/s将不同量纲的原始数据转化为均值为0、标准差为1的无量纲标准分数,使不同性状、不同单位的指标可以在同一尺度上进行比较和综合分析。FORMULA&PROPERTIES标准化公式与性质01计算公式:Z=(x−x̄)/s,其中x为原始观测值、x̄为样本平均数、s为样本标准差,变换后数据均值=0、标准差=1、方差=102Z值含义:|Z|表示偏离平均数多少个标准差,Z>0表示高于平均数,|Z|>2通常被视为异常值的参考界限03保持分布形态:标准化是线性变换,不改变数据分布形态(偏态仍为偏态),只改变位置和尺度,不能替代对数变换等纠正偏态的方法APPLICATIONS农业科研应用场景多性状综合比较:评价不同品种时需同时考虑产量、品质、抗性等多个量纲不同的指标,标准化后可计算综合得分进行排名异常值检测:将全部观测值标准化后,|Z|>3的个体极可能是异常值或录入错误,可作为数据清洗的自动化筛选标准CHAPTER06统计图表的规范应用图表选择原则、制图规范与学术论文中的图表标准生物统计附试验设计·资料的整理统计图表类型的选择原则统计图表的选择应基于数据类型(连续/离散/分类)和分析目的(分布/比较/占比/关系/趋势)两个维度综合判断,选对图表类型是准确传达数据信息的前提,错用图表不仅无法揭示规律,还可能造成误导。按分析目的选择分布形态直方图、频率多边形、次数分布曲线,回答"数据呈什么分布"类别比较条形图、复式条形图,回答"各类别数量谁多谁少"结构占比饼图、堆叠条形图,回答"各部分占总体多少"按数据特征选择连续型直方图或折线图,横轴为连续数值,展示分布与变化离散型条形图或散点图,横轴为整数取值,展示频繁程度分类型条形图或饼图,展示各类别的数量或比例关系ChapterII·DataPresentation制图规范与常见错误规范的统计图表必须具备完整标题、清晰坐标轴标注(含单位)、合理纵横比和准确图例,常见错误如纵轴截断、3D透视变形等会严重影响数据传达的准确性和专业性。标题规范图标题置于图下方、表标题置于表上方,标题应简洁完整包含"对象+性状+图表类型"三要素,便于读者快速理解图表核心内容。对象+性状+类型坐标轴标注横轴和纵轴必须标明变量名称及单位,刻度间距均匀,标注数字大小适中,确保数据读取准确无误。变量名+单位纵横比例推荐5:7或4:5的黄金比例,避免过度拉伸或压缩造成数据趋势的视觉失真,保持图表的真实性和可读性。5:7黄金比例纵轴截断纵轴不从0开始会夸大数据间差异,除非有特殊说明,否则应从0起始,保证数据比较的客观公正。必须从0起始3D效果图三维透视使前排数据看起来比后排大,学术论文中应一律使用二维平面图表,确保数据呈现的准确性和专业性。拒绝3D效果ACADEMICSTANDARD统计表格的学术规范(三线表)学术论文中的统计表格采用三线表格式(顶线、底线、表头分隔线),去除竖线和多余装饰线,以简洁清爽的版面呈现数据。表格设计需确保信息自足——读者无需翻阅正文即可理解表中所有数据含义,这是科研写作的基本规范。THREE-LINETABLE处理株高(cm)产量(kg/hm²)CK(对照)85.36,842.5处理A92.17,531.2处理B88.77,128.0处理C94.6—注:"—"表示数据缺失,因采集设备故障未能获取。三线表仅保留顶线、表头分隔线与底线。结构要求01仅保留顶线、表头分隔线和底线三条横线,取消所有竖线和行间横线,保持版面清爽简洁02列标题应包含变量名称和计量单位,多层表头用括号分层标注,避免使用模糊缩写03同列数据小数位数必须统一,数字以小数点对齐,缺失值用"—"标注并在注释中说明使用注意事项信息自足原则表格标题、表头和注释应包含足够信息,使读者不依赖正文即可完全理解表格内容,所有缩写和特殊标注需在注释中解释。SELF-CONTAINED表格与图形互补表格适合精确展示数值,图形适合直观展示趋势和分布,同一数据一般不同时用表和图展示,选择更能突出信息重点的形式。TABLEvsCHARTChapter07数据整理实践与案例从原始数据到分析结论——综合运用本章方法解决实际农业问题DATAORGANIZATION案例一:小麦千粒重数据的整理流程以100个小麦小区千粒重数据为例,完整演示从原始数据到次数分布表的全流程:极差R=20g、组数k=8、组距i=3g、首组下限30g,编制出的次数分布表显示千粒重主要集中在39~48g区间,呈近似正态分布,验证了本章方法的实用性。100个小麦小区千粒重(g)次数分布表组段(g)组中值次数(f)频率(%)累计频率(%)30~3331.533.03.033~3634.577.010.036~3937.51414.024.039~4240.52222.046.042~4543.52424.070.045~4846.51616.086.048~5149.51010.096.051~5452.544.0100.0千粒重呈近似正态分布,峰值在39~45g区间,占总体的46%,两端频数递减。CASESTUDY·生物统计附试验设计案例二:玉米种植密度试验数据整理玉米种植密度试验数据的整理需要按处理分组统计各农艺指标的平均值与标准差,并以三线表和折线图综合展示密度梯度对产量、株高、穗位高等性状的系统影响,从而揭示密度-产量的响应规律,为确定最优种植密度提供数据支撑。TABLE01不同种植密度下玉米主要农艺性状比较(3次重复平均)密度(万株/hm²)株高(cm)穗位高(cm)每穗粒数(粒)千粒重(g)产量(kg/hm²)4.5245.3102.5586342.57856.26.0252.8108.3548335.88945.67.5261.5115.2495321.29523.89.0268.7121.8438305.69187.410.5275.2128.5385288.38234.1密度7.5万株/hm²时产量最高(9523.8kg/hm²),密度过高(>9.0万)导致每穗粒数和千粒重显著下降。OPTIMAL7.5万株/hm²CASESTUDY·资料整理案例三:水稻品种稻瘟病抗性分级统计30个水稻品种的稻瘟病抗性鉴定数据按0~9级标准分级整理,次数分布显示中感(5级)品种最多(12个,40%),高抗品种仅3个(10%),整体抗性水平偏向中等偏感,提示该批品种的抗性改良仍需加强,为后续育种方案提供了明确的筛选方向。METHOD调查方法对30个品种在稻瘟病高发区自然诱发鉴定,按0~9级标准评定叶瘟抗性等级。RESULT归类计数高抗3个(10%)、中抗8个(26.7%)、中感12个(40%)、感病5个、严重感病2个。VISUAL图形展示以抗性等级为横轴、品种数为纵轴绘制条形图,直观显示集中趋势。NEXT后续分析建议按来源地分组统计,或用抗性评分与产量做相关分析,探究权衡关系。FINDING高抗品种仅3个品种达到高抗水平(0~1级),占总数10%,抗性改良空间较大。INSIGHT抗性改良方向整体偏中等偏感,需加强抗性基因导入与品种改良,明确筛选方向。水稻稻瘟病田间病害症状实拍DISTRIBUTIONOVERVIEW12个品种·中感(5级)·40%8个品种·中抗(3级)·26.7%3个品种·高抗(0~1级)·10%7个品种·感病及以上

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论