心理基础及其测量 6_第1页
心理基础及其测量 6_第2页
心理基础及其测量 6_第3页
心理基础及其测量 6_第4页
心理基础及其测量 6_第5页
已阅读5页,还剩162页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

心理测量第十五章人工智能时代心理测量新范式Psychometrics李英武董妍中国人民大学心理学系第十五章学习导航第一节人工智能与心理测量大型语言模型、生成式人工智能、Transformer与智能测评工具。第二节自然语言处理与心理测量自然语言形式、语言赋值、语境维度与构念映射。第三节风险和伦理考量AI模型测评、评估框架、伦理原则与法律监管。综合任务在效度、公平、隐私与人类监督约束下设计AI辅助测评。范式变化内容提要AI与大型语言模型正在改变心理测量工具的开发、施测、评分和解释方式。数据拓展自然语言为情绪、认知风格与人格特质提供更丰富、更具语境的信息。治理要求有效应用必须同时处理隐私、安全、透明度、公平性和责任问题。理解学习目标(一)说明大型语言模型、生成式人工智能与Transformer的核心概念。识别识别文本、口语和对话系统中的心理测量信息。解释解释词嵌入和语境信息如何支持心理属性赋值。分析学习目标(二)分析功能词、语言元特征与心理构念之间的映射逻辑。评价从可解释性、透明度和泛化能力评价AI模型。治理运用伦理原则与法律框架审视AI心理测量方案。人工智能大型语言模型自然语言处理伦理与公平性关键词本章关注的不是“模型会不会说话”,而是语言输出能否形成可靠、有效和负责任的测量证据。【章节导读】小花狮智能作文评分系统识别从图像到可分析文本系统先通过文字识别把手写作文转化为数字文本,原稿给出的识别率超过95%。处理文本依次经过分词、清洗和特征提取。建模相似度计算与词向量训练把语言特征转换为评分信息。智能作文处理链文字识别把手写内容转为机器可读文本→文本预处理分词、清洗与规范化→特征建模提取语言特征并训练词向量→评分反馈形成评分线索与教学建议人工评分与智能辅助评分比较维度人工评分智能辅助评分速度受评分者数量与时间限制可快速处理大量文本信息利用能理解复杂语境与写作意图可稳定提取大量显性和隐性特征一致性可能受疲劳和主观标准影响同一版本下规则较稳定风险评分者偏差训练偏差、黑箱与用途漂移理想模式专业判断经验证的技术辅助与人工复核效度案例思考系统评分对应的是写作质量、语言风格,还是训练数据中的表面模式?公平不同地区、语言背景和书写习惯的学生是否获得同等准确的评价?责任当评分影响升学或教学分流时,谁负责复核、解释和纠错?第一节人工智能与心理测量过去心理测量正在发生什么变化自然语言处理多面向单一任务,依赖专门标注和特定模型。现在基础模型和大型语言模型可在统一架构中处理多类语言任务。测量转向研究重点由“描述语言”拓展为“理解语言背后的人及其情境”。任务专用模型与基础模型维度任务专用模型基础模型/大型语言模型训练目标解决明确、单一任务从大规模语料学习通用表征迁移方式换任务常需重新训练可提示、微调或迁移到多类任务优势边界清楚、便于针对性优化扩展性强,可利用上下文测量风险适用范围窄机制复杂、版本变化与偏差难追踪通过深度学习从海量语言数据中学习统计规律与语境表征,并执行生成、理解和转换任务的模型大型语言模型模型规模和任务表现不能自动保证心理测量效度。架构大型语言模型的技术基础现代大型语言模型通常以Transformer为核心架构。规模模型包含大量可学习参数,并通过大规模训练获得通用语言能力。机制多头注意力帮助模型同时关注序列中的不同关系和语境线索。大型语言模型的典型功能功能输入输出或用途文本生成主题、提示或前文续写、摘要、改写和题目草案语言翻译一种语言文本另一种语言的语义对应文本问答系统问题与背景材料基于上下文组织回答文本分析开放回答、访谈或日志分类、编码、表征或分数线索作用语言基准测试用统一任务集比较模型在理解、推理和问答等方面的表现。GLUE包含9类自然语言理解任务。SuperGLUE包含8类更具挑战性的任务,用于检验更复杂的推理能力。GLUE与SuperGLUE覆盖的能力任务类型示例能力文本判断情感、语法可接受性、释义与语义相似度语义消歧根据上下文判断词语含义推理因果、常识和自然语言推断理解与问答阅读理解和基于材料回答问题现象基准饱和之后原稿指出,许多通用语言基准逐渐接近饱和,基础模型供给快速增长。问题“基准高分”不等于“能准确测量某个心理构念”。下一步需要转向构念效度、群体公平、生态效度和真实场景影响的验证。语言层从“语言建模”到“人的建模”词义、句法、主题、情感与语篇结构。个体层情绪状态、人格倾向、认知风格与心理需求。关键约束由语言推断个体属性必须有理论定义、标准效标和不确定性说明。从语言样本到测量分数自然表达开放回答、日志或对话→模型表征把语言转换为向量特征→构念映射用标注或效标连接心理属性→验证解释检验信效度、公平与适用边界面向心理语言分析的工具生态原稿示例用途PythonDLATK从语言中提取词汇、主题与社会心理特征Rtext-package在统计分析流程中处理和建模文本共同要求预训练语言表征记录版本、参数、预处理和效标定义嵌入嵌入与降维将词、句或文本映射为连续数值向量,保留语义与上下文关系。降维压缩高维表征,降低小样本模型的参数负担。原稿示例经预训练表征与降维后,较小样本也可能获得较强预测表现。优势小样本不等于低风险预训练模型可以把外部语料中学到的表示迁移到心理研究。风险样本过小会放大偶然性、过拟合与群体代表性问题。报告需要交叉验证、外部验证、置信区间和失败案例分析。机会多语言与跨文化测量多语言模型可在多种语言中形成共享表征,支持跨文化研究。难点词义、礼貌规则、情绪表达和群体基线并不完全等价。要求分别检验语言版本的构念一致性、误差结构和公平性。能够从训练数据的规律中生成新文本、图像或其他内容的人工智能系统生成式人工智能在心理测量中可辅助项目、情境和反馈生成,但生成内容必须经过专业审查。生成器生成对抗网络:GAN尝试生成与真实数据相似的新样本。判别器区分真实样本与生成样本。对抗训练两者相互竞争并逐步提高生成质量。编码变分自编码器:VAE把输入压缩为潜在空间中的概率表示。采样从潜在分布中取样,形成可变化的内部表示。解码把潜在表示重建或生成新的数据样本。序列建模Transformer与生成模型根据已有上下文预测后续内容。代表GPT类模型利用Transformer生成连贯文本。测量用途可生成项目草案、模拟回答和反馈文本,但不能绕过专家验证。三类生成模型比较模型核心机制心理测量中的可能用途主要风险GAN生成器与判别器对抗合成样本、数据增强训练不稳定、合成偏差VAE概率潜在空间与重建潜在结构探索、样本生成生成细节与解释有限Transformer注意力与序列预测题目、对话、文本编码与反馈幻觉、黑箱与版本漂移一种以注意力机制为核心、能够并行建模序列中远距离关系的神经网络架构TransformerVaswani等于2017年提出,已成为现代大型语言模型的重要基础。Transformer与传统序列模型维度RNN/CNNTransformer序列处理RNN依次处理;CNN依赖局部窗口可并行处理序列远距离关系长依赖可能衰减或需多层传播注意力可直接连接远距离词语计算并行度受限或局部性较强训练时并行效率较高测量意义常需手工设计较多特征可获得语境化语言表示并行视角多头注意力不同注意力头可关注语法、指代、主题或情绪等不同关系。加权每个位置根据上下文相关程度分配不同权重。整合多个头的结果合并,形成更丰富的语境表示。输入编码器接收词元及其位置信息。处理通过自注意力与前馈网络形成上下文表示。用途特别适合理解、分类、编码和特征提取。输入解码器结合已有输出和上下文信息。处理逐步预测后续词元并维持文本连贯。用途特别适合文本生成、对话和开放反馈。Transformer的信息加工词元输入文本被切分并编码→注意力计算估计词元之间的关联→语境表征整合位置与多头信息→任务输出分类、预测、生成或赋值心理测量中的语言数据来源数据来源可观察信息潜在用途开放式回答内容、结构、措辞与论证构念评分、反应质量分析日记与自述情绪主题和时间变化动态状态监测社交媒体自然互动与表达习惯群体趋势与风险线索求职材料或访谈能力证据、职业兴趣与沟通方式人事评估辅助学习文本困难表述、动机与反思个性化教学支持真实性开放回答的测量价值被试不必把体验压缩为预设选项。丰富性内容、结构和语境共同提供信息。代价评分规则更复杂,模型误差与解释难度更高。信号日记与社交文本负面情绪词、主题变化、语法与语义关系可能与心理状态相关。优势可观察自然情境中的连续变化。限制平台行为不等于临床表现,相关性不能直接解释为诊断。关键词计数与语境分析维度关键词计数语境化模型关注词出现的频率词义、顺序、否定、指代和上下文优势直观、可复现、易解释能够区分同词不同义和复杂表达局限忽略语序与语境机制复杂、解释和复现成本高适用明确词典和简单特征语义依赖强的复杂构念模型可以风险信号不是诊断识别需要关注的语言模式,并帮助专业人员安排进一步评估。模型不能仅凭一段文字确定疾病、人格或干预方案。安全边界高风险结论必须由合格专业人员结合访谈、量表和情境证据确认。数据人力资源场景求职信、开放回答与访谈文本。用途辅助分析职业兴趣、沟通特点和与岗位相关的行为证据。风险代理变量可能放大性别、地域、教育和语言风格偏差。数据教育场景作文、作业反馈、自我总结与讨论发言。用途发现学习困难、动机变化和需要支持的线索。原则反馈应服务教学支持,避免依据情绪措辞对学生贴标签。黑箱挑战:可解释性复杂模型很难直观说明内部运算和决策路径。专业需要临床、教育和选拔都要求结果可核查、可沟通。应对提供特征贡献、反例、置信度、失败案例和人工复核。表达差异挑战:文化与语言适配相同心理状态在不同文化中可能使用不同的词语和叙述方式。训练偏差主流语言或群体在训练数据中通常更充分。检验需要本地常模、跨群体效度与测量等价证据。核心智能心理测评工具NLP与Transformer从文本中提取心理信息,并支持动态交互。输出风险提示、结构化摘要、分数线索或个性化建议。定位工具应作为专业判断的辅助,而非独立诊断主体。输入成人心理护航系统:原稿案例职场社交平台表达及与咨询师的私信对话。分析模型关注疲惫、沮丧、自我怀疑及其上下文。转介系统把分析报告交给心理咨询师,由专业人员联系并制定支持方案。初步线索如何负责任地理解案例职业倦怠、人际压力和自信受挫只是待核实假设。不应自动化人格判断、心理诊断和干预决策不应由文本模型单独完成。必须补充知情同意、危机评估、专业访谈、多源证据和纠错渠道。交互对话式测评系统根据被试回答动态调整后续问题。信息同时分析内容、情绪变化和逻辑连贯性。优势比固定问卷更贴近自然交流,并可深入追问。起点职业发展智能测评询问工作满意度、职业目标与自我评价。追问若被试表达对新技术的兴趣,可继续了解知识与实践经验。输出为培训、岗位调整或发展路径提供参考,而非替代组织决策。信号学习支持智能测评作业反馈中反复出现“太难”“没有思路”等表述。综合结合其他学科、学习习惯和过程信息理解困难来源。支持向教师提示进度、辅导资源和教学方法的调整方向。智能测评工具开发链界定构念明确要测什么、不能推断什么→治理数据同意、隐私、代表性与去噪→训练验证性能、效度、公平与泛化→部署监督人工复核、监测与持续纠错准确性数据质量噪声、转录错误和异常文本会直接影响模型输出。代表性训练样本需要覆盖真实使用人群和情境。标签质量专家评分标准和一致性决定构念映射的上限。敏感性数据安全心理语言数据可能暴露健康、关系、职业和身份信息。保护应去标识化、控制访问、加密存储并限制保留时间。用途未经新授权,不应把测评数据转作监控、营销或其他决策。结果层模型解释说明输出的含义、置信度和适用边界。证据层指出哪些信息支持结论,以及有哪些反证或缺失信息。行动层给出人工复核、申诉和再次评估路径。技术第一节小结大型语言模型与Transformer扩大了可处理的心理语言数据范围。测量从文本到心理属性,需要构念映射、效度验证和不确定性管理。实践智能工具的价值取决于数据治理、人类监督和专业责任。第二节自然语言处理与心理测量人类在生活、学习、工作和社交中自然形成并使用的交流语言自然语言它包括口语和书面语,能够表达事实、思想、情感与观点,并随社会文化持续演变。口语与书面语形式主要特征附加信息测量挑战口语即时、灵活语调、语速、停顿转录误差与场景噪声书面语较规范、可保存标点、结构、修改痕迹媒介与写作能力影响内容自然语言的表达范围可以表达日常事实,也可以讨论抽象观念和复杂体验。创造性说话者可自由组合词汇与句子,形成新的概念和故事。开放性新词与新用法不断出现,模型和词典需要持续更新。来源语言是一扇心理窗口心理治疗自述、问卷开放回答和日常交流。信息情绪、认知风格、人格特质和心理健康线索。价值比固定选项更贴近个体自然表达,但标准化难度更高。自然语言的三种测量形式形式典型数据主要特征文本分析帖子、博客、邮件、评论内容稳定,可反复编码口语分析访谈、咨询、面试包含声音和流畅性信息对话系统人机多轮交流可动态追问并实时适应数据文本分析社交媒体帖子、博客、电子邮件和在线评论。特征词汇频率、语义关系、语法结构、主题和情感倾向。用途描述情绪变化、认知风格、人格与心理健康相关模式。文本分析流程采集明确同意、用途与样本边界→预处理清洗、分词、去标识化→特征建模词典、嵌入或语言模型→心理解释与量表、访谈或行为效标验证目标情感分析识别文本中积极、消极或中性的情感倾向。纵向价值连续文本可帮助观察个体情绪表达的变化。局限反讽、引用、否定和文化表达会导致误判。发现心理健康文本研究某些词汇频率、语义关系和语法结构与抑郁症状存在关联。用途为早期筛查和监测提供新线索。边界关联模式不能替代临床诊断,也不能脱离知情同意使用。场景口语分析心理治疗、面试和心理咨询。声学信息语速、语调、停顿和声音稳定性。内容信息词汇选择、主题偏好和话语连贯性。口语特征与可能线索特征可能提供的信息解释限制语速激活水平、紧张或思维流畅性受语言习惯与任务难度影响语调情绪唤醒、自信或犹豫受文化、性别与生理状态影响停顿认知负荷、犹豫或情绪波动也可能来自措辞或记忆搜索连贯性叙事组织与思维过程需要结合主题和交流情境错误推断不要把单一声学特征标签化“说得快”等于自信,“停顿多”等于焦虑。正确做法结合个体基线、任务、语言背景和多项证据进行解释。验证分别检查不同设备、场所和群体中的可靠性。模拟交流对话系统通过提问、倾听和回应收集心理信息。动态适应根据回答改变问题顺序、深度和措辞。专业支持把结构化线索提供给咨询师或评估人员。澄清动态追问的价值发现模糊回答时请求具体例子。深入围绕高相关主题继续询问频率、强度和影响。安全触发高风险信号时切换到人工支持和标准处置。人机协作的职责边界环节系统可承担专业人员负责提问执行标准问题、记录分支设计访谈框架与风险阈值分析编码文本、提取模式验证构念并解释冲突证据反馈生成结构化草稿审核措辞、沟通不确定性干预提供预约和资源入口诊断、决策与危机处置自然语言与评分量表维度自然语言回答评分量表表达自由、开放、可叙述语境固定项目与有限选项信息内容丰富,个体差异大信息压缩,便于比较标准化编码和评分复杂常模、计分和误差较明确反应偏差受语言能力与表达意愿影响受选项、默许与社会期望影响高度一致信息量的直觉若90%的人选择同一答案,结果容易预测,新增信息相对较少。意见分歧若“是”和“否”各占一半,不确定性更高,可探索的差异更多。测量含义开放回答可能揭示固定选项未覆盖的原因、情境和体验。样本自然语言与PANAS:研究设计100名参与者。开放回答回答“你感觉如何?”。量表回答完成20项目的正负情感量表,采用1至5级评分。两种回答格式的信息差异回答格式多样性指数相对信息量自然语言回答366约为量表回答的4.8倍PANAS评分量表77作为比较基准原稿据自信息度量比较两种格式;结果说明信息更丰富,不等于测量更准确。可以说明如何解释“4.8倍”开放语言在该研究条件下呈现更高的回答多样性和区分度。不能说明自然语言必然比PANAS更可靠、更有效或更适合所有用途。还要检验评分一致性、构念效度、跨群体公平和结果可解释性。目标自然语言赋值问题把语言中蕴含的意义转换为可用于统计分析的数值。难点同一词在不同上下文中含义不同,相似含义也可用不同词表达。关键工具词嵌入和语境化语言模型。把词语或文本映射为连续数值向量,使语义关系能够进入统计模型词嵌入向量相近通常表示使用语境或意义相近,但维度本身未必具有直接心理解释。做法词袋模型统计文本中有哪些词及其出现次数。优势简单、透明,在许多任务中仍具有实用价值。局限忽略词序和上下文,难以理解否定、指代与多义词。做法语境化嵌入根据一个词所在的句子和上下文生成动态表示。优势能编码隐含句法结构和长期依赖关系。测量意义同一词在不同语境中的心理含义可以得到区分。大型语言模型成功的条件条件作用深度神经网络与算法增强复杂模式学习能力专用硬件提高大规模计算效率海量语言数据提供丰富的实际语言使用样本大规模训练方法使模型能够充分吸收数据中的关系任务掩蔽词预测根据前后文预测句子中被遮蔽的词。学习为了完成预测,模型需要掌握语法和词语之间的关联。结果训练形成能够表征上下文语义的内部表示。目标词注意力如何利用上下文模型确定当前需要理解或预测的词。上下文词根据与目标词的相关程度分配权重。语义表示整合远距离依赖与词语交互,形成语境化含义。语境化语言模型的发展示例模型原稿中的定位测量启示BERT2018年公开,广泛应用的双向Transformer编码模型适合文本表征、分类和赋值RoBERTa/XLNet在训练策略或架构上继续扩展模型差异需要独立比较GPT系列强调基于上下文的生成能力可用于对话、生成和开放反馈心理过程为什么语境不能被忽视语言帮助人整理记忆、理解情绪、规划未来并与他人协作。社会作用语言也可能用于争论、操纵或欺骗。生态效度脱离交流者、对象、场景与媒介,会遗漏心理现象的重要部分。核心问题Who:谁说个体的心理与人口学背景会影响语言风格;追踪同一个体的历史表达,有助于理解其稳定差异。测量启示记录并控制语境变量,检验模型能否迁移到新的交流对象、场景与媒介。解释边界语言特征的含义依赖语境,不能脱离上下文作机械推断。核心问题Whom:对谁说面对亲友、专业人员或聊天机器人时,表达意愿、语言风格和信息披露程度可能不同。测量启示记录并控制语境变量,检验模型能否迁移到新的交流对象、场景与媒介。解释边界语言特征的含义依赖语境,不能脱离上下文作机械推断。核心问题Where:在哪里候诊室、公交车或家中等场景会改变心理状态与回答方式;界面是否由人控制也可能影响披露。测量启示记录并控制语境变量,检验模型能否迁移到新的交流对象、场景与媒介。解释边界语言特征的含义依赖语境,不能脱离上下文作机械推断。核心问题How:如何说提示方式、书面或口头媒介,以及面部表情和肢体语言,都可能改变词语的实际含义。测量启示记录并控制语境变量,检验模型能否迁移到新的交流对象、场景与媒介。解释边界语言特征的含义依赖语境,不能脱离上下文作机械推断。语境化语言的4W框架维度核心变量典型影响Who说话者的心理、人口与历史信息稳定语言风格与个体差异Whom交流对象与界面披露程度、表达意愿和印象管理Where物理与社会场景状态、规范和安全感How提示、媒介与非语言行为词义、情绪强度和反应方式场景情感过程建模研究对心理治疗中的情感过程进行语言建模。比较将BERT发言模型与专家诊断评级对照。结果模型与专家平均评级的一致性系数为0.48。积极信号怎样理解一致性系数0.48模型能够捕捉一部分与专家判断相关的语言信息。现实限制一致性并不充分,仍存在大量模型与专家不一致的情况。应用边界适合作为研究和辅助线索,不足以支持独立临床判断。把可观察的语言特征与理论定义的心理属性建立经验联系,并形成可验证的连续分数特征—构念映射相关性只是起点;构念效度要求排除语言能力、场景和群体差异等替代解释。输入从语言提取连续分数自然语言中的词汇、句法、语义和语篇特征。学习目标量表得分、专家评级、行为指标或健康结果。输出关于情绪、人格或心理健康的连续预测分数。特点功能词汇特征代词等高频功能词往往不描述具体对象,却能反映注意焦点与社会关系。价值出现频率稳定、可量化,适合大规模语言分析。限制心理关联多为群体统计规律,不能直接解释个体。原稿关联第一人称单数过往研究发现它与神经质、抑郁和焦虑呈正相关。其他关系与生活满意度呈负相关,并可能体现较强的自我关注。边界“我”字较多并不等于存在心理问题,主题和语境同样重要。原稿关联第一人称复数与群体社会联系、高地位及积极心理变量有关。研究趋势过往研究中与抑郁、焦虑负相关,与生活满意度等正相关。边界团队任务会自然增加“我们”的使用,应控制任务和角色。关注对象具体名词具体名词可反映个体对外界物体和事件的兴趣。心理偏好主题分布能提供关注点和经验世界的线索。解释要求需要区分个人偏好、任务要求与文本主题的影响。定义语言元特征不直接依赖具体主题的整体语言统计特征。原稿示例平均词长和总词数。用途从表达复杂度、输出规模等角度补充语义特征。原稿关联平均词长与认知能力、概念复杂性、教育和社会阶层有关。可能含义较长词汇有时反映更复杂的概念和表达方式。混淆因素文本类型、专业术语、语言结构和教育机会都会影响该指标。含义词数总词数反映语言输出量和表达丰富程度。可能线索可与表达欲望、任务投入和思维活跃度有关。混淆因素时间限制、题目熟悉度、写作能力和设备输入速度。特征到构念的证据链语言特征词汇、元特征与语境→理论假设说明为何关联目标构念→效标学习与量表、专家或行为连接→独立验证新样本、新群体与新场景检验构念映射的主要威胁威胁表现控制方法构念污染模型学到写作能力而非心理属性加入替代变量与增量效度检验群体偏差方言或教育差异被当作心理差异分群体验证与公平性分析语境漂移新平台或任务改变语言模式场景外验证与持续监测标签误差量表或专家评分本身不稳定多评定者、信度与潜变量模型材料PTSD语言预测研究救援者的口述历史访谈语言。结果语言模型对PTSD症状及其横断面和纵向轨迹表现出预测能力。意义数字表型与访谈标记可能支持更早、更个性化的预防护理。机会实时筛查仍需谨慎连续语言数据可能帮助识别风险变化并节约专业时间。风险误报、漏报、监控感和敏感数据泄露可能造成新的伤害。条件必须有明确同意、人工复核、危机流程和可退出机制。数据第二节小结文本、口语和对话扩展了心理测量的反应形式。技术词嵌入、注意力和语境模型把开放语言转化为数值表征。效度特征与构念之间需要理论、效标、泛化和公平证据。第三节风险和伦理考量研究问题AI模型也可以成为测评对象心理量表能否描述语言模型表现出的稳定反应倾向?方法向模型呈现人格或情绪能力测验,并分析回答模式。注意测得的是特定版本和提示条件下的输出特征,不等同于人类心理实体。期待模型人格研究的问题AI会呈现社会期望的理想形象,还是出现不受欢迎的特征?构念研究使用大五人格的开放性、尽责性、外向性、宜人性和神经质。解释结果可用于比较模型行为,但不能据此断言模型具有人的人格。工具模型人格研究设计大五人格问卷BFI,共44个项目。反应每个项目采用5点评分。对象研究比较了六个英语语言模型的回答剖面。大语言模型的人格特质剖面(一)图15-2上排:multilingualDeBERTa、DistilRoBERTa与BART(按原稿图片分排展示)大语言模型的人格特质剖面(二)图15-2中排:XLMRoBERTa、DeBERTa与DistilBART(按原稿图片分排展示)大语言模型的人格特质剖面(三)图15-2下排:三个德语模型的回答剖面(按原稿图片分排展示)共同模式模型人格研究结果六个英语模型的剖面较为相似。总体倾向宜人性和外向性相对较高,神经质相对较低。差异开放性和尽责性存在轻微模型差异。版本依赖不要把剖面拟人化模型更新、系统指令和采样设置都可能改变回答。提示依赖题目顺序、角色设定与语言版本会影响结果。构念问题人类人格量表对模型输出是否具有同样含义,需要单独论证。指标AI模型的情绪理解研究原稿按情商分数把模型分为专家、正常与较差区间。任务比较不同大型语言模型在情绪理解测验中的表现。边界测验得分反映任务表现,不证明模型拥有主观情绪体验。情绪理解分数:原稿所引研究模型分数原稿中的相对表现GPT-4117专家区间,超过89%的人类DaVinci87正常区间,超过18%的人类Alpaca/Vicuna104/105正常区间Koala83较差区间,超过13%的人类Oasst/Dolly/ChatGLM/Claude107/98/94/106均处于正常区间这些数值来自Wang等(2023)所用任务、模型版本和评分规则,不宜推广为模型的一般“情商”。研究结果情绪理解研究的结论边界多数受测模型在该任务中获得了与普通人群相当的分数。不能推断模型具有真实情绪、同理心或承担临床责任的能力。复现要求记录模型版本、提示、采样设置、量表版本和评分程序。用可解释性、方法透明度和泛化能力三类证据,系统评价AI心理测量模型模型评估框架高预测准确率只是框架中的一项证据,不能替代科学与伦理审查。三维模型评估框架维度核心问题主要证据可解释性模型为什么形成这个判断?特征贡献、反例、置信度与解释一致性方法透明度模型和数据如何产生?架构、数据、预处理、算法、训练与版本记录泛化能力换人群、地点或时间还可靠吗?外部验证、分群体误差与漂移监测能够清晰说明模型做出判断或预测所依据的信息及其过程模型可解释性在心理健康等高风险场景中,专业人员和被试都需要理解结果的来源与限制。复杂性黑箱问题深度神经网络内部包含大量参数和非线性运算。临床影响无法说明依据会削弱专业人员的判断、患者信任和纠错能力。目标揭示哪些症状、病史或语言特征对输出产生关键影响。一份合格解释应回答什么问题应提供的信息依据是什么关键输入、主要特征和关联证据把握有多大置信度、误差范围和不确定性来源什么情况会改变结论反例、阈值与缺失信息能否采取行动人工复核、替代评估和申诉路径完整呈现模型架构、数据处理、算法选择和训练过程,使研究能够被审查与复现方法透明度透明度同时服务科学重复性、伦理审查与监管合规。方法透明度清单环节需要记录模型架构结构、层数、节点或模块、连接与关键参数数据来源、样本组成、授权、排除规则和代表性预处理清洗、转换、去标识化与缺失处理算法选择理由、局限、优化目标和超参数训练数据切分、随机种子、版本、硬件与评估程序研究透明度带来的价值其他团队能够审查、验证和改进模型。协作清楚的记录促进跨学科交流和累积性证据。治理为伦理委员会和监管机构评估安全与合规提供依据。模型在不同人群、环境和数据分布下仍能保持可靠性能的能力模型泛化能力心理状态受年龄、性别、文化、遗传与生活经历影响,外部验证不可省略。人群精神心理数据的异质性年龄、性别、文化背景和社会经济条件不同。表现相似问题可能用不同语言、症状组合和求助方式表达。后果单一中心或单一平台训练的模型容易过拟合局部规律。原训练场景城市医院到农村诊所城市大型医院的数据量大、流程规范、患者构成特定。新应用场景农村地区或小型诊所的疾病表现、记录方式和资源不同。检验问题性能是否下降?误差是否集中于某些群体?阈值是否需要重估?泛化验证设计内部验证训练数据内交叉验证→时间外验证在后续时间段测试→地点外验证在新机构或平台测试→群体外验证比较语言与人口群体表现开放模型与封闭模型维度较开放的模型封闭服务型模型示例BERT、RoBERTa、BLOOM原稿以ChatGPT为例复现可记录版本并离线运行架构、训练数据和旧版本可能不可得数据可在受控环境处理调用服务可能需要向托管方传输数据治理重点依赖和代码版本管理版本漂移、数据共享与供应商风险模型可复现性记录准确名称、版本、下载来源或服务日期。配置使用的层、提示、温度、随机种子和其他生成参数。流程预处理、代码、效标、评分和失败重试规则。风险敏感数据与托管模型不能离线运行时,输入可能被传输到外部服务。判断先确认服务条款、数据保留、访问主体和跨境处理。原则若无法证明数据得到充分保护,就不应上传可识别的心理数据。以透明、公平、不伤害、责任和隐私五项原则约束人工智能的全生命周期AI伦理框架Jobin等(2019)审查80多项国际AI伦理指南后归纳出这些共同原则。五项全球AI伦理原则原则核心要求心理测量中的焦点透明度系统与决策可理解解释分数依据、版本和限制正义和公平避免歧视与偏见分群体检验误差和机会不造成伤害预防直接和间接损害防止误诊、标签与不当干预责任明确主体与追责机制人工复核、审计和申诉隐私保护个人数据控制权最小收集、授权与安全处理原则含义透明度原则让相关利益者了解系统如何运作、依据哪些数据和规则形成结论。测评实践公开用途、数据来源、模型版本、主要限制与结果解释依据。检验问题如果被试、专业人员或监管者提出质疑,系统能否提供可理解、可核查的说明?原则含义正义和公平原则避免训练数据与算法偏差使特定群体承担不合理的不利后果。测评实践检查样本代表性,分群体报告误差与公平性指标,并建立纠偏机制。检验问题如果被试、专业人员或监管者提出质疑,系统能否提供可理解、可核查的说明?原则含义不造成伤害原则系统不应对个体的身体、心理、社会关系或环境造成直接或间接损害。测评实践开展风险评估、安全测试和危机处置,限制高风险自动决策。检验问题如果被试、专业人员或监管者提出质疑,系统能否提供可理解、可核查的说明?原则含义责任原则开发者、使用者、数据提供者和监管者都应有清晰的责任边界。测评实践记录决策链、保留审计证据,设置申诉、纠错与事故追责机制。检验问题如果被试、专业人员或监管者提出质疑,系统能否提供可理解、可核查的说明?原则含义隐私原则保护敏感心理数据在收集、存储、传输、分析和反馈全过程的安全。测评实践最小化收集、明确授权、访问控制、加密处理并限制二次使用。检验问题如果被试、专业人员或监管者提出质疑,系统能否提供可理解、可核查的说明?把伦理原则转成控制措施风险预防控制发现与纠正黑箱可解释设计与用户说明解释审计、反例测试偏差代表性采样与公平约束分群体监测、阈值调整伤害限定用途与人工监督危机转介、事故复盘责任不清角色授权与决策记录申诉渠道、责任追踪隐私泄露最小化、加密与访问控制异常检测、通知与补救目的法律与监管框架在技术开发和临床实施中保护安全、健康、基本权利和数据权益。方法通过风险分类、准入、数据治理、审计和责任规则约束系统。说明以下内容按本章原稿梳理,用于教学讨论,不构成法律意见。作用欧盟:CE合规视角原稿强调,临床AI产品进入欧洲市场需要满足相应安全和健康要求。审查覆盖设计、生产、软件质量、硬件安全和用户界面等环节。心理测量启示若工具参与医疗判断,应明确其产品属性、风险等级和验证要求。原则欧盟:风险分级治理按AI系统对健康、安全和基本权利的潜在影响实施差异化监管。高风险关注稳定性、可解释性、偏差防范、数据质量与隐私保护。实施开发者需保留证据,部署者需监测使用环境和异常结果。我国AI治理文件:原稿梳理文件主要关注教学定位生成式人工智能服务管理暂行办法服务提供、训练数据、标注、安全评估与算法备案生成式AI服务治理数据安全法数据处理安全与保密义务数据治理基础法律个人信息保护法个人信息处理的合法、公正、透明与安全个人权益保护基础法律人工智能示范法伦理、开源和知识产权等建议专家团队起草的示范性建议,并非现行正式法律AI生成合成内容标识办法显式、隐式标识与禁止恶意删改生成内容标识治理时间生成式AI服务管理暂行办法2023年7月13日公布,8月15日起施行。原则发展与安全并重、创新与治理结合,实行包容审慎和分类分级监管。要求规范训练数据、标注、安全评估、算法备案、投诉举报和法律责任。核心数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论