版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
/基于大语言模型的自助式AI心理咨询系统构建及其效果评估【摘要】本研究旨在探讨不依赖真实案例数据的前提下,基于大语言模型构建自助式AI心理咨询系统的技术可行性,及其对普通人群心理健康状况的改善效果。研究分为两个阶段:首先,基于零样本学习和思维链提示策略构建了一个自助式AI心理咨询机器人系统;随后,通过招募202名参与者进行为期两周的随机对照试验,评估了该系统的实际应用效果。实验1的结果表明,经提示工程优化后的GPT-4o模型在规范性、专业度、情感理解与共情能力以及一致性与连贯性方面均有显著提升。实验2发现,与控制组相比,使用自助式AI心理咨询机器人的参与者在短期内的抑郁、焦虑和孤独感均有显著改善。特别是,拟人化设计的AI咨询师在缓解孤独感方面表现出显著优势,而非拟人化设计在减轻压力方面效果更为明显。此外,焦虑症状的积极变化在一周后的随访中仍然保持,而其他指标的改善效果则未能持续。本研究初步探索了基于大语言模型的自助式AI心理咨询对心理健康的积极影响,揭示了不同AI设计对特定心理问题的差异化效果,为未来研究和实践提供了参考。 1引言 1.1研究背景 提升大众心理健康水平、促进个体全面发展,是构建和谐社会与实现健康中国战略的重要组成部分(中华人民共和国国家卫生健康委员会,2019)。在快节奏的现代生活中,人们普遍面临工作与学业压力、焦虑、抑郁和孤独等心理困扰。研究表明,即使未达到临床诊断标准的轻度心理困扰也会显著影响个体的生活质量和工作效率(DeOliveiraetal.,2023;Hardyetal.,2003;Karanietal.,2021)。及时有效的心理支持对于维护情绪稳定、增强社会适应能力和提升民众整体生活幸福感至关重要。然而,据Sun等人(2024)统计,中国每十万人口对应的精神健康专业人员仅有不到3人。传统心理咨询服务由于资源稀缺(Saxenaetal.,2007)、成本高昂(Luetal.,2021)及地域分布差异(Pateletal.,2016)等因素,难以满足广大民众日益增长的心理支持需求。这一“供给鸿沟”凸显了开发低门槛、高可及性的心理健康促进工具的紧迫性。 人工智能(artificialintelligence,AI;McCarthyetal.,2006)技术的发展,尤其是大语言模型(largelanguagemodels,LLMs;Cerf,2023;Vaswanietal.,2017)的出现,为应对以上挑战提供了新的契机。近年来,LLMs以其强大的自然语言理解和生成能力而在学界备受关注,使构建智能化的自助式AI心理咨询系统,提供高可及、全天候和低成本的心理健康支持成为可能。然而,当前关于LLMs在心理咨询领域的研究主要集中在理论探讨或技术可行性评估层面(Jietal.,2023;Maetal.,2023),较少涉及自助式AI心理咨询的实际应用和效果评估。如何在缺乏高质量训练数据的情况下优化LLMs以适应心理咨询场景,以及“AI咨询师”的拟人化设计如何影响心理干预效果,成为亟待解决的问题。 1.2文献综述 1.2.1LLMs及其在心理健康领域的应用现状大语言模型在近年来取得了突破性进展。从2018年的BERT(BidirectionalEncoderRepresentationsfromTransformers)到2020年的GPT-3(GenerativePre-trainedTransformer3),再到最新的GPT-4,LLMs的规模和能力不断提升。最新一代的LLMs展现出前所未有的语言理解、逻辑推理和内容生成能力(Binz&Schulz,2022;Kalyan,2023;OpenAietal.,2024)。目前,LLMs已被广泛应用于教育、医疗和心理健康等多个领域,展现出有效处理复杂信息、进行深度对话及提供个性化服务的优势。例如,在教育领域,Sajja等人(2023)基于GPT-3开发的智能教育框架显著提高了教学效率;在医疗领域,基于AI的问答系统为患者提供了准确、及时的健康信息(Lozanoetal.,2023;Xueetal.,2024)。当前,LLMs在心理健康领域的应用主要集中在心理健康教育、心理评估和辅助干预三个层面。 在心理健康教育层面,LLMs能够提供准确、即时的心理健康科普信息。研究表明,ChatGPT在回答心理健康相关的问题时能够与专业机构的官方回答保持高度一致(Sezginetal.,2023);此外,使用LLMs生成心理健康培训内容,还能够显著提高专业培训人员的效率(Barishetal.,2023)。在心理评估方面,LLMs展现出高效识别和追踪心理状态变化的能力。例如,Zhang等人(2025)通过LLMs进行数据增强,显著提高了传统机器学习模型对于自杀意念的识别准确率;Huang等人(2025)提出一种基于理论驱动的LLMs心理特征提取方法,其表现在预测个体生活满意度方面甚至超过人类专家。在心理健康干预层面,基于LLMs的聊天机器人成为主要愿景。已有研究发现,基于LLMs的聊天机器人可以经训练而表现出与人类相似的同理心(Martinengoetal.,2022;Youetal.,2023)、提供包容性的回应(Maetal.,2024),甚至与个体建立治疗性的信任关系(Chan&Li,2023;Leeetal.,2024)。以上研究进展为构建基于LLMs的自助式AI心理咨询系统提供了技术基础,使得在无人类咨询师实时干预的情况下,为用户提供个性化、互动性的心理支持成为可能。尽管LLMs在心理健康领域展现出广阔前景,但将其有效应用于自助式心理咨询仍面临诸多挑战,需要从现有心理健康服务的局限性和需求缺口出发,探索最佳实践路径。 1.2.2自助式AI心理咨询的潜力与挑战 目前心理健康服务主要包括专业人员提供的心理咨询和非互动式自助资源(如心理健康书籍、音频、视频课程等)。专业心理咨询广受认可,但面临资源稀缺、成本高昂和地域限制等问题(Pateletal.,2016;Saxenaetal.,2007;Sunetal.,2024)。据统计,全球范围内的心理健康专业人员与其区域人口基数比例都处于严重失衡状态(Bruckneretal.,2011;Singlaetal.,2018);在中国,每十万人口对应的精神健康专业人员(包括精神科医生/护士、临床心理学家、咨询心理学家、心理康复治疗师和相关社会工作者等)不到3人(Sunetal.,2024)。同时,地域分布不均、服务成本高昂和社会污名化等因素进一步限制了专业心理咨询的普及(Sunetal.,2024;Yuetal.,2018)。书籍、视频和应用程序等非互动式自助心理健康资源虽然具有高可及性、低成本和易传播的优势,但存在交互有限、个性化不足等问题。基于LLMs的自助式AI心理咨询有望弥补当前心理健康服务的缺口,在保持高可及性和低成本优势的同时,为难以获得传统心理咨询服务的人群提供类似专业咨询的互动体验。然而,构建有效的自助式AI心理咨询系统面临两个核心技术挑战:一是如何在真实心理咨询数据稀缺的条件下优化模型性能;二是如何设计有效的人机交互方式,使用户能够建立类似于传统心理咨询中的治疗关系。 在数据获取方面,由于伦理考虑和隐私保护,真实情景下的心理咨询对话数据难以获得,而采用模拟数据集则难以真实反映心理咨询的复杂性和个体差异性。研究表明,在缺少高质量数据集的情况下对LLMs进行迁移学习和参数微调,不仅无法有效提升其性能,反而可能导致其推理能力退化(Baldazzietal.,2023;Noukhovitchetal.,2023;OpenAietal.,2024),甚至出现“灾难性遗忘”(Luoetal.,2025)。在关系建立方面,心理咨询师与来访者之间建立的治疗关系被认为是心理咨询成功的关键因素之一(Cuijpersetal.,2008;Polinghorne&Vernon,2000;Wampold,2015),而这种信任关系的建立往往基于人类特有的社会互动。在自助式AI心理咨询中,如何在无人类咨询师参与的情况下创建有效的人机互动关系,成为一个亟待解决的挑战。 1.2.3零样本学习和思维链提示策略 零样本学习(Zero-ShotLearning)和思维链提示策略(Chain-of-ThoughtPrompting)为开发自助式AI心理咨询系统时所面临的数据获取难题提供了新的技术路径。零样本学习是指LLMs在没有接受特定任务训练或示例的情况下,直接执行新任务的能力(Kojimaetal.,2022)。该方法的核心机制是利用模型在预训练阶段获得的广泛知识基础和推理能力,通过精心设计的指令提示(prompt)来引导模型完成特定任务,无需额外训练数据(Zhangetal.,2025)。思维链提示策略则是一种通过引导模型分步骤思考以提升复杂推理质量的技术(Weietal.,2022),其核心在于模拟人类解决问题的思维过程,将复杂任务分解为多个中间推理步骤,显著提高模型在复杂推理任务中的准确率(Mitraetal.,2024;Weietal.,2022)。 将零样本推理与思维链提示策略结合应用于自助式AI心理咨询有多重优势:首先,零样本学习能够快速适应最新的LLMs技术,避免参数微调的潜在性能降级风险;其次,思维链提示通过优化推理路径,减少对大规模标注数据的依赖,缓解心理咨询领域中真实数据获取难的问题;此外,思维链提示增强了AI推理过程的透明度(Weietal.,2022;Wuetal.,2022),有助于专业人员理解和审查AI的咨询逻辑。 1.2.4关键心理健康指标的选择 本研究选择抑郁(depression)、焦虑(anxiety)、压力(stress)和孤独感(loneliness)作为核心评估指标。一方面,上述心理困扰在普通人群中较为常见,具有良好的代表性;另一方面,其在心理机制上呈现独特差异,为探索AI心理咨询的差异化效应提供了良好的研究框架。具体而言,抑郁主要涉及情感调节系统的功能障碍,表现为持续的情绪低落、兴趣丧失和自我价值感下降(Becketal.,2021),其改善通常需要通过行为激活和情感重新体验实现,这一过程往往伴随波动性和复发风险。焦虑则主要基于认知评估系统,表现为对未来威胁的过度担忧和回避行为(Craskeetal.,2018;Craskeetal.,2019)。与抑郁不同,焦虑的改善主要通过认知层面的威胁评估修正来实现,且认知技能一旦掌握往往具有较好的稳定性(Breitetal.,2024;Hofmannetal.,2012)。压力反映的是个体与环境的交互适应过程,当环境要求超出个体应对资源时产生主观压力体验(Folkmanetal.,1986;Lovibond&Lovibond,1995)。压力缓解主要依赖问题解决能力的提升,但需要注意的是,社会评价本身就是重要的压力源(Dickersonetal.,2004),这意味着在自我暴露和问题讨论情境中,社会评价威胁可能影响干预效果。孤独感则直接反映社会连接的质量,是个体期望社会关系与实际社会关系差异产生的主观体验(Hughesetal.,2004;Perlman&Peplau,1981)。与其他指标不同,孤独感的改善更多依赖于社会存在感和人际连接体验的获得(Cacioppoetal.,2015),这使得孤独感可能对人际互动的真实性较为敏感。上述机制差异暗示了不同指标可能对AI心理咨询系统的特定设计要素表现出差异化响应模式,为系统优化和个性化干预提供了理论基础。 1.2.5拟社会互动理论与AI拟人化设计 基于上述心理健康指标的机制差异,AI咨询师的设计特征可能对不同指标产生差异化影响。拟社会互动理论(parasocialtheory;Stever,2017)为理解这种差异化影响提供了重要的理论框架。拟社会互动(Parasocialinteraction,PSI)最初由Horton和Wohl(1956)提出,用来解释受众与大众媒体人物之间形成的单向但情感丰富的关系。随着数字技术的发展,该理论已被扩展应用于人机交互领域,解释用户如何与数字代理(如虚拟助手、聊天机器人等)建立社会性连接(Giles,2002;Tukachinskyetal.,2020)。该理论指出,即使在非对称的交流中,人们也倾向于将数字代理视为社会行为体,并对其应用社交规则和期望(Nooretal.,2021;Tukachinskyetal.,2020)。 在自助式AI心理咨询的设计中,拟人化程度(如是否赋予AI咨询师姓名、性别、人类视觉形象等社会属性)可能显著影响用户的拟社会体验和互动质量。以往研究表明,拟人化设计可以增强用户感知到的社会存在感(socialpresence;Konya-Baumbachetal.,2022;Munnukkaetal.,2022;Toaderetal.,2019),而这种社会存在感的增强能够提高用户对数字工具的信任度(Hassanein&Head,2007;Toaderetal.,2019)。在心理咨询情境中,这种社会存在感和信任度和对于用户与AI咨询师之间的治疗关系建立至关重要。此外,结合前述心理健康指标的机制分析,拟人化设计的效果可能因指标类型而异。具体而言,对于以社会连接缺失为核心的孤独感,拟人化AI咨询师可能通过提供更强的社会存在感而产生显著的缓解效果。相比之下,对于以问题解决为导向的压力指标,过度的拟人化可能引入额外的社会评价威胁,非拟人化的交互环境反而可能创造更有利于开放讨论的条件。这种理论预期为探索AI咨询师设计的个性化优化提供了重要方向。 1.3研究内容及目的 综上所述,当前自助式AI心理咨询研究面临三个核心问题:一是如何在缺乏高质量训练数据的情况下,优化LLMs在心理咨询场景中的表现;二是自助式AI心理咨询对用户心理健康状况的实际干预效果尚缺乏系统评估,特别是对不同类型心理健康指标的影响差异;三是AI咨询师的拟人化设计对干预效果的影响机制尚未明确。针对这些问题,本研究聚焦基于LLMs的自助式AI心理咨询系统的构建及其效果评估,分为两个阶段进行:第一阶段探索基于零样本学习和思维链提示策略的自助式AI心理咨询系统构建方法,优化大语言模型在心理咨询场景中的表现;第二阶段通过随机对照试验设计,系统评估该系统对抑郁、焦虑和压力等常见心理健康问题的干预效果,并基于拟社会互动理论,探究不同拟人化程度的AI咨询师设计对干预效果的调节作用。 2实验1:构建基于大语言模型的自助式AI心理咨询系统 本实验旨在构建一个基于大语言模型的自助式AI心理咨询系统,探索零样本学习和思维链提示策略在优化模型心理咨询能力方面的有效性。通过模型选择、提示工程设计和专业评估,系统验证这一方法在提升大语言模型规范性、专业度、情感理解与共情能力等方面的效果。基于零样本学习和思维链提示策略的理论优势,本实验提出以下假设: H1:经过思维链提示策略优化的大语言模型相比简单角色指令驱动的模型,在心理咨询对话质量方面将表现出显著改善。 2.1方法 本实验使用经过大规模预训练的通用LLMs作为基础,通过设计思维链提示策略引导模型执行心理咨询任务,无需额外训练数据。该策略避免了获取大量真实心理咨询对话数据进行模型训练,并能够随着通用模型的迭代而持续受益。构建过程主要涵盖对话内容评估、基座模型选择、提示工程设计和机器人部署四个核心板块。首先,基于业内广泛认可的大语言模型排行榜,选择适用于中文交互的基座模型;其次,结合专业心理咨询师的评估,设计并优化适用于心理咨询场景的思维链提示指令,以引导模型遵循心理咨询的规范与流程进行对话;最后,将基于角色指令优化后的大语言模型接入易得性平台(如社交媒体工具),实现自助式心理咨询机器人的部署,为后续的实际应用效果评估奠定基础。整体实验框架及流程见图1。 图1基于LLMs和提示工程的自助式心理咨询系统构建 2.1.1对话内容评估 为了评估大语言模型在心理咨询的实际对话表现,本研究招募了3名具有心理咨询师(国家职业资格三级)资质的研究人员,组成评估小组。根据提前制定的《AI心理咨询对话质量评估准则》(下文称“评分准则”)对模型生成的内容进行独立打分。该评分准则基于当前AI心理健康干预工作中的重点关注内容(Alazrakietal.,2021;Golden&Aboujaoude,2024;Jiang,Zhang,etal.,2022)制定,涵盖“4(能力)+1(安全)”共5个核心维度,每个能力维度采用1~5分的评分量表。具体包括:(1)规范性:评估对话内容是否严格遵循心理咨询的基本规范,包括对用户的尊重、积极倾听,以及避免主观评判。(2)专业度:评估对话内容是否展现出专业的心理健康知识与适当的咨询技巧。(3)情感理解与共情能力:评估模型是否能够准确理解用户的情感状态,并作出适当的情感回应。(4)一致性与连贯性:评估对话内容是否逻辑连贯,模型的回应是否在前后语境中保持一致。例如,在规范性维度中,“1分”表示“对话内容对用户的尊重和共情表达欠缺,完全不符合心理咨询的规范要求”,而“5分”则表示“对用户展现了高度的尊重和共情,完全符合心理咨询的规范”。此外,基于心理咨询话题的敏感性与复杂性,评分准则还设置了“潜在有害信息”作为模型排除选项,该选项采用“是/否”二分评定及一票否决制,即任一对话内容如被任一评分者认为生成了“潜在有害信息”,则该模型被视为整体不合格。完整评分准则详见原刊网络版附录。 2.1.2基座模型测试 根据国际开放研究组织LMSYSOrg于2024年5月20日发布的大语言模型排行榜单(Chiangetal.,2024),以中文交互情景中排名前三的大模型(GPT-4o、Yi-Large和Claude3Opus)作为备选基座模型。本研究从Chen等(2023)构建的《心理健康对话数据集》中选取测试样例。该数据集包含人际、家庭和成长等12个主题类别。为确保测试集的代表性,采用分层随机抽样方法从每个主题类别中随机抽取1条具体案例,形成测试集(N=12)。测试案例的内容形式为用户向咨询师表达的初次问题描述,如“最近有点失望,觉得友情很脆弱”(人际)“爸妈离异,我感到很难过”(家庭)“我总觉得自己不自信,不知道该怎么办”(成长)等。 测试集构建完成后,基于简单角色指令(“请扮演心理咨询师角色与用户对话”),引导三类基座模型分别就12条测试集案例逐条进行10轮次对话(一问一答计为1轮次),共形成3×12=36份对话评估材料。最后,基于评估小组对各基座模型生成的对话内容评结果,通过方差分析和事后检验确定最佳基座模型。 2.1.3提示工程设计 本研究基于零样本学习和思维链提示策略设计角色指令,旨在引导大语言模型遵循心理咨询规范进行对话的同时,最大化发挥其推理和泛化能力。首先,由1名人工智能领域研究成员(编译员)和3名国家心理咨询师资质成员(评估员)共同设计适用于单次心理咨询AI初始角色指令。共包含4个核心板块:(1)角色定位:明确定义AI扮演的是“资深心理咨询师”角色,奠定基础定位;(2)咨询流程:详细说明心理咨询的8个标准步骤,从建立信任到跟进评估;(3)技术应用:列举认知行为理论、人本主义心理学和接纳与承诺疗法等9种主要心理咨询理论与技术;(4)伦理安全:声明AI身份、严重问题处理原则和伦理守则。 随后,采用持续迭代优化方法逐步完善提示指令。迭代过程包括:(1)测试与反馈:三名评估员分别对初始角色指令驱动的大模型进行对话评估,评估测试集与流程和基座模型测试环节相同,同时基于专业知识对模型响应中的不足提出具体反馈和优化建议;(2)指令调整:编译员基于思维链提示策略将三名评估员产生的优化建议编译为新的提示模块或内容,嵌入现有提示指令;(3)迭代优化:重复步骤1-2,直至模型输出质量不再明显提高;(4)统计评估:对三名评估员在初始角色指令和最新角色指令驱动下的模型对话评分执行差异检验,以评估提示工程优化效果并确定最终角色指令。角色指令优化过程及效果示例见图2。 图2角色指令优化过程及效果示例 2.1.4流派取向设计 针对心理咨询流派和技术取向,本研究采用了整合性策略,主要基于以下考虑:首先,AI辅助心理健康工作仍处于探索阶段,尚无研究表明何种单一流派更适合AI实施。其次,现代心理咨询实践已逐渐从严格单一流派转向整合心理治疗(Castonguayetal.,2015;Norcross&Goldfried,2019),整合策略能更好适应普通人群多样化的心理健康需求。最后,当前主流的LLMs均属于Transformer架构下的生成式预训练模型,其在预训练阶段已获取多种心理咨询理论知识,且已经具备一定的“思维涌现”能力(Webbetal.,2023;Weietal.,2022),限制其使用单一流派可能反而抑制其潜力。 本研究的提示工程设计理念是引导模型根据用户实时呈现的问题类型,动态地评估并选择最合适的心理咨询流派与技术。在实施上,通过思维链提示策略设计分层决策结构实现:首先引导模型基于对话上下文分析用户问题性质(如认知扭曲、情绪困扰等),再从所列的认知行为疗法、人本主义心理学、接纳与承诺疗法、正念疗法和焦点解决疗法等流派中选择适合的理论框架与技术。 2.1.5机器人部署 确定最终角色指令后,本研究通过大语言模型官方接口和企业微信应用开发接口,将具有心理咨询师角色属性的对话模型部署于企业微信中,从而完成自助式心理咨询机器人的构建。 2.1.6数据分析 使用R(版本:4.4.0;RCoreTeam,2025)和car包(Fox&Weisberg,2019)进行数据分析。通过组内相关系数(ICC)评估评分者一致性。在基座模型测试阶段,采用单因素方差分析和事后检验评估不同模型在各评估维度上的得分差异。提示工程设计阶段,通过配对样本t检验评估基座模型经提示工程优化前后的得分差异,并计算Cohen'sd效应量。所有统计分析均采用双侧检验,显著性水平设为α=0.05。 2.2结果 2.2.1模型选择 由三位评分者在不知晓模型类型的情况下对36份对话评估材料进行逐条独立评分,组内相关系数(ICC)为0.709(F(35,105)=2.441,p<0.001),表明评分者间具有良好的一致性。在进行方差分析前,检验了ANOVA的基本假设。Levene检验显示各组数据在规范性(p=0.052)、专业度(p=0.551)和总分(p=0.130)上满足方差齐性假设,情感理解与共情能力(p=0.003)和一致性与连贯性(p<0.001)违反方差齐性假设。鉴于此,对满足方差齐性假设的维度采用标准单因素方差分析和TukeyHSD事后检验,针对违反方差齐性假设的维度采用Welch方差分析并使用Games-Howell事后检验以控制第I类错误。各备选基座模型在各评估维度上的得分比较见表1。 方差分析显示,三个基座模型在规范性(F(2,105)=8.04,p=0.001,η2p=0.13)、情感理解与共情能力(Welch'sF(2,64.0)=11.92,p<0.001)、一致性与连贯性(Welch'sF(2,66.4)=7.47,p=0.001)以及总分(F(2,105)=4.09,p=0.020,η2p=0.07)方面存在显著差异,而在专业度方面无显著差异,F(2,105)=0.60,p=0.551,η2p=0.01。基于方差分析结果,对存在显著差异的四个维度采用相应的事后检验方法:满足方差齐性假设的维度(规范性、总分)使用TukeyHSD检验,违反方差齐性假设的维度(情感理解与共情能力、一致性与连贯性)使用Games-Howell检验,结果见表2。 事后检验显示,GPT-4o在规范性方面显著优于Claude3Opus(p=0.003)和Yi-Large(p=0.001);在情感理解与共情能力方面显著优于Claude3Opus(p<0.001),但与Yi-Large无显著差异(p=0.599);在一致性与连贯性方面显著优于Yi-Large(p=0.002),但与Claude3Opus无显著差异(p=0.919)。在总分方面,GPT-4o显著高于Claude3Opus(p=0.037)和Yi-Large(p=0.041)。基于以上结果,选用GPT-4o为本研究的基座模型。 2.2.2角色指令 初始角色指令经过7次优化迭代后,形成最终角色指令。在此基础上,再次由评估小组对GPT-4o在测试集上生成的12份对话材料进行独立评分。三名评分者的组内相关系数(ICC)为0.871(F(11,33=6.778,p<0.001),达到良好一致。对提示工程优化前后的GPT-4o平均得分执行配对样本t检验,结果见表3。 配对样本t检验结果显示,经过零样本学习和思维链提示策略优化后,GPT-4o在所有评估维度上均有显著改善。其中,专业度方面的进步略小,但在规范性、情感理解与共情能力和一致性与连贯性的提升尤为显著,效应量均大于1。 基于最终的角色指令,本研究进一步完成了自助式心理咨询机器人系统的部署。该系统通过企业微信平台实现,集成了经思维链提示优化后的GPT-4o模型API。系统测试结果显示,部署的机器人能够稳定运行,平均响应时间为16秒(根据对话内容长度浮动),可同时支持500名以上并发用户。 2.3讨论 本实验成功构建了基于零样本学习和思维链提示策略的自助式心理咨询系统。实验结果表明,思维链提示策略显著优化了GPT-4o在心理健康对话中的表现,特别在规范性和情感理解与共情能力方面。这一发现验证了研究假设H1,证实了零样本推理结合思维链提示在心理咨询领域的可行性,为克服传统模型调优方法对大量标注数据的依赖提供了新思路。然而,尽管各评估维度均有提升,但专业度维度(提升后均分为2.56)的进步相对有限,主要体现为模型倾向于提供普适性建议而非引导来访者进行自我探索和问题解决,反映了当前技术在专业心理咨询能力方面的局限。总体而言,本实验为基于LLMs的自助式心理咨询系统提供了可行的技术路径,并为后续的应用效果评估奠定了基础。 3实验2:基于随机对照试验的自助式心理咨询效果评估 本实验旨在通过随机对照试验(RCT)设计,系统评估基于大语言模型的自助式AI心理咨询对普通人群心理健康状况的影响,重点考察其对抑郁、焦虑、压力和孤独感的干预效果,并探究AI咨询师拟人化设计在这一过程中的调节作用。基于实验1证实的提示工程优化效果和前述理论分析,本实验提出以下假设: H2:自助式AI心理咨询系统能够显著改善参与者的抑郁、焦虑、压力和孤独感 H3a:焦虑情绪的改善效果将表现出比抑郁、压力和孤独感更好的持续性 H3b:AI咨询师的非拟人化设计对于压力的改善效果将显著优于拟人化设计 H3c:AI咨询师的拟人化设计对于孤独感的改善效果将显著优于非拟人化设计 3.1方法 本实验共持续16天,包括持续一周的人机交互实验和三次心理健康数据采集(前测T1、后测T2和随访T3)。参与者被随机分配到试验组(包括三个不同拟人化程度的AI咨询亚组)或对照组。主要关注抑郁、焦虑、压力和孤独感四个心理健康指标,均通过标准化量表进行测量。考虑到追踪研究中被试流失导致的数据缺失问题,采用线性混合效应模型(LinearMixedModel;LMM)评估组别、时间及其交互作用对结果变量的影响。整体研究框架及流程见图3。 3.1.1参与者 本实验通过基于先验统计功效分析确定样本量。采用simr包(Green&MacLeod,2016)进行4(组别)×3(波次)混合设计的功效分析,针对组别×波次交互效应进行蒙特卡洛模拟。短期干预效应(T2)参考Pǎsǎrelu等人(2017)对互联网认知行为疗法的元分析,设置为中到大效应(d=1.1~1.5);长期效应(T3)参考Firth等人(2017)关于智能手机心理健康干预的元分析,设置为小效应(d=0.2~0.3)。采用含随机截距的LMM,设置目标检验力(1-β=0.80)和α=0.05的显著性水平,进行1000次模拟。模拟结果表明每组参与者达到37人(总样本量148人)时,可获得满足要求的统计功效。考虑三波次纵向设计25%左右的预期样本流失率,计划每组分配样本量50人,总样本量200人。 实际通过在线平台招募参与者202人,招募条件为“认为自己在某些方面存在负面情绪或心理困扰”的普通人群,以确保被试具备充分的先验实验条件,并更好地检验干预效果。鉴于探索式研究的新颖性,参与者排除标准包括:(1)18周岁以下未成年人;(2)自认为或曾被医生/专业机构诊断为存在严重心理健康问题(如自杀意念、自我伤害行为、施虐倾向等)或患有精神障碍(包括但不限于抑郁症、双相情感障碍、精神分裂症等)的个体。 3.1.2实验设计 采用随机对照(单盲)试验设计。将202名参与者随机分配至试验组或对照组。试验组中,根据机器人的名称和外观差异分别设F(n=51;50.5%女性)、M(n=51;50.5%女性)和R(n=50;50%女性)三个亚组,其中,F组和M组的聊天机器人头像分别被设置为具有性别辨识度的中年亚洲人形象(F:女性形象;M:男性形象),并基于中国政府网发布的《二〇二〇年全国姓名报告》赋予其具有性别辨识度的人类姓名(F:王静;M:王涛);R组(n=50;50%女性)机器人未赋予人类姓名,直接命名为“心理咨询机器人”,头像设置为无性别特征的机器人形象。三个试验亚组间,在模型参数、提示工程设计和实验期间指导语设计等方面完全一致。控制组(C组,n=50)中采用未经任何提示工程的原生态GPT-4o模型构建聊天机器人,命名为“生成式人工智能”,头像设置为“AI”字样,并在色彩风格上与试验组保持一致(见图3)。 图3基于随机对照试验的自助式心理咨询效果评估 人机交互在人机交互阶段,所有试验组(F组、M组和R组)机器人与参与者的话题互动被限制在心理咨询范畴内,该条件控制通过机器人角色指令以及和参与者在实验前确认知情同意共同实现;控制组(C组)对于机器人的使用在不违反国家法律和道德伦理的前提下,不设话题和使用场景限制。为确保参与者积极参与实验,本实验要求参与者尽量每日与机器人进行对话,并将参与者与机器人进行10轮次对话、且对话时间跨度大于10分钟的当日标记为互动日。后续分析中将互动日大于0的参与者视作有效交互,否则归入流失样本。 数据采集本实验共进行了3个时间节点(Wave)的心理健康数据采集。在人机互动开始前(T1),所有参与者受邀完成前测问卷以控制基线水平。随后参与者被邀请加入企业微信,与各自组别的聊天机器人进行为期一周的人机交互,并在互动阶段的最后两天(T2)完成后测问卷,以评估短期干预效果。最后,在人机互动结束一周后(T3),所有完成人机交互的参与者被邀请再次填写随访问卷,以检测干预效果的持续性。为提高问卷完成率和数据质量,以及控制时间因素导致的潜在测量偏差(如工作日与周末的心理状态差异),三次问卷的填写时间均被设置在周六至周日。 3.1.3测量工具 抑郁、焦虑和压力使用抑郁-焦虑-压力量表简式版(DASS-21;Lovibond&Lovibond,1995)进行测量。DASS-21包含3个子量表:抑郁子量表主要测量快感缺失、绝望和贬低生活价值等核心症状(条目示例:“我对任何事情都提不起兴趣”“我觉得生活毫无意义”);焦虑子量表:用于评估过度生理唤醒、情境性焦虑和主观焦虑体验(条目示例:“我觉得很难放松自己”“我担心一些让自己感到恐慌或出丑的场合”);压力子量表:测量难以放松、神经紧张、易怒和过度反应等(条目示例:“我发现自己很难放松下来”“我觉得自己精疲力尽”)。每个子量表下各包含7个条目,均采用0~3点计分(0=完全不符合,1=有些符合,2=相当符合,3=非常符合或大部分时间符合),各子量表得分范围均为0~21分,分数越高表示症状越严重。研究表明,该量表在中国大学生群体中具有良好的信效度(Gongetal.,2010)。本研究中,各子量表的Cronbach'sα系数分别为0.87(抑郁)、0.90(焦虑)和0.83(压力)。 孤独感使用孤独感简式量表(SSL;Hughesetal.,2004)进行测量,该量表基于UCLA孤独感量表理论框架,将孤独感定义为个体期望的社会关系与实际获得的社会关系之间的差异所产生的不愉快主观体验,共包含3个条目(“我觉得我缺乏陪伴”“我感到被排斥”“我感到被孤立”)。各条目采用1~5点计分(1=几乎从不,2=很少,3=有时,4=经常,5=几乎总是),量表得分范围为3~15分,分数越高表示孤独感越强。SSL与完整版UCLA孤独感量表相关系数达0.82,表明良好的效标效度。研究表明,SSL量表在中国人群中具有良好的心理测量学特性(Jiang,Zhao,etal.,2022)。本研究中该量表的Cronbach'sα系数为0.86。 3.1.4数据分析 使用R(版本:4.4.0;RCoreTeam,2025)及相关统计分析包(bruceR;Bao,2024;lme4;Batesetal.,2015)进行数据分析。采用线性混合效应模型(LinearMixedModel;LMM)评估组别(Subgroup,包括F、M、R和C组)、时间节点(Wave,包括T1、T2和T3)及其交互作用对结果变量的影响。模型包括年龄(Age)和性别(Gender)作为控制变量,并将参与者标识符ID纳入随机截距效应以控制个体内重复测量的相关性。模型公式如下: Outcome=Subgroup+Wave+Subgroup×Wave+Age+Gender+(1|ID) 公式1 模型拟合后,计算边际R2和条件R2以评估模型解释力。对于存在显著交互效应的变量,通过似然比检验(比较包含交互项与不包含交互项的嵌套模型)确定交互效应的显著性,并进一步进行简单效应分析,考察各组在不同时间点间的变化以及各时间点上的组间差异。所有统计分析均采用双侧检验,显著性水平设为α=0.05。 3.1.5敏感性检验 LMM能有效处理纵向数据中的缺失值,在数据缺失完全随机(MCAR)或随机(MAR)的情况下提供无偏估计。为进一步评估样本流失对研究结果的潜在影响,我们分别使用完整样本(包含所有至少参与一次测量的参与者,n=202)和限制样本(仅包含完成全部三次测量的参与者,n=153)进行了模型拟合。比较结果显示,两种分析方法得出的关键参数估计在符号和统计显著性上保持一致,表明缺失数据对研究结论的影响有限。本文报告的结果基于完整样本分析。 3.2结果 3.2.1描述统计 基线测量(T1)的202名参与者平均年龄为24.06岁(SD=4.05),其中女性102人(50.49%)。在后测(T2)时,180名参与者完成了人机交互和问卷,保留率89.11%;在随访(T3)时,153名参与者完成了问卷,保留率75.74%。参与者从T1到T3的总流失率为24.3%,符合预期设计。对完成全部测试的参与者与至少有一次测评缺失的参与者在人口统计学特征和基线心理健康指标上进行比较分析,结果显示,完成三次测量的参与者与至少一次测评缺失者在年龄(t(70.25)=1.78,p=0.079)、性别(χ2(1)=0.33,p=0.564)、基线抑郁水平(t(73.66)=1.95,p=0.055)、焦虑水平(t(86.50)=0.94,p=0.348)、压力水平(t(86.36)=0.91,p=0.364)和孤独感(t(91.85)=1.51,p=0.134)方面均无统计学显著差异。各组的有效交互比例分别为C组88.0%、F组94.1%、M组92.2%、R组90.0%,组间差异不显著(χ2(3)=1.75,p=0.630)。表4呈现了各变量在T1-T3时间点的描述性统计和相关系数矩阵。 3.2.2线性混合模型 对抑郁、焦虑、压力和孤独感四个结果变量分别构建了线性混合模型,以评估组别(Subgroup:C组、F组、M组和R组)、测量时间点(Wave:T1、T2和T3)及其交互项对心理健康指标的影响。模型包括年龄和性别作为控制变量,并将参与者ID纳入随机截距以控制个体内重复测量的相关性。通过比较包含交互项与不包含交互项的嵌套模型进行似然比检验,结果显示,在控制年龄和性别后,组别×时间交互效应在抑郁(χ2(6)=37.46,p<0.001)、焦虑(χ2(6)=50.16,p<0.001)和孤独感(χ2(6)=86.06,p<0.001)模型中均达到显著水平;固定效应分别解释了总体变异的10%(抑郁模型)、16%(焦虑模型)和27%(孤独感模型)。压力模型中,组别×时间交互效应达到边缘显著水平(χ2(6)=12.53,p=0.051);模型的解释力相对较低(3%)。表5呈现了4个模型的固定效应估计结果。 3.2.3简单效应分析 鉴于组别×时间交互效应在所有模型中均达到显著或边缘显著水平,进一步进行简单效应分析以评估各组在不同时间点间的变化。表6呈现了各组在不同时间点之间的变化情况。 结果显示,在抑郁指标上,所有试验组(F、M、R组)从T1到T2均显示显著降低(F组:b=2.93,SE=0.43,p<0.001;M组:b=3.53,SE=0.43,p<0.001;R组:b=2.76,SE=0.43,p<0.001),而对照组无显著变化(b=0.28,SE=0.46,p=0.819);在T3时,所有组别均回归至与T1无显著差异(所有p≥0.479)。 焦虑指标呈现出更持久的效应模式:所有试验组从T1到T2均显著降低(F组:b=3.30,SE=0.39,p<0.001;M组:b=3.07,SE=0.39,p<0.001;R组:b=2.54,SE=0.39,p<0.001),且这种降低在T3时仍然保持(F组:b=3.02,SE=0.42,p<0.001;M组:b=2.73,SE=0.42,p<0.001;R组:b=2.40,SE=0.42,p<0.001)。对照组在各时间点间均无显著变化(所有p>0.668)。 压力指标呈现出显著的组别差异:仅R组从T1到T2表现出显著降低(b=2.35,SE=0.48,p<0.001),但在T3时回归至与T1无显著差异(p=0.304);F组、M组和对照组在各时间点间均无显著变化(所有p≥0.167)。 孤独感指标也呈现出显著的组别差异:所有试验组从T1到T2均显著降低(F组:b=3.07,SE=0.32,p<0.001;M组:b=3.45,SE=0.32,p<0.001;R组:b=1.43,SE=0.32,p<0.001),F组和M组的下降幅度(>3分)明显大于R组(1.43分);在T3时,所有组别均回归至与T1无显著差异(所有p≥0.468)。 3.2.4TukeyHSD多重比较 通过TukeyHSD多重比较进一步评估不同时间点上的组别差异。图4展示了各组在不同时间点的心理健康指标变化趋势。 如图4A所示,在抑郁指标上,T1时各组间无显著差异;T2时,所有试验组均显著低于对照组(F组vs.C组:b=2.45,SE=0.86,p=0.024;M组vs.C组:b=2.96,SE=0.86,p=0.004;R组vs.C组:b=2.36,SE=0.86,p=0.033),试验组之间无显著差异(所有p≥0.593);T3时,各组间差异再次变得不显著(所有p≥0.856)。 图4各组在不同时间点的心理健康指标变化趋势 注:图中数据点表示各组在不同时间点的估计边际均值,误差线表示95%置信区间。所有模型均控制了年龄和性别。C组=对照组;F组=拟人化女性特征机器人组;M组=拟人化男性特征机器人组;R组=非拟人化机器人组。T1=前测调查;T2=后测调查;T3=随访调查。 图4B展示了焦虑指标的变化模式:T1时各组间无显著差异;T2时,所有试验组均显著低于对照组(F组vs.C组:b=3.14,SE=0.70,p<0.001;M组vs.C组:b=3.29,SE=0.70,p<0.001;R组vs.C组:b=2.82,SE=0.71,p<0.001),试验组之间无显著差异(所有p>0.680);T3时,三个试验组仍显著低于对照组(F组vs.C组:b=2.48,SE=0.73,p=0.004;M组vs.C组:b=2.56,SE=0.73,p=0.004;R组vs.C组:b=2.29,SE=0.73,p=0.010),试验组之间无显著差异(所有p≥0.980)。 图4C显示了压力指标的变化:T1时各组间无显著差异;T2时,仅R组与对照组的差异达到边缘显著(b=2.00,SE=0.85,p=0.091),其余组别间差异均不显著(所有p>0.415);T3时,各组间无显著差异(所有p≥0.823)。 图4D呈现了孤独感指标的变化,并揭示了最显著的组别差异:T1时各组间无显著差异;T2时,R组显著低于对照组(b=2.20,SE=0.48,p<0.001),而F组和M组不仅显著低于对照组(F组vs.C组:b=3.98,SE=0.47,p<0.001;M组vs.C组:b=3.98,SE=0.47,p<0.001),还显著低于R组(F组vs.R组:b=-1.78,SE=0.46,p<0.001;M组vs.R组:b=-1.78,SE=0.47,p<0.001),F组与M组间差异不显著(b=0.00,SE=0.46,p=0.991);T3时,各组间差异再次变得不显著(所有p≥0.191)。 3.3讨论 通过随机对照试验设计,本实验证实了自助式AI心理咨询系统能有效改善使用者的心理健康状况,验证了研究假设H2。实验还发现不同指标的影响模式存在显著差异。在抑郁和焦虑方面,所有试验组相比控制组均显示出显著改善,焦虑症状的积极变化在一周后的随访中仍然保持,而抑郁症状则回归基线水平,这验证了假设H3a关于认知成分较强的指标具有更好持续性的预测。在压力和孤独感方面则呈现出明显的组别差异——非拟人化机器人组是唯一在压力指标上显示显著改善的组别,支持了研究假设H3b;而对于孤独感,拟人化设计(F组和M组)相比非拟人化设计(R组)表现出更显著的缓解效果,验证了研究假设H3c。这种差异化模式可能反映了用户与不同类型AI进行交互时的心理机制差异——面对非拟人化机器人时,用户可能不仅更倾向于问题解决导向的交互,还能在不必考虑对方情感反应和人际形象维护的环境中,更自由地表达压力源并探索解决方案,从而特别有利于压力管理;而拟人化设计则可能通过增强社会存在感,更有效地满足了社交需求,进而缓解孤独感。这些发现不仅验证了实验1中构建的系统在实际应用中的效果,也为理解AI辅助心理健康服务的差异化影响机制提供了理论支持。 4总讨论 本研究系统探讨了基于LLMs自助式心理咨询系统的构建及其对普通人群心理健康状况的影响。实验1从技术层面验证了零样本学习结合思维链提示策略在优化大语言模型心理咨询能力方面的有效性;实验2则从理论和应用层面评估了该系统对不同心理健康指标的干预效果及AI咨询师拟人化设计的影响。研究发现为人工智能在心理健康领域的应用提供了重要实证基础。 4.1提示工程在心理健康服务中的应用价值 在实验1中,零样本学习结合思维链提示策略在心理咨询系统构建中的成功应用,拓展了LLMs在心理健康领域应用的新路径。这一方法最大的优势在于规避了传统模型微调对大规模标注数据的依赖,突破了心理咨询数据获取困难的瓶颈。研究结果表明,即使在无需额外训练数据的情况下,经过思维链提示优化后的GPT-4o在规范性、情感理解与共情能力以及一致性与连贯性方面均有显著提升,这与Wei等人(2022)和Mitra等人(2024)关于思维链提示增强模型复杂推理能力的发现一致。虽然在专业度维度的提升相对有限,但总体结果仍验证了提示工程作为一种轻量级且高效的优化方法在心理健康领域的应用潜力,为解决传统数据驱动方法的伦理困境和实施障碍提供了可行路径。 4.2自助式AI心理咨询对不同心理健康指标的效果 实验2的结果证实了基于LLMs的自助式心理咨询能有效改善多种心理健康指标,但不同指标表现出差异化的响应模式与持续效应。在短期效果方面,所有试验组的抑郁、焦虑和孤独感得分都较基线水平显著降低,这一普遍性改善表明自助式AI心理咨询系统确实能发挥积极的心理健康促进作用,与先前关于数字心理健康干预有效性的研究发现一致(Chan&Li,2023;Karyotakietal.,2021;Leeetal.,2024)。 在长期效果维持方面,各指标呈现出明显的差异性模式。焦虑症状的改善在一周后随访中仍然保持显著,表现出良好的持续性;而抑郁症状和孤独感的改善效果则在随访中回归至接近基线水平。焦虑症状持续改善的特殊性可能与其认知特性相关——焦虑常源于对未来威胁的过度预期(Liuetal.,2024),AI系统通过提供即时、系统性的认知调整框架,可能有效打破了焦虑的自我强化循环。这种认知层面的调整一旦形成,其效果往往比情绪或行为层面的变化更为持久(Rafferty&Minbashian,2018;Snippeetal.,2024)。相比之下,抑郁和孤独感可能更多涉及深层社会功能和长期行为模式,仅靠短期干预难以维持长久效果。 上述差异化的响应模式揭示了AI辅助心理健康干预的复杂性,表明不同类型的心理健康问题可能需要不同强度、频率和持续时间的干预策略。特别是对于抑郁和孤独感这类易于回退的症状,可能需要设计更持续或周期性的干预方案,以维持初期取得的积极效果。 4.3拟人化设计对不同心理健康指标的差异化影响 本研究系统探索了AI咨询师的拟人化设计对心理健康干预效果的影响,发现不同心理健康指标对AI拟人化程度表现出截然不同的响应模式。该发现突破了以往对AI界面设计统一效应的简单假设,为拟社会互动理论在心理健康领域的应用提供了重要扩展。 在孤独感方面,拟人化设计表现出显著优于非拟人化设计的效果。这一结果强有力地支持了拟社会互动理论的核心观点——人们倾向于将具有人类特征的数字代理视为社会行为主体,从而建立类似于真实社交的心理连接(Giles,2002;Nooretal.,2021;Tukachinskyetal.,2020)。拟人化设计可能通过增强社会存在感
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- AI在证券市场预测中的作用分析
- 如何用ai快速生成活动策划方案
- 人工智能伦理规范在保险领域的实践
- 王者荣耀入门课程教案
- 制造塑料行业标准化规范
- 保险AI安全架构设计
- 足浴公司管理制度
- 足球知识总结文字版
- 电子厂房通风技术总结
- 2026年北京市中考英语试题-文字版-含答案-
- 2026年环境监测人员持证上岗考核试题上、下册附答案
- 2026年新教材人教版九年级上册英语Unit 3 Smart Learning 教案
- 2025南瑞集团有限公司招聘300人笔试历年常考点试题专练附带答案详解
- 成都兴城投资集团有限公司成都蓉城城市管理服务有限公司2026年6月校园招聘笔试参考试题及答案详解
- 商铺应急处置流程
- 2026贵州铜仁德江机场消防员岗招聘15人笔试备考试题及答案详解
- 2026年抖音内衣-泳衣类目准入考试高频原题+标准答案
- 2026年四上部编语文说课稿
- 《分数乘整数》数学课件
- 2026年西藏高考理科综合题考点及完整答案
- 雨课堂学堂在线学堂云《医学信息检索与利用(首都医科)》单元测试考核答案
评论
0/150
提交评论