版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
本申请实施例提供了一种文本分类方法及并非直接将文本聚类结果作为最终的文本分类2基于多个所述同簇统计数值和第二预设约束条件,确从所述未分组同簇统计数值中确定目标节点的一级若所述一级子节点的同簇统计数值不满足所述第二预若所述一级子节点的同簇统计数值满足所述第二预设基于所述根节点、多个所述叶子节点以及所述根节点与所将所述未分组同簇统计数值中的第一未分组同簇统计数将所述未分组同簇统计数值中的第二未分组同簇统计数值和/或第三未分组同簇统计标同簇统计数值的行序号相同且所述第二未分组同簇统计数值的列序号与所述目标同簇标同簇统计数值的行序号的差值等于所述预设数值且所述第三未分组同簇统计数值的列3若所述行序号和所述列序号相同,则将所述行序号若所述行序号和所述列序号不同,则将所述行序号对应的针对每次所述文本聚类操作,对所述待分类文本集合中的待分类文本进行聚类处理,将所述文本分类子集中各用户提问语句确定为所述标准提问语句的相4文本聚类模块,用于对所述待分类文本集合中的文本分类模块,用于基于所述同簇统计数值,将被安排成存储计算机可执行指令的存储器,所述可执行指令被配置由所述处理器执13.一种计算机可读存储介质,其特征在于,所述存储介质用于存储计算机可执行指56先利用预设聚类方法对n个待分类文本进行初步聚类,再结合初步聚类结果进行精准分类得到最终的文本分类结果,即将n个文本划分到多个子集的过程中主要涉及文本初步聚类7和文本精准分类这两个文本处理阶段,并非直接将文本聚类结果作为最终的文本分类结果是基于多次文本聚类操作的文本聚类子结果得到的,确保了文本聚类统计结果的准确可以为智能客服与用户终端在针对预设咨询大于或等于ROUNDUP表示向上取整,m表示每次文本聚类操作选择的种8文本聚类子结果的准确度,上述文本聚类中心数量m可以通过以下两种方式中任一方式确确定为文本聚类中心数量m,也可以将预设文本类别的个数与预设补偿个数之和确定为文个数确定为文本聚类中心数量m,也可以将目标类别个数与预设补偿个数之和确定为文本[0049]在一些示例实施例中,如果上述文本聚类结果是对n个待分类文本进行一次聚类类文本对所包含的待分类文本在一次文本聚类操作中被划分到同一文本聚类簇,0表示待分类文本对所包含的待分类文本在一次文本聚类操作中未被[0050]在另一些示例实施例中,如果上述文本聚类结果是对n个待分类文本进行多次聚征待分类文本对包含的待分类文本在N次文本聚类操作中被划分到同一文本聚类簇的概9该待分类文本对的同簇统计数值是指在N次文本聚类操作中同时包含待分类文本Ti和待分分类文本对所包含的待分类文本在N次文本聚类操作中被划分到同一文本聚类簇的概率,一步基于待分类文本对的同簇统计数值对n个待[0053]具体的,上述待分类文本对可以是n个待分类文本中两两待分类文本进行组合得得基于文本聚类统计结果更准确地对n个待分类文本进行分类,上述文本聚类统计结果可R21表示待分类文本T1和待分类文本T2在N次文本聚类操作中被划分到同一文本聚类簇的概本T2和待分类文本T3在N次文本聚类操作中被划分到同一文本同簇统计数值能够表征待分类文本对包含的待分类文本在N次文本聚类操作中被划分到同数值与预设阈值的大小关系和两个同簇统计数值对应的待分类文本对是否包含同一待分本聚类结果作为最终的文本分类结果,而是先基于文本聚类结果确定文本聚类统计结果,[0060]在一个具体实施例中,以上述待分类文本集合包括n个用户提问语句且上述文本文本聚类统计结果包括用户提问语句对1的同簇统计数值1至用户提问语句对P的同簇统计[0064]基于上述文本聚类统计结果,将上述n个待分类的用户提问语句划分为多个文本相似提问语句进行扩充的效果,建立了标准提问语句与多个相似提问语句之间的对应关结果4和文本聚类子结果5中均不存在一个文本聚类簇同时包含待分类文本Ti和待分类文R11R12R13……R1n…………R同簇统计数值的行序号相同,且n个同簇统计数值对应的待分类文本对包含同一个待分类个同簇统计数值的列序号相同,且n个同簇统计数值对应的待分类文本对包含同一个待分数值对应的待分类文本对中任一待分类文本的序号等于n且同簇统计数值小于预设阈值、同簇统计数值为已分组同簇统计数值(例如,设置为指定数值或者标记为已分组)中任一簇统计数值R12和R23对应的待分类文本对的共有的待分类文本,这样通过这种共有的待分[0089]其中,考虑到通过树状结构能够更加直观地呈现同簇统计数值之间的层级关系(即行序号或者列序号满足预设关联关系的两个同簇统计数值对应于一对父子节点),因[0090](1)基于上述待分类文本对的同簇统计数值和第二预设约束条件,确定多个统计上述待分类文本对可以是n个待分类文本中两两待分类文本进行组合得到的,两个待分类对应的,上述文本聚类统计结果包括(n(n_1)/2)个待分类文本对分别对应的同簇统计数文本聚类统计结果更准确地对n个待分类文本进行分类,上述文本聚类统计结果可以表示样基于文本聚类统计矩阵能够更加有规律地确定哪些同簇统计数值被划分到同一同簇统两个同簇统计数值对应的待分类文本对是否包含同一待分类文本(即如果行序号或者列序相邻的两个同簇统计数值对应的待分类文本对包含的多个待分类文本属于同一文本类别R23聚类统计结果中各同簇统计数值与预设阈值的大小关系和两个同簇统计数值是否为上述计数值树状分组中各同簇统计数值对应的待分类文本对包含的待分类文本划分到同一个R31[0102]在一个具体实施例中,仍以上述待分类文本集合包括n个用户提问语句且上述文本聚类结果包括N个文本聚类子结果为例,如果上述文本聚类统计结果包括文本聚类统计[0107]基于多个统计数值树状分组中各同簇统计数值,确定n个待分类的用户提问语句[0108]其中,针对上述(1)基于上述待分类文本对的同簇统计数值和第二预设约束条件的,未分组同簇统计数值不包括在先已确定的统计数值树状分组所包含的同簇统计数值除在先已确定的统计数值树状分组包含的同簇统计数值之外的同簇统计数值为未分组同组同簇统计数值包括统计数值树状分组1和统计数值树状分组2[0114]步骤A2,从上述多个未分组同簇统计数值中确定目标节点的至少一个一级子节分组为统计数值树状分组,上述第二预设约束条件可以包括同簇统计数值小于预设阈值、同簇统计数值的行序号或者列序号等于n且同簇统计数值小于预设阈值、同簇统计数值为取多个未分组同簇统计数值中行序号和列序号均为最小值或者最大值的同簇统计数值作[0126]将上述多个未分组同簇统计数值中的第二未分组同簇统计数值和/或第三未分组目标同簇统计数值的行序号相同且第二未分组同簇统计数值的列序号与目标同簇统计数的行序号的差值等于预设数值且第三未分组同簇统计数值的列序号与目标同簇统计数值值可以等于1,即上述第二未分组同簇统计数值为位于目标节点对应的目标同簇统计数值点的列序号相同且行序号差值为1,目标同簇统计数值右侧的相邻同簇统计数值的行序号同簇统计数值右侧的相邻同簇统计数值)和同簇统计数值R21(即位于目标同簇统计数值下包括同簇统计数值R22(即位于目标同簇统计数值右侧的相邻同簇统计数值)和同簇统计数[0130]上述目标聚类统计矩阵为表1中所示的文本聚类统计矩阵,文本聚类统计矩阵中[0131]从上述文本聚类统计矩阵中确定当前的目标节点R11的至少一个一级子节点(即R12和R2112为位于目标同簇统计数值R11右侧的相邻同簇统计数值,R21为位于目标[0132]若目标节点R11的至少一个一级子节点R12和R21均大于预设阈值(即均不满足第二[0133]从上述文本聚类统计矩阵中确定当前的目标节点R12的至少一个一级子节点(即R13和R2213为位于目标同簇统计数值R12右侧的相邻同簇统计数值,R22为位于目标[0134]从上述文本聚类统计矩阵中确定当前的目标节点R21的至少一个一级子节点(即R22和R3122为位于目标同簇统计数值R12右侧的相邻同簇统计数值,R31为位于目标[0135]若目标节点R12的两个一级子节点R13和R22中R13大于预设阈值且R22小于预设阈值22标记为终止节点,即满足第二预设约束条件的一级子节点所在统计数值分支[0136]若目标节点R21的两个一级子节点R22和R31中R31大于预设阈值且R22小于预设阈值22标记为终止节点,即满足第二预设约束条件的一级子节点所在统计数值分支[0137]从上述文本聚类统计矩阵中确定当前的目标节点R13的至少一个一级子节点(即R14和R2314为位于目标同簇统计数值R13右侧的相邻同簇统计数值,R23为位于目标[0138]从上述文本聚类统计矩阵中确定当前的目标节点R31的至少一个一级子节点(即R32和R4132为位于目标同簇统计数值R31右侧的相邻同簇统计数值,R41为位于目标[0139]若目标节点R13的两个一级子节点R14和R23均大于预设阈值(即不满足第二预设约[0140]若目标节点R31的两个一级子节点R32和R41中R32大于预设阈值且R41小于预设阈值41标记为终止节点,即满足第二预设约束条件的一级子节点所在统计数值分支中基于同簇统计数值分组中各同簇统计数值,确定同簇统计数值分组对应的初始分类子类文本对中某一待分类文本或者两个待分类文本均未被划分到任一初始分类子集,那么,此类分类文本可以认为是噪声文本;又考虑到如果分类文本被划分到某一目标分类子集,[0155]在确定出n个待分类的用户提问语句对应的多个文本分类子集之后,针对每个文本分类子集,确定该文本分类子集对应的标准提问语句和该标准提问语句的标准回复语[0156]将上述文本分类子集中各用户提问语句确定为对应的标准提问语句的相似提问文本精准分类这两个文本处理阶段,并非直接将文本聚类结果作为最终的文本分类结果,而是先基于文本聚类结果确定文本聚类统计结果,再基于文本聚类统计结果进行文本分是基于多次文本聚类操作的文本聚类子结果得到的,确保了文本聚类统计结果的准确度,能够进一步提高基于文本聚类统计结果进行文本文本精准分类这两个文本处理阶段,并非直接将文本聚类结果作为最终的文本分类结果,而是先基于文本聚类结果确定文本聚类统计结果,再基于文本聚类统计结果进行文本分是基于多次文本聚类操作的文本聚类子结果得到的,确保了文本聚类统计结果的准确度,能够进一步提高基于文本聚类统计结果进行文一个以上模块(图示未示出),每个模块可以包括对电子设备中的一系列计算机可执行指上有线或无线网络接口804,一个或一个以上输入输出接口805,一个或一个以上键盘806一个或者一个以上处理器执行该一个或者一个以上程序包含用于进行以下计算机可执行本聚类结果作为最终的文本分类结果,而是先基于文本聚类结果确定文本聚类统计结果,子结果,这样由于文本聚类统计结果是基于多次文本聚类操作的文本聚类子结果得到的,[0182]上述对本申请特定实施例进行了描述。其它实施例在所附权利要求书的范围生用于实现在流程图一个流程或多个流程和/或方框图一个方框或多个方框中指定的功能[0183]这些计算机程序指令也可存储在能引导计算机或其他可编程数据处理设备以特令装置的制造品,该指令装置实现在流程图一个流程或多个流程和/或方框图一个方框或备上,使得在计算机或其他可编程设备上执行一系列操作步骤以产生计算机实现的处理,从而在计算机或其他可编程设备上执行的指令提供用于实现在流程图一个流程或多个流据。计算机的存储介质的例子包括,但不限于相变内存(PRAM)、静态随机存取存储器(SRAM)、动态随机存取存储器(D
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 建筑施工行业脚手架立杆安全投入管理总结报告
- 双减工作知识试题及答案大全
- 2026年浙江省部编版初中物理九年级下册第5章电学基础课件
- 小学杠杆知识测试题目与答案
- 一、简单电现象教学设计初中物理九年级全一册北京课改版
- 体育与健康九年级人教版篮球教学设计
- 人教版九年级道德与法治下册 第六课 第2课时 多彩的职业 教学设计
- 2026年天津市苏教版高中物理选修八第五章原子物理实验课件
- 2026中国智能环保材料行业市场供需分析及投资评估规划分析研究报告
- 2026中国消费级无人机市场饱和预警与创新方向研判报告
- 危险化学品建设项目(油气长输管道)安全条件审查要点
- 科学护肤知识课件小班
- 《教育系统重大事故隐患判定指南》知识培训
- 家庭协议书范本
- 2024年辽宁省抚顺市望花区中考二模物理试题(解析版)
- 2024年全国期货从业资格之期货投资分析考试高频题(附答案)
- 口腔药品培训课件
- 2023年重庆市万州区社区工作者招聘考试真题
- 苔藓植物分类与鉴定完整版
- 江苏船山矿业股份有限公司矿山地质环境保护与土地复垦方案
- 2023年任之堂笔记总结
评论
0/150
提交评论