交互方法、装置、计算机可读存储介质和计算机设备_第1页
交互方法、装置、计算机可读存储介质和计算机设备_第2页
交互方法、装置、计算机可读存储介质和计算机设备_第3页
交互方法、装置、计算机可读存储介质和计算机设备_第4页
交互方法、装置、计算机可读存储介质和计算机设备_第5页
已阅读5页,还剩21页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

(19)中华人民共和国国家知识产权局

(12)发明专利申请

HP(10)申请公布号CN110162668A

(43)申请公布日2019.08.23

(21)申请号201910171651.X

(22)申请日2019.03.07

(71)申请人腾讯科技(深圳)有限公司

地址518000广东省深圳市南山区高新区

科技中一路腾讯大厦35层

(72)发明人陈姿

(74)专利代理机构广州华进联合专利商标代理

有限公司44224

代理人李文渊何平

(51)lnt.CI.

G06F76/738(2019.01)

G06F76/73(2019.01)

权利要求书3页说明书14页附图8页

(54)发明名称

交互方法、装置、计算机可读存储介质和计

算机设备

(57)摘要

本申请涉及一种交互方法、装置、计算机可

读存储介质和计算机设备,所述方法包括:获取

语音交互信息;确定所述语音交互信息所指向的

查询意图;定位当前播放的媒体文件所对应的媒

体文件标识和播放进度;按照所述查询意图,在

所述媒体文件标识相应的、且在所述播放进度之

前的剧情信息中进行查询得到查询结果;输出所

述查询结果。本申请提供的方案可以提高交互效

率。

V

98

9

Z

I9

IO

I

g

CN110162668A权利要求书1/3页

1.一种交互方法,包括:

获取语音交互信息;

确定所述语音交互信息所指向的查询意图;

定位当前播放的媒体文件所对应的媒体文件标识和播放进度;

按照所述查询意图,在所述媒体文件标识相应的、且在所述播放进度之前的剧情信息

中进行查询,得到查询结果;

输出所述查询结果。

2.根据权利要求1所述的方法,其特征在于,所述获取语音交互信息包括:

在产生唤醒指令时,展示语音助手的虚拟形象;

通过所述语音助手获取语音交互信息;

所述输出所述查询结果,包括:

通过所述语音助手语音播报所述查询结果。

3.根据权利要求1所述的方法,其特征在于,所述确定所述语音交互信息所指向的查询

意图,包括:

当所述语音交互信息中指定目标角色标识时,确定所述语音交互信息所指向的查询意

图为精确目标角色查询意图;

所述按照所述查询意图,在所述媒体文件标识相应的、且在所述播放进度之前的剧情

信息中进行查询,得到查询结果,包括:

当与所述媒体文件标识相应的、且在所述播放进度之前的剧情信息中存在与所述目标

角色标识对应的剧情信息时,则

按照所述目标角色查询意图,在与所述媒体文件标识和所述目标角色标识分别相应

的、且在所述播放进度之前的剧情信息中进行查询,得到查询结果。

4.根据权利要求3所述的方法,其特征在于,所述方法还包括:

当与所述媒体文件标识相应的、且在所述播放进度之前的剧情信息中不存在与所述目

标角色标识对应的剧情信息时,则得到表示未知的查询结果。

5.根据权利要求3所述的方法,其特征在于,所述方法还包括:

获取与所述媒体文件标识相应的剧情信息;

确定所述剧情信息所包括的多个角色;

从所述剧情信息中提取所述多个角色各自相应、且按进度分布的剧情信息;

将所述多个角色各自相应的剧情信息与相应角色的角色标识对应存储。

6.根据权利要求1所述的方法,其特征在于,所述确定所述语音交互信息所指向的查询

意图,包括:

当所述语音交互信息中指定目标角色、但不包括所述目标角色的目标角色标识时,确

定所述语音交互信息所指向的查询意图为模糊角色查询意图;

所述按照所述查询意图,在所述媒体文件标识相应的、且在所述播放进度之前的剧情

信息中进行查询得到查询结果,包括:

根据所述播放进度定位当前播放的视频帧;

从所述视频帧中识别出所述目标角色得到目标角色标识;

按照所述模糊角色查询意图,在与所述媒体文件标识和所述目标角色标识分别相应

2

CN110162668A权利要求书2/3页

的、且在所述播放进度之前的剧情信息中进行查询得到查询结果。

7.根据权利要求6所述的方法,其特征在于,所述从所述视频帧中识别出所述目标角色

得到目标角色标识,包括:

提取所述语音交互信息所指定的目标角色特征;

从所述视频帧关联的角色标识中,筛选对应的角色特征与所述目标角色特征匹配的目

标角色标识;所述视频帧关联的角色标识分别对应存储有角色特征。

8.根据权利要求7所述的方法,其特征在于,所述方法还包括:

对所述媒体文件所包括的各视频帧进行角色识别,提取识别出的角色所对应的角色特

征并确定识别出的角色所对应的角色标识;

将从各所述视频帧中识别出的角色所对应的角色标识和角色特征对应存储,并将从各

所述视频帧中识别出的角色所对应的角色标识与相应视频帧关联。

9.根据权利要求6所述的方法,其特征在于,所述从所述视频帧中识别出所述目标角色

得到目标角色标识,包括:

确定所述视频帧中的面部区域;

按照所述面部区域在所述视频帧中截取面部图像;

将所述面部图像输入角色分类模型,通过所述角色分类模型输出识别出的角色所对应

的角色标识。

10.根据权利要求9所述的方法,其特征在于,所述方法还包括:

获取所述媒体文件所涉及的角色的模板图像;

以所述模板图像所属角色的角色标识作为相应的训练标签;

将所述模板图像输入所述角色分类模型得到识别结果;

按照所述识别结果与所述训练标签的差异,调整所述角色分类模型的模型参数并继续

训练,直至满足训练停止条件时结束训练。

11.根据权利要求1所述的方法,其特征在于,所述确定所述语音交互信息所指向的查

询意图,包括:

当所述语音交互信息中指定目标集数时,确定所述语音交互信息所指向的查询意图为

剧情查询意图;

所述按照所述查询意图,在所述媒体文件标识相应的、且在所述播放进度之前的剧情

信息中进行查询得到查询结果,包括:

按照所述剧情查询意图,在与所述媒体文件标识相应的、且在所述播放进度之前的剧

情信息中查询与所述目标集数相应的剧情信息得到查询结果。

12.根据权利要求1所述的方法,其特征在于,所述查询结果为文本查询结果;所述输出

所述查询结果,包括:

合成与所述文本查询结果对应的语音查询结果;

输出所述语音查询结果。

13.一种交互装置,包括:

获取模块,用于获取语音交互信息;

确定模块,用于确定所述语音交互信息所指向的查询意图;

定位模块,用于定位当前播放的媒体文件所对应的媒体文件标识和播放进度;

3

CN110162668A权利要求书3/3页

查询模块,用于按照所述查询意图,在所述媒体文件标识相应的、且在所述播放进度之

前的剧情信息中进行查询得到查询结果;

输出模块,用于输出所述查询结果。

14.一种计算机可读存储介质,存储有计算机程序,所述计算机程序被处理器执行时,

使得所述处理器执行如权利要求1至12中任一项所述方法的步骤。

15.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,所述计算

机程序被所述处理器执行时,使得所述处理器执行如权利要求1至12中任一项所述方法的

步骤。

4

CN110162668A说明书1/14页

交互方法、装置、计算机可读存储介质和计算机设备

技术领域

[0001]本申请涉及计算机技术领域,特别是涉及一种交互方法、装置、计算机可读存储介

质和计算机设备。

背景技术

[0002]随着网络技术的发展,互联网得到了广泛的应用,已经成人们工作、生活中不可缺

少的一部分。比如,人们可以通过视频平台观看电视剧或者电影等视频。人们在观影过程中

可能会进行剧情查询。

[0003]然而,目前基于剧情查询的交互方式通常需要用户手动暂停当前播放的视频,打

开浏览器手动搜索,操作繁琐,存在交互效率低下的问题。

发明内容

[0004]基于•此,有必要针对基于剧情查询的交互效率低下的技术问题,提供一种交互方

法、装置、计算机可读存储介质和计算机设备。

[0005]一种交互方法,包括:

[0006]获取语音交互信息;

[0007]确定所述语音交互信息所指向的查询意图;

[0008]定位当前播放的媒体文件所对应的媒体文件标识和播放进度;

[0009]按照所述查询意图,在所述媒体文件标识相应的、且在所述播放进度之前的剧情

信息中进行查询得到查询结果;

[0010]输出所述查询结果。

[0011]一种交互装置,包括:

[0012]获取模块,用于获取语音交互信息;

[0013]确定模块,用于确定所述语音交互信息所指向的查询意图;

[0014]定位模块,用于定位当前播放的媒体文件所对应的媒体文件标识和播放进度;

[0015]查询模块,用于按照所述查询意图,在所述媒体文件标识相应的、且在所述播放进

度之前的剧情信息中进行查询得到查询结果;

[0016]输出模块,用于输出所述查询结果。

[0017]一种计算机可读存储介质,存储有计算机程序,所述计算机程序被处理器执行时,

使得所述处理器执行上述交互方法的步骤。

[0018]一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,所述计算

机程序被所述处理器执行时,使得所述处理器执行上述交互方法的步骤。

[0019]上述交互方法、装置、计算机可读存储介质和计算机设备,可直接获取语音交互信

息,自动确定语音交互信息所指向的查询意图,定位当前播放的媒体文件所对应的媒体文

件标识和播放进度,从而可以按照查询意图,在媒体文件标识相应的、且在播放进度之前的

剧情信息中进行查询得到查询结果并输出。这样既避免了繁琐的手动操作带来的耗时,提

5

CN110162668A说明书2/14页

高了交互效率;而且查询结果是根据播放进度之前的剧情信息得到的,不会存在剧透,有较

高的实用性。

附图说明

[0020]图1为一个实施例中交互方法的应用环境图;

[0021]图2为一个实施例中交互方法的流程示意图;

[0022]图3为一个实施例中在终端界面中语音助手的虚拟形象的示意图;

[0023]图4为一个实施例中在终端界面中展示文本格式的查询结果的界面示意图;

[0024]图5为一个实施例中按照目标角色查询意图查询的业务流程图;

[0025]图6为一个实施例中将角色标识与视频帧关联的时序图;

[0026]图7为一个实施例中训练和使用角色分类模型的示意图;

[0027]图8为一个实施例中交互方法的时序图;

[0028]图9为一个实施例中交互装置的结构框图;

[0029]图10为另一个实施例中交互装置的结构框图;

[0030]图11为一个实施例中计算机设备的结构框图。

具体实施方式

[0031]为了使本申请的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对

本申请进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本申请,并

不用于限定本申请。

[0032]图1为一个实施例中交互方法的应用环境图。参照图1,该交互方法应用于交互系

统。该交互系统包括终端110和服务器120。终端110和服务器120通过网络连接。终端110具

体可以是台式终端或移动终端,移动终端具体可以电视、手机、平板电脑、笔记本电脑等中

的至少一种。服务器120可以用独立的服务器或者是多个服务器组成的服务器集群来实现。

终端110和服务器120均可单独用于执行该交互方法。终端110可直接执行该交互方法,直接

播放视频;终端110上也可安装有应用(Application,APP),终端110可以根据用户指令运行

该应用,通过该应用执行该交互方法,以及通过该应用播放视频。其中,应用是具有视频播

放功能的计算机应用程序。

[0033]如图2所示,在一个实施例中,提供了一种交互方法。本实施例主要以该方法应用

于计算机设备来举例说明,该计算机设备具体可以是上述图1中的终端110或服务器120。参

照图2,该交互方法具体包括如下步骤:

[0034]S202,获取语音交互信息。

[0035]其中,语音交互信息是计算机设备通过声音采集装置采集用户语音得到的数据,

是用户与计算机设备进行交互的数据。

[0036]具体地,当计算机设备为终端时,终端可通过内置或者外部连接的声音采集装置

采集用户语音得到的语音交互信息。终端也可接收其他终端发送的语音交互信息,从而获

取到语音交互信息。比如,物联网中智能家居之间的语音数据传输等。当计算机设备为服务

器时,服务器可接收终端发送的语音交互信息,从而获取到语音交互信息。

[0037]在一个实施例中,计算机设备为终端,S202包括:在产生唤醒指令时,展示语音助

6

CN110162668A说明书3/14页

手的虚拟形象;通过语音助手获取语音交互信息。

[0038]其中,唤醒指令是启动语音助手的计算机程序。唤醒指令可通过多种形式触发。

[0039]具体地,唤醒指令具体可以是语音唤醒指令。终端可通过内置或者外部连接的声

音采集装置采集用户语音,对用户语音进行文本转化,并检测转化得到的文本数据中是否

包括预设的唤醒词。终端在检测到唤醒词后可触发唤醒指令,终端在未检测到唤醒词时,可

继续进行声音采集。终端可在触发唤醒指令后,可启动语音助手并展示语音助手的虚拟形

象。

[0040]其中,语音助手的虚拟形象可以是二维虚拟形象也可以是三维虚拟形象。二维虚

拟形象可以是在终端界面中显示的角色形象或者控件样式形象等。角色形象比如,三维虚

拟形象可以是在终端界面中显示的虚拟形象,也可以是在现实空间中投影的虚拟形象。语

音助手的虚拟形象可通过用户自定义设置。

[0041]图3示出了一个实施例中在终端界面中语音助手的虚拟形象的示意图。参考图3,

可以看到终端正在播放视频,在唤醒指令时,展示语音助手的虚拟形象310。可以理解,图3

以后文中所示的界面图仅用于举例说明,实际场景中具体使用的界面图可以包括比图中所

示更多或更少的内容。

[0042]在另外的实施例中,唤醒指令也可通过对预定义的物理按钮的点击操作触发,或

者通过晃动操作触发,或者预设肢体动作等。

[0043]进一步地,终端可在启动语音助手后,通过语音助手调用声音采集装置采集用户

语音,获取采集到的用户语音作为语音交互信息。

[0044]在一个实施例中,终端在产生唤醒指令时,并不展示语音助手的虚拟形象,而是在

通过语音助手获取语音交互信息后,将语音交互信息转化为文本数据,然后展示展示语音

助手的虚拟形象,并展示转化得到得的文本数据。再参考图3,该界面图还包括将语音交互

信息转化得到的文本数据320。

[0045]上述实施例中,用户在与计算机设备交互时,展示语音助手的虚拟形象,从而可以

提高语音交互时输出方式的灵活性,提升用户的交互体验。

[0046]S204,确定语音交互信息所指向的查询意图。

[0047]其中,查询意图是指进行查询的目的。语音交互信息在包括不同的内容时可以指

向不同的查询意图。查询意图可以是角色查询意图也可以是剧情查询意图等。计算机设备

可以分析语音交互信息得到语音交互信息所指向的查询意图。

[0048]举例说明,比如,语音交互信息为“孙悟空是谁",计算机设备可分析该语音交互信

息是角色查询意图,且意图查询的角色是“孙悟空”。再比如,语音交互信息为“前两集讲了

啥”,计算机设备可分析该语音交互信息是剧情查询意图,且意图查询的剧情是当前播放剧

集前两集的剧情。

[0049]S206,定位当前播放的媒体文件所对应的媒体文件标识和播放进度。

[0050]其中,媒体文件可以是视频文件、动画文件或者音频文件等。媒体文件标识具体可

以是媒体文件名称,比如电视剧剧名“西游记”等,播放进度具体可以是媒体文件序号,比如

电视剧集数“第十集”等。媒体文件标识具体也可以是媒体文件名称和媒体文件序号的组

合,比如“西游记第十集”,播放进度具体可以是当前媒体文件当前播放至的时间节点,比如

“32:12”等。当然,媒体文件标识也可通过其他字符序列表示。

7

CN110162668A说明书4/14页

[0051]具体地,当计算机设备为终端时,终端可以在获取到语音交互信息时,实时获取终

端当前播放的媒体文件的播放进度,并获取当前播放的媒体文件的媒体文件标识。在另外

的实施例中,终端可根据用户操作暂停当前播放的媒体文件,从而读取当前暂停位置的播

放进度。

[0052]当计算机设备为服务器时,可以接收终端上传的终端当前播放的媒体文件所对应

的媒体文件标识和播放进度;也可以获取终端当前登录的用户标识,进而查询与该用户标

识对应的当前播放的媒体文件所对应的媒体文件标识和播放进度。可以理解,终端在播放

视频时,可将当前播放的媒体文件所对应的媒体文件标识和播放进度同步至服务器。

[0053]S208,按照查询意图,在媒体文件标识相应的、且在播放进度之前的剧情信息中进

行查询得到查询结果。

[0054]其中,剧情信息可以是文本数据也可以是语音数据等。查询结果也可以是文本数

据或者语音数据等。可以理解,剧情信息在存储时是按照进度分布的。这样计算机设备在查

询时,可以根据剧情信息的进度分布确定在播放进度之前的剧情信息,继而进行查询。

[0055]举例说明,比如二十五集电视连续剧“西游记”的剧情信息,可按集数存储,即每集

对应的剧情信息与对应集的集数存储。如,第一集:XXX…XXXX。第二集:XXX-XXXX。第三集:

XXX…XXXX。…其中,每集的剧情信息可以继续按照时间节点进行划分。

[0056]再举例说明,假设用户观看的电视剧为《西游记》,且当前观看视频的播放进度为

第十集12:34。那么媒体文件标识相应的、且在播放进度之前的剧情信息,即为《西游记》第

一集0:0至第十集12:34之间的剧情信息。

[0057]S210,输出查询结果。

[0058]具体的,当计算机设备为终端时,终端可直接输出查询结果,即在终端界面展示文

本格式的查询结果和/或通过内置或者外部连接的扬声器播放语音格式的查询结果。当计

算设备为服务器时,服务器查询结果输出至终端,再由终端向用户输出查询结果。

[0059]在一个实施例中,查询结果为文本查询结果。S210包括:合成与文本查询结果对应

的语音查询结果;输出语音查询结果。

[0060]具体地,计算机设备在获取到文本查询结果后,可基于自动语音合成系统进行语

音合成。计算机设备可先对目标文本进行语言学分析,以确定句子的层结构和每个字的音

素组成,包括文本的断句、字词切分、多音字的处理、数字的处理、缩略语的处理等。计算机

设备可再将处理好的文本采用自动语音合成系统合成声音,得到语音查询结果。其中,自动

语音合成系统是用于进行语音合成的系统,具体可以是TTS(TextToSpeech从文本到语

音)参数合成系统。计算机设备采用自动语音合成系统合成声音,具体可以是按照TTS韵律

特征将处理好的文本转化成语音波形,得到语音查询结果。

[0061]进一步地,计算机设备在进行语音合成时,对于不同的查询结果可按照不同的音

色类别转化为语音查询结果。比如,诙谐幽默的剧情可以按照轻快类型的音色转化为语音

查询结果,悲惨不幸的剧情可以按照沉重类型的音色转化为语音查询结果等。

[0062]在本实施例中,通过语音格式播放查询结果,使得用户无需再分心查看屏幕上文

本格式显示的查询结果,提高了交互实用性。

[0063]在一个实施例中,S210包括:通过语音助手语音播报查询结果。

[0064]具体地,终端可通过语音助手调用扬声器语音播报查询结果。当语音助手的虚拟

8

CN110162668A说明书5/14页

形象为角色形象时,终端通过语音助手语音播报查询结果时,控制语音助手的虚拟形象进

行运动。比如进行唇部运动以模拟自然人说话的场景等。

[0065]在本实施例中,用户在与计算机设备交互时,展示语音助手的虚拟形象,并通过语

音助手语音播报查询结果,从而可以提高语音交互时输出方式的灵活性,提升用户的交互

体验。

[0066]在一个实施例中,计算机设备可以既通过语音助手语音播放查询结果,还可在终

端界面中展示文本格式的查询结果。举例说明,图4示出了一个实施例中在终端界面中展示

文本格式的查询结果的界面示意图。可以看到,终端在视频界面展示有语音助手的虚拟形

象410和文本格式显示的查询结果420,同时还可通过扬声器播放语音格式的查询结果。

[0067]上述交互方法,可直接获取语音交互信息,自动确定语音交互信息所指向的查询

意图,定位当前播放的媒体文件所对应的媒体文件标识和播放进度,从而可以按照查询意

图,在媒体文件标识相应的、且在播放进度之前的剧情信息中进行查询得到查询结果并输

出。这样既避免了繁琐的手动操作带来的耗时,提高了交互效率;而且查询结果是根据播放

进度之前的剧情信息得到的,不会存在剧透,有较高的实用性。

[0068]在一个实施例中,S204包括:当语音交互信息中指定目标角色标识时,确定语音交

互信息所指向的查询意图为精确目标角色查询意图。S206包括:当与媒体文件标识相应的、

且在播放进度之前的剧情信息中存在与目标角色标识对应的剧情信息时,则按照目标角色

查询意图,在与媒体文件标识和目标角色标识分别相应的、且在播放进度之前的剧情信息

中进行查询得到查询结果。

[0069]其中,目标角色标识是作为查询目标的角色的标识。可以理解,媒体文件中可包括

一个或多个角色,比如电视剧《西游记》中可包括角色唐僧、孙悟空、猪八戒以及沙和尚等。

角色标识用于标识该角色,具体可以是该角色的角色名称,或者其他的字符序列等。可以理

解,这里的精确角色查询意图,表示需要进行查询的目标是明确的。

[0070]具体地,计算机设备在获取到语音交互信息后,可将语音交互信息转化为文本数

据,并继续查看该文本数据中是否包括角色标识。计算机设备在文本数据中查找到角色标

识时,即将该角色标识作为语音交互信息中指定的目标角色标识,继而确定语音交互信息

所指向的查询意图为精确目标角色查询意图。也就是说用户意图查询该角色的剧情信息。

[0071]在一个具体的实施例中,计算机设备中可事先与媒体文件标识存储有角色标识,

角色标识所标识的角色存在于对应存储的媒体文件标识所标识的媒体文件中。这样,计算

机设备在将语音交互信息转化为文本数据,可将该文本数据与当前播放的媒体文件的媒体

文件标识对应存储角色标识进行比对,以查看该文本数据中是否包括角色标识。

[0072]举例说明,比如,计算机设备将语音交互信息进行文本转化得到的文本数据为“沙

和尚是谁”,并在“沙和尚是谁”中查找到角色标识“沙和尚”,则将“沙和尚”作为语音交互信

息中指定的目标角色标识;再比如,计算机设备将语音交互信息进行文本转化得到的文本

数据为“红孩儿的妈妈是谁”,并在“红孩儿的妈妈是谁”中查找到角色标识“红孩儿的妈

妈”,则将“红孩儿的妈妈”作为语音交互信息中指定的目标角色标识。

[0073]进一步地,计算机设备可继续查查看与媒体文件标识相应的、且在播放进度之前

的剧情信息中是否存在与目标角色标识对应的剧情信息。当与媒体文件标识相应的、且在

播放进度之前的剧情信息中存在与目标角色标识对应的剧情信息时,判定截止到当前的播

9

CN110162668A说明书6/14页

放进度,该目标角色标识所标识的角色已经出场,则在与媒体文件标识和目标角色标识分

别相应的、且在播放进度之前的剧情信息中进行查询得到查询结果。

[0074]这样,计算机设备进行查询的剧情信息的范围仅为当前的播放进度之前的剧情信

息,这样既可与用户基于剧情进行交互,又不会产生剧透,提高了交互的实用性与合理性。

[0075]举例说明,计算机设备将语音交互信息进行文本转化得到的文本数据为“沙和尚

是谁”,并判定截止到当前的播放进度,“沙和尚”已经出场,则查询得到查询结果“沙僧,又

叫沙和尚、沙悟净,原为天宫玉皇大帝的卷帘大将,因为失手不小心打破了琉璃盏,触犯天

条,被贬出天界,在人间流沙河兴风作浪,危害一方,专吃过路人。后经观音点化,赐法号悟

净,一心归佛,同八戒、悟空一同保大唐高僧西天拜佛求取真经,在本剧中第x集出现”。

[0076]在一个实施例中,计算机设备在则按照目标角色查询意图,在与媒体文件标识和

目标角色标识分别相应的、且在播放进度之前的剧情信息中进行查询前,还可从由语音交

互信息转化得到的文本数据中提取关键词,确定需要查询的内容,从而查询到得到相应的

查询结果。

[0077]举例说明,比如计算机设备将语音交互信息进行文本转化得到的文本数据为“孙

悟空是被谁困在五指山”,将“孙悟空”作为语音交互信息中指定的目标角色标识,并提取关

键词“被谁”、“困在”和“五指山”,这样,当孙悟空被困在五指山的剧情已经发生时,计算机

设备可查询到将孙悟空困在五指山的角色。

[0078]在一个实施例中,该交互方法还包括:当与媒体文件标识相应的、且在播放进度之

前的剧情信息中不存在与目标角色标识对应的剧情信息时,则得到表示未知的查询结果。

[0079]具体地,计算机设备在与媒体文件标识相应的、且在播放进度之前的剧情信息中

不存在与目标角色标识对应的剧情信息时,即判定截止到当前的播放进度,该目标角色标

识所标识的角色尚未出场,此时则不再进行继续查询操作,可以直接得到表示未知的查询

结果。

[0080]举例说明,计算机设备将语音交互信息进行文本转化得到的文本数据为“沙和尚

是谁”,并判定截止到当前的播放进度,“沙和尚”尚未出场,则直接得到查询结果“我不知

道”。

[0081]在本实施例中,当截止到当前的播放进度,该目标角色标识所标识的角色尚未出

场即不再继续查询,既节省了计算机设备的运算资源,又避免了剧透。

[0082]举例说明,图5示出了一个实施例中按照目标角色查询意图查询的业务流程图。参

考图5,S501,终端可根据用户指令播放视频用户观看视频。S502,用户在观看视频的过程中

发出语音指令,终端获取语音交互信息,如“红孩儿的妈妈是谁”。由于“红孩儿的妈妈是谁”

中指定目标角色标识“红孩儿的妈妈”,终端即确定语音交互信息所指向的查询意图为精确

目标角色查询意图,继而判断与媒体文件标识相应的、且在播放进度之前的剧情信息中是

否存在与目标角色标识对应的剧情信息。如S503,判断与该视频相应的、且在播放进度之前

的剧情信息中是否存在与红孩儿妈妈对应的剧情。当与媒体文件标识相应的、且在播放进

度之前的剧情信息中存在与目标角色标识对应的剧情信息时,终端则按照目标角色查询意

图,在与媒体文件标识和目标角色标识分别相应的、且在播放进度之前的剧情信息中进行

查询得到查询结果。如S504,在与该视频相应的、且在播放进度之前的剧情信息中查找得到

查找结果“红孩儿得妈妈是铁扇公主,在第N集出现"。当与媒体文件标识相应的、且在播放

10

CN110162668A说明书7/14页

进度之前的剧情信息中不存在与目标角色标识对应的剧情信息时,终端则直接得到表示未

知的查询结果。如S505,得到查询结果“我不知道”。

[0083]上述实施例中,计算机设备进行查询的剧情信息范围仅为当前的播放进度之前的

剧情信息,而且当截止到当前的播放进度,该目标角色标识所标识的角色尚未出场即不进

行查询,直接得到表示位置的查询结果,这样既可与用户基于剧情进行交互,又不会产生剧

透,提高了交互的实用性与合理性。

[0084]在一个实施例中,该交互方法还包括:获取与媒体文件标识相应的剧情信息;确定

剧情信息所包括的多个角色;从剧情信息中提取多个角色各自相应、且按进度分布的剧情

信息;将多个角色各自相应的剧情信息与相应角色的角色标识对应存储。

[0085]可以理解,这里的剧情信息按照进度分布,表示剧情信息中包括的剧情均对应存

在剧情发生的时间节点。这样计算机设备在剧情信息中进行查询时,可以更准确的定位当

前的播放进度之前的剧情信息。剧情发生的时间节点可以是媒体文件序号(如电视剧集

数),也可以精确到每个媒体文件中的时间节点等。

[0086]比如,对于电视剧《西游记》的剧情信息包括:第N集XX:XX如来佛祖将孙悟空困在

五指山,或者第N集XX:XX唐僧将孙悟空救出五指山等。

[0087]具体地,计算机设备可获取与媒体文件标识相应的剧情信息,确定剧情信息所包

括的各个角色。对于确定的每一个角色,计算机设备可从剧情信息中提取出于该角色相对

应的剧情信息,并将提取的剧情信息按照进度排布,这样即可分别得到各个角色各自相应、

且按进度分布的剧情信息。计算机设备可再将每个角色对应的剧情信息与该角色的角色标

识对应存储。

[0088]举例说明,对于电视剧《西游记》,计算机设备可获取该电视剧的全部剧情信息,

《西游记》中可包括唐僧、孙悟空、猪八戒以及沙和尚等多个角色。计算机设备可为这些角色

一一提取相对应的剧情信息,分布进行存储。

[0089]在一个具体的实施例中,计算机设备可通过NLP(NaturalLanguageProcessing,

自然语音处理)算法提取每个角色的剧情信息、以及该集剧情信息,保存在对应的集数。

[0090]在本实施例中,事先按照角色将相应的剧情信息按照进度进行存储,这样在目标

角色查询时,即可快速在该角色相应的剧情信息中进行查询,缩小了查询的范围,提高了交

互效率。

[0091]在一个实施例中,S204包括:当语音交互信息中指定目标角色、但不包括目标角色

的目标角色标识时,确定语音交互信息所指向的查询意图为模糊角色查询意图。S206包括:

根据播放进度定位当前播放的视频帧;从视频帧中识别出目标角色得到目标角色标识;按

照模糊角色查询意图,在与媒体文件标识和目标角色标识分别相应的、且在播放进度之前

的剧情信息中进行查询得到查询结果。

[0092]可以理解,这里的模糊角色查询意图与前述实施例中的精确角色查询意图相应,

表示需要进行查询的目标需要通过识别确定。

[0093]具体地,计算机设备在获取到语音交互信息后,可将语音交互信息转化为文本数

据,并继续查看该文本数据中是否包括角色指代词。计算机设备在文本数据中查找到角色

指代词且未查找到角色标识时,即将该角色指代词指代的角色作为目标角色,进而对该角

色进行识别得到目标角色标识。

11

CN110162668A说明书8/14页

[0094]进一步地,计算机设备可根据当前的播放进度定位当前播放至的视频帧,从该视

频帧中识别出目标角色得到目标角色标识,再按照模糊角色查询意图,在与媒体文件标识

和目标角色标识分别相应的、且在播放进度之前的剧情信息中进行查询得到查询结果。

[0095]举例说明,用户在观看视频的过程中可产生语音交互信息Voicel,比如用户说话

以进行语音提问等。计算机设备则可获取该语音交互信息Voicel,将Voicel转化为文本数

据,再继续查看该文本数据中是否包括角色指代词以及是否包括角色标识,从而根据查看

结果确定用户的查询意图。假设,由Voicel进行文本转化得到的文本数据为“这个人是谁”,

显然“这个人是谁”中存在角色指代词“这个人”但不存在“角色标识”。那么,计算机设备即

可判定用户的查询意图为模糊角色查询意图,则以“这个人”作为Voicel中指定的需要识别

出的目标角色。进一步地,计算机设备则可根据当前的播放进度定位当前播放至的视频帧,

“这个人”是当前视频帧中的哪个角色,即将该角色的标识作为目标角色标识,再按照模糊

角色查询意图,在与媒体文件标识和目标角色标识分别相应的、且在播放进度之前的剧情

信息中进行查询得到查询结果。

[0096]在一个实施例中,计算机设备在得到目标角色标识后,也可直接输出该目标角色

标识。

[0097]在一个实施例中,在当前播放至的视频帧中包括多个角色时,语音交互信息可包

括角色特征,这样计算机设备可在视频帧中定位进行识别的目标角色。计算机设备也可根

据用户操作在视频帧中定位进行识别的目标角色。

[0098]上述实施例中,需要进行查询的目标需要进行识别时,从当前的播放进度位置的

视频帧中进行角色识别后再进行查询,提高了交互的实用性。

[0099]在一个实施例中,从视频帧中识别出目标角色得到目标角色标识,包括:提取语音

交互信息所指定的目标角色特征;从视频帧关联的角色标识中,筛选对应的角色特征与目

标角色特征匹配的目标角色标识;视频帧关联的角色标识分别对应存储有角色特征。

[0100]其中,角色特征是反映角色特性的数据。角色特征可以是角色位置特征、角色性别

特征或者角色装饰特征等。比如“这个男孩是谁”所指定的目标角色特征是性别男,或者“这

个穿红裙子的人是谁”所指定的目标角色特征是角色装饰红裙子,或者“右边的这个人是

谁”所指定的目标角色特征是角色位置右边等。可以理解,在本实施例中,媒体文件为视频

文件。

[0W1]具体地,计算机设备可事先对媒体文件中包括的视频帧进行角色识别,并将识别

出的角色的角色特征和角色标识与相应的视频帧关联。这样,计算机设备在根据播放进度

定位当前播放的视频帧、且提取语音交互信息所指定的目标角色特征后,可将定位的视频

帧关联的角色的角色特征与提取的目标角色特征进行匹配,在匹配成功时,获取匹配成功

的角色特征所对应的角色的角色标识作为目标角色标识。

[0102]在一个实施例中,该交互方法还包括:对媒体文件所包括的各视频帧进行角色识

别,提取识别出的角色所对应的角色特征并确定识别出的角色所对应的角色标识;将从各

视频帧中识别出的角色所对应的角色标识和角色特征对应存储,并将从各视频帧中识别出

的角色所对应的角色标识与相应视频帧关联。

[0103]具体地,计算机设备可获取媒体文件以及媒体文件所涉及角色的模板图像,根据

模板图像有监督地训练出角色分类模型。在训练完成分类角色模型后,将媒体文件所包括

12

CN110162668A说明书9/14页

的各视频帧进行预处理,然后将在预处理后的视频帧中定位面部区域,截取面部图像,输入

分类角色模型进行角色分类,得到该角色对应的角色标识,再确定该角色的角色特征,将角

色标识和角色特征与相应的视频帧关联。这里的训练过程可具体参考后续实施例。这里的

预处理可以包括去噪处理。

[0104]图6示出了一个实施例中将角色标识与视频帧关联的时序图。参考图6,运营用户

通过所在终端执行S601将媒体文件和媒体文件包括的角色的模板图像上传至服务器。服务

器则先执行S602根据角色的模板图像有监督地训练得到角色分类模型;然后执行S603通过

角色分类模型对媒体文件所包括的各视频帧进行角色识别,得到各角色对应的角色标识,

并提取各角色的角色特征(比如角色面部区域位置等);再执行S604将角色标识和角色特征

与相应的视频帧关联。服务器还可执行S605将角色标识和角色特征与相应的视频帧的关联

关系下发至用户所在终端,这样再服务器和用户所在终端均可进行查询。

[0105]上述实施例中,事先对视频文件中包括的视频帧涉及的角色进行识别,将识别出

的角色的角色标识与角色特征与相应的视频帧关联,这样在实际交互过程中,即可直接进

行角色特征对比,而不再需要实时进行识别,极大地提高了交互效率。

[0106]在一个实施例中,从视频帧中识别出目标角色得到目标角色标识,包括:确定视频

帧中的面部区域;按照面部区域在视频帧中截取面部图像;将面部图像输入角色分类模型,

通过角色分类模型输出识别出的角色所对应的角色标识。

[0W7]其中,面部区域是角色面部在视频帧中的位置。面部区域可以是自然人面部区域,

或者虚拟对象面部区域,或者动物面部区域等。

[0108]具体地,计算机设备在每获取到一帧视频帧时,即在获取的视频帧中检测面部区

域。若计算机设备未在该视频帧中检测到面部区域时,则结束对该视频帧的处理;继续获取

下一帧视频帧进行面部区域检测。若计算机设备在该视频帧中检测到面部区域时,则确定

该视频帧中的面部区域,按照面部区域在视频帧中截取面部图像,将将面部图像输入角色

分类模型,通过角色分类模型输出识别出的角色所对应的角色标识。

[0109]在一个实施例中,该交互方法还包括:获取媒体文件所涉及的角色的模板图像;以

模板图像所属角色的角色标识作为相应的训练标签;将模板图像输入角色分类模型得到识

别结果;按照识别结果与训练标签的差异,调整角色分类模型的模型参数并继续训练,直至

满足训练停止条件时结束训练。

[01W]其中,角色分类模型是经过训练后具有角色分类能力的机器学习模型。机器学习

英文全称为MachineLearning,简称ML。机器学习模型可通过样本学习具备特征提取与特

征识别能力。机器学习模型可采用神经网络模型、支持向量机或者逻辑回归模型等。

[0111]具体地,计算机设备可将各角色的模板图像作为训练样本,对每个训练样本添加

训练标签。训练标签为训练样本所属角色的角色标识。这样,计算机设备即可将训练样本输

入初始化的角色分类模型,根据角色分类模型的分类结果与输入的训练样本的训练标签进

行对比,并朝向减小两者差异的方向调整角色分类模型的模型参数。

[0112]其中,训练停止条件可以是达到预设迭代次数,也可以是训练出的机器学习模型

达到分类性能指标。分类性能指标可以是分类正确率达到第一预设阈值,也可以是分类错

误率低于第二预设阈值。

[0113]在另外的实施例中,计算机设备还可从训练样本中划分出部分训练样本用作测试

13

CN110162668A说明书10/14页

样本。测试样本是用于在模型训练后进行模型矫正的样本。采用测试样本对训练得到的角

色分类模型进行校准,具体可以是将测试样本输入训练得到的角色分类模型,将该角色分

类模型的输出与测试样本的训练标签进行对比,若两者之间的差值落在允许的误差范围

内,则完成对角色分类模型的校准,若两者之间的差值落在允许的误差范围外,则对角色分

类模型进行参数调整,减少两者之间的差值,以完成对角色分类模型的校准。

[0114]计算机设备还可根据角色分类模型的实际输出和预期输出建立代价函数,采用随

机梯度下降法最小化代价函数,更新第一识别模型的模型参数。代价函数比如方差代价函

数或者交叉端代价函数等。

[0115]图7示出了一个实施例中训练和使用角色分类模型的示意图。参考图7,在训练阶

段,获取角色的模板图像作为训练样本,对训练样本进行预处理后确定训练样本中的面部

区域,按照面部区域在训练样本中截取面部图像样本,将训练样本所属角色的角色标识作

为训练标签,将面部图像样本输入角色分类模型,训练角色分类模型。在使用阶段,获取媒

体文件的视频帧,对视频帧进行预处理后确定视频帧中的面部区域,按照面部区域在视频

帧中截取面部图像,将面部图像输入角色分类模型得到分类结果。

[0116]上述实施例中,事先训练好角色分类模型,在实际交互过程中,实时通过训练好的

角色分类模型识别出用户意图查询的角色,继而查询与识别出的角色相应的剧情反馈给用

户,实现了与用户之间基于剧情的交互。

[0117]在一个实施例中,S204包括:当语音交互信息中指定目标集数时,确定语音交互信

息所指向的查询意图为剧情查询意图。S206包括:按照剧情查询意图,在与媒体文件标识相

应的、且在播放进度之前的剧情信息中查询与目标集数相应的剧情信息得到查询结果。

[0118]其中,目标集数是媒体文件的分段序号。可以理解,媒体文件可以是按序排列的媒

体文件序列中的其中一个。比如,电视剧《西游记》包括二十五个按序排列的视频文件,每个

视频文件对应一个集数。

[0119]具体地,计算机设备在获取到语音交互信息后,可将语音交互信息转化为文本数

据,并继续查看该文本数据中是否包括媒体文件的分段序号,即集数。计算机设备在文本数

据中查找到媒体文件的分段序号时,即将该媒体文件的分段序号作为语音交互信息中指定

的目标集数,继而确定语音交互信息所指向的查询意图为精确剧情查询意图。也就是说用

户意图查询某一时间段的剧情信息。

[0120]可以理解,计算机设备上存储的剧情信息包括剧情和该剧情发生的时间节点,该

时间节点可以是媒体文件的分段序号。这样,计算机设备在进行剧情查询时,即可快速定位

与媒体文件标识相应的、且在播放进度之前的剧情信息中与目标集数相应的剧情信息得到

查询结果。

[0121]举例说明,计算机设备将语音交互信息进行文本转化得到的文本数据为“前面两

集讲的什么”,且当前播放到《西游记》第十集。这样,计算机设备根据“前面两集”确定用户

意图进行剧情查询,且该前面两集是第八集和第九集,即查找《西游记》第八集和第九集的

剧情。

[0122]在本实施例中,计算机设备进行查询的剧情信息的范围仅为当前的播放进度之前

的剧情信息,这样既可与用户基于剧情进行交互,又不会产生剧透,提高了交互的实用性与

合理性。

14

CN110162668A说明书11/14页

[0123]图8示出了一个实施例中交互方法的时序图。参考图8,该交互方法所应用的硬件

环境包括开发人员对应的第一终端,用户对应的第二终端和服务器。

[0124]准备阶段,第一终端可先执行S801将各视频文件以及各视频文件所对应的角色的

模板图像上传至服务器。服务器则根据角色的模板图像有监督地训练得到角色分类模型,

并通过训练得到的角色分类模型对视频文件所包括的各视频帧进行角色识别,提取识别出

的角色所对应的角色特征并确定识别出的角色所对应的角色标识。这样,服务器即可将从

各视频帧中识别出的角色所对应的角色标识和角色特征对应存储,并执行S802将从各视频

帧中识别出的角色所对应的角色标识与相应视频帧关联。第一终端还可执行S803将各视频

文件的剧情信息上传至服务器。服务器从而确定剧情信息所包括的多个角色,从剧情信息

中提取多个角色各自相应、且按进度分布的剧情信息,执行S804将多个角色各自相应的剧

情信息与相应角色的角色标识对应存储。

[0125]交互阶段,第二终端可根据用户指令执行S805播放视频文件。用户可在观看视频

文件时触发唤醒指令。第二终端可将执行S806发送唤醒指令至服务器,服务器则可执行

S807反馈交互引导信息,如“你可以提问XXX是在第几集出现的“。用户可继续发出语音指

令,第二终端则可获取语音交互信息,执行S808上传语音交互信息至服务器。服务器再确定

语音交互信息所指向的查询意图,定位第二终端当前播放的视频文件所对应的视频文件标

识和播放进度,执行S809按照查询意图,在视频文件标识相应的、且在播放进度之前的剧情

信息中进行查询得到查询结果,执行S810反馈查询结果至第二终端。第二终端执行S811可

在终端界面上展示查询结果,还可以通过语音播报该查询结果。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论