版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、用户生成内容的质量评估斯蒂芬温克尔 (先进数字科学中心(ADSC)、新加坡138632)摘要随着数码相机、制图软件、图片分享网站、社交网络,以及其他相关科技的广泛使用,媒体产品和消费模式相较于以前更为多方面、更复杂。尤其是用户生成内容得到了极大的发展。因此,我们也应该从一个不同的角度来看待体验质量和相关质量评估方法。这篇论文将一些传统质量评估方法和为用户生成内容设计的新方法进行对比。也介绍了一些我们开发过的示例应用。关键词图片质量、照片集、社交媒体、摄影作品、总结1 介绍 图片质量评估(QA)可以追溯到十九世纪七十年代,第一个关于视觉皮层、视觉建模和数字成像的研究完成之时。基于人类视觉系统模型
2、的算法现在正和更为实用的基于图像的或基于功能的方法竞争。视频质量评估也有类似的,却更短一点的历史。被广泛使用的、人们负担得起的数码相机(也包括以植入形式存在的摄像设备)现在允许用户几乎随时随地拍摄图片和视频。这导致了来自业余爱好者与专业人员的图片等信息的大爆炸。然而,传统媒体和用户生成内容在很多层面上完全不同,尤其是从质量评估的角度来看(见表1)。表1:传统媒体 vs 用户生成内容阶段传统媒体用户生成内容产品专业质量,优质内容业余内容/质量处理编码,转码,多路复用等极少的用户介入,或对用户是隐蔽的传送实时流,多用户,高网络需求和朋友分享,通常是通过下载的方式1.1 对传统媒体的质量评估传统的质
3、量评估方法主要关注广播媒体的处理和广播,即图像、视频的压缩、传输和增强。在许多情况下,一个显式的资源(例如源图像或视频),经过这个系统的处理之后会发生某些变化(例如失真、压缩损失、丢包、除噪)。 对于这样高价值的、专业的内容,生产过程中质量评估一般是手动完成。然后,这些内容通过电影和广播电视等渠道,提供并分配给许多付费用户。一个高质量的资源经过许多可能会改变或影响内容质量的处理步骤发生着线性变化。在整个过程中,实体的质量通常涉及到编码器制造商、内容提供商、服务提供商和运营商。此外,传统媒体是专为众多观众而设计的,因此,典型用户和意见质量分数(MOS)是质量考核单元和选择标准。 迄今为止,大多数
4、质量评估算法、数据库、标准、以及产品都处于将保真度(即经过处理的图片/视频与原始源内容的相似度)视为是最重要的评估方面的一个阶段。 1.2 用户生成内容的质量评估但对于用户生成内容来说,保真度是次要的。质量评估和增强的标准不仅仅是图片或内容特性(例如场景构成缺损),还需要以用户为中心(即在一个集合中什么是与用户最相关的)。这是区别于传统质量评估方法的。 用户生成内容的自动化质量评估在生产过程中是最有用的的原因有以下几点:l 即使质量评估可以由用户手动完成,但是大部分情况下将会耗费很多时间。此外,普通用户也需要指导才能产生高质量的内容; l 处理和分配对于用户来说是简单的,在很大程度上已经被隐藏
5、或模糊(例如在相机中进行压缩或上传内容到一个网站);l 质量成为一个更个人的概念,因为它主要取决于用户以及用户会与谁分享内容的社交圈。事实上,个性化迄今没有得到太多的关注,尽管它对于用户生成内容如此重要。我们以照片集为例详细讨论这些方面。同时他们也适用于其他类型的媒体。2 照片集如今最常见的用户生成内容是数码照片。相片集通常包含某个事件或旅途中拍摄的相片,或许是来自多个用户的不同设备。它们也包括分享在社交网络中的图片、网站中的图片,以及存储在第三方库的图片。设备可能包括单反相机(SLR),傻瓜相机,照相手机。 拍大量照片变得如此容易以至于用户经常需要处理大量的图片集。在此质量评估首要的任务就是
6、从一个照片集中筛选最好的、最具代表性的图片。这个任务可以被分成两个基本步骤:筛选和总结。筛选时,从一组相似的图片中选择最好的相片(通常对于同一个场景会拍摄多个镜头),并且如果有必要,做适当的图片增强。总结时,为相册选择部分图片。一般来说,目的是为了讲述一个故事或分享一个经历。由于用户特定标准、口味和偏好的重要性,智能用户界面设计和个性化是两个步骤中必不可少的。这些步骤也很难完全自动的进行并使用户满意。2.1 筛选对于数码相机而言,对同一个场景拍摄多个镜头已经成为惯例。用户通常平均每个场景拍摄两到三个镜头,对于某些场景或在某些情况下,会拍摄八到十个镜头。从一组图片中选择最好的图片通常涉及到亮度、
7、曝光,以及白平衡;构图和角度;姿势、动作和场景中的人脸;以及基本的图片质量。通常情况下,一张照片的质量是通过将它与一个相同场景而未曾损伤的参照物进行比较评估的(全参照对比)。它也可以自行评估(无参照比较)。当没有参照图片时,传统的全参照比较方法便不适用了。无参照比较方法原则上是可以用的,但它们一般需要相同图片的单一的减值维度才能起到最好的效果,例如,量化或模糊。这里的问题是更为普遍的,与相似、相关(但不相同)内容以及不同质量/失真维度和级别(一张图片被模糊处理的时候,另一张或许会被过度曝光)的图片的比较相关的。我们需要选择最好的图片,这需要对不同损失维度在感觉上带来的效果有很好的理解。现有的在
8、质量评估领域所做的工作都注重图片美学方面的品质。用于评估消费者照片的审美价值或分类美学范畴的特性是颜色和照度、成分、景深和视角,以及主题。这些特性甚至被用来给摄影师拍摄提供自动反馈。审美方面的品质无疑是重要的,但对于大部分的业余摄影师所关注的“家庭照片”这一大类来说却只是次要的。对于家庭照片来说,人为因素,如面部表情、姿势、活动和互动,是迄今为止决定一个照片价值最重要的因素。如果一个场景中有一个人,观察者将会马上将注意力集中在人的脸上而很大程度上忽视图像的其他特征。因此,评估人为因素对于智能地处理家庭相册是至关重要的。 不幸的是,人为因素比审美或其他低层次的因素更难以衡量。人脸检测或识别人、姿
9、势、活动和表情等问题仍然是计算机视觉中一些最具挑战性的问题,尤其是在不受控制的条件下的图像捕获。2.2 总结从一组照片中挑选最具代表性的照片就像是讲故事或摘要,其关键是要明确哪一些场景是用户认为的在这个故事中最重要的一幕。由于大量可能的子集和不同可能的主题,使得或许没有一组独特的照片能完全代表一个相片集。一个有效的摘要应该具有以下属性:质量,被选择的照片必须是有趣和有吸引力的;多样性,不应该有重复或冗余的相片;覆盖率,重要人物或事件都应该出现在摘要中。人们用来从之前研究过的一组照片中选择照片的标准,包括具体的人、地点多样性和综合图像质量。这些可用于指导(半)自动图片选择过程。此外,它对于在某种
10、文化中遵循一个特定的事件序列的某些大事件,比如婚礼,非常有用。可能会有很多重要的里程碑的一幕需要被记录下来。有时候用户会希望能发现一些不属于最初的相片集,但是却和这个故事有着联系,并且能从其他的相片集获取到的图片。像这样的例子有,记录足迹的地图相册集,或是当现有的相片集中的关于一个著名景点的照片不令人满意时,希望获得更好的一张。最后,总结的目的不一定是生成一个静态的专辑或一组照片,相反,它可以用于照片收藏的动态浏览。特别感兴趣的是“联想”浏览,指任何以更直观的方式帮助用户发现、浏览、或导航大型数据库的方法。使用联想浏览,用户将被引导向其他与目前正在查看的数据类似的数据。自然地,人为因素对一个人
11、看一张照片时会有的联想有很大的影响。这不仅使开发获得有意义的总结的方法增加难度,也使评估它们的有效性难度增大。此外,联想是高度主观的,这给我们带来了个性化主题的概念。2.3 个性化个人和社会因素对于用户生成内容更重要,因为这些内容往往对于用户和他们的家人朋友来说是唯一有意义的因素。因此,为需求设计的通用模型可能会比为美学设计的模型生命周期更短。为了使个性化更为有效,必须仔细了解个人或环境偏好,量身定做。个性化意味着作为选择图片标准的不是普通用户(如典型的传统意见质量分数),而是具体用户。这种方法非常不同于那种主题通常是相似的的方法。被一个随机的人从一个个人收藏的照片中挑选出来的图片不太可能对照
12、片主人有意义或与之相关。一个具体的人可能有对角度、照明、色彩、增强、主题、情感,以及姿势有具体的偏好。任何质量评估系统都应能对这些内容根据用户的个人品味和偏好提供个性化的建议。仅图像内容和视觉特征可能不够,图像元数据,如标签、地理信息、时间、日期可以极大地帮助完成个性化。3 举例3.1 互动照片筛选人们通常同一场景拍摄多个镜头然后选择其中最好的照片。这对于涉及到人物的照片是特别常见的,例如,与婴儿孩子一起的家庭照片或一些重要事件的照片,如婚礼或毕业典礼。在这些情况下,我们希望捕获以最难忘的姿势表达照片主题的最佳的一幕。然后,我们希望和家人朋友分享我们最喜欢的照片。照片筛选(审核)是最常见的一种
13、关于照片进行的活动。现有的照片软件为持照片筛选提供了非常有限的计算或界面支持。在许多情况下,这个基本任务仍然依赖于翻阅这些照片,一个接一个地查看它们,这是一个原始的交互方法。使用缩略图作为替代也并没有起到什么作用,因为在缩略图视图中被比较的相关图像特征往往太小。因此,细节比如面部表情是不容易辨识的。这个问题在有着有限的屏幕空间和分辨率的移动设备上尤其明显。因此,我们提出一种有效且易于使用的“刷与拖”界面,它允许用户在一个更广泛的场景上下文中交互地查看与比较图片(见图1)。首先,用户在一个照片中刷出一个感兴趣的区域。我们的定制分割引擎自动确定照片之间相应的图像元素。然后,用户可以从不同的照片中拖
14、动被分割的元素同时在屏幕上查看他们,进一步使用简单的手势来交互地进行照片排序、选择最喜欢的照片分享、或删除不想要的照片。这种Focus + Context设计允许用户通过刷子选择任何感兴趣的区域或对象(Focus区域),同时保留照片预览 (Context区域)。照片筛选过程变得更加灵活和以用户为中心。图1:用于照片筛选的“刷与拖”界面我们在一个苹果iPad 2上实现了我们的界面并邀请了很多用户对其进行评估。根据这客观和主观的测量,我们的“刷与拖”界面比传统的通过翻阅浏览照片的方法更好。参与者更喜欢我们的界面因为使用方便以及能够从多组相似的照片中更快地挑选出最喜欢的照片。1233.13.2 以人
15、为中心的总结有想当多的研究是关于幻灯片的,甚至是关于一些商业产品(例如苹果的iPhoto)用于在私人相册中人脸自动标识的。然而,现有的系统都不能在照片库中识别人以及它们的表情,以及使用这些信息和其他的一些相似特征组合,形成一个图片切换的联想链或浏览推荐。大多数现有的估测人的情感的技术,并没有将人的因素考虑进去,它们主要关注其他的全球的或本地的图片特性。我们开发了一种制作以人为中心的幻灯片的方法,考虑了人和情感因素。图2展示了该系统是如何运行的。用户指定他们想要包括的人以及他们分配给不同相似标准的权重。系统自动扫描照片库寻找指定的人的照片并进行人脸识别和情感估测。检索到照片,然后根据用户分配的各个值的权重,自动的排列成一个有意义的序列。由此产生的图片序列可以显示为幻灯片或向用户提供浏览建议。目前的相似标准包括面部情感/表情、时间线、颜色和场景特征。图2:以人为中心的幻灯片创作该系统具有灵活的设计,可以很容易地添加新的相似属性。它也贴合用户的喜好。可以为相似属性定义不同程度的权重,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026葡萄干行业原材料价格传导机制与成本控制研究报告
- 2026全球云计算基础设施服务市场格局与进入壁垒分析报告
- 企业财务管理优化实施方案
- 乡村产业发展与农村产业结构优化方案
- 售后服务人员培训与考核方案
- 福建省农村公共服务体系建设规划方案
- 从业资格伤寒考模拟试题及答案详解
- 2026年智能科技前沿知识普及模拟试题及答案详解
- 2026货运理论考试题库及答案
- (2026)特种设备安全管理人员安全考核考试题库及参考答案
- 统编版初中道德与法治九年级上册6.3文化自信日益增强 议题式教学课件(共35张)+内嵌视频
- 2026年卫生信息化系统管理岗医疗卫生事业招聘考试笔试试题(含答案)
- 大学英语四级词汇表 (完美打印版)
- 精神科患者的团体治疗护理
- DB54∕T 0533-2025 公路养护预算指标(定额)
- 5.1《从小爱劳动》课件 统编版道德与法治三年级下册
- 高校教师资格证之高等教育学完整版及答案【历年真题】
- T/CIS 67002-20213种剧毒鹅膏菌的物种鉴别PCR扩增-Sanger测序法
- 仁爱科普版(2024)七年级下册英语期末复习:语法填空+阅读理解+完型填空 解题技巧+练习题汇编(含答案解析)
- 《高速公路互通式立交桥设计原理》课件
- 社会工作概论课件
评论
0/150
提交评论