下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
从隐空间认识CLIP多模态模型
1前言
AIGC可生成的内容形式包含文本(文句)、图像、音频和视频。它能将文本中的语言符号信息或学问,与视觉中可视化的信息(或学问)建立出对应的关联。两者相互加强,形成图文并茂的景象,激发人脑更多想象,扩大人们的思维空间。其中,最基础的就是文本(Text)与图像(Image)之间的学问关联。本篇来介绍文本与图像的关联,并以CLIP模型为例,深化介绍多模态AIGC模型的幕后架构,例如隐空间(Latentspace)就是其中的关键性机制。
2简介CLIP模型
在2022年,OpenAI团队提出了CLIP,它是典型的多模态(Multi-modal)机器学习模型。OpenAI从互联网上找到大量的文本(Text)与图像(Image)的配对,可以用来训练CLIP模型,然后让CLIP进行其猜测任务,即是输入1张图像,然后猜测出哪一个文本与它是配对的。
CLIP的目标是透过大量图片及文字描述,建立两者间的对应关系。其做法是利用ResNet50等来萃取图像的特征,并映射到隐空间(Latentspace)。也就是将图像编码成为隐空间向量。
同时,也利用Transformer萃取与图像相配对文句的特征,并將文句编码成为隐空间向量。最终经由模型训练来渐渐提高两个向量的相像度。换句话说,CLIP能将图像和文句映像到同一个隐空间,因此可以快速计算图像与文句的相像度。
CLIP模型学习整个文句与其对应的图像之间的关系。当我们在整个文句上训练时,模型可以学到更多的潜在的东西,并在图像和文句之间找到一些规律。值得留意的是,在训练CLIP模型时,我们输入的是整个文句,而不是像猫、狗、汽车、电影等单一类别而已。
3CLIP的基本架构
CLIP的核心设计概念是,把各文句和图像映射到隐空间里的一个点(以向量表示)。针对每一个文句和图像都会提取其特征,并映射到这个隐空间里的某一点。然后经由矩阵运算,来估量它们之间的相像度,如图1。
在训练CLIP模型的过程中,会不断调整各点的位置(在隐空间里),以表达出它们之间的相像度。CLIP在整合文句与图像两种模态上有突破性的表现。一旦训练完成之后,就可以对新图像进行猜测了,亦即猜测出一个文本与它是配对的。例如,输入1张新图像,经由图像编码器(如ResNet50)来提取这张图象的特征,然后映射到隐空间里的一个新的点。
然后经由矩阵运算,即可猜测出它与我们所给的一些文句的相像度,就可以得到猜测值了。此外,CLIP也能输入描述文句来找到相对应的图像。
4图解CLIP的空间对映
兹以中药材的CLIP为例,例如有4张中药材的图像,以及其对应的文句,或单词(图2)。
这里的文本与图像之间的对应关联,可以是人们赐予的,也可以是从互联网页的数据而得来的。那么CLIP模型就来建立这些关联性。
在前面已经说明白,CLIP会利用ResNet50等模型来帮助提取各图像的特征,并将各图像(随机)对映到隐空间(即数学上欧式空间)的点。同时,也使用Transformer模型来关心提取个文句的特征,并将各文本(随机)对映到隐空间的点(图3)。
这就是空间对映(Spacemapping),意味着从可观看空间(即上图里的图像和文句空间)对映到隐空间。
5绽开训练
在进行训练的过程中渐渐地修正CLIP模型里的参数(如weight和bias值),也就是渐渐地调整隐空间里各点的位置(坐标),来呈现出这些点之间的相像性(Similarity)。例如,在隐空间里,我们可以让愈相像的点,会愈相互靠近(图4)。
以上训练完成了。其智能表达于模型里的参数(如weight和bias)值里。虽然人们可以理解文本和图像的涵意,但并无法理解模型里的参数,以及所计算出的隐空间向量的涵意,所以才称为隐蔽性空间,或称黑箱(Block-box)。
6猜测范例1:从图像找文本
在刚才的训练过程中,CLIP已经持续调整各笔数据(如文本和图像)的其隐空间里的位置(以隐空间向量表示),来表达其所蕴含的关联性。一旦训练完成了,就能进入猜测或推理的阶段了。
例如,拿来1张新图像输入给CLIP,它就(要求ResNet50等)来帮忙提取这新图像的特征,并依据其所训练出来的参数(即weight和bias)值,而计算(对映)出这个新点在隐空间里的位置(图5)。
由于这张新图像的特征与左边第3张(由上而下)图像特征很接近,也就意味着这两张图象很相像,所以在潜藏空间里两者会很靠近。如此,计算出这个新点与其他各点之相像度,然后挑出相像性最高的文本是:枸杞(图6)。于是,就顺当完成从图像关连到文本的任务了。
7猜测范例2:从文本找图像
刚才的范例是:从图找文。CLIP还可以供应:从文找图。例如,拿来一个新文句输入给CLIP,它就(要求Transformer等)来帮忙提取这新文句的特征,并依据其所训练出来的参数(即weight和bias)值,而计算(对映)出整潜藏空间里这个新点的位置。接着,计算出这点与其他各点之相像度,然后挑出相像性最高的图像(图7)。
由于CLIP幕后有Transformer预训练模型来帮忙,可以发觉”宁夏枸杞”与”银川枸杞”两个文本很
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 热转移防护膜涂布工创新意识强化考核试卷含答案
- 信息安全管理员技术水平模拟考核试卷含答案
- 中小电机笼型绕组制造工操作管理测试考核试卷含答案
- 重冶净化工发展趋势水平考核试卷含答案
- 2026年国家职业卫生试题重点题(新版)
- 材料力学试题及答案
- 伊索寓言试题及答案
- 2026年湖北省人教版初中英语第9章同步练习题
- 2025-2026学年陕西省西安一中高三(上)期中地理试卷
- 办公室自查报告(3篇)
- DB44T 1444-2014 聚氯乙烯(PVC)软管
- 江西省2018-2024年中考满分作文121篇
- 科瑞技术:资产评估报告
- 2025年全国统一高考英语试卷(全国一卷)含答案
- 船舶管系基础知识
- 沈阳辅警考试试题及答案
- 晕针晕血的应急预案及处理流程
- VDA6.3-2023过程审核检查表
- 实验动物与动物实验
- 眼的胚胎发育课件
- 围棋启蒙教程
评论
0/150
提交评论