版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大语言模型在计算机视觉领域的应用演讲人:冯佳时
02
基于LLM的图像理解
03
基于LLM的视频生成目
录
04
总结展望
01
背景介绍背景介绍"a
计算机视觉的基本问题草地,猫,树,天空物体检测物体识别物体分割猫"a
计算机视觉的基本问题大象戴着生日帽海底漫步大脑乘着火箭飞向月球黏土做的火车引擎图像和视频来自Google
Imagen视频生成图像生成3D生成LLM统一模型大语言模型(例如
ChatGPT
)情感分析输入文本翻译生成问答是否可基于LLM搭一个生
成理解统一的
视觉基础模型?图像理解
基础模型
图像生成"a
视觉基础模型
–
生成与理解的统一“在草地上奔跑的小猫”“在草地上奔跑的小猫”基于LLM的图像理解LLM
图像理解与文字描述生成"aLLM在图像理解中的应用映射层:将图像
的特征对齐到大
语言模型的特征图像编码器:抽取图像的特征
映射层
图像编码器
“左边是一只羊驼,右边是一只美洲驼”“图片中的动物是什么?”幻觉•
语言模型缺少对图像内容
的参考,容不存在
的内容。•
从语言模型的训练语料中,
构造出常见的内容,例如
“红色的”。缺少细节理解•
只是对图像内容全局的描
述。•
缺少图像内容像素级别的
理解,例如分割、检测等。•
限制了模型与实际物理环
境交互的能力。"a
一些问题“左边是一只羊驼,右边是一只红色的美洲驼”"a
带定位能力的
LLM图片来源:Wanget
al.
GRUtopia:
Dream
General
Robots
in
a
City
at
ScaleLLM拓展LLM的输出:文字描述
-->文字+相关物体图像中的定位•
提供更明确的答案•
和真实世界建立对应"a
相关工作图片来源:
LISA:ReasoningSegmentation
viaLargeLanguageModel相关物体的分割结果现有模型的局限•
需要借助一个大规模的分
割模型
(例如
meta
的SAM),
严重拖慢响应速度。•
只能定位和分割一个物体,
无法应用于需要输出多个
物体的场景。高效性•
使用SAM增加了模型的计
算成本。•
将分割模型SAM替换成轻
量的MLP,提高响应速度。多物体•
之前的工作只能检测分割
出单个物体。•
引入多个token,模型能
够完成多个物体的分割。"a
我们的方案:
PixelLM"a
PixelLM
的模型架构轻量级的物体
分割代表多个物体
的分割码本大语言模型图像
编码器12•
目标物体可能有不同的尺寸大
小(如右图所示)•
利用
OpenAI
的
CLIP
模型作为
图像编码器,并且提取多个尺
度的图像特征,方便识别分割
不同尺寸的物体。只定位分割出一个尺寸的物体"a
PixelLM
模型细节
–
图像特征提取OpenAICLIP:
LearningTransferableVisualModelsFromNaturalLanguageSupervision•分割词表包含多个token组,
每一
个对应图像的一个尺度的CLIP
特
征。•每个token组包含多个tokens,
一
起捕捉目标物体的语意特征。•将多个token组的解码结果融合,
可以得到多个物体的分割结果。"a
PixelLM
模型细节
–
分割词表的设计第一组分割
tokens第二组分割
tokens•
高效的分割解码器•包含多个注意力模块,每个对应一个特征尺度•前一个生成的分割结果,会指导后面分割的生成"a
PixelLM
模型模型预测的分割tokens多尺度的
图像特征训练的损失函数:•帮助模型分辨和学习分割不同的目标物体•
将分割的预测记为
M1,
…
,
Mk分割的训练损失函数:"a
PixelLM
训练方法整体模型的训练损失函数:不带L_ref的PixelLMvs.完整
PIxelLM输出文本的损失函数物体分割的损失函数已有数据集的局限•
细节不够丰富•
缺少带有文字问答的标注一个新的数据集–
MUSE•910K
高质量的实例分割标注(选自LVIS*)•平均超过100
tokens的实例文字描述•246k
问答对,每个回答平均带3.7个物体•
超过1000个物体类别"a
PixelLM
训练数据构造通过LLM
构造训练数据PROMPT回答*LVIS是一个涵盖1000多个日常物体的实例分割数据集。•
和之前的模型
LISA
相比,
计算量减少一半。•
分割精度显著提升
(9.6
->
37.7)"a
PixelLM
的表现"a
应用实例•PixelLM
是一个新的LMM模型,可以进行像素级别的图像理解和推理。•为了促进后续的研究工作,构建了MUSE数据集。•未来的扩展:具身智能对物理世界的理解上。"a
总结基于LLM的图像视频生成"a目前的视频生成模型OpenAIsora"a
目前的视频生成方案
–
文字描述到视频
文生视频模型
“一个男孩儿骑
着自行车…
”图像扩散模型
扩展到时间维度
视频扩散模型Yuetal.
Make-A-Video:Text-to-Video
Generation
without
Text-Video
Data.
2023"a
目前的视频生成方案
–
扩散模型一致性•
长时间保持一致性
对目前的视频生成
模型是很大的挑战。•
人物一致•
环境一致创作界面与可控性•
长视频的内容需要
复杂的文字描述。
视频创作过程对用
户不友好。•
文字描述很难对视
频内容精细控制。视频的表现力•
在动作、表情的丰富度上有局限。"a
视频生成模型面临的挑战•更友好的交互方式:指定角色和剧本,提高对视频内容的控制。•提高一致性:
StoryDiffusion模型中的一致性模块•提高表现力:StoryDiffusion模型中的运动生成模块LLM
/
图像生成模型
LLM
StoryDiffusion"a
新的视频创作流程角色一致的
关键片段剧本,
分镜创作角色定义完整视频Yan
LeCunYan
LeCun
登月探险"a
StoryDiffusion
的效果StoryDiffusion剧本生成角色定义LLM•对剧本中的多段文字,同时生成对应的多。•在多的生成过程中
,引入相似的图像特征,保证角色的一致性。"a
StoryDiffusion的关键模块:
一致性注意力多个文字prompt,以及生成的对应图像。图像生成模型中引入一致性注意力机制。•在关键画面之间,生成过渡运动。•在特征空间中进行画面的差值,生成平滑运动。"a
StoryDiffusion的关键模块:
运动生成•
运动表现力强
,一致性好。"a
StoryDiffusion的运动生成效果"a
与已有的方法比较内容一致性比较SEINESparseCtrlStoryDiffusionLPIPS(↓)0.430.490.37CLIPSIM(↑)0.920.900.96IP-AdapterStoryDiffusion图文相似度0.610.66角色相似度
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 学生考试纪律告知书
- 小区加装电梯方案
- 物业设施设备维修监理细则
- 物业小区绿化服务部管理制度及养护流程
- 教师防滑防冻不落实个人整改措施
- 2026年山东中考生物试题附答案
- 《城市地震灾害应急救援手册》
- 选择性必修3 第三十五课 课时3 简单判断的演绎推理
- 创业担保贷款申请
- 学校突发公共卫生事件应急手册
- 2026上海闵行公安机关专业特保招聘602人笔试模拟试题及答案详解
- 2026河南南阳南召县招聘巡防队员招聘60人笔试模拟试题及答案详解
- DB61 1226-2018 锅炉大气污染物排放标准
- 格力多联机空调维护保养手册
- 水利部职称考试指定用书《水利知识》试题
- 脑梗死恢复期的护理课件
- DB31/T 1011-2016燃气用户设施安全检查技术要求
- 施工现场驾驶员安全教育
- 安全生产责任法律风险防范培训课件
- 《网络综合布线系统工程技术实训教程(第5版)》 课件全套 王公儒主 第1-15章 网络综合布线系统工程技术- 综合布线系统工程管理
- 福禄克787信号发生器使用
评论
0/150
提交评论