汽车行业深度报告:AI系列深度19期多模态如何从模型拼接走向统一_第1页
汽车行业深度报告:AI系列深度19期多模态如何从模型拼接走向统一_第2页
汽车行业深度报告:AI系列深度19期多模态如何从模型拼接走向统一_第3页
汽车行业深度报告:AI系列深度19期多模态如何从模型拼接走向统一_第4页
汽车行业深度报告:AI系列深度19期多模态如何从模型拼接走向统一_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

复盘多模态:基础模型如何统一语言、视觉与生成 4多模态的核心问题:统一表示下的理解、推理与交互 4多模态是“统一基础模型”在模态维度的兑现 4多模态发展阶段:对齐前移与转换损耗下降 5三阶段框架:对齐位置前移、转换损耗下降 5阶段一·外挂式/组合式:先把图像“接进”语言模型 5阶段二·原生多模态:把对齐前移到预训练 7阶段三·全模态Omni:把统一处理前移到实时交互 8理解生成统一与多模态推理仍待验证 10全模态Omni路线的瓶颈 10方向一:理解与生成的统一——三条技术路线 方向二:多模态推理——从语言o1到多模态深度思考 12结论:多模态收敛于同一个Transformer,深度推理仍是关键变量 13风险提示 13图1:多模态大模型发展三阶段:对齐位置前移、转换损耗下降 5图2:外挂式/组合式多模态的典型结构 7图3:全模态Omni路线与传统串联式流程对比 10图4:理解与生成统一的三条技术路线 12表1:多模态大模型发展三阶段框架 5表2:阶段一·外挂式多模态代表论文 6表3:外挂式多模态与原生多模态对比 8表4:传统串联式语音助手与全模态Omni路线对比 9表5:理解与生成统一的代表性探索 复盘多模态:基础模型如何统一语言、视觉与生成多模态的核心问题:统一表示下的理解、推理与交互人类智能天然是多模态的。人在认识世界时,视觉、听觉、语言、动作彼此交织、多模态是“统一基础模型”在模态维度的兑现在AI1.0时代,处理不同模态需要不同专用架构:图像用卷积网络,语音用隐马尔anoerokeOmni图1:多模态大模型发展三阶段:对齐位置前移、转换损耗下降多模态发展阶段:对齐前移与转换损耗下降三阶段框架:对齐位置前移、转换损耗下降我们对2021表1:多模态大模型发展三阶段框架阶段时间核心问题代表模型阶段特征CLIP、ALIGN、先分别训练视觉编码器、语言模型一外式/合式 2021—2023二、生模态 2023—2024三、态Omni 2024至今各模型技术报告与论文

如何让图像进入语言模型体系?多模态能否从预训练开始统一建模?能否由同一模型

CoCa Flamingo BLIP-2GeminiGPT-4o Qwen2.5-Omni

Q-Former从“图像输入+交互我们认为,原生多模态阶段始于2023年,可视为多模态大模型的元年。这一年起,阶段一·外挂式/组合式:先把图像“接进”语言模型2021—2023年,多模态模型处于外挂式/组合式阶段,核心问题是如何让图像进入语言模型体系。主流方法是先训练好视觉模型、语言模型或图文对齐模型,再通过连接表2:阶段一·外挂式多模态代表论文时间 代表论文模型 核心贡献 在多模态大模型中位用大规模图文对进行对比学习,把图像和文本映2021 CLIP2021 ALIGN2022 CoCa2022 Flamingo2023 BLIP-22023 各论文原文

/视频Q-Former将指令微调引入视觉语言模型,用GPT-4生成视觉指令数据,形成开源视觉对话模型

图文语义对齐的起点CLIP路线的规模化验证++多模态从“识别/问答”走向“助手式交互”CLIPCLIP4CLP解决的是“视觉世界如何接入语言语义空间”的问题,其图文对齐思想对Flamingo、BLIP-2StableDiffusionFlamingoangoBLIP-2Q-FormerLLaVA将指令微调引入多模态模型,用GPT-4生成多模态指令跟随数据,并把视大语言模型+token图2:外挂式/组合式多模态的典型结构阶段二·原生多模态:把对齐前移到预训练2023—2024年,Gemini标志原生多模态阶段开启,推动多模态能力在预训练阶段统一形成。token,再通过表3:外挂式多模态与原生多模态对比维度 阶段一:外挂式组合式 阶段二:原生多模先有视觉模型和大模型,再构建方式连接

从模型设计与训练开始就面向多模态能力源 多模是期入能力 多模是础型原能视觉编码器+连接模块+典型结构

言模型

强调统一预训练与跨模态联合建模朝多模态输入、多模态推理、多模态主要出 以文为主Gemini技术报告及相关论文

输出演进GeminiangoBLIP2LLaAGemini则强不再是语言模型的外部扩展,而逐步成为基础模型本身的内生能力。阶段三·全模态Omni:把统一处理前移到实时交互2024年至今,GPT-4o标志多模态大模型进入全模态Omni实时交互阶段,推动多模态能力从“统一预训练”进一步走向“实时统一交互”。OmniGPT-4oTGPT-4o代表的Omni表4:传统串联式语音助手与全模态Omni路线对比对比维度 传统语音助手:串式程 GPT-4o:全模态Omni路线技术式 多个块联合 单一型体处理典型流程模型结构

语音→识别→语言理解→语音合成→回答识别、理解、合成分属不同模型或模块

文本/图像/音频/视频→同一全模态模型→文本/音频/图像各模态输入输出由同一个神经网络处理直接处理音频输入,保留语气、节奏、语音解 先将音写文再解语音在识别阶段被压成文

情绪等非文本信息语音信息直接进入模型,保留细粒度信息保留

字,音色、停顿、情绪易丢失

交互信号交互迟 多模串,应条长 单一型接理响更接实时视觉参与核心意义

视觉作为额外输入模块,难与语音实时协同实现了语音入口,但仍是模块组合GPT-4o相关公开资料

我们将Omni第二第三第四2025年,Qwen2.5-Omni方式生成文本和自然语音;其提出的TMRoPE用于对齐视频与音频时间戳,Thinker-TalkerOmni图3:全模态Omni路线与传统串联式流程对比理解生成统一与多模态推理仍待验证全模态Omni路线的瓶颈我们认为,Omni路线在补齐“实时互动性”之后,主要面临以下瓶颈。Janus其二,离散与连续模态生成范式的统一。文本通常以离散token进行自回归建模,而图像、视频及原始音频属于高维连续信号,当前高保真生成更多采用扩散或流匹配。token/token体仍处于由“多模态输入—语言推理”向“多模态证据持续参与—潜空间推演”过渡的早期阶段。方向一:理解与生成的统一——三条技术路线针对“理解与生成表征冲突”这一核心瓶颈,业界提出多条代表性技术路线:表5:理解与生成统一的代表性探索时间 代表模型 技术路线 核心思路把图像和文本都表示为离散token,用统一2024

纯离散token/早融合

Transformer从头训练,支持交错图文的理解与生成将语音、文本、图像、音乐统一转为离散2024 AnyGPT token自回归+扩散2024 Transfusion混合自回归+离散2024 Show-o扩散混合2024 Emu3 next-token2024 Janus 2025 Janus-Pro +

token,使多模态像“多语言”一样接入大模型在单一Transformer中结合“预测下一个token”与扩散损失,同时处理离散文本与连续图像Transformer等tokentoken解耦“理解用”与“生成用”的视觉编码,缓解统一模型中理解与生成对视觉表示需求不同的冲突在Janus基础上通过训练策略、数据扩展和模型规模提升,增强理解与文生图能力各论文原文 整理归纳来看,主流路线有三条:纯自回归、自回归加扩散混合、解耦再统一。纯自回归路线(Chameleon、AnyGPT、Emu3)把所有模态都离散化为token,用统一的“预测下一个token”来建模一切。其优点是与大语言模型的架构和训练范式高PredictionisAllNeed、Show-o)在同一个态用扩散,在统一骨干内各司其职。2025年出现的BAGEL即采用混合专家式(JanusJanusJanus-Pro图4:理解与生成统一的三条技术路线方向二:多模态推理——从语言o1到多模态深度思考以o1接入更多模态转向让多模态信息进入推理循环。Omni路线2025年以来,多模态推理沿四个方向加速演进:—“结论:多模态收敛于同一个变量我们对多模态大模型从外挂式拼接、到原生统一、再到全模态Omni的发展历程进行了复盘,核心结论如下。tokenTransformer的视觉特征接入语言模型,原生阶段让多模态数据从预训练起进入统一骨干联合建模,全模态Omni阶段由

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论