版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
TOC\o"1-2"\h\z\uLLM:以文本为核心的语言基础模型 4概念界定与提出背景 4核心机制:自回归预训练与Transformer 4能力边界与应用场景 4代表性模型与公司 4VLM:视觉模态如何接入语言底座 5概念界定与技术脉络 5核心机制:视觉编码、模态对齐与语言推理 5能力边界与应用场景 6代表性模型与公司 6VLA:动作输出如何进入多模态模型 6概念界定与提出背景 6核心机制:动作表征、连续生成与系统分工 7能力边界与应用场景 8代表性模型与公司 8LLM、VLM、VLA关系:模态扩展与约束递进 8架构关系:从文本到视觉再到动作 8问题与数据递进:从数字语料到真实动作轨迹 9演进时间线 9中国厂商在三个层次的布局 10风险提示 10表1:LLM代表性模型一览 5表2:VLM代表性模型一览 6表3:VLA代表性模型一览 8表4:LLM、VLM、VLA多维对照 9表5:LLM–VLM–VLA关键演进时间线 9表6:中国主要厂商在LLM、VLM、VLA三个层次的布局 10LLM:以文本为核心的语言基础模型LLMVLMVLA概念界定与提出背景坦福CRFM确+核心机制:自回归预训练与LLM以自回归方式进行下一词元预测依托TransformerTransformer令(HFnsucGT1.B人175BChatGPTDeepSeek-R1能力边界与应用场景LLM(Agent)代表性模型与公司表1:LLM代表性模型一览模型机构时间关键信息GPT-3OpenAI20201750亿参数,自回归GPT-4/4oOpenAI2023/2024多模态;参数未官方公开PaLMGoogle20225400亿参数,Pathways训练,Google官方,Llama3.1Meta20248B/70B/405B,开放权重,Meta官方博客,旗舰多模态对话模型;参数未公开,Anthropic官Claude3/3.5AnthropicClaude3/3.5Anthropic2024DeepSeek-V3/R1深度求索2024.12/2025.01通义千问Qwen2.5/3阿里巴巴2024–2025V3总参671B、激活37BMoE;R1纯RL推理Nature20250.5B–235B;72BLlama-3-405B,技术报告,文心ERNIE 百度 2023起
知识增强;国内最早对标ChatGPT之一,百度官方,混元Hunyuan 腾讯 2023起 千亿参数级,全链路自研,腾讯云官方,GLM/Kimi/
智谱/月之暗面/MiniMax
2024–2025
GLM-4系列;KimiK2总参约1T、激活32B,开源;MiniMaxabab/M系列OpenAI、Meta、Google、Anthropic、DeepSeek等公司官网 整理VLM:视觉模态如何接入语言底座概念界定与技术脉络LLMASurveyonMultimodalLargeLanguageModels为LLMLLMVLMpatchtoken化;CLIP4-语言对齐基础;Flamingo提出Q-Former确立视觉编码器、投影层和LLM的主和Gemini进一步将VLM核心机制:视觉编码、模态对齐与语言推理VLM1)2)MLP、Q-Formertoken;3)LLMtokentokenCogVLMLLM区分拼接式多模态与原生多模态两类路径。VLMtokenLLMLLMtokentoken能力边界与应用场景VLMOCR(GUI)代表性模型与公司表2:VLM代表性模型一览模型 机构 时间 关键信息CLIP OpenAI 2021
约4亿图文对对比学习,视觉-语言对齐基座Flamingo DeepMind 2022 80B,门控交叉注意力,少样本BLIP-2 Salesforce 2023 Q-Former连接冻结视觉编码器与LLM/4o OpenAI 2023/2024 商用多模态,图入文出/omni,Gemini Google 2023起 原生多模态Qwen-VL/2-VL 阿里巴巴 2023–2024 动态分辨率+M-RoPE;72B可比InternVL上海人工智能实验室/商汤2023起InternViT-6B,开源,学术影响大CogVLM/GLM-4V智谱AI2023起视觉专家深度融合Yi-VL/Step/豆包零一万物/阶跃星辰/字节2024起开源6B/34B;千亿级多模态;C端规模化OpenAI、GoogleDeepMind、Salesforce、阿里巴巴等公司官网 整理VLA:动作输出如何进入多模态模型概念界定与提出背景视觉-语言-GoogleDeepMindtoken语言tokenSayCan的语言规划和技能执行,以及GatoX-Embodiment/汇集22100万agNeVA核心机制:动作表征、连续生成与系统分工VLAVLMVLM和π0VLMPaliGemma50HzNVIDIAGR00TN1System2System1GO-1-语言VLAtokenOpenVLA50HzVLMGR00TN1GO-1体token路线一,离散动作tokentokentoken和OpenVLA。token,π050HzVLMtokenVLMtokenGO-1连续轨迹之间的隐动作token,属于厂商表述中的中间层设计。该设计试图在语义规划和连续控制之间建立更稳定的接口。System1/System2VLAVLMtokentoken能力边界与应用场景VLA代表性模型与公司表3:VLA代表性模型一览模型 机构 时间 关键信息Google 2022 token化,700+指令GoogleDeepMind 2023.07 首个命名知识迁移OpenX-Embodiment/RT-X
21家机构 2023 22本体、100万+轨迹OpenVLA 斯坦福等 2024 7B开源,约97万演示,超π0 PhysicalIntelligence 2024 PaliGemma+50Hz连续动作GR00TN1 NVIDIA 2025 开源人形基础模型,双系统GeminiRobotics GoogleDeepMind 2025 基于Gemini2.0,动作为新输出模态GR-2/GO-1/GraspVLA
字节/智元/银河通用 2024–2025
视频-语言-动作;ViLLA隐动作;合成数据抓取基座GoogleDeepMind、PhysicalIntelligence、NVIDIA等官方网站 整理LLM、、VLA关系:模态扩展与约束递进架构关系:从文本到视觉再到动作LLMVLMLLM基在VLM出,通常通过动作token、动作头或连续动作生成模块实现。问题与数据递进:从数字语料到真实动作轨迹NVIDIA黄仁勋在CES2025将AI划分为感知AIAI和物理VLA表4:LLM、VLM、VLA多维对照维度LLMVLMVLA输入文本图像+文本图像+语言指令+本体状态输出文本文本机器人动作关键技术自注意力、预训练、RLHF视觉编码器+模态对齐动作token化/流匹配/双系统训练数据 文本语料 图文对,CLIP约4亿,
机器人轨迹,OpenVLA约97万,代表作 GPT、DeepSeek CLIP、、Qwen-VL 、π0、GR00TN1关系定位 基座 LLM+视觉 VLM+作出AttentionIsAllNeed《LanguageModelsareFew-ShotLearners《LearningTransferableVisualModelsFromNaturalLanguageSupervision《TrainingLanguageModelstoFollowInstructionswithHumanFeedback》等学术文献 整理演进时间线表5:LLM–VLM–VLA关键演进时间线年份 里程碑 所属层次2017Transformer架构GoogleLLM底层架构2018GPT/BERT,预训练范式确立LLM起点2020GPT-3,1750亿参数,LLM规模化2021CLIP,OpenAI,约4亿图文对,VLM起点2022FlamingoDeepMind/ChatGPT发布VLM成熟/LLM出圈2023GPT-4V/RT-2,首个命名VLA,VLM→VLA跨越2024π0/OpenVLAVLA扩散2025GR00TN1/GeminiRoboticsVLA+人形机器人基础模型OpenAI、GoogleDeepMind、Meta等公司官网整理中国厂商在三个层次的布局MiniMax/VLA表6:中国主要厂商在LLM、VLM、VLA三个层次的布局厂商LLMVLMVLA/具身DeepSeek阿里巴巴,通义字节跳动,豆包是是是部分是Qwen-VL是—生态/投资是,GR-2,硬件双线,百度,文心是是—腾讯,混元是是—智谱AI月之暗面KimiMiniMax上海人工智能实验室/商汤是是是是,书生,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 跨境数字芯片氮化铝薄膜中跨国压电系数d33测试标准互认-基于国际半导体设备与材料协会氮化铝压电测试标准规范分析
- 跨境数字碳中和数据中心中跨国可再生能源购电协议环境溢价-基于国际可再生能源环境溢价核算标准及各国PPA环境溢价确认规则规范分析
- 2026年退役电池回收环保技术应用与效果评估
- 楼梯间使用安全准则
- 2026年河南驻马店市泌阳县中招模拟测试地理试卷
- 2026年广西钦州市第四中学春季学期八年级4月学情自测地理
- 天津市和平区2025-2026学年下学期高一期末考试语文试题(含答案)(解析版)
- 增添用户乐趣元素的设计条例
- 2026年浙江省人教版六年级英语下册第12单元课后练习
- 2026年江苏省人教版初中数学第3章专项训练题库
- 2026年中小学教师(语文)副高级职称评审答辩题库及答案
- 学校管理与教师专业发展手册
- 初中音乐七年级上册《美丽的草原我的家》深度鉴赏与跨文化理解教案
- 2026秋新人教版英语五年级上册单元一Unit 1 Different friends测试卷-提高卷附答案(文档中已插入听力音频)
- 2026年餐饮服务食品安全管理员试题及答案
- GB/T 47950-2026资产管理数据资产登记指南
- 2026版《医师外出会诊管理暂行规定》课件
- 影像医学技术操作规程大全
- 2026年河南高考地理考试试卷及答案
- 中国老年抗中性粒细胞胞浆抗体相关肾小球肾炎治疗指南总结2026
- 2026版中华人民共和国生态环境法典深度解析课件
评论
0/150
提交评论