通信行业深度:机器人的泛化和ChatGPT时刻挑战、路径与猜想_第1页
通信行业深度:机器人的泛化和ChatGPT时刻挑战、路径与猜想_第2页
通信行业深度:机器人的泛化和ChatGPT时刻挑战、路径与猜想_第3页
通信行业深度:机器人的泛化和ChatGPT时刻挑战、路径与猜想_第4页
通信行业深度:机器人的泛化和ChatGPT时刻挑战、路径与猜想_第5页
已阅读5页,还剩27页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

内容目录投资件 4我为关“化”? 5“化是前人的键题 5定:型在未见布保性能 5分:觉/语/泛化等 5曙:前器存“泛”的几案例 6语泛(RT-2):听懂糊令 6环泛(π0.5):新环中泛并总成功但在 7组泛(π0.7):从“空炸烤薯瞥见合化曙光 8跨体化(π0.7):“脑手的能显现 8对:GPT珠在机器处何阶? 10多务略:π0可比GPT-1 10模:GPT-1证通预练线 10器:固序走通策略 10新境化:π0.5类比GPT-2 11模:GPT-2,步的化力 11器:π0.5,环境化 11组泛:π0.7于GPT-2与GPT-3之间 11模:GPT-3,下文习力 11模从InstructGPT到ChatGPT,从务到人意交互 12器:π0.7,超越环泛,还是ChatGPT式互 12挑:前器泛的局性原因 14问题1:从务行,效、定与时能力不足 14础作执率有限 14时任的程完能不足 14实动,表现不定 16问题2:从三验看,开测不分 16π0.5:试揭泛表现不衡 16π0.7:少公权验证 18问题3:评口不,模成难横比较 18归:什机泛化显弱大言型? 20型:VLA世模型模路尚收,据Scaling方未可用源型少 20据:质练数规增难大 20展:器泛提的路与ChatGPT24路:前业机器泛的个验 24用多据:GEN-0证器人ScalingLaw 24异数上训练 25用模网据 27用针性据训练 29猜:1亿时署ScalingLaw机的ChatGPT时刻 30何义器的ChatGPT时? 30何现机人GPT刻需1小量据、“署ScalingLaw” 30要久多业人预未五内器人迎ChatGPT31投建:何前局机人的“ChatGPT刻” 32整:注硬、垂整合 32核零件视感器谐减器无电机行滚丝、巧手等 32风险示 33图表目录图表1:RT-2对新、背、境备布泛化力 6图表2:RT-2的些力 7图表3:π0.5整新间 7图表4:π0.7使空炸锅部原是训数据见过气锅 8图表5:π0.7现跨体泛能力 9图表6:大模能效地用下信息 11图表7:InstructGPT于人反的阶对训练程 12图表8:zero-shot,one-shot,fewshot与统调模的比 13图表9:机人化与GPT型进段照 13图表10:π0.5在见实家中部任进评测 14图表11:π0.5在见实家中部任进评测果 15图表12:π0.7未长程任从言导自执行过程 15图表13:π系部模在部任上进对比 16图表14:ColosseumV2的任范与π0.5三评测置 17图表15:π0.5在三基准的础能扰泛化现 17图表16:π0.5与ACT第三基中基性与扰泛表现 18图表17:STAR-Gen器人化测系分类 19图表18:大言型具身型据布异 20图表19:GR00TN1人基模数金塔 21图表20:DROID器采集台 22图表21:RoboCasa多化厨仿场示例 22图表22:机人型据规表 22图表23:GEN-0训数据模下任表的Scaling24图表24:GEN-1规预训与功提示意 24图表25:π0.7的练推理构意图 25图表26:RT-2模的练与署念图 26图表27:RT-2使了维链理生“划”,作视推和作成之的梁 27图表28:π0.5在OOD体上部消实验 28图表29:Dyna-2:视频据模升来机跨体化力强 28图表:π.5D...图表31:RT-2RT-1与VC-1部能对比 29图表32:多产人共同言机人在来5内近ChatGPT31图表33:部机人司概(值据至2026年8月24日盘值) 32投资要件ChatGPTSOTAGPT如何定义机器人的ChatGPT不同于大部分市场人士认为的“当前机器人仍然停留在‘专机’、要完成某项任务,必须专项训练没有泛化能力,只会跳舞和‘抓拿放’”,也不同于极少部分市场人士认为的“机器人很快就会无所不能、人类将被全面替代”,我们试图了解产业进展的真相,我们注意到机器人存在泛化能力的若干证据:2023年发布的RT-22025π0.52026π0.7π.72026年发布的Dyna-2SOTAGPT-3模型端:究竟使用VLA/投资建议:在迎接机器人的ChatGPT时刻到来的路上,我们认为,应当提前布局以下产业环节。关注标的:优必选(收购了硬件公司锋龙股份、向上整合)、越疆(协作机器人头部公司)、仙工智能等。催化剂:2027年,特斯拉人形机器人Optimus我们为何关注“泛化”?“泛化”是当前机器人的关键问题AI领域的关键问题。CEOAI景中,机器人成功率可达100%,但场景一旦更换,成功率便急剧下跌。机器人公司PhysicalIntelligence为,”(),()定义:模型在OOD(未见分布)保持性能arGn/分类:视觉/语义/行为泛化等Star-Gen项目将机器人模型范式VLA(Vision-Language-Action,视觉-语言-动作)语境中的泛化分类为三种:语义泛化视觉泛化行为泛化某种特定的干扰因素可能会出现在这些类型中的一个或多个的交集中。例“如把,胡在萝卜放到盘子上”这个任务中,改变胡萝卜的位置就会同时影响图像呈现(视觉方面)以及所需的操作行为(行为层面)。PhysicalIntelligence认为机器人的泛化等级不同。其中,语义泛化层级较高是床上。同时,还需要确定适合用于擦拭污渍的工具。视觉泛化层级较低的餐具,而且这些餐具还被放在了一堆脏盘子之中。曙光:当前机器人存在“泛化”的几个案例可喜的是,我们已经在机器人产业中注意到“泛化”存在的证据。语义泛化(RT-2):听懂模糊指令TransformerGoogleDeepMind2023VLALanguage6000RT-2(图表1:RT-2对全新物体、背景、环境具备分布外泛化能力oogleDeepMind官RT-2RT-2符号理解)如“将可乐罐挪动到字母X逻辑推理VLM苹果移动至颜色相同的杯子旁”)、数学推理(“把香蕉放到数字‘2加1’的计算结果旁边”)和多语言理解(“muevelamanzanaalvasoverde(注:西班牙语,意为把苹果移到绿色杯子里)”)。人物和物体识别泰勒图表2:RT-2的一些能力oogleDeepMind官环境泛化(π0.5):新环境中的泛化并不总能成功,但存在2025年4月,PhysicalIntelligence宣布其新开发的π0.5模型能够在完全新的环境中实现有效的泛化能力,比如清理机器人没在训练数据中见过的新家中的厨房,或“卧并室不总是能第一次尝试就成功,但往往能体现出一个人面对新挑战时的灵活性和机智处理能力。”图表3:π0.5能整理新房间hysicalIntelligence官组合泛化(π0.7):从“用空气炸锅烤红薯”瞥见组合泛化的曙光JSONJSON20264Intelligenceπ0.7——无需微调(),PhysicalIntelligenceπ0.7PhysicalIntelligence当PhysicalIntelligence要求虽然PhysicalIntelligenceπ0.7π0.7PhysicalIntelligence图表4:π0.7能使用空气炸锅的部分原因是在训练数据中见到过空气炸锅hysicalIntelligence官跨本体泛化(π0.7):“一脑千手”的可能性显现PhysicalIntelligenceπ0.7RobotiqUR5e始机作员被要求使用双手动UR5e375图表5:π0.7展现出跨本体泛化能力hysicalIntelligence官对照:GPT珠玉在前,机器人处于何种阶段?ChatGPTAlphaGo破,再由GPTScaling走向通用,最终在ChatGPT到能走向,银行通用创始人兼CTOGPT各代模型经历了从“专用任务能力”向“跨分布迁移能力”的演进。GPT-1:GPT-2:zero-shot()GPT-3:few-shot/in-contextlearning()GPT-3):针对对场场景,微调GPT-3.5对应到机器人领域,泛化水平也可以理解为从固定程序执行,逐步走向多任务策略、新环境泛化、组合泛化和跨本体泛化。多任务策略:π0可类比GPT-1大模型:GPT-1验证通用预训练路线GPT-1Transformer同一个预训练模型由此能够适配文本蕴含、语义相似度、阅读理解、常识推理等不同任务,而无需针对每类任务重新设计一套完全不同的模型架构。较基础的机器人泛化表现,是从“固定程序”走向“多任务”策略。传统工业机器人:PhysicalIntelligenceπ0数据预训练、OpenX-Embodiment数据和自有8种机器人数据训练通用机器人策略,任务覆盖叠衣、做咖啡、收拾餐桌、打开爆米花等。这一阶段类似GPT-1:重点不是证明模型已经具备强泛化能力,而是证明通用预训练的路线在机器人领域可行。从这一角度看,π0与GPT-1具有较强的路线相似性,GPT-1模型适配多个NLP任务,而π0则覆盖多种操作任务。新环境泛化:π0.5可类比GPT-2大模型:GPT-2,初步的泛化能力GPT-2GPT-2GPT-1即表现出初步的泛化能力。这背后的核心逻辑是,当训练数据的规模和多样性达到一定程度后,模型可以从自然语言数据中隐式学习多种任务,并将这些能力迁移到训练时没有被明确标注的新任务中。但GPT-2GPT-2z力仍处于早期阶段,模型在“阅读理解”等部分任务上已经能够取得有竞争力的表现,但在“摘要”任务上的定量表现仍较为初级;从实际应用角度看,其泛化能力距离可用仍有较大差距,在“问答”和“翻译”等任务中,也只有当模型具备足够的参数规模时才开始超过简单基线。机器人:π0.5π05P-2ro-t

零样本)能力跃迁。二者都说明,规模化、多样化的预训练能够产生超出单一训练分布的迁移能力。π0.5组合泛化:π0.7介于GPT-2与GPT-3之间大模型:GPT-3,上下文学习能力GPT-2GPT-3in-contextlearning(上下文学习)能力,用户只需要在输入中提供任务说明和少量示例,图表6:大型模型能更高效地利用上下文信息penAI官大模型:从InstructGPT到ChatGPTGPT-3OpenAIInstructGPTGPT-2GPT-3GPT-3GPT-3(SFT);PPOChatGPT在GPT-3.5ChatGPTLH图表7:InstructGPT基于人类反馈的三阶段对齐训练流程penAI论文《Traininglanguagemodelstofollowinstructionswithhumanfeedback(LongOuyang等)机器人:π0.7ChatGPT式交互能力水平上,π0.7介于GPT-2和GPT-3之间。GPT-2GPT-3之下,GPT-3原则上不需要更新模型参数,仅依靠上下文中的少量示例即可调整任务行为。图表8:zero-shot,one-shot,fewshot与传统微调模型的对比penAI官π0.7也有InstructGPTChatGPTPhysicalIntelligence图表9:机器人泛化水平与GPT模型演进阶段对照能力阶段大模型代表机器人代表核心判断通用预训练路线验证GPT-1π0已经开始使用同一个模型学习多种任务零样本跨分布迁移GPT-2π0.5新环境可调用已有技能,但稳定性仍有限已出现技能组合,但尚不能熟练上下文学组合化上文习 GPT-3 π0.7 习指令齐自交互 InstructGPTChatGPThysicalIntelligence官网、OpenAI官

尚无严格对应模型

机器人尚不能与人类实现ChatGPT式交互20267GPT-3阶段,AgenticGPT-320272028GPT-3API挑战:当前机器人泛化的局限性与原因当前机器人泛化能力的局限可以进一步归纳为三个层面:一是实际任务执行能力仍存在边界,二是第三方独立验证仍不充分,三是不同研究的泛化评测口径尚未统一。第一项回答的是机器人能否在现实中稳定做成,后两项则关系到这些能力是否已经得到独立、可重复和可比较的验证。问题1:从任务执行看,效率、稳定性与长时程能力仍不足机器人泛化能力的进步已经相当明显,但“能够进入新环境”不能等同于“能够自主解决开放世界中的新问题”。π0.5PhysicalIntelligenceπ0.5π0.52—5PhysicalIntelligence半的任务进度。因此,较高的任务进度并不一定意味着机器人已经具备稳定的全流程自主执行能力;它也可能是完成了多数子任务,但在某个关键环节停滞或失败。图表10:π0.5在未见真实家庭中的部分任务进度评测hysicalIntelligence官图表11:π0.5在未见真实家庭中的部分任务进度评测结果hysicalIntelligence官长时程任务的困难,还在于机器人必须让每一个中间动作都在物理世界中真实成立。语言模型生成一段较长的回答时,即使前面的文字存在小幅偏差,后文仍可能保持基本连贯;机器人则不同,一次抓取位置偏移、物体滑动或抽屉未完全打开,都会直接改变后续步骤所面对的状态。图表12:π0.7未见长时程任务从语言指导到自主执行的过程hysicalIntelligence官图表13:π系列部分模型在部分任务上的进度对比hysicalIntelligence官VLARADARVLA3DIoU期望值0.2610.068。π0.7RADARπ0.7它揭示了当前VLA问题2:从第三方验证看,公开复测仍不充分π0.5π0.5π0.520265月发布的ColosseumV228项任1316100种扰动开展200次测试。评测结果表明,π0.5已经表现出一定的视觉和动作迁移能力,但基础动作能力不够稳定,对语言表达变化、初始状态变化和复杂双臂任务仍较敏感。第三方评测所揭示的,是一种“局部泛化能力已经形成,但整体能力尚不均衡”的状态:π0.5ACT(ActionChunkingwithTransformersTransformer的动作分块策略),说明通用预训练并未自然转化为较高的基础动作成功率。ACT指一次前向推理预测未来k步连续动作,由斯坦福ALOHA团队在2023年论文中提出。视觉泛化相对较强。π0.57.73%9.86%ACTπ0.519.16%24.0%。π0.551.4%图表14:ColosseumV2的任务范围与π0.5第三方评测设置OLOSSEUMV2:BenchmarkingGeneralizationforVisionLanguageActionModels(JeremyMorgan,PrajwalVijay,HyeonhoOh,JincenSong,AshvinArora,AlinaDu,GauravS.Sukhatme1,JesseThomason,IshikaSingh图表15:π0.5在第三方基准中的基础性能与扰动泛化表现OLOSSEUMV2:BenchmarkingGeneralizationforVisionLanguageActionModels(JeremyMorgan,PrajwalVijay,HyeonhoOh,JincenSong,AshvinArora,AlinaDu,GauravS.Sukhatme1,JesseThomason,IshikaSingh图表16:π0.5与ACTOLOSSEUMV2:BenchmarkingGeneralizationforVisionLanguageActionModels(JeremyMorgan,PrajwalVijay,HyeonhoOh,JincenSong,AshvinArora,AlinaDu,GauravS.Sukhatme1,JesseThomason,IshikaSinghπ0.7与π0.5PhysicalIntelligenceπ0.7PhysicalIntelligencePhysicalIntelligence官方OpenPIπ0π0-FASTπ0.5checkpointπ0.7π0.7π0.7问题3:评测口径不一,模型成绩难以横向比较当前机器人泛化研究的另一个局限,并不完全来自模型本身,也来自评测体系,不同研究对“泛化”的理解和测试方式并不一致。有的只是改变物体颜色、纹理或背景,有的要求机器人进入完全陌生的住宅,有的测试不同的语言指令,或把同一套策略迁移到不同机器人本体上。这些测试都可以被归入“泛化”,但难度并不在同一层级。80%STAR-GenGenSTAR-GenBridgeV2-STAR4个55STAR-Gen2213OpenVLAMiniVLAπ0885图表17:STAR-Gen对机器人泛化评测体系的分类TaxonomyforEvaluatingGeneralistRobotManipulationPolicies(JensenGao,SuneelBelkhale,orsaSadigh,SudeepDasari,AshwinBalakrishna,DhruvShah,DorsaSadighSTAR-Gen的测试结果显示,现有VLA模型在多数泛化维度上的绝对表现仍然有限,语义泛化尤其薄弱。模型较容易在以下情形中失效:也就是说,采用大语言模型或视觉语言模型作为骨干,并不会自然解决机器人侧的语义泛化问题。语言模型知道一个词“是什么意思”,不代表机器人已经学会如何把这一语义稳定转化为物理动作。归因:为什么机器人泛化仍显著弱于大语言模型?Scaling机器人任务持续时间越长、包含的操作阶段越多,机器人需要连续正确完成的感知、规划和控制决策也就越多,局部误差如果不能及时发现和纠正,就可能在后续步骤中不断放大。因而,一个真正适用于家庭和工厂的通用机器人,不仅需要知道下一步应该做什么,还应当具备以下能力:VLA模型,尚未有定论。VLA测机器人所处环境的下一个状态、甚至是机器人自身的动作会如何改变所处环境,如20268Dyna-2VLADyna-1另外,可以发现,机器人可用的开源模型较少,仅有π0.5等。token()token/集成本和可用性均不同,训练数据规模增长难度较大。例如,机器人数据采集必须同时处理视觉识别、空间定位、运动规划等信息。一次抓取偏移、物体滑动或相机噪声,会真实改变后续状态,使错误在物理世界中累积。同样是“拿起杯子”,不同机械臂、夹爪、相机位置和控制频率都会导致动作分布变化,机器人模型不仅要理解任务语义,还要学会特定身体如何执行任务。图表18:大语言模型与具身模型数据分布差异earningPrimitiveEmbodiedWorldModels:TowardsScalableRoboticLearning(QiaoSun,LiujiaYang,WeiTang,WeiHuang,KaixinXu,YongchaoChen,MingyuLiu,JiangeYang,HaoyiZhu,YatingWang,TongHe,YilunChen,XiliDai,NanyangYe,QinyingGu顶层:Real-WorldData()收集方式UMI夹爪等;优点缺点中层:SyntheticData()收集目的优点缺点底层:WebData&HumanVideos()收集目的优点缺点图表19:GR00TN1机器人基础模型数据金字塔伟图表20:DROID机器人采集平台ROID官图表21:RoboCasa多样化厨房仿真场景示例oboCasa官CEO2026WAIC100token100图表22:机器人模型数据规模表机器人模型 发布时间 预训练数据规模RT-1 RT-1 2022年12月 13万机人episodes,700+RT-2 2023年7月 沿用RT-1机人据时使互网据π0 2024年10月 1万时上器数据π0.5 2025年4月 基于额移操据及络据同练GEN-0 2025年11月 超过27个时真界不操数据GEN-1 2026年4月 50小以真物互数据Dyna-2 2026年8月 100小预练类一视视频oogleResearch,GoogleDeepMind,PhysicalIntelligence、GeneralistAI、DynaRobotics官触觉:人类视频:展望:机器人泛化提高的路径与ChatGPT时刻路径:当前产业提高机器人泛化的几个经验使用更多数据:GEN-0验证机器人ScalingLawGEN-027万小时验证机器人存在ScalingLawGeneralistGEN-027Scaling图表23:GEN-0预训练数据规模与下游任务表现的Scaling关系eneralistAI,GEN-GEN-02025272026450Generalist1GEN-0图表24:GEN-1大规模预训练与成功率提升示意eneralistAI,GEN-PhysicalIntelligenceπ0.5VLA哪里;π.7PysicalInlgnce),图表25:π0.7的训练与推理结构示意图hysicalIntelligence官Star-Gen也发现“更大且更多样化的数据集能够显著提升泛化能力,例如视觉泛化和行为泛化”。图表26:RT-2模型的训练与部署概念图T-2官VLART‑2VLM中理解这些概念并执行相应操作。在训练阶段,RT-2把动作转化为token,与互联网视觉和语言数据共同训练;推理阶段,RT-2将token反解为动作,实现闭环控制。视觉语言预训练RT-2继承了VLMVLM在动作即tokenRT‑2将机器人动作表示为token,与自然语言token1812150112”,这一设计使VLM无需改变输入输出空间即可在机器人数据上训练,是泛化得以实现的关键技术前提。端到端统一架构RT‑2实现了单一端到端训练的模型,直接训练VLM思维链推理的融合:RT-2的PaLM-E变体进行了少量梯度步微调,并引入“计划”步骤,使模型在输出动作前RT-2rxbar巧1128124136121158111255图表27:RT-2使用了思维链推理,生成“计划”,作为视觉推理和动作生成之间的桥梁官PhysicalIntelligencePhysicalIntelligence训练了π0.5OOD而言:(WD)OOD(即π0.5)(ME)(CE)OOD((π0.5)(ME)尤其重要。图表28:π0.5在OOD物体上的部分消融实验hysicalIntelligence官WDMECEWebMultipleEnvironment多CrossEmbodimentdata((π0noMEnoDyna-21000100(scaling100,10090%。图表29:Dyna-2:人类视频数据规模提升带来人机跨本体泛化能力增强yna-2官PhysicalIntelligence100(已)图表30:π0.5OOD跟随率与训练场景的数量呈一定正相关hysicalIntelligence官RT-2RT-2(PaLM-E-12BPaLI-X-55B的RT-RT-1VC-13PaLI-XPaLM-E务上更具优势,推测源于PaLM-E图表31:RT-2RT-1与VC-1oogleDeepMind官猜想:1亿小时、部署ScalingLaw与机器人的ChatGPT时刻如何定义机器人的ChatGPT时刻?关于机器人的ChaPT银河通用创始人兼CTO王鹤(20266):能力强:zero-shot70%至80%;使用门槛低:CEO姚卯青(2026WAIC):能力强:使用门槛低:(2026)能力强:使用门槛低:如何实现?机器人GPT时刻需1亿小时量级数据、或“部署ScalingLaw”部分产业人士提出机器人GPT时刻或需1亿小时量级数据。2026WAIC(CEO1GPT业内也存在1000万小时左右的估计。1Generalist披露,GEN-1ScalingLaw。20266aingLaw建立在预训练LossLossLossChatGPT时刻5ChatGPT图表32:多位产业人士共同预言,机器人将在未来5年内接近ChatGPT时刻人物 公司/职务 场合与时间 对标GPT哪一格GPT

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论