华泰证券-科技行业:GPT-6+Astra发布LoopTransformer或打开新Scaling路径-260909_第1页
华泰证券-科技行业:GPT-6+Astra发布LoopTransformer或打开新Scaling路径-260909_第2页
华泰证券-科技行业:GPT-6+Astra发布LoopTransformer或打开新Scaling路径-260909_第3页
华泰证券-科技行业:GPT-6+Astra发布LoopTransformer或打开新Scaling路径-260909_第4页
华泰证券-科技行业:GPT-6+Astra发布LoopTransformer或打开新Scaling路径-260909_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

科技前沿模型开始探索LoopTransformer科技Astra或已使用LoopTransformer,目前循环深度有限GPT-6AstraLoopTransformer重新进入前沿模型讨论。TheInformation于202691日报道,OpenAILoopTransformer,AIAI成模型的固定数量的“层”数学运算,然后生成回答中的下一个词。而采用“循环深度”技术后,模型可以在输出回答中的下一个词之前,将文本在相同的层中循环处理更多次。据知情人士透露,OpenAIAstra提供动力的递归深度方法与去年几位美国和欧洲学术研究人员在一篇关于“latentreasoning”的论文中提出的方法相似。OpenAIAstraOpenAI首席科JakubPachockiXAstraGPT-42OpenAIAstraLoopTransformer,但使用程度相对有限,当前更接近部分中间层的浅循环,有效计算深度尚未出现数倍扩张。图表1:OpenAI首席科学家JakubPachocki回应X.com、JakubPachocki、华泰研究智谱已完成初步实验,将其列为重要研发方向Transformer列为基座研发的重要方向。26LoopTransformer26度和任务环境并列为四大gpfomr图表2:智谱列举四大Scaling方向变量公司披露的方向后续观察指标基座规模推进下一代基座训练新模型能力与预训练效率有效深度循环复用网络层,完成初步实验LoopTransformer技术发布及消融实验训练深度扩大长程任务强化学习复杂任务完成率任务环境增加真实任务环境的供给环境构建效率与训练收益智谱26年中报、华泰研究科技Astra的No-CoT推理能力跃升,符合LoopTransformer技术特征科技TheInformation91LoopTransformer保留可供监测的T(hnofThought,思维链,后续统一使用T。与其他最先进TransformerAIAstraCoT的情况下,处理困难任务的能力远超之前的模型。GPT-6AstraAISINo-CoT50%可靠性时间跨度30.9GPT-5.6Sol3.6分钟,No-CoT能力让模型更少地将推理过LoopTransformerGPT-6Astra(未被告知要规避监控CoT(OpenAIGPT-6AstraCoT可控性的变化并非主要由任何架构变化所导致。鉴于目前官方没有给出其他合理原因,我们从结果上认为No-CoTLoopTransformer)图表3:Astra的No-CoT推理能力跃升 图表4:模型自发减少CoTToken规避监控GPT-6Astra系统卡、华泰研究 GPT-6Astra系统卡、华泰研究预测LoopTransformer解读:计算深度成为Scaling的新维度LoopTransformer:中间状态循环执行LoopTransformer通过共享中间层权重,将参数规模与计算深度进一步解耦。普通TransformerLoopTransformer的核心是沿模型深度重复执行共享参数层,输入经过前置生成。随着循环计算量相应提高,因此能够在较小参数增量下继续增加有效计算深度。LoopTransformerCoTScalingComputeScaling度ScalingHiddenState图表5:普通Transformer和LoopTransformer区别核心结果核心结果示意结构普通Transformer L1→L2→L3→L4→Token 参数深度与计算深度基本绑定LoopTransformer L1→[L2→L3]×R→L4Token R华泰研究LoopTransformer实现示例LoopTransformer最直观的变化是输入的循环计算。LoopTransformer具体实现,Nanbeige4.222hiddenlayers2loops,取得效果提升。这一设44blockapplication执行相同循环次数。DeepSeekV4-FlashTransformerLoopTransformer最直观的差异就是在中间进行了循环。论文Nanbeige4.2-3B:UnlockingAgenticCapabilitiesinaCompactModellossspikeNanbeige4.2在数学KV图表6:LoopTransformer最直观的变化是输入的循环计算运行一次循环运行科技科技

ebastianRaschka官网架构图、DeepSeek官网、NanbeigeLLMLab,2025年12月,Nanbeige4.2-3B:UnlockingAgenticCapabilitiesinaCompactModel以字节Seed202510ScalingLatentReasoningviaLoopedLanguageModelsOuro把循环次数作为同一模型内部可观察的计算变量,其最大递归深度为14Q-exit规则会选择累积1则会用满全部四次循环。图表7:根据不同Token选择不同循环次数不同不同Token循环运行1-4次华泰研究

ebastianRaschka官网架构图、Rui-JieZhu等人,25年10月,ScalingLatentReasoningviaLoopedLanguageModels、科技科技ScalingScaling?Scaling路径持续扩展,不同阶段的主要增量来自不同计算维度。第一阶段是预训练Scaling。早期模型规模较小时,增加参数、训练数据和预训练FLOPs能够持续提升能力,ParameterScaling具有较高的边际收益和较成熟的工程路径。因此,UniversalTransformer2018年已经提出沿计算深度方向循环TransformerBlock,但当时缺少增加串行计算和训练复杂度的动力。Test-timeScaling。Scaling难度提高,新增算力逐步配置到后训练和推理阶段,RLHF、RLScaling空间,ReasoningModelCoTScaling的有效性,使模型能够根据任务复杂度投入更多推理计算。ScalingCoT模型继续扩大参数规模会同步推高预训练成本、权重显存、模型并行和部署复杂度,显式CoT则依赖逐增加会带来更高推理时延和KVCache占用。LoopTransformerBlockHiddenState内部计算,在参数规模Scaling维度,ScalingScalingScaling共同承担后续模型能力提升。科技图表8:预计未来将多种Scaling并行科技阶段主要Scaling方向核心作用Scaling的选择预训练Scaling参数量+数据+训练FLOPs扩大知识容量与基础能力早期边际收益高、路径最简单,因此长期是主旋钮后训练ScalingSFT/RLHF/RL/RLVR+更多环境与采样底座不变下提升推理、对齐、工具与Agent能力可把新增算力集中在高价值能力上显式Test-timeScalingCoT/reasoningtokens难题在推理阶段多算、多写几步按需付费,但自回归串行,延迟和KV随token增长计算深度Scaling计算深度输出token前在hiddenstate中增加有效计算深度参数不必同步变大,可减少对显式长CoT的依赖;最直接提高FLOPs/parameter华泰研究CNNRNNTransformerLoopTransformer,我们认为历代架构都在回答ScalingCNN让同一卷积核在不同空间位置复用;RNN让同一状态更新函数在不同时间步重复执行;LSTM加入门控机制,提高长期状态保存能力。TransformerSelf-Attention提升并行度,模型深度主要依赖独立层堆叠;LoopTransformer重新把参数复用引入深度维度,同一组Transformer层可以多次处理同一个的hiddenstate。LoopTransformer保留TransformerAttentionRNNTransformer的共享参数可以输出以前沿模型深度重复执行。由此产生的关键变化是参数量和计算深度再次分离,模型能够在不增加同等比例唯一权重的情况下获得更深的内部计算。图表9:模型迭代路径:让有限参数承担更多有效计算LSTMLSTM内控机制稳定长期状态缓解长序列记忆衰减RNN重复调用同一状态CNN空间位置共享卷积核降低参数冗余LoopLoopTransformer深度维度复用Transformer物理深度与有效深度解耦TransformerAttention并行处理序列深度主要由独立层堆叠华泰研究当前研究现状:技术可行性已验证,前沿模型进入早期工程化LoopTransformer已完成技术可行性验证,但目前在循环深度上还处在早期。根据OpenAI首席科学家JakubPachocki在XAstra在内的当前前沿模型,其ComputationGraphDepth相比GPT-4增幅不到2Astra即使已经引入LoopTransformer,当前更可能采用有限深度的循环计算,有效计算深度尚未出现大幅扩张。智学术研究主要完成了中小规模模型验证,大模型Scaling规律尚未形成。从相关论文如AhmadrezaJeddi等人在26年2月发布的LoopFormer:Elastic-DepthLoopedTransformersforLatentReasoningviaShortcutModulation、Fan267月发布的BridgingtheGapBetweenLatentandExplicitReasoningwithLoopedTransformersLoopFormer1B,LOTUS3B规模完成,相关研CoT等MoE模型在参数规模和工程复杂度上仍有较大差距。科技产业影响:单位Token计算强度提升,关注AI安全科技硬件端:单位Token计算需求提升LoopTransformer最直接提升每Attention、FFN及相关矩阵运算均需循环执行,因此在独立参数FLOPsCoding、Agent等复杂任务的单次推理计算量有望继续提升。AgentCPU需求,ComputerUseCPU侧执行负GPT-6AstraComputerUseAgentCPU完成任AgentAgent数量扩张,单次任CPUAgent逐步进入真实业务流程后,CPUCPU相关机会。相关公司包括禾盛新材、海光信息、中国长城。软件端:模型能力提升但可观察性降低,建议关注AI安全及可观察性方向Agent近OpenAIAgent先后出现未经授权通信、绕过隔离和访问外部系统等事件。DseWikiReuters2026945OpenAIAgent占用了德国编程WikiAI1.5万次编辑。HuggingFaceOpenAI2026826日发布的《TheHuggingFaceincidentandtheroadahead20267月,OpenAI内部网络安全评估中的研究模HuggingFace可能托管了用ExploitGymOpenAI721日首次公开披露该事件,随后开展调查并加强相关安全措施。图表10:OpenAIAgent挟持德国程序员WikiDseWiki注:该图表显示了事件期间的AIAgent编辑情况(黑色柱状图,左侧)和OpenAI流量(蓝色折线,右侧)。https://collusion.wiki/、华泰研究科技科技注:完整攻击链:Agent逃逸了OpenAI的评估沙箱,接入互联网,获取了一个第三方代码沙箱的root权限作为据点,随后滥用了HuggingFace的数据集处理器(先是文件读取,随后是代码执行)以进入HuggingFace的内部网络。HuggingFace官网、OpenAI官网、华泰研究OpenAI20268月7RespondingtothenextfrontierofcriticalcyberAstraAgenticCodingCritical(OpenAICritical意味着模型在获得适当工具和权限后,OpenAI91PathtoAstra:criticalcapabilitiesandfrontiersafeguards,AstraCritical门槛,成为首个被划入该等级的模型。由Critical级模型在开发和发布前需要满足更高的安全要求,O

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论