版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
展来自AI开发公司新数据集的证据产品编号:RR-A5043-1关于兰德研究诚信我们的研究诚信基于兰德的质量和客观性核心价值观。严格的质量保证程序、利益冲突筛选和资金透明度确保每项研究都是客观和无党派的。如欲了解更多信息,请访问/in兰德公司的出版物不一定反映其研究客户和赞助商有限的印刷和电子分发权使用许可的信息,请访问/about/publishing/per新兴的美国和中国商业人工智能(AI)开发系统地描述美国和中国的商业人工智能生态系统,从而拓宽商业智础。为此,我们构建了一个由总部位于美国和中国的人工智能开发这些开发人员符合一系列创新标准。然后,我们分析了这一数据集关于美国和中国人工智能开发人员人口的基本描述性信息,每个国及每个国家公司采取的技术方法。这份报告填补了解释现代人工智中的一个重要空白,该领域在很大程度上依赖于轶事证据或官方政先进人工智能的公司进行系统的跨国比较。研究中美两国创新体系兰德全球和新兴风险是兰德公司的一个部门,就文明和全提供严格和客观的公共政策研究这项工作由该部门的人担,该中心旨在研究快速技术变革的机遇和风险,重点关这项研究是在人工智能、安全和技术中心内独立发起和致谢能开发的对该数据集的分析产生了对每个国家人工智能发展生本报告的正文中介绍了这些描述综合这些研究结果,首先,在我们的样本中研究的两个人工智能开发在大多数维度上,例如,模型架构、商业定位的人工智能开发公司生态系统非常相似。这两个国家都是以变垂直行业(如制造业、交通运输和能源)。美国公司专注于知识密集型直行业,如医疗保健,科学研究和网络安全。通过这些措施,这两个生这一发现说明了正在进行的关于美国在人工智能方面是否并没有得到我们的数据的支持。然而,如果通术、世界模型和物理环境学习共同发展,那么我们从中国式人工智能产品组合代表了一种有意义的对冲,最后,我们分析了模型路由提供商OpenRouter的美国模型的采用模式。在这一人群中,中国的开放式体重模型从型的发布,这些模型提供了类似前沿基准的性能,价格约为美国之一专有模型。由于OpenRouter在结构上过度代表了开放权于技术复杂,对成本敏感的开发人员,因此这一发现最好被解释员在这一特定人群中采用的方向性信号,而不是更广泛的全球v这项工作中,我们提供了经验基础,植根于开源源,这些来源在两国的覆盖面不均匀:中国公司的信息缺失率较高,这意关于本报告三C障碍11介绍1C.障碍23构建数据集3第二阶段。应用入选标准 5 6C.障碍310C障碍414商业定位15开放重量状态20C障碍524模型架构25学习范式26数据模态27核心功能30C.障碍632结论32APPENDIXA34APPENDIXB42APPENDIXC45公司级分类提示(Gemini2.5Pro)45APPENDIXD49缩略语.53关于作者56图4.5.发布不限重量车型的公司所占份额201新兴的美国中国的商业人工智能(AI)开发重新定位,该行业的重大变动导致两国对行业构成的理解持续存据匮乏的环境下,美国和中国商业人工智能生态系统的大部分内已经在扩展范式上共同投入了数百亿美元,在这种范式中,开发在替代模型架构和方法上不够多样化。1获得优势的潜力的质疑。这些举措,再加上中国在机器人领域投资的证据,引发了人们的担忧,即美国可能在嵌入式人工智能以及将人工智能融入工业和这些说法的真实性是间接的。如果这是真的,这种不平位,成为第一个实现人工通用智能(AGI)的国家,如果扩展范式在性能改重大限制的话。然而,考虑到人工智能行业的规模和活力,仅能会扭曲每个国家更广泛的商业人工智能开发者格局。此外,映美国或中国的技术能力或商业活动的实际分布评估这些索赔2生态系统。我们的研究承担了这一任务:我们构建了一个广泛国和中国人工智能开发行业的基本描述性统计数据。第四章考察业定位,包括商业定位,模型起源,应用领域和开放重量状态。了每个国家的企业所采取的技术方法:模型架构、学习范式、数和核心功能。我们在第6章中总结了研究结果讨论了用于对公司进行分类的人工智能驱动中使用的关键提示,附录D提供了用于实施第2阶段人工智能开发人员3正如我们将在本章后面更详细地描述的那样,我),人工智能开发人员的关注是由易处理性和他们代表私营部门人假设驱动的,尽管我们完全承认政府,大学,基础设施提供商系统。该术语仅指符合本文和附录D中所述人工智能开发者包括大学、政府机构、研究实验室或其他非公司行为者,即使我们的数据收集过程分三个阶段进行。首先,我们构建组织展示了人工智能开发活动的证据。其次,我们根据使用AI开发活动的补充指标在缺乏此类公司的单一具体来说,我们使用四个来源构建了候选组织列表:雇用个人从事AI开发工作的组4雇用人工智能开发人员提供了强有力的证据,证明公司发尽管一些人工智能相关角色的员工可能会支持范围外的活动),司积极投资于人工智能特定的人力资本,这是持续内部是直接参与推进人工智能能力的明确指标。根据定义,发布人工智能研究展。专利受让人代表投资开发新颖的、可受法律保护的人工智能相关发明的组织。因此,专利活动提供了一个补充,比单独的就业或出版数据更展信号。将专利受让人包括在我们的人群中有助于捕获那些进行人工智能研究和开发(RD)的公司,这些公司可能无法通过学术出版物对研究密集型公司的偏见,并提高更广泛的商我们用于这一类别的数据来源是德温特创新指数专利数受让人,我们利用经济合作与发展组织(OECD)于2025年5一系列AI专利。从这个集合中,我们生成了将模型提交给AI基准或排行榜提供了直接模型供外部评估。参与这些基准需要内部模型开发能力,因此与我们利用了两个排行榜:第一个是汇总了各提供商基准测试结果的性能排改进了这份名单,以确保数据集集中于总部位于美第一个标准(即,该组织是一家公司)确保遵守该研究对追求利润的公司。因此,大学、政府研究实验室和个人研8ArtificialAnalysis,“LLMAPIProvidersLeaderboard-Comparisonofover500AIModelEndpoints.”6最终标准确保最终样本仅包含符合我们对AI开发人员定义的组织。在本报告中,人或支持人工智能的系统-而不是主要应用或研究部门,经常性的模型发布或出版物,或对新的人工),),公司部署人工智能进行欺诈检测的银行,提供基于其有人工智能工具应用于客户工作流程的系统集成商,以及人发布、描述内部培训的技术出版物或记录在案的人工智能研究部门),该公司将被排除“否”分类,而不管其他证据。附录D中提供了用于实施该标准的完整分类提示背景研究收集的变量包括基本描述性特征(如成立年业定位细节(如商业定位模式和模型来源)和技术变量(如模型7对于某些公司变量,我们补充了额外的数据来源。在对公司类时,例如其主导的人工智能架构或其产品和服务的学习范式,我们授予评估,这些公司与即时细化过程中使用的任何公司变量对分开对变量分类,一个人工评分员将他们与代理人分类的一致性分为强这项评价有两个相关但不同的目的。首先,它提供了一个第二,审计有助于限制我们在后面章节中报告的从代理数据可能的测量误差。对于二元分类变量,代理报告分数和相应的人类代理分歧率限制,假设审计具有代表性,并且人类评级被百分点的保守测量误差这个界限是保守的,因为它假设所有的在审计中,几乎所有保留用于分析的变量都显示出人类评分员如,我们最初考虑在我们的数据集中跟踪公司创始人和工智能搜索代理和内部团队成员都很难为这个变量获得一致的分叙述相互冲突,公司层次结构模糊,以及领导者在公司之间的快8通过将大学、政府机构、政府研究实验室、个人研究人员和们的研究之外,我们产生了一个样本,尽管在分析上很有用,家的完整人工智能生态系统。被排除在外的行业在人工智能发些作用在美国和中国之间可能有很大不同。因此,本报告中的尽管如此,我们仍然认为,这个以公司为中心的子集是因有三。首先,商业公司是当代人工智能系统开发、部署和传播究成果转化为产品、平台、基础设施和嵌入式系统,他们通常决触到用户、客户和下游开发人员。第二,关注企业可以使分析更业、专利、出版物、模型发布、商业产品和公共技术文件等可观比较。第三,许多关于美国和中国人工智能竞争的政策相关主张行业的产业结构,重点关注诸如公司是否集中在基础模型,他们工智能系统,他们是否正在发布开放权重模型,以及创新活动如与此同时,利用商业人工智能公司对国家人工谨慎。这些假设假设认为,商业人工智能部门占据了每个国家先比,这些假设可能更适用于商业部署、产品导向和产业扩散例如算、大脑启发架构或其他非转换器方法的最具投机性的工作可能资助的研究中心,而不是商业公司。如果这是真的,我们的公司用于构建候选公司名单和公司变量数据集的过程在美国9板块中国的专业人士渗透率远低于美国,这意味着这一步可人员和雇用他们的公司。这种影响对于那些在与中国人民解放军或其他中国安全部门有联系的公司工作的个人来说可能尤其明显共职业形象。这部分被我们基于专利的提取步骤所抵消:中国政的激励措施,通过专利数据浮出水面的中国公司数量超过了我们有价值,但可能会错过那些研究出现在我们使用的索引系统不太据库中的公司这种影响可能被中国人工智能研究人员在顶级英语类似地,当填充公司级变量(例如,模型架构,学习范式)要少。这一问题影响到如何解读跨国比较。当一个国家的未知率高异可能反映了实际生态系统的差异和公开披露的差异例如,如果中缺乏关于模型架构或学习范式的公开文档,那么在指定的技术类别能部分反映了数据的可用性,而不是真正的缺乏。因此,后面的章在解释本报告中的估计值时,应注意缺失和观察到的差异的大较小的差异,特别是只有几个百分点的差异,应被视为描述性的变化速度-公司进入,退出,枢轴和重新定提出的跨国比较应该被理解为每个生态系统的快照在那个时首先,我们提供了五个关键的公司层面特征相关分类变量报告为计数和列百分比;发现年可变美国(n=743)中国(n=438)总部所在国成立年份,中位数[IQR]n=734n=431公开交易是的没有未知军事AI关系是的没有未知多样化公司是的没有未知注:分类变量显示计数(国家列的%)。发现年份显示中位数[第25-75百分位数]和非缺失值的n。由于四舍五入,数字之和可能不等于100。我们将每家公司分配到一个国家生态系统,使用其总部所在国,定义为公司报对于每家公司,我们记录成立年份,定义为公开文件或公司美国2010-2019年的IQR和2014年的中国企业(IQR2003-2017)。我们进一步分类公司的公开上市状态。如果公司在任何如果公开来源直接记录了该公司与其国内军方(美这种关系的证据,尽管考虑到中国国防工业人工智能活动的公开最后,多元化公司指标衡量的是一家公司是否属于美国公司主要集中在沿海地区的主要技术集群中。公),),),),),),度学习突破后的商业人工智能投资和公司组建浪潮一致。Aldeveloperfirmsbyyearoffounding,2000-2025Yearfounded在这一章中,我们考察了美国的商业导向中国的的。例如,一个公司可以被标记为基础开发人员和模型适配器立15Applicationdomain序两国主导的商业定位模式都是应用型AI产品的开发大约90%的美国公司和75%的中国商组成-约占每个国家公司的10%因此,将商业人工智能竞赛视为一系列前沿API提供商之间的竞赛的流行框架描述了这两个国家人工智能开发者生态系统的一个大多数公司正最大的不对称是在内部使用类别。大约16%的中国公司属于这一类别,而美国样本的这一比例为10%。在中国,这类公司中有许多是大型国有企业、公用事业、受监管的银行和电信公司。这一模式与观察结果一致,即中国企业的输业或能源业。商业定位维度询问公司如何销售人工智能,而尽管基金会模型开发吸引了媒体的最大份额,但只有19%的美国人关注它。在我们的数据集中,大约19%的中国企业被标记为基金会开发商,尽管中国企业数据的高缺失率(28%)可能掩盖了两国在这一维度上的细微差异根据现有数据,在这两个国家,公司更Task-SpecificModelTask-SpecificModel特定任务模型开发在美国样本中(52%)比在中国样本中(38%)更普遍。我们在美国的样本中观察到的常见特征的一些说明性例子是Abridge(见附录B中的案例研究),它同样值得注意的是,解释这一差距需要谨慎。正如附限。鉴于中国人在这一维度上的未知率较高(28%),我们不能确信在特定任务模型发应用领域维度记录了每个公司的目标垂直市场。一个公司可以服务于一个以上的领应用领域是两个生态系统之间最明显的结构差异。中国企),19最明显的差距是在国防领域;13%的美国公司被贴上标签,我们在本章中考虑的第四个商业维度是公司是否发布任Shareoffirms(%)通过计算企业数量来评估美国和中国的生态系统,也显示出类似的集中度:美国约15%公司至少发布一个开放式重量模型,而中国同行只有17%每个国家的其余公司都是独资公司。有些将模型使用保持在内部(应用产品和内部使用公司);其他人通过封闭的然而,我们在下一节中提出的论点是,仅仅公布开放式权重模型的使用也很重要。开发人员实际构建的模型集是塑造产品、OpenRouter是一个面向开发人员的网关,它将API请求路由到来自数十个模型提供商和推理供应商的大约300个前沿和开放权重模型。它按模型和排除了消费者聊天机器人的使用和提供商API的直接使用(例如,请求直接发送到OpenAI、Anthropic或Google,而不是通过OpenRouter)。与我们的OpenRouter是从美国内部访问许多开放权重中国模型的主要方式,这使得数据非常适合三个警告适用于OpenRouter数据,在本节中应牢记在心。首先,Op第二,因为OpenRouter在结构上过度代表了相对于更广因为中国的前沿模型主要是开放权重模型,而领用户群不是全球开发者偏好的中立样本,可能与描述相对第三,OpenRouter上的使用模式可能会排除部和/或定制的API进行的,而这些API并没有在OpenRouter平台上被捕获。考虑到这些警告,我们将OpenRouter数据解释为中国开放权重模型在注:虚线标记了改变开发人员采用的显着模型发布在美国三在供应商中,只有谷歌的Gemma模型系列是开放重量的(并且只有较小的尺寸;Gemini前沿模型仍然是专有的)。为什么中国的开放式权重队列在这一市场中取代了封闭式API提供商?部分答案可能取决于价格和性能之间的关系图合成本。中国的开放权重模型集中在每百万代币1-2美元的狭窄区间内,智力得分约为54.美国领先专有模型的智能分数约为48-60,每百万代币约为1-12美元在智能轴的顶列以大约四分之一到五分之一的价格提供了可比的测量智能80来源:作者根据OpenRouter定价数据和已发布的模型评估进行的计算注意事项:中国的开放式体重模型(红色)在智力得分上与美国大部分专利队列(蓝色)相当,集中在一个紧在本章中,我们将考察同一企业群体的五个技术维度:模型形态、物理形式因素和核心功能。关于这些维度的更录B中讨论了根据这些维度对公司进行分类的人GenerativeAdversarRecommendation/Pers本报告中的许多分析都有两个数据覆盖范围说明,适用的技术披露不均衡许多公司描述了他们的产品,但没有描述类,但这些信息通常来自技术博客文章、白皮书和研究出版物可能捕获公开记录其技术活动的公司,从而对披露较少的),正如已经讨论过的,未知类别在这两个国家都是索引等会议建立的AI/ML技术分类法来实现的17我们利用内部主题专家的洞察力对这些),CNN在视觉和感知管道中的持续流行一致扩散模型出国公司中,主要是在图像和视频生成方面。总体而言26●自我监督学习(例如,下一个令牌预测)监督学习是美国样本中最常见的模式(56%),在中国样本中则不太常见(35%)。自我监督学习是LLM预培训的基础模式,在20%的美国公司和16%的中国公司中被标记,与第4章中描述的类似基础开发人员队列规模然而法,应该记住中国的高未知率(60%对35%)RL是一个有趣的比较类别,因为它在两个生态系统中的应用不同。19%的美国公司和19%的中国公司都采用了RL,但这些公司以不同的方式应用这种学习模式在对公司级信接偏好优化,OpenAI,Anthropi方面,这个概念更经常与机器人、车辆控制和工●音频或语音●表格结构数据视觉和文本是这两个生态系统中最流行的两种形式,它们的60%的市场上被标记公司和67%的中国公司,以及文本标记分别为58%和51%。两国的视尽管中国企业数据在这一变量上的缺失率为17%,但缺失程度小于本章中的其他变量,这Genomic/Molecular-数据形态维度为中国在体现式人工智能方面的实力提供36%的中国公司使用3D或空间数据,而美国只有27%公司,传感器或物联网被标记为29%对25%。另一方面,对于表格或结构化、时间序列、基因组或分子数据形式(与知识工作更密切相关),美国公司的流行率略高于中国公司,尽管大多数差异在于数据缺失所设定的29物理形状因子维度记录了公司的AI在以下类别中交付的物理实例化(如果有的话)●仅软件(无实施例)物理形式因素是两种生态系统分歧最大的维度在我们的数据集中,61%的美国公司只做软件,而中国公司只有26%。在这一维度上,中国的未知份额为22%,由于中国企业的正分配数量应被视为下限(附录B),因此真正的软件差距可能是真实的,但在幅度制造检查和材料处理的人形和四足机器人,用于运输的自动能源监控的传感器网络部署相比之下,美国在医疗保健、科核心功能维度记录了人工智能系统被用来做什么这些类别并不是相互排斥的一个产品可以同时执行感知和规划,或者同时执行语言理解和代码合成分类器分配所有有明确推荐/个性化多智能体/分布式未知/未分类。Recommendation/Personalization大多数类别显示中美之间只有适度的差异。感知和感知、语言理解、规划和自主是这两个生态系统中最普遍的三个功能,每个功能都有大约一最大的差距出现在预测分析(44%的美国公司对27%的中国公司)和检索和搜索(17%对8%),这两个领域都倾向于与美国垂直组合一致的知识工作用例。然而,由于中国企业的正分配数量应被视为下限(附录B),这两个差距的真实大小可能比所显示的要小得入式人工智能的重视是一致的该报告为分析美国和中国的人工智能开发公司生态面数据中,而不是从国家计划、专家直觉或少数知名公司的在关于美国的辩论中,一个核心的动机问题是中法,美国在AI发展方面的做法是否不够多样化。中指定嵌入式人工智能作为国家发展重点,并通过政府资助的大学态计算和其他后变压器架构等行动实现多样化。我们的数据揭示在人工智能开发公司生态系统中的。在我们的数据集中,我们没据表明中国人工智能开发公司正在比美国同行更大程度地追求神经形态或后转换相反,在我们的研究样本中,这两个生态系统都是以变革者为主美国公司。中国公司更有可能通过人形机器人、地面机器车来提供人工智能,而且它们在实体经济垂直领域(如制造业、驶车辆控制和工业自动化方面的应用,这与美国占主导地位的基激烈。集中关注的最强版本-美国追求单一的架的模型架构水平上没有得到很好的支持然而,我们观察到,美国生态系统更倾向于软件交付的、以语言模型为中心的人工智能,司的生态系统在结构上更大地押注于具体的人工智能、物理世界如果通往变革性人工智能能力的道路最终需要与机如果没有系统的跨国公司层面的数据,就很难得出这随着人工智能发展的加速和地缘政治竞争的加剧,经验基础变得更加重要。这里是追求重叠但不同路径的多样化、动态生态系统之间的复杂相互作用了解这些途径需要系我们根据人工智能开发活动的结构化九维分类法对样维度和定义可能的类别这家公司用AI模型做什么捕获公司的主要模型生产活动-无论是从头开始训练基础模型,从头开始训练窄任务特定模型,适应现有的预训练模型,还是在不修改权重的情况下集成第三方模型。基础模型开发人员:以显著的计算规模从头开始训练AI模型的公司,旨在跨多个下游任务,客户或应用程序进行重用。特定任务模型开发人员:为单个定义良好的应用程序从头开始训练窄神经网络的公司,而不是从大型预训练基础模型开始。模型适配器(微调,蒸馏,量化现有模型):采用现有预训练模型(自己或第三方)并通过微调,指令调优,蒸馏,LoRA,量化,对齐训练,持续预训练或模型合并来修改权重的公司。模型集成商(使用第三方模型而不修改权重在第三方基础模型之上构建复杂AI产品而不修改模型权重的公司。未知/未披露:无法根据现有证据确定模型来源。当不清楚公司是训练、调整还是集成模型时,可以使用它作为后备维度和定义可能的类别AI模型的基本计算结构,独立于训练方法,任务或应用程序。回答:“这家公司实际上正在构建或修改什么样的神经架构(或非神经算法)?”Transformer架构:跨任何模态的Transformer架构-文本(GPT、LLaMA、Claude、BERT、T5、Qwen、DeepSeek、Mistral)、视觉(ViT、DINOv2、Swin、MAE、SigLIP)或多模态(GPT-4V、Gemini、Qwen-VL、LLaVA、InternVL)。卷积神经网络:主要基于空间或网格结构数据的卷积运算构建的架构。包括ResNet、EfficientNet、YOLO、U-Net、MobileNet和类似的CNN家族。后Transformer架构:是标准Transformer的显式替代品的神经序列架构。递归神经网络:具有显式递归连接的序列架构(LSTM,GRU)。Laravel在现代语言任务中被transformer取代,但仍用于时间序列,信号处理和传统工业系统。图神经网络:设计用于通过消息传递、图卷积、图注意力或谱方法对图结构数据进行操作的架构常见于药物发现、分子建模、知识图和网络分析。扩散和流匹配模型:生成式架构,学习反转噪声添加过程或学习连续流轨迹。包括DDPM、基于分数的生成模型、稳定扩散、流量匹配和整流。生成式对抗网络:在生成器和网络之间使用对抗训练的架构包括StyleGAN、CycleGAN和类似的GAN家族。神经符号架构:将神经网络组件与形式符号推理(定理证明器、约束求解器、可满足性求解器、概率编程或形式逻辑引擎)显式集成的系统。经典机器学习:非深度学习方法,包括决策树、随机森林、梯度提升(XGBoost、LightGBM、CatBoost)、SVM、线性模型和集成方法。未知/未披露:无法根据现有证据确定结构当证据没有明确地命名一个体系结构、模型族或技术时,这是默认分类自由使用这个。维度和定义可能的类别商业定位如何将人工智能推向市场-公司实际销售什么以及如何获取价值。以适应AI的经典云服务分层(IaaS→PaaS→SaaS)为模型,为训练和销售自己模型的公司提供模型即服务层,为有效服务模型的公司提供独特的推理即服务层(通常是他们没有训练的开放权重模型),为完成的AI驱动的解决方案提供应用AI产品层(现在包括出售给ML工程师的AI基础设施/开发工具),以及为自己的运营构建AI而不将其商业化的公司提供内部使用类别。学习与优化范式系统如何从数据中学习这捕获优化或控制逻辑。模型即服务:该公司训练自己的AI模型,并通过API、可下载权重或托管推理端点出售对它们的推理即服务:该公司为运行AI模型提供优化的推理基础设施-通常是由其他人训练的开放权重模型,尽管一些提供商也托管自己的微调。AI应用产品:一种成品或服务,其核心价值主张是AI的输出,出售或提供给外部客户。内部使用/运营AI:该公司主要为自己的内部运营开发AI,不会将AI商业化为独立的外部产品。未知/未披露:根据现有证据无法确定商业定位当公司的上市模式不明确时,可以把它作为退路监督学习:使用人工或自动标记的示例学习从输入到输出的映射。包括分类(离散标签)和回归(连续目标),并涵盖标记下游数据的微调。自监督学习:通过从数据本身构建借口任务来从未标记的数据中学习表示下一令牌预测、掩蔽重构或对比不变性)。无监督学习(经典):经典的无标记数据方法,在不构建学习的借口任务的情况下发现结构:聚类(k-均值,GMM,分层),降维(PCA,t-SNE,UMAP),密度估计,异常/离群值检测,主题。..强化学习(环境RL和RLHF):通过奖励信号训练模型-涵盖环境RL(与模拟或真实环境交互的代理,从环境奖励中学习..模仿学习:通过对期望行为的专家演示进行监督拟合来学习策略持续或终身学习:随着时间的推移,逐渐更新部署模型对新数据或任务的权重,同时显式地减少对先前功能的灾难性遗忘。未知/未披露:未说明学习模式维度和定义可能的类别核心功能能力系统提供的智能或功能的广泛类型,与应用程序域、用户界面或交付机制无关。回答问题:“这家公司解决什么样的人工智能问题?”感知和传感:从原始传感器数据中提取结构化信息-图像,视频,音频,激光雷达,雷达,热,深度,IMU或其他物理信号。语言理解和生成:处理,解释和生成文本形式的人类语言涵盖了完整的NLP频谱:文本分类,命名实体识别,翻译,摘要,问答,会话语言生成代码和软件综合:生成、完成、理解或分析源代码作为主要任务。包括代码完成助手,代码生成模型,自动重构,代码审查AI和专门的代码LLM。创意内容生成:生成新颖的媒体内容-图像、视频、音频、音乐、3D资产、动画或多模式创意输出。显式推理和推理:显式多步推理作为主要能力。包括:(a)专门的推理模型,训练用于思维链、扩展思维或解决问题(例如,OpenAIo1/o3,DeepSeekR1,Claudeextendedthinking,Geminithinki...预测分析和统计预测:来自学习模型的统计预测,其中主要输出是数值预测,概率或类别标签。推荐、排名和个性化:针对单个用户或上下文对内容、产品或操作进行排名、匹配和个性化检索和搜索:根据查询或上下文从语料库中查找和检索相关信息规划、控制和自主:在动态环境中选择和执行行动序列以实现目标。多智能体和分布式智能:涉及多个AI智能体的协调智能,这些智能体通过通信、合作或竞争来实现一个目标。未知/未披露:根据现有证据无法确定功能能力当公司的核心人工智能能力不清楚时,可以将其作为后备。维度和定义可能的类别如果公司将AI与物理硬件进行部署或集成,那么外形尺寸是什么?这个维度捕捉了构建人工智能硬件系统的公司的物理体现类型。纯软件公司被标记为“not_applicable”。类人机器人:设计用于在人类环境中操作的两足或人形机器人。定义物理签名是一个类似人类的身体计划(腿,手臂,躯干),使运动和操纵空间设计的人类。空中无人机/无人机:具有人工智能自主、感知或决策功能的无人机和无人机系统自动驾驶汽车:自动驾驶汽车、卡车、公共汽车、机器人出租车和其他具有人工智能自动驾驶功能的道路车辆。地面机器人(非人形,非车辆):所有非人形,非道路车辆地面机器人与AI。涵盖轮式/履带式送货机器人、仓库移动机器人、工业机器人手臂和机械手、巡逻和保安机器人、清洁机器人、协作机器人、四足动物、农部署的传感器网络:公司在物理世界中部署的固定传感基础设施-相机网络,激光雷达阵列,雷达装置,环境传感器网格,声学监控系统。可穿戴或生物设备:人工智能驱动的可穿戴设备、生物传感器或脑机接口硬件。涵盖智能手表AI、带有设备上ML的健身/健康可穿戴设备、EMG/EEG腕带、BCI耳机和带有AI处理的医疗可穿戴传感器。其他物理外形:不符合上述类别的物理AI硬件涵盖水下ROV/AUV、空间机器人、AI农业机械、AI采矿设备和其他专业物理平台。外形尺寸未知:该公司运营物理AI硬件,但无法从证据中确定具体的外形尺寸不适用(仅限软件):仅在有明确证据表明公司仅限软件(SaaS、API、Web应用程序、移动应用程序、云平台)时使用。维度和定义可能的类别人工智能系统主要部署或预期使用的现实世界部门、行业或环境。回答:“这家公司的客户来自哪个领域,人工智能解决了什么现实问题?”农业和食品系统:农业、作物管理、牲畜监测、精准农业、食品生产和供应链、农业机器人、土壤和产量分析。银行、金融和保险:金融服务-银行、支付、贷款、交易、资产管理、风险和信用建模、欺诈检测、保险承保、金融机构的监管合规、金融科技产品。教育和学习:用于教学、学习、辅导、课程、评估、学术内容生成、K-12和高等教育工具、企业培训和学习的人工智能。能源和公用事业:发电、输电和配电;电网运营和预测;可再生能源管理;石油和天然气勘探和生产;公用事业运营;智能电网和需求响应系统;电池和存储优化。..医疗保健和生命科学:临床护理AI,医学成像,诊断,电子健康记录,医院运营,远程医疗,药物发现和制药研发,临床试验,基因组学和精准医学,心理健康,生物技术。法律服务:法律研究、合同分析和起草、电子取证、法律合规、诉讼支持、法律实践管理人工智能。主要客户为律师事务所、内部法律团队或合规职能部门的公司物流和供应链:供应链优化、仓储自动化、最后一英里交付、货运和航运、库存管理、供应链需求规划、海关和贸易、车队管理。制造业和工业:工业生产,工厂自动化,质量检测和缺陷检测,工业设备的预测性维护,化工/材料/重工业的流程优化,机器人制造,工业物联网。媒体、娱乐和创意行业:创意内容生成(文本、图像、视频、音乐、3D)、游戏和游戏开发AI、流媒体和推荐、广告和营销创意、新闻AI、后期制作和视觉效果、社交媒体内容。军事和国防:军事和国防应用-自主防御系统,监视和ISR(情报,监视,侦察),国防后勤,指挥和控制,电子战,导弹防御,国防情报分析,导弹防御。..房地产和建筑:房地产交易,物业管理,建筑人工智能,建筑信息建模(BIM),建筑和设计人工智能,智能建筑,房地产估价。零售和电子商务:零售运营、电子商务平台、购物者推荐和个性化、商店级库存管理、全渠道零售、动态定价、虚拟试穿、商店自动化。科学和研究:科学研究和发现-人工智能用于科学实验,材料发现,气候和地球科学,物理,化学,生物学研究(基础科学与应用医学相对),天文学和空间科学,scienti。..安全和网络安全:网络威胁检测和响应、安全运营(SOC)自动化、恶意软件分析、网络安全、身份和访问管理AI、安全欺诈检测、漏洞评估、安全分析。维度和定义可能的类别电信和网络:电信网络运营,5G和网络优化,网络管理,电信公司客户服务,计费和OSS/BSS系统,RAN智能,光纤/网络规划。交通和移动性:自动驾驶汽车、叫车和移动平台、公共交通AI、航空和航天AI、海上和航运路线AI、交通管理、车队路由和调度、汽车ADAS。跨领域或通用:通用AI基础架构或基础技术,旨在跨多个行业使用其他可识别的域:仅当证据清楚地识别了公司的应用程序域,但不符合上述任何类别时使用宗教、体育、酒店、艺术、慈善、利基消费硬件垂直市场)。未知/证据不足:仅当证据不足以确定公司的应用程序域时使用。分类器无法从现有证据中识别AI主要服务于哪个行业或用例。公司的AI产品主要处理哪些类型的数据这个维度捕获了公司的核心产品所操作的数据模态--而不是它在内部使用的架构,也不仅仅是训练数据的模态。回答:“当这家公司的人工智能完成工作时,它消耗的是什么样的数据?”视觉(静态图像):静态图像数据-照片,医学成像(X射线,MRI,病理切片,超声波),卫星和航空图像,文档图像,作为图像分析的单个视频帧文本(自然语言和代码):自然语言文本(文档、文章、聊天消息、社交媒体帖子、电子邮件)、源代码(作为文本标记)和其他作为语言处理的符号序列音频(语音和声音):音频信号-语音,音乐,环境声音,工业声学监测。视频(时间图像序列):视频数据-具有运动的图像帧的时间序列涵盖视频理解(动作识别、随时间变化的场景理解、监控分析)、视频生成(文本到视频、图像到视频、视频到视频)和实时。..3D和空间数据:3D点云(来自LiDAR、深度传感器、摄影测量)、3D网格、体积数据(体素网格、被视为3D的医学CT/MRI体积)、深度图、地理空间数据以及用于机器人和AV感知的SLAM/重建数据表格和结构化数据:结构化关系数据-数据库、电子表格、财务记录、交易日志、临床记录、企业资源数据、客户关系数据。组织为具有类型字段的行和列的数据。时间序列(时间数字流):按时间索引的结构化数字流,其中时间模式是主要信号。基因组和分子数据:DNA和RNA序列,蛋白质结构和序列,分子图,化合物表示(SMILES,分子指纹),药物化合物数据和相关的生物/化学结构化数据。原始传感器和物联网数据:来自物理传感器的原始或经过最低限度处理的多通道信号,包括IMU(加速度计、陀螺仪、磁力计)、雷达、声纳、工业传感器网络(压力、温度、振动、流量)、EMG和生物传感器阵列、环境传感器、传感器网络、传感器网络和传感器网络。..未知/证据不足当证据不足以确定公司的AI主要处理哪种数据模式时使用分类器无法从现有证据中识别特定模态维度和定义可能的类别发布开源模型:该公司已经在HuggingFace、GitHub或公司自己的网站上该公司是否将自己的AI模型发布了一个或多个作为开源发布?这是二进制专有(不发布开源模型):该公司不发布自己的AI模型供下载。所有AI模的设计,确切地说,两个类别中的一个应该标记每个公司。型都是专有的,可以通过API访问,托管产品或内部使用注意事项:因为这些材料是由LLM代理摄取的,我们在这里逐字转载,尽管我们合并或截断了以省略号结尾的某些段落(。..).我们也故意没有定义缩写,因为特定的术语对于理解所呈现的一般概念并不重要每个维度都有一个“未知”的后备,这样低证据的公司就会被标出来。除了已经提供的信息之外,我们对每个类别的分类还提供信号短语以及明确的排除标准(后者阻止了常见的假阳性模式,在为每个公司分配技术属性时,我们为数据集中的每个公司收集了两个证据流,并络查询,内容涉及其产品、模型发布、训练方法、开检索到的来源包括供应商产品页面、新闻稿、技术博客文章、GitHub存储库、(同行评审论文、预印本、技术博客、产品文档、营来源进行分类,以便更权威的来源在分类器的认为是高信号,从而提高相关性得分,而基于营销文案的信息在证据收集过程中,有两个注意事项始终适用。第一个是,潜业人工智能活动平均比美国更不透明由于制度差异而进行的活动中一部分发生在国有企业、受监管的公用事业和工业集团内部,这些公开披露有限。在整个研究过程中,结果是,在积极分配的维度上,中额始终高于美国企业的份额因此,读者应该把中国企业在任何积极产品公司,其产品是临床文档的成品工作流程。一起阅读这两维度分类LLM推理商业定位模型即服务应用人工智能产品主要的商业模式是在付费使用下出售DeepSeek模型系列的API访问权;消费者聊天产品占次要的AppliedAIProduct标签。模式种源基础显影剂模型适配器该公司大规模地预训练了自己的基础模型(基础开发人员);它还发布了在Qwen2.5和Llama3基础上微调的精选检查点(模型适配器)。应用程序域cross_domain模型是通用的。该公司出售API访问使用跨垂直领域,而不是针对一个行业;因此,一个单一的跨域标签。核心功能语言理解推理决策代码综合规划自主性创造世代知觉纯文本LLM工作量占主导地位(语言理解,推理,代码合成,规划或代理)。较低的相关性感知标签反映了DeepSeek-VL和Janus,这是一个与V/R旗舰不同的较小的多模式产品线开放重量状态publishes_open_source所有发布的模型都是在许可下开放权重的GitHub和HuggingFace上的许可证(MIT或类似)话转换为结构化的临床笔记,与Epic等电子健康记录系了针对医疗对话调整的定制语音识别系统,以及用于摘要和结构维度分类LLM推理商业定位模式种源应用程序域核心功能开放重量状态applied_ai_product客户为完成的文档工作流付费整合到现有的电子健康记录系统中。AI是产品的内部,而不是正在销售的物品模型适配器特定任务开发人员该公司使用专有的医疗微调数据(模型适配器)来适应通用基础模型;它还从头开始训练定制的语音识别模型用于医疗对话(特定任务开发人员)。healthcare这是一个单一的垂直领域;它是医疗保健的临床文档提供商没有通用适用性的要求语言理解知觉检索搜索功能是语言理解(笔记生成),感知(医学语音识别与日记),语言理解知觉检索搜索proprietary_only没有公开的模型版本,没有公开的代码库,没有公共数据集。这是一种完全私有的商业模式。信息这些信息随后与工件级别的分类(在下一节中讨论)你是一个行业分析师。根据提供的证据,在以下分类维度中对公司“{COM{分类摘要-维度名称、描述、多编码指南,以及每个类别字符)}),),1.0:公司身份和主要业务0.7-0.9:显著、证据充分的活动0.4-0.6:有一些证据0.1-0.3:轻微、不切实际或证据不足仅包含相关性>=0.3的强烈倾向于最近的证据(2024-2026)而不是旧的来源如果旧的证据与最近的相矛盾,就用最近的证据。如果只有早于2023年的证据可用,请注意“[过时的证据]",将维度置信度上限设为0.4,并首选该维度的*_unknown主项):示”、“几乎肯定”、“通常指的是”、“可能使用”、“是的特征”、“是的一个强有力的指智能背景下”或“表明”来证明一个非未知的主要。如果证据只支持推理语言,则2.DIRECT-EVIDENCE-ON接命名架构(例如,“Transformer人”、“大型模型”和“做NLP”不是Transformer_architecture的证据。当体系3.SOELARGE-MODELRULE(model_provenance)-如果除非证据还包含预训练规模的证据(令牌计数,参数计数,除非证据还包含预训练规模的证据(令牌计数,参数计数,4.RL/IMITATIONTRAININGRULE(learning_parad的训练管道使用了该范例(语言如“我们训练”、“训练管“SAC”、“演示数据集”)。在实验中提到RL的研究论文,或“将使用”RL的产品,是不够的。否则,使应用程序、云)的公司。如果证据表明是物理硬件,但没有指定form_factor_unknown。永远不要使用not_applicable作为缺少信息的{“dimensions”:“置信度”:0.85,“推理”:“简要说明与证据”},“commercial_positioning”:“核心功能”:{...},“application_domain”:{...},“data_modality”:{...},“open_source_status”:{...}}}这些标签针对每家公司未覆盖的每个技术工件发布一次根据列出的过程对给定公司您正在将AI公司“{COMPANY}”的学术论对于下面的每一篇论文,在论文本身中确定相关类别。仅标记论文提供model_architecture(根):{architecture_unknownneurosymbolic,post_Transformer_architectures,recurrent_nn,Transf):self_supervised,supervised_learning,unsupervised,.}?):{视觉,文本,音频,视频,3D空间,表格结构,基因组分子,时间序列,.}model_provenance(每张论文选择一个主模型?):model_integrator,provena[1]...仅使用上面只标注论文实际描述的内容-不要从公司名称model_architecture:标记提到的特定架构。如果摘要没有命名,则learning_paradigm:标记所描述的训练方法。如果未公开,则data_modality:标记纸张使用的数据类型model_provenance:“Trainedfromsfoundation_developer.“Fine-tunedXmodel”→model_adapter。从零开始训练的窄任务特型→task_specific_developer。使用第三方模型,无需修改→model_integrator还将source_type分类为以下类型之一:peer_reviewed、preprint、technical_report{“paper_index”:0,“learning_paradigm”:[“self_supervised”,“model_provenance”:“peer_reviewed”},]对分类进行了改进和验证。读者会注意到,提示使用了“旨在推进最先智能研究和开发”这一短语,这似乎比第2章中的的是捕捉相同的人口。提示的“前沿”语言是一种操作手段,旨在排除或部署其他人开发的模型的公司,而不是将其纳入最前沿或最大器人公司训练自己的运动控制器,一家医学成像公司训练专有创公司发布开放权重语言模型,这些都符合与超大规模基础模型身体定义和提示的决定因素是公司本身是否创建新的人工智能模“错误定义错误定义-关键错误抛弃之前关于“AI开发人员”这个术语的任何知识或假设。您必须完全按照本提示中提供的定义有操作和决策都必须完全遵循本文中确立的“AI加密器”的定义(对于本系统):“AI开发者”是一个积极参与前沿AI研究和开发的组织,旨在推进最先进的技术,而不是主要应用或启用现有模型。这特别包括从头开始开发自己的AI模型的组织,拥有专门的AI研究团队,并发布沿。根据该系统,仅使用、应用、集成、投资或提供AI基础设施的组织不被前沿AI模型或系统开发:组织开发或培训推进AI前沿的AI模型或系统,例如:基础或前沿规模模型(语言、视觉、多模态、世界模型等)人工智能或人工智能机器人控制系统神经形态的,认知启发的,或混合符号神经系统新颖的架构、培训制度、学习范式或软硬件协同设计证据可能包括公开记录的专有模型、技术博客、模型卡、基准、数据集、开源版本或同行评审的论文/预印本。对前沿AI研发的持续机构承诺:该组织展示了开发新AI范式或模型的长期机构承诺,例专门的人工智能研究部门或实验室重复出现的技术出版物、版本或模型迭代对前沿人工智能方向的持续投资(例如,基础模型、具身智能、神经形态计算等)强制性规则的例外情况(当组织明确满足“是”标):投资其他人工智能公司并在内部开发前沿人工智能技术的公司被归类为人工智能开发人员,如果内部开发有良好的记录。如果内部开发有良好的记录,那么既集成人工智能又在内部开发前沿人工智能技术的公司被归类为人工智能开发人员。开发前沿A
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 人教版2025-2026高三语文上学期测试卷
- 招聘3人!刚察县应急管理局公开招聘工作人员模拟试卷(突破训练)附答案详解
- 2026天津工业大学绍兴柯桥研究院招聘技术经理人3人备考题库及参考答案详解【轻巧夺冠】
- 2026新疆塔城市第三中学银龄教师招聘笔试题库(夺冠)附答案详解
- 2026年公开招募攀枝花市增量政策性岗位(盐边县)人员的(33人)考前冲刺密卷及参考答案详解【基础题】
- 2026中国新能源汽车充电设施建设领域市场发展现状及政策推动分析报告
- 2026媒体出版产业市场现状供需分析及投资评估规划分析研究报告
- 2026缺氧舱训练设备技术规范制定与康复医疗服务拓展研究
- 2026中国印度电子元件行业市场供需分析及投资评估规划分析研究报告
- 2026中国新能源金融创新模式与资本运作策略研究报告
- 2026秋新北师大版二年级上册小学数学教学计划附教学进度表
- 2026墨西哥电信行业市场供需分析及投资评估规划分析研究报告
- 起重机械使用单位安全管理制度
- 灯塔猪场建设方案设计
- 2027届高考地理一轮复习主要知识结构思维导图
- 周转材料租赁管理综合办法
- 《功能性食品开发与应用》课件-第一章绪论
- JJF 1128-2026 矢量信号分析仪校准规范
- 医疗卫生机构数据分类分级指南(试行)
- 运动休克案例分析
- 优衣库物料管理案例分析
评论
0/150
提交评论