2023-人工智能行业海外大模型系列深度报告之一:OpenAI和微软_第1页
2023-人工智能行业海外大模型系列深度报告之一:OpenAI和微软_第2页
2023-人工智能行业海外大模型系列深度报告之一:OpenAI和微软_第3页
2023-人工智能行业海外大模型系列深度报告之一:OpenAI和微软_第4页
2023-人工智能行业海外大模型系列深度报告之一:OpenAI和微软_第5页
已阅读5页,还剩45页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

海外大模型系列深度报告之一:OpenA

I和微软——通用人工智

能道路上矢志不渝的逐梦者

核心观点:

OpenA

I是目前全球估值最高的A

I初创公司,成立目的是让通用人工智能朝着最有可能造福人类的方向发展。其研究方向大致聚焦

在三个领域:强化学习领域、

自然语言处理领域、多模态模型领域,OpenA

I最新发布的GPT-4模型展现了出色的自然语言处理能力,并初步融

合多模态能力。当前的GPT系列模型不止于生成式A

I,更是点燃了实现通用人工智能的希望。同时,OpenA

I也进行了商业化初探,大模型全面

赋能微软传统业务,与其Azure云、Office

365、Dynamics

365均有很好的结合。除个人办公领域之外,OpenA

I在代码编程、金融、医疗、教

育、零售等其他领域中均打开了A

I应用新局面。•

OpenAI是目前全球估值最高的AI初创公司,成立目的是让通用人工智能朝着最有可能造福人类的方向发展。OpenA

I成立于2015年12月,研究

方向大致聚焦在三个领域:强化学习领域、

自然语言处理领域、多模态模型领域。其研究方向始终关注问题的通用性解决方案,而不是聚焦在特定问题之上,与其通用人工智能的研究目标契合。•

OpenA

I是大语言模型的技术先驱。OpenA

I基于Transformer模型开辟自回归建模路径,发布了GPT系列模型。GPT-1开启了自然语言预训练时代,GPT-2证明大模型无需微调也可以完成广泛下游任务,GPT-3证实了无监督预训练路线的正确性,ChatGPT引入强化学习机制增强人机对话表现,

GPT-4拥有卓越的文本处理能力,并且初步融合多模态能力。OpenA

I长期坚持其技术路线并且投入大量的研究资源,是大语言模型的技术先驱。•

OpenA

I商业化初探,大模型全面赋能微软传统业务。大语言模型所需要的庞大算力是OpenA

I成立之时始料未及的,2019年开始OpenA

I从非营利性企业转变为具有利润上限的营利实体OpenA

ILP。随着GPT模型爆发出强大的应用潜力,OpenA

I也开始其商业化布局。OpenA

I在个人办公应用领域与微软加深合作,大模型全面赋能微软传统业务,与OpenA

I的相关合作对其Azure云、Office365、Dynamics365均起到了相当程度的促进作用。微软23Q3财报显示,FY23Q3AzureOpenA

I已有2500个服务客户,Azure云下个季度中有1%的收入增长来自于人工智能。•

在个人办公领域之外,OpenA

I在其他领域中均打开了A

I应用新局面。在代码编程领域,GPT显著提升代码编程效率和质量;在金融领域,GPT成为金融领域强力的信息汇总和分析工具;在医疗领域,GPT全方位提升医疗领域的智能化与数字化;在教育领域,GPT提高教育和学习的效

率和针对性;在零售领域,GPT提升零售中的业务效率和用户体验。•

风险提示:技术发展不及预期、算法隐私问题、应用不及预期、数据质量不及预期、伦理冲突风险等。核心观点OpenA

I打开A

I应用新局面

43风险提示

49OpenA

I概述

4OpenA

I技术发展路径

10大模型全面赋能微软传统业务

29第一章第二章第四章第五章第三章目录OpenA

I概述

4第一章

OpenA

I成立于2015年12月,成立的目的是让通用人工智能(Artificial

General

Intelligence)朝着最有可能造福人类的方向发展。公司的主要创始人包括山姆奥尔特曼(Sam

Altman)、格雷格·布罗克曼(Greg

Brockman)、里德·霍夫曼

(Reid

Hoffman)

杰西卡·利文斯顿(Jessica

Livingston)

、埃隆·马斯克(Elon

Musk)

、Amazon

Web

Services(AWS)等。截止2022年,OpenA

I拥有大约375名员工,主要面向以下三个方面:Capabilities,不断的提高A

I的功能和能

力;

Safety,确保这些A

I系统拥有和人类一致的价值观念;Policy,确保这些A

I系统能够得到适当的治理。

根据路透社报道,OpenA

I在2022年收入数千万美元,并预计2023、2024年收入为2亿、10亿美元。截止2023年4月29日,OpenA

I历史融资额超200亿美元,

当前估值为290亿美元,是全球估值最高的A

I初创公司。公司专注领域成立年份融资金额

(百万美元)OpenAl人工智能模型开发201511000Databricks数据存储和分析20133500Andurillndustries防御软件20172400Anthropic人工智能模型开发20211300Insitro药物研发2018700Scale

Al数据标签提供商2016602Gong销售软件2015584AlphaSense市场情报搜索2011520ShieldAl自主防御软件2015520Clari销售软件2012496EightfoldAl招聘软件2016424Adept人工智能模型开发20224151.1OpenA

I:全球估值最高的人工智能创业公司GPT多模态图:福布斯A

I

50部分企业图:

OpenA

I主要研究领域自然

CapabilitiesSafetyPolicy强化

学习OpenAI

Five语言DALL·E

2-4GregBrockman(1985-)格雷格·布罗克曼是美国企业家、商人和投资家。他是OpenA

I的联合创始人,并在

创立时担任首席技术官

(CTO)。在2022年5月,卸任首席技术官,担任公司总裁,并专注于训练公司旗舰A

I系统。在OpenA

I之前曾担任Stripe的首席技术官。Mira

Murati(1988-)米拉·穆拉蒂,出生于阿尔

2018

OpenA

I,主要负责OpenA

I的

研究、产品开发和部署的相

关工作。并在2022年5月接

任Greg

Brockman担任首席

技术官。她对于DALL.E的成功起到了重要作用。在加入OpenA

I之前,曾就职于LeapMotion和特斯拉。Ilya

Sutskever(1985/86-)伊利亚·苏茨凯弗,人工

智能科学家,是OpenA

I的

联合创始人,同时担任首席科学家。曾就职于谷歌,

是卷积神经网络AlexNet的发

,是AlphaGo论文的众多合著

者之一。在2015年底,离开

共同

OpenA

I并担任首席科学家。Brad

Lightcap布拉德·莱特卡在2018年加入OpenA

I,担任OpenA

I

首席财务官

。2022年5月

担任首席运营官,与人工

智能应用团队合作,完善

相关业务和商业战略。此

曾担任Dropbox的战

略财务总监和摩根大通的投资银行分析师。SamAltman(1985-)山姆·奥尔特曼是美国企业家、投资者和程序员。他是Loopt和OpenA

I

的首

席执行官,也是联合创始

人。曾担任Y

Comb

inator的总裁,后为了更多专注

于OpenA

I,于2019年转任

董事长,并于2020年离开

YC。

图:

OpenA

I现任人员介绍

1.2公司现任人员首席技术官首席执行官首席运营官首席科学家总裁

2015年公司成立之初的愿景是让通用人工智能(Artificial

General

Intelligence)朝着最有可能造福人类的方向发展,与此同时不受财务回报的约束。

2023年初,公司对未来发展做了进一步描述,其中提到公司目标是确保通用人工智能(在智能水平上胜过人类的A

I系统)造福全人类。

随着A

I模型逐步迈向通用人工智能阶段,公司对模型的创建和部署更为谨慎。其中OpenA

I提出了三条最关心的原则:>

期望通用人工智能最大化造福人类,最大化赋能、最小化风险,让通用人工智能成为人类能力的增强器。>

期望广泛和公正地分享通用人工智能的能力、使用权和治理权。>

期望成功应对通用人工智能可能带来的风险,通过一些功能较弱的版本来不断学习和适应,从而化解潜在的风险。

图:“Introducing

OpenA

I”中对OpenA

I的愿景描述

图:“Planning

for

AGI

and

beyond”中对OpenA

I的目标描述

“Ourmission

is

to

ensure

that

artificial

generalintelligence—AIsystemsthatare

generally

smarter

than

humans—benefitsallofhumanity.”2023.1.24“Ourgoal

istoadvance

digital

intelligence

in

theway

that

is

most

likely

to

benefit

humanity

as

a

whole,unconstrainedbya

need

to

generate

financialreturn.”2015.12.111.3公司愿景:以最有可能造福人类的方式推进人工智能发展

OpenA

I一共经历了7轮融资,包括种子前融资,种子轮融资,二级市场融资和企业融资,总募集资金超过200亿美元。

主要投资者包括有:微软、Y

Combinator、科斯拉风险投资公司,里德霍夫曼基金会、红衫资本、基岩资本、安德森·霍格威兹、马修布朗公司等。

2019年开始,OpenA

I开始对融资保持相对开放的态度,彼时公司的大语言模型正处于GPT-2迈向GPT-3的发展阶段。训练大语言模型所需要的庞大算力是公司成立之时始料未及的,公司开始接受融资同时寻求与云厂商的广泛合作,与此同时也伴

随着公司商业模式的变化。

图:

OpenA

I融资历史图

1.4OpenA

I融资历史:通用人工智能发展的有力保障

2019年,为了获取大规模投资和吸引人才从而更好完成企业使命,OpenA

I从非营利性企业转变为具有利润上限的营利实体OpenA

I

LP。在新的公司结构下,OpenA

I就特指现在的OpenA

I

LP,原先的非营利实体转变为OpenAI

Inc。而OpenA

I

LP则会

受到OpenAI

Inc的董事会进行控制。在此结构下,所有的投资者和员工的经济回报都是有限的,所有超额的回报都会归OpenAI

Inc所有。对于第一轮投资者(First

Close

Partners)的回报上限定为了投资的100倍,后续的投资回报率会不断

降低。

OpenA

I的主要盈利模式包括:会员订阅费、API许可费、与微软合作带来的商业收入。图:

OpenA

I商业模式变化情况

图:

OpenA

I的主要盈利模式使用API的方式接入OpenAI模型

(例如GPT-4

、Dall·E2等),按

生成内容长度和图片数量收费ChatGPT

plus付费版本,每月收费20美元1.5OpenA

I商业模式大模型融入githubcopilot

、bing等软件,创造商业收入微软合作收入API流量费会员订阅费OpenAIOpenA

I技术发展路径

10第二章

人工智能大致可以分为三个发展阶段:弱人工智能、强人工智能、超人工智能。

弱人工智能(Weak

artificial

intelligence)或称狭义人工智能(Artificial

Narrow

Intelligence)是实现部分思维的人工智能,且仅专注于某项特定任务。弱人工智能不需要具有人类完整的认知能力,甚至是完全不具有人类所拥有的感

官认知能力,只处理特定的问题。弱人工智能专注于模仿人类如何执行基本动作,例如记忆或感知事物、解决简单问题。比如:A

I模型AlphaGo战胜了顶尖的人类选手,但是局限于特定问题,仍然不能被称之为强人工智能。

当前人工智能技术发展处于弱人工智能相对成熟、强人工智能曙光乍现的阶段。图:人工智能发展的三个阶段

图:

AlphaGo战胜顶尖人类棋手2.1人工智能发展历程

强人工智能也指通用人工智能(artificial

general

intelligence,AGI)

,具备非常通用的“智能能力

”,包括推理能力、规划能力、抽象思考能力、理解复杂概念的能力、快速学习的能力、从经验中学习能力等,并且在这些方面达到或超

过人类水平,强人工智能是人工智能研究的主要目标之一。

强人工智能的目标是创建一个能够与人类一样自适应、灵活地处理各种问题和任务的智能系统。强人工智能使得人工智能具备意识、感性、知识和自觉等人类特征,有潜力为每个人提供几乎任何认知方面的帮助,可以为人类的聪明才智和创造

力提供巨大助力。图:强人工智能具备的能力

图:强人工智能主要玩家OpenA

I和DeepMind2.2

强人工智能AGI从经验

中学习理解复杂概念快速学习规划能力抽象思考推理能力

从时间维度上看,OpenA

I的研究方向大致聚焦在三个领域:强化学习领域、

自然语言处理领域、多模态模型领域。

在强化学习领域,OpenA

I采用通用的强化学习策略来来帮助A

I应对灵活多变的困难问题;在自然语言处理领域,OpenA

I开辟自回归建模路径,大语言模型无需在特定领域微调也有出色的任务表现;在多模态模型领域,OpenA

I围绕Transformer主

架构不断增强多模态能力。OpenA

I的研究方向始终关注问题的通用性解决方案,

而不是聚焦在特定问题之上,与其通用人

工智能的研究目标契合。

图:

OpenA

I技术发展路径

强化学习阶段

多模态阶段2015.12

2017.8

2018.6

2020.7

2021.2

2022.11OpenA

I成立

OpenAI

Five

GPT-1

GPT-3

DALL·E

ChatGPTDota2战胜职业选手

开启预训练时代

证实技术路线正确性

文字到图像生成

为大语言模型引入强化学习

20152023自然语言阶段

2017.8Dactyl机械手训练系统2019.2GPT-2零微调完成下游任务2021.2CLIP图文配对模型2022.4DALL·E

2图像质量升级2023.3GPT-4初步融合多模态2.3OpenA

I技术发展路线2016.6OpenAI

Gym强化学习工具包

2015年之前,深度学习的发展已经如火如荼,OpenA

I成立之后,首先关注的是深度学习与强化学习的结合领域。强化学习适合决策和运动控制相关领域,涉及一系列决策相关问题,例如机器人的电机控制、玩电子游戏和棋盘游戏等,强化学习

帮助A

I代理在复杂、不确定环境中取得良好表现。

OpenAI

Gym是OpenA

I最早期的开源研究成果,是一个用于开发和评估强化学习算法的工具包。假定环境中存在一个A

I代理(例如机器人)

,A

I代理的每一次行动都会从环境中获得相应的反馈和奖励,强化学习算法寻求最大化奖励途径,促进A

I代理与环境交互达到最优状态。OpenAI

Gym中有一系列环境,包括经典控制、雅达利游戏、棋盘游戏、机器人控制,

同时OpenAI

Gym中可以对强化学习算法进行评估。图:

OpenAI

Gym的一系列环境

图:

OpenAI

Gym实现A

I代理与环境的有效互动2.4OpenAI

Gym:强化学习算法开发和评估工具包

OpenA

I研究早期涉及各类游戏对战,其中包括著名的Dota2对战机器人,在2017年8月在1v1比赛中击败了世界的顶尖选手。

OpenAI

Five的目标是寻找最大化与人类玩家对战获胜的策略,模型训练过程中通过强化学习来实现这一目标,设置了最大化的奖励函数,奖励函数中包括:角色死亡、资源收集等与胜率相关的信号。游戏过程中,OpenAI

Five通过程序接口和游戏进行交互,直接从游戏中获取诸如生命值、位置等具体的状态值,在获取观测到的状态后,通过LSTM长短期记忆网络进行处理,之后A

I反馈一个离散化的动作指令,如移动、攻击、使用技能等。

从2018年6月开始,OpenAI

Five就从OpenA

I内部逐步进行了与人类对战的测试,直至2019年4月,OpenAI

Five以2-0击败了职业战队OG,并在接下来的4天时间中,在线上与3193支不同的人类队伍进行了7257场比赛,达到了99.4%的胜率。Dota2复杂程度接近现实世界中的问题,OpenAI

Five的成功证明强化学习在困难的任务当中也能够取得超越人类的表现。图:

简化版本的OpenAI

Five模型架构

图:

模型视角下的Dota2游戏2.5OpenAI

Five在多人竞技游戏中击败人类顶尖选手

在研究早期,OpenA

I也尝试通过强化学习策略去解决机械手的操作问题。2018年7月,OpenA

I发布了机械手训练系统Dactyl,Dactyl采用了与OpenAI

Five相同的强化学习算法和代码从头开始学习,Dactyl通过机械手完成了对物体的精准抓握和灵活

控制,甚至完成了绕轴旋转、盘核桃之类的复杂机械手操作。

Dactyl首先在OpenAI

Gym中的MuJoCo物理引擎构建了机器人的模拟版本,在虚拟环境中对A

I机器人进行训练,然后再把策略应用在实体机器人身上。训练过程中还会增加大量的动态随机事件,让A

I在这个过程中自己领悟出完成任务的诀窍,整

个训练过程中无需任何微调。在虚拟环境中,通过强化学习训练得到的操作技能使得机械手到达前所未有的灵活度。

图:

Dactyl系统实现机械手的精准操控过程

通过3个CNN模型实现三路摄像头的信息处理

2.6Dactyl系统通过强化学习实现机械手的灵活操控通过长短期记忆网络理

解环境中的物理过程神经网络给出针对目

标的具体操作指令摄像头信息融合得到

物体的具体姿态信息在虚拟环境中通过强化学习训练机械手操作

2017年,Google在《Attention

is

All

You

Need》论文提出Transformer模型,将注意力机制引入到自然语言模型之中,在自然语言的翻译任务中取得极高的准确度,随后通过不断挖掘Transformer模型能力,Transformer模型在自然语言的理解和生成也取得了巨大的成功,

当前已经成为自然语言处理领域的基础模型。

OpenA

I开辟自回归建模路径。基于Transformer模型衍生出三条路径,分别为BERT、T5、GPT路径。BERT采用掩码建模策略,利用双向文本信息学习语言信息,在文本理解、情感分析方面具备一定优势;

GPT采用自回归的建模策略,通过对上文文本学习预测下文,在零样本或者少样本的生成方面表现优异。图:

Transformer模型结构

图:

自然语言模型发展路径前馈神经网络多头自注意力机制前馈神经网络多头掩码自注意力机制2.7OpenA

I基于Transformer模型开辟自回归建模路径

Encoder

Decoder

在GPT-1之前,传统的NLP模型往往使用大量的数据对有监督的模型进行任务相关的模型训练,但是这种有监督学习的任务需要大量的人工数据标注,而且只能做到特定领域的自然语言理解,极大的限制了自然语言模型的技术发展。

OpenA

I率先将预训练的方法引入到自然语言处理领域。OpenA

I采用Transformer的Decoder部分作为GPT主体架构,通过在无标签的数据集上训练得到一个通用的语言模型,随后在下游任务中做进一步微调训练,

自然语言模型开始从专业领域走向通用领域。GPT-1的诞生(2018.6)开启了自然语言预训练时代,随后诞生的BERT模型(2018.10)也沿袭了类似的思路,

但是采用Transformer的Encoder部分作为主体架构。图:

GPT-1预训练之后在下游任务中的微调

图:

GPT模型与BERT模型比较2.8GPT-1开启了自然语言预训练时代

分类任务蕴含任务相似任务不同下游任务双向表示单向表示多选任务GPT主体

2019年2月GPT-2模型被提出,GPT-2的目标旨在训练一个泛化能力更强的词向量模型,GPT-2在GPT-1的模型架构基础上并没有做过多的创新与设计,但是省去了后续的fine-tune过程,

同时使用了更多的网络参数和更大的数据集。

GPT-2使用无监督的预训练模型完成下游任务。GPT-1在构建下游特定任务输入时引入了起始、截断和终止符,在微调过程中教会了机器去识别这些特定符号。GPT-2训练过程采用多任务学习模式,选用提示取代特定符号去做下游任务,例如使用

“translate

to

English

”实现翻译任务,

“answer

the

question

”去实现阅读理解任务。GPT-2验证了通过海量数据和

大量参数训练出来的词向量模型有迁移到其它类别任务中的潜力,证明了预训练大模型在无需微调的情况下也可以完成广

泛的下游任务。图:

GPT-1和GPT-2模型基础架构保持一致

图:

GPT-2实现了模型规模上的扩充Model

Name参数量层数词向量长度注意力头数GPT-1117M1276812GPT-2Small117M1276812GPT-2

Medium345M24102416GPT-2

Large762M36128016GPT-2

Extra

Large1542M48160024BERT-Base110M1276812BERT-Large340M241024162.9GPT-2证明大模型无需微调也可以完成广泛下游任务

GPT-2

SmallGPT-1

GPT-2证明了语言模型无监督预训练的有效性,确立了大模型参数巨量化的技术路径。在此基础上,参数规模更加庞大的GPT-3在2020年5月被提出,证实了无监督预训练路线的正确性。GPT-3相比GPT-2最显著的改变体现在三个方面:>

参数量显著提升:

从GPT-2的15亿参数提升至GPT-3的1750亿,Transformer层数从48层提升至96层。>

训练数据集不断扩充:从GPT-2的40GB上升至GPT-3的45TB,滑动窗口提升至2048,关联语义挖掘能力进一步提升。>

使用少样本学习策略替代GPT-2的零样本学习策略,在少量任务样本训练(Few-shot)设定下,在部分测试中,GPT-3的表现超越了特定领域微调后的自然语言模型,例如在阅读理解测试TriviaQA中,GPT-3表现超越了微调后的最好模型(SOTA)。

图:巨量参数和少样本学习显著提升模型表现

图:

GPT-3在阅读理解测试中表现超越SOTA

2.10GPT-3证实了无监督预训练路线的正确性模型参数量训练样本量

在GPT-3.5版本的基础上,通过3个步骤实现基于人类反馈的强化学习微调(RLHF)

,得到人机对话模型ChatGPT。>

步骤1:监督微调(SFT)——使用精选的人类回答来微调预训练的语言模型以应对各种查询;>

步骤2:奖励模型微调——使用一个包含人类对同一查询的多个答案打分的数据集来训练一个独立的奖励模型(RW);>

步骤3:RLHF

训练——利用近端优化策略算法(PPO),根据奖励模型的奖励反馈进一步微调SFT

模型。

RLHF触发了大语言模型的多项能力,其中包括:应尽翔实的回应、公正的答复、拒绝不当问题等,通过与人类答案的对齐过程,显著提升了大模型的人机对话体验。图:基于人类反馈的强化学习微调

图:

RLHF提升了自然语言模型的多方面表现2.11ChatGPT引入强化学习机制增强人机对话表现遵循指令合适用语幻觉问答遵循约束

2023年3月15日,OpenA

I发布多模态预训练大模型GPT-4,相较于过去的GPT系列模型,提升包括几个方面:>

具备多模态信息处理能力,能够接受图像和文本两种模态的输入,再通过文字给出正确的文本答复。>

文本处理能力更为出色,在为机器学习模型评判标准和为人类设计的专业测试中均取得良好表现。>

安全性和真实性显著提升,模型训练结束之后进行了大量的规范性调试,减少了幻觉事实的输出概率。>

GPT-4构建了用于模型性能预测的深度学习堆栈,能够在模型训练早期,在仅有1/1000‒1/10000训练计算量情况下外推实

现GPT-4模型某些方面性能的准确预测,降低了模型训练过程中的试错成本,缩短了整体训练周期。图:

GPT-4模型在各类人类考试中的表现

图:深度学习堆栈实现模型性能的准确预测中国高考SAT中国律师资格考试LSAT公务员考试GMAT&GRE美国高中数学竞赛2.12GPT-4:卓越的文本处理能力,初步融合多模态能力

2021年6月,OpenA

I发布具备代码生成能力的Codex模型。Codex模型系列是GPT-3系列的后代,

它经过了自然语言和来自Github数十亿行代码的训练,该模型系列精通十几种语言,包括C#、Python、JavaScript、Go、Perl、PHP、Ruby、Swift

等语言,其具备代码语言的编写、补全、添加注释、测试等能力。

基于代码的预训练显著提升了大模型的推理能力。关于大模型是否具有推理能力得到了大量的研究,一个结论是百亿参数级别以上的大模型可能具备简单的逻辑推理能力

,通过思维链的提示可以激发大模型之中的推理能力

。Codex(code-davinci-002)与GPT-3的模型主体保持一致,仅仅将训练文本从文本数据集切换到文本和代码数据集上,在大多数的推理

测试中,模型的推理测试成绩都得到了显著的提升。图:

GPT-3系列模型演进过程

图:

GPT-3和Codex模型在推理测试中的表现2.13Codex赋予大模型代码生成能力、增强逻辑思维能力MethodGSM8KAsDivMultiArithSVAMPSingleEqCo

se

StrategyQACLUTRRnseQAmmontext-davinci-002:code-davinci-002:Self-Consistency76.786.298.685.893.777.378.335.6Greedy

Decode55.375.588.870.587.573.473.832.9Greedy

Decode8.731.431.421.238.248.259.333.6Greedy

Decode37.160.870.760.073.365.560.318.4Diverse82.3(+5.6)88.7(+1.5)99.8(+1.2)87.0(+1.2)94.9

(+1.2)79.9(+2.6)

77.7(-0.6)95.9

(+60.1)Diverse70.2(+12.0)83.5(+6.6)

96.4

(+8.0)

82.7

(+4.5)86.5(-0.7)79.2(+6.3)73.1(+2.4)68.5

(+52.7)Diverse30.9

(+12.0)57.6(+4.8)87.6

(+19.0)

46.9(+2.3)65.1(+5.5)75.0(+17.6)

67.9

(+2.0)92.5

(+50.0)自然语言模型推

理能力显著提升GPT-3davinci

(175B):Self-ConsistencySelf-Consistency42.544.687.288.476.978.272.970.758.259.652.865.968.657.415.818.9

在GPT-1模型发布后4个月,Google发布了自己的语言模型BERT,其采用编码器作为模型主体且采用双向编码结构。从性能上看,与GPT-1模型参数规模相当的BERTBASE性能超越GPT-1,参数量更大的BERTLARGE更是形成了压倒性优势,双向结构的BERT模型很快得到了学术界的广泛欢迎。

GPT可能是一条难度更高、

同时天花板更高的技术路径。直到1750亿参数量的GPT-3模型诞生,在各类下游任务中无需微调便可取得良好成绩,越来越多的企业和研究机构才开始转向GPT技术路线,BERT路线的影响力开始逐渐转弱。OpenA

I在自然

语言模型方面的领先得益于公司对于其技术路径的长期坚持,即使早期并未得到学术界的广泛仍可。图:大语言模型发展树状图

图:

BERT模型的性能超越GPT-1资料来源:

BERT:Pre-training

of

Deep

Bidirectional

Transformers

for

Language

Understanding,中信建投

图:

BERT与GPT论文的引用数

2.14绽放源于技术路线的长期坚持0

1000020000

3000063995GPT-3之后,

码器路线开始

得到逐步重视52375732

9288 GPT-1

GPT-2

GPT-3

BERT40000BERTGPT

2020年后,OpenA

I开始逐步涉足多模态研究领域,2021年3月发布了图文配对模型CLIP。CLIP利用文本信息监督视觉任务自训练,训练数据集为网络搜集得到的4亿个“文本-图像

”对,采用Vision

Transformer模型和ResNet实现图像的特征提

取,将不同模态的原始数据映射到统一或相似的语义空间,实现不同模态信号间的相互理解,模型在这种对应关系中学习

到文本和图像这两种不同模态信息背后的内涵,为多模态的生成模型奠定了基础。

CLIP在零样本学习任务上表现较好。与机器视觉中常用的先预训练然后微调不同,CLIP可以直接使用提示进行零样本学习图像分类,在某个具体下游任务上实现分类。CLIP在具体的细粒度对象分类、地理定位、视频中的动作识别和OCR等27个数

据集的任务中表现十分优异。图:

CLIP模型实现图文信息配对

图:

CLIP在诸多零样本学习任务上表现较好2.15多模态领域的基石性模型CLIP

与CLIP模型同期,OpenA

I开始关注多模态的生成任务,公布了图像生成模型DALL·E。

DALL·E模型包括三个主体部分:dVAE、Transformer和CLIP。首先通过dVAE将图像信息转序列,后将图像序列和文本序列融合拼接,将拼接输入的数据输入transformer中进行自回归训练,在图像生成过程中,通过文本序列自回归得到图像序列,

在dVAE中实现图像的还原生成过程,最后通过训练好的CLIP模型进行匹配打分来把控生成质量。

2022年4月提出的DALL·E

2进一步升级。首先是利用CLIP文本编码器将图像描述映射到表示空间,其次利用扩散先验从CLIP文本编码映射到相应的CLIP图像编码,最后通过反向扩散从表示空间映射到图像空间,生成众多可能图像中的一个。图:

DALL·E模型主体结构

图:

DALL·E

2模型主体结构2.16DALL·E模型实现文本到图像的跨模态生成基于扩散模型实现

高质量的图像生成文本序列和图像序列融合基于CLIP模型构建起图像和文本的统一语义关系图像信息

转序列文本信息

转序列

2022年9月,OpenA

I提出自动语音识别(ASR)

系统Whisper,根据从网络收集的68万小时的多语言和多任务监督数据进行训练,Whisper支持99种语言,英语语料内容大约占据2/3。

Whisper架构采用标准的Transformer模型编码器-解码器。输入音频被分成30秒一段的片段,然后转换成log-Mel频谱图传递到编码器。编码器来计算注意力,最后把数据传递给解码器,解码器被训练来预测相应的文本,并添加特殊标记,这些

标记用来对单个模型执行诸如语言识别、多语言语音转录和英语语音翻译等任务。

图:语音识别模型Whisper主体架构

图:

Whisper在长文本转录方面具有较强竞争力

2.17Whisper实现语音到文本的跨模态生成

着眼于通用人工智能的发展目标,我们预计,OpenA

I的研究会沿着两个方向进一步延升:多模态能力不断提升;

大模型充当A

I代理、能力范围不断扩大。

多模态能力不断提升。GPT-4初步融入了多模态能力,具备了图像的识别和理解能力,OpenA

I在图像生成方面也颇有建树,预期未来在大语言模型基础之上,也会融入图像生成等多模态能力。

大模型充当AI代理,通过调用各种专业化工具进一步扩大能力范围。大语言模型未来将与搜索引擎、代码编程工具、实体机器人等专业化工具进一步深化融合,打造更强大高效的多任务解决方案,为现实世界中的复杂任务提供全面的支持,让

大模型成为日常生活中的个人助理,充分释放个人创造力。图:大语言模型与AIGC模型的融合途径

图:

A

I代理进一步扩大语言模型能力范围2.18

未来技术展望大模型全面赋能微软传统业务

29第三章

大语言模型具备出色的文本理解与处理能力,个人办公领域涉及到大量的文本处理工作,与大语言模型的优势高度契合,是大语言模型最佳落地场景。微软业务多聚焦在个人办公领域,是OpenA

I的最佳合作伙伴之一。微软和OpenA

I合作始于

2016年,2019年7月合作关系得到进一步巩固,随后不断在Aure云、大模型模型方面加强合作。

OpenA

I与微软达成人工智能行业的一次双赢合作。OpenA

I的通用人工智能研究需要庞大的计算能力做支撑,

同样需要充足的资金支持去支付运营成本和科研人员薪酬。微软也亟待OpenA

I的合作增强其A

I技术实力,微软作为OpenA

I先进人工智能

技术的首选商业合作伙伴,获得了人工智能技术商业化的竞争力。

图:微软和OpenA

I合作历程

3.1个人办公是自然语言大模型的最佳落地场景3.2大模型以云为基,全面赋能微软传统业务

图:微软产品体系下各业务与大模型结合下的新功能及展望

微软FY2023Q3的营业收入为528.57亿美元,

同比增长7.1%,营业利润达到223.5亿美元,

同比增长9.7%,毛利率为69%。

生产力及业务流程:

FY2023Q3营业收入175.2亿美元,

同比增长10.9%。得益于Office365copilot的推出,Office365Commerical营收同比增长14%,用户量增加11%,

而Microsoft365的订阅量达到6540万,

同比增长12%。Dynamics产品营收

同比增长25%。

智能云业务:FY2023Q3营业收入220.8亿美元,

同比增长15.9%,其中Azure和其他云服务收入增长27%。

个人计算业务:

2023Q3营业收入132.6亿美元,

同比降低8.7%。受PC需求疲软影响,Windows

OEM收入和设备收入分别减少28%和30%。New

Bing的推出带来了搜索量和用户量的提升叠加收购Xandr,搜索和新闻广告业务收入同比增长10%。

图:微软营业收入和营业利润情况(亿美金)

图:微软主营业务收入构成(亿美元)

600.00500.00400.00300.00200.00100.000.00

个人计算业务

生产力及业务流程

智能云183.27

190.51

209.09

203.30

215.08

220.81146.01

173.75

169.64129.86159.36146.91

150.39123.19118.49

151.22

130.36

140.86133.14

174.65

145.20143.56133.30

142.37132.601,258.431,103.60

17.5%

18.0%

14.3%

14.0%

13.7%

699.16

833.833.3微软分业务经营情况

营业收入

营业利润

营收yoy

利润yoy

32.0%

2,500.002,000.001,500.001,000.00500.000.0035.0%30.0%25.0%20.0%15.0%10.0%5.0%0.0%429.59

529.59350.58FY2018FY2019FY2020FY2021FY2022FY23Q1-Q322.5%19.5%642.696.4%2.3%1,557.2619.3%23.3%1,430.15157.89

166.001,982.701,680.88151.18170.02164.70133.53175.16135.52

Microsoft

Azure是全球第二大云服务提供平台。Azure智能云平台是微软的公用云端服务平台,遍布全球42个区域覆盖百余个数据中心,根据Synergy数据,2023Q1Microsoft

Azure占到23%的云服务提供商市场份额,仅次于亚马逊AWS。

大模型对微软Azure云服务产生直接促进作用。OpenA

I成立之初,与微软就Azure云展开了合作,后续OpenA

I把服务逐步转移到微软Azure云上运行。

自然语言大模型背后需要庞大的算力和通信带宽做支撑,对Azure云服务产生了直接促进作用。

Azure

OpenA

I服务允许通过API访问OpenA

I的模型,包括GPT-4、ChatGPT、Codex、DALL-E2和Embeddings模型系列。微软智能云业务FY2023Q1-Q3营收639亿美金,单Q3营收221亿美元,

同比增长16%,其中Azure和其他云服务收入增长27%。FY23Q3Azure

OpenA

I已有2500个服务客户,下个季度中有一个百分点的收入增长来自于人工智能。图:微软智能云业务收入情况及增速

图:

23Q1云服务提供商市场份额情况

10.0%

5.0%

21.0%

483.66

20.0%

17.4%

389.85

17.60%

322.19

15.0%3.4OpenA

I服务与Azure云深度融合2%

2%3%3%4%10%23%

Alibaba

Cloud

IBM

Cloud

ORACLE

Tencent

Cloud

0.0%8007006005004003002001000

639.14

24.1%600.824.2%25.3%

营业收入(亿美金)

yoy

Salesforce

Other30.0%25.0%

GoogleCloud

MicrosoftAzure

AmazonAWS21%

752.5132%

Microsoft

Azure云具备较强的生态优势和协同效应。Azure云提供Office365、Dynamics、Linked

In等Saas化服务,微软IaaS、PaaS、SaaS各产品均采用同类数据模型,形成较强的协同优势。近期,Azure云市场份额占比持续不断上升。

OpenA

I与Microsoft

Azure云深度融合之后

实现了其Saas化服务的全面赋能

。通过将大模型能力融入Office365、Dynamics、Linked

In等产品,不断增强其丰富生态下的产品能力。Azure

OpenA

I同时提供大模型的全栈式工具,其中包括

预训练的大模型、大模型的应用微调、用于检测和减轻人工智能有害输出的工具、基于用户的访问控制和专用网络的企业

级安全性保障。全栈工具促进企业级应用与大模型的结合,进一步增强云上业务的协同优势。图:云服务提供商市场份额变化情况

图:

Microsoft

A

I产品组合3.5OpenA

I助力Azure云增强其生态优势和协同效应18Q118Q218Q318Q419Q119Q219Q319Q420Q120Q220Q320Q421Q121Q221Q321Q422Q122Q222Q322Q423Q160.0%50.0%40.0%30.0%20.0%10.0%0.0% Amazon

AWS

Microsoft

Azure

Google

Cloud

OtherothersGoogle

Office因为操作简单、功能强大而快速占领市场。微软Word具备“所见即所得

”的编辑模式和支持鼠标操作的简洁模式,Excel支持自动计算公式,支持宏等功能,让用户能在简便操作下完成复杂任务。Office因为操作简单、功能强大而快速占

领市场,据worldwide数据,2022年Office365在全球办公套件领域市场中份额占比为45.5%。

微软推出的Microsoft

365

Copilot,通过大型语言模型进一步强化Office

365操作简单、功能强大的优势。Microsoft365Copilot将大语言模型与Microsoft

Graph中的数据以及Microsoft365应用程序相结合

重塑个人生产力

。通过copilot应用程序,

大语言模型中深刻融入到个人工作流程中,为个人工作者释放生产力、提升创造力同时增强技能。Copilot同时提供商务聊天模式,汇集文档、演示文稿、

日历等数据来源,增强团队成员的信息融合。

目前Microsoft

365

Copilot仍在试用阶段,未来有望推出定价从而拉动Office

365业务量价齐升。图:

2022年全球办公软件市场份额情况

图:

Microsoft

365

Copilot3.6ChatGPT进一步强化Office操作便捷、功能强大的优势

GoogleApps

MicrosoftOffice

365

Microsoft

PowerPoint

AdobeAcrobat

Pro45.5%50.3%0.5%2.4%

Word:Copilot协助用户实现文档的创建、编写、润色、总结,让用户专注于创造力富集、重要的工作之中。

Excel:Copilot可以根据用户需求生成模型,快速实现数据的定量分析,

同时提供强大的可视化功能。Copilot协助用户快速理解和分析数据,寻找潜藏在数据背后的客观事实。

PowerPoint:可以通过Copilot直接基于相关的Word,一键生成演示文稿;也可以通过自然语言的命令,根据提示或大纲创建新的演示文稿;

也可以通过语言命令来调整布局、重新格式化文本、添加动画效果。

Outlook:Copilot帮助用户筛选和总结重要的电子文件内容,并根据自然语言命令自动生成相关的电子邮件。通过Copilot可以有效地减少办公中阅读浏览电子邮件和回复电子邮件的时间,显著提高办公效率。图:

Word中根据用户需求生成文档初稿

图:

PowerPoint根据Word一键生成相关演示文稿3.7ChatGPT进一步强化Office操作便捷、功能强大的优势

Dynamics

365是微软面对企业现代化需求推出的智能化应用组合。Dynamics365融合企业的销售业务和信息管理服务,统一整合Dynamics

CRM和Dynamics

NA

ERP等产品,有效连接组织架构下的人员、数据和操作流程,降低企业的运行成本并且简化了商业流程。

大模型助力Dynamics

365

Copilot实现企业运行的降本增效。CRM(客户关系管理)

、ERP(企业资源管理)

系统中经常需要执行繁琐的任务操作,比如数据的手工输入、

内容生成和事实记录。微软率先将大语言模型与其CRM、ERP系统进行融合,

帮助用户实现任务自动化、提供工作创意、并获得见解,从而快速推进交易、深入理解客户需求,提升客户问题的响应速度。例如Dynamics365下的Viva

Sales,允许卖家使用Microsoft365和Microsoft

Teams自动将数据捕获到CRM系统中,消除了手动数据输入,

同时通过A

I推荐最佳的营销行动,缩短整个销售周期,Viva

Sales用户每月收费40美元。

图:

Viva

Sales通过A

I建议缩减销售周期

图:

Customer

Insights利用生成式A

I提供实时客户数据分析

3.8Dynamics365通过大模型进一步实现企业运行的降本增效

微软具有的强大的报告和数据分析能力,凭借这一优势Dynamics365占据ERP市场主导地位。根据Software

Connect数据,2022年ERP市场中,微软市场份额占比超过30%。

引入大模型之后,进一步加强Dynamics在ERP方面的优势。

根据Worldwide数据,2021年微软在CRM的市场占比为5.3%。在CRM领域中面对Salesforce和Oracle的竞争中,核心竞争力主要是简单易操作的界面和集成度高的相关办公软件(可以与Access和Outlook集成)

。Dynamics365Copilot通过自然语言

模型进一步提高自身操作便捷的优势,通过简单语言命令完成相关操作。也可以通过A

I增强与其他微软产品的联系,提升

高集成度下的工作效率。图:

2022全球ERP市场份额情况

图:

2016-2021年CRM市场份额情况50.0%45.0%

40.0%

35.0%

30.0%

25.0%

20.0%

15.0%

10.0% 5.0%0.0% salesforce.com

SAP

Oracle

Microsoft

Adobe3.8%3.2%5.3%4.0%5.1%7.1%5.4%6.5%5.3%5.6%23.8%16.8%29.70%31.50%1.60%11.80%6.10%8.10%3.9Dynamics365Copilot通过A

I加强核心竞争力 Microsoft

SAP

Deltek

Sage

Oracle

Workday

Epicor

Other

3.8%4.0%4.8%4.8%3.6%3.7%5.2%3.5%3.4%5.7%2020202119.6%19.5%18.4%18.1%5.10%1.60%9.4%7.2%2016201720182019

Linked

In(领英)是面向商业的社交网站,于2003年5月正式推出。与Facebook和Myspace等其他社交网站不同,Linked

In强调用户之间的专业联系,而不仅仅是用于娱乐与社交的网站与应用。用户可以在个人资料界面制作简历、介绍自己的职

业、技能和工作经验,通过搜索等方式建立自己在工作上的联系和社交网络。微软在2016年完成了对Linked

In的收购。

Linkedin通过引入大语言模型加快招聘流程、提升商业效率。Linkedin将GPT-4融入到A

I助理之中,帮助招聘单位加快招聘流程,A

I助理根据公司名称、职业名称、工作类型等信息快速生成职位描述;针对个人用户,A

I助理可以根据用户的工

作经历和相关工作技能,提供关于个人页面标题和摘要的撰写建议。图:

Linkedin利用大模型快速实现职位描述

图:

A

I助理提供的写作建议3.10Linked

in通过引入GPT-4提高商业社交效率

2023年2月7日,微软推出了引入大模型驱动的New

Bing和Edge浏览器。在引入了GPT-4后,bing优化了相关的搜索体验,大语言模型可以帮助查看来自整个互联网下的搜索结果,

自动查找、整合和汇总相关答案,

同时bing提供了相应的网站索

引,方便进一步查看。根据FY23Q3财报数据,Bing移动应用的每日安装量增长了4倍。

随着GPT-4的引入,Bing新增了Bing

Chat等功能,可以通过交互式聊天的方式进行更复杂的搜索,用户可以通过不断的交流来完善自己的要求。GPT-4的引入让Bing也不再仅仅拥有搜索的功能,还可以根据用户的相关要求,撰写电子邮件、生成

具体的文案、

内容来帮助用户产生灵感。图:使用Bing生成旅行计划

图:

Bing搜索每日访问人次(百万)3.11Bing引入GPT-4有效提升搜索效率与交互体验555045403530

New

Bing

2023年3月21日,微软将Bing

Image

Creator集成到New

Bing当中。Bing

Image

Creator可以通过A

I的方式根据文字描述生成相应图片,该功能基于OpenA

I的多模态模型DALL-E,Bing不仅可以搜索网络上已经存在的图像,还可以根据用户的相

关描述,直接生成相关的图像,进一步提升Bing用户的体验。

Bing推出了Knowledge

Cards

2.0功能。Bing新增的图谱卡片会出现在必应搜索结果页面的右侧,可以通过提供图像、短视频、

图表、时间线等方式帮助用户快速探索感兴趣的内容,增加用户在使用Bing时的搜索体验和内容交互方式,使查找

资料的过程更加高效和有趣。图:

Bing

Image

Creator的图片生成功能

图:

Bing的Knowledge

Cards

2.0功能3.12Bing率先引入多模态生成能力

ChatGPT与Windows融合进一步增强Windows操作的便捷性。微软计划将Bing

With

ChatGPT接入到Windows11的任务栏中,以此提高用户的操作性,

同时让Windows用户能够更容易的找到系统

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论