极客传媒-2023年·第二季中国卓越技术团队访·谈·录_第1页
极客传媒-2023年·第二季中国卓越技术团队访·谈·录_第2页
极客传媒-2023年·第二季中国卓越技术团队访·谈·录_第3页
极客传媒-2023年·第二季中国卓越技术团队访·谈·录_第4页
极客传媒-2023年·第二季中国卓越技术团队访·谈·录_第5页
已阅读5页,还剩162页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

桌面QQ重构,探寻跨平台开发挑战与Electron内存优化突破 13 中国卓越技术团队访谈录·2023第二季i两个多月完成全自研:大模型之争,采访嘉宾:罗云、邹鹏、杨亚洲作者:冬梅在大模型爆火之前,国内向量数据库赛道略显荒芜,市场上独立开发向量数据库的厂商只有个位数。这是因为向量数据库的应用场景比较单一,大多用于推荐、图搜图等场景中,因此在AI技术没有取得突破性进展之前,向量数据库一直不温不火,这种状态直到去年ChatGPT问世后才有所改变。去年10月,OpenAI发布了智能聊天机器人ChatGPT,随后短短几天内注册用户就突破上亿人,一时间,与AIGC等大模型相关的技术成为了VC眼中炙手可热的投资从目前VC的投资数据来看,投资者对于AI的关注点主要有三个:第一个是基础大模型LLM,第二个是具体某个场景的应用(包括小模型),第三个就是基础模型与应用层之间的中间层(开发者工具和数据库等)。随着各种AI应用诞生,中间层已经成为各大VC争抢的投资标的,早期默默无闻的向量数据库一跃成为当下最大的一个热门,各数据库厂商摩拳擦掌都想在这一垂直赛道分一杯羹。机构观点认为,AI大模型或催生向量数据库应用骤增,向量数据库或迎重中国卓越技术团队访谈录·2023第二季要发展机遇。最近,腾讯云团队也正式发布了专业型向量数据库(TencentCloudVectorDB),InfoQ有幸采访到了腾讯云数据库团队,与他们一同探讨了腾讯云向量数据库背后的故事以及他对于向量数据库现在所面临的挑战和未来发展趋势的思考。“走了不少弯路,也踩过很多坑,但最终还是遇见了星辰大海。”2010年,腾讯这家千亿巨头还埋头在自家地里辛勤耕耘,QQ空间等一众应用的爆火,让腾讯的服务器忙得不可开交,为了承接住如此高并发的流量洪潮,腾讯在短短一个月内额外购买了上千台服务器。但流量不会永远停在峰值上,当流量回落后,闲置的服务器就造成了资源的浪费。另一方面,应用的爆火也为腾讯下游的小程序和游戏方们带去了巨大的流量,但他们有限的服务器无法承接住如此庞大的流量洪流。急,服务器我有。找上门的生意没有不做的道理,就这样,2011年左右腾讯开始筹备组建一支十几人的云团队,将内部技术能力以产品和服务的形式对外销售,当时他们做了一个产品,叫OpenCloud(开放云),这就是后来腾讯云的雏形。有了一众明星级应用等加持,腾讯云团队的技术实力很快得到了市场的认可,同年年中国卓越技术团队访谈录·2023第二季底,腾讯就已经积累了近3000家客户。云计算是一个人力密集型的赛道,需要投入大量人力才能把客户维护好。就这样,为了更好地支持腾讯云业务,腾讯深圳大本营分别在深圳、北京和杭州扎了根,随后扩展到了成都等多个城市。随着OpenCloud打磨了云技术的底座,腾讯成立了独立的云计算品牌腾讯云,正式开启了公有云的万里征程。担任腾讯云数据库副总经理的罗云,就是腾讯云业务团队的创始成员之一。据罗云介绍,从2011年开始做云业务至今,整个团队经历了多次方向上的调整,直到2017年看到国产数据库这个大趋势后,成都团队才定下调来主攻数据库赛道。与很多互联网公司不同的是,腾讯初始的业务发展并未对数据库有过强依赖,腾讯内部没有去IOE的过程。一开始,腾讯云数据库建设主要引入了当时业界较为主流的开源数据库,如MySQL、Redis、MariaDB、PostgreSQL等。随后针对云上客户定制需求,腾讯云在数据库中衍生研发了如数据库并行复制、审计日志、在线加字段等核心功能,并计划逐步将以上功能回馈给MariaDB和MySQL社区。随着腾讯云数据库积累的客户越来越多,客户的需求越来越定制化且应用场景更加复杂,在业务倒逼之下,从2012年开始,腾讯云研发了适配内部业务自研数据库TDSQL,此后又推出多款自研数据库TDSQL-C、TBase等产品。在习惯了Oracle、MySQL等国外十分成熟的数据库后,客户对新兴数据库产品的要中国卓越技术团队访谈录·2023第二季求很高,既要求高并发、高可用、低延迟等高性能,还要保证数据持久化,因此对团队的技术水平要求极高。罗云举例称,“在数据库每次热升级时,要做到让用户无感是非常困难的。在断开又重连的过程中,我们的团队能做到秒级别的抖动。因为我们在数据库的内核上做了很多工作,比如做了两层架构,软件的第一层叫proxy(接入层),下面有cache(存储层),我们通过一些逻辑使这两层叠加后就可以实现做业务替换时让客户毫无感知。”为了应对高性能和数据持久化的要求,腾讯内部还100%自研了KeeWiDB数据库,这是一款完全兼容Redis协议的新一代分布式KV存储数据库,实现了数据的冷热分级,满足业务高性能、持久化、低成本、大规模的四大诉求,这也为后面腾讯自研向量数据库打下了坚实的技术基础。此外,腾讯云与中科大联合撰写的论文PLIN:APersistentLearnedIndexforNon-VolatileMemorywithHighPerformanceandInstantRecovery已被数据库国际顶会VLDB收录。在大模型浪潮爆发后,腾讯云在一众大厂中抢先发布了自己的向量数据库产品。据悉,整个产品从立项到最终完成产品化仅用了不到3个月的时间。之所以能如此快地推出这款产品,罗云表示,这主要得益于两方面:一个是云团队内部多年的技术积累;另一方面是这个团队中每个人都是能打“硬仗”的好兵。中国卓越技术团队访谈录·2023第二季v去年年初,随着ChatGPT的爆火,国内“百模大战”趋势日渐明显。腾讯云也在思考从哪个方向找到突破口切入到大模型“军备竞赛”中。随后到了3月份,ChatGPT发布了一个叫“Plugin”的插件功能,Plugin的标准案例中提到向量数据库是大模型产品中必不可少的一个组件。因为当前的大模型都是预训练大模型,它能够学到的数据只是公开数据,更多的企业私有数据和实时数据大模型是学不了的。既无法学习实时数据,又学不到企业私有数据,这是预训练大模型在时间和空间上的两大限制。基于这个逻辑,大模型一定会需要一个外部的“海马体”,也就是存储组件来存储这些知识。另一方面,市场上很多做大模型的企业也在向腾讯云团队寻求一款企业级的向量数据库产品。就这样,在加深了对大模型的探索和对行业有了更清晰的认知后,腾讯云团队认为向量数据库是一个必须要做并且要赶紧做出来的产品。对齐了需求后,就来到了执行层面。摆在腾讯云面前的第一个选择就是到底要做什么类型的向量数据库类型,究竟是做插件式还是自研?出于市场需求侧的压力,腾讯云想快速推出一款产品,所以刚开始也考虑了用RedisSearch插件式的方案来做产品。但经过调研发现,这种全内存的方案成本太高,这也腾讯云坚定了要做自研的决心。据腾讯云向量数据库产品负责人邹鹏介绍,腾讯云向量数据库真正立项时间是在5月中下旬,随后技术团队就着手调研研发方案了。既然时间如此紧迫,那不如从腾讯的内部项目中考察是否有能够匹配得上的产品,这样是最高效的解决方案。中国卓越技术团队访谈录·2023第二季邹鹏认为,做一款云数据库最核心的两大要素就是管控和内核:管控是指要给数据库做一些功能,把它产品化,就比如数据库的控制台上一系列可操作的功能;内核就是数据库数据层面的东西。在管控层面,通过多年的技术积累,腾讯云沉淀出了一个比价成熟的云原生管控平台——云巢,这是一款PaaSonIaaS方案,自2019年上线后一直稳定地为所有腾讯云数据库产品服务。在内核层面的选择上就要比管控层复杂一些。因为腾讯集团内部有多款数据库内核可供选择,究竟该选择哪一款就是个问题。经过调研后,腾讯云数据库团队认为,使用规模和体量最大的向量引擎Olama是向量数据库内核的最佳选择。QQ、QQ空间、腾讯视频、腾讯新闻这些业务场景中都会涉及推荐、搜索等向量技术,也从一定程度上验证了Olama的技术实力。此外,Olama采用了比较前沿的分布式的、Raft架构设计,这种架构设计逻辑也更偏向于数据库的架构逻辑,且易于维护。更重要的是,Raft架构在弹性上也设计得非常灵活,它甚至能够做到表级别的资源扩展。邹鹏称,在和PCG团队沟通后,了解到他们也有非常强烈的上云需求,两个团队一拍即合,管控层和内核层全部尘埃落定,这个项目基本上已经完成了大半。Olama和云巢都是腾讯集团内部非常成熟的产品,如何高效强执行的将两者融合在一起的过程中还是给团队带来了一些挑战。中国卓越技术团队访谈录·2023第二季整个团队花费时间和精力比较多的工作在接口和协议的处理上。由于Olama和云巢此前都是腾讯内部自用的产品,它们接口的一些功能设计无法友好地对外服务,因此需要进行重新设计接口,这是对内核改造最大的一部分工作,也会占用一些新的研发资源并加大在这方面的投入。经过了两个多月的摸爬滚打后,腾讯云向量数据库现已在官网上线。要想做出一款好产品,仅有技术上的积累是不够的,背后团队的技术实力也同样重要。罗云称,“数据库是个比较卷的赛道,没有最卷,只有更卷。在这么短的时间内推出上线一款全新的自研数据库,对团队成员来说是不小的挑战。但我们的工程师都是很‘能打’的。”提交千行MongoDB代码被采用,做数据2022年下半年,腾讯云MongoDB专家工程师杨亚洲在帮助一家头部金融企业维护数据库时发现,他们单个数据库集群数据量很大,达到几百上千亿条。会不定期出现性能抖动,有时延迟也比较大,抖动高的时候甚至都可以达到秒级别。MongoDB本身是个分布式、无限量扩容的数据库,但如果硬件资源不足,又数据量过大的情况下,业务访问就会可能会产生抖动。抖动原因是集群大、数据量多了过后,路由信息会很多,路由变更的过程中,如果资源不足,就可能会产生抖动,而这样的抖动和延迟可能会影响客户的业务。中国卓越技术团队访谈录·2023第二季杨亚洲认为,当时这家头部金融企业用的是腾讯云MongoDB数据库,该金融客户遇到的问题在腾讯云线上MongoDB中也同样会遇到,腾讯团队从一切为了客户的角度出发,借助自身对MongoDB深厚知识迎难而上,决心既要为客户消除这个可能影响业务的抖动,又避免传统单纯扩容增加用户的成本。“为了从根本上解决问题,于是我花了近三个月的时间,分析造成问题的原因和解决问题的技术瓶颈到底是什么,通过底层代码优化调整,然后彻底把问题解决掉了”,杨亚洲表示。解决掉这个问题后,腾讯云数据库团队向MongoDB官方提交了一个1000行的patch,最终该patch被他们接受了并收到了MongoDB官方的感谢。“专业的向量数据库需要有长时间的积累和投入才能做得出来,但相应的它的天花板也更高。”AIGC技术迎来大爆发后,国内外科技公司纷纷推出自家大模型产品,这一波浪潮把向量数据库这一原本没那么火爆的赛道推到了聚光灯下。向量数据库本质有三种形态:第一种是纯单机向量数据库,它不是分布式的;第二种是在传统数据库上加上一个具备向量检索能力的插件;第三种是独立的、专业的企业级向量数据库。目前国内的许多企业并没有采用专门的向量数据库,而是在原来传统数据库上增加了一项向量检索能力,也就是上述提到的第二种形态。从表面上看,独立的、专业的向量数据库看起来并不是那么刚需,但事实的确如此吗?中国卓越技术团队访谈录·2023第二季这就要从传统数据库和向量数据库的区别来看了。传统数据库和向量数据库的主要区别在于它们的数据存储方式、数据规模、查询方式和计算密集型。数据存储方式:传统数据库存储的是结构化数据,而向量数据库存储的是向量数据,即将非结构化数据(如图片、音频、文章等)转换为向量方式来存储。数据规模:传统关系型数据库的管理数据规模通常为千万级,而向量数据库的需求数据规模则以达到千亿级。查询方式:传统数据库的查询通常是精确查询,即查询结果要么符合条件要么不符合条件。而向量数据库则使用相似性查找,即查找与查询条件最相似的结果,这需要更高的计算能力。计算密集型:传统数据库的查询主要是事务处理,而向量数据库的查询则是计算密集型,需要进行大量的向量计算和比较。总而言之,向量数据库的主要特点是能够高效地存储和查询大规模的向量数据。它通常采用基于向量相似度的查询方式,即根据向量之间的相似度来检索数据。这种查询方式可以用于各种应用场景,例如图像搜索、音乐推荐、文本分类等。维度越高、信息量越大,这些特性都是传统数据库很难做到的。这种专门用于存储、索引和查询嵌入向量的数据库系统,可以让大模型更高效率的存储和读取知识库,并且以更低的成本进行finetune(模型微调),还将进一步在AINative应用的演进中扮演重要作用。目前,大语言模型(LLM)往往包含数十亿个参数,嵌入则广泛作用于这些模型的训练和微调过程,使其获得执行各种NLP任务的能力。在MaaS业务的训练、推理等场景,向量数据库都非常重要。中国卓越技术团队访谈录·2023第二季x更重要的是,向量数据库可以大幅度拓展大模型的时间边界和空间边界。目前的大模型都是预训练模型,对于训练截止日之后发生的事情一无所知。向量数据库可以通过存储最新信息后给大模型访问来弥补这点不足。此外,通过向量数据的本地存储,向量数据库能够协助解决目前企业界最担忧的大模型泄露隐私的问题。向量数据库还自带多模态功能,能够实现用中文搜索英语图书、用俄文搜索图片内容等操作,向量数据库的近似搜索能力能够给向量数据库带来巨大的商业化潜力。在罗云看来,现在我们无法完全笃定地说最终向量数据库会停留在哪个形态上,但他认为第三种形体是可以向下兼容前面两种形态的,只是这种专业的向量数据库需要有长时间的积累和投入才能做得出来。第一个形态它可能边界就在几十万行的下面,第二个形态它可能做到几百万行到亿可能就搞不定了,如果要做到亿到10亿的数据规中国卓越技术团队访谈录·2023第二季模,就需要专业的企业级分布式向量数据库了。虽然去年至今年国内外大模型产品和企业层出不穷,但罗云认为,目前大模型还处于技术发展的初期阶段,相应地,与之相关的技术也处于较早期。以向量数据库技术发展现状来看,向量数据库的发展可以分为三个演进阶段:第一个阶段,是向量数据库概念的定义和规范阶段。也就是一款数据库它要具备向量数据库所有的特征,在向量存储能力、检索能力上达到向量数据库的要求,能够满足客户的基本需求,才可以称之为向量数据库。第二个阶段,是向量数据库核心成本优势的竞争阶段。当我们把向量数据库的概念和特征明确后,就要求数据库厂商们“卷起来”了。他们要去真刀真枪地对比谁家的产品成本更低,比如单QPS查询需要客户付多少钱、它节省了多少人力和时间成本等。第三个阶段,是向量数据库的易用性打磨阶段。这个阶段就主要去解决客户“既要又要”的问题了。客户已经不再只要求成本上的降低,还会更加关注数据库性能的极致体验,这也是向量数据库厂商们要大力投入的方向。目前来看,客户的需求还只是停留在需要一款真正的向量数据库上。相比于传统数据库,客户在做向量数据库选型时就容易得多,因为应用场景单一,不会涉及太多混合场景需求。罗云称,“在市场侧,国内客户在做数据库选型时更倾向于选择有持久性保障的厂商,客户们会考虑你的服务的可延续性,这个比较重要。”中国卓越技术团队访谈录·2023第二季在技术层面,罗云预判向量数据库未来会朝着与云和云的基础设施结合的发向发展,也就是AINative化的向量数据库。他进一步解释道:“在向量里面,决定向量数据库核心性能的指标是它的向量检索算法,而这个算法其实比较成熟了。所以当我们要攻破数据库单QPS查询成本的时候,就会考虑如何将整个云服务结合IaaS、容器的核心竞争力都组合在一起去打磨向量数据库,这也是我认为在向量数据库赛道未来云厂商能够跑出来的第一个点”。此外,随着向量数据库和AI的结合更加紧密,客户向量数据库的易用性会有更高要求,这也是刚才罗云提到的第三个发展阶段,有了AI和数据库相关技术的积累后,就可以很方便地将这些能力组装进向量数据库里,产生核心竞争力。采访嘉宾简介罗云,腾讯云数据库副总经理邹鹏,腾讯云向量数据库产品负责人杨亚洲,腾讯云MongoDB专家工程师中国卓越技术团队访谈录·2023第二季嘉宾:赵增博士作者:凌敏宋徽宗赵佶曾创作过一幅名为《蜡梅山禽图轴》的画作,并为该画题了一首诗:“山禽矜逸态,梅粉弄轻柔,已有丹青约,千秋指白头。”讲述的是一对白头翁立于这丹青笔墨的虚空中,没有风,没有阴影,没有俗世喧嚣、红尘侵染,一千年恩爱如初,一千年只不过黯淡些羽毛上的墨色,艺术比生命更长久。以此诗为灵感,网易集团高级副总裁胡志鹏给网易伏羲自研文生图模型取名为“丹青”,依托于该模型之上构建的AIGC平台名为“丹青约”。丹青模型基于原生中文语料数据及网易自有高质量图片数据训练,与其他文生图模型相比,丹青模型的差异化优势在于对中文的理解能力更强,对中华传统美食、成语、俗语、诗句的理解和生成更为准确。比如,丹青模型生成的图片中,鱼香肉丝没有鱼,红烧狮子头没有狮子。基于对中文场景的理解,丹青模型生成的图片更具东方美学,能生成“飞流直下三千尺”的水墨画,也能生成符合东方审美的古典美人。中国卓越技术团队访谈录·2023第二季2成的图片近日,InfoQ采访到了网易伏羲预训练及生成式人工智能平台负责人赵增博士,进一中国卓越技术团队访谈录·2023第二季3步了解丹青模型的构建思路。网易伏羲成立于2017年,主要研究方向为强化学习、自然语言、用户画像,视觉计算,虚拟人等,技术应用智能捏脸、反外挂、智能NPC、对战匹配、竞技机器人、人机协作、数字孪生等多个方向,团队已在世界顶级学术会议发表论之200余篇,申请发明专利550余项。2022年被称为AIGC(生成式人工智能)的元年。ChatGPT火遍全球,成为现象级应用。在年末Science杂志发布的2022年度科学十大突破中,AIGC作为人工智能领域的重要突破赫然在列。进入2023年,AIGC技术助推出新的人工智能浪潮,AI大模型的创新应用按下加速键。而其中,文生图仍是大模型最火热的应用领域之一,国内外发布的文生图模型数量不断攀升。越来越“卷”的文生图模型们,正促进模型生成效果和效率迈上新台阶。“在过去的半年里,我深刻地感受到了AIGC技术的飞速发展。整体来看,去年整个行业和技术相对来说不如今年活跃。今年以来,行业和社会都开始更加关注AIGC的发展,AIGC技术发展速度惊人。”赵增在接受InfoQ采访时表示,AIGC技术的飞速发展使得文生图模型不断实现更加良好的生成效果,与此同时,以StableDiffusion为代表的开源项目空前活跃,很多没有强大AI背景的开发者也能够基于开源生态做出优秀的AI模型。“这对我们产生中国卓越技术团队访谈录·2023第二季4了很大的冲击,我们需要重新审视自身的工作路径,并考虑如何与有志于参与模型建设的行业伙伴建立关系。同时,我们也要考虑如何支持内部同事,尤其是那些掌握了一定AI生产能力的美术同事们,帮助他们更好地利用AIGC技术,以提升他们的工作效率和质量。”据了解,网易伏羲从2018年开始关注AIGC技术在产品中的应用可能性,不断尝试将其应用于实际场景。2018年,GPT横空出世,其强大的生成效果令人印象深刻。在胡志鹏的推动下,网易伏羲开始尝试在游戏中使用AIGC技术,推出一些互动玩法。比如,在《遇见逆水寒》游戏中,网易伏羲引入了一个文字生成类的玩法——傀儡戏。在这个玩法中,玩家可以扮演剧情角色,通过聊天的方式,与AI共同创作剧本,共同协作达成一些目标。这也是国内首个将AI接入游戏中,与玩家共同创作剧本的玩法。2019年,网易伏羲尝试将这一设计正式大规模上线,并在训练应用、工程加速等多个方面进行直接探索。与其他AI研究机构相比,网易伏羲的优势在于能够快速在产品中验证AI技术,根据实际应用效果不断迭代优化。赵增表示,网易有多款产品,可以通过类似“实验田”的方式验证AI产品在游戏或其他产品中的可行性,“这也是网易的一个良好机制,可以快速验证和实现AI的应用。”中国卓越技术团队访谈录·2023第二季52021年,网易伏羲正式启动大规模预训练研发项目,并得到了浙江省政府的支持。根据项目规划,网易伏羲计划开发文本、图像、音乐等一系列AI大模型。在与网易集团多个业务的专家交流后,网易伏羲判断多模态将是未来发展趋势,决定优先专注多模态相关的工作,如文本到图像、文本到音乐、图像到音乐的理解和生成。文生图模型丹青正是其中的主要工作之一。2022年上半年,网易伏羲开始启动丹青模型的各项工作,该模型基于原生中文语料数据及网易自有高质量图片数据训练,100%自研。“生产好的内容之前,需要先理解好的内容”在丹青模型出现以前,国内外已有多个文生图模型,随着去年StableDiffusion的开源,文生图模型数量激增,很多创业公司直接基于StableDiffusion模型进行适配训练和推理生成,并利用API的翻译接口将中文的输入转化成英文,实现对中文用户的不过,StableDiffusion使用的核心数据集是开放图像-文本对数据集LAION-5B,存在一些偏西方化的特点。比如,海外数据的内容组成大多由当地的人文地理、生活历史构成,对中文语言、美食、文化、习俗缺乏理解,直接地英译中可能引起语义的缺失,由此生成的图片也容易引发争议。像淮扬名菜“红烧狮子头”,一些模型会生成狮子头的图片;河北小吃驴肉火烧,也有模型直接生成一头驴和一团火。此外,海外数据集在合规性和安全性方面存在一定风险,比如,存在种族不平等、大量裸露、暴力等内容,直接将这些数据模型用于国内的生产,存在巨大的隐患。中国卓越技术团队访谈录·2023第二季6“网易伏羲的观点是,生产好的内容之前,需要先理解好的内容。”赵增认为,StableDiffusion的确给文生图模型领域带来了一些参考和启示,但StableDiffusion在很大程度上仍是“黑盒”,如果在其基础上进行修改,对模型的优化和控制力是相对有限的。做文生图模型,如果只是简单的重复并无意义,需要走出自己的一条路子。具体来说,网易伏羲的关注点主要有三大方面:网易伏羲需要构建的是一个对中文领域以及中文的艺术知识有更深理解的生成模型,满足国内用户的使用需求。从技术的可控性、安全性和规则性出发,需要打造一个完全开放的基础模型,知道它是如何构建和运作的,以及如何对其进行优化,而不是始终等待别人开源新AIGC并不代表只是大模型,大模型只是其中的重要环节,要真正将生成的内容用于生产,还需要做很多大模型以外的工作。比如建立生产管线,将专家及AI能力整合起来,提供专业化解决方案。基于这一认识,网易伏羲选择兼容开源数据的同时,又分为四步推进丹青模型的研发工作:建设高质量的大规模中文数据集;构建中文领域的优质理解模型;基于数据集和理解模型重构图文生成算法,做到语义的有效提升;引入专家和人类的反馈,引导模型生成用户更加需要的高质量内容。中国卓越技术团队访谈录·2023第二季7数据集方面,网易伏羲联合网易多个部门,包括网易雷火、传媒、云音乐等核心业务,从用户和业务维度提供对数据的理解和需求,完成对于优质数据的定义,建设包括文本质量、图像美观度、版权合规性以及伦理评估等评价标准。以此框架作为约束共同推进数据构建,同时设计了一套基于分布式任务的数据可信系统,各专家团队各自提供数据质量评审模型,完成共同打分后再交由数据治理引擎统一管理。大模型方面,网易伏羲自主研发了中文文本预训练大模型系列“玉言”,“玉言”先后登顶知名中文榜单FewCLUE和CLUE分类榜单,在多项任务上超过人类水平。在文本理解的基础上,网易伏羲自2021年起着力打造“玉知”多模态图文理解大模型,采用图片-文本双塔结构和模块化的训练思想,基于亿级别的中文图文数据对,先后迭代了三种规格的模型版本。基于数据集和理解模型,网易伏羲对图文生成算法进行重构,依托于扩散模型的原理,在广泛的(8亿)图文数据上训练以达到较好的生成结果。具体来说,丹青模型侧重中国卓越技术团队访谈录·2023第二季8文本与图片的交互,强化了在文图引导部分的参数作用,能够让文本更好地引导图片的生成,因此生成的结果也更加贴近用户意图。同时,丹青模型进行了图片多尺度的训练,充分考虑图片的不同尺寸和清晰度问题,将不同尺寸和分辨率的图片进行分桶。在充分保证训练图片训练的不失真的前提下,保留尽可能多的信息,适应不同分辨率的生成。在数据策略方面,丹青模型在初始阶段使用亿级别的广泛分布的数据,不仅在语义理解上具有广泛性,可以很好地理解一些成语、古文诗句,在生成的画风上也具有多样性,可以生成多种风格。在之后的阶段,丹青模型分别从图文关联度、图片清晰度、图片美观度等多个层面进行数据筛选,以优化生成能力,生成高质量图片。此外,丹青模型在训练和生成阶段还引入了人工反馈。在训练阶段,人工从多个维度的评估,筛选出来大批高质量图文匹配、高美观度数据,以补足自动流程缺失能力,帮助基础模型获得更好的效果;在生成阶段,人工对模型的语义生成能力和图片美观度进行评分,筛选出大批量优质生成的结果,引入模型当做正反馈,实现数据闭环。丹青约背后的东方美学丹青模型是底层基础,在实际场景中进行应用需要依赖于上层平台的建设。依托于丹青模型,网易伏羲和雷火艺术中心联合研发了AI绘画平台“丹青约”。在赵增看来,丹青约的优势在于对中文和美的理解,依赖于较强的中文理解能力,以及对美学的专业理解,丹青约创作出的作品更能满足中式审美。“我们会请一些美术专家对模型进行把控。目前来看,国内具备美术专家群体的AI机构寥寥无几,网易在这一领域具有显著优势,我们知道什么样的模型生成内容更符合大家的审美需求。”中国卓越技术团队访谈录·2023第二季9比如,雷火艺术中心会派遣艺术家前来指导,从艺术的角度对生成图片效果、插件、版本给予专业意见。丹青约也会为艺术家提供定制化的生成工具,及时获取艺术家们的反馈意见,进一步迭代优化。此外,丹青约还充分结合了网易游戏美术设计的工作流,无论是生成图片的美观度,还是满足高质量要求的图片生产(如原画、美术资产等),都做了深入的探索和研发,并且支持用户跨文字、图片等多模态给予多轮修改建议,直到生成满意的图片效果。丹青模型生成的“天空之城”目前,网易伏羲正在推进丹青约的建设,并携手网易集团内部生态共同参与艺术风格和算法模型的设计和训练。此外,网易伏羲还积极推动将AI技术应用于企业美术资中国卓越技术团队访谈录·2023第二季产的生产创作流程中。即将上线的网易伏羲有灵美术平台集成了丹青约等多种美术工具,涵盖了美术资产制作、工具管理、审核验收等生产全链路功能,大幅提升了美术创作的生产效率,为艺术家们提供了更加灵活的生产力工具。“大模型业务不仅包括模型算法本身,还需要一个非常完善的数据计算和人工智能系统支撑。我们系统地从多个方面来建设大模型能力,以满足实际应用需求,并不断持续关注和发展大模型技术。”赵增说道。文生图作为大模型最火热的应用领域之一,近几年取得了突破性的进展,并成功在多个领域落地应用。与热度随之而来的也有争议,其中,最大争议点在于版权。今年1月份,三位艺术家曾对StableDiffusion背后的公司StabilityAI,AI绘画工具Midjourney,以及艺术家作品集平台DeviantArt提起诉讼,称这些组织通过在“未经原作者同意的情况下”从网络上获取的50亿张图像来训练其人工智能,侵犯了“数百万艺术家”的权利。该案的代理律师MatthewButterick指出,从法律的角度来看,几乎没有艺术家明确同意他们的作品用于训练AI系统。即使系统生成的图像作为原始图像传递,生成系统仍将基于未经授权的数据。“因为系统中的所有视觉信息都来自受版权保护的培训图像,所以产生的图像无论外观如何,必然是从这些训练图像中衍生出来的。”版权争议是文生图模型继续向前发展必须解决的问题。赵增认为,能够真正训练好AI中国卓越技术团队访谈录·2023第二季模型并使其发挥作用的并不是技术人员,而是具有行业需求和美术能力的专家。“我们需要聚集这些专家,让专家们围绕这个生态进行创作。必须考虑到专家的版权和原始利益,否则整个生态无法运转。”在版权问题上,目前网易伏羲团队正与网易区块链团队搭建相关平台,通过区块链和Web3.0的模式,将大家在整个生产链路过程中的贡献记录下来。例如,有人提供了原始训练图片,有人提供模型,有人提供创意,将这些生产日志记录下来,并通过回报分配的方式尽可能给予大家相对公平的激励。“这是我们现在非常明确要做的非常重要的事情。但是这个事情比较新,我们目前还在与网易的区块链团队搭建平台,并在内部进行验证。”目前,丹青模型还在持续的迭代优化中,团队的短期目标是将丹青模型打造成一个更完善的产品。“我们正在努力提升大模型的效果,包括丰富其知识和提高生成的稳定性。其中,丰富知识是指对一些特定领域的理解,例如对于中国传统文化或海外知识的掌握。当我们需要生成一个中国古代建筑或榫卯结构的建筑时,我相信许多模型缺乏相关的知识。此外,我们的模型对于海外支持相对较弱,这也是需要进一步提升的地方。”赵增表示,除了将基础生成模型发展为一个更完善的产品,网易伏羲还希望构建一条更高效的生成图片的路径,以帮助美术专家进行创作。这涉及到多个模型能力的整合和闭环学习系统的建设,“这些都是我们接下来的重点努力方向”。在技术之外,开源生态同样值得关注。“今年以来出现了很多基于开源生态的大模型,中国卓越技术团队访谈录·2023第二季包括图文、文本等。未来基于这些开源生态,工具和模型的版本迭代一定会发生非常有趣的变化,这个可能是我们现在都想象不到的。因此,我们需要保持关注并适应这采访嘉宾赵增,计算机博士,网易人工智能专家,预训练及生成式人工智能平台负责人、计算效能部门负责人。网易集团技术委员会机器学习分委会、音视频分委会委员。研究领域包括大规模人工智能系统、生成式预训练及基础算法优化。浙江省重点研发项目-超大规模预训练云平台主要研发人员,组织多项超大规模预训练模型研制及平台示范工作,参与申请发明专利近30项、高质量论文5篇。主导研发人工智能平台“丹炉”,日调用量超百亿次。曾参与国产芯片基础数学库优化、国产万亿高性能集群、“十四五”数字人等多个国家、省部级重点研发计划。中国卓越技术团队访谈录·2023第二季桌面QQ重构,探寻跨平台开发挑战与Electron内存优化突破采访嘉宾:王辉、吴浩、陈俊文在瞬息万变的互联网行业中,年过二十四的QQ堪称超长寿的产品,见证了中国互联网崛起的完整历程。然而,如今这个元老级产品经历了一次从内到外彻底的重构。在这次重构中,QQ选择了Electron作为UI跨平台开发框架。尽管Electron被Slack、VisualStudioCode和Discord等大型产品广泛使用,但也引发了一些网友的担忧,例如内存占用、安装包体积和启动速度等方面的问题。好奇于QQ的决策,于是我们采访了QQ技术团队,窥探这次变革的脉络,揭示出那些潜藏在背后的思考。QQ的第一个版本发布于1998年,在Windows技术栈的基础上用纯原生的方式开发,在当时互联网带宽非常小的情况下,QQ将安装包控制在了只有200K左右。2007年后智能手机开始露出苗头,腾讯行动得比较早,部分前端技术开发开始转型到了移动端,在桌面端,QQ随着业务和组织的发展,针对三大操作系统陆续组建了中国卓越技术团队访谈录·2023第二季三支不同的研发团队,各自负责自己的一套代码。三端不同代码,老产品历史包袱,加上移动时代研发人员的转型,导致桌面QQ维护成本很高。QQ技术团队介绍,拿之前的桌面QQ为例,WindowsQQ以前的UI框架用的是腾讯自研的GF框架,10多年了,GF这个框架文档还不全,新加入这个项目的团队人员,要基于这个基础框架去做一些事情,是效率很低的一件事情,慢慢的就没有人愿意去用这个框架了。简而言之,就是技术债。QQWindows丰富,macOS次之,Linux功能非常简洁。比如“屏幕共享”这个功能,移动端有,Windows端有,但是macOS端是没有的。那用户就会遇到一个问题,像macOS端无法与其它端QQ用户一起来使用这个功能。“多端不统一不利于用户对于QQ的统一认知。我们这次的架构升级就是想尽量通过一套核心代码去拉平所有平台的体验,让它具有更好的可维护性和可扩展性,让桌面QQ能够更好地迭代产品交互和功能,升级用户体验,再次焕发生长的生命力。”QQNT在2022年3月份正式启动,macOSQQ在6月份开始发布内测,9月份正式上架了AppStore,迭代了几个版本之后,QQ团队就同步开发Linux。在2022年,QQ发布了新的macOS和Linux版本,包括QQ后台其实也做了很大的改变和重构,核心系统做了全新重写,云原生成熟度也得到了很大的提升。从2023年开始,QQ团队聚焦做Windows端的开发,在3月底就开始内测,7月初上架官网。同时移动端QQNT也在7月初完成了核心系统的重写和全量升级。在目前全新的框架设计下,无论是核心系统、功能迭代还是设计语言上,都可以尽可能地“原子化”,来让QQ后续更好地迭代功能。中国卓越技术团队访谈录·2023第二季“QQ的重构其实是两方面的重构:一个是面向复杂业务的梳理重构,一个面向工程技术债的全新技术重构,重构之路也是两者相互伴随的过程。”首先,在整个QQ重构过程中最大的挑战来自于QQ功能的复杂化,QQ有很多十分复杂的历史功能,这些功能模块也曾经由非常多不同的人经手负责过。其中哪些功能是不合理的或没有价值的,如何去做取舍往往是最难的。“虽然技术上我们做了很多事情,但技术上的实现或许并没有那么难,我们处理起来更有经验和从容。相比于技术的复杂度,业务上的往往需要考虑的更多,这本身就是很大的挑战。”因为QQ已经是近25年的产品了,有很多细小复杂的功能。虽然这些功能看看起来很小,但用户量其实又很大,稍微改动可能就会有很多的用户反馈,QQ团队都得非常的关注。仅从产品功能角度上看,有些功能本身就已经是很重的负债,而QQ团队内部有一个叫做“QQ节能计划”的项目,会有比较严谨的项目流程去评估是否需要技术上重构也有不少挑战,这次重构是一次跨平台的重构,而在多个平台里面比较有挑战则是Linux平台。作为程序员,很多人免不了要跟Linux打交道。但是这么多年来,对于使用Linux系统的用户来讲,有一个特别让人烦恼的问题,那就是没有一个好用的IM聊天工具。被寄予厚望的QQ,此前在Linux版本上功能也没有Windows和macOS版本全面,迭代速度也明显慢过其他两个版本。业界甚至猜测Linux第一个版本是由腾讯实习生所写,毕竟这个说法进一步加重了其初版的“简陋”特性,也为其“停更”的原因提中国卓越技术团队访谈录·2023第二季供了更合理的解释。QQ技术团队表示,较之另两个版本,Linux版本的研发最为复杂:一方面操作系统本身很多碎片化,市面上有非常多的发行版,也不缺乏一些千奇百怪的版本;另一方面因为机器运行环境或编译器的缺失,使得解决适配问题的难度很大。许多发行版相关的机器和开发环境实际上他们并没有,有时还需要外部公司帮助进行一些测试工作。由于没有相应的开发环境,一旦出现闪退等问题,解决难度自然会变得更大。此外,有时候需要与国产操作系统厂商进行特殊的合作,甚至需要对方寄送特定的编译好的代码库,但前后往往会花费一个月的时间才能收到。而在本次重构之后,“Linux功能跟Windows一样多了”。技术上的另一大挑战便是外界对于QQ桌面端使用Electron的质疑,尤其是内存方面。外界有些用户在没有使用和分析的情况下对此发表一些夸大和否定的言论,也确实给QQ技术团队带来不小压力,但他们却始终坚定选型方向,也相信其中的问题可以被攻克和解决。确实当时有很多人在问,为什么Windows不用原生去实现?为什么不用QT?“首先不太想和以前一样,Windows、macOS、Linux三端各由一个团队分开负责。在国内这种人才环境里面,相关的纯原生的开发人员其实非常难招了,桌面端的人才稀缺,同时也投入比较大。中国卓越技术团队访谈录·2023第二季而对于QT技术栈,他们首先考虑的其实还是人才的问题,国内熟练Qt技术栈的人非常少。如果对这个框架不了解,使用它反而是一个负向作用。至于微软的Webview2,从本质上讲,Webview2和Electron并没有太大的区别,只是相对在其中打包了一些微软自身的优化措施,其他方面也不是很完善,而且还无法跨平台。虽然内存方面相较于Electron做了更多的优化。但据了解,比如微软Teams也没有完全切到Webview2。并且由于它没有开源,因此也没有办法基于Webview2做定制优化。包括Flutter,QQ团队表示他们当时也有过调研。他们放弃的一个原因是Flutter在桌面端的完善程度并不高,也担心标准化的问题。虽然当前Flutter非常流行,但谁也说不好这是不是“2015年的ReactNative”。大家担心随着时间推移,这套技术可能会失去维护支持,因为本身Google使用Flutter的占比也比较小。“虽然它很热,但我们历史上踩过了很多很多非标准化的坑,一旦某个技术栈热度一过、维护力度不够,它就会成为全新的负债,做选型时必然也是避免再有类似经历。”中国卓越技术团队访谈录·2023第二季至于为什么最后选择Electron,QQ技术团队表示主要是基于以下几个考量:首先最看重的是框架成熟度和技术栈的标准化。Electron基于Web技术栈,有足够低的上手和使用成本,不需要为了使用框架本身,还需要投入额外巨大人力成本去做基建和周边工具链的建设,以前在RN、Flutter的实践上都有类似的情况。而使用Electron,现有的Web前端的大部分基建都可以直接复用,而且使用Web开发UI的效率,在主流技术栈里算是很高的了。至于迭代效率我觉得从新版桌面QQ功能的迭代速度就可以证明,这放在以前是完全办不到的。另外由于Web技术栈是标准化的,假如Electron修改开源协议或者要闭源了,他们也能很方便的去写出一套类似的框架。只不过现在已经有开源的了,没必要再去重复建设一个。而且随着Web标准长久发展,Web技术栈也不会有大的问题,而且还会越来越好。其次是技术经验及人才储备,技术选型是否适合当前团队也是一个很重要的考虑点,团队是否有相关的技术积累,是否有人才储备来持续投入这个技术栈。Qt的确在性能上是一个很好的选择,但目前团队对Qt没有太多积累,基建基本没有,而且相关人才其实比较匮乏,招聘就更难了。而当前QQ技术团队Web前端团队还是有比较多的积累,在QQ频道项目中,也完整验证了Electron的技术可行性。最后就是Electron具备的桌面端跨平台的优势。但QQNT架构并不是仅指Electron,Electron主要是作为UI跨平台的框架,只是占比很小的一部分,并且QQ桌面端不是全部用Electron实现,QQNT最核心的部分还是QQ底层通用抽象的模块,称之为NT内核,包括核心登录、消息系统、关系链、富媒体、长连接、数据库等等模块,完全用C++实现,全平台通用。因此底层是完全跨平台的架构,而Electron只是上层桌面端UI跨平台较薄的一层。中国卓越技术团队访谈录·2023第二季“其实我们当时选型的时候,也的确看得到大家对Electron的评价褒贬不一,但我们还是有信心去解决这个问题,前期也做了一些技术的Demo和预研。实际上Electron并没有糟糕到这个地步。我们觉得可能是国内很多没有用过Electron的开发者,对这个框架有些忌惮。其实你到Electron的网站去看,还是有非常多国内外的亿级DAU产品都使用Electron框架。目前这几年主流的桌面端应用基本都选择了Electron,如VisualStudioCode、Discord、Slack、Skype、Whatsapp、Figma等等,新的应用基本上也是首选Electron,版本的迭代速度和社区氛围都很在线。”“我们觉得不需要单纯因为口碑问题,就对这个选型没有了期待。还是要从实际出发,哪种技术栈适合你的产品,看看到底能不能有技术实力去把这个事情搞定。”外界之所以会觉得Electron内存占用高,是因为其本身是一个多进程的架构,主进程基于Node.js,而每个窗口都对应一个渲染进程以及V8实例。可以说从技术框架层面上,上手写代码很容易,但不容易去管控它的内存。QQ技术团队认为Electron的开发者更多的是前端的开发者,可能在思维上没有去考虑怎么在这样一套技术框架里,去对内存数据进行管理和管控。开发者需要从前端开发者的思维,转变为客户端开发者的思维。综合来看,对内存的看法其实不完全是Electron的技术框架所导致的,更多的是门槛上、开发思维上,导致内存没有得到很好的关注和优化。其实最简单的Electron应用中国卓越技术团队访谈录·2023第二季大概也就只有几十兆的内存占用。因为前端原本更多还是停留在开发即用即走的Web站点,很少实现一个超大客户端,缺乏控制内存的经验,所以面对QQ这么大一个产品的时候,你就必须非常在意内存的使用和管控。至于优化内存的突破口,可以说是从各个层面:从消息的链路中的每条消息的收发上,数据是怎么管理,包括像窗口及会话的管理,都得精打细算,也会做一些数据本地化和一些机制的按需加载,包括渲染上他们也提出一个根本的原则:“要做到所见才占用”,既我们看到的内容才占用这一部分内存,没看到和用不到的任何场景的内存就不应该再占用,通过各种方式来去让内存达到一个设定的目标。他们也使用了不同维度的内存分析工具,从V8引擎到进程,再到整个应用程序,打通整个链路进行多角度的细节分析,以此来定位内存使用的瓶颈。之后采取一系列的针对性优化策略,包括缓存策略、按需加载、优雅降级等,同时使用线上监控、自动化测试手段,包括借助开发框架、工具建设、代码审查等,来阻止性能退化。中国卓越技术团队访谈录·2023第二季经过一系列组合优化之后,QQ的内存在长时间挂机的条件下,平均稳定在220M左右。“现在优化还是不错的,比老版本要好很多。”“我们认为这个难题还是可以被很好的攻克,内存并不是大家认为的这么不可控,但是也需要团队去花费相当精力去探索和实践,才能去把内存控制到一个比较理想的状态。”目前QQ的前端团队作为一个公线团队,不仅负责桌面QQ的研发,还有QQ基础运中国卓越技术团队访谈录·2023第二季营、QQ空间以及基于QQ生态的创新项目研发,有比较多的线上项目的开发与维护和内部研效工具的建设。涉及的技术栈,包括H5、Electron、Cocos、小程序、WebGL、WebAssembly、WebRTC等。他们也表示会继续夯实这些技术,同时也不断地打破立下的性能目标,希望让桌面QQ覆盖更多平台。他们也正在积极拥抱AI,让AI在质量和效率上辅助日常开发。比如:前端设计稿还原,之前更多是一个耗时的体力活,有时为了1px的对齐问题不断的调整,比较繁琐,D2C是QQ前端一直探索的方向,之前使用纯规则转换生成代码,在视觉还原上效果还不错,但是代码可读性和可维护性不能很好的满足预期,所以除了一些日抛型的运营活动有些使用之外,比较难扩大成果。现在D2C结合大模型,生成的代码质量高了很多,也能很方便的将代码与UI组件库做映射,达到可以在核心业务中高效使用,达到通过AI提升研发效率的目的。针对一些无设计稿的管理平台开发,使用P2C提效,目前也有了一些不错的案例。另外,QQ技术团队也在积极探索AI更广阔的应用场景,比如代码评审,基本的Lint检检是难以实现的,但将已经掌握的内存泄漏模式通过规则的形式给到AI,可以很方便地给开发同学一些不错的建议,为性能看家护院提供多一道保障。QQNT项目于2022年3月份启动,macOSQQ花了该团队3个月的开发时间,9月份上架AppStore,迭代了几个版本后同步开始开发LinuxQQ,并于这一年的最后一天上架各Linux应用市场,作为给Linux用户的一份特殊的新年礼物。2023年QQ团中国卓越技术团队访谈录·2023第二季队开始去聚焦做WindowsQQNT的开发,7月正式上架应用市场和官网。同时移动端的QQ从2022年的Q4开始开发,也已经完成了全量升级和发布。另外,桌面QQ也是在NT版本中第一次支持64位,这需要将音视频、安全、字节码、图形库等C++模块,包括Electron框架都重新进行编译,花费了比较大的工作量。但在64位系统上,QQ从此便不再需要以32位应用的方式通过额外的兼容和转换来运行。毕竟额外操作会增加开销,导致性能下降。至此,QQ实现了多个系统平台之间架构的统一。而团队的未来规划还是不断地打破性能目标,并覆盖更多平台,同时探索更多提升研发效率的办法,加快研发速度。腾讯QQ用跨平台Electron取代之前原生应用程序的开发模式,这一举动引发的反响确实巨大。但我们也能看出,不同于小型产品团队,在大公司里具有一定规模的产品组织架构之下,快速满足用户需求,并逐渐需要为第三、第四乃至第五种运行平台提供支持时,保持一致性和协调性并不是想象中的那么容易。而缓慢而低效,最终会令你输掉比赛。不管使用什么跨平台开发框架,都要去选择最合适自己团队的,也因此在Web标准技术栈上有丰富积累的QQ团队才会选择Electron。并且我们认为没有人真正讨厌Electron,只是我们对QQ,对国内App寄予了非常高的期盼。嘉宾简介王辉:QQ技术负责人吴浩:QQ前端负责人陈俊文:QQ桌面端前端负责人中国卓越技术团队访谈录·2023第二季受访嘉宾:陈鑫、崔力强、蒋鑫作者:王一鹏云原生研发效能平台,听起来是云原生时代的必备基础设施,但据信通院发布的《2022中国软件研发效能调查报告》显示,业内具备该基础设施的团队仅有26%,而有接近同比例的团队,甚至还处于纯手工阶段,可见留给各家企业的施展空间相当之大。但要组建一支云效团队却并非易事。因为研发效能提升这一赛道的业务特点,相关工程师往往都带着一些客服色彩——传统客服无法解答研发类工具的使用问题,因此负责研发效能产品的工程师要和另一批作为用户的开发者保持密切的交流,实时解答问题,以获取第一手反馈。让后端的人,干前端的事,这对团队心性、企业文化是个考同时,研发从某种意义上来讲,和艺术类创作一样,也是一件比较个人的事,使用工具的人往往有着不同的产品偏好。历代流行的研发工具,几乎全部具备高可定制性,这对企业的产品能力也是个考验。再者,该领域在国内还没有绝对领先的产品出现,因此相关团队的创业氛围都比较浓厚,要求团队的战斗力比较强,也增大了团队组建和管理的难度。中国卓越技术团队访谈录·2023第二季带着这些疑问遍寻国内产研团队,阿里云云效团队,自然而然出现在了视野里。原因之一,阿里云是国内最大的云服务商,其团队构建、产品研发有着相当大的借鉴意义;原因之二,开放原子开源基金会刚发布的AtomGit代码协作平台产品,是基于阿里云云效研发的分布式多副本架构打磨而成,这从侧面证明了团队的实力。在和阿里云云效团队总负责人陈鑫、CI/CD团队负责人崔力强,以及代码平台团队负责人蒋鑫聊过以后,我们发现阿里云云效团队更像一只创业团队,有着独特的创业气质,和而不同的团队文化,是他们向前的关键。云效团队整体发展可以分为三个阶段:第一阶段主要作为阿里内部服务出现,团队规模在几十人量级,以前后端研发、配置管理工程师、技术支持工程师为主,主要负责两个维度的工作:1.将阿里集团过去数年在工程效能上的方法实践通过工具进行标准化、数字化;2.配合技术中台战略,打造研发、运维、监控三大块领域的技术平台,也就是现在业界讲的“平台工程”;这样阿里就可以通过统一的技术中台去推动内部技术发展与落地,比如容器化、云原生化、全面上云就是在技术中台的推动下实现的。第二阶段,集团决定将技术中台核心产品和团队划归到阿里云,从而帮助阿里云补齐在PaaS层的核心能力,因此云效团队的主要工作目标是效能类服务的产品化。中国卓越技术团队访谈录·2023第二季云效团队要将过去近十年积累的效能改进方法实践、效能工具变成广大企业能轻松落地的产品。云效团队对产品架构进行了全面梳理,最终形成了七大核心模块,覆盖从项目需求管理到软件研发交付的全链路一站式工具平台。为了确保产品质量和用户体验,云效团队按照新的产品架构,对原来的内部产品进行全面重构,重点投入用户故事梳理、UI交互设计、云化改造、用户文档、性能优化以及稳定性体系建设。前后投入了两年左右时间,在2020年初完成了云效产品全新。第三阶段是商业化。商业化阶段最重要的是市场洞察、销售体系、运营体系、交付体系的搭建。云效作为阿里云上产品,需要同时服务公共云直接使用SaaS的客户,以及私有化部署的专有云客户。SaaS客户主要以中小企业为主,行业集中在互联网、新零售、娱乐等,这部分客户通常为自服务,更重视产品核心能力、交互体验、品牌影响力、价格与稳定性等,营销方面团队需要投入更多的内容运营与品牌运营。而私有化客户主要为金融、交通、政府、能源等中大型企业,这部分客户不但希望买产品,还希望能够得到落地实施服务,更重视产品功能丰富度、落地案例、以及方法和实践的先进性。针对不同的客户云效团队需要搭建不同的商业化团队,并且和阿里云市场、销售各部门进行紧密协同,有计划的对阿里云目标客户群体进行覆盖。中国卓越技术团队访谈录·2023第二季从发展流程来看,阿里云云效团队的发展存在两大特点:1.产品体系庞大且全面。由于发展历程长,且有阿里集团需求、阿里云云能力作为基础,阿里云云效团队与业内众多创业公司不同,并非只聚焦于研发工具等一两个垂直维度,而是从发展之初就聚焦于平台建设;2.阿里云云效团队虽然孵化自跨国大型企业内部,但有鲜明的创业团队色彩,其三个发展阶段,对团队能力的锻炼和要求都非常全面。不过尽管如此,阿里云云效团队依然和业内所有团队一样,逃不开正常的业务开拓逻辑,遇见了许多挑战。“大企业问题”与“小企业问题”阿里云云效团队发展过程中遇到的问题,大致可以用“大企业问题”与“小企业问题”两个形容来做粗略的概括。“大企业问题”主要指目标与协同问题、战略目标的落地问题;“小企业问题”主要指有限资源与高目标的矛盾,以及团队的专业能力提升问采访中,阿里云云效团队总负责人陈鑫聊到,团队目标与协同机制的问题,在最近几年商业化过程中,反映的最为明显。在商业化进程的早期,阿里云云效团队选择全面面向收入业绩去设定目标,业务人员、产品人员、技术leader都需要共背业绩指标。实际上这也是业内大部分团队的选择,业务leader经常担心后台人员商业感觉迟钝,前台后台协作矛盾大,这种目标设定,确实可以让全体核心成员都可以面向商业化去中国卓越技术团队访谈录·2023第二季思考问题,并且目标相同,在沟通协同时比较容易达成一致。比如某个行业客户要不要做,某个客户的需求要不要做等。但是随着市场竞争进入深水区,这种目标设定的模式就出现了明显问题,比如团队更加追求短期经济利益,而忽视产品长期演进以及客户满意度,另外就是对一线技术人员来说缺少在技术卓越层面的激励等。时间长了,很容易发现团队的产品、技术层面硬实力出现停滞,而收入也随之陷入瓶颈。所以阿里云云效团队最近几年开始实践BizDevOps方法,更加强调业务、产品、技术多角色的共识和协同,而不是单纯的业务导向。反映在目标设定方面,首先是目标更加细化,业务团队承担收入与规模的指标,产品团队承担客户满意度、产品交付能力、产品竞争力指标,技术团队承担需求交付效率以及质量、成本、安全、稳定等技术先进性指标。多角色之间目标不是简单的拆解关系而是承接关系。比如客户满意度和产品竞争力决定着市场营收的长期潜力,而技术竞争力和需求交付效率又决定着客户满意度以及产品长期竞争力。其次是从组织协同上强调共识机制,对于前线带回来的业务需求,要求业务同学与产品技术同学达成业务价值、影响面、预计成本的共识,目的是为了有效的判断优先级。对于需求的传递强调从业务需求到产品需求再到技术任务的拆解,从而实现组织透明和溯源,让所有人对所做工作的价值和目标清晰和一致。关于战略目标的落地,则与阿里云云效团队的发展阶段有关。中国卓越技术团队访谈录·2023第二季针对不同的发展阶段,云效团队的组织架构也经历过几次重大调整。在最早期的内部服务阶段,为了实现云效各子产品的快速发展,云效将产品与技术团队、测试团队放在一起组成独立的全功能团队,这样可以保障各产品资源独立并且闭环,决策快速,落地敏捷。到了第二个阶段,即产品化阶段,这种产品全功能团队架构就出现了明显弊端,主要体现在各产品协同不够,导致产品一致性差,技术方面整体架构没有整体拉齐,也会导致在一些基础能力上投入不足,比如账号、权限、安全性、私有化输出、运维能力等。因此需要成立横向团队对基础模块和技术进行投入,比如产品团队统一拉齐产品设计规范、架构团队确定统一技术规范、基础平台团队完成跨产品共享能力的产品实现工作等。此时云效团队形成了矩阵式组织架构。在商业化阶段,云效团队面临的新问题是前线的市场洞见以及客户需求,能否快速有效的传递给后方,并且确保产品主线演进不被各种客户问题进行打断。这就需要一套业务、产品、技术三个核心团队的有效协同方法。云效团队通过两个主要措施解决问题:1.业产技三级团队OKR设定以及拆解:如前文所述,业务团队负责业务指标、产品团队负责产品能力交付以及客户满意度、技术团队负责需求交付以及质量、成本、安全、稳定等目标。三级团队之间并不是简单业务数字拆解,而是要确保目标之间有承接与协同;2.业产技各角色执行中的事项、优先级、排期的共识:比如说需求并不是谁单方面中国卓越技术团队访谈录·2023第二季决定要不要做,什么时候完成,而是要充分沟通形成共识。坚持市场为导向的同时,确保产品为中心的目标;如果说以上都是“大企业”的烦恼,那么可以说云效团队也作为“小企业”、“创业者”过头皮。云效因为产品体系全面,注重平台能力,所以对研发、产品的能力要求极高。在国内的ToB赛道,绝大部分产品市场销量不好的原因很简单,就是不好用,用了以后解决不了业务问题。阿里云云效产品,在2018年产品发展的早期阶段,也曾被各类研发论坛的用户吐槽过,团队内部总结的问题有:用户注册、激活流程、交互设计、性能体验上都有不少短板,尤其是在产品架构方面问题很大。云效多个子产品之间互相耦合并且有强依赖,导致用户没有办法按照自身需求选择一、两个子产品进行落地,后期再逐步探索使用更多产品,而是要想用全都必须用,这无疑导致用户落地成本陡增。坦诚问题存在是个勇气问题,但解决问题则需要付出卓绝的努力。差不多在同期,阿里收购了Teambition,其对产品细节的极致追求给团队带来了很大的启发。同时,云效团队下定决心,要对产品进行彻底重构,这带来了对人员能力的严苛要求。一方面,这场重构对视觉、交互、产品设计相关岗位角色的能力要求需要大幅提升;另一方面则需要有魄力抛弃掉过去项目制思维(项目驱动,堆砌功能,缺乏复用和灵活性)转向产品化思维。在这个过程中一方面各产品技术负责人需要不断提升个人的能力与视野,在每一个功能上线前反复雕琢,上线后不断追踪数据和用户反馈进行改进,确保产品基本素质。此外,团队也需要引入优秀的产品经理,三年下来,云效产中国卓越技术团队访谈录·2023第二季品团队的人员规模接近翻倍,最终完成了迭代升级。除了主观层面,在客观层面上云效团队也经历过较大挑战,其核心在于资源和目标的矛盾。2019年年底临近春节时,云效团队需要马上在阿里云上线新版云效。当时云效的产品已经和Teambition深度融合,只能带着Teambition在阿里云上重新部署一份,作为云效的产品组合来服务阿里云开发者。工期限制在三个月内,人员投入十几位,时间非常紧张,整体技术难度也很大。而让全国人民印象深刻的三年疫情,也正是在那个春节快速传播。云效团队所有人被封闭在家中,只能以远程的形式工作。但团队顺利的在预定时间内完成了对Teambition的改造,将其接入阿里云体系,并且高质量的完成了文档、技术支持、商业化等体系的搭建,完成了稳定性保障工作。这一次攻坚,确保了云效业务最近三年的顺利发展,完成了产品的全面升级工作,产品能力和体验相较于2019年年有了质的变化。这是怎么做到的?陈鑫说,在云效发展的历史上,我们渡过了很多困难的节点,在关键时刻往往不是我去推动团队,去摇旗呐喊往前走。而是团队有一种自驱力,自然而然的兴奋起来,去战胜这些不可能难关,这个特质让我非常骄傲。是什么造就了这种特质?这与企业文化、团队文化脱不开关系。阿里“六脉神剑”作为头部公司的企业文化,在网络上广为流传,部分人会觉得文化中国卓越技术团队访谈录·2023第二季不好落地。但在本次访谈中,我们发现,这套“六脉神剑”可能是云效团队能够前行的最大依仗。云效CI/CD业务线早期规模很小,要对标国际成熟GitHub团队,做出更适合中国开发者的CI/CD产品,陈鑫谈及此事却并不觉得难以想象。他说,阿里巴巴能做出淘宝,蚂蚁能做出支付宝,我们相信我们也可以,因为“此时此刻,非我莫属”。无独有偶,代码平台团队负责人蒋鑫也在采访中提到了“六脉神剑”,他最喜欢的是我爱人说我去了阿里以后整个人都不一样了。“认真生活,快乐工作”的意思就是,工作很辛苦,所以要做喜欢的事,要快乐;生活也是一样,你怎么对待生活,生活就怎么对待你。夫妻相处、子女教育都要花心思。”“‘因为信任,所以简单’,有些公司的信息安全严格到无法在公司内参与开源贡献,而阿里云有更灵活的信息安全管控,参与开源贡献不再有重重阻碍,真正诠释了‘因同时,在企业文化的层面下,云效团队也在践行这些文化。如客户第一,陈鑫作为云效团队的总负责人,每天也会亲自在用户交流群去回答一些开发者的问题。另一项整个云效团队比较看重的文化素质叫做“匠心”。陈鑫在采访中说道:“匠心一方面代表着追求卓越的品质,另一方面也是一种愿意长中国卓越技术团队访谈录·2023第二季期坚持做好一件事的心态。”CI/CD团队负责人崔力强用一个例子说明匠心是什么:“比方说你做事情的时候,你的方案是不是考虑的足够细致,还是说差不多能用就行。”CI/CD是阿里云云效产品对外提供的核心能力之一,历来是产品迭代的重中之重,因此,“匠心”也是CI/CD团队工作得重要特质。2017年,云效流水线产品正式进入到公有云市场提供服务,当时使用的是阿里云内部架构,19年开始,云上用户量迅速增加,原有架构在规模化和可运维性上有一定的局限,于是CI/CD团队决定重新开发一个构建引擎,来应对云上用户更加丰富的构建场景需求,例如更多的语言,更多的技术栈,更多样的执行环境,以及快速增长的用户量对于稳定性和安全性的需求,希望可以做到AnyLanguage,AnyPlatform,无限扩容,支持不同的计算服务,比如VM、容器以及阿里云的ECI等,支持不同的操作系统,支持不同的芯片架构。这是一个庞大的能力集合,需要稳扎稳打地逐步演在开发的第一个阶段,也就是2019年底-2020年底,团队的主要工作是开发并完善上层编排能力,希望80%的用户可以开箱即用,20%的用户通过一定的自定义配置也可以实现自己的功能,需要解决的主要问题是场景化封装及构建环境调度等基础能团队主要做了两件事情:一个是建立“执行环境”+“执行命令”组合的业务概念,内部称之为“步骤”,并使用阿里云容器服务的ACK集群作为容器的调度平台;第二个是实现了一个特殊的“自定义环境构建”的步骤。中国卓越技术团队访

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论