AI视频行业深度:技术进展、商业化进程、应用场景及相关公司深度梳理_第1页
AI视频行业深度:技术进展、商业化进程、应用场景及相关公司深度梳理_第2页
AI视频行业深度:技术进展、商业化进程、应用场景及相关公司深度梳理_第3页
AI视频行业深度:技术进展、商业化进程、应用场景及相关公司深度梳理_第4页
AI视频行业深度:技术进展、商业化进程、应用场景及相关公司深度梳理_第5页
已阅读5页,还剩77页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

行业研究报告行业研究报告慧博智能投研专业的投资研究大数据平合2026年8月10日生成式AI正加速从单模态创新迈向多模态深度融合。相比于文本和图像生成,生成式AI正加速从单模态创新迈向多模态深度融合。相比于文本和图像生成,AI视频不仅具备空间建模、时序推演与物理因果模拟等高维能力,其技术壁垒更高、产业价值也更深,已成为当前AIGC技术演进与数字内容革新的核心方向。随着核心技术的迭代与成熟,AI视频的能力实现了跨越式升级,在画质清晰度、视频时长、物理仿真效果以及交互叙事水平等方面,均取得了系统性突破。当前,行业技术路线已基本收敛,DiT架构确立了主流范式。与此同时,3D立体创作、世界模型仿真等前沿技术加速落地,大幅打破传统视频创作的效率与成本桎梏。从全球商业化来看,海外企业聚焦于前沿技术的攻坚,而国内厂商则深耕场景落地与规模化应用。依托头部平台与优质初创团队的协同布局,本土AI视频产业快速实现能力跃升。眼下,AI视频已深度渗透至影视、广告、游戏、数字人等核心领域,重构了内容生产的全流程,并形成了覆盖C端轻量化创作与B端行业定制服务的多元商业模式。随着各项短板的持续优化,AI视频正逐步升级为数字内容生产与虚拟生态构建的核心基础设施。本报告全面梳理行业技术迭代、发展趋势、商业化格局、应用场景与头部企业,一、原理及技术发展 三、国内外商业化进展 24五、核心应用场景 29六、相关公司 40七、参考研报 43能力上限。视频需处理空间、时间、因果与交互等高维结构,并同一表征空间,其复杂性要求模型必须具备对真实世界的综合理解与推演能力:1)空间:视频需理解物体形状、位置关系、遮挡与深度等三维结构;2)时间:视频要求模型在连续帧中保持状态演化一致性,学习动力学规律与行为轨迹;3)因果与交互:视频呈现对象间的作用、反应与事件链条,专业的投资研究大数据平台2026年8月10日型掌握因果机制和多实体交互规则。当前文本、图片、音乐等模态文本图片虚用最为于音进与推理属留的按表现,在各个饭速OpenA推出GPT-3,引发业界关注,验证scal2022年10月,Google.Meta发布Phenaki,Make-A-Video2023年,创业公司推出Runway-Gen2,StableVideoDifusio2025年,openAJ,Google先后发布sora2Veo3.1等2026年2月,抖音发布Seedanc2020年8月,NeRF论文发表2023年5月OpenA开源Shape-E模型2024年7月,Meta发布Meta3DGen代表模型资料来源:量子位,MIT科技评论。/极客公园,证券时报网,中邮证券研究所整理一次视频技术的重大革命都源于图像生成技术的先验突破。视频生成技术的生成技术约1-2年。时间区间证明了AI生成逼真图像的可能性,奠定了生成式AI的基础解决了GAN训练不稳定和模式崩溃问题,为视频扩领域的可扩展性,直接催多模态生成的统一建模,推动音视频专业的投资研究大数据平台2026年8月10日扩散模型阶段2022年2022年2024年骨干网络架构:从2D卷积到3D卷积,从时空U-Net到扩散Transformer,所有骨干网络都先在图像 (CFG)、无分类器引导等提升生成质量的关键技术也都是先在图像生成上成熟,再直接迁移到视频领数据利用方式:联合图像-视频训练已成为行业标准,利用海量图像数据弥补目前视频生成广泛使用的蒸馏技术,直接继承自图像生成的LCM蒸馏技术。AI视频生成技术的发展与图像生成技术紧密相关,同样形成了比较清晰的四个发展阶段:时间早期萌芽探索阶段GAN/VAE主导的可能性室走向商业化架构统一生成能力质变至今多模态融合一个完整的AI视频生成模型,是多个模块协同工作的结果,并依赖一套科学的体系来评估其优专业的投资研究大数据平合专业的投资研究大数据平合文本编码器:理解你的文字指令,常用CLIP或T5模型。视觉素材像素画面数据来源:东北证券文本描述的相关性。新指标如WorldConsistencyScore(WCS)则开始关注视频在物理世界中的时空一致性。2)人工评估:自动化指标有时无法全面反映人的主观感受。因此,通过人工对画质、运动自这一阶段的核心特征是将在图像生成领域取得成功的生成对抗网络(GAN)和变分自编码器(VAE)扩GAN:通过一个生成器和一个判别器相互博弈来提升生成质量。代表模型有TGAN和MVAE:通过学习数据的潜在空间表示来生成新的数据。由于计算资源和模型架构的限制,这一阶段生成的视频分辨率极低、时长很短(通常只有几秒),并且运动模式单一,存在严重的模糊和时间不一致性问题。这个时期由于算力和模型架频生成的需要,仅能作为视频生成可能性的早期探索阶段,相关的技术更多起到论证AI视频可行性的技术效果:1)能够生成3-5秒的低分辨率视频(通常为64×64或128×128像素)。2)可以生成简单场景下的单一物体运动,如飘动的旗帜、旋转的物体。3)部分模型能够生成人脸表情变化等简单动态。主要局限性:1)继承了GAN的所有缺陷:训练极不稳定,模式崩溃问题在视频领域更加严重。2)时序一致性差,容易出现物体突然消失、变形或运动不连贯的情况。3)无法处理复杂场景和长视频生成。4)计算成本极高,即使生成低分辨率视频也需要大量GPU资源。未形成商业产品。唯一有影响力的应用是DeepFake换脸技术(2017年出现),它基于GAN架构,能够将一个人的脸替换到另一个人的视频中,虽然引发了巨大的伦理争议,但也证明了AI在视频生成方面的潜力。输入:从简单分布(如高斯分布)中采样的随机噪声向量z。输出:模拟真实数据分布的假样本G(Z)(如图像、视频)。输出:O到1之间的概率值,表示输入是真实样本的概率。真实概率随机噪声生成器专业的投资研究大数据平合GAN的训练过程是生成器和判别器之间的动态对抗过程。在每一次训练迭代中,分别对两者进行训练:使其能准确区分真实样本和生成器生成的样本。具体地训练过程如下:1)训练判别器时,固定生成器参数。分别输入真实样本和生成样本,通过反向传播更新判别器参数,使判别近1,对生成样本的输出更接近0。2)训练生成器时,固定判别器参数。输入随机噪声,生成假样本,通过反向传播更新生成器参数,让判别器对假样本的输出接近1。骤应当不断重复,直到生成器生成的样本足够逼真,判别器无法准确区分(准确率约为50%)。模数据分布,通过对抗学习隐式学习;3)生成速度快(单步生成);4)应用场景广泛,可用于图像、关键的灵感。但GAN仍具有1)训练不稳定:生成器和判别器的平衡难以维持;2)模式崩溃:生成器只生成少数几种样本,多样性不足;3)难以评估:没有统一的评估指标;4)可解释性差:黑盒模型,难以理解生成过程等缺点。因此GAN模型本身的生成能力并不能达到GAN在视频生成领域的应用。视频生成与图像生成的本质区别在于增加VGAN(2016):首个基于GAN的视频生成模型,用3D卷积处理时空维度。缺点是计算量大、难生TGAN(2017):分离时间与图像生成过程,用双生成器分别处理,时间生成器(Go)将输入的噪声生成为时间步的特征值,再由图像生成器(G1)将时间步特征转化为对应的视频帧。判别器沿用MoCoGAN(2017):将视频分解为静态内容与动态运动,潜在空间划分内容与运动子空间,用RNN级上采样。降低计算复杂度,优化时空连贯性,可生成更高分辨率(256×256)视尽管GANs在视频生成方面取得了一定进展,但模型架构本身仍然存在严重的局限性:1)训练极不稳定:GAN本身的训练不稳定问题在视频领域更加严重;2)模式崩溃:生成的视频往往缺乏多样性,只能生成少数几种场景和运动;3)长视频生成困难:随着视频时长增加,时序一致性迅速下降;4)物理逻辑错误:经常出现违反物理规律的现象,如物体漂浮、穿模等;5)可扩展性差:难以通过增加参数专业的投资研究大数据平合数据编码为潜在空间中的一个固定点,然后解码重建输入,这种确定性的映射VAE将编码器从确定性映射改为概率分布映射,通过编码器(E)将高维数据压缩到低维潜在空间,通过解码器(D)将高斯分布中采样的潜在变量重建为数据样本,即将低维潜在变量映射回高维数据空间,于GAN相比,VAE的优点在于:1)训练稳定:基于似然的训练,没有GAN的对抗平衡问题;2)有明确的潜在空间:潜在空间是连续且结构化的,便于进行插值和操作;3)可解释性强:可以通过分析潜在变量理解数据的生成因素4)数学基础扎实:基于变分推断,有严格的理论支撑。与GAN类似,将VAE应用到视频生成也需要解决时序建模的问题。各国研究者提出了时空联合压缩、结合RNN建模时序依赖、引入向量量化技术等方法解决VAE模型的时序建模问题,但仍具有较大的局限性:1)生成样本模糊:传统VAE生成的视频往往缺乏细节,不够清晰。2)长程依赖建模能力弱:难以生成超过10秒的连贯视频。3)计算复杂度高:3D卷积和Transformer的计算量都很大。4)生成尽管GAN和VAE在早期视频生成中取得了一定进展,但它们的固有缺陷限制了进一步发展。2020年之后,扩散模型逐渐取代GAN和VAE成为生成式AI的主流技术路线。2020年是AI生成领域的转折点,扩散模型(DiffusionModel)在图像生成任务上超越了GAN,展现究人员将其应用于图像和视频生成。2020-2021年,研究的重点在图像生成上,为视频模型奠定了关键基础。2022-2023年,图像生成的成功经验被迅速迁移到视频领域,各大公司纷纷推出自己的视频生成扩散模型路线:包括Meta的Make-A-Video、自回归(Transformer)路线:以谷歌的Phenaki为代表,采用类似于语言模型的方式,根据之前的技术效果:1)生成质量显著提升,视频分辨率从128×128提升到1280×768。2)时序一致性大幅改善,本描述,生成符合语义的视频。4)生成时长从3-5秒提升到10-15秒。成效果差,人脸容易扭曲,手部和手指问题尤为严重。3)生成速度慢,生成一段10秒视频需要几分钟甚至几十分钟。3)长视频生成困难,超过15秒后,视频内容容易变得混乱或重复。首个面向公众的文生视频产品,支持生成4秒720p视频。3)Pika专业的投资研究大数据平台2026年8月10日专业的投资研究大数据平台变成符合标准正态分布的纯噪声。该前向过程是一个固定的马尔可夫链,无需训练义,数学上可以直接推导任意步数t的带噪数据,无需逐步迭代,大幅提升了训练逆向去噪过程:训练一个神经网络(通常称为“去噪网络”),学习从纯噪声中逐步预测并去除噪声,最终恢复出清晰的真实数据。生成时只需输入随机噪声,经过逐步去噪即可得到全新样本。图4:扩散网络的加噪、去噪过程OO理论上,由于前向扩散即加嗓声的过程是固定的,加嗓声的逆操作也应是固对比GAN/VAE,扩散模型的核心优势在于:1)训练极度稳定:没有对抗博弈,损失函数单调下降,不存在模式崩溃问题;2)生成质量与多样性均衡:既可以生成高度逼真的细节,又能保证样本丰富多样;3)可扩展性强:模型参数量、数据量越大,生成效果持续提升,符合大模型缩放定律;4)可控性好:支持多种条件灵活引导,便于实现可控生成。专业的投资研究大数据平台专业的投资研究大数据平台ViT是Transformer架构从自然语言处理向计算机视觉领域的迁移,它打破了CNN(卷积神经网络)对视觉任务的垄断,凭借全局建模能力和强可扩展性,成为当前大模型时代的视觉主干网心是通过卷积核在图像上滑动,提取局部特征;而ViT彻底抛弃了卷积归纳偏置,将图像转化为和文本一样的一维token序列,直接用标准Transformer处理,即图像序列化。ViT将一张图像切分为若干个固定大小的小块(Patch,通常为16×16像素),每个小块通过线性投影,转化为一个特征向量(即Transformer中的一个token),并为每个token添加位置编码,保留原始的空间位置信息,最后将token序列输入多层Transformer编码器,完成全局特征建模。LinearProjectionofFlattenedPatchesViT的核心思想在于将图像输入转换为一维特征向量后,用Transformer架构进行处理,因此ViT模型的核心组件以及优势均源于Transformer架构:ViT的输入接口。多头自注意力(MSA):ViT的核心,让每个token都能和图像中所有其他token计算关联度,实现全局感受野。相比CNN的局部感受野,它天然擅长捕捉长距离的依赖关系(比如人物全身的比例、物体间的空间关联)。早期扩散模型的去噪网络普遍采用CNN架构的U-Net,但U-Net的长程依赖短板和可扩展性瓶颈,逐渐成为生成质量进一步提升的瓶颈。2022年DiT(DiffusionTransformer)提出,用ViT替换了U-慧博智能投研慧博智能投研专业的投资研究大数据平台核心贡献是首次证明纯Transformer架构可以完全替代传统扩散模型中的卷积U-Net主干,且具备极佳底打破了U-Net的性能天花板,为后续视频大模型、多模态生成模型奠定了核心架构基础。2024年2月OpenAI发布的Sora模型是AI视频生成领域的里程碑事件,模型能力实现了质的飞跃。Sora彻底改变了人们对AI视频生成能力的认知,其采用的DiT架构也成为行业的事实标准,引领了后续所有主流技术效果:1)生成时长突破,从15秒提升到60秒,部分场景甚至更长。2)物理真实感大幅提升,能够准确模拟重力、碰撞、流体等常见物理现象。3)3D一致性增强,支持复杂的相机运动,物体在3D空间中保持一致性。4)多镜头叙事能力,能够在单个视频中实现多个镜头的自然切换。5)复杂场景生主要局限性:1)精细结构仍有错误,手部、手指等精细结构仍然容易出错。2)长视频逻辑一致性不足,超过1分钟后内容容易出现重复或逻辑混乱。3)生成成本极高,生成一段60秒视频需要大量GPU资源和时间。4)可控性不足,用户对生成过程的精细控制能力有限。月):专业级视频生成平台,引入了更精细的时序控制,提供丰富的编辑工具。2)Pika1.5(2024年10月):以创意风格和快速生成为特色,深受创作者喜爱。3)快手可灵(2024年6月):国内用户量最大的文生视频平台之一,以长视频生成能力著称。4)字节即梦(2024年5月):与剪映深度集成,提供一站式视频创作体验。5)MiniMax海螺(2024年8月):支持音视频联合生成。DiT模型的整体流程和传统扩散模型一致,仅将去噪网络的主干从U-Net替换成了Transformer,具体变化如下:1)输入处理:带噪的潜在表示经过补丁嵌入,转化为token序列;2)条件注入:扩散时间步、文本条件等信息,通过自适应层归一化(adaLN-Zero)或交叉注意力注入到每个Transformer块中;3)主干网络:多层Transformer块堆叠,通过自注意力完成时空全局建模;4)输出头:将token专业的投资研究大数据平合DiT架构的核心是标准的ViT风格Transformer块(多头自注意力+前馈网络+层归一化+残差连接),文作者对比了四种条件注入方案,最终adaLN-Zero(零初始化自适应层归一化)效果最优,即上图所示的Transformer块。具体的条件注入过程如下:先将时间步t和条件c拼接后投影,生成缩放(scale)和偏移(shift)参数。将参数注入到每个Transformer块的层归一化中,控制特征的分布。采用零初始化策略:训练初始时,条件注入的权重为0,Transformer块等价于恒等映射,大幅提升训练稳定性。DiT架构的提出对图像/视频生成及多模态大模型的发展具有重要价值。1)范式级架构替换:首次证明纯Transformer可以完全替代U-Net作为扩散模型主干,且在大参数量下效果全面超越卷积架构,将生缩放规律,为后续模型迭代指明了明确的技术路线。3)统一多模态架构底座:Transformer是NLP、模态融合的成本。4)工程化友好:DiT架构简单统一,只有一种标准Transformer块,便于硬件优化、2024年GPT-40发布,实现多模态统一建模;图像生成进入实时生成时代。2025年,AI视频生成技术进入了全面成熟阶段,技术路线已经基本收敛到DiT架构,模型能力在生成质量、时长、可控性和生成速度等方面都有了显著提升。同时,音视频联合生成、多模态输入、长视频生成等1)视频长度:通过滑动窗口注意力和分块生成技术,最长生成时长从1分钟提升到5分钟以上。多镜头叙事能力增强,能够生成有完整故事情节的短片。2)可控性:为了满足专业创作需求,模型的可控性得到了极大提升,包括运动控制(手绘运动轨迹、关键帧控制、相机运动控制)、角色控制(上传参考图像保持角色一致性)、风格控制和局部编辑。3)效率优化:通过蒸馏技术将原本需要几十步的扩散过程蒸馏到8步甚至更少,结合稀疏注意力和量化技术,大幅提升了生成速度,降低了硬件要求。4)音视频联合生成:新一代模型普遍支持原生音频生成,能够生成与视频内容同步的对话、音效和环境音。目前主流的AI视频模型已经达到了以下技术水平:1)分辨率:主流模型支持108op,高端模型支持4K。2)时长:普通模型支持15-30秒,高端模型支持1-5分钟。3)生成速度:实时生成成为可能,部分模型达到10fps以上。4)可用率:专业模型的生成可用率超过90%,大幅降低了创作成本。5)物理真实感:大多数常见物理现象都能准确模拟。6)人物生成:人脸和手部生成质量大幅提升,基本告别基于以上能力水平,AI视频模型已经能够在影视、广告、游戏等行业的多种场景下实现工业化应报告后续章节会对具体应用场景进行分析。报告内难以直接展示模型的视频生成结果专业的投资研究大数据平台2026年8月10日数据来源:豆包Seedream-4.5、东北证券虽然当下的AI视频生成模型已经在多项技术指标上均已得到了长足的进步,在视频细节和生成成本上早期萌芽探索阶段(约64×64)3秒以内运动模式单一,严重模糊,时间画面几乎无可辨识的主低(约256×256)5-10秒画质明显提升,但主体一致性易“畸变”、“抽搐”易突变,无法维持逻辑架构统一约60秒开始具备初步物理规律模拟能力(光影、遮挡),运动流畅度大幅运动与物理一致性显著增强,可同步生成原生音频,向理解三维长程交互、记忆与可控性仍在探索,计算成本长视频生成要求模型具备持续记忆与一致性维护能力,目前仍然存在两大技术限制。1)模型本身上下专业的投资研究大数据平台2026年8月10日 (如室内场景无过渡切到户外);2)生成时长增加下,误差累积仍不可控:短视频可容忍局部质量瑕疵,但在长序列生成中误差会逐帧累积,导致视觉质量随时间逐步下降,表现为内InputImage径各异,但仍可按延长记忆跨度与降低错误累积两大方向分类,比较有代表性的主增强方案与字节的错误累积抑制方案:1)记忆改善层面:香港大学与可灵团队联合推出MemFlow方案,其采用叙事自适应记忆+稀疏记忆激活架构,即首先创建记忆库,在新片段生成时根据提示词检索库中相关视觉记忆,从而实现角色形象与叙事状态的跨段一致性;2)错误累积优化层面:UCLA与字长视频(允许崩坏),通过教师模型对画面进行修正并更新,使模型在长时间范围内形成稳态生成能力。从效果看,两类技术均已将能力扩展至分钟级以上,其中Self-Forcing++最长生成时长可达4分15秒,生成链式结构:生成链式结构:信息(斜向延展的重叠块)NarattveAdaptiveMem构建并更新“记忆库”让记忆库参与生成&控制显专业的投资研究大数据平台2026年8月10日在传统短视频蒸馏中,模型每次都从随机噪声生成Self-Forcing±±改为在长视频roll-out后,把噪声重新注入到已生成的序列中,使后续帧与前文保持时间连续性。这一步相当于让模型「重启但不失忆」,避免时间割裂。将原本只在5的教师-学生蒸馏。教师不也能「局部监致性学习。「暖光漂移」目前在提升物理能力方面主要可以概括为两种路径:1)隐式物理学习;2)显式物理约束:C端应用场景。其基本机制是基于大规模视频数据,学习不同物体状态在时间维度上的联合概率分布,力增长,高复杂度动作的生成能力能够快速提升。但由于路径本质仍是对概备对物理因果关系的显式建模能力,生成偏差仍难以避免。因此,该路径更视觉表现力为核心诉求的C端内容生成场景。频数据的预训练与后训练体系优化。生成效果亦可予以侧面佐证:相较一代模型原能力(如复现奥赛季体操运动)上实现显著提升,但个别基础物理或事实逻辑层面仍会出现偏差。Sora1(左)在生成简单体操运动时仍不足以满足基本的物理逻辑专业的投资研究大数据平台 2026年8月10日专业的投资研究大数据平台资料来源:第一财经公众号,中邮证券研究所显式物理约束:物理正确性上限更高,但工程成本与生成自由度受限,更偏向B端专业与垂直场景。其核心思想是在生成过程中引入物理先验、规则引导等结构性约束,从而降低违背因果规律的生成结果。但由于现实物理规则高度复杂且层级繁多,使得该路径在算力成本、系统复杂度等方面面临挑战。此外,显式约束在提升稳定性的同时可能降低结果的发散性与创造性,因此行的工程化折中方案:即在不破坏生成模型主体灵活性的前提下,局部引入物理相关数据或约束Runway为例,根据AITurbo介绍,其产品Gen-4通过集成物理感知模拟层,使其能对走路姿态、物体重量等多种物理现象实现深刻理解。但由于折中方案仍牺牲了部分物理正确性,恒存性方面表现仍有不足。尽管如此,从综合性能来看,得益于4.5仍能以1243的Elo评分在ArtificialAnalysis文生视频基准测试中位居首位。图表25:图表25:Runway已参与众多工程级影音项目资料来源:Runway,中邮证券研究所图表26:文生视频模型排名(ELO)并展现出真实颠酷感能够还原粉刷墙壁后,涂刷区域训练和推理仍然需要大量GPU资源,限制了大规模应用和普及。专业的投资研究大数据平台专业的投资研究大数据平台(2)世界模型世界模型或将带来新技术变革,视频生成有望再迎发展拐点,为机器人等物理2024年,业内对于世界模型的理解开始延伸,并出现一种新的趋势判断:世→图像生成→3D生成→世界生成(同时具备时序与空间序建模)”的趋势链条。同年2月,OpenAI将图表35:世界模型理解的衍生推动了不同技术方向的产品落地图表35:世界模型理解的衍生推动了不同技术方向的产品落地编辑、可分享的三雄环境,在这种模式下,「世界」是皇现在VR头显、显示器或电脑屏幕上的那片可供人观看与游走的空间.供人欣赏的画面。关注点不在于渲染,[世作包括WorldModels、Dreamer系列以及Meta提出的JEPA等,其本质均依赖隐性潜变量学习与未来变”这一类具身推理问题),因此在学术界和产业界对于其是否属于世界模型仍有争议,彼时也未促成产业对生成派路线的系统性关注或资源投入。2025年后:部分主流厂商入局生成类赛道,叠加Genie3交互能力首次验证了生成模型具备掌握因果律的潜力,重心开始向生成类倾斜。自2025年起,海内外多家企业开始将世界模型作为明确布局方向,其中,NVIDIA推出Cosmos,李飞飞创办WorldLabs,2025年8月,DeepMind发布可交互世界模型Genie3,首次在工程层面为“生成类模型能否回应因果律”提供了可验证证据,证明生成式路线在长期演化下具备成为世界模型标准范式的可行性。在此信号作用下,市场对生成类技术重视度提升,并进一步推动Runway等视频模型厂商入局。模型名可用于世界生成和推理,或进行后训练以开发专用的物理AI模型,分为三个方向:1)CosmosPredict:根据单个30秒的预测世界状态视频;2)CosmosTransfer:可跨各种环境和光照条件快速扩展单个模拟或空间视频;3)CosmosReason:使用视频和图像的结构化推理。Google首个支持实时交互的世界模型,用户只需输入文本提Genie3就能以每秒24帧的速度实时生成可供自由探索的动态世界,并在720p分辨率下保持数分钟的画面一致性。应用场景主要包括虚拟训练场、游戏与内容创作、AI智能体研究等。发布时间为2025年8月(此前版本为23、24年发布的Genie1及2代)2025年11月核心能力可以概括为三点:1)多模态生成:可以根据一张图片、一段视频,甚至一句文字提示,重建出结构完整、细节丰富的3D世界;2)AI原生的世界编辑能力:允许用户像调整真实场景一样对世界进行局部替换、材质变化、光照调整或布局重构;3)可落地的制作流程:支持将生成的世界导出为高斯溅射、三角网格或视接进入Unreal.Unity、Blender等常见创作工具,融入游戏、影视等行业的工作流。2025年12月目前包含三个变体:1)GWMWorlds:用于实时环境的模拟与探索;2)GWMAvatars:能够模拟人类对话;3)GWMRobotics:用于机器人操作。昆仑万维2025年2月Matrix-Zero世界模型包含两款子模型。其中:1)自研3D场景生成大模型,支持将用户输入的图片转化为可自由探索的真实合理的3D场景;2)自研可交互视频生成大模型,提供以用户输入为核心驱动的可交互空间智能视频生成方案,支持根据用户实时输入生成互动视2025年7月可基于一句文本描述或一张图像输入,生成一个360度沉浸式的三维场景。用户可在其中进行视角切换、自由环视近VR世界,且支持物理仿真与二次编辑,亦可导出为全景贴图用于成技术在长时一致性、物理准确性等层面仍存技术瓶颈。相比之下,世界模型化路径高度耦合。世界模型的发展已形成相对清晰的代际规划:第一阶段:短秒级运动生成,即为当下的视频生成类模型技术;第二阶段:要求模型支生成,同时保持语义级与导航级的交互能力,实现跨镜头、跨场景的一致叙事专业的投资研究大数据平台推理与多时空尺度的自主演化,是具身智能的终极形态。可以看到,前三阶段的每图表38:世界模型的四代演进路径图表38:世界模型的四代演进路径GoogescholrVeoGen与物理反馈的内部表达,因此在长时序生成与一致性维持方面迭代速度仍相对缓慢。而世界模型通常由状态表征模型、动态模型与决策模型三部分构成,通过显式维护环境状态并模拟动未来可能成为视频生成的另一条主流演进路径。以GoogleGenie系列为例:2024年底发布的Genie2仅能支持浅层三维环境搭建与基础交互,画面维持约10~20秒即出现信息崩溃;不到一年时间,Genie3已能够以24fps实时生成可供自由探索的动态虚拟世界,并在720p分辨率下维持数分钟级画面专业的投资研究大数据平台 2026年8月10日专业的投资研究大数据平台目前世界模型已被业内普遍视为与大语言模型(LLM)同级的重要人工智能发展模型相关技术路线,后续可能逐步实现产品化落地。此外,尽管Op行业共识逐步形成背景下,研发节奏预计或将进一步加快,2026年有望成为世界模型跃迁的关键节点。验证生成式路径的可行性,能够认为其行业位置更类似于2022年GPT-2向GPT-3的跃迁前夜。当前随着入局者持续增多,叠加3D资产与物理仿真资源逐步丰富,技术框架有望加速成熟,2026年或将迎来世界模型的GPT-3时刻,其能力亦有望从技术展示逐步迈向基础场景的商业化应用,进入真正的产品验证周期。未来AI视频将突破技术边界,通过实时交互式生成深度支持游戏、VR/AR等实时应用场景,够与生成内容进行即时的双向互动;并且,还将具备直接生成3D立体视频的能力,产出双目立体视频与VR内容,为元宇宙的构建提供坚实的内容支撑。专业的投资研究大数据平台2026年8月10日无一无一10/15/25秒1080p、准2K1)Sora2(720p):0.1美元/秒2)Sora2Pro(720p):0.3美元/秒3)Sora2Pro(准2K):0.5美元/秒模型版本2)强调世界模拟1)更快的生成速度(较预览版提高约40%)2)更强大的功能3)支持多分辨率、比例选择1)画面延展功能2)视频循环功能3)视频元素编辑功能4)故事板功能(在时间轴设置场景、角色、动作序列)5)视频合并功能(以过渡、点缀等方式合并两个视频)1)同步音频生成2)更好的遵循物理规律1)音视频同步生成功能2)角色扮演功能(让用户成为生成视频内的角色)3)发布SoraApp资料来源:OpenAl官网,太平洋证券研究院谷歌Veo:专注电影级创作控制。2024年5月,谷歌发布Veo预览版,模型专注于电影级创作控制。此后,Veo围绕这一核心定位完成三次更新迭代。在模型能力上,依化物理真实感、镜头语言表现力、叙事连贯性等。其中,2025年5月发布的Veo3是最早实现音画同出的视频模型,且分辨率可通过超分功能升至4K;最新迭代版Veo3.1位列LMArena文生视频榜榜首,生成视频质量领跑全球。在创意控制上,推出时长延长、对象增减、镜头控制业视频编辑工具演进。在产品生态上,发布面向电影制作人的AI电影制作工具Flow,集成Gemini、生成视频的渠道。截至2025年10月,Flow累计生成视频超2.75亿个。Gemini0mi让你能够用最白然的流畅语言,轻松进行影片编辑。每一次的指令都会承接上一步的脉络,不仅能让影片保持角色外性、拥有合理的物理逻辑,场景更会记住前一幕发生的细节。Ommi不只能够建构出逼真的场景,还能推理接下来该发生什么事。透过结合物理常识跟Gemini丰富的历史、科学与文化知识,0Ommi能将图像、文字、影片或音讯等任何参考来源,揉合转化为单一且风格连贯的成品输出。在音讯输入上,我们初期会先开为参考素材,并持续加入其他音讽输入类型。专业的投资研究大数据平台工具起家,2023年2月发布Gen-1,实现视频到视频的风格化转换,支持将提示词描述的风格应用于源视频。此后,Gen完成四次更新迭代,始终强调视频编辑能力,于2023年6月最早推出镜头控制、视频编辑优势。此外,2023年6月发布的Gen-2是全球首个实现商业化的文生视频模型,其基于Diffusion架构突破文生、图生视频能力,并推出订阅制+积分制的混合付费模式。无-无-无1)Gen-3:0.20美元/秒文本、图片(重点)无1)Gen-4:0.24美元/秒无*以$0.02美元/信用消耗计算1)主要应用于视频到视频的风格1)首次实现文本、图片生成视频1)超分功能(通过超分技术将分辨率提升至4K)2)延长/拼接功能(延长生成视频的时长)3)比例自定义功能(根据选择,生成多比例视频)4)镜头控制功能(控制镜头移动、速度、方向等)5)动作笔刷功能(在特定区域绘制对象运动方向)1)显著提升一致性、保真度、运动真实感1)高级镜头控制功能(增加镜头控制的运动方向、可在时间轴定义对象的出现、变化、运动)2)延长/拼接功能(延长次数增加,视频时长更长)3)发布Gen-3Turbo(提升生成速度、降低成本)1)提升角色、环境的一致性,跨镜头的连贯性4)更强的提示词遵循和叙事能力1)图片参考功能2)延长/拼接功能(延长次数增加,视频时长更长)3)发布Gen-4Turbo(提升生成速度、降低成本)1)提升一致性、保真度、风格控1)计划推出原生音频生成功能频生视频LumaRay:构建垂类场景优势,Ray3为全球首个原生HDR及推理驱动视频模型。Ray聚焦专业影视创作场景,构建起垂类场景优势。在模型能力上,Ray3是全球首个支持原生H可通过超分功能升至4K,生成视频质量达到部分影视级制作标准;同时,Ray3也是全球首个推理驱动实现生成视频的保真度SOTA,更适配影视、CG等高精度内容创作需求。在产品生态上,2024年11月,DreamMachinev1升级为AI多模态创作平台,完成ios应用开发、界面优化、Photon图像生成模型集成等迭代。平台依托多个自研多模态模型与多样化专业编辑功能,为创作者提工具。21/43专业的投资研究大数据平台专业的投资研究大数据平台1)540p:0.08美元/秒-1)生成速度快,20-60秒可完成生成1)算力资源是一代模型的10倍,实1)超分功能(通过超分技术将分辨率提升4K)2)延长/拼接功能(视频时长延长至1分钟)3)镜头控制功能4)发布RayFlash2(生成速度提升3倍、成本下降67%)1)支持原生HDR视频生成(可通过输入文本、SDR图片、SDR视频实现),并输出可供专业创作者使用的EXR原3)实现保真度的SOTA(提升真实度、物理规律遵循、一致性)1)草稿模式(先生成预览,挑选后再生成高质量成片;生成速度提升5倍、成本下降80%)2)视频编辑功能(可修改视频背景、环境、对象等;基于参考视频生成特定风格的视频)3)首尾帧连接功能1)生成速度提升4倍,成本下降67%Ray3.142)全流程支持原生1080p生成资料来源:Luma官网,太平洋证券研究院专业的投资研究大数据平台2026年8月10日专业的投资研究大数据平台国别发布时间美国1中国233Seedance2.0,凭借强大的生成能力与控制精度,迅速引爆全网,成为现象级产品。Seedance2.0统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入。相比1.5版本,Seedance2.0的生成质量大幅提升,其在复杂交可控性显著增强,更加贴合工业级创作场景的需求。2026年6月,Seedance2.5发布,在单段生成长度 (支持30秒单段原生直出与高质量视频延长)、多素材参考(支持50个全模态素材联合输入)、视频编辑三个维度实现突破。商业化方面,Seedance2.0采用“个人订阅+企业API”双轨制,2026年2月陆续接入豆包App、即梦AI及剪映平台,4月火山引擎正式上线Seedance2.0系列API服务,商业化能力迅速从C端创作者延伸至B端企业客户。在定价方面,火山引擎1000万Tokens价格为280元,BytePlus1000万Tokens价为43美金,根据财联社报道,按实测数据,生成15秒视频需消耗30.888万tokens,以纯生成模式核算,单条成本约15元,折合每秒1元。凭借出色的运动稳定性和物理还原能力,模型在多主体交互和复杂运动场景中表现出色,生成可用率达到业界SOTA水平。基于统一的多模态音视频联合架构训练,支持混合模态输入,允许用户同时输入多达9张图片、3段视频、3段音频以及自然语言指令,模模型的指令遵循与一致性表现全面提升,并支持稳定可控的视频延长、视频编辑,让普通用户也能模型支持15秒高质量多镜头音视频输出,具备双声道音频能力,可实现极致拟真的视听效果,配合参考和编辑能力,能大幅降低影视、广告可灵AI随大模型版本迭代ARR持续攀升。2025年12月,可灵AI启动“全能灵感周”,先后发布全球视频2.6模型以及可灵数字人2.0等一系列新的模型,带动可灵在12月的当月收入突破2000万美元,ARR达2.4亿美元。Kling-Omni通用视频生成架构引入全新的多模态视觉语言(MVL)。2026年2月,可灵AI3.0系列模型上线,基于All-in-One产品架构构建,支持涵盖文本、图像、音频和视频的全模态输入与输出,将视频的理解、生成和编辑整合到一个高效流畅的AI工作流中。在支持长达15秒视计划,支持多达15名成员进行实时协作创作,并使创作者能够高效管理团队内部的内容创作工作流程。随着3.0版本的更新迭代,2026年第一季度,可灵AI产生的收入超过人民币6.5亿人民币,同比增长超过300%。2026年3月,可灵AI的年化收入运行率(ARR)近5亿美元,海外贡献重要收入来源。专业的投资研究大数据平台2026年8月10日图:可灵ARR变化情况图:可灵ARR变化情况2资料来源:公司官网,国元证券研究所资料来源:KlingTeam《Kling-OmniTechnicalReport》,国元证券研究所约5亿美金010日,阿里ATH创新事业部正式认领HappyHouse,4月27日开启灰测,并接入千问App。爱诗科技和生数科技两家均为AI视频生成领域的初创企业。生数科技速度与成本上具有优势,其原创U-ViT架构带来了极致的生成视频模型的变现方式目前以2B为主,初期是超级个体(P端创作者),逐渐渗透企业客户(B端聚合平台、企业)。以快手可灵Kling的客户类型演进来看,期初(1)海外自媒体、视频超级创作者为主,通常是个人或小团队用于创作效率提高的场景,有较好的付费意愿,通过APP和PC端直接会员费的模式获取快速通道和积分,生成不同分辨率的视频消耗对应定价的积分。(2)随着视频模型的能力升级,目前更多企业客户(B端)开始接入API使用视频模型。客户销售方式通常分类两类,一类是分销平台,类似于Higgsfield这些为创作者提供多模态生成工具的聚合模型平台,会引入各类多模态生成模型;另一类是直接销售给B端,例如广告、游戏、电商等行业的企业客户;通常API接入的模式则按照实际的Token消耗收费。专业的投资研究大数据平台2026年8月10日图14:目前的客户类型和变现模式P端·超级创作者B端数据来源:可灵KlingAI开放平台、火山引擎、广发证券发展研究中心图15:字节跳动火山引擎生态容器与中间件视频与边缘大数据2026年8月10日2026年8月10日专业的投资研究大数据平台数据来源:higgsfield.ai、广发证券发展研究中心图17:Magnific平台的视频创作界面数据来源:、广发证券发展研究中心表6:主要的聚合模型平台列举融资(USD)接入模型社)以上模型均有接入Google内部项目GoogleAl创作平台,整合Veo、入阅用户聚合9M(非官方)(非官方)以上模型均有接入数据来源:路透社,各平台官网、广发证券收费方式:针对P端推出包月套餐,B端则为API消耗收费。(1)P端的套餐包月门槛50元人民币。(2)API收费,通常是打包定价,按token消耗/生成时长来收费。专业的投资研究大数据平台表7:主要的视频大模型定价列举即梦(Seedance)元HappyHorse1.1:0.9元-1.1元秒(无4K)海螺2:0.3元-0.6元/秒(无4K)VEO3.1standard:0.4美元-0.6美元随着模型版本的迭代,更高参数/性能更高的模型普遍还是会比前代的定Seedance不同版本模型的API收费均价,按目前来看,价格和分辨率、模型先进程度成正相关。更好的模型有更高的定价,一方面代表初期的模小幅提价的趋势下,更多高版本的模型调用量,对整体大模型平台的利图18:可灵Kling不同版本模型API定价(元/秒)图19:Seedance不同版本模型API定价(元/秒)数据来源:可灵Kling官网、广发证券发展研究中心数据来源:火山引擎官网、广发证券发展研究中心专业的投资研究大数据平台图20:主要大模型平台毛利率数据来源:Reuters、theinvesting、各公司财报、广发证券发展研究图21:快手可灵Kling的利润率测算20252025数据来源:公司财报、广发证券发展研究中心格局和定价逻辑决定了未来的模型UE。以快手可灵Kling为例,测算其Capex投入,对应的折旧成本在Cogs和Opex层面的逐年影响,以及收入端如果能持续保持加快增长,在收入达到130亿水平的时候,整体模型的OP利润率可以达到~10%。后续决定利润率的核心在于格局和定价,如果格局保持稀疏,表8:快手可灵Kling的收入和成本测算(亿元人民币)(2024-2028E)累计摊销66828数据来源:快手财报、广发证券发展研究中心在影视行业,动漫剧由于本身拟真性要求相对较低,与视频生成契合度最高,已率DataEye研究院《2025年漫剧数据报告》,2025年仅抖音端原生漫剧上线数即突破6万部,市场整体播放量超700亿次。2025年以前漫剧市场的作品供给量不足千部,AI视频技术的大规模应用为漫剧市场提供了60倍的供给量增长。短剧方面,AI生成的拟真短剧内容接受度在快速提升,2026年以来已经逐步进入量产阶段。但由于短在细微差异时会产生恐怖谷效应,因此在短剧场景中,拟真人短剧当前在科幻、魔长剧与电影方面,CG特效等高价值环节有望成为首批替代场景。但鉴于CG特效仍为影视工业中技术门槛最高模块之一,具备专业团队与预算的头部厂商短期内仍可能优先采用成熟CG方案,并逐使用AI替换/调整原先的工作流程。相较而言,中小型影视团从形态上看,短剧单集时长通常为1~3分钟,集与集之间的情节连续性要求较低,天然契合当前视频模型的片段化生成特征,使AI能够实现全流程参与;从内容上看,当前AI漫剧以动态漫与2D动画为主,其画面复杂度、物理精度及光影细腻度均显著低于CG或拟真场景,对模型能力要求更低。得益于效率与成本优势,AI漫剧已率先实现商业闭环。据短剧的平均制作周期可较传统动态漫缩短50%以上(从50~60天压缩至30天以内),整体成本可降至传统模式的10%~30%。2025年4~7月期间,AI漫剧剧目供给量以83%的复合增长率持续扩容,播放量与点赞量亦分别实现92%与105%的复合增长。AI漫剧市场规模倍速增长,2026年前5个月已超220亿元。在AI技术的深度赋能下,漫剧市场正迎来爆发式增长。根据DataEye的统计和预测,仅2026年前5个月,综合考虑广告消耗、非效果广告模式以及资本投入等情况,预计国内AI剧漫剧市场规模已超220亿元。考虑到赛道监管趋严、竞争激烈,不少企业重心转向出海等因素,2026年全年国内AI剧漫剧市场规模保守估计将达400亿,较2025年增长138%。专业的投资研究大数据平台2026年8月10日576.14亿400.00亿2023年以前7.35亿2023年2024年■端原生关联播放量其他平台预估关联播放量产业生态:漫剧产业已构建“AI+IP”双轮驱动生态体系,通过阅文、知乎、番茄配合字节跳动、快手等提供Seedance2.0分发并依托IAP与IAA模式实现商业闭环。材同质化严重,部分作品粗制滥造、剧情逻辑混乱,抄袭搬运、擦边引流等问题也推动漫剧市场的转变:一方面,监管与平台治理逐步收紧,内容审核标准日趋明确生存空间被持续压缩;另一方面,市场供给趋于饱和,观众的审美快速升级,漫画IP快速影像化并投放市场,通过真实数据精准判断一个IP的市场潜力。经过漫剧验证的优质IP,可以沿产业链条逐级延伸,向上开发为真人短剧、长剧集乃至院线电影,横向专业的投资研究大数据平台2026年8月10日低成本验证市场→沿产业链阶梯式开发→IP价值最大化真人短剧→长剧集→院线电影向下沉淀快速影像化并投放市场海量待开发内容2025年AI漫剧经历四代迭代:从1.0沙雕漫、2.0动态漫、3.0小说剧升级至4.0精品AI漫剧,实现从“轻量化引流”向“精品化留存”转变。从技术上看,AI仿真人短剧可以归结为AI漫剧的第五发展阶段,即由AI生成的以数字人/真人为角色形象的微短剧。能够认为AI仿真人短剧将是影视行业下一被攻克,数字角色可以在数十集篇幅内保持面容、神态、服装的稳定;口型与语音与肢体动作的自然生成,让“恐怖谷”效应快速消退;多镜头叙事、运镜从市场上限的维度看,仿真人形态决定了这条赛道的天花板远高于前几个阶元受众边界,用户规模和付费能力存在明确边界。而仿真人短剧直接切入了真市场。当内容形象从“漫画脸”换成“真人脸”,目标受众便从垂直人群扩展至全年龄层的泛娱乐用户,从产业格局看,仿真人短剧将演员、场地等重资产要素全面数字化,突破物“项目制”走向“流水线制”,由劳动密集转向算力密集。率先建立数字演员库、打通生成管线的团队,AI仿真人短剧播放量及占比快速提升,2026年1月至3月由5%跃升至40%。根据DataEye数据,2026年Q1AI短剧总播放量近1300亿,3月份环比2月份播放量增长78.9%,增速主要由AI仿真人剧细分品类中2026年1-3月AI仿真人剧播放量占比大幅提升,分别为5%、30%、40%,2D+3D漫剧占比分别为71%、55%、49%,沙雕漫为15%、10%、13%。31/43专业的投资研究大数据平台2026年8月10日图11:2026年Q1各类型图11:2026年Q1各类型AI剧播放量分布图12:2026年3月各类型在播AI剧数量分布数据来源:DataEye,东北证券共发布AI剧超10万部,其中AI仿真人剧占比56%;新剧贡献播放量占比高达92.88%,单季度播放图13:2026年Q1各类型AI剧上新数量占比数据来源:DataEye,东北证券图14:2026年3月上新图14:2026年3月上新AI剧各类型占比数据来源:DataEye,东北证券根据2026年3月AI仿真人短剧播放量占比(40%)及产业趋势,我们预计2026全年占比水平将达到55%,2030年将至80%。根据《2025-2026年中国AI漫剧行业趋势白皮书》,我国AI短剧市场规模将由2026年全年313.7亿元增长至2030年858.6亿元,据此推测我国AI仿真人剧市场规模2026年预计实现173亿元,2030年或将达到近687亿元。313.72026E2027E2028E2029E■国内AI剧整体市场规模(亿元)■国内AI仿真人剧市场规模(亿元)数据来源:《2025-2026年中国AI漫剧行业趋势白皮书》,东北证券0专业的投资研究大数据平台2026年8月10日色之契》预告片已于2026年4月29日上线,该片由公司旗下华策环球星核工作室(HuaceGlobal相较于真人电影对写实性的极高要求,动画电影的风格化表达为AI生成提供了容错空间,AI生成更易实现其对角色面部表情、动作设计等内容的创作。因此,目前AI动画电影相较于AI真人电影发展更成头部影视公司除积极布局短剧业务外,已在AI赋能影视大制作上做华策影视长剧《太平年》中观众印象深刻的乌鸦食肉糜、暴风雨海战等场景均由可灵AI生成,后者在保障画面的专业级水准效率的基础上制作提升8-10倍。根据中国视听大数据数据,《太平年》单集最高收视率3.2%,收视总规模达11.4亿人次,创CVB有收视记录(2018年)以来古装历史类电视剧集数据来源:东西文娱,东北证券数据来源:东西文娱,东北证券数据来源:东西文娱,东北证券博纳影业出品制作国内首部东方超写实灵智共创长篇电影《三星堆:未来往事》,现已正式获得国家电之罗刹海市》多部AI+电影作品。专业的投资研究大数据平台2026年8月10日图19:《三星堆:未来往事》已获得国家电影局"龙标"广告营销是AI视频生成技术商业化兑现最直接的行业分母。据QuestMobile2026年3月发布的《2025年中国营销市场年度报告·市场篇》,其统计口径下中国互联网广告市场规模由2023年的7146.1亿元增长至2025年的7930.8亿元,并预计2026年、2027年将分别达到8362.6亿元、8847.6亿元。互联网广告大盘已由流量扩张期进入稳健增长期,营销实验室、秒针营销科学院与北京师范大学新闻传播学院2026年1月联合发布的《2025中国互联网广告营销趋势报告》,2025年视频类信息流广告同比增速高达18.85%,为所有广告形式中增长最快的品类,视频化是大盘内部最显著的增量方向,这为AI视频生成提供了天然的渗透场景。0专业的投资研究大数据平台2026年8月10日AI对广告行业的渗透正从单点工具升级为全链路基础设施。《2025中国互联网广告营销趋势报告》将量红利转向AI技术全链路渗透。市场规模测算上,据量子位智库《中国AIGC广告营销产业全景报告》,2023年中国生成式AI在广告营销行业中的业务营收占比尚不足1%,市场规模约50亿元。预计未来每年增速或达60%以上,2030年AIGC广告营销业务营收规模有望达1500亿元。以行业龙头蓝色光标为例,其AI驱动收入由2024年的12亿元增至2025年的37.25亿元,占总营收比重由约2%(12亿元/607.97亿元)提升至5.42%(37.25亿元/686.93亿元)。综合看,AI在广告行业的收入渗透率目前仍处于低个位数水平,但增速显著高于大盘,渗透率抬升将是素材生产是AIGC在广告营销链路中落地最深的环节。量子位智库预测,未来5年内70%的营销内容可由AI自动生成并迭代,内容生产将由存量市场转变为增量营销服务商侧:蓝色光标与快手可灵AI战略合作,自研BlueAI心影平台接入可灵API,在商品、APP、内容公司侧:中文在线依托“逍遥大模型”与多模态技术打造“逍遥AIAgent性案例是2023年11月广州车展期间蓝色光标为宁德时代发布的广告片——全球第一部由用户自己选择剧情、自己出演的AIGC广告片:用户只需选择性别、脸型、旅行起止地点并上传照片,约三分钟即可获得一部由AI生成、本人主演的个性化驾驶大片。数据来源:广告门、东北证券专业的投资研究大数据平合20专业的投资研究大数据平合2026年8月10日从投放效果看,据广告门案例页披露,该AITVC小程序通过裂变而来的用户占总UV的80%,为行业均值的2.5倍以上;超过25%的用户参与互动,为行业平均互动率的3-5倍;参与互动用户最终加粉留资的留存率达90%,效率较传统页面广告从浏览到留资提升近10倍。国际头部品牌已将AI视频生成用于正式广告片的规模化制作,效果获得第三方创意评估背书,但技术短板与舆情风险同步暴露。2025年11月,可口可乐发布2025年节日营销广告,其中1995年经典广告《节日将至》(HolidaysareComing)的AI重制版由5名AI专家在30天内利用OpenAISora、谷歌Veo3和LumaAI等工具、从7万条视频片段中提炼完成,后期进行微调;创意效果评估机构System1给予该广告满分5.9分,认为其具备推动品牌长期增长的潜力。数据来源:新浪财经、东北证券综合来看,素材生成环节的成本曲线下移与个性化上限提升,正推动广告行符号”演进为直播电商、品牌营销、金融客服、政务服务等领域的生产力工具。据艾媒咨询2025年11月发布的《2025年中国数字人产业发展报告》,2024年中国数字人核心市场规模为339.2亿元,预计2030年将达到935.6亿元;2024年数字人带动市场规模为4785.3亿元,预计2030年为10468.6亿元。据艾媒咨询2026年2月发布的数据,中国数字人核心市场规模从2017年的8.1亿元增长至2025年的480.6亿元,年均增长率达66.60%,2026年预计进一步扩大至572.9亿元。上述口径为“广义数若采用狭义口径,据IDC发布的《中国2024年AI数字人市场份额》报告,2024年中国AI数字人市场规模约41.2亿元(按PaaS/SaaS年度收入计),同比增长85.3%,预计2029年将达到250.5亿元,2024-2029年复合增速43.5%,其中百度以9.8%的市场份额位居行业第一。专业的投资研究大数据平合2026年8月10京东推进数字人直播商业化进程:2024年,言犀数字人春节带货GMV超4000万;4月刘强东数字分身“采销东哥”首播半小时吸千万观看;618披露成本仅真人1/10,服务超5000家品牌,带动GMV超百亿。2025年,618实现“高商业可用”,7×24小时开播,成本1/10,转化率提升30%,表现超80%真人;全年累计服务超5万品牌,带动GMV数百亿;12月官宣免费开放,10天报名破1万家。GMV破5500万,下单用户增230%,人均观看时长增30%。主流媒体IP化运营则提供了相对成功的样本:据艾媒咨询《2025年中国数字人产业发展报告》案例研200余条内容,社交平台粉丝超200万,全网传播量达亿级。能够认为,早期超写实虚拟代言人“高投游戏是AI视频生成技术商业化落地最具确定性的下游场景之一,其分母足够大且仍在扩张。据中国音像与数字出版协会游戏出版工作委员会(游戏工委)2025年12月19日在2025年度中国游戏产业年会上发布的《2025年中国游戏产业报告》,2025年国内游戏市场实际销售收入达3507.89亿元,同比增长7.68%,游戏用户规模达6.83亿,同比增长1.35%,两项指标均创历史新高。结构上看,自研游戏国内市场实际销售收入2910.95亿元,同比增长11.64%;自研游戏海外市场实际销售收入204.55亿美元,同比增长10.23%,规模已连续六年超过千亿元人民币,出海已成为行业确定性第二曲线;小程序游戏市场收入535.35亿元,同比大幅增长34.39%,是增速最快的细分板块。专业的投资研究大数据平台专业的投资研究大数据平台出图效率倍增,成本显著下降广告素材批量生成与迭代技术储备就绪,静待规模化爆发局部试点落地,降本路径清晰重塑玩法,想象空间最大尚未全面铺开规模化爆发前夜美术资产层:AI渗透最深、证据最充分的环节。据三七互娱2025年年度报告,2D美术资产AI生成占比超80%,2D图片每季度产出超过50万张,AI-3D超30%,人物立绘产出由8-10人天压缩至2.5人天。恺英网络投资的公司自研虚幻引擎AIGC工具,批量生高精人物与模型渲染图,创作时间从2个月降至半小时。完美世界游戏2025年已将AI应用于智能NPC、场景建模、绘画、剧情、配音等;《诛平台化供给方面,腾讯混元游戏视觉生成平台为业内首个工业级AIGC游戏内容生产引擎,其角色多视图生成耗时由传统的12小时压缩至几分钟至30分钟,主体一致性达99%,已应用于多个头部游戏项目,广告所耗时间从原来的6小时缩短到30分钟,效率提升10倍以上,部分地区智能投放占比已超过60%。据三七互娱2025年年度报告,公司由AI深度参与生成的游戏广告素材视频占比已超过70%,“量子”与“宙斯”平台AI辅助投放广告比例达总投放的50%,AI图片扩散在海外平台消耗占比达20%。运营层:AI成为长线运营的效率基础设施。据三七互娱2025年年度报告,公司旗下全部游戏均已接入AI智能客服,解决准确率达90%;AI本地化翻译覆盖旗下所有海外游戏、覆盖18个语种,单语种最高准确率可达95%;用于知识产权保护的素材侵权检测系统上线后5个月内,识别及获取外部侵权核心线索效率提升约9倍。行业层面,点点数据报告亦将客服、审核、风控、推荐、社区治理等运营环节列为AI率先渗透的方向,典型案例包括世纪华通智能客服、心动公司TapTap

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论