AI 视频模型行业深度:中国短视频生态构筑隐性壁垒_第1页
AI 视频模型行业深度:中国短视频生态构筑隐性壁垒_第2页
AI 视频模型行业深度:中国短视频生态构筑隐性壁垒_第3页
AI 视频模型行业深度:中国短视频生态构筑隐性壁垒_第4页
AI 视频模型行业深度:中国短视频生态构筑隐性壁垒_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

识别风险价值发现媒体Ⅱ前次评级买入相对市场表现AI视频模型行业的发展复盘。2022年后智谱/Google/Runway发布论文探讨U-Net先。我们根据目前主要渗透的场景如微短剧、视频广告、影视工业等行业算,预计AI视频模型行业收入规模在2025、2026相对市场表现行业的格局和定价逻辑决定了中长期的模型UE。毛利率来看,海外平台高于国内大模型,例如和定价1)AI视频模型格局有望保持玩家海外巨头在多模态领域战略收缩,2026年中国模型抓住反超相关研究Kling3.0在物理规律理解、智能运镜、多镜头原生生成等底层技术上领先相关研究海量IP储备与影视工业化降本预期的深度分析|媒体Ⅱ股票简称股票代码货币最新最近报告日期评级合理价值EPS(元)PE(x)EV/EBITDA(x)ROE(%)收盘价2026E2027E2026E2027E2026E2027E2026E2027E快手-W01024.HK港元40.882026/5/28买入77.493.904.519.117.888.367.0815.014.0哔哩哔哩-W09626.HK港元124.702026/3/6买入242.118.4411.2414.7711.1014.0012.009.012.0爱奇艺IQ.O美元0.962026/5/19买入1.970.020.81327.618.093.473.19-2.02.0阅文集团00772.HK港元18.662026/3/29买入42.051.421.5811.4210.2723.0020.006.07.0深度分析|媒体Ⅱ 5 5 6 11 13 15 19 20 20 22 22 23 23 23 23深度分析|媒体Ⅱ 5 6 8 8 12 12 16 16 17 17 19 19 19 19 7 9 9表4:以字节不同类型模型的调用成本对比不同 11 13 17 18)( 20 21深度分析|媒体Ⅱ海外较早开始探索视频模型,海外巨头在大模型各领域希望保持齐头月,Runway发布Gen-1,首次实现基于文本和图像的视频生成,并率先开启AI视频商业化探索。2024年国内AI视频模型于2024年开始涌现多个玩家内玩家给予发展多模态更高的战略优先级,26年迎来技术和商业化的跃数据来源:Google、OpenAI、可灵KlingA深度分析|媒体Ⅱ视频模型发展按标志性事件可切割为三个阶段1)2Google、Runway都发布了学术论文DiT架构,采用了《Videogenerationmodelsasworl月,Google在I/O大会上官宣了VEO;6月快手基于平台也纷纷跟进并推出自己的视频模型。这一阶段的视频模型靠文/图输入可生成数秒钟长度的视频,分辨率•24年2月OpenAISora提•海外:OpenAI、Google聚焦•25年12月快手推出Kling-Omni通•海外:OpenAI、Google引领•720P/1080P分辨率的视频为主流2022年-2023年2024年-2025年2026年-早期技术选型正确的模型厂商拥有先发优势,快手可灵Kling在一开始就押注对了方向。从架构选型来看,深度分析|媒体Ⅱ多模态领域,资金能力和训练效率也是另一种优势阶段一:前DiT时代的探索(CNN/U-Net技术主导)2022年5月智谱AICogVideoCogVideo:Large-scalePretrainingforText-to-VideoGenerationviaTransformers3DCNN(U-Net)+扩散模型。这是国内最早开源的文本生成视频模型,但受限于架构,生成质量和时长有限。2022年10月GoogleImagenVideo&PhenakiImagenVideo:HighDefinitionVideoGenerationwithDiffusionModels级联视频扩散模型+级联U-Net。架构是纯CNN。2023年2月RunwayGen-1StructureandContent-GuidedVideoSynthesiswithDiffusionModels基于U-Net视频到视频生成/编辑模型,主打局部重绘和风格迁移。阶段二:架构交替,DiT(DiffusionTransformer)架构出现2024年2月15日OpenAISoraVideogenerationmodelsasworldsimulatorsDiT(DiffusionTransformer)+SpacetimePatch。证明把视频当成一维Token序列,用纯Transformer处理,通过大力出奇迹可以实现长达60秒的高清生成。2024年5月GoogleVeo谷歌在I/O开发者大会上推出视频生成模型——Veo,对标Sora。Veo可以生成超过1分钟的1080p高质量视频,并具有多种视觉和电影风格。表示跟随Sora步伐,放弃U-Net,采用了基于潜在空间的Transformer架构。2024年5月生数科技ViduVidu:aHighlyConsistent,DynamicandSkilledText-to-VideoGeneratorwithDiffusionModelsU-ViT(UniformVisionTransformer),清华团队早期提出的一种将Transformer与U-Net结构结合的变体,后来全面演进为纯DiT路2024年6月快手KLING上线可灵KlingAI支持生成1080p分辨率的视频,技术路线对标Sora,采用3D时空联合注意力机制实现对复杂时空运动和物理规律的建模。阶段三:中国模型爆发,全面拥抱DiT2024年8月智谱AICogVideoXCogVideoX:Text-to-VideoDiffusionModelswithAnExpertTransformer3DCausalDiT+FlowMatching。抛弃初代U-Net,引入了专家Transformer处理视频的时空关系。2024年8月MiniMax海螺AI/Video-01MiniMax视频生成模型Video-01正式发布该模型支持生成720p分辨率,25fps的高清视频,具备电影感的镜头移动效果,能根据文本描述快速创造出具有视觉冲击力的内容。2024年10月生数科技ViduSageAttention:Accurate8-BitAttentionforPlug-and-playInferenceAcceleration改为DiT路线,详细分析了注意力量化的可行性。提出了SageAttention,一种高效且精确的注意力量化方法。2024年10月快手KLINGKoala-36M:ALarge-scaleVideoDatasetImprovingConsistencybetweenFine-grainedConditionsandVideoContent在Transformer架构成为一致预期后,决定模型上限的已经不是网络结构,而是数据的质量,本论文提出一套流水线,把3600万个视频洗成“精品”。例如处理200词标注、做概率分布切镜头的数据工程能力,进一步拉高视频模型入场门槛。2025年6月字节跳动Seedance1.0Seedance1.0:ExploringtheBoundariesofVideoGenerationModels探讨工程能力,例如通过洗数据(精准标注)→改训练目标(多镜头+联合训练)→上后训练手段(多维RLHF)→极致压榨推理算力(10深度分析|媒体Ⅱ倍蒸馏加速),把前沿的Diffusion模型打磨一个具备“导演思维”、且生成速度快到能当消费级产品的工业级引擎。阶段四:全模态融合+比拼后训练效率和产品生态2025年12月快手KLINGKling-OmniTechnicalReportKling-Omni是Kling通用视频生成框架,打破了传统视频生成、编辑和智能推理之间的功能壁垒,采用端到端架构,能够直接从多模态视觉语言(MVL)输入中合成高保真视频。它标志着从单一的“内容创建工具”向“多模态世界模拟器”迈出了关键一步。2026年4月字节跳动Seedance2.0Seedance2.0:AdvancingVideoGenerationforWorldComplexity全模态融合的世界模拟。不再区分“画图”、“做视频”、“配乐”,直接向AI描述“包含声音、画面、动作的复杂场景”,AI一次性将其渲染出数据来源:、可灵AI器通过SkipConnection(跳跃连接)传输信息,将左边提取的高清细节DiT架构可以通过提高模型参数来提升视频生成质量,转型DiT架构,解决了模型训练瓶颈。DiffusionTransformers(DiT),其核心是在潜在扩散模型(深度分析|媒体Ⅱ对比维度-Net(卷积网络)DiT(Transformer)底层基本单元卷积层,只看相邻的像素。自注意力层,每一个Patch都和全图所有Patch交架构形态U型结构,有明显的Encoder和Decoder,依靠跳跃连接传递细节。直筒型结构,像一段一段的砖头直线堆叠,没有跳跃连接。处理图像的方式像素级/局部邻域处理。Patch化(把图切成比如2x2的小块当Token)。注入条件(文本/时间)通常用交叉注意力,在中间层把文本塞进去。通常用adaLN-Zero,把文本和时间直接变成调节参数,注入到每一层。视野(感受野)局部感受野,需要堆很多层才能看到全图。第一层就是全局视野,懂整体布局。扩展性(缩放法则)差。把U-Net加宽加深,性能提升很快会遇到瓶颈,甚至训练崩溃。极好。算力(Gflops)增加,性能几乎呈线性提升。Kling-Omni是快手Kling团队在模型定位与核心贡献Kling-Omni是快手Kling团队推出的通用视频生成框架。它打破了传统视频生成、编辑和智能推理之间的功能壁垒,采用端到端架基于多模态大语言模型(MLLM能够理解复杂的用户输入,并结合在共享嵌入空间中处理视觉和文本Token,实现深度基于低分辨率潜变量和MVL信号,采用局部窗口注意力和非对称注大规模预训练:大规模文本-视频配对数据,向模型注入稳健的基于指令的文本到视频生强化学习:采用DPO算法对齐人类审美偏好,优化目标集中在关键感知开发端到端训练系统,包含多模态数据流水线与负载均衡、高效算子(MM-FlashAttention)、显存优化(重计算与卸深度分析|媒体Ⅱ构建了涵盖跨模态(图/文/视频)和跨任务(图生视频、视频编辑、参考生成等)的全面数据系统。通过真实世界数据挖掘与合成数据构建,并经过三层严格的数据处理(基础),数据来源:Kling-OmniTech解复杂的用户输入,并结合世界知识推理出创作者的具体意图,重写并优化提示词。态交互,确保视觉一致性和指令遵循。(3)多模态超分辨率模块(MultimodalSupe全能生成器(Omni-Generator)的训练策略包含1)预训练:预训练利用大规模文图像/视频编辑,以及一系列用于语义理解的专业任务。通过让模型暴露于这种异构且信息丰富的数据中,有通过多轮偏好对齐训练,模型在视频生成质量上取得了显著改善,更符合人类意图。(4)模型加深度分析|媒体Ⅱ从模型训练的成本来看,视频数据获取、清洗和合成的成本),1.大语言模型模型名称条件千token输入(非音频)元/百万token缓存存储元/百万token/小时缓存命中(非音频)元/百万token输出元/百万tokendoubao-seed-2.1-pro输入长度[0,256]60.01730doubao-seed-code输入长度(128,256]2.80.0170.242.图片生成模型模型名称单价元/张doubao-seedream-5.0-lite0.22doubao-seedream-4.50.25doubao-seedream-4.00.23.视频生成模型模型名称输出分辨率输入条件元/百万token元/个(5s视频)doubao-seedance-2.0输出视频分辨率为480p,720p输入不含视频462.31/4.970.46/0.99输入包含视频282.53~5.62/5.44~12.101.99~4.42/4.28~9.50输出视频分辨率为1080p输入不含视频5112.392.48输入包含视频3113.56~30.13不支持输出视频分辨率为4k输入不含视频2625.275.05输入包含视频27.99~62.21不支持数据来源:火山引擎、广发证券发展研究中心深度分析|媒体Ⅱ略会更为灵活,主要以租赁第三方算力结合小部智谱营业成本智谱营业成本+研发费用MiniMax营0202220230深度分析|媒体Ⅱ视频广告制作、微短剧和AI漫剧等行业,不考虑未来可能渗透的更多场景和市场。根据DataEye、verifiedmarketresearch、thebusinessresearchcompany等机构测算计可渗透的市场在3666亿美元,预计到2030年增长至50单位:十亿美元20252026E2030E1电影、电视剧、动画等视频内容制作市场USDbn2792973832视频广告制作市场USDbn7175933微短剧USDbn4国内微短剧产业规模海外微短剧产业规模AI漫剧USDbnUSDbnUSDbn4195467国内漫剧市场规模USDbn135海外漫剧产业规模USDbna可渗透市场规模合计a=1+2+3+4USDbn367390501bAI模型渗透率合计电影、电视剧、动画等视频内容制作市场视频广告制作市场微短剧漫剧%0%0%40%2%0%6%7%55%16%5%50%60%90%cAI视频模型的收入规模合计(C=a*b)USDbn1.27.782.7电影、电视剧、动画等视频内容制作市场USDbn0.00.319.2视频广告制作市场USDbn0.64.546.4微短剧USDbn0.21.010.8漫剧USDbn0.52.06.3数据来源:DataEye、verifiedmarketresearch、thebusinessresearchcompany、广发证券发展研究中心目前AI视频模型对目标市场的渗透率仍较AI视频模型在不同行业的渗透率和渗透速度,因漫剧本身是AI催生的原作的普及率应该较高;微短剧目前也开始有大量的行业的产值应有较高比例的AI渗透;而视频广告市场,随着视频模型的能力提升,对广告公司制作降本增效带来更大的增益,视频广告制作市场应该也有较大的潜力被AI渗透。最后,考虑到传统影视工业对内容制作深度分析|媒体Ⅱ要求较高,生产链路较为负责,AI对传统影视内容创作的赋能和改造还需要一定时间,但这部分可触达的空间或决定了多模态的上限。我们预计整体AI视频模型的收入规模在2025、20型,仅需要简单的输入图片形象,给予生成指令,AI视频模型就制作出动态的视频展示效果,这在广告、电AI漫剧、微短剧转向纯AI生成带动了26年AI视频模型收入的爆发。25年下半年AI漫剧开始起量,Seedance2.0推出进一步推动了AI漫剧产出效果的提升。目前,更多真人微短剧也深度分析|媒体Ⅱ作视频提供工具。爱奇艺则针对影视团队和超级创作者提供了纳逗Pro剧、漫剧等不同品类的内容创作提供工具。这类平台基于自身创),人或小团队用于创作效率提高的场景,有较好的付费获取快速通道和积分,生成不同分辨率的视频消耗对多企业客户(B端)开始接入API使用视频模型。客户销售方式通常分类两类,一类是分销平台,类似于Higgsfield这些为创作者提供多模态生成工具的聚合模型平深度分析|媒体Ⅱ客户类型接入方式客户类型接入方式收费方式•个人用户•订阅会员+积分消耗•按Token消耗收费•按时长收费•APP/网站登录使用•超级创作者•直销:企业客户•分销:聚合平台C端Google、OpenAI、字节、阿里等平台型玩家,多模态是模型组合享有一定的分发渠道优势,同时豆包等2C产品也有多模态生成的需求,也深度分析|媒体Ⅱ市面上还有较多的聚合模型,例如Higgsf数据来源:www.magnific.co平台名称成立时间用户数ARR(USD)融资(USD)接入模型HiggsfieldAI2023成立,2025产品上线25M+200M(01.15路透2024.04.03-seed-8M2025.09.09-A-50M2026.01.15-A+-80M除Gen、Vidu、Pixverse外以上模型均有接入WaveSpeedAI20251M+10M(2025.10.28)2025.04.25-天使轮-数百万以上模型均有接入聚合GoogleFlow2025.05.20未披露未披露Google内部项目GoogleAI创作平台,整合Veo、Gemini等模型能力,并逐步引入Omni模型KreaAI202230M+未披露(8MARRclub)2023年初-seed-3M2023.06-A-33M2025.04-B-47M除Sora、Pixverse外以上模型均有接入Freepik(改名2010成立100M+接近1M订230M(2026.04.28)未披露除Vidu外以上模型均有接入Magnific)2022年开始AI转型阅用户API2024.09.18前-seed-9M(非官方)聚合Fal.ai20211.5M+未披露(400MARRclub)2024.09.18-A-14M除Gen以上模型均有接入平台2025.02.12-B-49M2025.07.31-C-125M深度分析|媒体ⅡRunware2023500M+未披露2025.09.09-seed-13M2026.01.29-A-50M以上模型均有接入数据来源:路透社,各平台官网、广发证券发展研究中心随着需求场景的扩充,未来定价可能会越来越两级价的匹配性能普通模型的套餐。针对B端越来越复平台包月套餐API收费套餐API单价即梦(Seedance)69元/199元/499元/4299元196元-2800元Seedance2.0系列:0.5元-5.4元/秒可灵Kling58元/234元/586元/1149元5千元/1.5万元/3万元/4.5万元/6万元可灵Kling3.0系列:0.6元-3元/秒HappyHorse70元/350元HappyHorse1.1:0.9元-1.1元/秒(无4K)海螺68元/245元/578元/1399元海螺2:0.3元-0.6元/秒(无4K)VEO4.99美元/19.99美元/99.99美元VEO3.1standard:0.4美元-0.6美元/秒数据来源:各平台官网、广发证券发展研究中心随着模型版本的迭代,更高参数/性能更高的模型普遍还是会比前代的定价更高。我们对比了可灵Kling和深度分析|媒体Ⅱ65432101.00.50.70.40.90.30.5体模型的OP利润率可以达到~10%。后续决定利润率的深度分析|媒体Ⅱ)(亿元人民币202420252026E2027E2028EARR4691收入3773Capex30累计摊销6306286研发人员成本68推理毛利润282246OP利润-21-33-23历了SoraApp等C端应用探来自Anthropic、Google等平台模型公司的竞争,关停Sora视为阶段性的战起步早,最新的ARR披露为9000万美元,在26年2月完成了3亿美元融资,投后估值达到53亿美元。深度分析|媒体Ⅱ美国withJointAudio-VideoVeo2-2024.12.16Veo3-2025.5.20Veo3.1-2025.10.15Gemini-native+Any-inpu/Autoregressive-to-Diffusion中国VideoJointGeneration+Seedance1.5pro-2025.AlibabaWan2.1-2025.01Wan2.2-2025.07Wan2.5-2025.12(9月Wan2.6-2025.12Wan2.7-2026.04forNativeAudio-Video/ViduAudio+Multi-shotConVidu1.5-2024.11.13ViduQ1-2025.0329ViduQ2-2025.09.25ViduQ3-2026.01.30VideoGeneration2023.08.07-天使轮-数千万元(数据来源:ARRClub、晚点、各

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论