版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
AI视频行业市场分析
1.技术路线
主流AI视频工具的技术情况
目前AI视频工具的底层模型主要基于扩散模型。基于GAN和VAE:
早期的文生视频,在给定文本描述的情况下自回归生成视频帧,仅限
于低分辨率、短距以及运动单一情况。基于Transformer:通过自我
注意机制拓宽了生成视频的性能,如VideoGPT、Cogvideo、Phenaki
等,其生成的视频画质清晰,且具备长视频生成能力,但对算力要求
高、生成速度慢。基于扩散模型:正向扩散过程系统地扰动数据中的
分布,通过学习反向扩散过程恢复数据的分布,以产生高度灵活且易
于计算的生成扩散模型。扩散模型在多样化、超现实和图像联想方面
取得成功,催生了一系列以此为底层架构的产品,如RunawayGen2>
SVD、Pikal.O等。
Al视频工具的核心功能布局
目前AI视频工具功能布局趋于完善,应用潜力强。主流工具如
RunawayGen2和StableVideoDiffusion均已推出文生视频、图生视
频的功能,画质清晰、连续性强,生成视频的时长均为4s左右,其
中Gen2最长支持视频至16s。近日新发布的Pikal.O和
MiracleVision4.0在此基础上带来更多应用落地,实现实时拓展画幅
和视频运镜等功能;导入更多视频风格,效果惊艳,生成的视频更具
真实感与动态性。
文生视频与图生视频:基于输入的文字或图像生成对应的视频。部分
工具可同时输入图像与文字,生成对应视频。视频生视频:输入一段
视频,通过输入prompt,生成各种风格的视频动画,包括动漫、科
幻、现实主义等风格。局部重绘:输入原视频,可通过涂抹或圈定需
要修改部分的内容并输入prompt,单独修改所涂抹或圈定的内容,
如使其运动或增添元素。
故事板:通过拍摄现实物体,实现另一形式的模型建立,如拍摄竖立
的书本和桌面,可生成相同排布的高楼大厦以及道路。3D合成:支
持物体从单一视角到多视角的转化,可以360度查看生成的模型,
例如输入平面的人物图,建立该人物的3D模型。视频拓展:将图片
拓展画幅的模式迁移到视频工具上,可以实时拖动边框,生成更大画
幅的视频,支持三种画幅比例。视频运镜:输入一段视频,可以实现
八种角度的视频拍摄,为影视创作带来更多可能性。
技术要点:数据、算力、算法
文生视频模型常采用两种训练方式训练,流程分为三步。文生视频一
般采取两种方式进行训练:从插入额外时间层的预训练图像进行训练
或从头开始训练。为获得视觉■文本能力,数据集中的图像和视频需
具备较大量级和对应的描述性文字。而出于计算限制和描述困难,视
频通常被分为固定长度、限于少数目标的孤立动作再进行训练。当前
主要存在三个不同的视频训练阶段:文本到图像预训练、低分辨率大
数据集上的视频预训练以及在更具有高分辨率的相对小数据集上进
行高分辨率视频的微调,过程对数据集的质量要求较高。
文生视频模型常在图像和视频数据集上训练,大都为千万以上量级。
各数据集官网显示,常用的文本■视频数据集如WebVid-10M由1070
万个文本■视频对组成,其中视频时长5.2万小时,;HowtolOOM包含
13600万个视频剪辑,包含特定的动作任务片段。为了弥补高质量视
频数据集数量的不足,必须结合使用图像和视频的训练数据,常用的
图像数据集有LAION-5B,包含58.5亿个CLIP过滤的图像■文本对
数据集,提供高分辨率突破、美学图片等子集,以达到内容控制和动
态质量的平衡。
2.模型实测
文生视频产品进展和不足
进展:产品功能更加丰富,图像质量更好,交互平台更加完善。技术
层面,Pikal.O和RunawayGen2都能生成更多风格内容,除文生视
频外,图生视频和视频生视频都陆续推出c功能层面,各家产品交互
界面编辑更加灵活,例如,Pika在新版本中提供了画布延展、局部
重绘、视频时长拓展等新功能,StableVideoDiffusion则支持
14frames和25frames可选帧数,并支持单秒内布帧量选择。平台层
面,RunawayGen2官网不断更新,增强用户交互体验,Pika的全新
官网即将上线,用户届时可以直接在除Discord以外的网页端进行内
容生成和编辑。
不足:视频时长仍较短,模型数据集质量和版权有待扩展,动作复杂
性和意义感还需加强。时长层面,RunawayGen2和Pikal.O等均能
将视频时长做至10s左右,但仍低于1分钟,大规模商用价值有待
释放。动作完成度层面,各厂商模型的画面美感已经大大提升,但动
作的连续性和意义性还不足,小幅度动作慢镜头仍然占据主导,长连
续动作生成能力是算法技术难点,未来还将继续突破。模型数据层面,
各模型亟需寻找图构造形和运动轨迹更加丰富的画面进行训练,需与
影视1商和媒体进行谈判,获取更多素材版权。
3.前景展望
文生视频的应用领域——影视内容
AI视频生成可提升影视制作效率和质量。生产端上,利用人脸合成、
视频分析、语音合成等,AI视频生成可以实现虚拟演员、智能剪辑、
自动配音等功能。画面帧之间的逻辑算法可以为剧本创作、场景设计
和特效制作提供更加便捷的可复制路径。观众端,AI视频能将传统
大厂具有的视效生成能力下方到小众影视制作,给观众的日常影视欣
赏带来更多参与感,观众端的智能推荐、互动评论、个性化定制可量
化性大大提升。生产端和观众端的互动上,通过观众文字反馈,钊作
者可以进一步将评论作为参数优化的参考,实现内容分析和质量控制。
短视频方面,AI视频能促进短视频便捷性和美感,带来传播力提升。
AI视频能够提升短视频平台的技术水平,如AI视频编码、图像处理、
语音合成等。AI视频能帮助创作者生产更多样化和个性化的短视频,
利用生成式对抗网络、迁移学习、风格控制等实现虚拟场景、虚拟角
色和内容推荐等。
文生视频的应用领域——游戏
文生视频是AIGC重要应用,将带来游戏行业增本增效和范式改变。
降本增效方面,脉脉高聘数据显示,AI技术己逐渐应用于游戏产业
的策划、美术、程序、运营等各个环节,74.95%的游戏行业从业者
已经在工作中不同程度的使用了AI工具,另有19.83%的人员正在主
动学习。根据IT时报报道,网易已经在语音生成、原闽生成、视频
动捕、模型生成等多个关键生产环节应用AI,部分效率提升幅度可
以达到90%以上。AI视频的新技术有望进一步提高生产效率。从体
验范式上看,根据Lightspeed报告,AI视频将有望加持生成类似人
类性格的智能NPC驱动的多人游戏体验、动态的游戏社交体验以及
超真实和身临其境的画面,使游戏从画质体验上升到情感体验、定制
化体验的更高级水平。
文生视频的应用领域——营销
AI视频生成将有效赋能营销行业六大板块。AI视频生成不仅能够对
广告、内容创作和流媒运营中的图文音画艺术创意提供支持,还能在
电子商务、客户管理服务和产品创新领域带来灵感动能,增强私域、
公域打法的灵活性、多样性,有效赋能产品店主和用户进行更高质量
的互动。
文生视频的应用领域——教育
“
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2027届山东省滨州市邹平双语学校九上化学期中学业水平测试模拟试题含解析
- 四川省宜宾市南溪区三中学2027届九上物理期末质量检测试题含解析
- 2027届贵州省铜仁伟才学校九上化学期中调研模拟试题含解析
- 阿里市重点中学2027届物理九上期末经典模拟试题含解析
- 社区庆中秋活动方案(二篇)
- 婚前财产赠与协议书官方版(5篇)
- 2027届新疆师大附中九年级化学第一学期期中复习检测模拟试题含解析
- 2027届河北省衡水市故城聚龙中学九年级物理第一学期期末考试模拟试题含解析
- 危重抢救相关考试题目与答案
- 开展三好一满意活动工作总结范文(四篇)
- 2026太仓市城市发展集团有限公司第一批公开招聘6人考试参考题库及答案详解
- 2026年山东将军开元纸业有限公司招聘(13人)笔试模拟试题及答案详解
- 2025年农信社不良资产处置岗招聘考试题库附答案
- 国有企业董事会决策事项清单管理制度
- 2026年全国高考1卷高考数学真题(教师版)
- A 证(企业主要负责人)考试题库
- 2026年高考英语真题完全解读(全国一卷)(试卷点评)
- 2026-2030中国航空光电吊舱行业研发创新策略及投资价值评估报告
- 2026云南中医药大学招聘第二批科研助理岗位工作人员(事业编制外)25人笔试参考题库及答案详解
- 2026年五四制小升初数学测试题及答案
- 体育与健康九年级人教版背越式跳高教案
评论
0/150
提交评论