人工智能通识基础(微课版)课件第8章 视频类AIGC应用_第1页
人工智能通识基础(微课版)课件第8章 视频类AIGC应用_第2页
人工智能通识基础(微课版)课件第8章 视频类AIGC应用_第3页
人工智能通识基础(微课版)课件第8章 视频类AIGC应用_第4页
人工智能通识基础(微课版)课件第8章 视频类AIGC应用_第5页
已阅读5页,还剩49页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第8章视频类AIGC应用目录2050601视频类AIGC工具介绍02视频类AIGC工具应用场景视频类AIGC技术正以颠覆性力量重塑视觉内容创作生态,推动从个人创意表达、知识科普到企业营销、影视前期制作的全场景视频生产力变革。本章系统解析视频类AIGC工具的核心分类与技术特性,聚焦文生视频、图生视频、数字人视频三大核心应用场景,深入拆解提示词设计逻辑、工具操作流程与人机协作要点。通过掌握工具特性与视频生成方法论,学习者将突破传统视频创作的技能壁垒与成本限制,高效调用AI能力解决多场景下的视频制作难题,为适应智能化视频内容生态奠定坚实基础。31.了解并熟悉主流视频类AIGC工具的功能特性、适用场景及核心差异。2.掌握文生视频、图生视频的提示词设计公式,以及视频生成后的编辑方法。3.掌握数字人视频制作的关键流程,包括角色创建、场景选择、脚本生成、音色与动作匹配,以及视频包装与导出操作。学习目标1.能根据视频创作任务特性评估并筛选匹配的视频类AIGC工具,提升数字化视频工具的高效应用能力。2.通过掌握视频生成的多样化形式与优化技巧,激发人机协作中的视觉创意表达,学会用AI拓展视频内容的创作边界,同时培养对生成视频的质量校验与细节优化能力。素养目标48.1视频类AIGC工具介绍58.1.1可灵6视频类AIGC工具是人工智能生成内容(AIGC)领域中的重要组成部分,它们基于深度学习技术,尤其是生成对抗网络(GANs)、变分自编码器(VAEs)、扩散模型和Transformer等生成模型,结合时间序列建模技术,能够自动生成视频内容。目前典型的AIGC工具包括可灵、堆友、即梦、有言、讯飞智作、百度曦灵等。可灵是一款功能强大的视频类AIGC工具,由快手大模型团队基于其在视频技术方面的多年积累自研打造的视频生成大模型,其核心特色在于能够将文本描述直接转化为视频内容,或者根据图像生成视频,同时具备视频续写、运镜控制、首尾帧等多个能力。可灵的视频生成质量高,画面流畅自然,适用于多种视频创作场景。可灵大模型生成的视频分辨率高达1080p,时长最高可达2分钟(帧率30fps),且支持自由的宽高比,这使得可灵在影视创作、广告生成等方面具有广泛应用。8.1.2堆友7堆友是阿里巴巴旗下的一款注重社交互动的视频类AIGC工具,它集AI视频生成、AI动画制作与创意社交社区于一体,允许用户基于平台提供的丰富素材库,结合个人创意,快速生成短视频。堆友内置多种视频模板和特效,用户无需专业视频编辑技能,也能轻松制作出吸引眼球的视频作品。堆友突出社交互动特性,支持用户间的视频分享和互动评论,形成了一个活跃的短视频创作与分享社区,这也是与其他单一视频类AIGC工具最大的区别。用户生成的所有视频都可以一键发布到队友的社区中,形成一个不断更新的视频流,类似于抖音的发现页,其他用户可以对这些AI视频进行点赞、评论和收藏,形成了一个基于AI创作内容的互动闭环。同时还可以对别人的视频进行“合创”,即在原视频的基础上,利用AI进行续写、扩展或者风格转换,增强了社区的互动性和趣味性。8.1.3其他8除了可灵和堆友两款视频生成工具,还有很多视频类AIGC工具可供选择,如表所示。工具名称核心功能简介典型应用场景即梦支持文本、图片生成视频,首创首尾帧控制技术,可生成带运镜特效的4K动态短片;提供局部重绘、一键扩图、消除笔等工具,支持多图层精细调整;上传人物照片即可生成“会说话”的视频,支持多种语言。自媒体内容创作、知识科普与教学、广告和影视前期制作。有言支持千款3D数字人定制和500+电影级场景库,输入文本即可生成包含数字人、场景、运镜的完整视频,内置字幕模板、背景音乐和特效,支持品牌元素自定义;可根据脚本自动设计全景、中景、特写等镜头组合,支持手动调整景别、视角和节奏。企业营销与品牌宣传、教育与健康科普、金融。讯飞智作侧重AI音频生成与克隆;输入文本或录音即可生成带虚拟人播报的视频,支持音量、语速、语调精细化调节;结合星火大模型实现语音识别、语义理解和视觉合成,可生成包含动态字幕、背景音乐的完整视频。新闻与媒体传播、企业内部培训。百度曦灵支持2D高清人像克隆、3D超写实数字人创建,并集成直播、视频制作、对话交互功能;可一键搭建虚拟直播间,支持实时商品讲解、互动问答和7×24小时不间断直播;预装金融、医疗等领域知识库,数字人可提供专业问答(如理财推荐、用药指导)。电商直播与销售转化、金融与医疗服务、文旅与品牌IP孵化。8.1.3其他9四款工具通过技术差异化满足了从个人创作者到大型企业的多层次需求,用户可根据内容形式、行业属性和预算灵活选择。比如作为个人或小团队,想快速做一个有数字人出镜的讲解类、知识类视频可选择吉梦;作为营销/运营人员,需要批量生产营销推广、带货短视频可选择有言;需要为视频配上顶级质量的旁白解说,或者有声音克隆的特殊需求则推荐讯飞智作;作为企业,想要打造一个能直播、能互动的虚拟员工或虚拟IP进行长期运营则可以使用百度精灵。8.2视频类AIGC工具应用场景108.2.1文生视频11文生视频指的是输入一段文字,大模型根据文本表达生成视频,将文字转变为视频画面。即梦大模型文生视频支持生成5s或10s的视频,支持21:9、16:9、4:3、1:1、3:4和9:16多种画幅比例,可选择720P或1080P两种分辨率,更多元满足大家的视频创作需求,如下图所示。8.2.1文生视频12提示词作为文生视频大模型最主要的交互语言,将直接决定了模型返回的视频内容,因此,如何使用有效提示词来完成AI视频创作是每个创作者都希望了解和学习的,建议的提示词公式如下。提示词=主体(主体描述)+运动+场景(场景描述)+(镜头语言+光影+氛围)以上括号里的内容可选填。主体:主体是视频中的主要表现对象,是画面主题的重要体现者。如人、动物、植物,以及物体等。主体描述:对主体外貌细节和肢体姿态等的描述,可通过多个短句进行列举如运动表现、发型发色、服饰穿搭、五官形态、肢体姿态等。主体运动:对主体运动状态的描述,包括静止和运动等,运动状态不宜过于复杂,符合5s视频内可以展现的画面即可。场景:场景是主体所处的环境,包括前景、背景等。场景描述:对主体所处环境的细节描述,可通过多个短句进行列举,但不宜过多,符合5s视频内可以展现的画面即可。如室内场景、室外场景、自然场景等。镜头语言:是指通过镜头的各种应用以及镜头之间的衔接和切换来传达故事信息,并创造出特定的视觉效果和情感氛围。如超大远景拍摄,背景虚化、特写、长焦镜头拍摄、地面拍摄、顶部拍摄、航拍、景深等,这里需与运镜控制作区分。光影:光影是赋予摄影作品灵魂的关键元素,光影的运用可以使照片更具深度,更具情感,我们可以通过光影创造出富有层次感和情感表达力的作品。如氛围光照、晨光、夕阳、光影、丁达尔效应、灯光等。氛围:对预期视频画面的氛围描述。如热闹的场景、电影级调色、温馨美好等。8.2.1文生视频13以上公式最核心的构成就是主体、运动和场景,这也是描述一个视频画面最简单、最基本的单元。当我们希望更细节地描述主体与场景时,需要通过列举多个描述词短句,保持提示词中希望出现要素的完整性即可,可灵大模型会根据用户的表达进行提示词扩写,生成符合预期的视频。8.2.1文生视频14下面使用即梦进行文生视频。(1)打开即梦AI网站登录账号,点击“视频生成”功能,直接输入提示词“镜头拉远,近景,拍摄,柔和光,线下跳舞的狐狸,背景是茂密的森林草地,狐狸四肢轻盈摆动,尾巴随着节奏摇晃,绿色植物在微风中轻轻晃动,画面,生动,自然”,单击“向上的箭头”生成按钮。8.2.1文生视频15(2)生成后的视频在“生成”功能区,如图所示,可点击播放按钮播放预览,也可下载或收藏。8.2.1文生视频16(3)点击生成的视频,可进入视频编辑页面,如图所示。编辑页面有“对口型”“AI音效”“补帧”“提升分辨率”“AI配乐”等功能。8.2.1文生视频17(4)点击“AI音效”,将为视频重新生成3种不同音效,用户可通过试听不同音效,选择适合音效的视频,如图所示。8.2.1文生视频18(5)点击“AI配乐”,将再次生成具有3种不同配乐的视频,如图所示。选择合适的视频,点击下载,即可将mp4格式的视频下载到本地。8.2.2图生视频19图生视频指的是输入一张图片,大模型根据图片理解生成5s或10s视频,将图片转变为视频画面;或者输入一张图片加文本描述,大模型根据文本表达将图片生成一段视频。图生视频是当前创作者使用频率最高的功能,这是因为从视频创作角度来看,图生视频更可控,创作者可以用提前生成好的图片进行动态视频生成,极大降低了专业视频的创作成本与门槛;而从视频创意角度来看,即梦为大家提供了另外一种创意平台,用户可以通过文本来控制图片中的主体进行运动,如最近网上爆火的“老照片复活”“与小时候的自己拥抱”,以及被网友调侃为吃菌子幻觉视频的“蘑菇变企鹅”等,体现出视频生成工具作为一个创意工具的属性,给用户的创意实现提供了无限可能。8.2.2图生视频20对图像视频来说,控制图像中的主体运动是核心,故而可供参考的提示词公式如下。提示词=主体+运动,背景+运动……主体:画面中的人物、动物、物体等主体。运动:指目标主体希望实现的运动轨迹。背景:画面中的背景。以上公式最核心的构成是主体和运动,与文生视频不同,图生视频已经有了场景,因此只需要描述图像中的主体与希望主体实现的运动,如果涉及多个主体的多个运动,依次列举即可,视频生成大模型会根据我们的表达与对图像画面的理解生成符合预期的视频。如果想要“让画中的蒙娜丽莎戴上墨镜”,当我们只输入“戴墨镜”时,模型较难理解指令,因此更可能通过自己的判断进行视频生成,当大模型判断这是一幅画时,会更可能生成具有运镜的效果的画幅展览,这也是照片类的图片容易生成静止不动视频的原因。因此,我们需要通过描述“主体+运动”来让模型理解指令,如“蒙娜丽莎用手戴上墨镜”。8.2.2图生视频--1.单图生视频21(1)打开即梦AI网站登录账号,点击“视频生成”功能,直接输入提示词“蒙娜丽莎用手戴上墨镜”,如图所示。鼠标点击“+首帧”上传“蒙娜丽莎。jpg”,点击“向上的箭头”,生成视频。8.2.2图生视频--1.单图生视频22(2)视频生成后在“生成”模块中,可进行播放预览,查看视频生成的效果。8.2.2图生视频--1.单图生视频23(3)点击生成的视频,进入视频编辑页面,点击“AI配乐”,选择“自定义AI配乐”,即提供了多种场景、情感、流派、乐器的配乐选项供用户选择。8.2.2图生视频--1.单图生视频24(4)选择“情感”中的“快乐”,点击右下角视频生成按钮,重新生成具备AI配乐的视频。(5)选择合适的视频,点击下载,即可将mp4格式的视频下载到本地。8.2.2图生视频--2.首尾帧生成视频25首尾帧功能,即上传两张图片,模型将这两张图片作为首帧和尾帧生成视频,通过上传首帧图片与尾帧图片,添加文字描述,生成视频进行体验。首尾帧功能可以实现对视频的更精细控制,现阶段主要应用于视频创作中对首帧尾帧有控制要求的视频生成,能够较好实现预期生成视频的动态过渡,但需要注意的是,首帧尾帧视频内容需要尽量相似,如果差别较大会引起镜头切换。8.2.2图生视频--2.首尾帧生成视频26下面使用“猫咪玩雪”首尾帧素材生成视频。(1)点击“+首帧”按钮,上传“猫咪玩雪-首帧。png”文件。再点击“+尾帧”,上传“猫咪玩雪-尾帧。png”,如图所示。8.2.2图生视频--2.首尾帧生成视频27(2)点击生成视频按钮,生成的视频出现在“生成”模块。点击视频右上角的“下载”按钮,可下载mp4格式视频文件到本地,如图所示。8.2.3数字人-1.即梦数字人功能28即梦数字人功能,支持上传真人/动漫人物图片,上传本地配音/歌唱文件,或者通过文本朗读功能在线生成配音,即梦就能让你的视频人物口型和音频完美同步,仿佛真人在说话/唱歌,视频瞬间栩栩如生!下面用案例对即梦数字人功能进行介绍。(1)在即梦网站首页点击“灵感”按钮,在“开启你的”后面选择“数字人”。点击“+角色”按钮,在这里上传真人或者动漫图片,上传“动漫女生。jpg”素材,如图所示。8.2.3数字人-1.即梦数字人功能29(2)选择“音频”按钮,用户可以选择即梦自带的“生成音频”,也可以使用自己录制的音频进行上传。我们选择“生成音频”,如图所示。8.2.3数字人-1.即梦数字人功能30(3)在“生成音频”弹出的“文本朗读”界面,输入用户希望AI生成的朗读文本内容,在输入框中输入“嗨!这里是人工智能导论课堂!准备好了吗?让我们一起快乐学习,玩转AI!”。即提供创建“我的音色”功能,需要用户上传自己的音频生成自己的音色。根据用户配音的场景和效果,有多种内置的音色可供选择。本案例中使用的角色为动漫少女,文本内容较为活泼,故选择“活泼女孩”音色,同时在音色右边可以调节语速为1.2倍,设置完成后点击“确认”,如图所示。8.2.3数字人-1.即梦数字人功能31(4)点击“向上的箭头”生成视频,生成的视频出现在“生成”模块。点击视频右上角的“下载”按钮,可下载mp4格式视频文件到本地,如图所示。8.2.3数字人-2.有言3D数字人32有言3D数字人中可以选择不同性别、种族和风格的3D数字人,还可以在3D世界实现“女娲造人”,任意打扮3D数字人;用户可以根据不同主题和风格任意搭配的3D人物和场景,一键生成多角度和景别的3D运镜画面;能对生成的3D内容进行自定义编辑,无论是镜头运镜、人物动作、语音语调,还是表情神态,都可以根据需求灵活调整,精准呈现想要表达的内容。下面以有言3D数字人生成进行案例介绍。(1)打开有言3D数字人AI视频生成平台网站并登录账号,点击网页右上角“AI创作”按钮,进入创作编辑页面。8.2.3数字人-2.有言3D数字人33(2)有言3D数字人AI创作提供了四种创作模式,包括“从零开始创作”“从模板开始创作”“从AI脚本创作”和“从PPT开始创作”。选择“从零开始创作”,有“横屏”与“竖屏”两种视频模式,用户可以根据需求选择,本案例采用“竖屏”模式,如图所示。8.2.3数字人-2.有言3D数字人34(3)进入AI生成编辑界面,左上角可以修改案例名称为“人工智能导论课程简介”,如图所示。8.2.3数字人-2.有言3D数字人35(4)单击“场景”按钮,根据课程简介的背景需求,选择适宜的场景作为3D数字人讲解的背景。有言的场景库中提供了多种场景供用户选择,包括“室内坐姿”“室内站姿”“户外站姿”“直播坐姿”等。选择“室内站姿”,“更多”选项卡中,找到“太空实验站”场景,单击使用该场景,如图所示。8.2.3数字人-2.有言3D数字人36(5)单击“人物”按钮,进入“人物库”选择合适的3D数字人物。截至目前,有言人物库中提供了2396个3D数字人物可供用户选择,可选择适合视频风格的人物。本案例选择3D数字人“新念”,如图所示。8.2.3数字人-2.有言3D数字人37(6)选择人物后,回到“AI生成”编辑页面,单击人物角色右上角的编辑按钮,可进入人物编辑页面。有言提供了对3D数字人套装、发型、配饰、妆容、面容等细节进行设置的功能,可以说涵盖了“捏人”的细节操作。人物编辑完成后,点击右上角“保存”按钮,再单击左上角“返回”按钮,返回AI生成编辑页面,如图所示。图

8‑20人物编辑-套装8.2.3数字人-2.有言3D数字人38图

8‑21人物编辑-发型8.2.3数字人-2.有言3D数字人39图

8‑22人物编辑-妆容8.2.3数字人-2.有言3D数字人40图

8‑23人物编辑-面容8.2.3数字人-2.有言3D数字人41(7)选择“音色”按钮,弹出“音色&动作风格”选择框,如图所示。有言提供了多种音色和人物动作风格供选择。8.2.3数字人-2.有言3D数字人42(8)单击“筛选”按钮,可以直接通过性别、语种、风格、应用场景对音色、动作风格进行筛选。本案例选择性别“女”,语种选择“中文”,风格选择“积极活力”,应用场景选择“教育教学”,如图所示。8.2.3数字人-2.有言3D数字人43(9)音色筛选结果得到“俏皮学妹”,单击“播放”按钮可对音色进行试听,试听后可调节“音量”“语速”“语调”的设置。选择“活泼1”的动作风格,单击“应用”,如图所示。8.2.3数字人-2.有言3D数字人44(10)在脚本输入框左上角点击“AI帮我写”按钮,弹出“AI帮我写”窗口,输入“帮我生成式人工智能导论课程的欢迎词”,点击发送按钮。8.2.3数字人-2.有言3D数字人45(11)AI生成文字内容后,点击“保存并应用”,脚本输入框呈现AI生成的文字内容,用户需审核AI生成的内容再进行操作,如图所示。8.2.3数字人-2.有言3D数字人46(12)点击输入框右下角的“试听”按钮,可试听当前文本的语音效果,如图所示。8.2.3数字人-2.有言

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论