GC基础使用教程 9_第1页
GC基础使用教程 9_第2页
GC基础使用教程 9_第3页
GC基础使用教程 9_第4页
GC基础使用教程 9_第5页
已阅读5页,还剩37页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

实训目标课前讨论(1)你在日常生活中接触过哪些可能是由AI生成或辅助生成的音频内容?(2)你认为AI生成音频内容的最大的社会价值和应用潜力在哪些方面?(3)你认为在AI生成音频的过程中,人类和AI各自扮演着怎样的角色?任务6.1AIGC音频处理技术介绍——定义AIGC音频处理技术

AIGC音频处理技术是利用AIGC使机器能够理解和生成符合人类感知与审美的音频的技术。它超越传统音频处理技术对已有信号的编辑与优化范畴,实现从无到有或基于特定条件的音频内容生成与创作。现代AIGC音频处理工具通常能够实现从高层语义指令到最终高质量波形输出的端到端合成,极大地简化传统复杂、分模块的处理流程

核心技术:内容生成导向、条件驱动生成、深度学习模型、端到端处理流程任务6.1AIGC音频处理技术的发展历程

AIGC音频处理技术的发展,是算法创新、数据积累和算力提升共同作用的结果,其发展历程大致可分为以下阶段。

(1)萌芽与规则驱动阶段(2000

年以前):早期语音合成主要采用基于波形拼接或参数合成的规则驱动方法,音乐生成则依赖于基于规则的算法,生成的声音往往机械、不自然,灵活性和表现力有限。

(2)统计模型与早期深度学习阶段(20001—2015

年):隐马尔可夫模型(HMM)等统计模型被引入参数化语音合成,以提高语音流畅度。随着深度学习的兴起,循环神经网络等开始被用于初步的旋律生成和简单的音频建模。

(3)神经声码器与WaveNet革命(2016—2019年):GoogleDeepMind首次直接使用深度自回归模型在原始音频波形层级建模,生成近乎人类水平的语音,证明深度学习在高质量音频生成上的巨大潜力。

(4)大规模预训练与多模态生成时代(2020年代至今):Transformer架构普及,大规模自监督预训练成为主流,特别是扩散模型在成功应用于图像生成后,迅速被应用于音频领域。同时,跨模态音频生成成为研究与应用热点,标志着

AIGC

音频处理进入高度智能化、创意化的新阶段。任务6.1AIGC音频处理技术的四大应用场景

AIGC音频处理技术的应用场景主要包括智能语音合成与交互、创意音频内容生产、媒体与娱乐产业革新、社会服务与无障碍应用等。

1.智能语音合成与交互:高质量语音合成、个性化语音克隆、交互式对话生成。

2.创意音频内容生产:音乐创作与编曲、音效与氛围声设计、个性化音频内容生成。

3.媒体与娱乐产业革新:用户生成内容、音频修复与增强、互动媒体与元宇宙。4.社会服务与无障碍应用:信息无障碍、教育辅助、医疗辅助探索。任务6.2使用大模型进行文本配音

假设你是一位学前教育专业的学生,现在要给同学们试讲古诗《登鹳雀楼》,你想利用AIGC工具制作一份古诗朗读音频,朗读内容为:“登鹳雀楼,王之涣。白日依山尽,黄河入海流。欲穷千里目,更上一层楼。”本节结合朗读内容和文本配音技术,创作朗读古诗的文本配音。

意义:文本配音的制作意义在于技术革新推动语音生成变革、大幅提升内容生成效率、扩展创意表达与个性化适配、促进信息无障碍传播等。(1)技术革新推动语音生成变革:传统语音合成技术存在语音生硬、韵律不自然等问题,基于大模型的文本配音技术可以

实现对音色、语调、节奏及情感的精细控制,显著提升语音的自然度与表现力。(2)大幅提升内容生成效率:在视频制作、课件开发、有声内容创作等领域,自动化文本配音可极大缩短制作周期,实现

低成本、高效率的语音内容产出,尤其适用于多语种、多风格、大批量的语音生成。(3)扩展创意表达与个性化适配:通过调整语音风格、情感倾向、语速等参数,生成式语音模型能够满足不同场景的听觉

表达需求,为虚拟角色、品牌形象、个性化助手等提供定制化声音解决方案。(4)促进信息无障碍传播:自动配音技术可快速将文字信息转化为语音,为视障群体、阅读障碍者及多任务处理场景提供

便利,具备显著的社会服务价值;

魔音工坊通过音频识别与生成技术,实现智能作曲、音效定制及一键生成个性化音乐,为教育、影视及广告等领域提供多场景语音合成与自动配音解决方案。魔音工坊构建完整的创作生态链,可应用于内容创作领域,如短视频创作者通过情感语音提升完播率、出版机构利用多人配音功能制作有声书、广告公司运用明星声库打造品牌专属音效、教育机构借助AI课件生成批量制作教学资源等。

技术特点:①文字转语音支持86种语言及方言,并提供800多种音色与1000多个风格模板;

②AI小魔文案可自动优化文本结构,视频云剪辑可实现音画同步打轴;

③API支持批量处理,满足日均十万级音频生成需求;

④支持网页端、移动端App、微信小程序三端数据实时同步。任务6.2魔音工坊文本配音工具——魔音工坊

核心技术:声音克隆算法、情感语音合成系统、高保真音频引擎任务6.2魔音工坊文本配音实训——魔音工坊

步骤一:打开魔音工坊官网,单击页面右上方的“登录”按钮,如图中的“1”所示。

步骤二:在自动弹出的魔音工坊登录页面中,选择“手机号登录”选项,如图中的“1”所示,切换到“手机号登录”选项卡。任务6.2魔音工坊文本配音实训——魔音工坊

步骤三:把手机号码输入“请输入手机号”文本框中,如图中的“1”所示。然后单击“获取验证码”按钮,如图中的“2”所示,等待手机收到验证码短信后,把验证码输入“请输入验证码”文本框中,如图中的“3”所示,最后单击页“登录”按钮,如图中的“4”所示。任务6.2魔音工坊文本配音实训——魔音工坊

步骤四:成功登录魔音工坊,可看到登录后的页面中将显示用户信息,如图中的“1”所示。选择“软件配音”选项,如图中的“2”所示,将自动跳转到“文案配音”页面,然后在文本框中输入配音的文本信息(最多可输入5000字),如图的“1”所示。任务6.2魔音工坊文本配音实训——魔音工坊

步骤五:输入配音的文本信息为“登鹳雀楼,王之涣。白日依山尽,黄河入海流。欲穷千里目,更上一层楼。”,如图中的“1”所示,单击“文案配音”页面左上方的“24K高清音质”按钮,如图中的“2”所示,即可完成对文本信息的配音。任务6.2魔音工坊文本配音实训——魔音工坊

步骤六:单击“魔小杰”播放器中的“

”按钮,如图中的“1”所示,可以重新播放文本配音。单击“文案配音”页面右上方的“配音下载”下拉按钮,如图中的“2”所示。任务6.2魔音工坊文本配音实训——魔音工坊

步骤七:在打开的下拉列表中选择“下载音频”选项,如图中的“1”所示。然后在打开的子菜单中选择音频格式,如图中的“1”所示,即可下载文本配音文件到本地硬盘上。魔音工坊提供“24K高清音质MP3”和“24K高清音质WAV(无损)”两种音频格式。任务6.2魔音工坊文本配音实训——魔音工坊

拓展:魔音工坊的文本配音功能相当强大,提供丰富、便捷的操作选项供用户使用,如图中的“1”所示。操作选项包括“局部变速”“多人配音”“局部变音”“停顿调节”“段落静音”“音效”“音量”配乐”等,可帮助用户快速将文本转换为高质量语音,如对文本设置“局部变速”“多人配音”,效果如图中的“2”所示,单击“魔小杰”播放器中的“

”按钮,即可完成文本配音。任务6.2魔音工坊文本配音实训——魔音工坊任务6.3使用大模型生成主题音乐

假设你是一位学生会的干部成员,学生会正在为举办“人工智能未来展望”讲座做宣传。你想利用AIGC工具为这场讲座制作一首主题音乐,为讲座助力宣传。本小节结合主题音乐创作技术,利用AIGC工具辅助进行主题音乐创作。

意义:基于大模型生成主题音乐,是指大模型根据用户提供的文本描述(如情绪、风格、场景、乐器等提示词),自主创作出具有相应主题性、结构性和情感表现力的原创音乐片段。其制作意义深远,具体包括以下几个方面。(1)技术突破实现音乐创作范式革新:传统算法音乐生成依赖于规则库与模板拼接,局限性明显。当前基于扩散模型、Transformer架构等的音乐大模型,通过对海量音乐数据中旋律、和声、节奏、音色等要素进行深度解构与学习,能够实现从语义理解到音乐符号“创造性翻译”,在保证音乐性的同时具备高度可控性。(2)极大降低专业音乐创作门槛:为影视、游戏、短视频等内容创作者提供高效、低成本的配乐解决方案。即使不具备系统乐理知识与作曲技能,用户也能通过自然语言描述快速获得适配其内容的原创音乐,极大地推动音乐创作民主化与普及化。(3)提升创意效率并激发灵感:在专业创作领域,AI可快速生成多个风格备选方案,作为灵感启发或创作基底,辅助作曲家进行扩展与细化,从而打破创作瓶颈,显著提升从构思到成品的全流程效率。(4)实现音乐精准定制与动态适配:模型能够根据极其具体、高细粒度的描述生成高度匹配的音乐,满足个性化营销、互动媒体、元宇宙等场景中对音乐元素的实时、动态生成需求。

任务6.3豆包生成主题音乐实训——豆包

步骤一:在浏览器中打开豆包,单击文本框下方的“更多”按钮,如图中的“1”所示。

步骤二:弹出菜单,如图中的“1”所示。选择“音乐生成”选项,如图中的“2”所示,自动跳转到“音乐生成”页面。任务6.3豆包生成主题音乐实训——豆包

步骤三:在“音乐生成”页面中,可看到豆包为主题音乐创作提供的音乐生成模板,包括主题、风格、情绪、音色4个参数供用户设置。主题的默认选项是“AI帮我写歌词”,风格的默认选项是“流行”,情绪的默认选项是“快乐”,音色的默认选项是“女声”,如图中的“1”所示。用户只需设置这4个参数即可完成主题音乐创作。任务6.3豆包生成主题音乐实训——豆包

步骤四:单击主题默认选项可弹出下拉列表,修改主题参数,如图中的“1”所示。该下拉列表中包括“AI帮我写歌词”“自定义歌词”两个选项。任务6.3豆包生成主题音乐实训——豆包

步骤五:在“音乐生成”页面中,单击风格默认选项,打开下拉列表,可修改风格参数,如图中的“1”所示,该下拉列表中包括“流行”“嘻哈”“国风”“DJ”“摇滚”“民谣”等选项。任务6.3豆包生成主题音乐实训——豆包

步骤六:在“音乐生成”页面中,单击情绪默认选项,打开下拉列表,可修改情绪参数,如图中的“1”所示,该下拉列表中包括“快乐”“放松”“活力”“兴奋”“忧郁”“鼓舞”等选项。任务6.3豆包生成主题音乐实训——豆包

步骤七:在“音乐生成”页面中,单击音色默认选项,打开下拉列表,可修改音色参数,如图中的“1”所示,该下拉列表中包括“男声”“女声”等选项。任务6.3豆包生成主题音乐实训——豆包

步骤八:本任务是制作一首主题音乐为“人工智能未来展望”讲座做宣传,设置音乐的主题、风格、情绪、音色4个参数,其中,主题参数为“AI帮我写歌词”,歌词要表达的主题为“人工智能未来展望”,风格参数为“国风”,情绪参数为“鼓舞”,音色参数为“男声”,如图中的“1”所示。设置完音乐的主题、风格、情绪、音色4个参数后,单击文本框右下方的“

”按钮,如图中的“2”所示,即可完成主题音乐创作。任务6.3豆包生成主题音乐实训——豆包

步骤九:本次创作的“人工智能未来展望”讲座主题音乐名称为“AI未来之光”,歌词如图中的“1”所示。调节好音量,单击页面中播放器的“”按钮即可播放音乐。

步骤十:单击播放器下方的“

”按钮,如图中的“2”所示,即可复制这首主题音乐的链接网址。把链接网址粘贴到浏览器的地址栏中,即可实现分享这首主题音乐,如图所示。任务6.3豆包生成主题音乐实训——豆包任务6.4应用大模型的音乐创作——DeepSeek+海绵音乐

假设你是数字媒体技术专业251班的宣传委员,你想利用AIGC工具创作一首班歌,为班级做宣传。本小节结合AIGC音乐创作技术,利用DeepSeek+海绵音乐辅助创作班歌。

意义:应用大模型的音乐创作,是指基于用户输入的主题、风格、情感等提示信息,大模型自主完成包括旋律、和声、节奏、配器乃至曲式结构的完整音乐作品生成。与语音合成不同,以大语言模型或音乐专属扩散模型为核心的技术路径,通过对音乐符号或音频信号的深度建模,实现对音乐内在逻辑的理解与创造性重构,使生成的作品具备良好的结构完整性与艺术感染力。

音乐创作大模型并不能取代人类作曲家,而是作为强大的协同创作者。它能突破人类创作者固有的风格惯性,快速生成超越传统范式的新颖音乐创意与组合,为专业创作者提供灵感,帮助专业创作者探索未知风格领域,实质性地拓展音乐创作的可能性空间。音乐创作大模型将部分标准化、模式化的作曲编配工作自动化,极大提升了音乐内容的批量化与个性化生产效率,降低了制作成本,其正在重塑从灵感、制作到发行的音乐产业价值链。音乐创作大模型极大降低了音乐创作的技术门槛,使更多人能够将创意转化为音乐作品,有效推动了大众音乐表达能力与审美能力提升。在音乐教育中,音乐创作大模型可作为实时分析、风格模仿与创作练习的智能辅助系统,加速学习进程。

步骤一:设计一份提示词,内容为“我是数字媒体技术专业251班的宣传委员,我想为班级创作一首歌,要求如下:歌词内容紧密围绕班级的数字媒体技术专业主题,能生动诠释主题内涵,并在歌词中要出现该主题;歌词语言优美、押韵,富有节奏感,易于传唱;从情感表达、意象塑造等多方面展现较高的创作水准。”

步骤二:打开DeepSeek官网,如图所示,选择“开始对话”选项,将会自动跳转到新的页面。任务6.4

DeepSeek+海绵音乐创作音乐实训任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤三:页面的文本框默认显示内容为“给

DeepSeek

发送消息”,该文本框即用户向DeepSeek输入提示词的文本框,如图所示。

步骤四:在文本框中输入步骤1中设计的提示词,如图中的“1”所示。单击文本框右下方的“

”按钮,如图中的“2”所示,即可完成歌词创作。任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤五:DeepSeek生成的歌词,如图所示。任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤六:把生成的歌词复制到文档中,可对歌词进行修改,如删除“第二段”内容,保留“第一段”和“尾声”内容,修改后的歌词如下。任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤七:在浏览器中打开海绵音乐官网,如图所示。

步骤八:单击页面左下方的“登录”按钮,如图中的“1”所示,自动弹出海绵音乐的登录页面。任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤九:在海绵音乐的登录页面,把手机号码输入“请输入手机号”文本框中,如图中的“1”所示,勾选“已阅读并同意《用户协议》和《隐私政策》”复选框,如图中的“2”所示。单击“获取验证码”按钮,如图中的“3”所示,等待手机收到验证码短信后,把验证码输入“验证码”文本框中,如图中的“4”所示,最后单击“登录”按钮,如图中的“5”所示,即可成功登录海绵音乐可看到页面左下方的“登录”按钮变成用户头像。任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤十:页面左下方的“登录”按钮变成用户头像,如图中的“1”所示。在页面左方选择“创作”选项,如图中的“2”所示,将会自动跳转到“AI写歌”页面。任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤十一:在“AI写歌”页面中选择“自定义写词”选项,如图中的“1”所示。将进入“自定义写词”选项卡,用户可在文本框中输入歌词,如图中的“1”所示任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤十二:在文本框中输入前文修改后的歌词,如图中的“1”所示。在歌词下方有音乐风格设置选项,海绵音乐提供曲风、心情、音色、人声4个风格设置参数,如图中的“2”所示。任务6.4

DeepSeek+海绵音乐创作音乐实训

步骤十三:本任务是为班级创作一首班歌,可参考图中的“1”设置歌曲的曲风、心情、音色、人声4个参数,其中,曲风参数为“流行”,心情参数为“鼓舞人心”,音色参数为“热情嗓”,人声参数为“男声”。

步骤十四:在音乐风格设

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论