版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第27课智能环境播报助手第六单元AI项目工坊义务教育信息科技课程资源
人工智能
第27课学习目标1了解人工智能在图像描述和语音生成领域的应用,掌握智能环境播报助手核心功能的实现方法。学习目标初步具备搭建简单人工智能辅助系统的能力,理解该系统在无障碍生活中的实际意义。2第27课课堂导入问题情境人工智能是如何帮助视障人士更好地感知周围环境的?计算机又是如何描述它“看”到的内容的?智能盲杖作为AI与辅助设备结合的典型应用,能够帮助视障人士感知周围环境,极大提升了他们的出行安全与独立性。第27课学习内容一
系统设计二
实现关键功能学习内容三
搭建系统一、系统设计第27课学习内容智能环境播报功能1.获取环境数据2.对图像内容进行识别、描述3.以语音形式将信息反馈给使用者智能环境播报系统的系统设计任务情境在日常生活中,视障人士常常难以获取周围环境中的信息,如身前是否有人、动物、障碍物等。借助人工智能技术,特别是图像识别、自然语言生成和语音生成技术,可以开发出智能播报环境的系统,帮助他们更好地理解和使用这些视觉信息。第27课学习内容一、系统设计任务分析要实现这一系统,首先需要获取用户拍摄的图像,然后通过图像识别技术提取其中的关键信息(如物体、场景、文字等),再将其转化为自然语言描述,最后生成播报语音。这一过程涉及图像获取、内容识别、语音生成等多个环节。第27课学习内容一、系统设计参考下图思考,要实现这一系统,需要怎样的工作过程?需要哪些软硬件?第27课学习内容一、系统设计第27课学习内容一、系统设计获取图像描述图像内容将描述转换为语音向使用者播报语音获取图像需要用到什么硬件设备?可使用摄像头(如手机摄像头)获取环境的图像。播报语音需要用到什么硬件设备?需使用扬声器或耳机。如何识别图像中的物体或场景?可使用模型识别图中的内容。如何将识别结果转化为语音?可利用语音生成技术。综合考虑各种因素,不同的硬件设备应按照哪种方式组织在一起协同工作?需选用高效网络协议进行数据传输。第27课学习内容打开配套资源中的《描述图像》软件,体验简易版的智能环境播报系统。1.选择一幅图像,然后单击“分析图像”按钮,生成描述图像的文字。2.单击“语音播报”按钮,根据描述文字生成语音并播放,然后单击“网页播放”按钮,把语音转换成Base64编码并保存在网页中等待播放。二、实现关键功能二、实现关键功能第27课学习内容大家可以试着修改一下模型和图像的路径,然后运行程序,看看程序能否正确描述图像展示的内容。#导入编程库importtorchfromtransformersimportAutoTokenizer,AutoModelfromPILimportImage#模型路径model_path="../models/ByteDance/Sa2VA-1B"#图像路径image_path="../data/img/002.jpg"#自动选择运算设备device='cuda'iftorch.cuda.is_available()else'cpu'#加载模型model=AutoModel.from_pretrained(model_path,trust_remote_code=True)#把模型加载到运算设备中model=model.to(device)#把模型设为推理模式model=model.eval()#加载分词器tokenizer=AutoTokenizer.from_pretrained(model_path,trust_remote_code=True)#设置输入信息inputs={'image':Image.open(image_path).convert('RGB’),'text':"<image>描述这张图片。",'tokenizer':tokenizer,}#模型推理answer=model.predict_forward(**inputs)["prediction"]#输出描述print(f'描述:{answer}')二、实现关键功能第27课学习内容大家可以打开配套资源中的代码,尝试理解代码的含义。#引入编程库importpyttsx3
#初始化引擎engine=pyttsx3.init()#设置语音速度engine.setProperty('rate',150)deftext_to_speech_bytes(text):#创建临时文件withtempfile.NamedTemporaryFile(suffix='.wav',delete=False)astemp_wav:temp_path=temp_
#将语音保存到临时文件中engine.save_to_file(text,temp_path)engine.runAndWait()#读取WAV文件withopen(temp_path,'rb')asf:wav_data=f.read()
#删除临时文件os.unlink(temp_path)returnwav_data二、实现关键功能第27课学习内容声音也可以保存为Base64编码,并保存到网页中,而不需要具体的音频文件。#引入库importbase64#把数据转换成Base64编码defto_base64(wav_data):base64_data=base64.b64encode(wav_data)returnbase64_data<audiocontrols><sourcesrc="data:audio/wav;base64,[Base64字符串]"type="audio/wav"></audio>大家还记得以前是如何把图像数据转换成Base64编码的吗?第27课学习内容三、搭建系统1.准备好所需的硬件,如便于携带的手机、作为服务器的计算机等。2.通过无线方式将设备接入局域网。3.打开配套资源中的image_caption.py程序,将其中的predict函数补充完整,实现根据图像生成描述文字的功能。4.打开gen_speech.py程序,将gen函数补充完整,实现依据文字生成语音的功能。第27课学习内容三、搭建系统5.打开gen_data.py程序,将to_base64函数补充完整,实现将音频转换成Base64编码的功能。6.运行server.py程序,启动服务器。7.用手机访问相应的网址,然后单击页面中的“智能探测”按钮,利用摄像头拍摄周边环境并传给服务器。服务器处理后,将语音反馈给手机,手机就会播报出来。第27课学习内容三、搭建系统image_caption.pygen_speech.pygen_data.pyserver.py
1.图像描述、语音生成等人工智能技术可以帮助视障人士更好地感知周围环境,极大提升了他们的出行安全与独立性。2.智能环境播报助手的系统设计可以分为“图像采集、数据传输、智能识别、信息反馈”四部分。3.在描述图像中,图像描述、文字转语音等关键功能的实现中,可以使用预训练模型来达到较好的效果。第27课课堂总结第27课拓展与提升可以选择合适的工具和模型来实现这些功能,如轻量级目标检测模型、深度摄像头、超声波传感器、语音播报
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 工地工人劳务用工协议 短期临时工务工简易范本
- 行为认知家庭治疗
- 外科术后低血压发生原因及护理
- icc导管在重症患者中的应用及护理
- FIDIC条款之计量与支付
- E3快递信息管理系统定制方案
- CATIAV5逆向工程车灯案例
- 公司销售部个人工作总结
- 2026四上数学易错题大单元课件
- CDMA无线网络语音业务的评估
- 2025北京初三一模物理汇编:热现象章节综合2(京改版)
- 业务工单管理办法
- 个体工商户登记申请书、提交材料规范、经营者变更登记承诺书
- 红外线治疗技术课件
- 化妆行业的法规和标准规范
- 人保财险车险合同范本
- 第六届“四川工匠杯”职业技能大赛(互联网营销赛项)理论参考试题库(含答案)
- 星级复评规范评分表星级饭店访查规范
- 《 大学生军事理论教程》全套教学课件
- 私人房屋装修安全免责协议书
- 自动控制原理 第3版 课件全套 陶洪峰 第1-8章 概论、控制系统数学模型-线性离散系统分析
评论
0/150
提交评论