阿里云AI原生应用开发实战营-AI Agent 专场(上海)_第1页
阿里云AI原生应用开发实战营-AI Agent 专场(上海)_第2页
阿里云AI原生应用开发实战营-AI Agent 专场(上海)_第3页
阿里云AI原生应用开发实战营-AI Agent 专场(上海)_第4页
阿里云AI原生应用开发实战营-AI Agent 专场(上海)_第5页
已阅读5页,还剩187页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

副标题-微软雅黑40磅|内容描述内容描述内容描述AI原生应用开发最佳实践从企业级生产痛点到解决方案探索江昱阿里云产品经理2025/12/12阿里云产品经理阿里云Serverless产品专家,云计算领域博士(主要研究方向为Serverless架构)畅销书《Serverless架构》《Serverless工程实践》《Serverless架构下的AI应用开发》《Serverless架构下的前端应用开发》作者;参编《基于服务器无繁殖架构的工具链技术能力要求》等标准CNCFSandbox项目ServerlessDevs发起人;阿里云FunctionAI产品负责人01破局之前,先看清这些"坑"了解现状,直面行业挑战02为AI而进化的基础设施函数计算FC全新升级,提供模型服务、多模态创作、AgentRun三大核心能力03让你专注创新,基础设施交给我们高性能高安全开箱即用,轻量灵活极致弹性,最小成本享受AI时代红利04案例场景与最佳实践FunctionQ案例/A2A协议/Devpod/Model2API01破局之前,先看清这些"坑"了解现状,直面行业挑战 一行代码把模型变成可用的API?零代码搭建一个AI助手/Agent?用过这些AI能力的朋友,你们觉 或者说,你们在AI落地时卡在哪一步了?是否调用过AI模型APIOpenAIA2023年/数字中国建设整体布局规划全球人工智能市场规模数据AIAgent平台AIAIAgent平台AIAgent之间自行交互UniversalAgentsPlatform-LevelAgents功能简单,灵活性低Prompt直给Smartermodelsusingmoretoolstoaccomplishhighervaluetasks多模态模型功能复杂,功能复杂,ReAct推理快速构建,统一管理Single-Single-PurposeAgentsAI观测AI观测开发/学习门槛过高各种技术发展迭代迅速“学不过来了”成为普遍共识快速验证思路和迭代项目成挑战部署运维复杂度高同步异步转换复杂GPU集群高可用挑战敏捷开发迭代成瓶颈AI应用安全备受挑战海量LLM匿名暴露流量攻击成本高度不对称内容安全管控成行业共识生态能力割裂/锁定严重LLM规范不同,治理困难工具与LLM联动不畅优秀资源如何聚合成痛点资源成本高昂/利用率低GPU资源资源不足,成本更高流量波峰波谷浪费更重资源利用率对成本更为敏感1业务高峰期API突然限流封号流量上来就触发限流,严重时账号直接被封,用户请求积压,业务被迫中断1业务高峰期API突然限流封号流量上来就触发限流,严重时账号直接被封,用户请求积压,业务被迫中断4自建降本却抢不到GPU资源想省API费用自己部署模型,结果高峰期算力被占满用户排队,临时扩容采购周期长预算也吓人2批量生成内容效果全靠抽卡同样prompt生成十次九不同,商品图、营销视频质量飘忽不定,必须人工筛选才能用5企业知识问答怕数据泄露调用外部API担心敏感数据出域泄露,想基于自己知识库搭建专属问答,但不知道怎么落地实施3Agent出错不知道哪里要改客服助手回答质量不理想,缺少评估工具和测试集,不知道是prompt问题还是工具调用有bug6智能助手经常答错或瞎编客户问答、文档助手频繁出现幻觉瞎编答案,用户投诉率居高不下,试了各种方法还是没法根治函数计算FC全新升级,提供模型服务、多模态创作、AgentRun三大核心能力模型服务企业Agent平台阿里云百炼魔搭社区模型服务企业Agent平台阿里云百炼魔搭社区高代码低代码模型市场高代码低代码模型市场AgentScopeLangchainLlamaIndexFlowAgentScopeLangchainLlamaIndexFlow模式AI自动生成快速创建模式API&SDK开源托管代理可观测运行时浏览器代码解释器身份凭证异步通信存储记忆SLS/ARMS/云监控API&SDK开源托管代理可观测运行时浏览器代码解释器身份凭证异步通信存储记忆SLS/ARMS/云监控文生图/声音/视频ComfyUIVoice开源模型一键部署,AI模型一键Serverless化,云端模型开发部署零门槛按量付费,降低成本免运维/低运维百万级实例规模*与ComfyUI/SD按量付费,降低成本免运维/低运维百万级实例规模*与ComfyUI/SD自然语言处理语音计算机视觉计算科学多模态模型服务享受PaaS自由度的同时获得SaaS便捷性,按调用量付费,模型部署成本降低90%100+热门模型在线体验100+热门模型在线体验200+模型一键部署6+模型框架一键托管6+模型框架一键托管与Agent服务一键集成DevpodDevpod模型在线开发/构建按量付费CPU+GPU集群函数计算-函数计算-ServerlessGPU*毫秒级弹性和百万规模集群紧针对部分模型的测试结果,并不代表全部模型都可以具备该能力多模态内容生成引擎,AI创作零门槛业务场景业务场景辅助设计游戏渲染营销物料辅助设计游戏渲染营销物料教育培训教育培训产品能力产品能力核心功能基础功能ComfyUIComfyUI托管StableStableDiffusion托管Midjourney合作模型广场工作流广场模型广场工作流广场ServerlessAPI文件管理实例登陆访问管理文件管理实例登陆访问管理异步调用应用监控弹性配置基础设施函数计算FC03让你专注创新,基础设施交给我们高性能高安全开箱即用,轻量灵活极致弹性,最小成本享受AI时代红利静态资源分配静态资源分配无弹性或分钟级弹性状态管理复杂状态管理复杂复杂,跨节点迁移几乎不可行持快照或会话管理,自带3AZ容灾持快照或会话管理,自带3AZ容灾从传统架构到AI原生架构Agent从Serverless架构到AI原生架构API驱动依赖网关/MQ实现同步和异步调API驱动依赖网关/MQ实现同步和异步调用或,微服务架构协作复杂度高事件驱动架构原子化解耦,协作更容易免运维运维负担沉重免运维运维负担沉重安全隔离的多语言运行环境,安全隔离的多语言运行环境,VM/容器运行时AI时代需求Serverless运行时50+50+Python/Node/Java/PHP/Go/.NET等行时和自定义镜像,便于灵活定制异构算力ServerlessAI运行时生态集成智能体Agent模型服务智能体Agent模型服务0不使用不计费按请求调度,毫/秒计费,低峰自动缩00不使用不计费按请求调度,毫/秒计费,低峰自动缩0Qwen,DeepSeek,etc.ComfyUI,SD,etc.低代码编排、高代码编码MCP&SandboxJava8~21…规格粒度规格粒度最小规格:FC0.05C128MB,Web函数任务函数Web函数任务函数产品集成,事件驱动云产品Serverless产品集成,事件驱动云产品Serverless化安全隔离,自动容灾沙箱容器2.0快速交付,极致弹性资源池化2.0高密部署,主动调度第四代神龙架构CPU算力(x86)XPU算力CPU算力(x86)XPU算力轻量灵活、安全隔离、极致弹性、精益成本的Se轻量化的函数管理&Session亲和与安轻量化的函数管理&Session亲和与安AgentRun::RuntimeAgentRun::SandboxAgentAgentToolsToolsComputerComputerServerless冷启动加速Serverless运行时隔离存储隔离会话亲和内置多语言执行引擎细粒度资源毫秒级弹性轻量化函数运行时隔离存储隔离会话亲和内置多语言执行引擎细粒度资源毫秒级弹性轻量化函数ServerlessServerless弹性效率基于内存快照技术实现业务真实负载的忙闲时自动切换请求感知调度,毫秒级CPU实例&秒级GPU算力解耦&1/N切分GPU算力GPU算力xPU算力CPU算力平均TCO连续三次入围《ForresterWavem:ServerlessDevelopme连续三次入围《ForresterWavem:ServerlessDevelopme亚太区第一,全球前三Serverless降本提效分从开源托管到开源贡献,让每个人可以最小成本享受AI时代红利AgentRunSDK快速构建高可用,低时延,零运维的AIAgentAgentRunSDK快速构建高可用,低时延,零运维的AIAgentAgentRun垂类模型加持,让你的AI工具更智能模型服务CLOUDNATIVELANDSCAPE/serverless-devs文生图生图/文生视频LORA模型训练企业级serverlessAPI调用高性价比的GPU弹性算力;支持一键将自动弹性扩容,内置队列,支持异步调用AgentRun案例:AICoding企业级一站式AIAgent基础设施平台卢令(赵庆杰)阿里云高级技术专家2025/12/1201AgentRun概览AgentRun的架构与功能概览图02开发实践—AIOps智能诊断带客户进入AgentRun具体的案例实践开发未来AgentRun的规划方向函数计算AgentRun:AgenticAI应用基础设施函数计算为AgenticAI应用提供开箱即用的开发、部署与运维服务开发部署开发部署运维流量模型运行时租户数据隔离Sandbox会话小参数大语言模型工具运行时领域模型Agent易受注入攻击毫秒级弹性执行任务与拓展功能安全隔离不可预测思考与规划行动亲和流量模型运行时租户数据隔离Sandbox会话小参数大语言模型工具运行时领域模型Agent易受注入攻击毫秒级弹性执行任务与拓展功能安全隔离不可预测思考与规划行动亲和模型代理MCP代理Agent代理注册发现AI可观测AI全栈监控端到端链路追踪成本与质量评估低代码高代码APIAgentScopeA2A协议AgentScope模型管理模型管理Agent运行时02开发实践—AIOps智能诊断项目实践—背景机器负载过高机器组件故障机型不匹配机器负载过高机器组件故障机型不匹配物理机故障传统协议改造成本高没有有效的总结和处理性能问题实例重启性能问题实例重启初始架构报警触发报警触发手动触发手动触发获取数据下钻分析生成报告获取数据下钻分析生成报告客户触发客户触发库,获取信息Agent接收指令后,进行思考推理,并生成步骤:ToDoList,每一个步骤,可以使用已经安装的工具(MCP)调用,以及sandbox::浏览器等能力去获取所需的信息,当执沙箱也是非常好用的工具,特别是在文章中有链接但没有具体信息的场景下,通过浏览器沙箱获取到网页内容,并且可以并发执行,相互不影响,用完后删除。但是要依赖强Agent接收指令后,进行思考推理,并生成步骤:ToDoList,每一个步骤,可以使用已经安装的工具(MCP)调用,以及sandbox::浏览器等能力去获取所需的信息,当执沙箱也是非常好用的工具,特别是在文章中有链接但没有具体信息的场景下,通过浏览器沙箱获取到网页内容,并且可以并发执行,相互不影响,用完后删除。但是要依赖强并行Task2Context输入问题用户返回Agent输入问题用户返回并行Task3Task节点AgentastoolContextContext主AgentTask节点Task节点基于DAG的每一个节点会独立完成一个任务,这个任务Agent之间共享上下文信息,从而完成独立的一项任务,基于DAG的每一个节点会独立完成一个任务,这个任务Agent之间共享上下文信息,从而完成独立的一项任务,Agents模式解决了上下文过大问题,整体方案借助了静态工作流与A2A的方案优势,从而完成目标工作。 Context Context AgentAgent Context Context Context AgentAgent ContextContext高速缓存无损上下线并发控制Session亲和高速缓存无损上下线并发控制Session亲和负载均衡模型评估监控告警Token模型评估监控告警Token数统计CICD流程任务管理单点登录成本管理运维管控质运维管控质量评估压测全链路监控Tracing压测全链路监控Tracing存储管理权限管理环境管理快速开发一键启动快速部署Sandbox凭证管理一键启动快速部署Sandbox凭证管理运行时模型部署AICoding低代码脚手架转高代码做出雏形应用高代码沉浸式编程低代码脚手架转高代码做出雏形应用AIAgentServerless弹性、按量、免运维会话、请求、实例多种隔离机制Serverless弹性、按量、免运维创建Agent使用创建Agent开发者用户企业级能力加持效果评估Agent企业级能力加持效果评估Agent持续进化Tool监控、日志、链路追踪会话管理—会话亲和&隔离会话亲和会话隔离AgentRunSDK快速构建高可用,低时延,零运维的AIAgent开发者工具(开源+拥抱开源)AgentScopeAgentRunSDK快速构建高可用,低时延,零运维的AIAgent开发者工具(开源+拥抱开源)Infra拥抱开源一键托管,绑定VPC/IDC资源,企业数据不出域AgentRun服务(拥抱开源)CLOUDNATIVELANDSCAPE/serverless-devs情景记忆对话记录存储语义记忆知识库存储技能记忆参数形式记忆快速集成AgentRunPHP/Go/.NET/…Java情景记忆对话记录存储语义记忆知识库存储技能记忆参数形式记忆快速集成AgentRunPHP/Go/.NET/…JavaSummary系统存储系统记忆提取记忆存储JsonVectorGraph全文索引向量索引Json索引标量索引Text采用开源Mem0与Ragflow企业数据安全可控,不出域AgentRun一键部署一键绑定VPC统一工具接口•支持MCP和FunctionCall双协议,兼•API统管工具调用,开发复杂度降低80%,集成时间从天缩短到分钟智能工具生成与发现•AI驱动的工具推荐引擎,根据Agent任务自动匹配最佳工具组合•开放式工具市场,支持自定义工具发布和分享,构建Agent工具生态闭环AI应用统一入口构建部署AIAgentWorkflowFunction模型代理多种部署方式的LLM通义千问APP云工作流AIStudioAI应用统一入口构建部署AIAgentWorkflowFunction模型代理多种部署方式的LLM通义千问APP云工作流AIStudio云原生API网关节点A节点B节点CSAE/ACK/托管DifyWebAPP异步Agent一键转化运行时MCPServerruntimeSan存量业务MCP化存量业务AI全栈统一监控基于Prometheus构建AI全栈监控大盘,包括模型性能分析、Token成本分析、GPU资源异动分析等端到端链路追踪基于OpenTelemetryTrace实现用户终端、网关、模型应用、模型服务、外部依赖工具等全链路追踪。构建统一日志分析平台,对模型调用日志进行二次评估分析,实现质量、安全、意图提取等语义检测。AI应用观测:OpenTelemetry可观测标准协议阶段一:按资源租用计费虚机/容器计费模式问题:为实例的持续运行付费。无请求时不能缩0仍阶段二:按请求计费问题:为代码运行时刻付费,无请求时0成本。但长连接保活场景(如MCPServer/WebSocket)因低负载存活仍计阶段三:按实际资源消耗计费价值:按实际资源消耗,精准区分忙闲时计费。引入会话粒度度存储粘性,将会话和一个持久化的,归属特定租户的存储子引入会话粒度度存储粘性,将会话和一个持久化的,归属特定租户的存储子平台基于POSIX标准多租存储安全实践框架,落地层次化纵深防御体系传统共享存储问题(虚机/容器/FaaS架构)AgentCodeSandbox多租户数据共享,有安全问题。无法满足同一个函数的每个实例路径不同的需求。挂载存储路径是变化不确定的。SandboxSandbox函数实例-1会话-1x-custom-affinity-header:Session实例-2x-custom-affinity-header:实例-2会话-2会话-2OSS实例-3会话-3x-custom-affinity-header:OSS实例-3会话-3高性能高安全开箱即用,轻量灵活极致弹性,最小成本享受AI时代红利AgenticAI应用的开发•AgenticAI应用的开发•低代码白屏化脚手架•高代码无框架绑定开发•版本的无损平滑升级模型部署•支持ServerlessGPU算力•支持微调后的模型进行私域一键部署模型微调•基于反馈的高质量数据集,对模型进行微调•支持主流的强化学习框架运行•预集成微调生态的插件Agent数据收集•无侵入式的全链路采点•一键开启,默认集成•除基础监控外,提供全链路的tracingAgent反馈评估•全链路的数据标注•反馈数据收集•基于数据测试集的回放设计、营销在AIGC浪潮下的新范式阿里云云原生高级产品解决方案架构师2025/12/1201AIGC在设计领域的渗透曲线Serverless助力成本低、高效率、高性能的可控图片视频生成03设计、营销新范式下的案例AIGC技术呈现出前所未有的创新和想象力,提高企业内容生产的效率和质量行业自主可控的生成技术能力技术萌芽到开源生态的繁荣行业自主可控的生成技术能力技术萌芽到开源生态的繁荣第一阶段•生成式技术萌芽第一阶段•生成式技术萌芽•OpenAI和Google分别输出自研方案,Midjourney上线第二阶段技术快速发展不穷•Lora、Dreambooth,支持灵活的训练方式•ComfyUI上线,插件灵活组装第三阶段行业可控、行业充分应用•Controlnet面世,补齐可控生成的版图•ComfyUI一年更新节点3000+•抽卡机制,行业自主可控的训练•工作流程搭建、相关技术逐渐成熟多类技术大融合•保ID技术快速迭代,多视角、多动作序列帧一致性问题解决•3D重建与渲染技术逐步突破•环境融合等技术渐趋成熟•3D生成技术效果向实际应用靠拢•可控视频生成多技术大融合,极大降低素材成本多技术大融合,极大降低素材成本特征AIGCBASICDESIGNABILITYAIGCSCENARIO-BASEDINDUSTRYAPPLICATIONAIGC设计技术能力AIGC场景化行业应用算法能力编排算法能力编排AIGCAIGC辅助商品设计AIGCAIGC辅助平面设计AIGC辅助空间设计AIGC辅助电商设计算法能力算法能力AIGC产品外观设计AIGC产品外观设计AIGC插画绘制AIGC插画绘制AIGC空间外观设计AIGC虚拟模特大模型大模型行业行业LORA模型AIGC包装设计AIGC包装设计AIGC建筑效果绘制AIGC建筑效果绘制AIGC场景替换AIGC场景替换AIGC服装设计AIGC服装设计AIGC海报生成AIGC海报生成AIGC环境艺术AIGC环境艺术AIGC试衣AIGC试衣Serverless助力成本低、高效率、高性能的可控图片视频生成自研大模型-通义万相50+开源大模型4000+生图可控算法能力定制化行业模型训练N////// 产品工具建设设计驱动产品工具建设,基于客户共建设计领域开箱即用的saas工具形态。也可以提供api能力,供客户封装 算法流程编排行业设计的可控的算法研发:客户ai场景调研、AIgc场景提效洞察、算法流程编排。 大模型万相、flux、可图、sd等,50+主流大模型支持行业模型的训练,提供训练服务 大模型内置了170插件,4000+AIGC生图可控算法。包含了自研的算法与主流的开源算法。 AI平台云资源的方式配套IT设施,部署模型、安装绿网、支持模型与算法的上传,提供AI算法编排能力、行业模型训练能力。企业级算力共享、算力调度、推理加速、快速扩容、弹性伸缩企业级算力共享、算力调度、推理加速、快速扩容、弹性伸缩场景策划与测试测试设计调研机会方案设计场景策划测试设计调研机会方案设计场景策划场景落地应用定开底层算力场景落地应用定开底层算力业务场景营销物料游戏渲染教育培训辅助设计产品能力ComfyUI托管StableDiffusion业务场景营销物料游戏渲染教育培训辅助设计产品能力ComfyUI托管StableDiffusion托管Midjourney合作核心功能基础功能模型广场应用监控弹性配置文件管理实例登陆访问管理异步调用工作流广场ServerlessAPI基础设施函数计算FC文生图生图/文生视频LoRA模型训练解决从数据集打标到模型训练的全过程。企业级ServerlessAPI调用高性价比的GPU弹性算力;支持一键将弹性扩容,内置队列,支持异步调用调试阶段启动工作空间下载模型调试提示词工作流/插件生成图片/视频关闭工作空间调试阶段启动工作空间下载模型调试提示词工作流/插件生成图片/视频关闭工作空间APIAPI发布阶段配置资源规格配置资源规格发布发布APIAPI调用阶段弹性生图结果转存转存至转存至API调用阶段弹性生图结果转存转存至转存至开箱即用一键拉起图像生成项目,分钟级完成端到端灵活开放一键发布项目开发阶段调试通过的流程可直接发布为Serverless算例与定价模型加载加速型层做了优化,模型加载速度提升约30%应用推理加速FunctionAI图像生成,简化从灵感到API调用的每一步03设计、营销新范式下的案例AIGC技术呈现出前所未有的创新和想象力,提高企业内容生产的效率和质量AIGC风格化海报:产品艺术海报AIGC风格化海报:产品艺术海报超级符号|大疆的视觉海报保持符号的稳定可见呈现强化品牌符号AIGC风格化海报:电商头图排版视频框架制定文本拓写-AI撰写提示词AI分镜图片制作文本拓写-AI撰写提示词AI分镜视频生成消费者用手机扫描可口可乐瓶身二维码,上传心愿和照片,便能定制新年愿望,不同的是,可口可乐引入了视频,用户不仅可以生成个人数字形象,还能选择个性化语音,生集齐全家人的心愿,就能连成一条完整的“心愿龙”。通过AI赋能,可口可乐得以成为家人心愿的载体,并且让连接不局限于单个家庭内部。当万千家庭的新年愿望组成长龙,意味着身处世界不同角落,素不相识的家庭因可口可乐而产生连接,“年在一起”也被赋予了更天猫利用AIGC这一特点,联动20多位明星户可以通过AIGC互动,在明星或者IP制作的年画添上自己的一笔,创作出带有个人烙印的年画。在轻松的互动中,带来新鲜感与成就感,这种「明星联动+个性定制」的互春节康师傅邀请AI写春联,用户进入小程序后,引导用户说出「新年你想写一副什么主题的春联」,随即通过故宫宫廷文化数据库,检索古往今来的祈福春联,为你创作一副独家春联。并通过LBS定位技术,精准定位用户家乡,实现与所在地地标性建筑的同在新年期间转发给亲朋好友,线上拜年,大大提升了社交价值。上传20张照片,支付9.9元,便可生成个人妙鸭相机的快速走红,得益于其在微信小程序上的便捷操作和社交裂变机制。用户通过上传20张照片并支付9.9元后,即可生成个性化的数字分身,并在社交媒体上分享。这种“傻瓜化”的操作流程和社交裂变的传播方式,极大地降低了用户的使用门槛,同时换脸效果换脸效果换脸效果换脸效果AI网关搭建与落地实践AI原生产品解决方案架构师2025/12/1202AI网关产品核心能力与落地实践03AI网关应用场景及案例AI应用落地过程中遇到的核心挑战安全与合规风险lAPI-KEY泄漏风险l敏感数据泄露l生成内容不可控集成复杂度l统一多模型代理l权限管理复杂高可用保障l模型服务中断lRT和成功率波动影响用户体验l监控告警缺失,无可观测能力成本失控l重复问答浪费AI网关产品核心能力AI网关AI网关模型代理存量HTTP服务工具代理模型代理存量HTTP服务工具代理护AI限流Agent代理Agent代理AI安全护栏AI安全护栏夸克百炼应用等Redis夸克百炼应用等Redis/VectorDB统一接入代理l多模型统一代理统一接入代理l多模型统一代理lAgentAPI封装安全鉴权管理安全鉴权管理l联网搜索优化模型幻觉lAPI-KEY托管、二次分发l消费者鉴权AI网关落地实践--解决用户管理失控问题核心问题1:我以什么样的方式将LLM服务暴露给大家呢?如何进行权限解法:OpenAIAPI的协议基本已经是标准协议,目前市场面上大部分LLM都支持OpenAIAPI协议。所以提供遵循OpenAIAPI协议的HTTP接口就可以让企业员工通过各种方式使用LLM服务和能力。通过创建消费者,对模型侧的API-Key进行保护,防止泄露导致的盗刷。核心问题2:企业内部部署DeepSeekR1满血版,公司好几千人,但GPU资源有限,如何限制用户?解法:AI接口一旦暴露出去,基本上不可能只让一小部分人知道,所以需要对访问LLM服务的用户做以限制,只让能访问的人访问,不能访问的人即便知道了接口也无法访321321消费者授权给消费者分配可以访问哪些LLM服给消费者分配可以访问哪些LLM服建议可以将一个消费者对应到一个团队或一个项目组,根据具体业务分配可以将一个消费者对应到一个团队或一个项目组,根据具体业务分配分发AI网关落地实践--解决安全合规的问题核心问题:模型托管平台自带好几层内容安全审核机制,但是我们在IDC部署或者在FC部署的,如何能方便的接入内容安全审核服务?解法:AI网关中的AIAPI集成了阿里云的内容安全防护和AI安全护栏服务,可以一键开启。安全防护的规则还是要在内容安全服务侧配置。AI网关落地实践—联网搜索降低模型幻觉问题核心问题:公司部署了DeepSeekR1671B的模型,但推理的结果和DS官网推理的结果有差距,似乎不满血?解法:推理的结果和DS官网推理的结果有差距大概率是因为DS官网开启了联网搜索。DeepSeekR1671B的模型推理能力是很强,但训练的数据也是有限的,所以要解决幻觉还需是要在推理前先搜索和处理出比较确切的信息后,再由DSR1推理,所以联网搜索是非常关键的。目前模型托管平台提供的DSR1API和自己部署的DSR1都需要自己实现1支持夸克联网搜索AI网关在AIAPI维度集成了夸克和必应的联网搜索能力AIAPI策略中一键开启,快速配置2搜索结果自动融合搜索结果自动融合进输入的3问题意图识别默认使用小模型对用户的问题做意图识别,避免无效的联网搜索AI网关落地实践--解决同一域名/API访问不同模型的问题核心问题1:公司GPU资源有限,部署了满血版DeepSeekR1,还有其他一些小模型以及使用百炼的模型服务,现在域名都不统一,分发、管理、集成的成本都很高,如何使满血DSR1和其他模型或者闭源LLMAPI服务共存,保持同一个API接口,不同业务通过请求中的模型名称,切换不同的模型。满血DSR1和其他模型或者闭源LLMAPI服务共存,保持同一个API接口,不同业务通过请求中(Header,Cookie等)携带的业务标识,匹配到不同的模型。33不同模型2维护多个模型服务还是闭源LLMAPI,都可以作为模建议使用多模型服务类型创建AIAPI,在一个AIAPI中可以添加多个模型建议优先推荐使用模型名称匹配切换的AI网关落地实践--解决百炼DSR1QPM/Token限制的问题核心问题:我们使用百炼平台上提供的DSR1671B模型的API,但是有15000QPM和1200000TPM的配额限制,不能满足业务需求,但是每次升配很麻烦。不只是百炼,目前所有的模型托管平台都有QPM和TPM的限制,并且有些平台是很难升配这个限制的,所以大多数用户都会选择申请多个帐号(APIKey),变相的撑大这个配额限制,但缺点是在业务里管理多个APIKey是一件很麻烦的事。对输入/输出内容做缓存,减少对模型服务的请求次数以及Token消耗,从而提升业务侧的请求性能。32APIKey可实时维护AI32APIKey可实时维护AIAIAPI维度支持将输入和输出缓存到支持精确匹配支持向量化检索匹配时,可以实时动态添加模型服务的AI网关,每个模型服务都可以配置建议建议在非常垂直类的应用场景下适合开启结果缓存,但建议开向量化检索匹配在非常垂直类,问题和答案非常固定的应用场景下可以开精确匹配建议建议在非常垂直类的应用场景下适合开启结果缓存,但建议开向量化检索匹配在非常垂直类,问题和答案非常固定的应用场景下可以开精确匹配在泛业务场景下开启结果缓存可能会降低推理精度或准确性,需要结合业务判断和考量的行为集成到客户自己的自动化平AI网关落地实践--解决模型服务高可用的问题核心问题:公司的主力模型是FC上部署的DSR1671B,但GPU资源并不是基于流量峰值储备的,所以当高峰期时,DS服务会请求失败,有解法:有两种做法,并且可以搭配使用:可以构建多个个兜底模型服务,如果要保证模型一致,可以主力使用FC上部署的,兜底使用百炼平台提供的。实现当FC上部署的DS服务请求失败时,Fallback到百炼平台托管的DSR1服务。从而保证业务的连续性和健壮性。通过基于Tokens的限流策略,解决Burst流量,保护后端模型服务。2开启ModelAPI维护多个模型服务开启ModelAPI维护多个模型服务是百炼LLMAPI服务,都可以作为QPS、并发等维度限流消费者,客户端IP,消费者AI网关落地实践—LLM可观测最佳实践核心问题:如何统计不同模型的调用情况,如何了解不同消费者对于模型的调用量?如何确认Fallback的情况?解法:AI网关集成可观测能力,能够统计整体调用上的Token消耗、模型消耗、各消费者使用情况、QPS、首包RT等信息,提供全面的可观测指标。AI网关落地实践–0代码转换MCPServer核心问题:企业内部目前有大量的OpenAPI的服务,需要转换成MCPServer,适应当下AI时代的发展,给AIAgent使用解法:通过AI网关,可以实现0代码将原有的OpenAPI服务转化成MCPServer,无需重新开发后端服务解决客户痛点开发一个AI应用或者做现存业务的AI解决客户痛点开发一个AI应用或者做现存业务的AI增强,AIAgent是需要和大量现存业务做交互的,MCP虽然统一的协议,但将现存业务重构为MCPServer的成本是非常高的,并且目前支持的开发语言有限,像Go,PHP都没有对应的MCPSDK,所以会让很多企业想拥抱MCP,但又无从下手。各种服务来源AIAgentCursorA领域MCPAIAgentCursorA领域MCP服务B领域MCP服务C领域MCP服务D领域MCP服务服务来源组装AI网关AI网关通义灵码CustomAgent通过白屏化操作,将各类服务快速接入AICustomAgent负责协议转换,将负责协议转换,将HTTP转换为MCP多种方式配置MCPTool信息消费者授权MCP服务针对MCP服务配置各类策略/插件…AI网关提供多种方式配置MCPTool描述信息。AI网关提供消费者认证体系,可以对消费者授权可使用的MCP…各类函数虚拟MCP语义检索各类函数0代码改动AI网关落地实践–MCPserver的统一代理和鉴权核心问题:建设企业内部的MCPMarketplace,能够将企业自有的工具以MCPserver的形式提供给大模型调用,同时能够将企业管理的外部API(如地图API等)以MCPserver的方式提供给内部AIAgent使用,且能支持对外部工具鉴权的统一收口和二次签发。解法:通过AI网关(withMCP),为AIAgent调用工具,提供统一的接入点和管理界面,支持对接各类内外部API和运行时,能够在网关上统一对MCP调用进行观测和治理,从而降低AIAgent使用工具的门槛,提升企业AI应用的安全性和稳定性。ladapt用户API或服务为MCPserversAI网关落地实践–AIagent代理、鉴权、观测核心问题:公司当前已经在使用百炼应用、dify等平台构建AIAgent,不支持二次API-KEY签发和更细力度的限流等策略,也不支持openAI的兼容协议。希望能够统一代理和管理AIagent平台,包括托管API-KEY、限流等解法:通过AI网关的AgentAPI,统一代理Agent,实现Agent对外的二次鉴权,并完成观测、限流、fallback和安全防护等治理动作,提升Agent的稳定性和安AI网关典型场景功能域详细功能业务场景消费者精细化管理基于请求标识切换模型精确管控企业内部、外部用户使用LLM的方式,基于请求方的特征决定使用哪个LLM,可以使用多少Token。统一管理多个LLM服务商,也包括自建LLM服务,通过多APIKey管理扩展TPM限制,可以基于业务场景通过模型名称快速切换模型

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论