2025大模型在数据管理与数据应用领域的实践_第1页
2025大模型在数据管理与数据应用领域的实践_第2页
2025大模型在数据管理与数据应用领域的实践_第3页
2025大模型在数据管理与数据应用领域的实践_第4页
2025大模型在数据管理与数据应用领域的实践_第5页
已阅读5页,还剩14页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

20241壹钱包大模型应用现状2大模型在数据管理领域的应用3大模型在数据风控领域的应用4大模型技术架构及平台建设RAG+PingAnGPT中石油、商城、积分应用于H5/企微场景高效运营,及时响应提供基于知识库的专业问答具备智能营销能力风控运营应用于风控场景可疑案件评定地域风险交易风险使用习惯风险宠物应用于小程序的社区页提供宠物相关知识问答提供猫狗品种介绍提供宠物饮食指南数据管理应用于大数据内部的数据治理场景辅助数据分类分级辅助元数据检索壹钱包大模型的应用场景JR/T

0197-2020金融数据安全分级指南s1~s5数据安全级别人工标识平安大模型+RAG技术辅助标识数据资产管理平台资产盘点、梳理、分类数据资产清单元数据接入信息检索根据指南识别数据资产人工打标数据分类分级业务价值落地PingAnGPT+

RAG技术在数据安全分级场景,辅助提升人工标识作业效率目前大模型实现数据安全分级准确率约94%,在持续优化迭代中。可节省90%人工打标工作量。场景1:辅助安全&监管对数据的分类分级要求,可实现节省90%人力任务:结合你与用户的会话记录和已知信息做回复。注意甄别你的回复是否属实,必要时附上信息来源。如果用户的问题涉及到多个分类分级,请针对不同情况进行回复,按照已知信息中最接近的问题进行答复已知信息:{context}你的角色:大数据分类分级专家拒答范围:拒绝回答与你业务无关的问题拒绝回答政治敏感、违法违规问题拒绝回答缺少上下文的问题输出格式:JSON格式,包含以下key:"name":{question}"lvl1":一级分类名称"lvl2":二级分类名称

"lvl3":三级分类名称

"lvl4":四级分类名称

"security":最低安全级别限制:生成内容严格按照返回格式,不要输出其他内容。用户问题是:{question}分类分级知识知识检索向量模型PingAnGPTembeddingPrompt

Engineering的一种通用结构化框架:任务(Task):明确表达你的最终目标上下文(Context):用户背景、相关知识等信息示例(Excamples):提供具体的例子,提高模型输出质量角色(Person):指定大模型扮演的角色,限定知识范围格式(Format):期望大模型输出的格式语气(Tone):正式、非正式、幽默等规则学习困难花费时间多语义理解难入门门槛高分类不准确

规则理解不准确字段注释不准确分类一致性较差工作效率低人工处理分类规则熟悉字段注释查阅知识向量注入embedding向量模型问:金额的分类分级是什么?向量知识库相似知识召回填充提示词模板提示词模板答:{"name":"金额","lvl1":"业务","lvl2":"账户信息","lvl3":

"NA","lvl4":"金额信息","security":

"S3"}解决用户痛点符合监管规范大模型&RAG&提示词迭代实现数据分类分级资产管理平台-分类分级AI助手大模型元数据检索传统元数据检索更强大的语义理解用户需要年龄信息,顺便带出了年月字段供用户参考丰富的扩展性用户询问财富等级字段,不仅提供回答后,拓展出信用卡等级风险等级等字段自定义的智能交互能力确人是否是用户需要的,尽可能满足用户需求任意输入元数据中文描述,精确检索到对应的元数据,不需要用户预先选择好数据服务对象(数据模型表、报表、标签、指标.....)使用门槛高固定关键词模糊匹配定位范围广、查找困难用户受众窄主要面向数据开发人员及元数据

owner功能较单一无法扩展回答无多步交互场景2:大模型尝试实现元数据检索场景3:大模型打标商品标签并迁移至用户,提升用户标签丰富度用户行为用户基础标签高尔夫球商体育竞猜活动用户行为用户基础标签商品标签活动标签商品自有标签活动自有标签体育竞猜活动标签:体育赛事互动娱乐竞猜游戏奖励机制体育竞猜活动标签:有参加体育竞猜活动的用户、参与的频度用户购买商品标签:有购买过高尔夫球杆的用户、有购买过体育类商品的用户高尔夫球杆商品标签:体育用品运动时尚高品质用户迁移标签体育

运动时尚高品质赛事互动娱乐竞猜游戏奖励机制采用大模型对商城全量商品进行打标,大模型根据商品名称及描述给出杆多个标签,再根据用户与商品的交互品(浏览、点击、加购、交易等行为权重)把标签迁移到用户上。再根据商品标签与用户标签进行向量匹配,增加一种商品推荐的方式。商城商品营销活动各类权益PingAnGPT商品标签-发散活动标签-发散权益标签-发散PingAnGPT标签收敛精简商城商品营销活动各类权益商品标签-收敛活动标签-收敛权益标签-收敛流程用户行为用户迁移标签3大模型数据风控领域的应用场景1:风控运营案件处理(

30min->1min)业务痛点处置繁琐风控账户运营需要结合客户身份、设备、操作、交易、关系等多维度信息,查询多个页面的结果进行判断处理知识庞杂不同场景有不同的业务知

识,不同案件类型有不同的作案手段,知识总量大、细节多上手困难新员工需经过漫长培训、在实践中反复训练,经过数个月实操才能达到较好状态,整体上手难度大业务价值降低处置难度将业务知识与案件经验封装入大模型的tools,降低知识传递的成本,减少上手难度提升处置效率提高数字化运营能力,精准提取关键信息、总结循证,降低人工失误率,人力效能最大化保障风控指标增强风控系统深度分析能力,高效精准识别风险,减少资损,为业务的稳定发展保驾护航信息汇聚综合风险客户各类信息解决方案模型判断Agent技术判断用户风决策输出生成风险概况和处置建议身份信息身份信息工具构建险代理工具客户概况核实内容交易信息操作信息任务切分记忆管理风险情况处理思路余额信息反查信息分析反馈总结输出参考依据处置建议OneAgent

VS

Workflow运营主导,自主编排流程多次调用,分步分析概括,简化了prompt低代码开发,低成本尝试整合简单风险,聚焦复杂问题PlanningToolsMemory

Action理想状态:

强大的L

L

M

+

数据聚合+

复杂Prompt

+

丰富的

Tools

->风控运营专家实际使用:

对大模型能力要求高,

大量的token+思维链能力;对Prompt要求高结构复杂;稳定性较差,调度困难;对Tools描述需清晰;Agents场景2:电话照会剧本生成业务流程数据链路删/改:将大模型生成结果标记为“错误”,后续通过调整模型输入/提示词工程进行优化新增:待排查风险点-照会剧本存入数据库,供后续RAG召回未增删改:将大模型生成结果标记为“正确”,添加至回归测试用例库电话照会剧本待排查风险点待核查信息照会思路注意事项案件基本信息《风控运营指导规范》《风险诊断报告》知识检索相似剧本GPT核查结果&管控建议风险核查结果案件风险判定管控建议场景3:管控建议及案件小结生成核查结果&管控建议对比剧本和实际通话记录确认各风险点的核查结果案件整体风险评估生成管控建议参考全流程关键信息生成结构化总结文本归档至业务知识库达成数据链路闭环案件小结电话照会剧本交互文本(ASR)GPT风险诊断报告电话照会剧本核查结果&管控建议案件小结案件基本信息待排查风险点核查结果管控建议GPT4大模型技术架构及平台建设技术底座工程建设平台建设LLMPingAnGPTChatGLMQwenMistral向量模型BERTBGEERNIEM3E技术框架LangChainMilvusPytorchFaiss核心算法上下文融合检索增强多模态处理MemoryRAG工程文档解析IUR多策略召回Rerank多知识库来源标记提示词工程场景隔离回归测试用例库多模板配置版本控制词槽管理模型管理A模型配置

提示词管理召回策略配置自动化测试……标注平台C挖掘标准问扩充相似问丰富知识库迭代提示词……线上服务D性能监控服务探活超时熔断白名单……LLM服务Agent工程决策引擎工具组件化记忆管理规划引擎WorkflowAgent协同Agent管理B角色定义技能管理节点配置流程编排……已有功能

建设中整体平台架构16问:怎么XXX?embedding业务知识文档文档片段1文档片段2文档片段3FAQ

1FAQ

2FAQ

3……embedding

1embedding

2embedding

3embedding

4embedding

5embedding

6……向量模型PingAnGPT答:xxxASROCR切片算法知识检索知识向量注入任务:你需要扮演一位经验丰富的XX顾问,引导用户提出清晰完整的问题,并基于用户问题给出答复。已知信息:{Knowledge}用户问题是:{question}##限制:严格参考已知信息,不要胡编乱造只专注于XX业务相关内容以MarkDown格式返回你的回答:提示词模板向量模型RAG,Retrieval-Augmented

Generation,检索增强生成知识构造->知识检索->增强生成IURRerankMilvusHiveToCache通过RAG技术实现基于知识库的智能回复IUR,Incomplete

Utterance

Rewriting,不完整话语重写embedding向量知识库向量化问:我没有壹钱包APP知识检索没有检索到知识优化前:embedding向量知识库问:我没有壹钱包APP知识检索微信小程序“小安加油”-【我的】-【我的加油券】PingAnGPTIUR

向量化问:我没有壹钱包APP,应该怎样使用积分兑换的加油券?<交互历史>问:我用积分换的券怎样用答:壹钱包app-【加油】-【我的】-【我的加油券】多轮对话场景可能面临的问题:隐含指代词、省略词隐含上下文信息难以准确检索知识无法生成预期回复解决方案:利用大模型,结合交互历史对当前用户输入进行重写,将缺失的信息重新纳入到新生成的用户输入中优化后:解决多轮对话问题IUR(Incomplete

Utterance

Rewriting)WorkflowAgent,定义多个Agent协作,通过工作流+工具调用完成任务:规划者:理解问题,判断调用哪个工作流观察者:观察工具调用结果,生成数据分析结论总结者:总结现有数据,生成任务的最终回复XX报告问:XXX生成xx分析报告理解问题

调用工作流Function

call

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论