DataFun大模型在数据管理与数据应用领域的实践_第1页
DataFun大模型在数据管理与数据应用领域的实践_第2页
DataFun大模型在数据管理与数据应用领域的实践_第3页
DataFun大模型在数据管理与数据应用领域的实践_第4页
DataFun大模型在数据管理与数据应用领域的实践_第5页
已阅读5页,还剩14页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

演讲嘉宾:涂勇

1

壹模型应用现状

2

大模型在数据管理领域的应用

3

大模型在数据风控领域的应用

4

大模型技术架构及平台建设CONTENTSRAG+PingAnGPT数据管理应用于大数据的数据治理场景

辅助数据分类分级

辅助元数据检索风控运营应用于风控场景可疑案件评定地域风险

交使用习惯风险中石油、商城、积分应用于H5/企微场景高效运营,及时响应提供基于知识库的专业问答具备智能营销能力宠物应用于小程序的社区页

提供宠物相关知识问答

提供猫狗品种介绍壹模型的应用场景资产盘点、梳理、分类数据资产管理平台元数据接入JR/T

0197-2020金融数据安全分级指南s1~s5数据安全级别场景1:

辅助安全&监管对数据的分类分级要求,

可某省市90%人力根据指南识别数据资产

人工打标数据分类分级平安大模型+RAG技术辅助标识目前大模型实现数据安

全分级准确率约94%,在持续优化迭代中。可某省市90%人工打标工

作量。落地PingAnGPT

+RAG技术在数据安全

分级场景,辅助提升

人工标识作业效率人工标识业务价值数据资产清单分类不准确规则理解不准确

字段注释不准确

分类一致性较差规则学习困难

花费时间多

语义理解难

入门门槛高Prompt

Engineering的一种通用结构化框架:任务

(Task):

明确表达你的最终目标上下文(Context):用户背景、相关知识等信息示例

(Excamples):提供具体的例子,提高模型输出质量

角色

(Person):指定大模型扮演的角色,限定知识范围格式(Format):期望大模型输出的格式语气

(Tone):正式、非正式、幽默等近的问题进行答复已知信息:{context}你的角色:大数据分类分级专家拒答范围:1.拒绝回答与你业务无关的问题2.拒绝回答政治敏感、违法违规问题3.拒绝回答缺少上下文的问题输出格式:JSON格式,包含以下key:"name":{question}"lvl1":一级分类名称"lvl2":二级分类名称"lvl3":三级分类名称"lvl4":

四级分类名称"security":最低安全级别限制:生成内容严格按照返回格式,不要输出其他内容。

用户问题是:{question}大模型&RAG&提示词迭代实现数据分类分级答:

{"name":

"金额","lv

l1":

"业务","lv

l2":

"账户信息",

"lv

l3":

"NA","lv

l4":

"金额信息",

"security":

"S3"任务:

结合你与用户的会话记录和已知信息做回复。注意甄别你的回复是否属实,必要时附上信息来源。如果用户的问题涉及到多个分类分级,请针对不同情况进行回复,按照已知信息中最接向量知识库------------⃞相似知识召回填充提示词模板工作效率低人工处理分类规则熟悉

字段注释查阅

embeddi

ng解决用户痛点

符合监管规范问:金额的分类分级是什么?PingAnGP

Tembedding向量模型分类分级知识知识向量注入

向量模型

知识检索提示词模板•••}•资产管理平台-分类分级AI助手场景2:

大模型尝试实现元数据检索

传统元数据检索

》》大模型元数据检索功能较单一•

无法扩展回答•

无多步交互用户受众窄•

主要面向数据开发人员及元数据owner任意输入元数据中文描述,精确检索到对应的元数据,不需要用户预先选择

好数据服务对象(数据模型表、

报表、

标签、

指标.....

更强大的语义理解

使用门槛高•

固定关键词模糊匹配•

定位范围广、查找困难----

自定义的智能交互能力

用户询问财富等级字段,不仅

提供回答后,拓展出信用卡等

级风险等级等字段

丰富的扩展性

用户需要年龄信息,顺便带出了

年月字段供用户参考确人是否是用户需要的,尽可

能满足用户需求流程商品标签-发散PingAnGPT采用大模型对商城全量商品进行打标,大模型根据商品名称及描述给出

多个标签,再根据用户与商品的交互

(浏览、

点击、

加购、

交为权

重)把标签迁移到用户上。

再根据商

品标签与用户标签进行向量匹配,增

加一种商品推荐的方式。场景3:

大模型打标商品标签并迁移至用户,

提升用户标签丰富度

用户迁移标签体育运动时尚高品质赛事互动娱乐竞猜游戏奖励机制活动自有标签体育竞猜活动标签:体育赛事互动娱乐竞猜游戏奖励机制用户购买商品标签:有购买过高尔夫球杆的用户、有购买过体育类商品的用户高尔夫球杆商品标签:体育用品运动时尚高品质用户迁移标签体育竞猜活动标签:有参加体育竞猜活动的用户、参与的频度标签收敛精简用户基础标签

商品自有标签高尔夫球杆商品体育竞猜活动活动标签-发散权益标签-发散用

为活动标签-收敛商品标签-收敛商城商品营销活动商城商品营销活动商品

标签活动

标签用户行

为用户基础标签用户

行为summary

3

大模型数据风控领域的应用of

work业务价值降低处置难度将业务知识与案件经验

封装入大模型的tools

降低知识传递的成本

减少上手难度提升处置效率提高数字化运营能力

精准提取关键信息、

结循证,降低人工失误

率,人力效能最大化保障风控指标增强风控系统深度分析

能力,高效精准识别风险,减少资损,为业务的稳定发展保驾护航业务痛点处置繁琐风控账户运营需要结合客

户身份、

设备、

操作、

易、

关系等多维度信息

查询多个页面的结果进行

判断处理知识庞杂不同场景有不同的业务知

识,不同案件类型有不同

的作案手段,知识总量大、

细节多上手困难新员工需经过漫长培训、

在实践中反复训练,经过

数个月实操才能达到较好

状态,整体上手难度大场景1:

风控运营案件处理

30min->1min)Agent技术判断用户风

险客户概况风险情况参考依据核实内容处理思路处置建议身份信息交余额信息身份信息操作信息反查信息模型判断决策输出信息汇聚生成风险概况和处置建议综合风险客户各类信息解决方案分析反馈总结输出工具构建任务切分代理工具记忆管理PlanningAgentsMemory理

:强

的LL

M

+数

合+

杂Prompt

+丰富的Tools

->风控运营专家实

使

:对

高,

的token+思维链能力;对Prompt要求高结构复杂;

稳定性较差,调度困难;对Tools描述需清晰;•

运营主导,

自主编排流程•多次调用,分步分析概括,简化了prompt•低代码开发,低成本尝试•整合简单风险,聚焦复杂问题OneAgent

VS

WorkflowActionTools新增:待排查风险点

-照会剧

本存入数据库,供后续RAG召回删/改:将大模型生成结果标

记为“错误

”,后续通过调整

模型输入/提示词工程进行优

化未增删改:将大模型生成结果

标记为“正确

”,添加至回归测

试用例库•待排查风险点

待核查信息•

照会思路•

注意事项业务流程数据链路场景2:

电话照会剧本生成《风控运营指导规范》电话照会剧本案件基本信息GPT核查结果

&

管控建议•对比剧本和实际通话记录•确认各风险点的核查结果•案件整体风险评估•

生成管控建议•

案件基本信息•

待排查风险点•

核查结果•

管控建议风险核查结果

案件风险判定

管控建议案件小结•参考全流程关键信息•生成结构化总结文本•

归档至业务知识库•达成数据链路闭环场景3:

管控建议及案件小结生成核查结果&管控建议交互文本

(ASR)风险诊断报告电话照会剧本电话照会剧本GPTGPT•••summary

4

大模型技术架构及平台建设of

workA

模型管理模型配置提示词管理召回策略配置

自动化测试……B

Agent管理角色定义技能管理节点配置流程编排……C

标注平台挖掘标准问扩充相似问

丰富知识库

迭代提示词……D线上服务性能监控服务探活超时熔断白名单……核心算法检索增强

上下文融合多模态处理

MemoryLLM

服务平台建设工程建设技术底座向量模型BERTERNIEBGE

M3EIUR多策略召回Rerank多模板配置版本控制词槽管理规划引擎WorkflowAgent协同决策引擎工具组件化记忆管理整体平台架构文档解析多知识库来源标记场景隔离回归测试

用例库PingAnGPTChatGLM技术框架LangCha

inMilvusPytorc

hFaissQwenMistral建设中已有功能Agent工程提示词工程RAG工程LLM任务:

你需要扮演一位经验丰富的XX顾问,引

导用户提出清晰完整的问题,并基于用户问题给

出答复。已知信息:{Knowledge}用户问题是:{question}##

限制:1.严格参考已知信息,不要造1.只专注于XX业务相关内容2.以MarkDown格式返回你的回答:

提示词模板通过RAG技术实现基于知识库的智能回复RAG,

Retrieval-Augmented

Generation,检索增强问:怎么XXX?

向量模型

答:xxx生成知识构造

-

>知识检索

-

>增强生成ASROCR切片算法Rerank文档片段2文档片段3FAQ

3……文档片段1embedding

5embedding

2embedding

1FAQ

1FAQ

2embedding4embedding

6……embedding

3

embedding

IUR向量模型业务知识文档知识向量注入HiveToCache知识检索MilvusIUR,Iplete

Utterance

Rewriting,不完整话

语重写多轮对话场景可能面临的问题:•隐含指代某省市略词•隐含上下文信息•

难以准确检索知识•

无法生成预期回复解决方案:利用大模型,结合交互历史对当前用户输入进行重

写,将缺失的信息重新纳入到新生成的用户输入中优化后:问:我没有壹APP知识检索embedding问:我没有壹APP,应该怎样使用积分兑换的加油券?答:壹app-【加油】

-【我的】

-【我的加油券】微信小程序“小安加油”

-

【我的】

-【我的加油券】解决多轮对话问题IUR

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论