打造多端多模态最优效果的百炼共建大模型生态繁荣_第1页
打造多端多模态最优效果的百炼共建大模型生态繁荣_第2页
打造多端多模态最优效果的百炼共建大模型生态繁荣_第3页
打造多端多模态最优效果的百炼共建大模型生态繁荣_第4页
打造多端多模态最优效果的百炼共建大模型生态繁荣_第5页
已阅读5页,还剩151页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

02

开放应用架构,

建设全新可精细化运营的百炼1.百炼RAG应用落地挑战与实践2.多语言多模态RAG技术研发与应用3.百炼可持续运营:

大模型应用优化技术实践4.AI运营实践分享—PE及RAG的实施方法论03

着眼未来,

共建多元化的大模型生态1.模型+应用双轮驱动:

全面开放的大模型生态04

大模型落地千行百业,

最佳实践案例分享1.Jarvis

X

百炼,

打造大模型智慧出行客服2.德勤携手阿里云百炼,

助力行业数智化提升3.产品博士

-基于阿里云百炼的首个阿里云内部案例01

多端融合,

打造最优落地效果的多模态百炼1.全新升级:

打造最优效果的多模态百炼2.终端大模型的探索及机会CONTENT目录主题一多端融合,

打造最优落地效果的多模态百炼打造最优效果的多模态百炼江潇阿里云智能集团飞天实验室资深产品专家2024/09/19CONTENT目录02

建设大模型生产力和产品力03

打造最优效果的RAG01

持续为AI创新加速04

打造最安全的百炼Part

1持续为AI创新加速与开发者共同成长,

为AI新范式创新加速2023年10月31日2024年5月9日百炼1.0百炼2.0新百炼理念理念阿里云百炼-产品定位基于通义大模型,

面向企业和开发者客户,打造一站式大模型服务和大模型应用构建平台百炼

MaaS应用

生态Qwen-PlusQwen-VLQwen-MaxQwen-Turbo听悟析言GBI妙笔三方应用阿里云AI计算服务PaaS/IaaS通义万相系列通义开源系列百模重器

·千锤百炼通义领域大模型多模态大模型通义千问系列自定义应用三方大模型模型生态通义晓蜜大模型

生产力大模型服务及应用已逐步进入“深水区

”客户对效果需求带来对大模型平台能力,从要求生产力到产品力的转变最佳企业级效果多模态开发适配工具效果安全工具工具模型拥有

(多模态)模型效果模型服务大模型产品力Part

2建设大模型生产力和产品力效果运营中心Agent应用开发工具全链路模型开发工具大模型服务基础大模型效果追踪工具Prompt工程模型体验/调试模型推理服务通义千问系列模型调优LoRA/SFT模型训练服务通义万相系列模型评测数据管理模型部署

模型安全服务模型预训练通义多模态大模型语音

、视觉

、HumanAI

GC等阿里云百炼产品升级架构图模型广场国际化应用广场多端生态VPC

、金融云

、政务云等大模型输出API/SDK/智能体效果分析工具流程/Agent编排效果干预工具插件中心多维看板搜索增强通义领域大模型法睿

、客服等三方大模型文本生成Qwen-TurboQwen-PlusQwen-Max视觉理解QwenVL-MaxQwenVL-Plus语音识别SensevoiceParaformer-v2图片生成Wanx-v1FLUXOutfitAnyone视频生成AnimateAnyoneEMOCosyVoice大模型生产力:

扩大多模态模型拥有多模态模型供给开源+闭源,

多模态模型一站式开箱即用多模态模型在线体验语音合成应用工具Agent智能体:基于视觉理解模型一键创建多模态交互智能体智能编排:基于文本

、视觉

、语音快速搭建多模态融合处理工作流及参数传递模型工具微调评测:支持图片

、视觉模型微调服务,

全面覆盖QwenVLQwenVL/Wanx/FLUX/SD模型大模型产品力:

多模态适配工具链能力应用搭建+效果优化,

模型工具链全面兼容多模态模型基于QwenVL-MAX模型,

搭建多模态搜索工作流QwenVL视觉理解模型图文SFT微调数据在线编辑可干预大模型产品力:

效果工具的实现思路可分析可追踪围绕大模型应用的全节点执行过程覆盖LLM

、API

、Retrieve

、Embedding

、Rerank

、Plug-in

等链路大模型产品力:

效果工具实现Logtrace全链路追踪监测LogTrace全链路监测

-

应用执行节点级监测完整执行链路的Latency延迟

、输入

、输出

、Tokens消耗子节点级监测

-节点执行详情大模型产品力:

效果工具实现提示词工程效果综合提升Prompt作为大模型与应用效果的链接器,优化方式更趋智能化提示词工程提示词

扩写基于反馈

优化ICL样例

扩充大模型产品力:

应用工具实现编排效果提升工作流编排智能体编排Multi-Agent+Workflow

智能决策的混合应用编排高度自定义的SOP流程执行,

显著降低编码成本Part

3打造最优效果的RAG搜索精度差系统集成难度模型生成幻觉维护成本高端到端生成满意度差企业知识管理复杂大模型产品力:

应用工具实现RAG的效果打磨痛点可管理企业数据百炼RAG目标领域应用效果企业管理可调优可运营可观测可干预多源/异构

数据可管理•多种数据对接方式云上数据库

、本地数据库

、网页数据解析等•

多模态数据文档

、图片

、数据库表

、视频

、语音•互联网搜索大模型产品力:

应用工具落地RAG的最佳范式效果可调优

、可干预•搜索精度提升Metadata增强

、模板化文档chunk切分•模型生成幻觉降低搜索前置/后置过滤

、意图识别后恢复召回等•提升端到端生成满意度RAG应用的自动化评估大模型产品力:

应用工具落地RAG的最佳范式Part

4打造最安全的百炼所有数据

100%

归属用户日志存储SLS

ActionTrail知识库向量数据AnalyticDB训练数据

、多模态数据OSS数据处理中间数据Elasticsearch内容安全

KMS加密

SDDP防护百炼账号大模型产品力:

安全工具的解决方案通义系列其他模型RAM内置绿网

内部审计模型加密用户账号数据可控模型独享链路可信操作可审百炼平台只计算不留存数据百炼应用RAG

Agent模型训练部署V

PCAPI用户账号用户

里调用百炼推理和应用模型微调模型部署百炼平台网关Prompt全程加密基础模型专网通道专网通道大模型产品力:

安全资质及多端可信部署国际首个人工智能管理体系标准ISO/IEC42001认证金融云VPC政务云一站式大模型服务平台,

企业拥抱AI

时代首选谢谢Thank

You终端大模型的探索及机会胡露露阿里云智能集团飞天实验室科学家2024/09/19从行业需求看终端模型能力通过AI

Core内置操作系统内核,

帮助品牌商,建立自己的大模型生态,开放APP调用,

为APP在手机,

PC,

平板等消费电子场景提供更丰富的端侧应用能力。文本总结提炼长文本中的信息,

并以固定格式输出短信/通话提取提取短信,

通话关键信息,

并发布到便签图像理解识别图像上的文字,

二维码等信息并结构化图搜信息通过摄像头直接识别物品输入法改写对输入的文本进行文风改写帮我写一段龙年祝福的话龙腾瑞气贺新春,福星高照吉祥年,愿你龙年事业飞跃

。章福安康,万事如意!不同风格选择礼貌抖音网易原神千问万相Audio

VL百度微信1-K个tokensN个正确tokens图搜商品相册图片直接搜索淘宝相似商品内容翻译内容创造客户

AI端云预测混合推理生态应用同口碑短信

通话端小模型相册

健康Core通用大模型商务调皮不可思议inconceivable浏览器模型分类开源时间应用场景Qwen2-0.5BIoT/冰箱2023.12端侧推理Qwen2-1.5B手机/IoT2023.12端侧推理Qwen2-3B手机/规划中Qwen2-7BPC/台式电脑2023.9.25端侧推理图像模型通义万相-0.3B生图的基础模型并具备背景图切换

、商品图设计

、数字模特等场景能力Qwen-VL-2B让模型能够“看见

”动态分辨率及OCR数据增强代码模型CodeQwen让模型能够代码编写通义家族推出的开源代码生成模型SenseVoice-small让模型能够“

听见

”语音理解模型支持语音识别

、语种识别

、语音情感识别

、声学事件检测

、逆文本正则化等能力Qwen2-Audio让模型能够“对话

”具备多语言的声音理解

、语音编辑

、音乐鉴赏

、情感分析等能力文本模型阿里云支持广泛端侧大模型CosyVoice-300M让模型能够“说话

”全新推出的生成式语音大模型,提供舒适自然的语音合成能力语音模型由于端侧模型部署相较于传统大模型部署在部署平台

、使用场景的不同,会有更多的模型调优

、工程优化的诉求与挑战Prefill速度

、decode速度

、模型加载速度

、模型Function

call

准确率

、模型对话效果

、模型总结效果功耗(

<3W

)内存占用(2G-4G

)CPU/GPU/NPU占用率(

<1c

)模型场景优化(

SFT能力

、互联网检索

、图像理解

、图像生成

、三方应用打通)模型落地的挑战模型更新

、模型升级(升级包<100M

)敏感内容过滤安全

&

维护扩展资源性能Alibaba

Cloud通义万相端侧大模型全技术链路Optimization

PluginsInferenceFrameworkModel

Weights通义干问KV

Cache

ManagerTransformer

Laye

0

Engine

Layer

N

DeploymentToolkit云端任务分发云端任务回复Qwen2-0.5B&

Qwen2-1.5BQwen2-7B性能对比列表评测对比数据来自通义官方博客,供参考:

https://qwenlm.github.io/zh/blog/qwen2/以百炼为基础-全面支持主流端侧芯片平台Qwen2

系列支持Qualcomm

、MTK

、Inter

、AMD等多种AI-SOC芯片原生调用•Counterpoint预测

,2024年生成式AI智能手机出货量将达到1亿部,到2027年出货达到5.22亿部

,2023-2027年CAGR为83%,届时AI手机的渗透率将达到40%•Canalys最新预测数据显示

,2024年,全球AI

PC出货量将达到4800万台,

占个人电脑(

PC)

总出货量的18%;预计到2025年,AI

PC出货量将超过1亿台,

占PC总出货量的40%。文件摘要文件内容摘要,

帮助消费者快速阅读通话提取提取通话关键信息,帮助消费者总结摘要通义大模型+MTK系列芯片创新摘要提取通义底座模型+

LoRA能力,

实现快速功能加载提取短信关键信息,帮助消费者记忆短信提取某品牌AI手机——

ASR

客户应用

TTS

执行器

上千种意图准确率96%

终端控制

端云结合的意图理解模型端侧小模型

百炼WorkflowQwen-LLMQwen-VLQwen-Audio其他客户端设备API服务执行节点

NLU1.5B语音输入

+

意图理解

+

Planning

推理

+

FunctionCall“驾车导航去机场,给我找下机场附近好吃的并加到途经点,

我想吃烧烤

”LLM语义识别/意图理解APP调用第一家烧烤店可以吗?

LLM

推理Planning大模型语义识别意图理解后返回结构化数据结合历史喜好记录和高德导航实现更舒适的出行体验APP调用LLM多轮对话/记忆读取口味喜好Memory历史喜好记录端侧大模型拒答模型内置拒答能力

。符合AI

GC备案要求

。并实时跟进政策需求变化

。隐私保护本地客户数据加密

。可选云端非对称数据加密

。模型数据与客户数据独立保存

。内容安全(需云端激活)支持本地,

云端双保护

。1.本地模式:预置60万风险词库,

6个算法比对模型

。支持中英双语支持中文同音词,相似词

。可选云端更新词库功能。2.云端模式:

云端风控模型,

电商级别内容安全保护。安全运行客定微调模型文件加密防破解

。关键算子抽离防盗取

。本地和增强多种可选安全方案,

帮助客户高效率实现安全的大模型使用环境内容安全

模型评测芯片适配百炼支持端云结合创新云端workflow模型微调百炼意图理解设备信令谢谢Thank

You主题二开放应用架构,

建设全新可精细化运营的百炼百炼RAG应用落地实践与挑战丁瑞雪通义实验室科学家2024/09/19CONTENT目录01

RAG背景与挑战03

差异化需求满足04

系统评估与优化02

复杂文档理解Part

1RAG背景与挑战知识受限私域知识:我入职3年,

今年有多少天年假?空调买了三年坏了,

还在保修期吗?长尾知识:fishier

rc4

2019的板腰长度是多少?ATOMIC

REDSTER

CS

SKI

BOOT硬度是多少?幻觉问题时效性知识:今天天气怎么样?2024云栖大会举办时间RAG出现背景长尾问题复杂的数据PPT

、PDF

、word

、网页

、markdown等多种复杂文件类型效果保障如何确保在客户的数据上达到效果要求,

如何迭代优化多样化需求多知识库编排

、回答范围限定

、多种query类型支持等RAG落地应用挑战Part

2复杂文档理解權益性質股東姓名/名稱實益擁有人於受控法團之權益權益合計佔本公司已發行股份之百分比(股份)(股份)(股份)(%)按性别划分的雇佣情况女性20%男性80%按级别划分的雇佣情况13%9%78%不同于word

、PDF等顺序理解文档,

PPT文档通常具有二维的空间理解顺序

。阅读顺序的正确理解对文档内容理解起到重要作用复杂的表头关系

、无线表格分割

、表格合并

、表格跨页等表格绘制方式均会对表格解析造成困难传统的依赖OCR的解析方式难以将饼图

、折线图

、柱状图等多模态数据信息准确地传达出来01.

PPT阅读顺序理解03.

多模态数据理解复杂的数据02.

复杂表格理解文本多模态复杂文档解决方案混合OCR

、规则解析

、离线VL

、在线VL

、layout

pompt等多种理解方式解决复杂文档理解问题多路解析结果融合离线解析路由PPT

表格layout

prompt规则解析OCR在线VL离线VLPart

3差异化需求满足多种query类型支持query类型:不同类型的提问,

对于所需信息密度

、信息类型不一样•

知识点问答•

总结摘要•

长文档推理•

翻译•

文本创作多知识库编排知识库类型:•

互联网知识库•

多类型业务知识库•

FAQ知识库知识库编排需求:•

本地/互联网知识优先级配置•

FAQ库短路机制•

多权重业务库路由混排回答范围限定知识范围:•

大模型自有知识•

知识库内容•

互联网知识依赖prompt无法支持知识范围限定•

模型幻觉•

垂域知识缺乏•

基模训练策略多样化需求例子搜中差异化需求解决方案搜前搜后知识库路由Query改写意图分析FAQ干预prompt组装配置知识库编排配置prompt压缩层级片段组装相关性检测回答范围配置搜索融合意图配置业务库2业务库4业务库1FAQ库业务库3Part

4系统评估与优化Bad

case怎么修复链路排查分析

、问题路由定位没有标注数据怎么办自动评估数据生产什么配置是最优的评估驱动的模块选择开箱即用之后

…(a)

Previous

MethodsSimple

QueryPlain

Text

Chunking

Retrieval

Reranking

GenerationEvaluationGolden

Chunks

Reference

AnswerCoFE-RAG:

RAG系统全链路自动评估框架

&BenchmarkChunking

Retrieval

Reranking

GenerationEvaluationMulti-granular

KeywordsReferenceAnswer(b)

CoFE-RAGComplex

QueryDocuments谢谢Thank

You多语言多模态RAG技术研发与应用龙

坤通义实验室科学家2024/09/19PE业

目知识库Query改写查询检索意图Query路由查询召回

家通义LLM输出结果Naive

RAGReRank丨

长期记忆丨

安全策略业

目知识库RAG系统介绍家通义LLMFinetuneAdvance

RAG文本向量多模态向量稀疏向量索引用户Query用户QueryRAGALL输出结果查询召回向量索引PEPE多轮改写多模态召回排序多语言Query路由Memory图片理解Code理解结构化搜索Long

Context表格问答Query拆解文本知识问答多模态融合跨语言理解业务特性定制…通义千问

Qwen-LLM

Qwen-VL离线数据在线处理RAG需求和功能的演进文档解析和理解场景定制多语言多模态多轮对话自定义切片大模型表格公式理解全电子格式混合解析Meta信息多语言特征抽取超长文档多模态文档解析多模态特征抽取文本向量多模态向量PDF解析OCR文本识别离线索引自定义切片智能切片模板切片表格理解KV信息抽取•多模态•文档理解文件格式众多图片/pdf/office/html多页长文档1-unlimited公式识别ChartDerenderingLayout分析阅读顺序理解TextSpottingChemicalStructureRecognition截图解析多模态文档理解版面层级结构多样论文/图书/财报/说明书多模态版面元素文本/表格/图片混合解析电子版

、大小模型混合解析文档结构识别长文档解析统一多模态文档识别多模态文档理解>10种文档格式转换md10000页文档解析>98%文字识别准确率>90%版面层级准确率>90%表结构准确率>95%公式准确率

文档理解能力技术和框架改进:混合电子版本解析,流式解析技术发展:

专属模型识别->通用模型识别文档版面分析,文档层级解析产品能力命多模态多语言Embedding/ReRank模型LLM双塔模型单塔模型ReRank

模型Embedding模型对比学习损失对比学习损失LLMLLM性能

&

泛化性连续

&

离散表示弹性维度表示多模态表征长文本多语言

&

跨语言高效率执行相关性区分度…统一多模态排序大模型应用DocumentRelevance

ScoreQueryVECTORQueryDocumentVECTOR推理能力多样性可定义的相关性底座模型Qwen

LLM训练策略多阶段训练高质量负样本混合模态均匀采样基于Qwen大模型的Embedding/ReRank能力构建大模型相关性数据合成GTE-Qwen-Embedding系列模型MTEB评测数据中文英文法语波兰语 baseline

GTE模型通过大模型过滤Positive和NegativeCode/多语言/多模态大模型合成数据基础相关性数据大模型应用数据通过检索+重排过滤采样PassageQuery

改写生成

Hard

Negative806040200生成Query生成角色生成场景Qwen

VL-80%向量存储+20%召回效率

Image

Encoder

这台汽车的售价?MMLMCLIP统一多模态召回VS

CLIP召回性能VS

分治策略这台汽车的售价?统一多模态表征模型MMLMLLM+85%纯图片召回+21%文图召回Image

EncoderProjection更统一的表征模型:单图/单文本/图+文充分利用多模态模型的底座能力召回+排序统一架构Text

EncoderLlamaIndex

官方SDK模型API服务全链路RAG应用开源模型生态开源生态接入百炼大模型平台RAG算法•

GTE-Embedding•

GTE-ReRank•IDP文档识别百炼2.0•Howto

book

air

tickets?•出差在外卖定的外卖无发票可以报销吗•Puis-je

réserver

un

lieu

deconférence

par

l'intermédiaired'unesociété

tierce

?Q:儿童座椅放置的卡扣在哪个位置Q:怎么放倒第三排座椅Q:查询AAC代号为98C的指令并使用V24.23版本的查询规范多模态产品智能辅助旅游和商品推广多语言智能问答多语言多模态RAG应用Q:这个鞋是什么型号?Q:根据商品知识写一段推广展示文案Q:

请问这是哪个城市的哪个景点?谢谢Thank

You百炼可持续运营—大模型应用优化技术实践赵中州阿里云智能集团飞天实验室科学家2024/09/19中等较低低应用基础模型智能体工作流

/多智能体•

适合添加新领域知识,易受灾难性遗忘的影响•

计算成本一般低于初始预训练•

用于改进模型行为,使其更加符合预期目标或标准•在SFT基础上增强性能,可减少偏差

、提升一致性•目的是增强指令遵循

、人类对齐

、任务执行等能力•

全微调:

可控性最强,可能面临灾难性遗忘问题•

PEFT:作为正则化手段训练,计算成本较低•使用动态提示上下文,通过用户问题检索并注入到LLM提示

中,适合需要结合动态/实时知识的场景,复杂性和性能依赖于检索引擎的实现•

在提示中放置原型示例

、推理轨迹

、角色等信息•推理成本和延迟可能随着更多的token输入而增加极高高大模型应用优化思路与选型优化方法

适用场景依赖成本仍需大量数据和计算资源针对目标的高质量评估器或高质量对齐数据高质量Prompt(

Demo和Instruction

)高质量训练数据(代表性&多样性)较少的训练资源高质量知识库继续预训练/CPT微调SFT/PEFT对齐训练/DPO检索增强生成/RAG上下文学习/ICL【任务描述】产品营销广告一版包含故事悬念,

信息缺口,

突展示,

预期反转,

直接利益,

内幕揭秘…等类

型,

请分析下列内容判断其具体类型:【参考样例】产品营销广告一版包含故事悬念,

信息缺口,

突展示,

预期反转,

直接利益,

内幕揭秘…等类

型,

请分析下列内容判断其具体类型:【分析内容】

贵与便宜的区别,谁说不是呢!

贵与便宜的差别,九块

九毛八,好珍惜哦,快来买吧

。【模型结果】直接利益【分析内容】亲身体验一下日常茶园管理(除草)@抖音小助手

谁说农民不苦?谁说梦里不累

,酸甜苦辣的滋味...【模型结果】情境共鸣【分析内容】减肥圈里的小秘密,其实吃对了,零食也能助燃脂!一小

包坚果(约30g

)仅150大卡,小块黑巧才50大卡…这些业内人不轻易说的小技巧,你学会了吗?【模型结果】

内幕揭秘【测试结果】ChinaJoy别眨眼~快和鹏哥一起来逛CJ吧!

了困了喝东鹏特饮

东鹏补水啦快速补充电解

质,

快来东鹏展台补充能量吧

。【模型结果】

情境共鸣【正确答案】

文化连接【错误分析思考】虽然正确识别了广告中包含的文化背景(

ChinaJoy)和用户互动元素,但在最终分类时,忽略了文化元素是作为整个广告背景框架存在的,其主要目的是通过与ChinaJoy这一文化盛事的连接,

吸引对该文化感兴趣的受众

。而“情境共鸣

”更多强调的是构建与观众日常生活相关的场景,

引发情感上的共鸣,这里并未直接构建如日常疲劳

、需要能量补充等普遍情境

,而是利用了ChinaJoy这一特殊文化活动作为吸引点,所以应该为“文化连接

”。【模型Prompt】你是一个专家,

擅长下面的能力:1.文本理解与分析能力

:能够准确理解文章标题和正文或摘要中的关键信息,识别其中涉及的汽车相关

…##【任务描述】请判断下面汽车相关的文章属于下面哪一种类别:“产品解析

”,“车商卖车

”,“经典怀

”,“质量投诉

”,“销量表现

”,“其他

”。最终的结果请按照{{“type

”:“

<类别结果

>

”}}的json格式进行输出##【任务步骤】完成该任务需要遵循以下步骤:1.

**阅读文章标题和正文**

:首先仔细阅读提供的文章标题和正文内容,这是理解文章主题和

目的的关键

…##【注意事项】完成该任务需要注意以下几点:1.

**标题与正文内容结合分析**:文章的标题往往能提供关键信息,但要结合正文内容综合判断...##【参考样例】###

样例一…###

样例二…##【待分析内容】…请根据【任务描述】针对【待分析内容】进行分析,并且参考【参考样例】

、给定的【任务步

骤】和【注意事项】

。请先一步一步详细的给出推理过程,然后给出结果

。ICL优化实践:

基于Meta-Prompt的提示词优化实践支持Instruction和Demo的快速扩展与反馈迭代【任务分析】

提示词扩展针对该提示词,

可通过下列维度提升清晰度

、全面性和实用性:1.明确定义各类型特征:

2.

引入评估框架:

…2.增加操作性指导:

3.补充案例分析:

…样例1:xxx…

…样例2:xxx…

…样例3:xxx

样例N:xxx明确文化元素与情境的区别,

当广告主要利用特定文化背景

、节日或活动吸引目标群体,

增强内容的相关性和吸引力时,

用于构建与特定社群的身份认同和兴趣共鸣时,

优先考虑“文化连接

”Meta-Prompt

Framework【改进建议】

提示词迭代样例扩展针对复杂任务可自动拆解步骤提供细粒度的控制与更好的推理可控性AutoTask

Decomposition专有知识融合能针对不同任务类型补充专业知识结合领域特定增强提示词一次性优化率关注类内与类间差异性关注遗漏

、多余

、混淆信息关注常见文体与创作维度关注回复相关性

、情感化

、事实性等维度Task

Oriented优化改进提示词结构化生成提供ICIO/CRISPE/RASCEF等

优化方法,

并支持已有提示词解析上文信息

任务描述考虑到当前的全球供应链危机

,请提供一个详细的清单,列出对小型企业影响最大的五个因素,并解释每个因素的具体影响

。每个因素请用短句

进行描述

,并用编号列表来组织

。请保持描述简洁,每个因素不超过两句话

,并避免使用行业术

。例如:

1

.物流延迟一由于海关清关时间增加,小型企业面临货物配送延误的问题样例参考格式说明复杂Prompt最佳实践指导Meta-Prompt演进1

结合任务特点的提示词快速优化复杂任务拆解支持步骤三步骤二步骤一输出格式指示限制条件样例输出结合上下文判断涉及的商品判断是售前

、售中或售后类问题针对售后问题提取具体反馈角色设定任务描述注意事项操作步骤分类对话抽取写作结合不同元素采用多种压缩方法保障基础效果减少推理时延与Token消耗请分析广告类别,

标签包括xx

、xx

…具体要求:-基于对广告内容的深入分析,

对比任务描述中各类别钩子

的定义,

进行严谨的类别判断

。-确保所选类别准确反映广告最显著

、最具吸引力的内容钩

子特征,无任何概念混淆或类别交叉

。-在面对复杂或混合型广告时,

能够果断选取最具主导性的

钩子类型作为最终输出,

展现出清晰的决策能力

。相关示例:-输入:

低减脂人不知道的秘密~冰的热量低,

而且老冰棍

35大卡,

冰加蓝莓64大卡...,

减肥馋了该吃什么,

大家get到了吗?

-

输出:

内幕解密核心指令分析与保留语义梯度高效优化结合语义反馈

、指标反馈与mini-batch优化提升优化效率,

提升优化稳定性x

epoch当前提示词错误分析…

Prompt

{j}修改建议(

gradient

)…优化更新(

optimizer

)基于语义梯度的优化流程全局均衡采样采样鲁棒性高超大数据集处理效率高反馈集☐☐

☐。☐☐☐☐☐

☐☐

☐正样本

负样本结合当前Good/Bad

Case自动选择Meta-Prompt演进2

–基于结果反馈的提示词自动迭代层次化提示词压缩。。。<B

h

>atc

__{j}抽样推理质量判断。。(loss

)。。。。。。。。

Time

step1CandidatesTime

step2CandidatesTime

step3Candidates难样本生成

增强Boundary

CaseEvolutionSynthetic

DataGenerationOutput

--Post-Refine

LLM

Feedback多样性样本

生成增强Tree-basedSearchAB-

-

"

ABDDE[]AB-

-

-

-

-

-

-

"

"CEDEInputXX城市属于XXOutputInput:成都属于哪个省份output:成都是四川的Input:

重庆是哪个省的城市Output:

重庆是直辖市input:

南宁是云南的城市吗?Output:

南宁是广东省的城市Meta-Prompt演进3

–样本生成能力持续增强提供相似/差异化/易错案例的自动扩展能力,减少人工维护成本input:长沙属于哪个省output:长沙是湖南的1.

问答格式遵循2.答案是对的1.

问答格式有变化2.答案是对的1.提问答格式有变化2.答案是错误的相似案例差异化案例错误案例Input:

西宁是新疆的省会?Output:

西宁是甘肃省的省会Input:武汉属于哪个省份Output:武汉是湖北的Input:武汉是湖南省的吗Output:武汉位于湖北省Boundary

EvolutionInput-

-

-

-

-

-

"

AEABC-

"

-

"`、DECD`

CCEABCCCAADDBBE、产品营销广告依据内容钩子可以分为以下几个类别:1.故事悬念

2.信息缺口

3.冲突...诉我属于哪种类型【核心技能】-内容理解与分析:精确解读短视频广告的内容,包括叙事结构

、关键信息

冲突元素

、结局设计

…-精准归纳与表达:识别核心钩子类型,运用精炼的语言进行高度概括

…-…【注意事项】-

深入挖掘广告中的文化符号

、传统特色及品牌历史等信息-

…-

关注广告中是否独家揭露秘密,

引起观众好奇心【参考样例】-输入:减肥圈里的小秘密,其实吃对了,零食也能助燃脂!一小包坚果(约30g

)仅150大卡,小块黑巧才50大卡…这些业内人不轻易说的小技巧,你学会了吗?-

输出:

内幕揭秘…Query-specific

PromptMeta-Prompt演进4

-从静态到动态提示词基于离线指令与样例自动挖掘注意点与易错样例,增强实时推理效果【分析内容】

低减脂人不知道的秘密

告诉你一些简直人都不知道的秘密

冰的热量低,

而且老冰棍35大卡,

加蓝莓64大卡

.

.

.

减肥馋了该吃什

么,

大家get到了吗?自动挖掘样例与提示结合Query动态组装样例与提示动态推理(在线)指令提炼(离线)样例增强(离线)Query

——

内幕揭秘

错例库相似样例合成差异化样例合成易错样例合成\.类别分布平衡动态样例库样例扩展样例清洗精细化迭代最佳指令样例集合InstructionInput

Content<>基于推理反思基于多样性生成Meta-prompt

Formatting

实时检索Top-K样例动态Tips负例正例是否扩充多次迭代n

--------------n

--------------训练集是否对比维度DSPyTEXTGRADMeta-Prompt优化性能(耗时)Instruction优化分钟级别小时级别分钟级别Instruction自动优化基于样例特点优化基于结果反馈迭代优化无样例/训练数据优化Instruction优化稳定性原始任务描述保留程度低中高ICL自动优化ICL样例筛选ICL样例合成Meta-Prompt92.082.080.184.7(复杂指令)原始PromptDSPyTEXTGRADMeta-Prompt分类(

ACC)69.235.341.972.0抽取(F1

)66.930.657.568.6写作(

Score

)70.568.169.974.3RAG(

Score

)71.5

44.0

54.575.3

原始PromptDSPyTEXTGRADObject

Counting(

ACC

)77.884.991.9Word

Sorting(

ACC

)76.779.879.8GSM8K(

ACC

)72.981.181.1Average(ACC)75.881.984.3框架能力对比Meta-Prompt同主流开源框架对比业务数据集效果对比

(Qwen2-72b)公开数据集效果对比

(GPT3.5-Turbo)相比较DSPy/TextGrad等框架在性能与效果上均有明显优势数据引用出处:Yuksek

gonul,

Mert

et

al.“TextGrad:Automatic"Differentiation"viaText.

ArXiv

abs/2406.07496

(2024):

n.

pag.Keypoint抽取重复检测内容维度

任务维度指令演化种子样本种子样本格式种子样本KeypointValues构建&采样样本集合指令扩充JSON丰富度检测内容维度

任务维度KeypointValue

Generation任务类型多粒度

内容分类金融实体抽取个性化

营销创作Qwen-Max60%62%71%Qwen-Max+APE78%72%73%Qwen-Turbo+SFT

(LoRA)70%54%73%Qwen-Turbo+Meta-SFT

(LoRA)85%73.5%75%SFT优化实践:

基于Meta-SFT的自动化数据合成与微调极大降低数据需求,

支持对输出和延时有更高要求的场景适配特点3:

更快的推理速度将任务知识从大模型压缩到小模型,推理速度提升约80%特点1:

数据构建成本低仅需少量标注数据

,实现高质量数据扩充和模型自动微调特点2:

更遵循回复要求针对输出格式

、回复风格等个性化指令遵循更稳定Prompt

Expansion

Post-Scoring偏见检测任务描述质量检测销售领域短文角色汽车营销主题语言形态中文…………自动评估实践:

基于Meta-Evaluator的自动评估增强无需手工设置评估器,

结合任务自动生成评估维度与说明任务描述(User/Module

Specific)产品营销广告依据内容钩子可以分为以下几个类别,请根据输入内容给出具体标签…任务评估

维度参考任务评估

最佳实践解释补充维度n

:xx分...综合评价

:xx分打分原因

:xxx评估项适配评估器

Themis

丫模型A模型B…

…打分维度抽取的召回率-正确答案中的主体被抽取结果覆盖到的占比,计算方式为召回率的定义:

。-抽取的精准率-模型最终抽取结果中的主体命中正确答案的占比,

计算方式为

精准率的定义:

…打分标准请按照1-10分的规则对模型生成的答案进行打分1分:

最终抽取结果中主体完全不准确1-3分:

…3-5分:

…8-10分:

最终抽取结果中主体非常准确

…打分一致性0.8738打分一致性0.8710注意事项准确区分实用教学与单纯强调产品优惠的不同

。前者更关注广告中详细的产品使用方法

、功效介绍及应用场景展示等教学元素

。打分一致性0.7892打分一致性0.8247ExplanationExplanationCriteriaCriteriaCriteriaCriteriaAspectsAspectsAspectsTips…应用发布轻量训练动态Prompt对话RAG分析

抽取写作总结WorkflowAgent/Multi-Agent样例合成&训练(可选)参考样例生成训练样本生成问答Prompt阿里云百炼:

提供应用全链路可运营支撑用户动线应用需求可运营能力支持效果观测A/B对比TracingAI辅助评测批量推理模板初始化提示词扩写评测器适配评测集扩充结果采样错误分析

可观测

可迭代

易接入提示词构建/扩展评测集构建(可选)应用支持任务支持效果验证反馈迭代谢谢Thank

YouAI运营实践分享—PE及RAG的实施方法论吴倩阿里云智能集团飞天实验室高级运营专家2024/09/19测评标准模型结果的好坏,

需要有明确的标准,

用来衡量模型实施的当前效果和目标结果的差距场景效果的衡量标尺建设配套提效工具,

从数据构建到评测,

再到优化,

辅助运营同学更高效的使用大模型实施效率的提升模型效果评估依赖一份完整,

全面,

客观的测试数据,

帮助模型实验过程中不断修正和完善效果测评的Benchmark结合模型特性及场景需求,

沉淀行业场景下的实施sop和方法

,模型应用的效果可以得到保障实施质量的关键AI应用的实施组件运营方法论运营工具测评数据Part

1提示词工程设计方法论Methodology

of

promptword

engineering

designPE策略业务分析格式

、规则

、个性化定义等收集必要要素

编写prompt量化优化的表现结构化框架

、填充分析结果整体方案输入生成应用业务数据LLM生成解析投入使用数据清晰可用,

直接基于任务prompt,

生成结果,

即可投入使用数据处理多agent协作完成结果转换加工使用对输入数据清洗至更适用模型使用,

通过多agent方案得到结果,

对结果再做后处理及应用为交付中的主要环节,

包含四大步骤:•建立评估体系:定义指标体系

、收集测试数据,

以检验表现•数据归类分析:分析输入数据提炼关键要素,转化为指令•

Prompt框架搭建:参考已有案例模版&写法策略搭建初版•

Prompt实验优化:

by

case优化迭代promptPE

-影

LL

M

成内

现结

-下

来LLM生成结果后,取目标字段对接业务系统

,或解析后应用于业务场景

,实现最终业务需求需

焦-

LL

M

么PE实施PE

应用深入理解需求

、实现目的和期望效果等,

以明确LLM生成的内容和指标结果PE实施概览应用实验测试数据量递进策略

反馈优化prompt实验动作

指标观察Badcase特征抽取简单场景复杂场景需求模型输入的重要性

提示词用得好不好,

输入内容也很重要提示词的不可复制性场景不同模型,

同场景不同业务,

不一定适用提示词的详实度不是写的丰富效果才好,

重要的是模型能把需求理解到位先解决高频业务,

再逐步覆盖长尾业务,

逐步提升整体效果O

优先级的区分定义清晰的先解决,

再来分析和重新定义不清晰的需求

从1到N的攀升从bad

case出发,

错误类型较多的着手,

抽象和迭代到prompt中PE实施的框架原则和优先级

0到1从哪开始结构化表达->善用分隔符,

让大模型更好地理解提示词内容关键信息强调->逻辑复杂类任务,

在prompt中反复强调,

增加其在大模型记忆中的权重补充专有知识->非通识场景,

建议在prompt中补充相关垂类知识,

增加模型学识Few-shot应用->prompt中添加示例帮助大模型从少量示例中学习和概括信息关键需求后置处理:指令遵循效果较差的需求,

放在prompt靠后的位置指定任务按步骤执行:

建议大模型按指令步骤完成,

在prompt中明确这些步骤,

不要一气呵成增加检查步骤:

部分指令未被完整遵循,

可在prompt尾部要求大模型在输出前逐步检查,

并按步说明检查项先依据后结论:

对分析判断型任务,

要求大模型先输出结论的判断依据,

再给出推理的结论指令怎么下达基于提示词的基本原则-清晰且具体

、给大模型思考时间等原则下,

以下是项目中积累的部分最佳实践

。模型在想什么为模型更好的理解任务需求,

建议先行了解大模型的推理过程或输出依据讲“大模型话

”持续迭代期,

对结果不满时,

引导大模型进行自我反思,

回顾其推理过程或输出依据,

了解错误背后的原因,

以指导prompt的优化

。初期,

基于需求要求大模型生成某任务所需的prompt,

以得到大模型可理解的prompt初始框架

。PE常用策略模型尺寸选择案例分享在对话场景中,借助LLM帮助企业完成业务分析

、销售线索分析

、市场统计和内部员工培训等工作。对较难被准确遵循的复杂规则可拆分为多条规则,

有助于提升效果,

如:•原prompt规则描述:“对于推销结果的判定,如果提及了【支付

、办手续

、签字

、合同】则是“成交

”,如果提及了【再看

、考虑

、不要

、再联系

、不需要

、放弃

、先不】则是“未成交

”,其他情况识为“无法识别是否成交

””•

拆分后:“-规则1:成交,对话提及支付行为,如:支付宝

、微信

、转账支付等视为合规-规则2:未成交,客户表达态度,如:考虑

、暂时

、不需要

、不升级

、不考虑等犹豫或否定词视为合规推销结果:从【成交

、未成交

、未知】

中三选一,参考规则1

、规则2的结论,得出结果

。“若审核项被遵循效果不稳定,

可在尾部增加【检查步骤】结合大模型错误响应原因,

prompt中要求大模型在输出前进行逻辑检查

。如易发生过度推理质

检规则时

,可要求大模型执行以下动作:"##在最终提交质检结果前,按步骤逐一进行逻辑检查,确保所有规则的应用合理,无明显错误

或遗漏###第一步:规则遵循检查,检查命中的结果是否遵循质检规则的字面含义,若自行添加或过度解读规则条件

,不能得出命中结果;"..更推荐:

先出依据,

再出规则命中结论约束输出内容&格式时,建议要求大模型先输出规则命中依据(如命中句子),再输出命中结果,相较准确率表现更佳,如要求大模型按以下格式返回下:{"scores":

[{"rule":"...","sentence":"命中的对话原文","match":"表示对话是否符合rule,给出

true或false结果","suggestion":"没有命中的原因或话术改进建议"}...prompt中明确质检的规则,

规则的定义描述,

直接影响LLM的生成表现:#

质检规则-“rule

”:

”质检规则1","describe":"对规则的描述"。-“rule

”:

”质检规则2","describe":"对规则的描述"

。…一般对话包含多角色

-客户&坐席,

需明确待质检对象,

可在思考步骤中体现如:…2.从对话数据中自动识别xx的角色与话术,xx会介绍

…(该角色的话术内容总结)

。3.结合上下文对xx角色的每一句话术进行合规性检查,对照质检规则逐一审核

。…热线场景有存在asr转写错误情况,

如若影响质检分析,

在prompt如下

说明:“有些词可能翻译描述错误,

你需要基于语境理解原本意思,

不要直接

因错别字判定不合规

”Prompt框架构成以markdown表达结构化形成prompt框架,含

<#角色

、#技能

、#思考链路

、#质检规则

、#输出格式>等部分典型case质检类型:

坐席服务质量检查

坐席服务项目确认◆

◆…

坐席服务结果判断

客户极端情绪判断◆◆业务场景:热线客服

在线客服PE实施上线运营指标对齐规则梳理实施路径现场客户接待数据收集效果验证网销电销…Part

2RAG的实施方法论Methodologyforthe

implementation

of

ragRAG应用的实施组件梳理服务场景了解用户需求确认业务目标制定评测标准知识采集知识分类知识清洗知识运营日志分析知识迭代链路策略交付阵型人员准备协作机制方案选型开发联调验证测试人力准备运营方案知识治理方案方案设计业务策略知识清洗非机构化知识文件名称规范化知识去重知识聚合&拆分内容归一化层级梳理复杂内容简化半结构化知识相似知识点拆分知识答案合并结构化知识内容归一化…

…知识分类区分业务类目例:

IT

、人力

、行政例:

售前

、售中

、售后结构化知识多文档规范数字化运营部门单文档规范名称规范标题规范格式规范内容规范业务部门补充缺失知识更新时效性知识持续进行清洗删除无效

、过期知识多模态HTML文档表格…

…多渠道多来源知识采集知识运营制定规范知识治理覆盖全面知识内聚数据脱敏效果反馈相互独立权限掌控规范统一质量跟踪…

…数据库对接客户官网直接获取内部文件库网站信息获取客服知识库API对接区分知识类型非结构化知识半结构化知识…

…谢谢Thank

You主题三着眼未来,

共建多元化的大模型生态模型+应用双轮驱动:

全面开放的大模型生态徐志远阿里云智能集团飞天实验室高级产品专家2024/09/19Part

1百花齐放的模型生态模型+应用双轮驱动,加速模型业务落地模型+应用双轮驱动,

开放不止一面全面开放的模型生态和应用生态,

资源共享,数据驱动,

连接企业客户与生态供给1

三方插件2

三方应用3

咨询服务4

集成开发通义自研

1商业闭源

2通用开源

3领域合作

4模型服务供给数据反馈优化应用模型以平台为中心,

聚合四大核心生态伙伴,

共创共赢模型

、应用

、插件

、服务,

围绕真实业务价值提供丰富供给,

百炼搭台,伙伴唱戏服务生态咨询型

、集成型合作伙伴,联合伙伴行业know

how优势共建联合解决方案,

收益共享,

为企业的定制化大模型落地应用提供专业服务应用生态基于通义基础模型

、百炼平台开发的AI原生应用产品支持SaaS/PaaS接入方式,上架百炼应用市场,

丰富大模型AI应用产品能力,

帮助企业低门槛接入使用插件生态数据查询服务相关API,支持百炼应用创建插件调用,

为开发者提供丰富的数据服务Agent开发更便捷模型生态基于阿里云算力资源训练的基础大模型服务,上架百炼三方模型服务,提供多元化模型服务生态阿里云百炼百川智能Bai

chuan2-Turbo

、Bai

chuan2开源系列模型月之暗面Moonshot-8k

、32k

、128k系列模型零一万物Yi-Large

、Yi-Medium

、Yi-Large-Rag系列模型Mini

MaxRekaFLUXab

ab-6.5t

、ab

ab-6.5s系列模型Reka

Core东南亚大语言

、多模态系列模型FLUX-Dev

、FLUX-Sch

nell开源系列模型Stable

DiffusionDeepSeek开放合作,

生态共赢Stable

DiffusionXL开源系列模型DeepSeek-v2开源系列模型更多模型,正在接入中..模型生态:

众多业内领先的模型合作方已上线百炼多领域

、多模态

、开源+闭源模型合作方,

为企业和开发者提供一站式模型服务双平台模型服务国内站+新加坡站双Region平台自主安全策略业内领先的自主安全策略国际化合规策略新加坡

、东南亚当地合规策略模型生态:

国际+国内双平台,

大模型出海的优选通道阿里云百炼(国内版)

+Model

Studio(国际版)

双平台,

为模型生态伙伴提供一站式出海合作模型生态:

百炼全工具链开放,

加速模型业务落地全工具链开放兼容三方模型,

平台协助效果优化,

与自研模型同等对待智能体Agent调度与决策模型V微调SFT+DPO+CT数据处理自动化数据加工与处理工作流模型服务工作流编排模型评测自动化模型AI评测应用观测全链路应用调用观RAG知识检索增强模型部署模型在线推理服务模型观测模型推理性能观测数据中心+应用中心+模型中心,三大核心工作链全面开放三方模型接入,

降显著降低模型交付成本,

帮助企业和开发者快速落地模型效果,

业内领先的安全策略和数据策略,

解决模型调用的后顾之忧20+工具链全面开放模型体验多模态模型在线体验数据增强自动化训练数据增强全链路大模型工具链Part

2业务为先的应用生态应用生态+插件生态,端到端的服务体系,

共享平台客户红利应用生态:

千行百业的商业化AI原生大模型应用无需开发,

多种场景开箱即用的原生大模型应用,基于百炼大模型平台+伙伴的场景know-how云市场三方应用联合阿里云云市场引入伙伴合作伙伴共建-百炼模型和工具+伙伴know-how百炼一方应用自建-阿里云&通义实验室析言GBI通过自然语言交互实现NL2

SQL、数据问答、分析

、洞察等多维度的大模型智能分析应用通义法睿面向律师

、企业法务等的法律智能助手,

支持合同审查

、法律咨询

、法律检索等万相营造阿里妈妈推出的智能创意平台,

广告推广

、运营

、设计师可依据货品素材进行AI创意生成ChatExcel借助阿里百炼的MAAS平台,

帮助元空AI灵活适配海量数据分析洞察i

Slide

智能PPT生成iSlide

AI

生成PPT联合阿里百炼击破打工人天命,解锁办公新武器More更多应用请访问百炼应用广场知微智鉴基于微博多年的风控经验和先进的AI技术搭建

,能迅速

、准确地识别出文本和图片中的潜在的风险内容全妙应用面向传媒

、营销

、办公等多行业及场景的多模态内容创作工具集通义万相企业版赋能企业智能设计,

支持图片生成与编辑

、Lora模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论