版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
免責聲明:AI
Agent
是一個被廣泛使用的詞彙,
故本課程中所講的AI
Agent不一定跟其他地方一樣(解決某個研究問題)假設
…
實驗
…
分析今天使用AI的方式人類給予明確指令AI
一個口令一個動作AIAgent人類給予目標AI
自己想辦法達成
「人工智慧代理人」
需要多步驟、靈活調整計畫AI
Agent
的翻譯AIAgentObservationAction
Goal好像在那裡聽過這個段落?這是
Reinforcement
Learning
(
RL)
常見開場AIAgent
(AlphaGo)“
5-5”Action
Goal贏棋Observation(RL:
Reinforcement
Learning)如何打造AIAgent?
RL?Reward“
5-5”Action
侷限:
需要為了每一個任務以
RL
訓練模型RL:
LearntoMaximize
RewardObservationGoal贏棋以文字描述(option)Goal“你要贏得勝利”如何打造AIAgent?
直接用
LLM!“我要下在
5-5”
轉譯為行動以
LLM
直接實踐人類對於擁有Agent
的渴望
Observation
Action
LLMLLM
能不能下棋?•
BIG-benchhttps://arxiv.org/abs/2206.04615LLM
能不能下棋?https://youtu.be/JHq4EKMg7fI?si=izKsH-GCVnZkooq_以文字描述(option)Goal“你要贏得勝利”如何打造AIAgent?
直接用
LLM!“我要下在
5-5”
轉譯為行動以
LLM
直接實踐人類對於擁有Agent
的渴望還有多遠?還可以多做什麼?
Observation
Action
LLM從
LLM
的角度來看Agent
要解的問題一直都在做接龍
AI
Agent
倚靠的是語言模型現有的能力goal
obs
1action
1obs
2action
2obs
3action
3LLMLLMLLMAutoGPT,AgentGPT,BabyAGI,Godmode
…https://youtu.be/eQNADlR0jSs?si=4y
GZEluAUzKK2VD0AIAgent不是最近才熱門•2023
年春天曾經爆紅過一次事先設定好有限行為只能在棋盤上的19x19
個位置落子近乎無限的可能可以使用工具以
LLM
運行AIAgent
的優勢TypicalAgentLLMAgentAlphaGoAI
programmerLLM
AgentAI
programmer以
LLM
運行AIAgent
的優勢為什麼是
-1???TypicalAgentCompile
ErrorCompile
Error更多資訊Reward
=
-1https://youtu.be/G44Lkj7XDsA?si=cMbKG3tqPbIgnnBqhttps://arxiv.org/abs/2304.03442AIAgent
舉例:AI村民組成的虛擬村莊"getting
ready
for
bed“
Action
Goal舉辦情人節派對、準備考試
…
…ObservationAIAgent
舉例:
Minecraft
中的AI
NPChttps://www.youtube.com/watch?v=2tbaCn0Kl90AIAgent
舉例:
讓AI
使用電腦Computer
Use,
OperatorAIAgent
舉例:
讓AI
使用電腦Goal訂披薩、上網購物
…ObservationActionAIAgent
舉例:
讓AI
使用電腦•
World
of
Bits:An
Open-Domain
Platform
forWeb-Based
Agents
(ICML,
2017)AIAgent
舉例:
讓AI
使用電腦Mind2Webhttps://arxiv.org/abs/2306.06070VisualWebArena
https://arxiv.org/abs/2401.13649WebArena
https://arxiv.org/abs/2307.13854AIDE:The
Machine
Learning
Engineer
Agent
https://arxiv.org/abs/2502.13138AutoKaggle:A
Multi-Agent
FrameworkforAutonomous
DataScienceCompetitionshttps://arxiv.org/abs/2410.20424AIAgent
舉例:
用AI
訓練模型goal
obs
1action
1obs
2action
2obs
3action
3LLM過
Strong
BaselineLLMLLMAIAgent
舉例:
用AI
做研究https://research.google/blog/accelerating-scientific-breakthroughs-with-an-ai-co-scientist/邁向更加真實的互動情境回合制互動goal
obs
1action
1obs
2action
2obs
3action即時互動
obs
1
goalobs
2例如:
語音對話 action
1action
2立刻轉換行動邁向更加真實的互動情境tell
me
a
story
ok
stop
I
don’t
likethestoryaction
1obs
3Once
upon
a
time
in
a
small
village
Sorry
…
…obs
1action
2obs
2Userhttps://arxiv.org/abs/2503.04721v1Guan-Ting
Lin(withcollaboratorsfromBerkeley,
UW,
and
MIT)邁向更加真實的互動情境AI如何使用工具AI
能不能做計劃AI如何根據經驗調整行為AIAgent
關鍵能力剖析根據經驗調整行為goalobs
1action
1obs
2action
2根據經驗調整行為u
uuu
u
nn
uuu
u
nn
uubUpdateParametersFeedback
Update你是軟體工程師
…(NotToday)寫一個
…LLM…
…goalobs
1action
1obs
2action
2根據經驗調整行為LLMFeedback
Update你是軟體工程師
…寫一個
……
…不斷回憶整個Agent
一生的經歷
…
超常自傳式記憶
(Highly
SuperiorAutobiographical
Memory,
HSAM)超憶症
(Hyperthymesia)根據經驗調整行為goal
obs
1
action
1…
…
obs
10000
?????LLMRetrieval其實這就是
RAG(自己的經歷vs.
別人的經歷)goalobs
1action
1…
…
obs9999action9999根據經驗調整行為ReadQueryDatabaseRelevant
Experienceobs
10000Agent’s
Memory?????StreamBenchhttps://arxiv.org/abs/2406.08747Goal:
Maximizetheaccuracyoverthe
sequenceQ3
Q1000
https://stream-bench.github.io/
(done
byAppier
Researchers)Q2Q1…
…StreamBenchhttps://arxiv.org/abs/2406.08747Q1
Q2
Q3
Q99Retrieval
ReadQ100Q65Q78…
……
…StreamBenchhttps://arxiv.org/abs/2406.08747StreamBenchhttps://arxiv.org/abs/2406.08747Negative
feedback
is
unhelpful.Q2
Q3
Q99Retrieval
ReadQ100Q59Q78Q1…
……
…StreamBenchhttps://arxiv.org/abs/2406.08747根據經驗調整行為
記下來?goal
obs
1
action
1Agent’s
Memory…
…
obs
9999
action
9999
(被雞毛蒜皮的小事塞爆)Relevant
Experience
obs
10000action
10000obs
10001根據經驗調整行為Relevant
Experience
obs
10000
action
10000obs
10001這件事要被記下來嗎?Writegoalobs
1action
1…
…
obs9999action9999Agent’s
Memory根據經驗調整行為Relevant
Experience
obs
10000
action
10000obs
10001Write對於記憶中的資訊做重新整理goalobs
1action
1…
…
obs9999action9999thought
2thought4thought
1thought
3ReflectionRead根據經驗調整行為Relevant
Experience
obs
10000
action
10000obs
10001GraphRAGhttps://arxiv.org/abs/2404.16130HippoRAGhttps://arxiv.org/abs/2405.14831goalobs
1action
1…
…
obs9999action9999Knowledge
GraphReflectionWriteRead有記憶的ChatGPT有記憶的ChatGPT有記憶的ChatGPTRead
模組啟動Read
模組啟動有記憶的ChatGPT•A-MEM:Agentic
Memory
for
LLM
Agentshttps://arxiv.org/abs/2502.12110
To
learn
more
…•
MemGPThttps://arxiv.org/abs/2310.08560•Agent
Workflow
Memoryhttps://arxiv.org/abs/2409.07429AI如何使用工具•工具可以看做是
Function,
使用工具就是調用這些
Function•使用工具又叫“
Function
Call”OtherAI(Different
capabilities,
stronger
but
costly)工具:
只需要知道怎麼使用,不需要知道內部運作原理語言模型常用工具Search
EnginePython如果遇到根據你的知識無法回答的問題,使用工具把使用工具的指令放在
<tool>和</tool>
中間,使用完工具後你會得到輸出,放在
<output>和
</output>
中間如何使用
所有工具特定工具使用方式現在你可以使用的工具如下:查詢某地、某時溫度的函式
Temperature(location,time)
,使用範例:
Temperature('台北',
'2025.02.22
14:26')(使用工具的方法很多,
這邊是只是一個通用的方法)System
Prompt<tool>Temperature('高雄',
'2025.03.
10
14:00')</tool>
這就是一串文字,
無法真的呼叫函式
2025
年
3
月
10
日那天下午
2:00
,高雄氣溫如何
User
Prompt如何使用工具語言模型gpt-4o-mini2025
年
3
月10日那天下午
2:00
,高雄氣溫如何(使用工具的方法很多,
這邊是只是一個通用的方法)如何使用工具Temperature使用者看到的輸出
工具使用方式
…
…
System
Promptgpt-4o-mini不需要呈現給使用者看tool
Temperature('高雄',
'2025.03.
10
14:00')/tool
output
攝氏
32
度/output(繼續去做接龍
…
…
)2025年
3
月
10日下午
2:00
,高雄的氣溫為攝氏32度。Agent
開發者先設定好的流程User
Prompt不需要呈現給使用者看語言模型最常使用的工具:
搜尋引擎RetrievalAugmentedGeneration
(RAG)使用其他AI作為工具他說「大家好」應該是心情蠻好的這個人在說什麼?語言模型語言模型語言模型這個人心情怎麼樣文字指令文字回應https://arxiv.org/abs/2407.09886使用其他AI作為工具Dynamic
SUPERB
上的結果https://arxiv.org/abs/2407.09886Chih-KaiYangChun-YiKuanHundredsofTool
Descriptions非常多工具怎麼辦?obs
1action
1Tool
UseHundredsofTool
DescriptionsAgent’s
Memory非常多工具怎麼辦?selectedtoolsToolSelectionhttps://arxiv.org/abs/2310.03128https://arxiv.org/abs/2502.11271action
1Tool
Useobs
1TroVE:
https://arxiv.org/pdf/2401.12869LATM:
https://arxiv.org/abs/2305.17126CREATOR:
https://arxiv.org/abs/2305.14318CRAFT:
https://arxiv.org/abs/2309.17428selectedtoolsToolSelection模型自己打造工具HundredsofTool
Descriptionsaction
1MakeToolsAgent’s
Memoryobs
1因為過度相信工具而犯錯
…因為過度相信工具而犯錯
…工具工具Sourceofimage:
/posts/petergyang_google-ai-overview-suggests-adding-glue-to-activity-
7199246664329551872-9VdY/假如工具有問題
…
以
RAG
為例…
工具因為過度相信工具而犯錯
…不要完全相信工具,要有自己的判斷力不要完全相信工具,要有自己的判斷力因為過度相信工具而犯錯工具語言模型有沒有自己的判斷力?
工具使用方式
…
…
System
Prompt
2025
年
3
月
10
日那天下午
2:00
,高雄氣溫如何
User
Prompt不需要呈現給使用者看
!
"
不需要呈現給使用者看
<tool>Temperature('高雄',
'2025.03.
10
14:00')</tool>
<output>攝氏
100度</output>
(繼續去做接龍
…
…
)2025年
3
月
10日下午
2:00
,高雄的氣溫預測為攝氏
100
度。語言模型gpt-4o-mini◆(繼續去做接龍
…
…
)2025
年
3
月
10日下午2:00
時,
高雄的氣溫為攝氏
10000
度。這個數值顯然不合常理,
可能是工具輸出錯誤。如需其他信息
或查詢,
請告訴我
。
工具使用方式
…
…
System
Prompt
2025
年
3
月
10
日那天下午
2:00
,高雄氣溫如何
User
Prompt語言模型有沒有自己的判斷力?<tool>Temperature('高雄',
'2025.03.
10
14:00')</tool>
<output>攝氏
10000度</output>
不需要呈現給使用者看不需要呈現給使用者看語言模型gpt-4o-mini語言模型在做
RAG
時
…
…什麼樣的外部知識比較容易說服AI
…
…External
KnowledgeInternalKnowledge什麼樣的外部知識比較容易說服AI
…
…https://arxiv.org/abs/2404.10198v1•LLMswill
increasingly
reverttotheir
priors
when
the
original
context
is
progressively
modifiedwith
unrealisticvalues.•
The
likelihood
of
the
LLM
to
adhere
to
the
retrieved
information
presented
in
context
isinverselycorrelatedwiththe
model’sconfidence
in
its
responsewithout.答案是A什麼樣的外部知識比較容易說服AI
…
…
答案是
C答案是
B答案是A
傾向相信AI
同類的話https://arxiv.org/abs/2401.11911什麼樣的外部知識比較容易說服AI
…
…Meta
Data
的影響•語言模型比較相信新的文章•資料來源沒有影響Cheng-HanChianghttps://aclanthology.org/2024.bl
ackboxnlp-1.24/什麼樣的外部知識比較容易說服AI
…
…Meta
Data
的影響Claude
3
比較贊同下面那邊文章Cheng-HanChianghttps://aclanthology.org/2024.bl
ackboxnlp-1.24/一模一樣的內容就算工具可靠
…
不代表AI
就不會犯錯•
就算所有找到的資料都是對的,
也不保證答案就是對的ChatGPT
Search(同樣的輸入目前已經沒有這樣的問題)使用工具與模型本身能力間的平衡•
用工具不一定總是比較有效率•
如果要做數學運算,
用計算機一定比普通人心算快嗎?問題:
3x
412AI
能不能做計劃?做計劃Reactive
Response?goal
obs
1action
1obs
2action
2obs
3action
3Planning
、'Plan-and-SolvePrompting:ImprovingZero-ShotChain-of-ThoughtReasoningbyLargeLanguageModelshttps://arxiv.org/abs/2305.04091天下沒那麼好的事情計劃就是要拿來改變的 obs
1planaction
1obs
2action
2obs
3action
3做計劃action
2action
1action
3planplan'action
2,
action
3,action
3•下棋:
對手的招數跟預想不同•使用電腦:
突然跳出廣告視窗與預期不同,
導致原有的計畫行不通做計劃obs
1
planplanaction
1action
1obs
2
plan'action
2,action
2語言模型有能力做計畫嗎?gpt-4ohttps://arxiv.org/abs/2201.07207可以執行的操作:1.從桌上拿起一個積木2.從另一個積木上拿起另一個積木3.把積木放到桌上4.將一個積木堆在另一個積木上初始狀態:
藍色積木在橘色積木的上面,紅色積木在桌子上,
橘色積木在桌子上,黃色積木也在桌子上
。目標:
讓橘色積木放置在藍色積木上。1.將藍色積木從橘色積木上取下2.將藍色積木放在桌子上3.從桌上拿起橘色積木4.將橘色積木堆放在藍色積木的上方會不會
LLM
早就看過類似的題目了?https://arxiv.org/abs/2206.10498https://arxiv.org/abs/2305.15771PlanBenchP
n
Bench
ttp
//
i
/
b
/2206
10498攻擊吞噬屈服征服神秘方塊世界(讓物件c
渴望物件
a)https://arxiv.org/abs/2305.15771https://arxiv.org/abs/2409.13373TravelPlannerhttps://arxiv.org/abs/2402.01622https://osu-nlp-group.github.io/TravelPlanner/https://arxiv.org/abs/2402.01622https://osu-nlp-group.github.io/TravelPlanner/https://arxiv.org/abs/2404.11891https://arxiv.org/abs/2404.11891實際試試看?action
1-1obs
1
action
1-2action
1-3如果路徑太長怎麼辦?action
2-1-1action
2-1-2action
2-2-1action
2-3-1action
2-3-2obs
2-1-1obs
2-1-2obs
2-2-1obs
2-3-1obs
2-3-2強化AIAgent
的規劃能力obs
2-1obs
2-2obs
2-3有機會嗎?
沒有
action
1-1
obs
2-1
減少沒必要的搜尋obs
1
有機會嗎?
有
action
2-2-1obs
2-2-1action
1-2
obs
2-2https://arxiv.org/ab
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2021-2025年法考主观题商法真题及答案解析
- 广东水务集团招聘真题
- 地铁集团应聘笔试题库
- 六年级上安全教育教案2
- 江苏省高校教师资格认定考试高等教育理论综合(高等教育学)真题试卷汇编18
- 临床生物化学考试题目及答案解析
- 解密中考《红岩》试题及得分答案
- 湖北省来凤县2027届九上数学期末质量检测试题含解析
- 江苏省扬州市广陵区2027届数学八上期末联考试题含解析
- 夏季防中暑班会课
- 2026八年级历史上册教材课后习题答案(1-16课)
- 天宫殿街道养老服务中心与社区居家养老服务站运营方案
- 加油站油气回收系统安装监管
- 公路安全设施劳务合同
- 服务方案-某消防救援大队车辆定点维修服务项目
- 水稻全程机械化栽培技术
- 初中数学:七八九年级全六册知识点总结(冀教版)
- 《无人机培训教材》课件
- key-hole经皮内镜颈椎间盘摘除术治疗神经根型颈椎病后路2
- 玉米密植精准调控高产技术-李少昆
- (高清版)JTG 3810-2017 公路工程建设项目造价文件管理导则
评论
0/150
提交评论