关于 DeepSeek Harness 的 100 个问题_第1页
关于 DeepSeek Harness 的 100 个问题_第2页
关于 DeepSeek Harness 的 100 个问题_第3页
关于 DeepSeek Harness 的 100 个问题_第4页
关于 DeepSeek Harness 的 100 个问题_第5页
已阅读5页,还剩160页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第一章.模型之外的隐形战场 2.都说AGENT猛,我一用就翻车,差在哪? 3.HARNESS到底是个啥,真是模型外面那套马具吗? 4.大厂为什么招HARNESS工程师,这是算法岗还是系统岗? 5.2026年多家官方资料都在谈HARNESS,为什么OPENAI官方中译把它写成「工 术」? 6.我越调PROMPT越没用,问题出在哪? 7.HARNESS、PROMPT、MCP、RAG到底啥关系? 8.同一个模型换个HARNESS,排 9.为什么说换HARNESS可能比换模型更关键? 10.AGENT跑完了为什么不叫我? 11.OPENAI官方已经把HARNESSENGINEERING译成「工程技术」,这个译法能被中文 12.为什么说HARNESS是「隐形战场」? 14.市面上的HARNESS这么多,分别替你扛哪段系统责任? 第二章.三行命令先跑起来 17.NPX装DSH总失败,先怎么判断卡在哪一层? 20.起好AGENT后第一步该干啥? 21.我想接CLAUDE或GPT,能行吗? 24.APIKEY填不进界面怎么办? 25.WINDOWS上一跑就静默退出,怎么分诊? 26.我该把第一个AGENT用在哪? 28.怎么确认我跑的是真AGENT不是套壳? 第三章.打开机箱全是插件 30.CORDIS凭啥管住这么多插件? 33.STANDARD和CODE模式差在哪? 34.CREATOR模式是给谁用的? 41.SESSIONLOG是干嘛的? 42.TRAJECTORY视图强在哪? 43.SESSIONLOG怎么帮我排错? 46.我想回看AGENT哪步调了什么工具? 54.学HARNESS该先读哪些一手资料? 55.横向跑分怎么避免把模型、HARNESS和配置差异混在一起? 56.只换HARNESS不换模型,成功率和单次成本真的会变多少? 第五章.场景实战抄现成轮子 60.我想用AGENT帮我写周报,能吗? 61.做研究时怎么让AGENT帮我读论文? 63.哪个开源HARNESS最适合我抄? 64.浏览器自动化有现成HARNESS吗? 65.AGENT长期记忆怎么接,三个流派选哪个? 67.多AGENT协作怎么搭? 68.做评估用哪个HARNESS? 71.有没有明天就能CLONE跑的合集? 第六章.让生产不翻车的工程 75.工具选错AGENT就瞎搞,怎么约束? 76.AGENT死循环怎么破? 79.出错了AGENT会自己恢复吗? 80.怎么验证AGENT真按规矩办? 81.多AGENT怎么避免互相打架? 85.上生产前必过的CHECKLIST有哪些? 第七章.比工具更耐久的判断力 87.最好的HARNESS是什么样? 89.怎么读懂一个HARNESS的设计哲学? 93.过度依赖HARNESS会怎样? 94.HARNESS会取代程序员吗? 95.我怎么建立自己的HARNESS判断力? 97.一个排名靠前的开源HARNESS也可能说关就关,怎么判断项目值不值得跟?.102 第一章·模型之外的隐形战场你大概也有过这种经历:同一个模型,同事用起来又快又稳,你用起来不是是死循环,换了个更新的模型,该翻车还是翻车。问题多半不在马,在马具。章先把「harness」这个词拆明白,包括它是什么、为什么大厂集体在换个马具比换匹马还管用。看完这章,你再听人聊Agent,耳朵里就不全是。模型能力不够是胡说的一种,但更多时候是它压根没拿到该拿的东西查的资料没工具可查,该知道的背景没人喂给它,干完了还没人检查。这三件harness负责让它把事做对,包括给它上下文、给可行的方案」「没做充分测试就标记功能完成」,这些毛病换个更强的模型照样有,吃进文本和图片、吐出文本,仅此而已。维持跨轮次的状态、执行代码、获取实时知识、搭环境装依赖,这四件事它一件都办不了,而这些全是harness连「聊天」这个最普通的体验,都是harness给的:把模型包进一个循最强的模型也躲不开。Anthropic官方做过实验:让旗舰模型在官方S一种是想一口气把整个应用干完,上下文烧到一半留下个半成品,下一个会话原话叫「没做充分的端到端测试就标记功能完成」。这两种病,换更强的模型好,得靠拆细任务、进度落文件、干完先验再宣从时间线上看,大家的解法也确实一代代往外扩:2022到2024年研究怎么给它配一整套控制系统。你越调prompt越没感觉,多半是下次它胡说,先别急着换模型,把那次对话的记录调出来问三个问题息查了吗?它看到的信息是对的吗?它干完有人验吗?三个答案会告诉你问题1)LangChain对公式的原始拆解https://www.langch2)Anthropic工程博客/engineering跑,比如上下文越滚越长、工具越调越多、中间状态越攒越乱,而这三样恰社区里的翻车吐槽翻来覆去就那几个词:上下文爆了、工具选错了、死循环态丢了、出错了查不回去。有人做过狠实验:同一个模型接进八套不同的harness,跑同一批25个任务,通过率最低68%,最高88%已经变成了「每次对代码或结果不满意,就去调harness」。另不过先别急着把锅全甩给harness。翻车到底怪哪一层,得验证近一次翻车按四层记一遍:任务是什么条件、它看见了什么信息、它调了什么工具、//question/2071/记住一个口径就够用:harness是Agent里除模型之外的一切,工具怎么调、权限怎么限、状态怎么存、结果怎么验。模型是马,harne马身上那套缰绳加马鞍加刹车,光有马跑不了车,光有马具也包括系统提示、工具描述、输出怎么解析、上下文怎么管;harness是里面的层,负责调模型、处理工具调用、决定什么时候停。原话就一TheharnessiswhatmakTheharnessiswhatmak它还引了ClaudeCode官方文档的一句话当宽口径的代表:「Clastheagenticharne跟scaffold是哥俩。还有家厂商数出了八个组件。你不用背这些,Anthropic官方从头到尾只「用」过这个词,从没正式「定义」过它——网上流传的智能体的那套行头。LangChain有句话传得最广:你要不是模型,那你给人解释的时候就用那句大白话:大模型是匹野马,harness就是让它拉车1)MartinFowler站的harne2)HuggingFace术语辨析https://huggingface.co/blog/agent-4.大厂为什么招Harness工程师,是系统岗,而且是公开在招的那种。腾讯WXG挂着「工程师-Harness这岗位要的东西跟炼丹没关系。看看要求就明白:系统设计、工具链、沙箱可观测性,全是工程活。最硬的证据来自OpenAI那篇官方文agent写代码,人类工程师的主要工作变成了「让agent能干活」,比如设计环境、写清楚要什么、搭反馈回路。代码是agent写的,但让agent行代码、一千五百个合并请求,人均每天三点五个PR。文章里的金句能不能管好沙箱和权限?懂不懂可观测和评估?这三个都比「会不会训模1)36氪崔添翼人物稿https://m2)OpenAI官方文章/index/harness-e5.2026年多家官方资料都在谈har写成「工程技术」?程技术」。原文标题《Harnessenginee顺带说,这场定名不止harness一个词。同一篇官方中译里,agent体」、context译作「情境」、goldenprinciples译作「黄金原则」,整套术语Anthropic工程博客把harness写进文章标题,官方arXiv两篇论文:比较Agent必须披露harne但要说清楚一件事:各家是在「使用」这个词,不是在「定义」它,定义权1)OpenAI官方中译/zh-Hans-C2)Anthropic首篇harness文/engineecontextengineering,管的是每一步给模型看什么信息,比如Anthropic给contextengineering下过官方定义:在推理时精选并维护「集合」的一整套策略,管的远不止提示词,还包括工具、MCP、么你调完prompt的第二天,效果你越调越没感觉,多半是拿着一楼的钥匙去开三楼的门。对号入座一下:任外部信息、你反复把资料贴进对话——这是context层的事,该挂个检要实际动手、改文件发请求——这是harness层的事,该给它工具。有个简单的分诊办法:拿最近一个调不动的问题,判断它需要模型「知道更/engineering/effective-cont2)MartinFowler站的分层视角https://martin这四个词最容易被搅在一起,其实一个比一个具体:harness是整套系统,prHuggingFace术语表里对model的还有个容易忽略的事实:模型、harness、产品是三样两个产品用同一个底层模型,体验可以完全不同,因为它们的harnes选择;反过来,往同一个harness里换一个更强的模型,体验也会这行概念多到什么程度?连DSH官方都专门维护了一份规范术语表汇定唯一说法,轮次、步骤、目标循环这些词在里面都有明确定义——查词这件事,词插座标准(AI的知识补给具给不给模型用、怎么描述、结果怎么回传、出错了怎么办,这些还是haai/deepseek-harness/blob/master/docs/gloss2)HuggingFace术语辨析https://huggingface.co/blog/agent-型,只改harness,比如调系统提示、改工具、加了个死循环检Bench2.0这个终端任务榜上,得分从52.8%涨到66.5%,排名从三十名开外冲进死循环检测,还有一个叫「reasoningsandwich」(推理三明治)的算力更扎心的对照组:同期换个更强的模型,通常只能涨6.8个百分点。效果差不多是换模型的两倍。这个榜本身也说明问题——它的条目都是按「harne只改了harness。单次实验,别吹成「任何场景改harness1)LangChain官方复盘with-harness-engineering2)Terminal-Bench2.0榜单https://www.tbench.ai/leaderboard/termina上下文、每一个错误处理得好坏、每一次「算不算干完」的判断,在学术界把这事写成了论文,结论很硬:长程任务上,harness带来的差具体哪几个环节在放大差异?四个:上下文越滚越长之后的取舍、工具出错的累积、跨步骤状态的保持、什么时候停的判断。所以接长活之前,先看马具的三张底下模型的弱点打的绷带,随着模型变强会「几乎肯定逐渐消解」。但那是未来的事,1)arXiv论文「比较Agent必须披露harness」2)LangChain复盘/blog/improving-deep-aDeepSeek的模型是纯文本的;两个任务跑第一个坑,有人实测复杂任务跑三十分钟以上,全程无人提醒,跑没跑harness的开发者」测试用的,核心插件和A现在优先服务盖房子的人,住客的便利设施(比如跑完通知)还排在后面的工单上。现阶段对付「不叫你」,官方留了个替代方案:会话日志。DSH把模型看到样东西都记进一条只增不删的日志,你切回浏览器时不用猜它干到哪了,轨里每一步都摆着——通知没来之前,自己看日志是最靠谱#批量任务三件套(跑长任务前必做)1.每个任务独立目录:task-01/task-02/,绝不共用一个文件夹2.跑前写验收清单:这个任务干完应该存在哪些文件、长什么样3.定时回看:自己设个闹钟轮询状态,别指望它叫你2)GitHubDiscussions(最新反馈都在这)httpsai/deepseek-harness/di难。官方定名是事实——OpenAI的中文版页面白纸黑字写着《工程技术:在优先的世界中利用Codex》。但社区不买账也是事实,大家在就在于那个画面,比如模型是野马,你给它套缰绳;译成「工程技术」,一篇文章吐槽这事:《Token刚定了中文名,AI圈又多了个翻译不了的词》。1)OpenAI官方中译/zh-Hans-C2)即刻社区的译名讨论/topics/55fadac08cc2——要么规则写了没人验,要么反复踩同一个坑。第一层,上下文管理:此刻模型能看见什么。第二层,工具边界:它能做什么、被禁止做什么。第三层,循环控制:多步任务怎么推进、什么时候打断。第四层证回放:结果谁检查、出了错能不能溯回去。中金六月那篇研报把它叫「模型之外、验证回放那层,Anthropic给了个能直接抄的做法:初始化的agent先把所以评估任何AI产品,别只会问「你们用的什么模型」。换成四个问么管?工具怎么限?长任务怎么控?结果怎么验?四个问完,你就把那匹马/articles/harness-e2)Anthropic长任务工程文/engineering2Tooldescriptions工具怎么描述、改名、限3Contextmanagement旧消息删不删、压不压缩、结果存不存文6Verification什么时候算干完,有没有人终检逐项验证的办法很朴素:同一个任务、同一个模型,一次只改一个因素,跑比如只换工具描述再跑一遍,通过率变了,你就抓到了一个命门。这六条还能反向用。Composio第二轮横评自己就交代了caveat:用了不同档位的推理强度,三十道题里有二十四道走了官方API——有一个因素没锁住,结论就脏了。所以六因素既是分析框架,也是审读别人这轮横评还有个统计值得咀嚼:八个框架里,有十二道题全员通过,十道题赢,三道题集体翻车。全员过的题,说明任务本身不难;集体挂的题,说1)Composio横评与六因素原文https://composi2)LangChain工业侧印证/blog/impragents-with-harness-eng给你,有的只卖地基让你自己盖,有的专做楼里的电梯调度。切的位置不同特点2.你愿意自己管模型key吗?不愿意=选带托管的;愿意=1)OpenAICodexCLIhttps://gi2)OpenCode/anomalyco/open3)Goose/aaif-g第二章·三行命令先跑起来这一章只干一件事:让你今天就把DeepS对。从装环境、选模式,到接你自己想用的模型、躲开Windows的那会有破坏性变更」,命令随时可能变,用之前对一眼官方文它不是玩具。跑起来之后,这整套东西是一个完整的harness,包工具、沙箱、会话日志,全部作为插件在跑。哪怕你选极简模式,它也带着—这是官方设计,不是坏了。它把「选工作区」当成安全边界,先圈定agen2)官方快速上手3)官方用户指南(中文,工作区细节出处)ai/deepseek-harness/blob/master/docs/user/guide/in能,Node.js是唯一的硬依赖。去下个LTS还有个背景知识让你心里有底:这个包在npm上一共就发过公开之前,它悄悄内测了三天。节奏还能更具体:正式公开当天,官方一口了rc.2、rc.3、rc.6三个版官方自己先示范了一遍。你现在用的东西非常新,遇到问题不丢人,去Disc2)npm包页面/package/@deep先别急着换镜像。失败至少分三层,包括命令层、网络层、版本层,一上来就分诊就一步:先跑npx@deepseek-ai/dsh--version。版本号都打不出命令解析层——Windows用户这时候多半是终端环境问题,换原生PowerShCMD再试一手。版本号能出来但web起不来,用下面这条抓报错,看版本和网络都排除了,再考虑换registry镜像重试,那是最后一招那个--dump-config参数值得记住,不止排安装问题用:它会把份打印出来,以后排查「我的配置为什么没生效」也靠它,一个参数两处用的哲学就一条:先定位层,再动手修——层没定位清楚之前,换镜像、#打不出版本→命令/包解析层问题(Windows用户换原生PowerSnpx--yes@deepseek-ai/dsh@latest--profileweb/deepseek-ai/deepseek-harn只留bash和str_replac顺带纠个偏:中文教程里流传的「PTC模式」不是官方名字,是媒体给C实战选法再给两条参考。想验证模型的Agent能力,先跑2)官方用户指南(中文)/deepseek-ai/deharness/blob/master/docs/user/gu3)AI星球评测(四模式实战建议出处)https://www.aixq.cc/Minimal模式只保留终端和文件编辑两个工具,用途是「在最小环境里评测模型」。它适合两种人。一种是只想让AI干活、一点配个体检,效果差说明任务需要更多支持,换Standard再跑一遍,差的环境完全对齐——你在家里跑的就是官方基准那套最小给你个真实参照:有人第一次测试看板任务,跑了两个半小时1)官方模式页(Minimal定位原文)https:/2)GitHubDiscussionshttps://github.co意思说。这种状态下你派什么任务都会翻车1)官方用户指南(中文,官方首测命令出处)httpai/deepseek-harness/blob/master/docs/user/guide/in2)官方用户指南(英文)/deepseek-ai/deharness/blob/master/docs/user能,而且这恰恰是DSH的设计初衷之一——它不锁自家模型。社认支持将近四十个模型,Kimi、OpenAI、Anthropic、Google家的都有,密提供方」,填ProviderID、基础知道:自定义的ProviderID是永官方在密钥这件事上的设计值得点赞:密钥是只写的,而且模型变更在下一次请求就生效,不用重启服务器——换模型试对接完别直接干正事,先跑一遍读文件测试,确认新模型和工具链通上了再模型从来不是换个名字那么简单,通不通测了才1)官方providers文档(含配置截图)https://githharness/blob/master/docs/user/guide/2)社区实测口径(近40模型)见AI星球评测https://www个机制——你可以在设置页添加自定义的模型服务地址;而「官方支所以分三层记:机制层,自定义provider是官方能力,确定有;路径层,Ol这条路的接法是社区教程给的,实测为准;动机层,想本地跑保护隐私是合理需求,但「隐私首选」是句营销话,不是验证过的结论。官方文档还有个诚实的细节:走原生认证的提供方(比如Bedrock、Vertex、Azure)各需要自己的原一个APIkey是配不通的——「一个key1)官方providers文档(自定义提供方与原生凭据)ai/deepseek-harness/blob/master/docs/user/guide/provid2)OpenAICodex的本地通道参照/index/unrolling,版也不用等用户升级。但代价也真实:多了一层「先起服务、再开浏览器」的动作而且社区实测超过二十万token之后界面会卡,那是个已知的性能上限。,车的系安全带。真需要纯命令行的,盯着Discussions的路线讨1)官方快速上手/2)「要客户端和CLI」的社区热帖/deepse/deepseharness/blob/master/docs/user/gu别在界面里死磕,先走环境变量。密钥这种东西本来就该放环境变量里,界死磕界面的人通常栽在三件事上:key粘贴的时候带上了空格或换行;网验证请求拦了;模型供应商有区域限制。这三种情况界面报错长得一模一样,模型不存在:选已配置的模型,或给自定义提获取可用模型返回401密钥不对:模型发现走的是OpenAI兼容的/models表里最容易冤枉人的是401那条。「获取可用模型」这个按钮走的是OpenAI兼容的/models端点,有些服务商压根不提供这个门——查不出模型key错了,手动把模型ID填进去照样能用。先分清「key不对」#APIkey三步排查 1.export你的_API_KEY=...#写进~/.zshrc或2.重启dsh,看设置页有没有自动带入1)官方providers文档(排错表出处)https://githharness/blob/master/docs/user/guide/2)AI星球FAQ(高频坑盘点)https://www.aixq.cc25.Windows上一跑就静默Windows是当前版本的重灾区,「静默退出」至少有三种不同的死配上官网安装包版的Node——别用pacman装的那个。第二种,k说句公道话:这些都是单个环境的报告,不是「所有Windows都不的解法值得所有Windows用户无脑采纳——原生PowerSh#Windows起步正确姿势(防患于未然)3.失败了先跑npx@deepseek-ai/dsh--version分层 →127?→第一种,换终端 →3221225477?→第二种,看Discussions#197 →directorypicker报错?→第三种,看Disai/deepseek-harness/discuss2)社区Windows兼容手册/sandbaseai/de用在一件事上就够了:边界清楚、你能验收、搞砸了能还原的小活。「件」是个不错的例子,但记住它只是示例,标准是那三条,不是这个动作为什么强调可验收?因为你第一个任务的真实目的是建立信任校你亲自知道正确答案长什么样,它干完你一眼判断好坏,这次合反面教材社区里有的是:有人第一个任务就派了个复杂看板,跑了两个半小首任务的候选池其实官方早就划好了:agent能读改工作区文件、能派工作、能维护计划——四种能力各挑一个小活试一遍,你对它的信任校准就齐了,还有个天然围栏值得知道:dsh进程会把启动命令时所在的目录当作默认文1)官方用户指南(任务示例)https://github.charness/blob/master/docs/user/gu在Minimal模式下,大概率正常。那个模式本来就没挂规划、搜索异大,说明任务需要那套增益插件,以后用Standard;差异不大,式,往别处查——它看到的信息够不够(上下文问题或者换个模过还蠢,那这个任务本身需要拆解,把它拆成一个个原子动涨到66.5的著名实验,原理跟你在桌上做的这个一模一样,只不过顺带把「蠢」分个类,省得白换模式。一种是缺工具的蠢:它没挂搜索就没法查证,答得含含糊糊——这种换Standard能救。另一种是缺上下文的蠢本没看到,答得自信满满但全是错的——这种换模式没用,回头检查你的工作2)知乎主帖(新手体感)/question/20713355295别看界面看证据,三条硬标准:工具调用的轨迹能不能看、文件系统是不是——连Anthropic官方都承认agent会没干完就说干完了系统里的diff才算。第三条,可复现。同一个任务再跑一遍,真Age#真Agent三连测(新工具上手就跑)1.读文件→打开Trajectory,看到工具调用记录2.写文件→去文件系统里亲眼确认文件存在、内容对第三条还有个官方背书的进阶版:Anthropic后来给agent配上它像人一样把应用从头到尾点一遍,许多光看代码发现不了的bug当场harness/blob/master/docs/subsys/engineer第三章·打开机箱全是插件跑起来之后,该看看这台机器的内部了。DSH的口号是「一切皆插件」,模具、沙箱、会话、连界面本身都是插件,听起来玄,拆开看就三层东西:一清楚,你看懂了它,看任何harnes一句话:没有特权核心。别的产品里你改功能要动源码,DSH里所有东西型、工具、会话、沙箱、存储、循环、界面,全都是插件,你想改哪个,不存在需要打补丁的特权内核:扩展不存在需要打补丁的特权内核:扩展dsh的方式是把插各项注册都是副作用,会在其插件卸载时撤销。后半句值得多读一遍——你挂上去的每样东西都是「可逆的副作用」,插件卸这就是外界吵的「毛坯房还是留白地」之争的技术底。说毛坯房的人嫌它没装修,说留白地的人爱它想盖几间盖几间。都对,看你想要什么。想拎包入1)官方架构文档(中文)https://github.charness/blob/master/docs/arc2)官方首页Cordis是插件的管家,一个「插件元框架」。每个插件向三样东西:服务(我能提供什么)、类型化事件(我能响应什么)(我做了什么,卸载时怎么撤销)。加载顺序和依赖关系,全由是import具体实现;依赖用inject声明,加载顺序由依赖关系编排启动序列;类型化事件负责通信,分emit、wat这套设计不是拍脑袋来的,它出自那篇八十八页的论文,讲「时空可组合性说白了就是让一堆插件在同一个运行时里既能一起干活,又能随时好聚好散1)Cordisprimer(中文,五概念原文)https://github.charness/blob/master/docs/cord2)Cordis论文仓库/cordive架构就懂了:profile、bundle、pa出厂自带web和headless两张模板。bundle是预制菜包,一dsh-base是所有菜的第一包,里面是模型适配器、工具、持久化、沙箱审批这些基础设施;dsh-web-app加上浏览器界面;dsh-headless加上一个不起服config。它把最终生效的配置整份打印出来,而且官方文档补了它打印出的任何条目,都可以由你自己的patch替换。看1)官方架构文档https://githharness/blob/master/docs/arc是同一套,四种模式不是四套实现,是同一棵插件树的四种修剪方式:profileStandard是全料版;Code在全料之上把工具通过SDK暴露砍到两个工具;Creator再挂上运行时检查和预设编写那套。配置层的事,一行代码都不用改。有意思的是,官方架构文档里其实没有「四模式」这个概念—构文档只说web和headless作为「模板」随发行版交付,模四张模板平起平坐,这正是Creator模式存还有个细节帮你把profile想实:官方说它除了列组合包,还「存放插件」——你自己装的插件、自己写的插件,都记在这张菜谱里。菜谱跟着机器走,换台电脑把profile带上,你的整套配置原样复刻,这就是「配置即所以别再问「该用哪个模式」了,更好的问题是「这个任务需要哪几层能力1)官方架构文档(profiles/bundles原文)httpai/deepseek-harness/blob/master/docs/architect差在干活的方式上。Standard是模型一步步来:调一个工具,看看结果调下一个,每一步一个来回。Code是模型先写一段TypeScript程官方原文是这么说的:Codemode用模型生成的代码来Code。想感受差异,把你最近一个十几轮才干完的任务给造工具的人。写插件的、改内核的、想自定义一套agent预设的,Crea折腾的时候有张官方地图可以抄:架构文档里有一张「新行为的归属位置」映射表,加用户命令走mands,连fork会话都有现成API普通用户的路线不该是从Creator进门,而是反过来:Standar1)官方首页(Creator定位)https:/dshplugin.online这个插件目录站,三是官方推荐的路子:你规模感受一下:官方页面上写着社区插件三百多个,dsh-plugin话题下的汇七百多个,还有媒体口径说上线三天第三方插件破四千——数字打架是因为统径不同,引用时报个口径就行。反正一句话:生态起得很快,选择已经多到需了。先给一条纪律:第一次逛清单别贪多,按你眼下最痛的一个需求挑1)awesome-deepseek-harness/02)dsh-plugin话题/topics理想是,现实还差着一截。装App是点一下的事,装插件目前要过一明依赖、改YAML、理解它挂了哪些服「YAML、插件、效果组件、服务一层套一层,对只想快速用上Agent别被这段话劝退,有个聪明的绕法:从预设开始,别从裸插件开始。预设是还有条更稳的路子,AI星球的评测原话:「不熟Cordis的话,先在运行时、临时加载插件,摸清服务与事件机制再动手」。翻译一下:装插件嫌麻烦,是因为你看不见它挂在树上哪根枝——进Creator看一眼运行时,看还有条铁律:每次只改一个变量。装一个插件就跑一次测试,别一口气装五1)AI星球FAQ(原话出处)ht2)GitHubDiscussionshttps://github.co在你等官方治理到位之前,自己先把门。装任何第三方插件之前,问#装插件三问(任何一问答不上来就不装)2权限它要什么权限?能碰哪些目录?1)Discussions「插件治理」热帖https://githpatch按id找到目标行,要么整行替换,层所以「冲突」在这套机制里的真相往往是——谁排后面谁说了算。插件行为诡生成,再和运行时schema交叉校验——文档不会和代码漂移,你提供方——依赖不满足会直接报出来,不用靠崩溃来1)官方架构文档(层序规则)https://github.charness/blob/master/docs/arc2)配置目录(自动生成)/deepseek-ai/deharness/blob/master/docs/con设置页直接看。官方的Settings界面有一块就是干这个的:已养成一个习惯:每装完一个插件,打开设置页核对两栏——列表里有没有是不是正常。挂载失败在这一步就能拦住,比等到用的时候发现功能没生效强多了。顺带说一句,有些能力不住在插件层,住在技能(skills)层:官方文档把它们技能层还有个容易踩的细节:注册表是分层的,全局层放主仓库的插件agent预设挂载的插件落在它自己的层里,重名时「最近的层说了算」。也就是说,1)官方首页(插件面板截图出处)https:/2)skills子系统文档/deepseek-aharness/blob/master/docs/subsy先按症状归类,再动手。事件名拼错最迷惑:没有报错,功能就是不工作Cordis的事件是强类型的,名字差一个字母就静默失效。依赖没声明的症状最干脆:定位用二分法:把插件砍到最小,比如只留一个服务、一个事件,确认能跑一个一次性的测试会话里跑,别拿你重要的长期会话当1)插件开发基础文档https://githharness/blob/master/docs/user/develop2)Discussions#14(依赖声明的真实修复案例)/deai/deepseek-harness/discu官方文档的表述比任何转述都硬:会话日志是「是从日志里派生出来的,从不单独存储;回放不是重放录像,是从同一批事件推导一遍。连原始的输出分块都原样保留,做到token级回放保真的,就是模型当时一个字一个字吐出来的原貌。架构文档里还有一条运行时不变量,原话是「模型可见即已记录」:抵达模型请求的一切都必须能从有位独立开发者的评价流传很广:这是他用过的最透明的Agent界面面好看,是数据结构好——所有可观测的能力,都建在这条事件流上。下一1)session子系统文档(中文)https://github.charness/blob/master/docs/subsystem2)官方首页ai/deepseek-harness/blob/master/docs/architect记录、replay重放全程。四个动作全部基于同一条事件流,这种完整度别家产resume,接着昨天的会话继续干;fork,从某个点复制一条新轨迹,试另一种做法,遥测、持久化,全部派生自这同一批事件——一条日志养活了一整个功能家族这四个动作撑起了后面几乎所有的进阶玩法:排错、对照实验、审计回放,全靠它。1)session子系统文档(中文,派生关系原文)httpai/deepseek-harness/blob/master/docs/subsystems/sess2)HN发布帖/item第四章·日志与钱的实战纵深这是全书最厚的一章,讲的是把DSH从「能跑」用到「真顺手」的用会话日志排错、怎么省钱、那篇八十八页的论文到底怎么读、横向跑分建议你用之前自己再核一遍——rc期的东西,变化以天计。第一看突变点:按时间线找到行为突然不对劲的那一轮。第二看那一轮之前注什么:是不是塞了过期的文件内容、错误的假设、被污染的中间结果——模型胡说,多半是它看见的东西先胡了。第三看工具返回:是模型判断错了,是「我们的流程为什么放它过去」,不只是那一行修复。触发标准三条:机制显,细心工程师也得重新推导;系统性,逃逸原因是测试或规范的缺口而不是手滑;1)session子系统文档(中文)https://github.charness/blob/master/docs/subsystem2)官方事故复盘目录/deepseek-aharness/blob/master/docs/post这事的价值要对照着看才知道。Anthropic的工程师形容没有持久化的a新会话都像一个没有交接班的轮班工人,前一班发生了什么一概不知。resume1)session子系统文档(中文,种子机制原文)httpai/deepseek-harness/blob/master/docs/subsystems/sess2)Anthropic长任务经验/engineering这个设计的妙处是保住了「如果当时」。别的工具里你只能重开一局全部归零;fork把那个岔路口原样冻结,让你从同一个路口再走一遍。API官是你想回到的那个「当时」。而且fork和resume共用同一套种子机制:子会话日志里有条专门的标记,划清哪些事件继承自母会话、哪些是它自己新产生的—(用search再从那一轮fork,新支线上改个提示词或者换个工具,两边对比看1)session子系统文档(fork用法)https://github.charness/blob/master/docs/subsystem2)官方架构文档(forkAPI出处)https://githubharness/blob/master/docs/arc按时间排出来;想看它用了哪几个工具,搜工具名;排错的时候搜报错关键错那一步的完整现场直接跳出来。还有个隐藏福利:文件系统工具在返回结带当时的diff——你搜到那一步时,连它具体改了哪几行都能直接看到,搜参数也能命中,这背后是个较真的设计:工具调用时模型生成的参数原文1)session子系统文档https://githharness/blob/master/docs/subsystem从官方教程的第一个插件开始,三十分钟跑通。地址在Cordis教程写插件其实就是实现三样东西:声明服务(我提供什么)、监听事件(么)、注册可逆的副作用(我做什么、卸载时怎么撤销)。跑通第一个之后材料也现成:官方cookbook的配方目录本身就值得逛一遍——加一工具、加一个模型适配器、加一个会话节点,四份分步指南各带可跑成功标准给自己定死两条:设置页里能看到你的插件;卸载之后状态干干净净回滚。两条都过,说明你真的理解了这套插件模型,后面写什么都是熟练度问题了。1)第一个插件教程https://githharness/blob/master/docs/cordis-tutorial/01-f2)扩展手册cookbook/deepseek-aharness/blob/master/docs/cookbook/extensi三个坑,全有真实案例背书:事件名拼错、依赖没声明、schema写错。逐项验证,的定义逐字核。依赖声明,社区刚发生过教材级案例inject声明加载不了,作者第二天发修复版——发布气话。schema,图片插件报Invalidschema直接崩库的案子还在Disc就崩,根因是exportdefault的写法把插件的inject声明弄丢个坑,连官方团队自己都栽过,栽完写进了公开事故库——你发布前那轮自#发布前自检三连(一条都别省)1事件名grep对照:你写的事件名vsprimer里的定义,逐字对3schema最小输入:{}都跑不通的schema,别指望真实数1)插件开发文档https://githharness/blob/master/docs/user/develop2)Discussions#14(真实修复案例)/deepseek-ai/de3)官方事故库(0001号inject案例出处)https://githubai/deepseek-harness/blob/master/docs/postmortem/选之前先分清三个设计点:什么时候触发、保留什么、恢复之后连不官方有compaction子系统,社区还有自适应压按「崩溃可检测」来设计,这就是事件流思维的彻底之处。压缩产生的是日志事件,实用纪律两条:会话超过半小时感觉它开始「忘事」,手动压一次;重负1)compaction子系统文档https://githharness/blob/master/docs/subsystem2)Codex的机制参照/index/unrolling-the-codex-不是他模型便宜,是他的harness会过日子。有个狠对照:同一个模型十五个任务,最省的Hermes单次成功花四毛六,最费的Clau六——四倍多的差距,全在上下文管理上。把整轮数据摆开Agent只过十八题,Pi二百二十三次(全场最少)同样供应商返回过真实用量就用真实口径,没有就用保守估计,还给出有符号的增减量,#成本查账三步(比换便宜模型管用)1看token流向:哪一步在烧钱?三个惯犯——长上下文反复重发、 大结果原样回灌、工具列表全量塞进去2压冗余:能外置成文件的别回灌,能摘要的别全量3盯单成功成本:总成本÷成功任务数,这才是真效率1)Composio八套harness横评(上表出处)https:2)token计量文档/deepseek-aharness/blob/master/docs/subsystems记住时段表,然后把批量活排进闲时——高峰(北京时间9–12、14–18)价格是闲V4-Flash¥0.10¥3.0¥9.0V4-Flash¥0.05¥1.5¥4.5V4-Pro¥0.30¥9.0¥27.0V4-Pro¥0.15¥4.5¥13.5打对折。适合排进闲时的活很多:批处理、建索引、定时摘要、不赶时间的告,这些白天跑就是白送钱。交互式的活留在白天,反正你也等不了定价回到从前。情绪可以有,账还是要自己算——峰谷制的意思就是官方拿#峰谷省钱排班表(北京时间)):闲时(半价其余全部+周末→批处理/索引/定时摘要全排这1)官方定价公告https://api-docs.deepseek2)「回滚pricing」许愿帖/deepse格从发布时的两分五涨到了三毛,涨了十一倍——官方在用价格明示:不做为什么差距这么大:命中意味着同样的上下文前缀直接复用之前的计算,不用重算,所以便宜。落到操作上有三条。第一,稳定的内容放前面:系统指令、工具参考资料这些不变的东西排在前缀,每次变化的内容放后面。第二,别中途改配置:连配置变更都改成追加新消息而不是改旧消息。第三,长会#缓存友好三条军规2中途不改配置:要改就追加新消息,别动旧的3重任务先跑一遍再迭代:让前缀在多轮间保持一致1)官方定价公告https://api-docs.deepseek2)token计量文档/deepseek-aharness/blob/master/docs/subsystems先分清它是什么再谈信不信:那篇《AProgr性质分清了,用法就清楚了:当学理参考读,别当产品承诺背。社区对它的值有真争论,最尖锐的一条问得很好:论文里那套形式化演算,和实际跑着实现之间,有没有一座可以验证的桥?这个问题没有现成答案,你自己读的文,效率高十倍。引用的时候守一条规矩:写「Cordis论文(个人署名预印本)」,1)论文仓库(PDF在这)https://githu2)社区八节通俗课https://curtiseng.github.io/cord别刷公众号了,十份一手材料按四层吃,两周足够。这份书单本身就能当收入门层两份:Anthropic的BuildingEffect);UnrollingtheCodexagentloop(把agentloop解剖给你看)、AntEffectiveharnesses(长任务一手经验)、LangCh学术层三份:Terminal-Bench和τ-bench的论文、arXiv那篇「比##两周阅读计划1)BuildingEffectiveAgentshttps:/2)宝玉中译https://baoyu.io/translations/building-effec3)OpenAI实战指南PDF/busineresources/a-practical-guide-to-building-ag55.横向跑分怎么避免把模型、harnes学术界已经把这事上升到立项层面了——arXiv上有篇论文标题就叫「harness的情况下比较LLMAgent」,核心盖过模型方差。可抄的披露清单五项:任务集和评测协议;模型与推理配置(档位、温度);工具集和版本;harness配置(系统指令、上下文);归因于harness。人家自己都这么#横评五项披露清单(缺一项,结论打七折)2)官方跑分公告(看它自己怎么披露)https://api-docs.deepseek.绩最好的那套过了二十个,最差的那套只过十四个;单次成功的成本,最省发Slack、写日历、更新Notion。细节里藏着两个金子般慢、快的不一定省:那套最费的(ClaudeCode)中位耗时反而最快,效率余量它选了后者。二是排名会随模型换位:同一批harness,换一就换了人——这说明harness和模型是要讲匹配的,没且真实;细节归因,自己跑一轮对照实验最靠谱。1)Composio横评原文https://composio.dev/cont2)arXiv披露论文/abs沿着两条线读:agentloop和工具注册表。这是好几份中文深潜教程不约而续——这个循环是整个系统的心脏。OpenAI有篇官方文章把这个循环解剖到了工具怎么声明、怎么挂载、怎么被模型发现——这条线对应Cordis的还有个关键心法:带着具体问题读。「Minimal模式怎么做到只剩两个工具的?」顺着profile配置一路找到那行patch,问题找到答案的那刻,你1)OpenAI的loop解剖(先读这个)https://openai.co2)DSH架构文档/deepseek-aharness/blob/master/docs/arc会,而且官方把丑话说在了最显眼的地方——README里那句全大写的警THEREWILLTHEREWILLBECOMPATIBIL版本现状感受一下:npm上全部六个版本都是0.1.0-rc打头,没有正式版;正式公开那天一天连发三个rc;连GitHub的Release页1)官方README(那句大写警告)https://gith2)npm版本页/package/@deep第五章·场景实战抄现成轮子这场对比是官方盖章的对位赛。ClaudeCode的官方文档自己写着:「ClaCodeservesastheagenticharnessaroundClaude」—harness里的双雄。实测上,同一批任务里ClaudeCode成绩稳定(过了七成六)但单次成功成本最高、耗时最长——成品稳但贵;可改装的路子上限另外知乎有个真实争议值得知道:有人说V4-Pro接进ClaudeCode会降智、换):前/docs/en/how-cl2)DSH仓库/deepseek-ai/deepse/question/2071的模板生成草稿;你只做核对和润色。工具面两个现成选择:awecode那个大合集里办公类workflow一抓一把;Dify这坑提前打好疫苗:长任务可能跑很久而且没人提醒你,所以验收清单要前置周应该覆盖哪些事、数字从哪来、格式什么样,跑之前写死。它给你的永远当/hesreallyhim/awes2)Dify/langgenius/dify选工具的时候盯死一条:它给不给来源。「给出处」不是口号,有的产品把设计目标写得很直白:对抗错误信息、追求速度和确定性。storm官方说得很谦虚:它在动笔前的准备阶段很好用——七万多人试过它的在特点用法上有个金句级的技巧:先要引用清单,再要结论。让它先列出参考(标题加链接你扫一眼来源成色,再让它基于这些写综述。引用先行,编造无1)gpt-researcher/assaf2)storm/stanford-oval/s3)deer-flow/bytedance/openai-cs-agents-demo。这个示例长什么样:Python后端跑AgentsSDK的官方客服示例Next.js前端用程可视化出来了,克隆下来半小时就能看到一个客服agent的完退款这类白名单操作)、敏感操作人工通道(大额退款必须转人)、输出合最小可用版给你配好了:知识库检索加一个查订单工具加一个转人工触发1)OpenAI官方客服示例/o2)Dify/langgenius/dify3)GuardrailsAI/guardrails-ai/验证、治理七个能力层,再加成品实现和必读读物两个参考类;另一抄的正确姿势不是clone最大的那个,是按你最痛的那一层进去挑你头疼可观测,就去清单的可观测分类里挑一两个,读README解决什么、怎么解决、我能抄哪段。三行写完,这个项目对你就有价值了,1)awesome-agent-harness/Picre2)awesome-harness-engineering/ai-boost/awesome-h动手之前三件事想清楚。权限:它能读写哪些页面、下载到哪、碰不碰你和密码——第一版建议只给无登录态的只读权限,比如抓公开页面整理成表格评测:跑通之后拿BrowserGym的任务集验一遍,证明它是真能1)OpenHandshttps://github.co2)BrowserGym/ServiceNow/Brow社区把路趟得很开了。GitHub那个「求一个memory能力」的帖子几种方案,讨论里被反复点名的插件就有sage-mem、dsh-goodmemopersist、dsh-sgme、mindspace、pi-hermes、dsh-tdai-m何事就上自动回写。都别信星标,这类小插件rc期变动极快,装之前1)Discussions「求memory能力」ai/deepseek-harness/discu上双重围栏:沙箱圈住它能碰哪里,权限档位管住它能干什么。DSH档位—workspace-write区起步姿势定死:默认只读档开跑;任务确需写文件,升到工作区档,再把圈成白名单;完全访问档只给一次性的沙箱环境,用完即弃。这套官方还有个值得点赞的诚实设计:沙箱的执行情况是「底层系统只能管住一部分(比如Windows的AC会报告partial而不是假装守住了。要求绝对边界的调用方看到part栏配错了也会坑人,所以围栏不是设完就完,配完要跑一遍真实任务验证它既1)沙箱文档https://githharness/blob/master/docs/subsys2)权限预设文档/deepseek-aharness/blob/master/docs/subsystems/permisAutoGen走确定性流程,每步DSH的子代理设计有个值得琢磨的地方:官接口后面「千差万别,从新建一个子agent,到把一个轮次委派给另一个—也就是说「委派」这件事本身也是可插拔的,你甚至可以让DSH把活儿个工具去干,接口不变。协作,同一个模型的通过率从七成二拉到八成八——编排确实值钱。但代价1)AutoGenhttps://githu2)LangGraph/langchain-ai/lan3)DSH架构文档(子代理提供方一句的出处)ai/deepseek-harness/blob/master/docs/architect按任务类型对号入座:代码任务用SWE-bench(真实GitHub准对话加工具的任务用τ-bench(专门考「会说话还会办事」终端任务看用SWE-bench有个新手坑:它有多个子集,最常被引用的Ve问题描述有歧义、环境有问题的条目筛掉了——看跑分先确认用的哪个集,不比选基准更要紧的是建你自己的私有基准:挑十个你的配置跑一遍记通过率。公开榜考的是别人的任务分布,你的十个任务考的是你的—#迷你私有基准(半小时搭完)2.每个任务写死验收条件(文件存在/输出匹配/退出码)1)SWE-benchhttps://github2)τ-bench论文/abs3)Langfuse/langfuse/有,用profile组合,别从头造轮子。DSH的机制天然支持这么玩:底好(模型、工具、沙箱、凭证全齐上面按需叠层——写码的、办公的,一层一具体动作:建一个自己的profile,第一层dsh-base(必有第有个反例心态要避开:别为了「一站配齐」把插件装成仓鼠症——三层结构每1)DSH架构文档(profile组合)https://github.charness/blob/master/docs/arc能抄,先核版本。教程里的命令是作者写他那天的版本,你装的八成不致,先查这条命令有没有变更记录,再动手。命令失效的样子很多:参1)官方文档站https://deepseek2)npm版本页/package/@deep但「挑星多的先试」这句话得加个护栏:星是热度,不是寿命——两万四RooCode说关就关。所以挑项目的动作改成这样:先按场景筛,再过),1)MaxKBhttps://git2)RAGFlow/infiniflow/3)ObsidianCopilot/logancyang/obsidi4)SmartConnections/brianpetro/obsidian-smart-connecti/hesreallyhim/awesMarkdown」这个动作,客服用得上、研究用得1)MCP服务器目录/mo2)OpenManus(拼装底座)/FoundationAgents/O第六章·让生产不翻车的工程文怎么管、死循环怎么破、护栏拦什么、上产前过哪四关。别被「生产」两住,这些事不一定要工程师才能干,但一定要懂行的人拍板——这一章读完但别把这事读成「工程没了」。工程全在,只是搬了家:代码归agent则、反馈回路归人。他们的AGENTS.md只留一百行,当地图用不当是「给Codex一张地图,而不是一本一千页的说明书」。仓库里写则」,有后台任务定期扫描代码偏差、自动开修复请求——他们管这叫给技术垃圾回收。架构规矩不靠自觉,靠自定义检查器机械执行,连报错文案都写Anthropic那篇BuildingEffectiveAgent下来,最成功的实现用的都是简单可组合的模式,不是复杂框架。文—工作流和agent——并且给了三条核心原则:设计保持简单、规划步骤透明可见、工具接口精心打磨。其中关于工具的那句值得裱起来:他们做SWE-be时,花在优化工具上的时间比优化prompt还多,一个好的防呆改动1)OpenAI官方原文https://openai.co/engineering/building-e分三个设计点看方案,别笼统谈压缩:什么时候触发、保留什么、恢复之后还连贯。这三个点是所有压缩方案的公共骨架。先讲原理,再讲行业里最讲究的参照。先说原理。Anthropic的contextengineering长文里有个概念值得记算。模型跟你一样,读的东西越多,每样东西记得越浅——这不是b行业里最讲究的参照是Codex的做法:设个阈值,上下文一超就1)compaction子系统文档https://githharness/blob/master/docs/subsystem2)Codex的机制参照/index/unrolling-the-codex-3)Anthropiccontextengineering/engineering/硬软两手一起上。硬的那手是白名单加参数校验:一次任务只给相关的三五个工具,输入先过schema校验,非法的挡在门口。软的那手常被忽略:工于给模型递了一张看不清的地图。软手的另一半在结果侧:返回要短小、要结构化,Anthropic的建议更操作化:像写文档一样打磨你的工具定义。他们管这变得更难。第三,跑很多测试输入看模型怎么用你的工具,在哪儿踩坑就改哪他们花在优化工具上的时间超过了优化整体有个数字专治「工具越多越好」的迷信:同一轮八套harness的横评多的和调得最少的过了同样多的题——多出来的约一百八十次调/engineering/building-e2)权限预设文档/deepseek-aharness/blob/master/docs/subsystems/permis只会设步数上限是老黄历了,工业级方案是三件套一起上:循环检测、超时预算。LangChain那次公开复盘是现他们踩的坑很有代表性:agent在终端任务里原地打转,也就是dooml是加了个循环检测中间件,识别「反复做同一件事」的模式并强行打断。更有路况。他们的组合拳除了检测和预算,还有个叫「推理三明治」的算力分期和验证期给最高档推理,执行期降一档,两头厚中间薄——钱花在开头和收尾上。所以你的配置单至少三样:循环检测(或等效的重复行为识别)、每任务超时上限、按任务分级的推理预算。步数上限留着当兜底安全网,但别拿它当/blog/improving-deep-agents-with-harn最稳的底座是「只增不删」的事件日志:状态不是存了一份快照那么脆弱没有持久化是什么下场?Anthropic给过一个最毒的比喻:每个新会话都像一交接班的轮班工人——你花半小时教它的东西,换个会话全白教。DSH构层面堵死了这个漏洞:有一条运行时不变量叫「模型可见即已记录」,抵请求的一切都必须能从日志重建,系统实时断言补齐动作不复杂,自查两个问题:你的agent进程重启,能恢复到1)DSHsession文档https://githharness/blob/master/docs/subsystem2)Anthropic长任务文/engineering编号写日志,出错时按编号一捞,全程回放。就这么土,但管用。DSH天然带着这套基础设施:sessionlog里每一步工具调用都有编号和参数原文,文件系统工具的结果里还自带diff——你甚至不需要自己建日志系统,翻开轨迹视图就是报告。规模感的参照:OpenAI那个0行手写代码的项目里,连生产监控1)Langfusehttps://github2)DSHsession文档/deepseek-aharness/blob/master/docs/subsystem看harness把错误「翻译」得好不好。同一个工具报错,翻译成「原因、建议怎么办」三段式,模型多数能自我纠错;原样甩一坨堆栈过去,它这是六因素里的错误恢复那一环:harness决定错误怎么呈现给模型、要不重试、重试几回升级人工。设计要点三个:错误信息必须可行动,让模型知道步改什么;重试要有上限加退避,连续失败别无限撞墙;永远留一条转人工的通道。给你一个立刻能用的改造:在工具层包一个错误翻译器,把原始报错统一转式再回给模型。这个改动小到一小时,恢复率的提升肉眼可见。DSH这边的1)Composio六因素(错误恢复原文)https://composio.de2)DSHsession文档(错误行为审计)/deepseek-ai/deharness/blob/master/docs/subsystemClaude倾向于不做充分测试就标记功能完成。它说做完了验证三层。断言层,关键输出的硬校验:文件存不存在、格式对不对、数字在范围内。脚本层,把规矩写成可执行的检查——OpenAI项目里的自定义li这思路,连报错文案都是写给agent看的修复指令。任务层,用τ-统计通过率。有个数字帮你清醒:横评里含排除项、精确计数、多依赖更新Anthropic那篇长文里给了个模板:初始化的agent先把用户一句话拆成一他们还发现用JSON格式比Markdown更不容易被模型擅自/engineering/effective-harnesses-fo2)τ-bench论文/abs两条铁律:一个agent只干一件事,它们之间的消息必须是定设计的时候画一张契约图:每个agent一行,三列——消费什人打架时听谁的。画不出来的设计就是会打架的设计,这话说得不客气但灵享状态也要显式化:放文件里或状态机里,别放在大家都能读的聊天记录里Anthropic那篇给了五种工作流模式,从简到繁:提示链(串行分步)、路由(分类分发)、并行(分片或投票)、编排者-工人(动态拆分分派)、评估者-优化者成加评审循环)。起步阶段你只需要记住:多agent不是必需品,先这是Anthropic的原话,也是他们几十个客户项目1)AutoGenhttps://githu2)LangGraph/langchain-ai/lan/engineering/building-e拦三类东西:越权(跑出指定目录、碰了不该碰的文件)、敏感操作(发送、支付)、危险命令(rm-rf这种)。原则是先拦再问——拦下来等Anthropic在附录里专门写了「给工具做提示工程」这个话题,里面有个防呆思路值得偷:他们的SWE-benchagent早期老在相对路径上出错——agent后就找不着北了。修复方式特别朴素:把工具改成永远只

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论