版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
LLMWiki·个人知识管理·实操指南用WorkBuddy+Obsidian+LLMwiki搭一座会自己生长的个人知识库从“收藏夹吃灰、临时检索”到“摄入时编译、知识滚雪球”——LLMwiki理念与落地全攻略PART00·引子一切,从Karpathy的一条推文说起前特斯拉AI总监、OpenAI创始成员AndrejKarpathy发帖观察:“最近,我绝大部分的Token消耗,从写代码转向了利用LLMs构建个人知识库。”这条推文引发巨大共鸣,阅读量超过1700万。第二天,他公开了一份名为LLMwiki的构想文件,瞬间点燃了新一轮关于“如何真正用好AI沉淀知识”的讨论。这背后是一个信号:AI的价值正从“生成内容”向“管理知识”迁移。1700万+单条推文阅读量,引发全球热议次日公开LLMwiki构想文件从写代码→构建个人知识库PART00·引子为什么“上传文件+提问”解决不了知识沉淀?01临时拼答案每次提问都临时召回相关片段拼凑回答,回答用完即弃,知识没有沉淀进任何结构。02知识不沉淀文章、文件躺在收藏夹和上传区里“吃灰”,从未被整理、连接成可复用的结构化知识。03上下文受限过度依赖一次性上下文,资料一多就超限、变慢、变贵,很难支撑长期积累的体系化知识。共同本质:资料与知识脱节——只有“检索”,没有“沉淀”。PART00·引子LLMwiki的答案:从“查询时检索”到“摄入时编译”查询时检索传统RAG/文件上传模式:需要时才临时召回片段拼装答案,回答用完即弃,知识不积累、不生长。=“图书馆式”借阅,书在架子上吃灰→摄入时编译LLMwiki模式:资料一进来,AI就把它编译成结构化的Wiki页面,一次编译、持续复用,知识不断沉淀、生长。=“编译器式”加工,原料进来就变成产品核心一句:“不要在查询时检索,要在摄入时编译。”——这是整套方法论的基石。PART00·引子“一次编译、持续复用”——知识像滚雪球知识网络持续生长,越用越厚LLMwiki不是一次性问答,而是一个不断积累的知识资产:新资料被持续编译进wiki,形成实体页、主题页、交叉引用;每份新资料都可能触发多个相关页面的更新,让旧知识也一次次被重新激活。人机分工:人负责筛选、引导、提问、审阅;AI负责总结、交叉引用、归档、维护。“滚雪球”的含义:知识越多,检索时能调用的结构化上下文越完整,回答质量越高;回答又反过来沉淀进wiki,形成正向循环。PART01·理念LLMwiki到底是什么?它凭什么能让知识“自己生长”?在动手之前,先想一想:它和传统的RAG、NotebookLM、ChatGPT上传文件,本质差别到底在哪里?“摄入时编译”这句话,具体在工程上是怎么实现的?本章将拆解三层架构·增量更新·与传统RAG的对比PART01·理念LLMwiki的三层架构:Raw·Wiki·SchemaSchema层·生产规范Wiki层·编译产物Raw层·事实来源一句话理解:Raw提供材料,Wiki是加工品,Schema是生产规范。节点互联、层层加工,最终形成一张可查询的知识网络指导LLM如何构建与维护Wiki的约定与工作流AI维护的摘要、实体页、概念页、比较、综合理解原始资料,不可变,LLM只读,作为事实来源PART01·理念Raw层:不可变的原始资料,事实的源头它是什么Raw层是存放原始资料的区域,是整套知识库的“原料仓”与事实来源。它保存文章原文、PDF、会议记录、聊天记录、音视频转录等一手资料,LLM编译时只读不改。这也是整座知识库可信度的根基——任何结论都能回溯到这里的原始文件。工程示意:raw/目录可按主题建子目录,例如raw/认知科学/、raw/项目复盘/,方便归类与后续编译。三条铁律01不可变:原始资料一旦入库,不轻易修改,保证可溯源。02只读:LLM编译时只读取,绝不在raw中改写内容。03事实来源:所有Wiki结论的依据都指向这里的文件。PART01·理念Wiki层:AI编译出来的结构化知识Wiki层是“编译层”:LLM依据Schema规范,把Raw原始资料加工成多种类型的知识页面,页面之间用双向链接互相引用。六大页面类型01实体页:人物公司画像。02概念页:术语、方法论的完整定义与边界。03主题页:跨资料归纳概述。04比较页:两两对比取舍。05综合理解:融合新认知。06索引与链接:双向链接编织知识网络。关键:这些页面不是“一次性摘要”,而是持续更新、彼此链接的动态知识结构。PART01·理念Schema层:指导AI“如何生产”的作业规范它是什么Schema层相当于CLAUDE.md/AGENTS.md:一份写给AI看的“生产规范”。它告诉LLM这个知识库长什么样、按什么规则加工资料、输出什么格式,确保每一次编译都稳定、可预期。类比工厂:Raw是原料,Wiki是成品,Schema就是挂在车间里的作业指导书(SOP)。这也是后期可以不断打磨升级的部分:规范写得越清楚,知识库越稳定。规范要覆盖什么01定义角色:AI在知识库里的职责与边界。02维护目录:目录结构与命名约定。03规范编译:摘要写法、链接创建、冲突处理。04固化流程:从读素材到更新的工作流。PART01·理念增量更新:新知识如何融入已有结构新资料进来时,先判断它对应已有结构还是全新主题,再决定“更新”还是“新建”。新资料入库对应已有页面?更新旧页补充新证据,保持页面连贯新建页面按模板创建,纳入知识网络冲突处理:新旧说法不一致时,不直接覆盖,而是保留并提示。保留来源与时间:并存记录,标注出处、时间、适用范围,不抹掉旧信息。给出冲突提示:由人类审阅判断取舍,而不是让AI擅自决定覆盖。PART01·理念一张表看懂:传统RAGvsLLMwiki对比维度传统RAG/上传文件LLMwiki触发时机查询时临时召回摄入时编译知识形态片段拼装、用完即弃结构化页面、持续复用沉淀情况知识不沉淀一次编译、持续沉淀增长机制不随使用增长滚雪球式生长人的角色上传后很少参与筛选、引导、审阅把关本质差别:传统RAG服务于“问一次”,LLMwiki服务于“建一座会生长的知识库”。PART01·章节小结LLMwiki,是一座“摄入时编译、持续生长”的三层知识库:Raw提供材料,Wiki加工成品,Schema规范生产。三条支柱判断摄入时编译:替代查询时临时拼答案,知识被提前加工。三层各司其职:Raw不可变、Wiki结构化、Schema定规范。安全生长:增量更新+冲突保留,不让知识越改越乱。下一章:理念落到工具,看WorkBuddy与Obsidian如何各司其职。PART02·工具用什么工具,把LLMwiki落地?它们如何配合成一个闭环?在选型之前,先想一想:为什么要让WorkBuddy当“编译器”、Obsidian当“编辑器”?采集、编译、查询、治理四件事,分别由谁负责最合适?本章将拆解四种角色·编译器·编辑器·采集器PART02·工具四类角色,各司其职一个统一的工作台,承载整个知识库的日常角色分工01编译器·WorkBuddy(也可用ClaudeCode/Codex):读raw、按AGENTS.md编译,产出wiki。02编辑器与视图·Obsidian:双向链接、关系图谱,日常浏览与检索。03采集器·ObsidianWebClipper+IMA:把网页与微信文章转成Markdown存入raw/。04调度与自动化·WorkBuddy定时任务:定期同步资料、执行健康检查。PART02·工具WorkBuddy:这座知识库的“编译器”它是什么WorkBuddy是腾讯出品的全场景AI办公工作台、AI原生桌面智能体。使用者用一句话描述需求,它能自主规划、调用工具、执行步骤,并交付可验收的成果。在本方案中,它承担“编译器”角色,是知识加工的主力。编译时的工作流:读取raw/新增文件→遵循AGENTS.md规范→生成wiki/页面→同步更新index.md与log.md。关键能力01一句话发起:自然语言描述任务即可开工。02自主规划:规划步骤并调用工具执行。03目录协作:工作空间指向本地项目文件夹。04定时自动化:同步、检查可设为周期任务。PART02·工具Obsidian:知识库的“编辑器与视图”Obsidian是一款本地Markdown笔记软件,在这里它充当知识库的“编辑器与视图”:Vault仓库直接指向我们的wiki项目目录,所有wiki页面都以Markdown文件形式存在本地,开放、可控、可迁移。为什么选它01笔记即节点:每页知识是一个独立文件。02链接即道路:[[双向链接]]编织知识关系。03关系图谱:一目了然。一句话:文件即知识,链接即道路,图谱即全局视野——这正是“会生长”的直观体现。PART02·工具采集工具:电脑直采+移动中转电脑端·ObsidianWebClipper一款Chrome浏览器插件:在网页上点击一次,就能把网页内容转成干净的Markdown,直接存入ObsidianVault的raw/目录。无需复制粘贴、无需手动排版,是“电脑端采集”的主力入口。移动端·IMA知识库中转微信公众号文章在手机上不方便直接抓取,因此先“一键收藏”到IMA知识库作中转站。随后WorkBuddy定时任务定期把IMA里的新内容同步到raw/,完成移动端到本地库的对接。两者配合的效果:“随处收藏、统一入库”——无论资料来自网页还是微信文章,最终都汇入同一份raw/,等待编译器统一加工。PART02·章节小结工具已就位:WorkBuddy编译、Obsidian展示、WebClipper与IMA采集、定时任务调度,形成完整闭环。三条支柱判断生产与浏览分离:编译用WorkBuddy,浏览用Obsidian,各干各的。采集入口打通:电脑直采+移动中转,资料统一入库。自动化收尾:定时同步与检查,让系统自己转起来。下一章:真正动手初始化工程,搭好目录骨架。PART03·工程初始化动手初始化:知识库的骨架怎么搭?在动手之前,先想一想:Obsidian的Vault和WorkBuddy的工作空间,为什么要指向同一个目录?raw、wiki、templates这些目录,各自承担什么职责?本章将拆解初始化三步·目录结构·关键文件职责PART03·工程初始化初始化三步:建仓、纳管、对齐01创建仓库在Obsidian中新建仓库(Vault),命名为kb-wiki,作为知识库的根目录。02Git初始化对仓库执行Git初始化,让整个知识库纳入版本管理,任意改动都可追溯、可回退。03对齐工作空间在WorkBuddy新建会话,工作空间指向同一项目文件夹——两个软件协同操作同一个本地目录。关键:Obsidian负责“看”,WorkBuddy负责“做”,二者必须面对同一份目录,才能无缝协作。PART03·工程初始化目录结构:六个核心成员各就各位kb-wiki/AGENTS.md生产规范index.md查询索引log.md操作日志raw/原始资料wiki/编译产物templates/生成模板每个成员的职责AGENTS.md:Schema层,指导AI如何维护整个wiki。index.md:总索引,查询时先读它路由到相关页面。log.md:操作日志,记录每次编译与变更。raw/:原始资料,子目录可自定义,事实来源。wiki/:AI编译出的结构化知识页面。templates/:生成wiki的模板,与wiki子目录一一对应。提示:templates与wiki子目录一一对应,让AI每次生成都有章可循。PART03·工程初始化三个关键文件:灵魂、入口、账本AGENTS.mdSchema·全库灵魂定义AI的角色、目录结构、素材来源、编译规则、摘要写法与链接方式。它是整个Wiki系统的灵魂,需持续维护直到表现稳定。index.md索引·查询入口汇总全部知识主题的导航页。查询时先读它,判断哪些页面与问题相关,再精读对应页面,节省上下文。log.md日志·变更账本记录每一次编译、更新与调整的时间与内容,让知识库的演化可回溯、可审计。三者配合:AGENTS.md教AI怎么做,index.md带查询去哪找,log.md记录发生了什么。PART03·章节小结知识库的骨架已固定:建仓、纳管、对齐三步,加上六个目录成员,物理结构清晰可扩展。三条支柱判断同一目录:Obsidian与WorkBuddy共享一个仓库,看与做不分家。三文件分工:AGENTS.md灵魂、index.md入口、log.md账本。目录即分层:raw原料、wiki成品、templates模具。下一章:写一份能指挥AI的Schema——AGENTS.md。PART04·Schema编写AGENTS.md,为什么是整个系统的灵魂?在动手写之前,先想一想:一份好的AGENTS.md,应该让AI明确知道哪些事情?为什么它需要“持续维护,直到表现稳定”?本章将拆解六要素·编写要点·持续迭代PART04·Schema编写AGENTS.md要写清楚六件事AGENTS.md是写给AI的“入职手册”,回答六个问题:我是谁、我管什么、我读哪、我怎么做、我写成什么样、我如何关联。这六条写清楚,AI每次编译都能稳定产出。好的AGENTS.md越写越短、越写越准:它只保留真正影响产出的约定,删掉一切空话。遇到AI反复做错的地方,就把它补进规范里。01定义角色:AI的职责与边界。02维护目录:结构与命名规则。03读取素材:从哪读raw资料。04编译流程:素材怎么变成wiki。05摘要规范:怎么写、写多细。06链接规则:如何创建双向链接。PART04·Schema编写持续迭代:让规范越用越准AGENTS.md不是一次写好的,而是伴随实际使用不断打磨,直到表现稳定。试用观察发现反复出错补写进规范回顾精简形成闭环:每跑一轮编译,都用结果反哺AGENTS.md;保留有效的约定,删掉空话,直到连续多次产出符合预期。判断“稳定”的信号产出符合预期:连续多次编译的wiki页面结构一致、质量达标。无需返工:人工介入次数显著下降,AI能自主完成整轮编译。PART04·章节小结AGENTS.md之所以是灵魂,因为它把“怎么做”从人脑搬进了规范,让AI可复现、可升级。三条支柱判断六要素齐备:角色、目录、素材、流程、摘要、链接,缺一不可。持续迭代:用实际产出反哺规范,越用越准。稳定信号:连续达标、无需返工,规范即可锁定。下一章:开始“喂料”——数据采集。PART05·数据采集资料怎么喂?如何让高质量内容持续进库?在动手采集之前,先想一想:电脑端和移动端的资料,分别怎么低成本进入raw/?为什么说“宁缺勿滥,否则垃圾进垃圾出”?本章将拆解按目的采集·电脑端·移动端·多格式与原则PART05·数据采集按目的采集:两种来源,两种打法个人第二大脑·日常积累面向场景:把大脑里值得留存的碎片沉淀下来。素材来源:文章、视频、会议、聊天记录、通话要点。采集特点:随见随存、细水长流,重在“不漏”。专题研究·项目驱动面向场景:围绕一个明确主题做深。素材来源:论文、专业文章、行业报告。采集特点:目标明确、集中收集,重在“够全够深”。共同点:先有明确目的,再决定存什么——采集从来不是“什么都存”。PART05·数据采集跨设备采集:随处收藏、统一入库看什么:电脑、手机与云端中转之间的数据流动示意。三条进料通道电脑端直采:WebClipper一键存Markdown到raw/。移动端中转:微信文章收藏进IMA,WorkBuddy定时拉取同步。平台自动化:飞书、钉钉等可用平台CLI加WorkBuddy自动采集。无论走哪条通道,最终都汇入同一份raw/,等待编译器统一加工——这是跨设备协同的前提。PART05·数据采集多格式转文本+宁缺毋滥多格式:统一转成文本PDF、图片、录音、视频等素材,用多模态模型识别成文本,统一落进raw/,保证编译器读到的是同一种“原料”。PDF文档图片扫描音视频论文、报告截图、图表讲座、访谈、会议宁缺毋滥:采集的第一原则只收集高质量内容。低价值资料进库后会被照样编译进wiki,最终污染查询结果——这就是“垃圾进,垃圾出”。宁缺毋滥,是对知识库质量的第一道闸门。原则:宁可少存几条优质内容,也不要把大量噪音写进wiki。PART05·章节小结喂料的关键不是“多”,而是“对”:先定目的,多通道进料,宁缺毋滥守质量。三条支柱判断按目的采集:日常积累与专题研究分开打。多通道进料:电脑直采、移动中转、平台自动化。质量闸门:多格式转文本,宁缺毋滥。下一章:让AI把原料编译成结构化知识。PART06·编译与查询一句指令,怎么把原料编译成结构化知识?在动手编译之前,先想一想:给AI的一句编译指令,应该包含哪几个部分?编译之后,双向链接和图谱是怎么“长”出来的?本章将拆解编译指令·增量更新·双向链接·查询与写回PART06·编译与查询一条编译指令,说清四件事阅读当前项目raw/中新增的文件,按照项目根目录中的AGENTS.md的规范,将它们编译到wiki/目录中,并同时更新index.md和log.md文件。01读什么raw/中新增的文件,只编译增量。02按什么遵循AGENTS.md的六要素规范。03写到哪编译产物入wiki/。04顺带更新更新index.md与log.md。PART06·编译与查询增量更新:更新旧页,还是建新页?新资料是否对应已有实体、概念或主题?对应已有→更新旧页在旧页面上补充新观点、新证据,保持知识连贯,避免同一主题散落多页。没有对应→创建新页为新实体、新概念、新主题建立独立页面,再挂进索引与相关链接。冲突处理:新旧信息冲突时不覆盖,而是保留来源、时间与适用范围,并在页面上给出冲突提示——让读者看到不同观点的并存与来龙去脉。PART06·编译与查询双向链接:让知识自动“长”出道路AI在编译时自动生成双向链接([[wikilinks]]):每当提到一个已存在或新建的实体,就写下链接。链接越多,知识之间的道路越密,查询时就能顺着道路找到相关的一切。关系图谱可视化Obsidian把wikilinks渲染成节点与连线,一眼看清知识网络长什么样。原子化笔记“笔记即节点、链接即道路”:每个页面独立成节点,靠链接彼此连接。触发式更新每份新资料进入编译,可能触发多个相关页面更新——这正是知识库“自己生长”的机制。PART06·编译与查询查询:先路由,再精读,能写回向WorkBuddy提问读index.md,只读相关页有价值回答写回wiki为什么“先路由再精读”?与“渐进式展开”机制一致:先看索引判断哪些页面相关,再只读取这些页面作答,避免把整库塞进上下文。既省Token,又让回答更聚焦、更准确。“写回”意味着什么?查询中产生的高质量总结、洞见或新联系,可以写回wiki。这等于把“提问”也变成一次知识加工——库越查越丰富,系统持续生长。PART06·章节小结编译让原料沉淀,查询让知识流动:一条指令、增量更新、双向链接,闭环运转。三条支柱判断一句指令驱动:说清读什么、按什么、写到哪、顺带更新。增量更新:旧页更新或新页创建,冲突不覆盖只提示。查即生长:先路由再精读,回答可写回库。下一章:让知识库保持健康——治理与检查。PART07·治理与健康检查知识库会“生病”吗?如何让它长期保持健康?在维护之前,先想一想:知识库最常见的“病灶”是什么?为什么需要定时健康检查,而不只是出了问题再修?本章将拆解健康检查·企业三大局限·总结与建议PART07·治理与健康检查定时健康检查:扫描三类“病灶”看什么:定期整理与检查知识库的维护场景示意。每周定时任务检查矛盾:页面间信息冲突,需核对并裁决。孤立页面:无链接“孤儿页”,需补链接或并入。断链:链接指向不存在目标,需修复或删除。健康检查由WorkBuddy定时任务自动执行
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026江苏省教育系统公开招聘考试(教育理论/公共知识)历年参考题库含答案详解
- 2026江苏住院医师规范化培训考试(检验科Ⅱ阶段)题库历年参考题库含答案详解
- 2026正高面审答辩-正高004面审答辩肾内科学历年题库含答案详解
- 2026文物保护工程从业资格考试(责任设计师·近现代重要史迹及代表性建筑)历年参考题库含答案详解
- 冰淇淋烹饪课程设计
- DCT图像压缩应用教程课程设计
- AI换脸特效剪辑课程设计
- 包装课程设计作业范文
- 图嵌入欺诈识别课程设计
- 机器学习垃圾邮件分类器系统设计课程设计
- 第1课 开启物联网之门 课件(内嵌视频)2026-2027学年人教版初中信息科技八年级全一册
- 2026年工商注册代理从业人员考核模拟试题及答案
- 2026国家能源集团科学技术研究总院(北京低碳清洁能源研究院)社会招聘84人考前冲刺试卷【典优】附答案详解
- 2026年跨境电商海外仓建设与运营管理
- 国家开放大学汉语言文学本科《古代诗歌散文专题》历年期末纸质考试真题总题库2027珍藏版
- 2026新教材全国培训:统编版小学语文五年级教材解析
- 2026年秋季开学第一课:强国复兴有我
- 混凝土强度评定表(GB/T50107-2010)
- 履带吊安拆装方案-天宫庄园站
- 认知中心建设方案
- 世界盐产业地理分布与区域特点
评论
0/150
提交评论