楼主: CDA网校
268 0

为你的AI赋予无限更新的长效上下文 [推广有奖]

管理员

已卖:189份资源

泰斗

12%

还不是VIP/贵宾

-

威望
3 级
论坛币
155168 个
通用积分
18822.2686
学术水平
308 点
热心指数
320 点
信用等级
283 点
经验
243426 点
帖子
7865
精华
19
在线时间
4562 小时
注册时间
2019-9-13
最后登录
2026-9-28

初级热心勋章

楼主
CDA网校 学生认证  发表于 2026-5-26 14:23:05 |AI写论文

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币

今年早些时候,OpenAI创始成员安德烈·卡帕西(Andrej Karpathy)在GitHub发布了一篇代码片段。

项目名为「LLM Wiki」,全文约1500词。它提出了一种全新模式:搭建由大语言模型自主维护的个人知识库——这是一份可持久存储、持续累积迭代的知识载体,每一次新增内容都会让知识库变得更加完善。

知识只需整合一次并持续更新,无需每次提问都从零重新推导生成。

大多数人看完只会觉得“有点意思”,然后关掉页面,不了了之。

但我亲自落地实现了这套方案。本文将手把手教你搭建这套系统,并分享我在落地过程中总结的实战经验。

当下大众使用AI的普遍痛点

每一次AI对话,都是从零开始。

你打开对话窗口,反复介绍自己、当前的工作内容、上周敲定的决策,得到有用的回答后关闭页面。第二天,你又要重复一遍所有介绍。

AI工具本身没有问题,但底层长效上下文层完全缺失。

诚然,AI自带的基础记忆功能能起到一点作用。

Claude能记住你的姓名和职位,ChatGPT知道你偏好要点式回答。但它们都无法记住你正在推进的具体项目、即将敲定的合作、上个月淘汰的供应商、本周工作流程的进展细节。

这类动态、实时的工作状态,没有任何持久化的存储载体。

大多数工程师接下来的首选方案就是检索增强生成(RAG)。

RAG确实实用,但它解决的是完全不同的问题。

RAG的核心逻辑是每次提问都从零推导知识:对文档进行向量化嵌入,提问时检索相关片段,再拼凑作答。整个过程没有任何知识累积。

如果一个问题需要整合五份文档的信息,大语言模型每次提问都必须重新查找、拼接这些碎片化内容。

而本文介绍的「知识库仓库方案」,只需整合一次知识,持续迭代更新。每当你新增内容,大语言模型会自动索引、读取、整合信息,更新相关页面、标记内容冲突、维护交叉引用关系。

在你发起下一次提问前,知识的整合工作就已经完成了。

卡帕西对此有精准的概括:知识库是一份可持久、可累积迭代的长效载体。

交叉引用永久留存,分析结果不会随对话记录消失,而是持续沉淀、不断完善。

作者寄语:大家好,我是萨拉。我每周都会在Learn AI分享实用的AI落地搭建教程,涵盖工具用法、实战架构、生产环境常见问题,内容免费订阅。

核心架构:两个文件夹 + 一个配置规则文件

整套系统的核心结构仅需一个简单目录树即可实现:

vault/
├── CLAUDE.md            # 规则配置文件,所有AI的入口文件
├── Raw/                 # 原始只读源文档目录
│   ├── Meeting Notes/
│   ├── Documents/
│   └── _pending.md      # 待编译任务队列
└── Wiki/                # AI生成、结构化、可索引的知识库
    ├── Projects/
    ├── People/
    ├── Decisions/
    ├── _hot.md          # 实时核心缓存
    ├── _log.md          # 操作审计日志
    └── _index.md        # 总索引目录

(以上为标准示例结构,可根据个人需求自定义调整)

Raw原始目录:唯一真实数据源

存放会议纪要、导出的Slack聊天记录、各类业务文档等一手工作资料。核心铁律:AI仅读取Raw目录内容,绝不修改、覆盖原始文件,仅支持追加记录。

Wiki知识库目录:AI自主搭建与维护的结构化知识层

按项目、人物、决策、业务领域分类生成独立文档,所有内容结构化整理、自动交叉引用。这是AI回答问题时优先读取的核心上下文。

熟悉数据管道的人能快速理解这套分层逻辑:Raw是原始数据落地层,Wiki是人工+AI整理后的精修层。若Wiki内容出现偏差或错乱,可基于Raw原始数据一键重建,永远不会丢失源头信息。

根目录的规则配置文件,用于告知AI整套知识库的组织结构、读取优先级和运行准则。适配Claude可命名为CLAUDE\.md,适配Codex可命名为AGENTS\.md。名称可自定义,只需保证每次对话会话启动时,AI优先读取该文件即可。

三大核心控制文件(系统稳定的关键)

绝大多数同类方案之所以最终失效,核心原因就是缺失这三个关键文件——单纯的Markdown文件夹无法形成可运转的系统,这三份文件才是整套自动化体系的核心。

1. _hot.md 实时缓存文件

每日自动化任务会更新该文件,汇总当前最新的工作进度、核心数据、截止时间和紧急事项,全文严格控制在500令牌以内。开启新对话时,AI会优先读取该文件,快速掌握最新动态,无需加载完整知识库,实现秒级上下文同步。

2. _pending.md 待处理队列文件

每当Raw目录新增文件,系统会自动将文件名、新增时间追加至该队列。每周的知识编译任务会读取该文件,逐一处理队列内容,将原始信息整合优化后录入Wiki知识库,并标记已编译状态。若无该队列文件,每日数据采集和每周知识整合会完全脱节,导致原始文件堆积、知识库长期滞后失效。

3. _log.md 审计日志文件

每一次自动化任务执行后,都会追加带时间戳的操作记录:任务类型、处理文件、新增/更新的Wiki页面。一旦知识库内容出现偏差,可通过日志精准定位问题环节。卡帕西在方案中给出了一个实用技巧:统一日志前缀格式,可直接通过Unix基础命令检索、解析日志内容。

示例日志格式:\#\# \[2026\-05\-01\] daily\-ingest

缺少这三份文件的知识库只会不断堆积冗余内容、逐渐失效;搭配三者,才能形成一套闭环、可迭代、可追溯的自动化知识管道。

规则配置文件:教会AI读懂你的专属知识库

CLAUDE\.md是整套系统的入口,所有AI对话会话都从读取该文件开始,包含以下核心配置:

  • 目录结构说明:明确Raw、Wiki目录及所有子文件夹的用途

  • 内容读取优先级:优先读取\_hot\.md,再读取对应领域的索引文档

  • 硬性运行规则:禁止修改Raw原始文件、禁止编造源文件不存在的信息、每次任务结束必须追加审计日志等

  • 领域结构定义:各类索引文件的命名规范、存储规则

你还可以在配置文件中固化专属提示词范式,我采用一套成熟通用的高效模板,直接嵌入规则文件:

我希望执行【具体任务】,最终达成【预期效果】。

1. 响应前完整读取所有上传文件;

2. 禁止直接执行任务,先向我提出澄清问题,协同优化执行方案;

3. 双方达成共识后,再启动正式工作。

”

将该逻辑固化到规则文件后,所有接入该知识库的AI都会默认先确认需求、再执行操作,彻底避免AI主观臆断导致的半成品输出。

值得固化的核心提示词理念

  • 上下文优于指令:给AI投喂文件信息,而非单纯堆砌文字指令

  • 示例优于规则描述:用实例展示预期效果,而非空洞的文字规定

  • 约束优于条文:明确禁止事项,交由AI自主选择最优执行方式

  • 目标优于步骤:明确最终达成的结果,不限制AI的执行细节

  • 极简表述:两句话明确任务与验收标准

自动化分层机制:三段式定时任务(核心稳定性保障)

我见过两种典型的搭建失败案例:一是纯手动更新知识库,短期可用,长期因繁琐维护彻底停滞;二是将数据采集、知识整合、内容校验合并为一个自动化任务,导致每日增量更新错乱修改结构化知识库,引发内容污染。

最优解决方案是拆分三级自动化任务,各司其职、互不干扰。

1. 每日任务(工作日晨间):仅数据采集

同步各类工作工具的增量信息,新增文件存入Raw原始目录、录入待处理队列,更新实时缓存\_hot\.md。不修改任何Wiki结构化知识库内容。

每日任务流程机械、简单、安全,可无人值守自动运行。 实操提示词模板:

每个工作日晨间执行以下操作:

1. 检查项目管理工具近24小时新增、更新的任务内容;

2. 同步会议纪要源的新转录文档,以「年月日-会议主题.md」格式存入Raw/Meeting Notes目录,并更新_pending.md队列;

3. 读取团队沟通工具核心频道消息,提取决策结果、待办事项、项目相关关键信息;

4. 整理邮箱标记的重要邮件,汇总待处理事项。

完成后更新Wiki/_hot.md,仅保留:当日最新工作进度、核心数据、截止时间、紧急事项,全文控制在500令牌内。

”

可适配Linear、Slack、Notion、邮箱等各类工作工具,通用性极强。

2. 每周任务(周一晨间):知识整合编译

读取\_pending\.md待处理队列,逐一对原始文件进行解析整合,在对应领域目录生成结构化Wiki文档,更新全局索引、补充页面双向交叉引用,最后标记队列任务为已完成。

每周任务的核心是信息解读与知识结构化沉淀,运算量更大、成本更高,建议定期抽检,确保AI归档分类准确。

3. 每月任务(每月1日):合规巡检纠错

仅做健康检查,不修改任何知识库内容。全面扫描Wiki知识库,排查过期页面、缺失的交叉引用、内容冲突、信息盲区、无索引孤立文档,生成巡检报告并输出通俗版总结。

全程只读不写,零风险、无需人工值守,及时发现知识库隐性问题。

分层机制的核心逻辑

三级任务风险等级完全不同:每日任务纯机械采集、零风险;每周任务负责智能解读整合、中度风险;每月任务仅诊断不修改、无风险。三者拆分执行,彻底避免知识库错乱污染。

工具适配性:支持所有定时调度工具,可通过搭载MCP协议的命令行定时任务、n8n、AI桌面工具实现,调度载体可自由替换,核心逻辑通用。

落地后的核心改变

你无需反复向AI解释背景信息,对话模式彻底升级。

当长效上下文永久加载完成后,你不再局限于用AI解决零散小问题,而是真正用AI落地核心工作。

AI实时掌握你的在研项目、近期决策、团队动态。当你提问「今天的工作优先级是什么」时,AI会结合实时缓存与完整项目知识库,给出贴合你实际工作场景的落地答案,而非通用套话。

另一大核心优势:高可移植性

你的所有上下文存储在本地文件夹,而非绑定某款AI的云端记忆。只需将该知识库目录指向其他AI工具,即可无缝同步全部知识,随时自由切换AI平台,知识库完全随行可用。

落地必看的常见故障与规避方案

  • 任务队列堆积:每日采集范围过广,每周整合任务处理不及时。解决方案:精简每日采集规则,仅同步核心有效信息。

  • 知识库内容偏差:长期不查看审计日志,问题无法及时发现。解决方案:定期查阅月度巡检报告与\_log\.md日志。

  • 系统彻底崩溃:自动化任务修改Raw原始文件,破坏唯一真实数据源。核心铁律:绝对禁止任何程序、任务修改原始目录文件,该边界不可突破。

结语

维护知识库最繁琐的工作,从来不是阅读与思考,而是机械的台账维护:更新交叉引用、同步最新摘要、比对新旧内容冲突。人类会因繁重的维护成本放弃知识库,但大语言模型不会疲惫、不会遗漏、可一次性批量更新十余份文档。

卡帕西的这套方案,溯源至1945年万尼瓦尔·布什(Vannevar Bush)提出的「记忆拓展器(Memex)」概念——一套个人专属的精选知识库,文档间具备关联检索能力。这一超前构想远比当下的互联网形态更贴合AI知识库,当年无法解决的持续维护难题,如今可由大语言模型完美落地。

我目前落地的方案,以Claude作为AI算力层、轻量化Markdown工具作为前端展示层,稳定可用。

这套架构兼容所有可读取本地文件的AI、所有定时调度工具。本质只是普通文件夹与文本文件,无复杂封装。

一次搭建、永久受用,让你的AI对话彻底告别从零开始,拥有持续迭代、无限更新的专属长效上下文。

推荐学习书籍 《CDA一级教材》适合CDA一级考生备考,也适合业务及数据分析岗位的从业者提升自我。完整电子版已上线CDA网校,累计已有10万+在读~ !

免费加入阅读:https://edu.cda.cn/goods/show/3151?targetId=5147&preview=0

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:上下文 documents Decisions Document Decision

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
扫码
拉您进交流群
GMT+8, 2026-9-28 17:32