AI Agent 时代的知识库不再只是个人笔记,而是长期上下文系统。真正的问题不是能不能写 Markdown,而是不同团队、不同项目、不同数据库文档之间缺少共同格式。每个系统都有自己的写法,智能体每次接入都要重新理解结构,长期知识很难迁移和复用。
Open Knowledge Format 给出了一套低门槛答案:用 Markdown 承载正文内容,用 YAML Front Matter 暴露结构化元数据,再用 Knowledge Bundle、Concept、index.md 和 log.md 组织成可导航的知识系统。它不是新的知识管理软件,而是一套人和 AI Agent 都能读取的开放格式。
OKF v0.2 的价值在于把知识管理推进到治理层:来源可追溯、可信度可判断、时效性可复核、生命周期可标记、计算过程可验证。落地时不需要一次铺满所有字段,最小合规只需要 Type 字段;复杂场景再逐步加入来源、审核、过期时间和计算验证。
这套分析框架围绕三个问题展开:需求是否真实,商业化是否已经进入财务结果,估值是否已经提前消化太多预期。只有把产业位置、关键数字、兑现节奏和风险条件放在同一张图里,判断才不会停留在主题热度上。
从 LLM Wiki 到格式碎片化
LLM Wiki 的理念,是让大语言模型帮助个人或团队持续构建结构化知识库,把项目经验、业务流程、架构决策和常用资料沉淀为长期上下文。问题在于,当每个人都开始搭建自己的知识库,格式差异会迅速放大。
一个代码仓库里的长期项目文档是一套格式,数据库文档是另一套格式,个人笔记又是一套格式。AI Agent 在执行任务前,必须先理解这些上下文;如果每个系统都使用不同结构,就需要为每个系统单独做适配。
格式碎片化的代价不只是阅读不方便,而是知识无法稳定迁移。越是希望把知识交给智能体长期使用,越需要一套统一的、开放的、低门槛的知识格式。OKF 就是为这个问题提出的规范。
把这一层拆开,起点是LLM Wiki;现实问题是格式碎片化;代码项目是项目文档。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:知识库越多,格式差异越会变成 AI Agent 接入和迁移成本。
后续判断要同步反向校验。数据场景需要看指标、口径和查询缺少统一元数据;智能体成本需要看每次接入都要重新适配结构;解决方向需要看让知识可迁移、可导航、可复用。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,起点、现实问题、代码项目共同构成这一章节的主轴。LLM Wiki对应用结构化文档沉淀长期知识;格式碎片化对应个人、团队和项目各写一套;项目文档对应架构、任务和长期决策分散。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,数据场景、智能体成本、解决方向是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
OKF 的定义:Markdown + YAML
OKF 是一套 Markdown 和 YAML 的格式规范。Markdown 负责承载正文,保留人类可读性;YAML Front Matter 负责描述这份知识的类型、标题、来源、状态、审核信息和其他结构化元数据。
这种组合的优点是低门槛。Markdown 本身已经广泛用于代码仓库、笔记系统和文档站;YAML Front Matter 又能让 AI Agent 先读取少量结构化信息,快速判断文件是否与当前任务相关,再决定是否读取全文。
OKF 不是一个新的知识管理软件,也不是 Obsidian、Git、RAG 或 MCP 的替代品。它更像一个共同语言:知识可以继续放在文件夹、仓库或笔记库里,但只要遵循同一套格式,就更容易被不同系统理解和组合。
把这一层拆开,格式名称是OKF;正文载体是Markdown;元数据是YAML。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:正文用 Markdown,结构化元数据用 YAML,让同一份知识同时适合人和 AI Agent 阅读。
后续判断要同步反向校验。读取对象需要看同一份知识兼容两类读者;组合系统需要看可被检索、工具和知识管理系统使用;定位需要看不是替代 Obsidian 或 Git。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,格式名称、正文载体、元数据共同构成这一章节的主轴。OKF对应Open Knowledge Format;Markdown对应人类可读、工具生态成熟;YAML对应Front Matter 暴露结构化字段。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,读取对象、组合系统、定位是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
Knowledge Bundle 是文件夹,不是数据库
OKF 的基础单位是 Knowledge Bundle,也就是知识包。它不是数据库表,也不是某个云服务里的专有对象,而是一个文件夹结构。这个设计非常重要,因为文件夹天然可复制、可版本管理、可放进代码仓库,也能被各类工具读取。
知识包内部可以包含多个 Concept,也可以包含 index.md 和 log.md 这样的导航与变更记录文件。智能体不需要一上来读取整个知识库,而是先读取目录、元数据和链接关系,再定位到真正相关的知识条目。
把知识包做成文件夹,而不是数据库,降低了迁移成本。个人笔记、团队项目文档、API 说明、数据库指标口径,都可以以 Knowledge Bundle 形式组织,再交给 RAG、MCP、Obsidian 或代码智能体使用。
把这一层拆开,基础单位是Knowledge Bundle;物理形态是文件夹;迁移成本是低。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:OKF 的基础单位是 Knowledge Bundle,本质上是一个可被工具读取的文件夹结构。
后续判断要同步反向校验。组合能力需要看可接入 RAG、MCP 和笔记系统;导航文件需要看提供知识包目录;变更记录需要看记录重要新增和更新。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,基础单位、物理形态、迁移成本共同构成这一章节的主轴。Knowledge Bundle对应OKF 中的知识包;文件夹对应不强依赖数据库或专用平台;低对应复制文件夹即可迁移。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,组合能力、导航文件、变更记录是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
Concept 是每个知识条目
Knowledge Bundle 内部最基本的单位叫 Concept,也就是知识条目。一个 Concept 本质上就是一个 Markdown 文件,可以保存一篇知识笔记、一段业务流程、一个 API 约定、一份架构说明或一个长期项目记忆。
例如 Concept/AgentMemory.md 就可以被视为一个知识条目。它所在的文件夹和文件名共同形成 ConceptID,也就是说,文件路径本身就是知识身份的一部分。这个设计让知识条目更容易被链接、引用和更新。
OKF 并不限制正文内容。真正需要遵守的是文件头部的 Front Matter,因为智能体需要通过结构化元数据快速理解这个文件是什么、是否相关、是否可信、是否过期。
把这一层拆开,基本单位是Concept;文件形态是Markdown文件;示例文件是AgentMemory.md。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:文件路径与文件名共同形成 ConceptID,让知识条目具备稳定身份。
后续判断要同步反向校验。所在目录需要看目录参与身份定义;稳定ID需要看由路径和文件名共同形成;内容范围需要看笔记、文档、流程都可以放入。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,基本单位、文件形态、示例文件共同构成这一章节的主轴。Concept对应知识包内的知识条目;Markdown文件对应正文可以保存任意知识;AgentMemory.md对应一个知识条目对应一个文件。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,所在目录、稳定ID、内容范围是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
最小合规只需一个 Type 字段
OKF 要求 Markdown 文件必须包含 YAML Front Matter,但最小合规要求很低:唯一强制字段只有 Type。Type 用来说明这份文件描述的是什么类型的知识,例如 AI、Resource、Prompt、业务流程、架构设计或数据库指标。
这个字段看起来简单,却能显著降低智能体读取成本。智能体可以先读 YAML 元数据,判断当前文件是否与任务有关,再决定是否读取完整正文。这样就不需要把整个 Markdown 文件直接塞进上下文窗口。
实际使用中,可以继续增加 title、description、sources、status、verified 等字段,但不需要一开始把所有字段都铺满。OKF 的落地原则是从最小 Type 开始,根据场景复杂度逐步补充治理信息。
把这一层拆开,结构区域是Front Matter;唯一强制是Type;可选字段是title/description。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:OKF 不要求一开始填满所有字段,最小要求只有 Type,用来说明知识类型。
后续判断要同步反向校验。示例类型需要看可自定义知识分类;示例类型需要看资源型资料;示例类型需要看提示词或任务模板。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,结构区域、唯一强制、可选字段共同构成这一章节的主轴。Front Matter对应Markdown 文件顶部的 YAML 元数据;Type对应说明文件描述哪类知识;title/description对应按实际需要逐步增加。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,示例类型、示例类型、示例类型是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
index.md、log.md 与渐进式披露
OKF 的文件夹目录里,通常会有 index.md 和 log.md。index.md 相当于整个知识包的导航目录,使用普通 Markdown 链接指向相关知识条目。这里故意使用普通链接,而不是某个笔记软件的专用双链格式,因为不是所有系统都支持私有链接语法。
log.md 记录知识包的重要变化,例如哪一天新增了哪些文件、重命名了哪些条目、更新了哪些关键内容。对长期知识库来说,变更记录能帮助智能体理解知识演进,也方便团队追踪上下文来源。
这一套结构对应 Progressive Disclosure,也就是渐进式披露。智能体先读取 index.md、Front Matter 和少量摘要,确定哪些内容相关,再进一步读取完整正文。这样既保留知识库完整性,又避免一次性消耗过多上下文。
把这一层拆开,导航入口是index.md;链接形式是Markdown链接;变更记录是log.md。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:index.md 提供导航,log.md 记录变更,Progressive Disclosure 减少上下文浪费。
后续判断要同步反向校验。读取策略需要看判断相关性后再深入;核心机制需要看渐进式披露降低上下文成本;最终效果需要看人类和 Agent 都能导航。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,导航入口、链接形式、变更记录共同构成这一章节的主轴。index.md对应整个知识包的目录;Markdown链接对应保持跨系统兼容;log.md对应记录新增、重命名和更新。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,读取策略、核心机制、最终效果是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
OKF v0.2 的五个治理问题
基础 OKF 解决的是通用知识格式问题;OKF v0.2 进一步进入治理层。知识从哪里来,是谁写的,有没有验证过,是否过时,是草稿还是正式版,里面的数据和指标是否经过计算验证,这些问题都会影响智能体能不能放心使用知识。
五个核心机制分别对应来源追踪、可信度、时效性、生命周期和计算验证。它们不是为了让文档变复杂,而是为了让文档在被智能体使用时更安全。人类读文档时可以凭经验判断可信度,智能体则需要显式字段。
当知识库进入团队、企业、代码仓库和数据库场景,治理字段就变得很重要。没有来源和审核信息的知识,可能被过度相信;没有时效性和状态信息的知识,可能把历史判断当成当前事实;没有计算验证的指标,可能被智能体临时改写而失真。
把这一层拆开,问题一是来源;问题二是可信度;问题三是时效性。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:OKF v0.2 重点解决来源、可信度、时效性、生命周期和计算验证五类问题。
后续判断要同步反向校验。问题四需要看草稿、稳定版还是废弃版;问题五需要看指标和查询是否按批准逻辑执行;治理目标需要看Agent 不只读取,还能评估知识质量。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,问题一、问题二、问题三共同构成这一章节的主轴。来源对应这条知识到底从哪里来;可信度对应谁创建、谁审核、何时审核;时效性对应过去正确的知识现在是否仍正确。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,问题四、问题五、治理目标是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
来源、可信度与时效性
Provenance 可以理解为来源追踪。它解决的问题是:这条知识到底从哪里来,是官方文档、研究文章、内部流程,还是智能体自动生成的总结。OKF 用 sources 字段记录来源地址和来源 ID,再允许正文中的具体句子引用对应来源。
可信度机制主要依赖 generated 和 verified。generated 记录由谁创建、在什么时间创建;verified 记录由谁审核、在什么时间审核。智能体读取这些字段后,就能判断这条知识是否经过验证、审核主体是谁、可信程度是否足以支撑当前任务。
时效性通过 stale_after 字段表达。很多知识过去正确,不代表现在仍然正确。比如一个日期字段可以写成 2020年12月31日,意思是到了这个日期之后,这篇知识应当重新检查。如果智能体在此后读取到未复核内容,就应该把它视为可能过期的知识。
把这一层拆开,来源追踪是Provenance;来源字段是sources;正文引用是ID引用。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:Provenance 建立出处链,generated/verified 记录创建与审核,stale_after 触发复核。
后续判断要同步反向校验。创建记录需要看by 和 at 记录创建主体与时间;审核记录需要看标记是否被人工或流程审核;过期检查需要看到期后需要重新复核。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,来源追踪、来源字段、正文引用共同构成这一章节的主轴。Provenance对应记录知识来自哪里;sources对应在 YAML 中写入参考资料;ID引用对应正文可指向 sources 中的来源。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,创建记录、审核记录、过期检查是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
生命周期与计算验证的企业价值
生命周期字段 status 用来区分 Draft、Stable 和 Deprecated。Draft 是草稿,适合继续编辑但不应该被自动当成权威;Stable 是稳定正式版本,可以进入流程;Deprecated 是废弃版本,保留历史但不推荐继续使用。
计算验证机制更适合企业场景。很多公司在查询数据库、计算指标、生成财务数据时,不希望智能体每次临时写一条 SQL 或一段代码。正确做法是把经过审核的查询、公式或脚本作为计算型知识固定下来,只允许智能体传入 parameters 这些可变参数。
OKF 对计算型知识提供 runtime、parameters、executor 和 attester。runtime 表示执行环境,parameters 表示唯一允许智能体提供的变量,executor 定义工具如何执行,attester 用来检查实际运行程序是否与批准过的程序一致。这样可以防止智能体临时改写代码、绕过审核或生成不可追溯的指标。
把这一层拆开,生命周期是status;状态一是Draft;状态二是Stable。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:status 区分 Draft、Stable、Deprecated;runtime、parameters、executor、attester 控制计算型知识。
后续判断要同步反向校验。状态三需要看废弃版本,保留但不推荐使用;计算环境需要看例如 Python 或 BigQuery;执行校验需要看限制和验证实际运行逻辑。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,生命周期、状态一、状态二共同构成这一章节的主轴。status对应标记知识当前状态;Draft对应草稿,不能过度信任;Stable对应稳定版本,可用于正式流程。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,状态三、计算环境、执行校验是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。
从最小 Type 字段开始落地
OKF 的落地方式很简单:先不要试图一次性使用所有字段,而是从最小结构开始。建立一个 OKF 文件夹,把真正需要长期复用的知识整理成 Knowledge Bundle,每个关键条目写成 Markdown 文件,并在 Front Matter 中至少写入 Type。
个人知识库可以把长期有效的概念、方法、项目经验整理成 OKF;代码项目可以创建专门的 OKF 文件夹,保存架构设计、模块关系、API 约定、历史决策和智能体长期记忆;数据库和指标场景则可以进一步使用计算验证机制,确保查询口径可审计。
真正重要的不是字段数量,而是让知识能够被定义、被导航、被追溯、被判断可信度、被判断是否过期。只要这套结构存在,AI Agent 就不必每次重新猜测知识库如何组织,也能在多个工具和系统之间迁移长期上下文。
把这一层拆开,个人知识库是Obsidian;代码项目是OKF文件夹;数据库是指标口径。这些并不是孤立信息,而是AI Agent 长期知识库从自由文本、目录导航、元数据治理到可验证计算知识的标准化路径之间的连续传导:个人笔记、代码项目、数据库、API 和业务流程,都可以从最小 OKF 知识包开始。
后续判断要同步反向校验。API文档需要看让智能体理解调用边界;业务流程需要看让任务执行有上下文;起步原则需要看按需求逐步增加字段。只要其中任何一环发生逆转,结论就要重新估价;如果这些条件继续同向强化,框架的解释力会明显提高。
从经营层面看,个人知识库、代码项目、数据库共同构成这一章节的主轴。Obsidian对应沉淀长期可复用知识;OKF文件夹对应保存架构、模块关系和长期记忆;指标口径对应用计算验证约束查询逻辑。这些指标的意义不在于单点高低,而在于能否相互验证:需求端给出方向,供给端决定交付,财务端确认结果。
落实到投资和产业判断,API文档、业务流程、起步原则是必须同时跟踪的约束条件。高景气会放大优势,也会放大执行偏差;价格、产能、成本、客户和技术路线任何一项出现变化,都可能改变最终利润留存。
因此,这里必须区分三类信息:已经发生的财务和订单结果,正在验证的产品、客户与产能进度,以及尚未兑现的远期利润假设。把三类信息混在一起,容易把产业趋势误读为当期业绩;分层处理后,机会和风险才会更清楚。