自动驾驶:知识自动化的分级

把知识流水线想成一辆车。人类判断从没离开方向盘——只是随自动化程度,从”逐条打分”上移到”划定方向”。

一个常见的困惑:既然 AI 已经给材料分了级,为什么还要人来 /promote?答案要先把”打分”拆开看。

先厘清:这里有三种”打分”

环节 谁在打分 性质
/ingest 的 A/B/C 分级 AI 评估相关性 / 质量 / 新颖性 建议
6 因子召回 + 记忆曲线 + 指标 算法(纯公式,见 召回引擎 机械计算
/promote 提升到 wiki 人类 逐条 promote / reject / edit 决定

A/B/C 是 AI 打的,召回分是数学算的,只有 /promote 是人工

为什么分级后还要人工确认

因为 A/B/C 只回答”值不值得起草”,不回答”值不值得成为可信的持久知识“。

  • AI 会错——分级只是把你的工作量从”全看”降到”只看 A 级”,这是降噪
  • 人确认才算 verified——/promote 是信任闸门,直接体现在指标的 review_coverage,这是背书

这也是 CONSTITUTION A3 的硬约束:绝不未经人工审查自动进 wiki。

分级:L0 → L5

人类判断介入的粒度,可以像自动驾驶一样分级:

级别 谁分级 谁提升 人的角色
L0 手动 全程手写
L1 辅助 AI 只做模态转换 / 提取
L2 半自动(OKS 当前默认) AI 人确认 手在方向盘上,逐条 promote
L3 条件自动 AI AI 自动提升高置信项,人只审异常 手离盘、眼看路
L4 高度自动 AI AI 在 goal 边界内自管,人批量抽审 只设边界 + 定期审计
L5 全自动 AI AI —— 违反 A3,OKS 故意不做

关键洞察:级别越高,人的标注就从”逐条”上移到”定策略”(设 goal + 置信度阈值 + 抽样审计)。就像 L4 自动驾驶仍要在人类划定的运行域(ODD)里跑——goal 就是那个 ODD。所以理念里说的”标注师”和”goal 设定者”其实是同一个人,只是自动化程度决定了他站在哪一层打分。

两条正交的模式轴

自动化级别之外,还有两个独立的旋钮:

  • 触发方式:手动 /ingest 等 slash 命令 · 配方定时profiles/recipes/*.md,由外部调度器按 schedule cron 触发)· 事件驱动。
  • 审查粒度:逐条确认 · 批量通过 · 置信度门控(高置信自动、低置信转人)· 抽样质检。

它们可以和级别自由组合——比如”定时抓取 + 置信度门控”就是一种典型的 L3 配置。

配方与调度:谁在跑

OKS 核心不内置调度器/执行器。配方(profiles/recipes/{slug}.md)是给 Agent 读的 自动化契约,不是被某个 runner 解析的脚本:

  • schedule 字段只是 cron 提示 —— 由外部调度器(如 Qoder 自带的定时任务)按点触发, 唤起一个 Agent 读该配方、按 Steps 执行。改调度不改 OKS 代码。
  • settings/input-sources.json 是声明式订阅清单 —— 每条 source 用 "recipe": "..." 绑定到具体配方;配方执行时读取其中 enabled: true 的源作为输入。
  • oks CLI 只提供能力(recall / search / drafts / distill…),编排始终由 Agent + 人类在环完成(CONSTITUTION P5)。

现状与设计空间

诚实地说:OKS 目前只实现了 L2(AI 起草、人工 promote)。L3+ 是设计空间与路线图,尚未内置;L5 被 CONSTITUTION A3 明确排除。本页讲的是这套系统能往哪走,而非已经走到哪。

落地示例

同一套循环,落到你每天都在产生材料的地方——这几个案例就是 L2 模式的具体演练:

接下来读哪里

  • 理念:为什么人类判断是训练的信号源。
  • 每日循环:L2 模式每天怎么跑。
  • 知识库指标:用 review_coverage 看你的人工背书覆盖了多少。


回到顶部

This site uses Just the Docs, a documentation theme for Jekyll.