返回 G01~G90 教材库
G05 · 总 Day 185教材已备 ≠ 学习已完成

G05:能力知识图谱与主张—证据账本

主张—证据账本把“系统很通用”拆成能力节点、条件、支持证据、反证与未知项,使知识图谱能够随新研究修订,而不是积累无法核验的结论句。

2027-02-26claimdecomposition、R/E/C/H/S、三类baseline与证据边界

内容类型:预习教材(不代表已完成)
日期:2027-02-26
阶段:P3 · AGI Foundations 90
总路线:Day 185 / 360
周次 / 节奏:W1 · 周五知识整合
状态:教材已备;学习未完成
主题:claim decomposition、R/E/C/H/S、三类 baseline 与证据边界

一句话定义

主张—证据账本把“系统很通用”拆成能力节点、条件、支持证据、反证与未知项,使知识图谱能够随新研究修订,而不是积累无法核验的结论句。

学习目标

  1. 能将三条 AGI 式主张拆成对象、范围、配置、指标、证据标签和证伪条件。
  2. 能把 memorization、固定规则与 adaptation baseline 的作用连接到能力图谱。
  3. 能区分论文证据、本人观察与推测,不把阅读理解写成复现完成。
  4. 能用一页轻量小结保留本周理解、反例、未知和兴趣,不建立重型验收流程。

核心知识

知识图谱中的节点不应只有名词。一个有效能力节点至少包含定义、可观察变量、前置假设、相邻机制与失败模式。例如 rule adaptation 连接 demonstrations、hypothesis space、sample efficiency 和 calibration;它不能直接连接“AGI 已实现”。边表示的是“依赖”“可能贡献”“证据冲突”或“不可推出”,而不是所有概念之间的笼统相关。

账本的一行可采用:claim | system | task distribution | configuration | metric | evidence | counterevidence | falsifier | boundary | status。证据标签只是索引。E 表示外部原始材料提供实证,但需记录实验范围;R 只有本人真实执行并保存证据后才能使用;C 指现有研究对解释或测量有实质冲突;H 必须写出可能推翻它的观察;S 则明确与近期可验证问题分开。

三类 baseline 对应三种替代解释:memorization 检查重复和表面检索;固定规则说明人工先验可达到什么;adaptation/search 检查从有限证据选择规则是否足够。复杂模型若只超过其中一个 baseline,不能宣称所有替代解释都排除。

机制与推导

可以把主张的支持强度理解为一组约束交集,而不是数字:

[ Support(c)=Scope \cap Independence \cap Replicability \cap ConstructValidity ]

任一集合很窄,结论就应相应缩小。外部论文在公开任务上的多 seed 结果可能具有较好 replicability,却未必有生态有效性;本人一次 toy run 即使保存完整,也只有局部 R,不能覆盖论文规模。

审计三类典型主张。第一,“模型在很多 benchmark 高分,所以具有通用性”:缺少任务独立性、污染与新任务适应。第二,“Agent 连续运行数小时,所以具有自主智能”:持续时间可能来自循环和外部工具,仍需看目标保持、恢复、权限与人工介入。第三,“模型能解释自己的推理,所以理解过程可信”:生成解释不是独立机制证据,应与行为干预或 verifier 对照。

更新规则可以很简单:新证据先附在既有 claim 下;只有当它改变范围或替代解释时才新建节点;冲突证据不覆盖旧证据,而是把状态改为 C;未知项始终允许保留。这样图谱不会因为一篇新论文就从“不会”翻转为“已经通用”。

最小练习或观察步骤

  1. 选取“多任务高分”“长程 Agent”“可解释推理”三条主张,分别填一行空结果账本。
  2. 对每条主张列出最强支持证据和至少一个替代解释,标记 E/C/H/S
  3. 将 G03 三类 baseline 连到相应替代解释,指出哪个 baseline 仍缺失。
  4. 为每条主张写一个最小证伪条件,例如在规则 OOD、伙伴变化或工具关闭后系统性失败。
  5. 画一张不超过十五个节点的概念图,至少包含两条“不可推出”边。

常见误区与边界

  • 把知识图谱做成术语收藏,没有操作定义与证据边。
  • 使用 R 表示“我读过”,混淆阅读与复现。
  • 只收集支持材料,冲突研究被视为噪声而不是重要节点。
  • 为主张打一个伪精确的可信度百分比,却没有解释如何得到。
  • 每天强制更新大量字段,让学习记录反过来吞噬学习时间。
  • 将 unknowns 视为计划失败;研究路线的价值正是逐步缩小未知。

研究/系统场景连接

金融零售系统常出现类似推理跳跃:“模型在验证集表现好,所以能自动审批”“解释文本合理,所以决策可解释”“人工复核率下降,所以风险更低”。账本要求明确数据时间范围、客群、阈值、人工流程和损失类型。一个模型可以提高效率,却仍需独立记录公平性、拒绝原因、漂移与申诉路径。

在 Agent 研究中,可把 capability profile 与 risk profile 分开挂载。同一规划能力,在本地益智题、只读数据库和可写支付工具下对应不同风险节点。这样未来讨论 alignment 或 control 时,不必重新争论“模型是否聪明”,而能直接检查权限、监控和不可逆动作。

自检问题

  1. 一条可维护的 claim 至少需要哪些上下文?
  2. 为什么 C 不是“什么都不知道”,而是有结构的冲突证据?
  3. 哪类主张最容易把 autonomy 与 generality 混在一起?
  4. 三种 baseline 各排除哪一种替代解释?
  5. 如何让账本足够轻,不变成新的学习 Gate?

专业课程对齐

深入学习提示

维护账本时优先写“证据不能推出什么”。这句话能阻止知识图谱被宣传叙事占据。对冲突论文,不必立即裁决;比较任务、指标、预算和训练充分性,常会发现双方回答了不同问题。若要深入,可研究 Bayesian evidence updating,但不要把主观先验包装成客观概率。本阶段用清楚的文字范围和反例就足够。

学后填写区

  • 我拆解的三条主张:
  • 最有价值的一条“不可推出”边:
  • 当前标为 C 的问题:
  • 一个仍缺少的 baseline:
  • 下周最想追踪的未知:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本