返回 G01~G90 教材库
G85 · 总 Day 265教材已备 ≠ 学习已完成

G85:AGI 能力—证据地图:把“通用”拆回可测问题

AGI 能力—证据地图把 generality、performance、learning efficiency、planning、memory、adaptation、autonomy 与 risk 画成独立但相互依赖的轴,并为每个节点标注可支持证据和外推禁区。

2027-05-17

内容类型:知识整合教材(不代表已完成)
日期:2027-05-17
阶段:P3 · AGI Foundations 90
总路线:Day 265
周次节奏:知识整合 · 周一全景图
状态:教材已备;学习未完成

一句话定义

AGI 能力—证据地图把 generality、performance、learning efficiency、planning、memory、adaptation、autonomy 与 risk 画成独立但相互依赖的轴,并为每个节点标注可支持证据和外推禁区。

学习目标

  1. 用多维 capability profile 代替“是否 AGI”的二元标签。
  2. 区分任务表现、跨任务覆盖、新任务适应、长期行动、自主权限与部署风险。
  3. 在概念图上同时标机制依赖、测量混杂、证据标签和 P4 变化。

核心知识

Performance 是在给定任务与预算上的质量;generality 是跨任务分布和结构变化的覆盖;learning efficiency 是适应新任务所需样本、反馈和计算;planning/memory 描述跨时间利用状态与预测;autonomy 描述系统在多大程度上自行设定子目标、调用工具和持续行动;risk 取决于能力、权限、环境影响和控制。一个模型可以高 performance 但低 generality,也可低 autonomy 却因被接入高权限执行器而高风险。

Skill 指一个已定义任务映射,intelligence 更关心在新问题上获得技能的效率与先验。Benchmark 广度不自动等于 generality:任务可能共享模板、训练数据或语言脚手架;长上下文演示也可能把适应工作交给人类。地图需把 pretraining、prompt、retrieval、tool、human scaffold 与 test-time compute 作为资源输入,避免把外部系统贡献全部归给模型。

机制节点可包括 search、verifier、world model、memory、continual update 和 social learning,但它们只是实现候选。会搜索不等于会建立正确目标,会记忆不等于能更新信念,会跨任务得分不等于具身 grounding。每条机制边要写失败:verifier 偏差、rollout error、memory contamination、catastrophic forgetting、协调失效。

证据用 R/E/C/H/S。R 仅指本人按固定范围复现;E 是外部实证;C 表示冲突或指标依赖;H 是可证伪但未运行;S 是远期推测。教材与计划本身不产生 R。地图上空白不是缺陷,而是显示当前没有足够证据。

机制与推导

能力 profile 可写为条件函数而非标量:

Capability = f(task_distribution, prior_data, adaptation_budget, tools, time, human_scaffold)

若坚持向量,可用:

P=[perf_IID, perf_OOD, sample_efficiency, compute_efficiency, horizon, calibration, autonomy_scope]

风险另写:Risk=f(P, permission, exposure, reversibility, control_coverage),不能把能力向量加权后直接称风险。

概念图有三类边:mechanism edge(memory 支持 partial observability 下的 belief)、measurement edge(exact match 把连续改进转成阈值跃迁)、control edge(permission 限制 autonomy 的后果)。每条边附一个 intervention:移除 memory、改变 metric、收紧 permission 后,哪些观察应变化。无法写干预的边先标为叙事连接。

P4 桥接应标“变量换义”:文本 history 变成带时间戳传感器序列,action token 变成连续控制,tool permission 变成 actuator/workspace 约束,world model error 通过动力学累积为物理偏差。

最小练习或观察步骤

  1. 画八个能力轴,每轴写定义、一个指标、一个混杂和一个不能推出的结论。
  2. 加入 search、verifier、world model、memory、continual、control 六个机制节点,只画有因果含义的边。
  3. 给五条边各写一个最小干预,并标证据为 R/E/C/H/S。
  4. 用两种假想系统比较 profile:固定 benchmark 高分模型与低分但能少样本适应的 agent;不强行决定谁“更 AGI”。
  5. 用不同颜色标出 P4 会改变的节点,并写连续时间/物理后果如何改变测量。

常见误区与边界

  • 把多个轴平均成一个 AGI 分数,隐藏价值权重与补偿关系。
  • 任务数量多就称 generality,未检查共享模板、污染和脚手架。
  • 将规划、工具调用或长程 demo 单独升级为 AGI 证据。
  • 把 autonomy 当模型固有属性,忽略部署权限由系统赋予。
  • 地图完整就称掌握;它只是当前问题结构,不是能力证明。

研究/系统场景连接

金融 Agent 可在问答任务表现强,却对新政策适应慢;也可能建议能力一般但被授予交易权限后风险高。能力与权限必须分别建模。Web3 签名使动作不可逆,更强调 human confirmation。P4 中同一 profile 需增加 state-estimation uncertainty、control frequency、tracking error、collision severity 与 emergency-stop coverage。

自检问题

  1. Generality 与 learning efficiency 怎样在同一系统中方向相反?
  2. Autonomy 为什么不是仅由模型参数决定?
  3. 哪类边没有干预时只能算叙事连接?
  4. P4 会使哪个能力指标最先失真?

专业课程对齐

  • Levels of AGI:用 performance、generality 与 autonomy 的操作化框架校准多维地图,不采纳为单一标准或时间表。
  • On the Measure of Intelligence:聚焦 skill-acquisition efficiency、任务先验与泛化难度,检查 benchmark 数量为何不足。
  • A Generalist Agent — Gato:将多模态多任务表现作为外部案例,区分 generalist behavior 与无限定 general intelligence。

深入学习提示

地图上每增加一个“智能”词,就要求写一个对照系统和一个反例。若两个系统在该定义下无法排序,保留多维 profile;不可比本身可能比武断总分更接近事实。

学后填写区

  • 八轴 capability profile:
  • 五条因果边与干预:
  • 证据标签分布:
  • 最大测量混杂:
  • P4 变量换义:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本