返回 G01~G90 教材库
G01 · 总 Day 181教材已备 ≠ 学习已完成

G01:AGI 定义与能力本体

AGI 不是某个模型在若干题目上取得高分的同义词,而是一组必须分开描述的能力主张:系统覆盖哪些任务、达到什么性能、用多少新经验完成适应、以多大自主性行动,以及这种自主性带来什么部署风险。

2027-02-22generality、performance、learningefficiency、autonomyrisk

内容类型:预习教材(不代表已完成)
日期:2027-02-22
阶段:P3 · AGI Foundations 90
总路线:Day 181 / 360
周次 / 节奏:W1 · 周一概念与论文
状态:教材已备;学习未完成
主题:generality、performance、learning efficiency、autonomy 与 risk

一句话定义

AGI 不是某个模型在若干题目上取得高分的同义词,而是一组必须分开描述的能力主张:系统覆盖哪些任务、达到什么性能、用多少新经验完成适应、以多大自主性行动,以及这种自主性带来什么部署风险。

学习目标

  1. 能区分 skill、intelligence、generality、agency、autonomy 与 deployment risk,避免用一个模糊标签替代六个不同问题。
  2. 能把“某系统已接近 AGI”改写成可观察、可反驳、带适用范围的能力主张。
  3. 建立第一版 Capability Ontology 与 Claim–Evidence Ledger,但不填入尚未获得的实验结果。
  4. 理解 performance 与 generality 是两个轴,autonomy 又是独立的部署属性。

核心知识

skill 是在一个相对确定的任务与分布上完成目标的能力;intelligence 更关注获得技能与有效分配认知资源的效率;generality 关心能力覆盖范围以及面对新任务族时的迁移;agency 指系统能否基于状态选择行动并维持目标;autonomy 指行动链在多大程度上不依赖逐步人类确认;deployment risk 则由能力、权限、环境、可逆性与监控共同决定。一个系统可以技能很强但泛化窄,也可以适应较快却没有外部执行权;这两种情况都不能只用“更智能”概括。

能力测量至少需要任务分布 D、训练经验 E_train、新任务适应预算 B_adapt、行动权限 P 与评价函数 M。如果这些变量没有说明,分数就缺少解释对象。例如同一模型在提供二十个示例、允许调用搜索器时得到 90%,与零样本、无工具时得到 65%,测量的是不同系统配置,而不只是不同提示词。

本阶段采用 R/E/C/H/S 证据标签:本人在固定范围复现是 R;原始研究提供但本人未复现是 E;研究结论冲突是 C;可证伪但尚未测试是假设 H;远期推测是 S。标签描述证据身份,不是给论点打分。

机制与推导

先把能力轮廓写成向量,而不是压成总分:

[ \mathbf{c}=\left(g, p, \eta, m, a, r\right) ]

其中 g 表示任务族广度,p 表示指定分布上的性能,η 表示学习效率,m 表示记忆、规划与工具资源,a 表示自主程度,r 表示在给定权限下的风险。学习效率可粗略写为 η = Δperformance / (examples + λ·compute + μ·human_help);这不是通用行业公式,而是提醒我们:若忽略示例、算力和人工脚手架,所谓“快速适应”无法比较。

两个系统可能出现偏序:A 的固定任务性能高,B 的新任务样本效率高,无法诚实地说谁在所有意义上更“通用”。可以定义任务集合 T_train、同分布集合 T_iid、组合外推集合 T_comp 与规则外推集合 T_rule,并分别报告。只有当测试任务、适应预算和人类帮助固定后,差异才有清楚含义。

对一个宏大主张采用四步拆解:主张对象是谁;能力轴是哪一个;证据来自什么任务与配置;什么观察会推翻它。例如“能自主解决复杂问题”可改写为:“在本地沙箱的 30 个可验证组合任务中,系统在每题最多 20 次工具调用、无人中途修正的条件下成功率为待测值。”这样主张仍有价值,却不越过证据。

最小练习或观察步骤

  1. 不查资料,先写下自己目前对 AGI 的三句话定义,并给每句话标记 HS
  2. 选择计算器、客服分类器和带工具 Agent 三个系统,为每个系统填写 g/p/η/m/a/r 六轴的“待观察字段”,不要填写臆测分数。
  3. 将“模型会写代码,所以具有通用智能”改写成三个较窄主张:训练内语言表现、陌生库适应、可执行程序正确性。
  4. 设计一个反例:系统在熟悉题库接近满分,却在只改变规则描述时失败。指出它反驳的是哪一条泛化主张。
  5. 在 Claim–Evidence Ledger 中只建列:claim、scope、configuration、evidence tag、counterevidence、unknowns。

常见误区与边界

  • 把语言流畅度当成任务理解的充分证据;流畅文本可能与因果能力无关。
  • 把 benchmark 总分当成智能的自然单位;加权方式会隐藏任务族差异。
  • 把 generality 与 autonomy 混为一谈;能力广的系统可以被严格限权,能力窄的自动脚本也可造成真实损失。
  • 把模型、提示、检索、工具和人工筛选的联合成绩归因给裸模型。
  • 把“当前没有反例”写成证明;有限任务只支持有限范围内的陈述。
  • 试图在第一天给 AGI 下唯一终极定义;本日目标是得到可工作、可修改的测量语言。

研究/系统场景连接

在金融零售信贷中,模型可能能精确预测历史违约,却无法在政策变化、新客群或宏观冲击下快速适应。历史 AUC 描述的是特定分布性能,不等于跨制度 generality。若系统还能自动调额、发出通知或冻结账户,部署风险取决于权限与可逆性,而不能从 AUC 推出。Agent 研究同样要把规划能力与工具权限分开:一个能生成复杂计划但只能调用本地只读工具的实验系统,与能访问资金和客户数据的系统不是同一风险等级。

研究层面,这套本体允许并列比较 scaling、search、RL、memory 与 continual learning:它们可能改善不同轴,而非共同朝一个单一“AGI 进度条”移动。P4 进入具身场景后,还要把物理不可逆性与人类接管时间加入风险描述。

自检问题

  1. 一个系统固定任务性能高但新任务学习慢,应该怎样描述,而不是说“它不智能”?
  2. 为什么 autonomy 不是 generality 的自然结果?
  3. 提示示例、工具与人工选择怎样改变测量对象?
  4. ER 的区别是什么,为什么阅读论文不能自动升级为复现?
  5. 你的能力向量里哪个维度最难操作化,缺少什么观测?

专业课程对齐

深入学习提示

阅读时把每个术语映射到一个可改变的实验变量:generality 对应任务族与切分,learning efficiency 对应适应曲线,autonomy 对应人工介入频率,risk 对应权限和失败后果。若两篇材料定义不同,不急于选“正确答案”,而是标记它们各自想解决的测量问题。可进一步追问:任务空间由谁划定?人类先验是否也算资源?未知任务的难度如何比较?这些问题没有必要在 G01 结束,但应进入 unknowns ledger。

学后填写区

  • 我学习前的 AGI 定义:
  • 我修改后的六轴描述:
  • 一条从宏大口号改写出的可证伪主张:
  • 当前最难定义的能力轴:
  • 证据标签仍不确定之处:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本