返回 G01~G90 教材库
G06 · 总 Day 186教材已备 ≠ 学习已完成

G06:不用术语堆砌解释 Intelligence 与 Skill

Skill 回答“在已界定任务上能做得多好”,intelligence 更关心“面对尚未熟练的任务,能否利用有限经验与资源获得有效技能”;两者相关,却不能用一个固定题库成绩互相替代。

2027-02-27概念压缩、类比边界、陌生任务适应与未知问题

内容类型:预习教材(不代表已完成)
日期:2027-02-27
阶段:P3 · AGI Foundations 90
总路线:Day 186 / 360
周次 / 节奏:W1 · 周六可选探索
状态:教材已备;学习未完成
主题:概念压缩、类比边界、陌生任务适应与未知问题

一句话定义

Skill 回答“在已界定任务上能做得多好”,intelligence 更关心“面对尚未熟练的任务,能否利用有限经验与资源获得有效技能”;两者相关,却不能用一个固定题库成绩互相替代。

学习目标

  1. 能用普通语言向非研究者解释 skill、learning efficiency 与 generality 的差别。
  2. 能构造至少两个“技能高但适应窄”或“初始技能低但适应快”的反例。
  3. 能识别类比的有效范围,避免把人类教育、金融风控或 Agent 行为粗暴等同。
  4. 整理仍不理解的测量问题,为 W2 的 scaling 与涌现学习保留入口。

核心知识

一名背熟整套题库的答题者可以有很高 skill,但题型换成未见规则时可能无法迁移。另一名答题者初始分数较低,却能从两个示例发现规则并迅速提高;在“获得新技能的效率”维度上,后者可能更强。这里没有必要宣布谁整体更智能,因为任务难度、先验知识和资源预算仍需固定。

技能不是贬义。可靠计算器、排序算法和信用规则引擎都是高价值的窄技能系统。问题只出现在把窄技能成绩升级为无边界 generality。反过来,也不能因为系统不是 AGI 就否定其工程价值;研究语言应同时允许“有用但有限”。

人类也拥有巨大先验:语言、身体经验、教育和文化工具。比较人类与模型的 few-shot 学习时,不能只数当前展示的示例而忽略累积经验。模型预训练同样是先验来源。所谓零样本并非没有经验,而是评测时没有额外标注样本。

机制与推导

设任务 t 的性能随经验变化为 P_t(e)。固定技能可以用 P_t(0) 或经过既定训练后的平台值描述;适应效率关心斜率与达到目标所需经验:

[ k_t(\tau)=\min{e:P_t(e)\ge \tau} ]

若 A 在熟悉任务 t_1P_A(0)>P_B(0),但在陌生任务 t_2k_A(τ)>k_B(τ),两个系统形成交叉优势。一个总分会把这种结构压平。任务难度也不是题面长度;可用最短规则描述、搜索空间、所需原语或人类基准近似,但每种定义都有局限。

再看迁移。若新任务共享原语,适应快可能来自可复用表示;若规则完全新,适应需要识别说明并建立新操作。可以把性能改变量分为 ΔP = transfer + adaptation + scaffolding + noise。实际实验很难完全分解,但这个式子提醒我们寻找对照:冻结工具、改变示例、交换规则、重复 seed。

类比练习也需边界。把模型比作“熟练员工”有助理解先验,却会暗示动机和责任;把 memory 比作“笔记本”有助理解外部状态,却忽略检索偏差。每个类比后应加一句“这个类比在哪一步失效”。

最小练习或观察步骤

  1. 用不超过 120 字向一个没有 AI 背景的人解释 skill 与 intelligence 的区别。
  2. 写两个反例:高初始技能但适应慢;低初始技能但两例后快速适应。为反例注明任务与预算。
  3. 选择“模型像学生”“Agent 像员工”中的一个类比,列出它帮助理解的两点和误导的两点。
  4. 回看 G01 的能力向量,删除一个无法解释的术语,换成可观察问题。
  5. 写下三个仍模糊的问题,例如任务难度、先验成本或跨模态 generality,允许保持未解决。

常见误区与边界

  • 把 intelligence 当成道德价值或身份判断;这里讨论的是研究操作化。
  • 认为 skill 窄就不值得学习;可靠窄系统常比模糊通用系统更有用。
  • 把 few-shot 的 few 只理解为提示里的例子,忽略预训练和工具先验。
  • 以人类直觉直接定义任务难度,不检查不同群体和经验差异。
  • 通过漂亮类比替代机制,或赋予系统未经证实的意图与理解。
  • 强求在可选探索日解决所有哲学问题;保留清楚未知即可。

研究/系统场景连接

金融零售中的资深审核员与规则引擎提供一个有限类比:规则引擎对固定政策执行稳定,审核员可能更能处理新型例外,但也会受疲劳、偏见和信息不足影响。这个类比帮助区分固定 skill 与适应,却不能把模型责任等同于人的职业责任。真正系统设计仍需记录数据、权限和人工复核。

Agent 场景中,工具库会显著提高可完成任务范围,但这可能是系统组合的 skill expansion,而非模型内部学习。若 Agent 遇到新 API 只靠文档就能正确调用,才涉及一种适应能力;仍需排除预训练见过同一 API 的可能。研究者可以诚实称其为“在给定工具与文档下的快速适应”,无需上升为 AGI。

自检问题

  1. 为什么零样本不等于没有先验经验?
  2. 两条适应曲线交叉时,单一排名会丢失什么?
  3. 高价值窄技能与 generality 主张应怎样同时描述?
  4. “Agent 像员工”的类比在哪些地方失效?
  5. 哪个未解决问题最自然地连接到 scaling 与涌现?

专业课程对齐

深入学习提示

如果概念仍显抽象,回到两条具体学习曲线,而不是继续收集定义。改变任务共享结构、示例数和工具权限,问哪个系统更快获得技能、成本是什么、外推到哪里。下一周会讨论模型和数据规模;提前保留一个问题:规模提升固定任务性能时,是否也按同样速度改善陌生任务适应?这不是预设答案,而是连接两周的研究假设。

学后填写区

  • 我的 120 字解释:
  • 两个交叉优势反例:
  • 一个类比及其失效边界:
  • 我删除或改写的术语:
  • 想带入 W2 的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本