返回 G01~G90 教材库
G68 · 总 Day 248教材已备 ≠ 学习已完成

G68:Circuit 泛化与稳定性:机制是否跨输入和随机种子存在

Circuit 稳定性研究同一行为机制是否在新输入、长度、符号和训练随机种子上保持因果作用,并允许不同参数实现同一算法或同一模型切换机制。

2027-04-30

内容类型:预习教材(不代表已完成)
日期:2027-04-30
阶段:P3 · AGI Foundations 90
总路线:Day 248
周次节奏:W10 · 周五知识整理
状态:教材已备;学习未完成

一句话定义

Circuit 稳定性研究同一行为机制是否在新输入、长度、符号和训练随机种子上保持因果作用,并允许不同参数实现同一算法或同一模型切换机制。

学习目标

  1. 区分 behavioral generalization、representational similarity 与 mechanistic invariance。
  2. 设计跨 seed、输入族与训练时刻的 circuit 对齐方法,不强求 head 编号一一相同。
  3. 理解 polysemanticity、superposition、冗余和 phase change 怎样使机制边界不稳定。

核心知识

两个模型在同一任务上准确率相近,只证明行为相近;它们可能用不同 circuit。反过来,head 编号或 attention 图不同也不代表算法不同,因为 neuron/head 可置换、信息可在 residual 子空间旋转。跨模型比较应优先使用功能签名:组件对一组干预的响应向量、写入方向、读取关系和对行为 margin 的影响,而非索引相等。

同一模型也可能按输入难度切换路径。短序列使用位置 shortcut,长序列才调用匹配 circuit;常见模板由一个 head 完成,罕见模板由冗余 MLP 补偿。因此需把输入分成结构切片,报告每片的 circuit effect,而不是先聚合。Mechanistic invariance 是强主张:高层算法变量与低层子空间的干预对应在指定输入族上保持;只在一个例子出现不够。

随机初始化会改变 learned representation。若 10 个 seed 中只有一个形成清晰 head,可能说明该机制不是训练必然结果;也可能多个 seed 将功能分散到不同组件,单 head 搜索漏掉分布式 circuit。稳定性分析应同时问“是否有相同功能”与“是否由相同稀疏结构实现”。

训练过程还可能发生阶段变化:某一行为突然改善时,内部回路的形成也可能渐进或替换。相关时间点不能自动证明因果;可以保存 checkpoint,在行为出现前后做相同干预,检验 effect 是否同步增长。

机制与推导

对模型 seed (s)、输入切片 (d)、候选组件 (c),定义干预效应:

e(s,d,c)=E[margin_patch-margin_corrupt | d]

把组件的功能签名写成向量 F(s,c)=[e(s,d1,c),…,e(s,dk,c), necessity, sufficiency]。跨 seed 不直接匹配 head id,而寻找功能签名和读写子空间相近的集合。可用概念性匹配:

match(c_s,c_t)=λ·cos(F_s,F_t)+(1-λ)·subspace_similarity

但匹配分数只是定位工具,仍需在目标 seed 上独立干预。稳定性报告至少包含方向一致率、effect size 分布、失败 seed 和替代 circuit。若平均 effect 高但一半 seed 方向相反,不应称稳定。

对 checkpoint (t) 可画 behavior(t)causal_effect(t);若前者上升而后者不变,候选 circuit 可能只是伴随表示。即使同步,也需控制模型整体置信与 activation 尺度变化。

最小练习或观察步骤

  1. 给 G65 toy task 规划三个输入切片:训练长度、新长度、符号重命名;每片使用相同 scorer。
  2. 为三个随机 seed 写统一训练配置和 checkpoint 位置,不预设都学到同一 head。
  3. 定义候选组件的功能签名:三个切片 patch effect、一次 ablation effect、一个输出方向。
  4. 设计允许“一对多”的 circuit 对齐,并保留找不到匹配的结果。
  5. 写出三种可能解释:相同稀疏 circuit、不同结构同功能、不同输入切换机制,以及区分它们的下一干预。

常见误区与边界

  • 按 head 编号跨 seed 对齐,忽略置换和分布式表示。
  • 只报告有清晰 circuit 的 seed,造成幸存者偏差。
  • 行为 OOD 成功就推断机制不变,没有内部干预。
  • 用 representation similarity 代替功能因果相似。
  • 从 toy circuit 稳定性外推到大模型的长期行为或安全性。

研究/系统场景连接

模型升级时,旧 probe 或 circuit monitor 可能因表示旋转失效,即使业务性能不变;因此解释工具必须绑定模型版本并重新校准。金融模型的“相同理由”不能由相同 attention 图定义,而应由受控反事实和决策影响验证。P4 中同一导航行为可由视觉、记忆或接触反馈不同路径实现,跨仿真随机种子的机制稳定性比单轨迹动画更重要。

自检问题

  1. 行为泛化为何不推出机制不变?
  2. 跨 seed 为什么应比较功能签名而非 head id?
  3. 一半 seed 找不到 circuit 时应怎样陈述?
  4. Checkpoint 时间相关怎样推进为因果证据?

专业课程对齐

深入学习提示

先承认“不同网络可以实现同一算法”。把跨 seed 问题分成三层:行为是否一样、功能干预是否一样、稀疏组件是否一样。只在最后一层失败不必否定前两层,但也不能把前两层成功写成参数级同构。

学后填写区

  • 输入切片:
  • Seed 与 checkpoint 计划:
  • 功能签名:
  • 稳定 / 不稳定 / 无法对齐:
  • 下一项区分性干预:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本