G68:Circuit 泛化与稳定性:机制是否跨输入和随机种子存在
Circuit 稳定性研究同一行为机制是否在新输入、长度、符号和训练随机种子上保持因果作用,并允许不同参数实现同一算法或同一模型切换机制。
内容类型:预习教材(不代表已完成)
日期:2027-04-30
阶段:P3 · AGI Foundations 90
总路线:Day 248
周次节奏:W10 · 周五知识整理
状态:教材已备;学习未完成
一句话定义
Circuit 稳定性研究同一行为机制是否在新输入、长度、符号和训练随机种子上保持因果作用,并允许不同参数实现同一算法或同一模型切换机制。
学习目标
- 区分 behavioral generalization、representational similarity 与 mechanistic invariance。
- 设计跨 seed、输入族与训练时刻的 circuit 对齐方法,不强求 head 编号一一相同。
- 理解 polysemanticity、superposition、冗余和 phase change 怎样使机制边界不稳定。
核心知识
两个模型在同一任务上准确率相近,只证明行为相近;它们可能用不同 circuit。反过来,head 编号或 attention 图不同也不代表算法不同,因为 neuron/head 可置换、信息可在 residual 子空间旋转。跨模型比较应优先使用功能签名:组件对一组干预的响应向量、写入方向、读取关系和对行为 margin 的影响,而非索引相等。
同一模型也可能按输入难度切换路径。短序列使用位置 shortcut,长序列才调用匹配 circuit;常见模板由一个 head 完成,罕见模板由冗余 MLP 补偿。因此需把输入分成结构切片,报告每片的 circuit effect,而不是先聚合。Mechanistic invariance 是强主张:高层算法变量与低层子空间的干预对应在指定输入族上保持;只在一个例子出现不够。
随机初始化会改变 learned representation。若 10 个 seed 中只有一个形成清晰 head,可能说明该机制不是训练必然结果;也可能多个 seed 将功能分散到不同组件,单 head 搜索漏掉分布式 circuit。稳定性分析应同时问“是否有相同功能”与“是否由相同稀疏结构实现”。
训练过程还可能发生阶段变化:某一行为突然改善时,内部回路的形成也可能渐进或替换。相关时间点不能自动证明因果;可以保存 checkpoint,在行为出现前后做相同干预,检验 effect 是否同步增长。
机制与推导
对模型 seed (s)、输入切片 (d)、候选组件 (c),定义干预效应:
e(s,d,c)=E[margin_patch-margin_corrupt | d]
把组件的功能签名写成向量 F(s,c)=[e(s,d1,c),…,e(s,dk,c), necessity, sufficiency]。跨 seed 不直接匹配 head id,而寻找功能签名和读写子空间相近的集合。可用概念性匹配:
match(c_s,c_t)=λ·cos(F_s,F_t)+(1-λ)·subspace_similarity
但匹配分数只是定位工具,仍需在目标 seed 上独立干预。稳定性报告至少包含方向一致率、effect size 分布、失败 seed 和替代 circuit。若平均 effect 高但一半 seed 方向相反,不应称稳定。
对 checkpoint (t) 可画 behavior(t) 与 causal_effect(t);若前者上升而后者不变,候选 circuit 可能只是伴随表示。即使同步,也需控制模型整体置信与 activation 尺度变化。
最小练习或观察步骤
- 给 G65 toy task 规划三个输入切片:训练长度、新长度、符号重命名;每片使用相同 scorer。
- 为三个随机 seed 写统一训练配置和 checkpoint 位置,不预设都学到同一 head。
- 定义候选组件的功能签名:三个切片 patch effect、一次 ablation effect、一个输出方向。
- 设计允许“一对多”的 circuit 对齐,并保留找不到匹配的结果。
- 写出三种可能解释:相同稀疏 circuit、不同结构同功能、不同输入切换机制,以及区分它们的下一干预。
常见误区与边界
- 按 head 编号跨 seed 对齐,忽略置换和分布式表示。
- 只报告有清晰 circuit 的 seed,造成幸存者偏差。
- 行为 OOD 成功就推断机制不变,没有内部干预。
- 用 representation similarity 代替功能因果相似。
- 从 toy circuit 稳定性外推到大模型的长期行为或安全性。
研究/系统场景连接
模型升级时,旧 probe 或 circuit monitor 可能因表示旋转失效,即使业务性能不变;因此解释工具必须绑定模型版本并重新校准。金融模型的“相同理由”不能由相同 attention 图定义,而应由受控反事实和决策影响验证。P4 中同一导航行为可由视觉、记忆或接触反馈不同路径实现,跨仿真随机种子的机制稳定性比单轨迹动画更重要。
自检问题
- 行为泛化为何不推出机制不变?
- 跨 seed 为什么应比较功能签名而非 head id?
- 一半 seed 找不到 circuit 时应怎样陈述?
- Checkpoint 时间相关怎样推进为因果证据?
专业课程对齐
- In-context Learning and Induction Heads:关注不同模型尺度、训练时刻与 induction 行为之间的证据链及其限定。
- Towards Monosemanticity:理解 superposition 与 feature 分解为何让单 neuron/head 对齐不可靠。
- Causal Abstraction 原论文:用干预对应而非表面相似定义高层机制是否跨实现保持。
深入学习提示
先承认“不同网络可以实现同一算法”。把跨 seed 问题分成三层:行为是否一样、功能干预是否一样、稀疏组件是否一样。只在最后一层失败不必否定前两层,但也不能把前两层成功写成参数级同构。
学后填写区
- 输入切片:
- Seed 与 checkpoint 计划:
- 功能签名:
- 稳定 / 不稳定 / 无法对齐:
- 下一项区分性干预: