G88:开放问题地图:用 E/C/H/S 保存已知、争议与未知
开放问题地图把 self-improvement、multi-agent、interpretability、alignment 与 AI Scientist 中的主张分成外部证据 E、冲突 C、待验假设 H 和推测 S,让未知保持可追踪而不被宏大叙事填满。
内容类型:知识整合教材(不代表已完成)
日期:2027-05-20
阶段:P3 · AGI Foundations 90
总路线:Day 268
周次节奏:知识整合 · 周四开放问题
状态:教材已备;学习未完成
一句话定义
开放问题地图把 self-improvement、multi-agent、interpretability、alignment 与 AI Scientist 中的主张分成外部证据 E、冲突 C、待验假设 H 和推测 S,让未知保持可追踪而不被宏大叙事填满。
学习目标
- 把宽泛问题改写成变量、机制、可观察结果和否定条件。
- 区分已有外部证据、跨研究冲突、本地可测假设与当前不可操作推测。
- 识别五个前沿方向之间共享的 evaluator、distribution、causality 与 control 问题。
核心知识
Self-improvement 的开放点不是“模型能否自我进化”这一句,而是:在什么任务、用什么外部选择信号、迭代多少轮、如何保持长尾、怎样避免 verifier 被优化。已有研究提供 E,但不同数据和过滤条件可能构成 C;“clean anchor 会在 toy 分布保持 tail recall”是 H;“无限递归必然产生超智能”属于缺少操作化的 S。
Multi-agent 要分合作、竞争、通信、制度与社会泛化。多个 Agent 的总分上升可能只是计算或样本增加;角色分工是否带来互补,需要 matched-budget 单 Agent baseline。开放问题包括协议是否跨伙伴泛化、共享记忆是否传播错误、激励是否导致 collusion。不要把“多人讨论更像社会”当社会智能证据。
Interpretability 的 E 包括特定 toy/模型中的 circuit 和因果干预;C 涉及方法是否稳定、feature 是否可命名、规模化是否保持;H 可以是“某 circuit 在符号重命名 OOD 保持”;S 是“完全读懂内部即可保证安全”。Alignment/control 中已有 toy protocol 与行为研究,但 threat model、模型能力、monitor 独立性和现实部署相差很大。
AI Scientist 的可验证算法搜索提供 E;judge bias、novelty 与研究选择形成 C/H;“自动化将取代完整科学共同体”属于远期 S。五个方向共享一条认识论:generator 能制造候选,不能单独提供真值;evaluator 会被分布和优化压力影响;因果结论需干预;行动后果需权限控制。
机制与推导
将开放问题记录为:
OQ={claim, variables, mechanism, evidence_for, evidence_against, confounds, falsifier, scope, tag, next_reading}
标签不是永久状态。H 在执行并保留证据后可变 R;阅读外部实证后可变 E;若发现相反研究变 C;无法操作但仍值得长期关注才是 S。不能把“我相信”作为迁移规则。
一个跨主题因果模板:generator quality G × evaluator validity V × distribution coverage D × control coverage C → observed improvement/safety。任何一个为弱项,都可能限制结论。多 Agent 或多 reviewer 只有在误差不完全相关时才可能提高可靠性;若个体误差率 p、相关性 ρ 高,多数投票收益远低于独立假设。
优先级不靠热点,可按 learning_value ≈ tractability × uncertainty_reduction × transferability / cost 粗排。它是选择辅助,不是评分 Gate;兴趣也可作为明确因素。
最小练习或观察步骤
- 为五个方向各写一条 OQ,禁止使用“是否实现 AGI”式不可操作问法。
- 每条至少填一项 evidence for、一个反例/混杂和一个 falsifier;没有就保持空白。
- 分配 E/C/H/S,并为其中两条写“什么新证据会改变标签”。
- 画共享问题图:evaluator bias、distribution shift、causal evidence、permission boundary,连接到五个方向。
- 选一条 tractable H 写最小实验;另选一条 S 说明为何当前不做。
常见误区与边界
- 把 E 写成共识,忽略研究范围和本人未复现。
- C 被理解为“一半真一半假”,没有找指标与条件差异。
- H 没有否定条件,只是希望出现的结果。
- 所有宏大问题都列为 S,却没有说明可操作化缺口。
- 按热度清空 unknowns,或为阶段完整强行选择立场。
研究/系统场景连接
企业 AI 决策中也可维护 claim–evidence ledger:供应商 demo 属外部证据,内部真实分布未知,业务假设需小范围验证,长期自主化属于推测。金融与 Web3 场景的不可逆权限应让 C/H 主张停留在建议层。P4 会把许多 S/H 变成可观测的仿真问题,例如 belief 在遮挡下是否保持、world-model error 是否造成控制失稳。
自检问题
- E 与 R 的关键差别是什么?
- 怎样把“自改进是否可行”改成可证伪问题?
- 多 Agent 投票为何依赖误差相关性?
- 哪一条 S 最可能在 P4 变成 H?
专业课程对齐
- AI Models Collapse When Trained on Recursively Generated Data:作为 self-improvement 数据风险的 E,同时记录任务、迭代与数据条件,防止过度外推。
- Causal Abstraction:为 interpretability 主张提供因果操作语言,帮助把描述性 S/H 转成可干预假设。
- AI Control:作为 control protocol 的外部研究案例,明确其威胁模型与现实部署之间仍存在的 C/H。
深入学习提示
开放问题列表不追求越长越好。优先保留那些“知道什么证据会改变观点”的问题;若暂时无法写 falsifier,就诚实标 S,并记录缺少的是测量、环境、权限还是理论。
学后填写区
- 五条 OQ:
- E/C/H/S 标签:
- 两条标签迁移条件:
- 共享认识论问题:
- 暂不研究的 S: