G45:学习策略、通信通道与固定伙伴对照
可学习通信让 Agent 发送影响伙伴决策的信号,但只有在无通信、随机通信和陌生伙伴对照下,才能判断消息是否携带可泛化信息而非私有编码或答案泄漏。
内容类型:预习教材(不代表已完成)
日期:2027-04-07
阶段:P3 · AGI Foundations 90
总路线:Day 225 / 360
周次:W7 · 多智能体、合作与社会泛化
节奏:周三引导实验
状态:教材已备;学习未完成
标签:communication、multi-agent-learning、centralized-training、cross-play、ablation
一句话定义
可学习通信让 Agent 发送影响伙伴决策的信号,但只有在无通信、随机通信和陌生伙伴对照下,才能判断消息是否携带可泛化信息而非私有编码或答案泄漏。
学习目标
- 区分 cheap talk、可验证消息、共享状态与直接动作控制。
- 实现一个小型学习或表格策略,并给通信设置显式带宽与成本。
- 比较 centralized training/decentralized execution 和独立学习的边界。
- 用 communication ablation 与 cross-play 判断消息的真实贡献。
核心知识
- Cheap talk 消息本身不改变环境 payoff,只通过改变伙伴 belief 起作用;没有共同激励或可信承诺时,消息可能无信息甚至欺骗。
- 如果通信通道直接包含隐藏状态或对方答案,性能提升是信息泄漏,不是学习出社会推理。消息可见范围和生成时点必须明确。
- Centralized training 可用联合状态或联合 critic 改善 credit assignment,执行时各 Agent 只看本地观察。若测试仍保留训练期全局信息,就没有验证 decentralized execution。
- Emergent protocol 可能是任意符号 convention。与相同训练副本配合成功,并不保证人可解释或能和新伙伴对齐。
- 通信价值需要扣除 token、时延、冲突和攻击面。无通信也可能通过观察行动历史协调。
机制与推导
两 Agent 在时刻 (t) 先发消息 (m_i\sim\mu_i(m\mid o_i)),再行动:
[ a_i\sim\pi_i(a\mid o_i,m_{-i}) ]
若消息有成本 (c(m_i)),训练目标可写为:
[ J_i=\mathbb E\left[\sum_t\gamma^t(r_{i,t}-\lambda c(m_{i,t}))\right] ]
比较有无通信时必须保持 action observation 一致。通信贡献可用配对差:
[ \Delta_{comm}=U(\pi,\mu)-U(\pi,\mu_{silent}) ]
但若 silent 改变模型输入长度或训练方式,差异仍有混杂。更强消融包括:正确消息、随机置换、延迟一轮、来自另一局轨迹的消息。
Cross-play 检验 convention:训练出多个独立 sender/receiver 对,形成矩阵 (M_{ij})。对角高、非对角低说明协议共同适应但不通用。可以计算 message-action mutual information 作为线索:
[ I(M;A)=\sum_{m,a}p(m,a)\log\frac{p(m,a)}{p(m)p(a)} ]
高互信息只说明相关,不证明消息因果有用;仍需置换干预。
最小练习或观察步骤
- 在 toy dilemma 或双人导航中加入离散消息集合
{0,1,2,3},每轮消息先于行动且不能直接改变状态。 - 选择表格 Q-learning、简单 policy gradient 或规则自适应之一;学习为可选,重点是清楚的对照。
- 比较 no-message、truthful rule message、learned message、random message;记录回报、福利、通信次数与成本。
- 训练至少两个独立 sender/receiver 配对,形成 cross-play matrix;精力不足时也可用手工协议模拟私有 convention。
- 做消息置换与延迟干预,观察行动和结果是否改变;将互信息与干预结果并列。
- 分离训练可见信息与执行可见信息,明确任何全局 state 是否只进入训练 critic。
常见误区与边界
- 通信后回报上升就认为出现语言或意图理解,可能只是隐藏状态泄漏。
- 消息和行动高相关就宣称消息被使用,没有置换或静默消融。
- 只测试共同训练的 sender/receiver,掩盖私有协议。
- 集中 critic 的全局信息泄漏到执行策略。
- 不计消息成本,通信越多越显得有利。
- toy 离散符号协议不是自然语言交流、共同心智或人类社会智能的证据。
研究/系统场景连接
多个业务 Agent 之间的消息应是 typed claim,包含来源与权限,不是互相发送自由文本后自动采信。风险 Agent 告诉服务 Agent“需要升级”可以是可验证状态;发送未引用的客户判断则可能形成自动化传言。研究系统中,生成者与 reviewer 的通信若共享答案或同一偏差,会抬高内部一致性却不增加外部真实性;需保留独立 verifier 或隐藏测试。
自检问题
- cheap talk 为何在利益不一致时可能不可信?
- 消息互信息高为什么仍不能证明因果贡献?
- 哪些消融可以发现答案泄漏或私有 convention?
- centralized training 的全局信息何时构成测试泄漏?
- 通信价值为何要同时报告成本与陌生伙伴表现?
专业课程对齐
- 阅读 Melting Pot 官方介绍,观察社会情境与背景 population 如何改变通信策略的意义。
- 阅读 SOTOPIA 原始论文,分析自然语言社会交互评价比离散消息多出的 judge 依赖与语义不确定性。
- 阅读 Concordia 原始论文,关注 Agent 行动、叙事环境与 game master 的信息边界,用来审视“谁知道全局状态”。
深入学习提示
进一步可研究 differentiable communication、information bottleneck 与 grounding。先坚持离散、小带宽和可置换消息,这比直接引入长文本更容易归因。深入的核心问题是:消息携带的是环境新信息、伙伴策略线索、协调 convention,还是直接泄漏目标答案?
学后填写区
- 实际采用的消息通道:
- 无通信与有通信的公平性设置:
- 置换/延迟干预观察:
- cross-play 现象:
- 不能支持的社会能力主张:
- 尚未理解的问题: