Chapter 11 Multiagent Interactions
从效用和偏好计算最佳响应、占优、纳什均衡、帕累托效率与社会福利。
学习目标
- 能用效用与偏好计算最佳响应
- 能区分占优、纳什均衡与帕累托效率
- 能分析社会福利函数的选择影响
为什么必须先冻结联合模型
先预测:囚徒困境中双方合作是稳定结果吗?带着判断进入本页。
从效用和偏好计算最佳响应、占优、纳什均衡、帕累托效率与社会福利。 博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。 本页不以单个代理“看起来聪明”为通过条件,而是检查联合状态、偏离动机、失败传播和可重放证据。
直觉、对象与计算合同
贯穿场景是:手算双人两行动囚徒困境并改变一次重复博弈贴现。参与者、可观察信息、行动集、偏好或目标、环境转移、协议版本和终止条件必须在运行前固定,不能在看到结果后修改效用或阈值。
公式用于公开关系与前提,不替代正式证明或实证测量。均衡不保证合作或公平;没有重复和未来价值时不能凭愿望支持合作。 本页重点防范:把高社会福利结果误称为纳什均衡,未检查单方偏离。
共享目标:团队问题,重心在协调与信用分配。
正式目录节点:解释与联合验证
下列目录节点逐项映射到解释、页面专属实验和章末答案。每个节点都必须指出它改变哪个联合状态以及什么观测会推翻结论;单纯出现术语不计覆盖。
Chapter 11 Multiagent Interactions
“Chapter 11 Multiagent Interactions”决定感知、内部状态、目标与行动怎样连接,应在相同环境轨迹上比较。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查效用偏好;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.1 Utilities and Preferences
“11.1 Utilities and Preferences”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查占优策略;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.2 Setting the Scene
“11.2 Setting the Scene”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查纳什均衡;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.3 Solution Concepts and Solution Properties
“11.3 Solution Concepts and Solution Properties”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查帕累托;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.3.1 Dominant Strategies
“11.3.1 Dominant Strategies”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查社会福利;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.3.2 Nash Equilibria
“11.3.2 Nash Equilibria”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查效用偏好;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.3.3 Pareto Efficiency
“11.3.3 Pareto Efficiency”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查占优策略;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.3.4 Maximising Social Welfare
“11.3.4 Maximising Social Welfare”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查纳什均衡;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.4 Competitive and Zero-Sum Interactions
“11.4 Competitive and Zero-Sum Interactions”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查帕累托;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.5 The Prisoner's Dilemma
“11.5 The Prisoner's Dilemma”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查社会福利;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.5.1 The shadow of the future
“11.5.1 The shadow of the future”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查效用偏好;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.5.2 Program Equilibria
“11.5.2 Program Equilibria”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查占优策略;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.6 Other Symmetric 2 x2 Interactions
“11.6 Other Symmetric 2 x2 Interactions”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查纳什均衡;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.7 Representing Multiagent Scenarios
“11.7 Representing Multiagent Scenarios”决定感知、内部状态、目标与行动怎样连接,应在相同环境轨迹上比较。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查帕累托;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
11.8 Dependence Relations in Multiagent Systems
“11.8 Dependence Relations in Multiagent Systems”决定感知、内部状态、目标与行动怎样连接,应在相同环境轨迹上比较。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查社会福利;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。
常见误区
术语
小结
- 博弈模型枚举参与者、行动和收益
- 纳什均衡只排除单方有利偏离
- 帕累托效率排除不伤害任何人的改进
- 社会福利聚合个体效用
- 均衡不保证合作或公平,需逐格检查偏离
容易踩的坑
误区 1
现象 → 误判博弈类型 原因 → 合作机制用在竞争场景 修法 → 先画收益矩阵再定机制
误区 2
现象 → 把纳什均衡当最优 原因 → 均衡可能整体低效 修法 → 对比帕累托效率评估
误区 3
现象 → 忽略交互的非平稳性 原因 → 对手学习使策略失效 修法 → 定期重评估均衡
练习与答案
前后导航
练习
练习
问题 1: 纳什均衡的含义?
问题 2: 零和与混合动机博弈的区别?
问题 3: 构造一个 2×2 收益矩阵并找出纯策略纳什均衡。(独立实现)