博弈论第四章 完全且完美信息动态博弈_第1页
博弈论第四章 完全且完美信息动态博弈_第2页
博弈论第四章 完全且完美信息动态博弈_第3页
博弈论第四章 完全且完美信息动态博弈_第4页
博弈论第四章 完全且完美信息动态博弈_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

博弈论第四章完全且完美信息动态博弈GameTheory—DynamicGameswithCompleteandPerfectInformationContents本章内容概览完全且完美信息动态博弈的核心框架与分析方法01动态博弈基本概念与分类框架02博弈树模型与信息集结构03逆向归纳法与子博弈精炼均衡04经典动态博弈模型深度解析05扩展议题与现实场景应用Chapter01动态博弈基本概念与分类框架从行动时序与信息结构两个维度建立分析坐标系DYNAMICGAMETHEORY什么是动态博弈动态博弈的本质特征是参与者行动存在时序先后,后行动者可观察先行者的选择后再做决策。这种序贯互动结构使得博弈分析必须引入"时间维度",策略不再是单一行动而是针对不同历史状态的完整行动计划。国际象棋对弈——序贯决策的经典场景序贯行动:动态博弈(SequentialGame)指参与者的行动有明确先后顺序,后行动者在决策时至少能观察到部分先行者的行动选择根本区别:静态博弈中参与者同时行动或互不知晓对方选择,而动态博弈中存在可观察的行动序列完整行动计划:策略不再是单一行动,而是规定在每一个可能的决策节点上应该采取什么行动典型场景:企业定价的先后博弈、国际谈判中的出价与回应、棋类游戏的轮流落子等GAMETHEORY·CH.04完全信息与完美信息的辨析'完全信息'关注参与者是否知晓各方的收益函数,'完美信息'关注参与者是否精确了解博弈的全部行动历史。两者是独立的维度。完全信息CompleteInformation每个参与者都清楚知道所有参与者的策略空间和收益函数,不存在"隐藏收益"或"私有信息"对应不完全信息博弈中的贝叶斯博弈,后者参与者对他人类型存在不确定性收益函数透明完美信息PerfectInformation每个信息集都是单点集,即参与者在决策时精确知道之前所有行动的历史不允许同时行动或不可观察的行动,否则信息集将包含多个节点行动历史可见本章聚焦Complete&Perfect同时满足两个条件的动态博弈,是最规范的序贯博弈分析框架,为逆向归纳法提供理论基础博弈树中每个节点都是独立信息集,所有参与者对各终端节点收益一清二楚典型应用:斯塔克尔伯格竞争、讨价还价博弈序贯博弈框架CHAPTER04·FRAMEWORK博弈分类的二维框架博弈论按"信息完全性"与"行动时序"两个维度形成四种基本类型。本章聚焦的完全且完美信息动态博弈处于"完全信息+序贯行动"象限,是理解更复杂博弈类型的理论基石。博弈论基本分类框架信息维度静态博弈(同时行动)动态博弈(序贯行动)完全信息纳什均衡(NE)典型应用:古诺产量竞争模型、经典囚徒困境子博弈精炼纳什均衡(SPNE)典型应用:斯塔克博格领导者模型、最后通牒博弈不完全信息贝叶斯纳什均衡(BNE)典型应用:密封第一价格拍卖、信号传递博弈精炼贝叶斯均衡(PBE)典型应用:企业声誉累积模型、最优机制设计本章核心定位:完全且完美信息动态博弈位于"完全信息+动态博弈"象限,其均衡概念为子博弈精炼纳什均衡(SPNE),通过逆向归纳法求解,排除不可信威胁,确保均衡策略在所有子博弈中均构成最优反应。Chapter02博弈树模型与信息集结构掌握动态博弈的形式化表达工具GameTree·完全且完美信息动态博弈博弈树的基本构成要素博弈树是动态博弈的扩展式表达工具,由决策节点、行动边、终端节点和支付向量四个核心要素构成。在完美信息博弈中,每个决策节点构成一个独立的信息集,参与者能精确定位自己在树中的位置。决策节点DecisionNode属于特定参与者的选择点,该参与者在此从可行行动集中选择一个行动选择点行动边Branch从决策节点延伸出的有向边,每条边代表一个可选行动,所有边构成该节点的行动集有向边终端节点TerminalNode博弈树的叶子节点,代表博弈路径的终点,不再有后续行动叶子节点支付向量PayoffVector标注于终端节点,形如(u₁,u₂,...,uₙ),表示各参与者在博弈结束时获得的收益(u₁,u₂,...,uₙ)GAMETREE·EXAMPLE博弈树构建示例:两人序贯博弈通过一个简单的两人序贯博弈可以清晰展示博弈树的构建过程。参与者1先选L或R,若选R则参与者2在观察到R后选择U或D。完美信息条件下每个信息集都是单点集,参与者能完全追溯博弈历史。博弈树结构LRUDP1P2(2,1)(3,3)(0,0)实心圆=决策节点·绿色圆=终端节点·括号内为收益(P1,P2)01根节点选择:参与者1在根节点选择L(博弈结束,收益为(2,1))或R(进入参与者2的决策节点)02后续决策:参与者2观察到R后,在U(收益(3,3))和D(收益(0,0))之间做选择03博弈结构:共有3个决策节点、4条行动边、3个终端节点,所有信息集均为单点集04完美信息标志:博弈树中不存在用虚线连接的多节点信息集博弈树终端节点收益明细行动路径P1收益P2收益总收益参与者1选L213参与者1选R→参与者2选U336参与者1选R→参与者2选D000收益结构显示(R,U)路径的总社会福利最高,但均衡结果取决于逆向归纳分析Chapter4·GameTheory动态博弈中的策略定义动态博弈中的策略是一份完整的"状态-行动映射",规定参与者在每一个可能的决策节点上采取什么行动。即使某些节点在均衡路径上不会被到达,策略仍需为其预设行动,这是子博弈分析的理论前提。01策略(Strategy)是一个函数sᵢ:Hᵢ→Aᵢ,将参与者i的每个决策历史映射到一个可行行动。sᵢ:Hᵢ→Aᵢ02一个完整策略必须为参与者的所有决策节点都指定行动,包括均衡路径上不会被到达的节点——这是子博弈完美均衡分析的理论前提。全覆盖03上述示例中参与者2的策略集为{U,D},参与者1的策略集为{L,R},组合形成2×2策略式博弈的标准型表达。2×204策略空间的"膨胀"现象:决策节点越多,参与者的纯策略数量呈指数增长,这使得复杂动态博弈的求解极具挑战性。指数增长CHAPTER03逆向归纳法与子博弈精炼均衡从终局倒推最优策略,消除不可信威胁SOLUTIONMETHOD逆向归纳法:四步求解流程逆向归纳法(BackwardInduction)从博弈树终端节点出发,逐层向前倒推每个决策节点的最优选择,最终确定根节点的最优行动。该方法由Zermelo于1913年首次提出,保证了有限完美信息博弈纯策略均衡的存在性。Step01确定终局标记博弈树所有终端节点,记录每个终端节点上各参与者的支付向量Step02倒推分析在倒数第二层每个决策节点上,找出该参与者收益最大化的最优行动Step03逐层前推将已解决子树的收益值"回传"到上级节点,继续对上一层节点做最优选择Step04确定均衡推导至根节点时,所有节点的最优行动构成子博弈精炼纳什均衡(SPNE)BACKWARDINDUCTION逆向归纳法实操演示通过对两人序贯博弈的逆向归纳求解,参与者2在子节点选择U(收益3>0),参与者1据此在根节点选择R(收益3>2),均衡路径为R→U,均衡收益为(3,3)。该过程展示了'向前展望、向后推理'的博弈思维。01终局标记三个终端节点收益分别为L路径(2,1)、R→U路径(3,3)、R→D路径(0,0)。明确各终局收益是逆向归纳的起点。🔹L路径:参与者1得2,参与者2得1🔹R→U路径:双方各得3🔹R→D路径:双方各得0(2,1)(3,3)(0,0)02倒推参与者2在其决策节点比较U(收益3)与D(收益0),理性选择为U。这是子博弈完美均衡的关键一步。📊选择U:收益为3📊选择D:收益为0✓理性决策:U>DU:3>0✓03折叠子树参与者2节点替换为(3,3),参与者1面对L(得2)与R(得3)的简化博弈。🌳原博弈树折叠→R分支等价收益(3,3)→简化后:L:2vsR:3L:2vsR:304确定均衡参与者1选R(3>2),SPNE策略组合为(R,U),均衡路径R→U,收益(3,3)。🎯子博弈完美均衡→参与者1策略:R→参与者2策略:USPNE(R,U)CHAPTER04·完全且完美信息动态博弈子博弈精炼纳什均衡(SPNE)子博弈精炼纳什均衡要求策略组合在每一个子博弈中都构成纳什均衡,从而排除含有'不可信威胁'的均衡。逆向归纳法在有限完美信息博弈中求得的解恰好满足SPNE条件,是纳什均衡的'精炼'版本。01子博弈Subgame从博弈树中某个单点信息集节点出发,包含其所有后续节点和边的完整子树02SPNE定义策略组合s*是SPNE当且仅当它在每一个子博弈(含原博弈本身)中都构成纳什均衡03精炼意义剔除那些依赖'不可信威胁'或'不可信承诺'的纳什均衡,保留策略在每个节点都最优的解04存在性定理Zermelo定理:任何有限完美信息博弈至少存在一个纯策略SPNEGameTheory·Chapter04SPNE与纳什均衡的关系SPNE是纳什均衡的精炼子集——每个SPNE必然是NE,但NE中可能包含不可信威胁。SPNE通过要求在每一个子博弈中都构成均衡来剔除不合理均衡,使预测结果更具行为合理性。纳什均衡的局限01纳什均衡仅要求策略组合在整体博弈中没有单方面偏离动机,不检验非均衡路径上的行动合理性02可能产生依赖不可信威胁的均衡,如在位者以"同归于尽"威胁阻止进入者进入市场SPNE的精炼机制03SPNE在每个子博弈(含非均衡路径上的子博弈)中都施加均衡条件,迫使所有节点上的行动都是最优反应04在有限完美信息博弈中,逆向归纳法求得的解恰好是SPNE,且通常是唯一的纯策略均衡集合关系:SPNE⊂NE精炼过程剔除不可信威胁均衡NE纳什均衡全集SPNE精炼子集含不可信威胁的NE每个子博弈均衡仅整体均衡CHAPTER04经典动态博弈模型深度解析从产量竞争到讨价还价,看动态博弈如何解释现实StackelbergModel斯塔克博格模型:基本设定斯塔克博格模型(1934)是产量竞争的动态版本——领导者企业先选择产量并公开承诺,追随者企业观察后做出最优反应。这种序贯结构赋予领导者"先行者优势",使其获得高于古诺均衡的利润。01模型设定:两家企业生产同质产品,市场需求为P=a−bQ,边际成本为c,领导者先选产量q₁02追随者反应:观察到q₁后选择q₂最大化利润,最优反应函数为q₂=(a−c−bq₁)/(2b)03前瞻性决策:领导者预知追随者反应函数,将其代入自身利润函数后选择最优q₁04古诺对比:领导者产量更高、利润更大;追随者产量更低、利润更小HeinrichvonStackelberg(1905–1946)·德国经济学家·1934年提出序贯产量竞争模型StackelbergEquilibrium斯塔克博格均衡的逆向归纳求解通过逆向归纳法求解,斯塔克博格均衡中领导者产量q₁*=(a-c)/(2b)是追随者q₂*=(a-c)/(4b)的两倍。领导者利润为古诺均衡的9/8倍,先行者优势在数学上得到严格证明。古诺均衡与斯塔克博格均衡对比比较维度古诺均衡(同时)斯塔克博格均衡(序贯)领导者/企业1产量(a-c)/(3b)(a-c)/(2b)追随者/企业2产量(a-c)/(3b)(a-c)/(4b)总产量2(a-c)/(3b)3(a-c)/(4b)企业1利润(a-c)²/(9b)(a-c)²/(8b)企业2利润(a-c)²/(9b)(a-c)²/(16b)追随者最优反应:对π₂求导得q₂*=(a-c-bq₁)/(2b),产量随领导者产量增加而线性递减领导者前瞻决策:将q₂*代入π₁,最大化后得q₁*=(a-c)/(2b),恰好为垄断产量均衡结果对比:总产量Q*=3(a-c)/(4b)大于古诺均衡2(a-c)/(3b),但小于完全竞争产量先行者优势量化:领导者利润π₁*=(a-c)²/(8b),高于古诺利润(a-c)²/(9b),增幅约12.5%GameTheory·DynamicGames蜈蚣博弈:逆向归纳的悖论蜈蚣博弈(Rosenthal,1981)揭示了一个深刻悖论:逆向归纳法预测参与者在第一步就终止博弈,但实验数据表明绝大多数人会选择继续合作数轮。这引发了对"共同知识理性"假设和逆向归纳法行为有效性的深入反思。博弈结构两人轮流在"继续(Pass)"与"终止(Take)"间选择,总奖池每轮增长,但终止者获得较大份额。逆向归纳预测从最后一步倒推,最后参与者必然选终止,依次类推,第一步就应终止——均衡收益极低。实验悖论McKelvey&Palfrey(1992)实验显示仅约1.4%的博弈在第一轮终止,大多数持续3-4轮。理论反思悖论源于"共同知识理性"假设过强,现实中有限理性、互惠偏好和声誉考虑影响决策。UltimatumGame最后通牒博弈:公平与理性的冲突逆向归纳预测极端理性,但跨文化实验一致显示公平偏好显著影响决策——提议者平均给出40-50%。01博弈规则:提议者提出100元分配方案(x,100−x),回应者选择接受(按方案分)或拒绝(双方得0)02SPNE预测:回应者接受任何x>0的方案(弱偏好),提议者最优策略是给出最小正数金额03实验发现:提议者平均出价40-50%,低于20-30%的方案被拒绝概率超50%,跨文化结果高度一致04理论解释:Fehr&Schmidt(1999)引入"不平等厌恶"参数(inequityaversion),成功拟合实验数据最后通牒博弈实验:提议分布40-50%的公平出价占比最高(42%),仅2%给出0-10%的极低份额GameTheory·Bargaining鲁宾斯坦轮流出价讨价还价模型鲁宾斯坦模型(1982)证明,在轮流出价博弈中唯一SPNE使谈判在首轮即达成协议。均衡分配由双方贴现因子决定:越有耐心的一方获得越大份额,完美诠释了"时间就是谈判力"的深刻洞察。01博弈结构两人轮流对大小为1的蛋糕提出分配方案,对方接受则博弈结束,拒绝则下轮换对方提议。SIZE=102贴现因子δ每延迟一轮蛋糕价值缩减为δ倍,δ越大表示越有耐心、时间成本越低。0<δ<103SPNE结果提议者1获1/(1+δ),提议者2获δ/(1+δ),博弈在首轮即达成协议无延迟。首轮达成04核心洞见当δ→1(完全耐心)时分配趋近均分;先行者优势随δ增大而消失。δ→1GameTheory·EntryDeterrence进入阻挠博弈与不可信威胁进入阻挠博弈中,在位者的"打价格战"威胁虽可能构成纳什均衡,但因事后容忍利润更高,该威胁不可信。SPNE唯一预测为"进入+容忍"。博弈结构STRUCTURE进入者先选"进入"或"不进入";若进入,在位者选"容忍"或"价格战"收益设定PAYOFFS(进入,容忍)=(2,1),(进入,价格战)=(-1,-1),(不进入,*)=(0,3)——在位者垄断利润为3不可信威胁NON-CREDIBLE纳什均衡(不进入,价格战)中,在位者的"价格战"威胁在其决策节点并非最优选择SPNE结果EQUILIBRIUM逆向归纳得(进入,容忍);在位者需预先投资(产能扩张等)改变支付结构才能使威胁可信Chapter05扩展议题与现实场景应用从理论到实践,探索动态博弈的解释力与边界完全且完美信息动态博弈先动优势与后动优势的条件分析动态博弈中先动者并非总是占优。当策略变量间呈'策略替代'关系时先动有利,呈'策略互补'关系时后动有利。先行者优势的本质是'承诺能力'带来的策略影响力。先动优势First-MoverAdvantage01策略变量之间呈策略替代关系——一方的增加导致另一方最优反应减少02产量竞争(斯塔克博格)、抢占市场份额、技术标准制定策略替代后动优势Second-MoverAdvantage01策略变量之间呈策略互补关系——一方增加使另一方最优反应也增加02价格竞争(伯特兰)、产品差异化定位、跟进式创新策略互补承诺的价值01先动优势的本质是'承诺能力':先行者的行动不可逆转地改变了后行者的决策环境02若行动可撤回或不可观察,先动优势消失——博弈退化为同时行动的静态博弈承诺能力GameTheory×GameDesign动态博弈在游戏数值设计中的应用博弈论为游戏数值平衡提供了系统化的分析框架:完全信息对应棋类先手平衡,不完全信息对应卡牌不对称设计,重复博弈驱动长期合作激励。PerfectInformation围棋、国际象棋通过贴目制度和棋子价值校准平衡先手优势,确保SPNE不偏向先行者ImperfectInformation炉石奥秘卡牌利用信息不对称创造策略深度,触发价值=基础效果+意外性−可预测性惩罚SequentialMoves文明、英雄无敌等回合制游戏通过后手补偿系数平衡先手优势,如额外资源或行动点RepeatedGamesMMO公会战通过声望系统和长期激励机制鼓励合作,单次背叛收益被长期声誉损失抵消围棋——完全信息动态博弈的经典场景CHAPTER04·动态博弈完全且完美信息假设的局限与拓展完全且完美信息是博弈分析的理想化基准,现实中信息不完全与信息不完美普遍存在,该基准为引入更复杂的均衡概念奠定基础。信息不完全的现实性企业不知对手的精确成本结构,谈判者不知对方的保留价格底线,投标人不知他人的真实估值,这种信息缺失在经济互动中无处不在。信息不完美的普遍性市场监管中企业行为不可完全观察,团队生产中个人努力程度难以精确衡量,动态博弈里历史行动记录存在获取成本。放松完全信息→贝叶斯博弈引入参与者"类型"的先验概率分布,参与者根据信念进行期望效用最大化,均衡概念相应升级为贝叶斯纳什均衡。放松完美信息→信号博弈参与者通过可观察的行动选择传递私有信息,接收者据此更新信念并做出反应,形成精炼贝叶斯均衡与动态声誉模型。CASESTUDY现实案例分析:企业定价的动态博弈可口可乐与百事可乐的定价博弈是斯塔克博格模型的现实映射。先动者通过公开声明和产能投资等"承诺机制"使策略可信,后动者则利用信息优势精确反应。承诺能力决定了动态博弈中策略影响力的分配。015%定价序贯博弈:可口可乐先宣布提价,百事观察后可选择跟涨共享利润或维持原价抢占份额02承诺承诺机制设计:企业通过公开声明、长期合同、产能扩建等不可逆投资使策略可信03后动信息优势利用:后动者精确调整反应函数,在价格博弈中可能形成后动优势04SPNE重复互动效应:长期竞争中形成默契合谋,单次SPNE被重复博弈的合作均衡替代可口可乐与百事可乐在超市货架上的定价竞争实景ChapterReview本章核心知识点回顾逆向归纳法和SPNE是贯穿全章的核心工具,理解它们的逻辑基础和适用条件是掌握本章内容的关键。概念基础完全信息:所有参与者知晓博弈规则和各方收益函数完美信息:每个信息集为单点集,行动历史完全可观察Information分析工具博弈树:动态博弈的扩展式表达,含节点、行动边、终端节点和支付向量逆向归纳法:从终局倒推最优策略的四步求解流程Methodology均衡概念SPNE:在每个子博弈中都构成纳什均衡的策略组合精炼价值:排除不可信威胁,保证每个节点上的行动都是最优反应EquilibriumEXERCISES&READING课后思考题与延伸阅读通过基础计算题巩固逆向归纳法操作技能,通过开放思考题深化对均衡概念行为有效性的理解,通过应用场景题培养将理论工具迁移到现实问题分析中的能力。思考题基础题构建一个三参与者、三阶段的完美信息博弈树,用逆向归纳法求解SPNE并解释每一步的推理逻辑思辨题蜈蚣博弈中逆向归纳预测与实验结果不一致,请从"共同知识理性"假设、有限理性和社会偏好三个角度分析原因应用题选择一个现实中的序贯决策场景(如求职谈判、租房议价),用博弈树建模并分析均衡结果延伸阅读Fudenberg&Tirole《博弈论》第3章完全信息动态博弈的系统化理论阐述Rasmusen《博弈与信息》以直觉化方式讲解动态博弈,含大量商业案例Camerer《行为博弈论》从实验视角反思经典博弈理论的行为预测有效性HISTORY博弈论发展简史与关键里程碑博弈论从1944年冯·诺伊曼奠基之作到当代行为博弈论,经历了三次重大范式突破:纳什均衡的提出(1950s)、精炼均衡与不完全信息的引入(1960-70s)、以及实验与行为视角的融合(1990s至今)。本章SPNE概念源自Selten的精炼均衡思想。JohnNash(1928–2015)·纳什均衡提出者·1994年诺贝尔经济学奖1944学科奠基

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论