已阅读5页,还剩338页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
博弈论,参考书目:,博弈论基础,罗伯特吉本斯,高峰译中国社会科学出版社,1999年3月策略-博弈论导论,乔尔沃森,费方域,赖丹馨译,上海人民出版社,2010年11月经济博弈论(第二版),谢枳予复旦大学出版社,2002年1月,主要内容,第一章完全信息静态博弈第二章完全信息的动态博弈第三章非完全信息静态博弈第四章非完全信息动态博弈,在所有社会,人们经常互动。互动有时是合作,有时是竞争。在这两种情况下,都可以用一个术语,即相互依赖性来表示一个人的行为对另外一个人的福利造成的影响。相互依赖的情形可称为策略环境。因为人们为了确定所采取的最优行动,必须考虑他周围的其他人会怎样选择行动。博弈就是策略对抗,博弈的定义,定义:博弈就是一些个人、队组或其他组织,面对一定的环境条件,在一定的规则下,同时或先后,一次或多次,从各自允许选择的行为或策略中进行选择并加以实施,各自取得相应结果的过程。四个核心方面博弈的参加人(Player)博弈方各博弈方的策略(Strategies)或行为(Actions)博弈的次序(Order)博弈方的得益(Payoffs),目前,博弈论被许多来自不同领域的专业人士使用,这些领域包括经济学、政治学、法律、生物、国际关系哲学以及数学。事实上,大多数情形即包含了冲突元素,也包含了合作的元素。我们对博弈的组成要有一个广义的理解。简而言之,博弈是策略环境的正式描述。因此,博弈论是研究相互依赖情形的正式的方法论。这里,“正式”是指一种以数学化的精确,以及逻辑上的一致见长的结构。利用正确的理论工具,我们可以研究各种情况下的行为,从而更好地理解经济中的相互作用。,静态博弈:所有博弈方同时或可看作同时选择策略的博弈石头剪刀布、猜硬币、古诺模型动态博弈:各博弈方的选择和行动有先后次序且后选择、后行动的博弈方在自己选择、行动之前可以看到其他博弈方的选择和行动弈棋、市场进入、斯坦博格型市场结构,完全信息博弈:各博弈方都完全了解所有博弈方各种情况下的得益不完全信息博弈:至少部分博弈方不完全了解其他博弈方得益的情况的博弈,也称为“不对称信息博弈”完美信息博弈:每个轮到行动的博弈方对博弈的进程完全了解的博弈不完美信息博弈:至少某些博弈方在轮到行动时不完全了解此前全部博弈的进程的博弈,约翰福布斯纳什(JohnForbesNashJr.,1950,1951)利用不动点定理证明了均衡点的存在,为博弈论的一般化奠定了坚实的基础。1994年约翰福布斯纳什、约翰C海萨尼以及莱因哈德泽尔腾,三人同时因为他们对博弈论的研究,所作出的突出贡献,而获得诺贝尔经济学奖。,三位大师主要的贡献,1950年和1951年纳什的两篇关于非合作博弈论的重要论文,证明了非合作博弈及其均衡解,并证明了均衡解的存在性,即著名的纳什均衡。从而揭示了博弈均衡与经济均衡的内在联系。泽尔腾(1965)将纳什均衡概念引入了动态分析,提出了“精炼纳什均衡”概念。海萨尼发展了刻画不完全信息静态博弈的“贝叶斯纳什均衡”(19671968)。泽尔腾和海萨尼进一步将纳什均衡动态化,加入了接近实际的不完全信息条件。他们的工作为后人继续发展博弈论,提供了基本思路和模型。,第一章完全信息静态博弈,1.1基本理论:博弈的标准式和纳什均衡1.2应用举例1.3混合策略和均衡的存在,1.1基本理论:博弈的标准式和纳什均衡,例1儿童游戏:“石头、剪刀、布”。参与人:1,2。策略空间:S1=S2=石头、剪刀、布收益:两人出手的函数u1(石头,石头)=0,u1(石头,剪刀)=1,u1(石头,布)=-1u2(石头,石头)=0,u2(石头,剪刀)=-1,u2(石头,布)=1,博弈的标准式表示(normal-formrepresentation)(1)参与人(player).n个参与人:1,2,i,n(2)策略(strategy).一个参与人的策略是他采取的一个行动。参与人i的策略:si参与人i的策略空间:Si策略的一个组合:s=s1,s2,sn简化表示:s-i=s1,,si-1,si+1,sn(3)收益(payoff).参与人i的收益:ui=ui(s1,s2,sn)n个参与人博弈的标准形式表示:G=S1,S2,Sn;u1,u2,un,博弈标准式特例:,s11s12s13,参与人1,参与人2s21s22,S1=s11,s12,s13S2=s21,s22,收益表(Payoff):两个参与人,有限个战略的博弈的表示方法,石头剪刀布,石头剪刀布,P1,P2,囚徒1的考虑:无论对方选沉默还是招认,自己选“招认”好于“沉默”。囚徒2的考虑:无论对方选什么,“招认”好于“沉默”。两人的选择:(招认,招认)。,囚徒2沉默招认,沉默招认,例囚徒困境(ThePrisonersDilemma),囚徒1,占优,17,每一个博弈都是一个你中有我,我中有你的情形,不同的博弈参与者可以选择不同的行动,但由于相互作用,一个博弈参与者的得益不仅取决于自己采取的行动,也取决于其他博弈参与者所采取的行动。博弈论的精髓在于基于系统思维基础上的理性换位思考,即在选择你的行动时,你应当用他人的得益去推测他人的行动,从而选择最有利于自己的行动。,鹰鸽博弈(斗鸡博弈)参与人:鹰和鸽策略:保持原方向和转向偏好:如果他们都保持原方向,就会撞车。如果都转向,就都保住了面子。如果只有对方转向,就会被称为硬汉。,鸽,鹰,公共财产的悲剧,智猪博弈,小猪,大猪,定义:si是si的严格劣势战略(strictlydominated),如果:ui(si,s-i)ui(si,s-i)“沉默”是“招认”的严格劣战略,囚徒2沉默招认,沉默招认,囚徒1,理性的参与人不会选择严格劣策略,公共财产的悲剧,重复剔除严格劣策略,上下,参与人2左中右,参与人1,上下,参与人2左中,参与人1,博弈结果(上,中),两人都没有严格劣策略,鸽,鹰,小猪,大猪,定义:s*=(s1*,sn*)是一个纳什均衡(Nashequilibrium),如果对i,ui(si*,si*)ui(si,si*)纳什均衡为如下最大化问题的解ui=ui(s1*,si,sn*),给定你的策略,我的策略是最好的策略给定我的策略,你的策略也是最好的策略因此没有一个参与人会轻率地偏离这个策略组合而使自己蒙受损失,纳什均衡特例:,s11s12s13,参与人1,参与人2s21s22,(s11*,s21*)是纳什均衡,如果u1(s11*,s21*)u1(s12,s21*)u1(s11*,s21*)u1(s13,s21*)u2(s11*,s21*)u2(s11*,s22).,寻找纳什均衡的方法之一:划线法,囚徒2沉默招认,沉默招认,囚徒1,-6,-6,没有哪个博弈方有偏离这个预测结果的愿望,第一类决策矛盾:强烈的个人动机将导致集体的损失,对于策略组合S和S,如果所有的参与人相对于S都更偏好于采取S,而且至少对一个参与人来说是严格偏好的,我们就说S比S更有效率。用数学来表示,如果ui(S)ui(S)对每个参与人i都成立,并且不等式至少对一个参与人是严格成立的,那么S比S更有效率。,囚徒2沉默招认,沉默招认,囚徒1,(沉默,沉默)比(招认,招认)更有效率,如果不存在其他更有效率的策略组合,我们就称这个策略组合S是有效的。用数学来表示,不存在其他策略组合S对每个参与人i来说都满足ui(S)ui(S),同时对某个参与人j来说满足ui(S)ui(S)。,囚徒2沉默招认,沉默招认,囚徒1,(沉默,沉默),(招认,沉默),(沉默,招认)都是有效的策略组合,寻找纳什均衡的方法之一:划线法,上下,参与人2左中右,参与人1,1,2,寻找纳什均衡的方法之一:划线法,上中下,参与人2左中右,参与人1,6,6,寻找纳什均衡的方法之一:划线法,帕特歌剧拳击,歌剧拳击,克里斯,性别战(thebattleoftheSexes),1,2,2,1,第二类决策矛盾:达成均衡的方式不止一种,策略不确定性有时会阻碍有效结果的获得,沟通,寻找纳什均衡的方法之一:划线法,鹰鸽博弈,鸽,鹰,制度、规则、行为及文化,第二类决策矛盾:达成均衡的方式不止一种,策略不确定性有时会阻碍有效结果的获得,现实生活中无效率均衡的例子-QWERTY的键位设计,第三类决策矛盾:习惯已经根深蒂固了,标准的键位设计(第三行以QWERTY开始)是由打字机的发明者为了防止按键卡死而修正的。对于机械打字机来说,当两个位置接近的按键同时按下的时候,会导致用来敲打色带的铅字杠杆之间发生纠结,因此发明者设计键位的原则是将那些经常连在一起使用的字母分开排列。但按键卡死在现代来说并不是一个问题。20实际30年代,AugustDvorak和WilliamDealey通过对英语中单词运用的仔细研究,设计了一种新的键盘-Dvorak键盘,人们确信这种键盘比使用QWERTY键盘打字效率显著提高。为什么QWERTY键盘现在仍然是标准?,寻找纳什均衡的方法之一:划线法,公共财产的悲剧,寻找纳什均衡的方法之一:划线法,智猪博弈,小猪,大猪,为什么中小企业不会花钱去开发新产品?,协调博弈,帕累托协调博弈,帕累托上策均衡,5,5,3,0,0,3,3,3,鹿,兔子,猎人2,鹿,兔子,猎人1,猎鹿博弈风险上策均衡(兔子,兔子),设猎人2选抓兔子的概率为p,则猎人1选抓鹿的期望得益:5(1-p)选抓兔子的期望得益:3(1-p)+3p由5(1-p)2/5,考虑其他博弈方可能发生错误等时,帕累托上策均衡并不一定是最优选择,需要考虑:风险上策均衡。,三个主要的广播电视台:A、B、C。所有这三个电视台都可以选择讲晚间新闻现场直播时间定在晚上6点或是推迟到7点,每个电视台的目标都是使他的收视率最大化。,6点,7点,C,缔约(contract),缔约不仅仅用于防止策略的不确定,还可以缓解共同利益和个体利益之间的冲突。即缔约为各参与者提供了一种防止无效率协调的方法。,让我们集中考虑z1+z2x1+y2,z1+z2x2+y1,且z1+z20的情况。这意味着各参与人的收益总和在采取(I,I)时达到最大化。(I,I)组合是这个基本博弈唯一的一个有效率的结果。问题:假设(I,I)是最好的结果,各参与人是否可以缔约,执行规定的(I,I)组合?,基本博弈,只要(I,I)是一个纳什均衡,采取(I,I)的协定就是自我实施合同。而这只有当z1x1和z2x2的情况下才成立。但是,如果其中有一个不成立,那么各个参与人就无法依靠合同的自我实施去维持(I,I)的结果,他们需要第三方的加入,法庭就是作为这样一种第三方存在的。如果一方选择了N,法庭的涉入可以在他们之间,强制进行货币收益的转移支付。,假设参与人知道转移的情况,那么法庭的干预就改变了参与人之间的博弈。这个新的博弈把转移的数字加到基本博弈中,显示各参与人的实际收益。这个博弈称为引发博弈(inducedgame)。,设计适当的合同,可以很容易引发有效率的(I,I)结果。只要符合z1x1+和z2x2-的和都满足这个条件。-具体和的值自由决定。,=-3=0,但是,上例的最基本的条件是,法庭必须能够区分基本博弈中所有不同的结果。例如,法庭必须能够核实每个参与人在博弈中,是选择了I还是选择了N。我们称这个信息条件为完全可证实性(fullverifiability)。结论:在完全可证实的条件下,存在一个合同,随着它的执行可以获得有效率的结果。不幸的是,完全可证实往往是特例,而不是通例。通常证据都不足以解释基本博弈的结果。法庭也许只能确定最终结果的好坏。好的结果意味着双方都进行了投入,坏的结果表示至少有一人没有投入。有限可证实性(limitedverifiability):法庭无法完美地对参与人的生产行为进行证实的情况。,在有限可证实的情况下,对博弈矩阵中的每一个单元格,规定不同的外部实施收益转移,是不可能的。即法庭无法区分(I,N),(N,I)和(N,N)。合同必须对所有这些结果规定相同的收益转移。从博弈论的角度看,这个合同中的外部实施部分只包含一个。(见下图),在有限可证实的情况下,要维持(I,I)的结果很难,甚至是不可能的。例如虽然提高可以降低参与人2选择N的动机,但是又提高了参与人1选择N的动机。因此的选择必须平衡双方的动机。需要满足:z1x1+和z2x2-整理简化以后可得:x2-z2x1+x2时,存在一个同时满足这两个不等式。,下图所示的基本博弈为例设=-3,得出的右下的引发博弈,其中(I,I)是纳什均衡。,下图所示的基本博弈在有限可证实的情况下,(I,I)不可能被执行。,(2)法庭实施违约赔偿情况下的缔约。法庭并不总是根据参与人起草的合同进行执行。事实上,美国法庭更可能根据某些法律原则,而不是根据合同的规定实施转移。在此,我们将对美国的商业环境下,对于赔偿的三个法律原则进行概括。,在预期利益赔偿的法律原则下,法庭要求被告转移给原告,使得原告获得在合同实现的情况下的收益。根据基本博弈,参与人1的期望收益是z1,参与人2的期望收益是z2。因此,如果参与人1违约,他被强制付给参与人2的钱数,必须使得参与人获得z2的收益。这意味着=y2-z2。类似地,如果参与人2违约,他付给参与人1的转移是=z1-y1。在引发博弈中,如果当且仅当z1x1+y2z2和z2x2+y1z1时,(I,I)是纳什均衡。不等式可以整理得:z1+z2x1+y2和z1+z2x2+y1它们正好是当(I,I)有效率时所满足的条件。结论:在预期利益赔偿原则下,当且仅当(I,I)是有效率的时候,(I,I)是可执行的。,第二种违约补偿非常适用于zi无法观察的情况。在信赖利益损害赔偿原则下,法庭实施的转移,使得原告能够获得他在没有签署合同情况下的收益。,根据左下图,信赖利益损害赔偿意味着=y2和=-y1。引发博弈如右下图所示。注意,当且仅当z1x1+y2和z2x2+y1时,(I,I)是引发博弈的纳什均衡。,违约情况下普遍采用的第三种法律原则指的是回复原状赔偿,这种原则是通过取消被告因违约而牟取的,相对于无合同情况下所增加的不当得利而得名。回复原状赔偿意味着=-x1,=x2。所得到的引发博弈形式如右下图所示。注意,当且仅当z10,z20时,(I,I)是引发博弈的纳什均衡。,在预期利益赔偿的法律原则下,(I,I)能够被执行。,基本博弈,引发博弈,在恢复原状赔偿的法律原则下,(I,I)能够被执行。,基本博弈,引发博弈,在信赖利益损害赔偿原则的法律原则下,(I,I)不能够被执行。,基本博弈,引发博弈,两方严格竞争博弈(two-player,strictlycompetitivegame)是指具有如下性质的两方博弈,对于任意两个策略组合s,sS,当且仅当u2(s)u1(s)。零和博弈是其中的一种,AB,参与人1,参与人2AB,对于策略来说,如果是的解,那么它就是一个安全策略,其中参与人i采取策略si最差的得益,参与人i的安全得益水平为结论:如果一个两方博弈是严格竞争的,并且有一个纳什均衡s*=(s1*,s2*)S,那么s1*是参与人1的一个安全策略,s2*是参与人2的一个安全策略。,AB,参与人1,参与人2AB,纳什均衡与重复剔除严格劣策略的关系,命题2.1:没有被剔除的唯一的策略组合是纳什均衡.命题2.2:如果策略是一个纳什均衡,它们在重复剔除严格劣策略后留下.上述两个命题保证在进行纳什均衡分析之前先通过剔除严格劣策略简化博弈是可行的。,1.1节习题与练习,1.2,TMB,LCR,1.3设此博弈的纯策略纳什均衡是对于参与人1来说同理,对于参与人2因此,此博弈的纯策略纳什均衡是且满足,例1定位博弈例2合伙人博弈-策略互补例3犯罪与治安模型例4古诺双头垄断模型(CournotModelofDuopoly)例5贝特兰德双头垄断模型(BertrandModelofDuopoly)例6最后要价仲裁(Final-offerArbitration)例7公共财产问题,1.2应用举例,例1定位博弈帕特和克里斯为一家很大的软饮料公司工作,他们的工作是在人们喜欢的一个海滩上销售这家公司的灌装苏打饮料,他们在同一个海滩上工作,而且公司规定,必须卖一样的价格,并且承诺每卖一听饮料给他们25美分的佣金。帕特和克里斯需要作出的决定是:每天早晨要把售货棚设在哪里?,1,3,2,4,5,6,7,8,9,每个区域中都会有50个人想要买苏打水。如果一个售货员可以为其中区域中的所有顾客服务,他将赚的12.5美元。顾客们都会到最近的售货摊去买。,1,3,2,4,5,6,7,8,9,利润=43.75,利润=68.75,1,3,2,4,5,6,7,8,9,1,3,2,4,5,6,7,8,9,西方两党政治的稳定性和欺骗性,两党政治:英国保守党和工党;美国民主党和共和党。纲领越来越靠近,为什么?三个不相上下的党又如何呢?不稳定!,0,1/4,1/2,3/4,1,A,B,A,3/8,平面定位,每个区域两个顾客,每个顾客创造一美元的价值,例2合伙人博弈-策略互补公司的利润是由合伙人分享公司利润:4(x+y+cxy),其中0x,y4分别是合伙人1、2付出的努力,0c1/4是互补程度合伙人1、2付出努力的成本:x2,y2合伙人1的利润:1=2(x+y+cxy)-x2合伙人2的利润:2=2(x+y+cxy)-y2,博弈的描述:参与人:合伙人1,合伙人2策略:合伙人1、2付出的努力x、y收益:合伙人1的利润1=2(x+y+cxy)-x2合伙人2的利润2=2(x+y+cxy)-y2,合伙人1:2(x+y+cxy)-x2一阶导数条件:2+2cy-2x=0合伙人2:2(x+y+cxy)-y2一阶导数条件:2+2cx-2y=0,当ui是可微分的时候,纳什均衡为下列方程组的解:,=0,i=1,n,公司总利润:4(x+y+cxy)-x2-y2一阶导数条件:4+4cy-2x=04+4cx-2y=0,合伙人博弈的反应函数合伙人1:2(x+y+cxy)-x2一阶导数条件:2+2cy-2x=0x=1+cy合伙人2:2(x+y+cxy)-y2一阶导数条件:2+2cx-2y=0y=1+cx,例3犯罪与治安模型参与人:罪犯(C),政府(G)策略:政府选择执法的程度x0罪犯选择犯罪的程度y0收益:uG=-xc4-y2/x,其中-y2/x是犯罪对社会的负面效应(-y2/x随着执法治安的力度而趋于缓和),c4是执法治安的单位成本(c0)uC=y1/2/(1+xy),其中y1/2是罪犯未被逮捕时从事犯罪活动的价值,1/(1+xy)是罪犯逃逸的概率,政府(G):uG=-xc4-y2/x一阶导数条件:-c4+y2/x2=0罪犯(C):uC=y1/2/(1+xy)一阶导数条件:,例4古诺双头垄断模型(CournotModelofDuopoly)19世纪初,AugustinCournot二个企业,生产产量:q1,q2,企业通过选择产量竞争,产品不存在差异,消费者并不关心从哪一家企业购买商品。市场中该产品的总供给:Q=q1+q2,产品都能卖出。市场价格:P=aQ企业成本:Ci(qi)=cqi,i=1,2.企业利润:i(q1,q2)=PqiCi(qi)=(a(q1+q2)qicqi,博弈的描述:参与人:企业1,企业2策略:产量qi收益:i(q1,q2),企业i选择产量求i(qi,qj),一阶条件=ac2q1q2=0=acq12q2=0厂商选择自己利润最大的产量q1=q2=解纳什均衡得q1*=q2*=利润1=2=(ac(+)=,两厂商整体利益最大化:,总利润,Q*=(a-c)/2,总利润为(a-c)2/4,以两厂商总体利益最大:各生产(a-c)/4单位产量,各自得益为(a-c)2/8以自身最大利益为目标:各生产(a-c)/3单位产量,各自得益为(a-c)2/9,自由竞争的经济存在低效率的问题,政府对市场的调控、监管是必须的,古诺模型的反应函数,企业1对企业2产量的反应函数,企业2对企业1产量的反应函数,古诺模型的重复剔除严格劣策略,反应函数的问题和局限性,在许多博弈中,博弈方的策略是有限且非连续时,其得益函数不是连续可导函数,无法求得反应函数,从而不能通过解方程组的方法求得纳什均衡。即使得益函数可以求导,也可能各博弈方的得益函数比较复杂,因此各自的反应函数也比较复杂,并不总能保证各博弈方的反应函数有交点,特别不能保证有唯一的交点。,(a),(b),例5贝特兰德双头垄断模型(BertrandModelofDuopoly),19世纪末,JosephBertrand两个企业生产有差别的商品消费者对企业i的需求qi(pi,pj)=api+bpj,成本:Ci(qi)=cqi,i=1,2.策略si:pi0收益:i(pi,pj)=(api+bpj)(pic),替代系数,若(p1*,p2*)是纳什均衡,对每个企业i,pi*满足maxi(pi,pj)=max(api+bpj)(pic)解得即p1*=p2*=,例6最后要价仲裁(Final-offerArbitration),一个企业(firm)和一个工会(union),通过一个仲裁人决定工资。企业和工会同时提出工资:wf,wu仲裁人有一个标准:x,选择双方提议中比较靠近x的提议:如果x(wf+wu)/2,则选择wuwf(wf+wu)/2xwu企业和工会不知道x,但知道x的分布函数F(x)和密度函数f(x)。,分析,wf被选择的概率:Probx=1F期望工资Ew=wfF+wu1Fwf*满足wfF+wu*1Fwu*满足wf*F+wu1F,双方要价的平均值一定等于仲裁者偏好方案的中值,双方的均衡要价以仲裁者偏好方案的期望值(即m)为中心对称,且要价之差随仲裁者偏好方案的不确定性(即2)的提高而增加。,例7公共财产问题,公共财产是具有(1)没有哪个个人、企业或组织拥有所有权;(2)大家都可以自由利用。公共财产的悲剧证明:如果一种财产没有排他性的所有权,就会导致财产的过度使用、低效率使用和浪费。公海捕鱼小煤窑的过度开发,一个村庄,有n个村民,在公共草地上放羊。村民i放牧的羊数:gi全村的羊总数:G=g1+.+gn一个村民养一只羊的成本:c养一只羊的价值:v(G)因为每只羊至少要一定数量的草才不至于饿死,有一个最大的可存活量Gmax当GGmax,v(G)=0当G0,v(G)0,v(G)0当草地上羊很少时,增加一只羊不会对其他羊的价值有太大影响,但随着羊的不断增加,每只羊的价值将急剧下降。,假设G*G*,则vv(G*)v(G*),又因为G*/nG*,纳什均衡总饲养量大于社会最优饲养量,1.2节习题与练习,1.4对于第i个企业,其目标最大化自己的利润,即(1)两端乘以2,再减去qi*得,因为所有qi*相等,则带入(2)得到当n趋于无穷大时,qi*趋向于0,pi*趋向于边际成本c,市场趋向于完全竞争市场。,1.5(1)企业利润:i(q1,q2)=PqiCi(qi)=(a(q1+q2)qicqi双方都选择qm/2时,每一方的利润一方选择qm/2,另一方选择qc时,选择qm/2一方的利润为选择qc一方的利润为双方都选择qc时,每一方的利润,qm/2,qm/2,qc,qc,所以纳什均衡状态(qc,qc),均衡状态下每一企业的福利都比他们相互合作时下降,每一个企业都有一个严格劣策略。,1.5(2)令,qm/2,qm/2,qc,qc,此博弈符合要求,即纳什均衡状态是(qc,qc),在均衡状态下,每一企业的福利都比他们相互合作时下降,且都没有严格劣策略,q,q,1.61(q1,q2)=(a(q1+q2)q1c1q12(q1,q2)=(a(q1+q2)q2c2q2一阶条件=ac12q1q2*=0=ac2q1*2q2=0厂商选择自己利润最大的产量q1=q2=解纳什均衡得q1*=,q2*=当c1c20,那么参与人i得到1-m,他会尽可能的选择最小的m,但是m=0将导致他的得益为0,因此,没有纳什均衡唯一的子博弈精炼纳什均衡:m=0,sj*,序贯谈判-赋予耐心者的谈判力,参与人1和参与人2谈判分配一元钱(s,1s).三期的谈判模型(1a)参与人1提议分配方案:(s1,1s1);(1b)参与人2接受提议或拒绝提议。如果参与人2拒绝,进入第2阶段;(2a)参与人2提议(s2,1s2)(2b)参与人1接受提议或拒绝提议。如果参与人1拒绝,进入第3阶段;(3)参与人1提议参与人1分得s,参与人2分得1s。终止。贴现率:,逆向归纳法求解(1)在阶段2如果s2s,甲将会接受s2。取s2=s,则1s2(1s)。结果:乙将会提议s*2=s,甲将会接受。,(2)在阶段1如果1s1(1s*2)即s11(1s*2),乙将会接受s1当s1=1(1s*2),s1s*2结果:甲将会提出s*1=1(1s*2)=1(1s)乙将会接受1s*1.逆向递归解为1(1s),s,例5动态定价,多样化的顾客群体零售商会从高价值客户那里取得高价格,从低价值客户那里取得较低的价格。零售商先设定一个高价,以吸引高价值的顾客,然后再卖给高价值顾客之后,会降低价格以期望获得低价值顾客的需求。在每个时期所有顾客定相同的价格,所以只能通过时间对他们加以区分。高价值的顾客如果能预期到价格会随着时间而下降,可能会延迟购买。,一家公司出售LCD显示器,经理托尼四个潜在客户:哈尔,希尔伯特(高价值)劳里,劳伦(低价值)第一期是第一个季度,第二期是第二个季度如果哈尔和希尔伯特第一期购买LCD,支付价格为p,则得益=1700-p;如果哈尔和希尔伯特第二期购买LCD,支付价格为p,则得益=500-p同样可得劳里和劳伦的得益托尼的得益来自于销售总收入,不考虑成本,博弈过程在第一期开始,托尼选择零售价格p1,观察到价格后,哈尔、希尔伯特、劳里和劳伦同时决定是否以这个价格购买。假设第一期购买后,第二期仍可以使用,不需要重新购买,且产品数量充足,顾客间不需要竞争。在第二期开始,托尼选择零售价格p2,任何没有在第一期购买显示器的顾客决定是否购买。,定价方案A:第一期中吸引所有的顾客来买定价方案B:第一期中使得所有的顾客都不购买定价方案C:使得高价值顾客哈尔和希尔伯特在第一期购买,而低价值顾客劳里和劳伦在第二期购买托尼如何定价?,定价方案A:第一期中吸引所有的顾客来买托尼选择p1=700,所有的四个顾客都会在第一期购买,这种定价策略为托尼带来2800的得益,定价方案B:第一期中使得所有的顾客都不购买托尼选择p11700,所有的四个顾客在第一期都将不再购买。托尼在第一期收益为0如果托尼选择p2=200,所有的四个顾客都会在第二期购买,这种定价策略为托尼带来800的得益如果托尼选择p2=500,只有哈尔和希尔伯特在第二期购买,这种定价策略为托尼带来1000的得益因此,p11700,p2=500最优,得益=1000,定价方案C:使得高价值顾客哈尔和希尔伯特在第一期购买,而低价值顾客劳里和劳伦在第二期购买1700-p1500-200,则p1=1400,托尼在第一期为2800的得益托尼选择p2=200,托尼在第二期为400的得益因此,p1=1400,p2=200,托尼的得益为3200的得益,通过价格保证实现的高价承诺,在某些情况下零售商存在动机随着时间的推移而降低价格,从而分别榨取不同价值的顾客的剩余。或许这样的定价策略对于一个公司来说是好事-它帮助公司从每一种类型的顾客那里获得利润。事实上,随着时间的推移而降低价格的动机可能会对公司所获得的利润具有相反的效应。托尼承诺不与劳里和劳伦进行交易(如果降价,零售商将差价退还给已购买的消费者),得益3400,2.1节习题与练习,2.1采用逆向归纳法,先最大化家长的收益:给定孩子的行动A,来选择家长自己的行动B,MaxBV(Ip-B)+kU(Ic+B)一阶条件:V(Ip-B)-kU(Ic+B)=0(1)接着最大化孩子的收益,给定家长的反应函数B*,来选A:MaxAU(IC(A)+B)一阶条件:U(IC+B)IC(A)+B/A=0由于U是递增又严格凹的,U(IC+B)0因此,IC(A)+B/A=0(2),将(1)式关于求A偏导V(Ip-B)Ip(A)-B/A-kV(Ip-B)IC(A)+B/A=0V(Ip-B)Ip(A)-B/A=kV(Ip-B)IC(A)+B/A=0因为V严格凹的,V(Ip-B)0Ip(A)-B/A=0(3)(2)+(3)Ip(A)+Ic(A)=0,2.2采用逆向归纳法,先最大化家长的收益:给定孩子的行动S,来选择家长自己的行动B,MaxBV(Ip-B)+kU1(Ic-S)+U2(S+B)一阶条件:-V(Ip-B)+kU2(S+B)=0即,孩子储蓄减少,家长给予更高的赠与接着最大化孩子的收益,给定家长的反应函数B*,来选S:MaxSU1(Ic-S)+U2(S+B)一阶条件:,因此当增加S时,U1(Ic-S)会减小,同时,d(S+B)/dS0,所以S+B会增加,U2(S+B)会增加,因为(*)式,U2(S+B)增加的幅度比U1(Ic-S)减小的幅度大,所以孩子的收益效用增大了,同时家长的收益效用也增大了。,2.2完全非完美信息二阶段博弈,理论:子博弈精炼完全非完美信息的二阶段博弈:(1)参与人1和2同时选择a1和a2;(2)参与人3和4观察(a1,a2),然后同时选择a3和a4;(3)收益是ui(a1,a2,a3,a4),i=1,2,3,4.逆向归纳法在第二阶段博弈,参与人3和4:(a*3(a1,a2),a*4(a1,a2).在第一阶段,参与人1和参与人2:(a*1,a*2).子博弈精炼解(sub-gameperfectoutcome)(a*1,a*2,a*3(a*1,a*2),a*4(a*1,a*2),例1:广告和竞争例2:银行挤提例3:关税和国际市场竞争例4:工作竞赛,例1广告和竞争,考察一个双寡头模型。其中公司1在与其他公司竞争之前,需要进行广告宣传。公司1选择广告的程度a,a0的数。广告对于整个行业的商品需求有正的效应,可以提高价格。市场价格为p=a-q1-q2在公司1选择a之后,它可以被另一个公司观察到。然后,两个公司同时并独立地选择它们的产量。假设公司以零成本进行生产。但是,公司必须支付的广告成本是2a3/81。,逆向归纳法假设在公司1选择了广告程度a之后,达到一个子博弈。这个子博弈的纳什均衡是古诺博弈。参与人1的利润=(a-q1-q2)q1-2a3/81一阶条件:q1*=BR1(q2)=(a-q2)/2同样公司2的最优函数是BR2(q1)=(a-q1)/2联立求解:q1=q2=a/3,代入公司1的利润函数,即z1(a)=a2/9-2a3/81最优的a满足2a/9-6a2/81=0求解a,我们得到a*=3。最后确定的策略组合是a*=3,q1(a)=a/3,q2(a)=a/3,例2银行挤提,下一阶段,r,r,D,2r-D,2r-D,D,提款,不提,客户2,提款,不提,客户1,日期1,R,R,D,2R-D,2R-D,D,R,R,提款,不提,客户2,提款,不提,客户1,日期2,二个投资者在一个银行存款D.银行:如果提前变现,得:2r(DrD/2)如果到期,得:2R(RD),R,R,D,2R-D,2R-D,D,R,R,提款,不提,客户2,提款,不提,客户1,日期2,R,R,r,r,D,2r-D,2r-D,D,提款,不提,客户2,提款,不提,客户1,日期1,挤提,求子博弈精炼解(1)在日期2,(提款,提款),收益(R,R),(2)将日期2收益代回,在日期1,二个纯策略纳什均衡:(提款,提款),(不提,不提).,两阶段博弈有二个子博弈精炼解:在日期1两人都提款,(r,r);在日期1两人都不提款,但是在日期2提款,(R,R)。,例3关税和国际市场竞争,国家i市场上商品总量Qi国家i市场上出清价格Pi=a-Qi,i=1,2企业i生产hi供内销,ei供出口,Qi=hi+ej,i,j=1,2两企业的边际成本均为c,无固定成本,则企业i的生产总成本为c(hi+ei)国家j的关税率为tj企业i的出口成本为cei+tjei,国内销售成本为chi第一阶段:两国同时制订关税率t1,t2第二阶段:两企业根据t1,t2同时决定各自内销和出口产量h1,e1和h2,e2,企业的得益函数为:,政府的得益函数:,由消费者剩余,本国企业利润和国家关税收入构成,分析-第二阶段(在观察ti与tj后,国家i的企业选择(hi,ei)),企业的得益函数为:,第二阶段企业选择:,di/dhi=a2hiejc=0di/dei=a2eihj(c+tj)=0,hi是ti的增函数,ej是ti的减函数,关税具有保护本国企业,打击外国企业的作用,t1=t2=0时即为古诺模型,第一阶段政府选择:先把第二阶段根据厂商选择得到结果代入政府得益,再求最优化:,政府的得益函数;,分析-第一阶段,解得:,从而:,例4:工作竞赛,模型假设:1.雇员i(i=1,2)的产出函数为,为雇员努力水平,为随机扰动。服从分布密度为,均值为0的随机变量。雇员努力的负效用函数为,且。2.因为雇员的产出能够观察到而他们的努力水平却不能观察到,因此最多根据产量支付报酬,产量高的雇员得到高工资,产量低的得到低工资。3.第一阶段雇主决定和,第二阶段是两雇员在知道雇主定的工资标准以后,同时独立选择各自的努力程度。,雇员的收益:u(w,e)=wg(e)雇主的收益:y1+y2whwl,竞赛,分析-第二阶段:雇员选择,雇主决定了工资以后,雇员i(i=1,2)同时决定努力程度:一阶条件这是雇员所选择努力程度必须满足的基本条件。经济含义是雇主付出努力的边际收入必须等于付出努力的边际负效用数值。,给定对方选择,选择使自己期望得益最大的努力程度,分析-第二阶段:雇员选择利用条件概率的贝叶斯法则:,代入一阶条件得:两雇员情况一样,对努力程度的选择也相同,即,这样就得到:这就是两雇员之间静态博弈的纳什均衡。,分析-第二阶段:雇员选择,两雇员之间静态博弈的纳什均衡说明对胜方的奖励力度(奖金额)较大,也就是说较大,会提高雇员的努力程度。另一方面,如果奖励不变,即固定,而对产出的扰动因素的影响扩大,也就是竞赛的结果更多取决于“运气”而不是雇员的努力,那么雇员就会觉得努力不值得,就会选择较小的。设,增大,e*减小,分析-第一阶段:雇主选择,由于雇员之间博弈的均衡是对称均衡,因此双方赢得竞赛的机会都是0.5,假设雇员能得到其他工作机会提供的得益是,则保证雇员接受工作的基本条件是:此即“参与约束”。由于在雇员接受工作的前提下,雇主必然尽可能压低工资,因此约束条件取等号:于是得到:设上述参与约束条件满足,雇主的利润函数为,雇主的期望利润为,因此雇主的最优化问题:上述雇主决策可转化为促使雇员的努力程度满足:一阶条件为:代入两雇员的最优努力水平决定公式得到:,奖金只与工作业绩的不确定性有关,与产出函数随机因素概率分布的方差正相关,分析-第一阶段:雇主选择(续),2.3重复博弈,有限次重复博弈:给定一个基本博弈G(可以是静态博弈,也可以是动态博弈),重复进行T次G,并且在每次重复G之前各博弈方都能观察到以前博弈的结果,这样的博弈过程称为“G的T次重复博弈”,记为G(T)。而G则称为G(T)的“原博弈”。G(T)中的每次重复称为G(T)的一个“阶段”。无限次重复博弈:一个基本博弈G一直重复进行下去的博弈,记为G()没有可以预见的结束时间,主观上认为会不断进行随机结束的重复博弈:重复博弈的次数虽然是有限的,但重复的次数或博弈结束的时间却是不确定的,经济中的长期关系,定义:在有限重复博弈G(T)或无限重复博弈G(,)中,参与者的一个策略是指每一个阶段,针对其前面阶段所有可能的进行过程,参与者将会选择的行动。定义:在有限重复博弈G(T)中,由t+1阶段开始的一个子博弈为G进行T-t次的重复博弈,可表示为G(T-t)。由第t+1阶段开始有许多子博弈,到t阶段为止的每一个可能的进行过程之后都是不同的子博弈。在无限重复博弈G(,)中,由t+1阶段开始的一个子博弈都等同于初始博弈G(,)。,唯一纯策略纳什均衡博弈的有限次重复博弈,考虑重复两次的重复博弈,可以理解成警方给这两个囚徒两次交待机会,两囚徒的最后得益(被关年数的负值)是两个阶段博弈中各自得益之和。重复博弈过程:两博弈方先进行第一次博弈,双方看到第一次博弈的结果以后再进行第二次博弈。,囚徒2沉默招认,沉默招认,囚徒1,两次重复博弈的囚徒困境,因为子博弈矩阵是通过把一个相同的得益向量加到阶段博弈矩阵的每个单元格而构成的,所以在子博弈中各参与人对于行动组合的偏好正好和他们单独进行一次阶段博弈的偏好是相同的。也就是说,子博弈和阶段博弈正好有着相同的纳什均衡。,囚徒2沉默招认,沉默招认,囚徒1,囚徒2沉默招认,沉默招认,囚徒1,子博弈精炼解:(招认,招认),(招认,招认),多个纯策略纳什均衡博弈的有限次重复博弈,结论:对任何重复博弈来说,阶段纳什组合的任意序列都能够成为一个子博弈精炼解除了阶段纳什组合,是否还有其他均衡?,AB,参与人2XYZ,参与人1,策略组合:在第一期中选择(A,X),只要参与人2没有偏离X,则在第二期中选择(A,Z);如果参与人2在第一期中发生偏离而选择了Y或者Z,那么在第二期中选择(B,Y)。子博弈精炼解:(A,X),(A,Z),AB,参与人2XYZ,参与人1,合作,声誉,策略组合:在第一期中选择(A,X),只要参与人2没有偏离X,则在第二期中选择(A,Z);如果参与人2在第一期中发生偏离而选择了Y或者Z,那么在第二期中选择(B,Y)参与人2的动机:遵从策略组合,一期3,二期4偏离策略组合,一期4,二期1参与人1也没有偏离策略组合的动机,AB,参与人2XYZ,参与人1,短期利益,惩罚,无限重复博弈的得益,随机结束和贴现率,随机结束重复博弈:停止重复概率p,重复下去概率1-p。设某博弈方第t阶段得益为t,利率为,则该博弈方期望得益的现值为:,其中,,每一期都采取阶段纳什组合,可以构成子博弈精炼解触发战略(triggerstrategy):“合作组合”“惩罚组合”惩罚组合假定是一个阶段纳什均衡。在触发策略均衡中,参与人应该在每一期中采取合作组合,但是如果有人如果从合作组合中发生偏离,那么在此之后他们将永远采取惩罚组合。也就是说,从合作组合中偏离会破坏一个参与人的声誉,从而导致在接下来的博弈中触发惩罚组合触发战略是否为子博弈精炼解?,参与人2L2R2,L1R1,参与人1,假设两方都遵从触发策略,考虑参与人i在第一期的动机。如果参与人i采取合作态度,即取R,双方总是取R,现值V=4+4+24+=4/(1-)如果参与人i选择背叛,即取L,参与人i的背叛会导致参与人j在以后的每一期同样选择背叛,现值V=5+1+21+=5+/(1)当4/(1-)5+/(1-)即1/4,参与人始终采取触发策略中的合作态度比偏离背叛导致的惩罚组合获得更高的得益。因此,触发战略构成子博弈精炼解还有没有其他的子博弈精炼纳什均衡?,(4.5,2),参与人2L2R2,L1R1,参与人1,G:有限的完全信息静态博弈。(e1,en):G的一个纳什均衡的收益。(x1,xn):G的可行收益。定理:如果xiei,充分地靠近1,则无限重复的博弈G(,)存在子博弈精炼的纳什均衡使(x1,xn)为平均得益.寓意:通过使用触发策略,几乎任何的重复博弈得益都能被耐心的参与人获得在上例中,可以有以非常接近区域中(1,1)右上方的任何一点为得益的子博弈纳什均衡。,考虑参与人1的策略:第1阶段:R1.第t阶段:当t=2k+1,如果以前的所有奇数阶段是(R1,R2),偶数阶段是(L1,R2),则R1,当t=2k,如果以前的所有奇数阶段是(R1,R2),偶数阶段是(L1,R2),则L1;参与人2的策略:第1阶段R2.第t阶段:如果以前的所有奇数阶段是(R1,R2),偶数阶段是(L1,R2),则R2。,参与人2L2R2,L1R1,参与人1,执行该策略的路径(结果)参与人1:R1,L1,R1,L1,参与人2:R2,R2,R2,R2,执行该策略的收益参与人1:4,5,4,5,参与人2:4,0,4,0,平均收益:u1=(1-)(4+5+42+53)=(1-)(4+5)/(12)=(4+5)/(1+)u2=(1-)(4+42+)=(1-)4/(12)=4/(1+),注意:当接近于1,那么这个平均得益会逼近(4.5,2)得益向量(4.5,2)是否满足子博弈完美均衡结果的条件?,改进的触发策略:参与在第一期采取(R1,R2),接着轮流采取(R1,R2)和(L1,R2),如果有人在某个时刻偏离这个行动组合,那么参与人在此之后永远的转而采用惩罚组合(L1,L2)从任一奇数期开始,参与人2的得益(4+0+42+03)=4/(12)从任一偶数期开始,参与人2的得益(0+4+02+43)=4/(12)在每一个奇数期,参与人应该选择(R1,R2),如果参与人2行为发生偏离则当4/(12)5+1+12+13.即在每一个偶数期,参与人应该选择(L1,R2),如果参与人2行为发生偏离则当4/(12)1+1+12+13.即,从任一奇数期开始,参与人1的得益(4+5+42+53)=(4+5)/(12)从任一偶数期开始,参与人2的得益(5+4+52+43)=(5+4)/(12)在每一个奇数期,参与人应该选择(R1,R2),如果参与人1行为发生偏离则当4+(5+4)/(12)5+1+12+13.即在每一个偶数期,参与人应该选择(L1,R2),如果参与人2行为发生偏离则当5+(4+5)/(12)4+1+12+13.即任意即时,双方都会遵从改进后的触发策略,改进后的触发策略是子博弈精炼解,例1Co
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年园林cad证书考试试题及答案
- 性病艾滋病病例报告课件
- 农业经理人岗前工艺优化考核试卷含答案
- 网络预约出租汽车司机诚信品质竞赛考核试卷含答案
- 烟叶回潮设备操作工安全素养竞赛考核试卷含答案
- 建筑节能减排咨询师创新思维能力考核试卷含答案
- 货运检查员工艺规程考核试卷含答案
- 光学数控磨工岗中基础操作考核试卷含答案
- 海底管道配重工岗位异常处置考核试卷含答案
- 建设工程质量检测员复测模拟考核试卷含答案
- 《机械基础(第7版)》电子教案
- JS/T 302-2026公共机构电动汽车充电基础设施配置及运行指南
- 小学五年级数学上册《分段计费问题》教学设计
- 脊髓型颈椎病护理查房
- 自律自强 书写精彩 主题班会课件
- 2026年江苏徐州市中考语文考试真题及答案
- 2026及未来5年中国番茄行业市场现状调查及未来趋势研判报告
- 市政道路路面铣刨施工方案
- 借款用小车顶账协议书范本
- 市政道路雨、污水管道工程施工技术培训
- 气管插管术 气管插管术
评论
0/150
提交评论