已阅读5页,还剩92页未读, 继续免费阅读
(概率论与数理统计专业论文)部分可观测的随机控制系统及其应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
山东大学博士学位论文 部分可观测的随机控制系统及其应用 王光臣 ( 山东大学数学与系统科学学院,济南2 5 0 1 0 0 ) 中文摘要 本文研究了部分可观测的随机控制系统及在线性二次最优控制,微分对策 和最优投资组合选择等问题中的应用全文共分为五章 滤波理论在寻找部分可观测的随机控制问题的显式解方面起到重要作用 在第一章,我们将简单介绍滤波理论的发展史和一个重要引理我们也概述了本 文所得到的主要结果 第二章研究了一类由经典的随机最优控制问题产生的正倒向随机系统的卡 尔曼一布西滤波问题,同时,研究了这类正倒向随机系统对应的滤波方程的稳定 性作为滤波理论的应用,我们研究了一类部分可观测的递归线性二次最优控制 问题结合分离原理和一种直接构造的方法,我们得到了显式的最优控制,它是 状态滤波估计的线性反馈在本章最后,我们给出了部分可观测的递归最优控制 问题的信息价值 在第三章,我们研究了一类部分可观测的递归最优控制问题结合g i r s a n o v 定理和完全可观测信息下处理最优控制问题的经典方法,我们得到了部分可观 测的递归最优控制问题的最大值原理当状态受限时,我们用类似的方法证明了 该控制问题的最大值原理作为最大值原理的应用,我们研究了一类部分可观测 的递归线性二次最优控制问题 风险敏感最优控制问题可以用来刻画投资者的风险态度,因此在金融经济 理论中有重要应用价值在第四章,我们将研究一类部分可观测的风险敏感最优 控制问题采用与第三章类似的方法,我们得到了部分可观测的风险敏感最优控 制问题的一般随机最大值原理尽管它在形式上与风险中性情形的最大值原理 相似,但是变分不等式和对耦方程明显地依赖风险敏感参数7 ,这是与风险中性 山东大学博士学位论文 情形的最大值原理的主要区别之一作为部分可观测信息的特例,我们给出了完 全可观测的风险敏感最优控制问题的一般最大值原理我们也举出了三个有趣 的例子,以展示风险敏感最大值原理的应用最优投资组合的例子进一步解释了 风险敏感一词的含义 在最后一章,我们研究了一类部分可观测的线性二次非零和微分对策问题 结合分离原理和正倒向随机微分方程理论,我们得到了显式的可观测的n a s h 均 衡点 关键词:部分可观测的随机控制系统;卡尔曼一布西滤波;最大值原理;线 性二次非零和微分对策;最优投资组合 l l 山东大学博士学位论文 p a r t i a l l yo b s e r v e ds t o c h a t i cc o n t r o ls y s t e m s a n dt h e i ra p p l i c a t i o n s w a n gg u a n g - c h e n ( s c h o o lo fm a t h & s y s s c i ,s h a n d o n gu n i v ,j i n a n2 5 0 1 0 0 ) a b s t r a c t i nt h i sp a p e r ,w em a i n l ys t u d yp a r t i a u yo b s e r v e ds t o c h a s t i cc o n t r o ls y s t e m s a n dt h e i ra p p l i c a t i o n st ol i n e a rq u a d r a t i co p t i m a lc o n t r o l ,d i f f e r e n t i mg a m ea n d o p t i m a lp o r t f o h oc h o i c ep r o b l e m s t h i sp a p e rc o n s i s t so ff i v ec h a p t e r s f i h e r i n gt h e o r yi sv e r yi m p o r t a n tf o ru st og e te x p l i c i ts o l u t i o n sf o rp a r t i a l l y o b s e r v e ds t o c h a s t i cc o n t r o lp r o b l e m s t h e r e f o r e ,i nc h a p t e r1 ,w ef i r s tg i v eab r i e f r e v i e wo ff i l t e r i n gt h e o r ya n di n t r o d u c ea ni m p o r t a n tl e m m a w ea k oi n t r o d u c et h e m a i nr e s u l t so b t a i n e di no u rp a p e r t h eo b j e c t i v eo fc h a p t e r2i st od e 以w i t ht h ek a l m a n - b u c yf i l t e r i n gp r o b l e m o ff o r w a r da n db a c k w a r ds t o c h a s t i cs y s t e mw h i c ha r i s i n gf r o mo n ek i n do fc l a s s i c a l s t o c h a s t i co p t i m a lc o n t r o lp r o b l e m w ea l s os t u d yt h es t a b i l i t yo ff i l t e r i n ge q u a t i o n c o r r e s p o n d i n gt ot h i sk i n do ff o r w a r da n db a c k w a r ds t o c h a s t i cs y s t e m ,a sa na p p l i - c a t i o no ff i l t e r i n gt h e o r y , w es t u d yo n ek i n do fp a r t i a l l yo b s e r v e dl i n e a rq u a d r a t i c r e c u r s i v eo p t i m a lc o n t r o lp r o b l e m c o m b i n i n gt h es e p a r a t i o np r i n c i p l ew i t had i - r e c tc o n s t r u c t i o nm e t h o d w eg e tt h eo p t i m a lc o n t r o lw h i 出i st h el i n e a rf e e d b a c ko f t h es t a t ef i l t e r i n ge s t i m a t i o n a tl a s t ,w eg i v et h ev a l u eo ft h ei n f o r m a t i o nf o rt h e p a r t i a l l yo b s e r v e dr e c u r s i v eo p t i m a lc o n t r o lp r o b l e m i nc h a p t e r3 w ec o n c e r no i l ek i n do fp a r t i a l l yo b s e r v e dr e c u r s i v eo p t i m a lc o n - t r o lp r o b l e m c o m b i n i n gg i r s a n o v st h e o r yw i t ht h ec l a 掰i c a lm e t h o du s e di nf u 王l y o b s e r v e do p t i m a lc o n t r o lp r o b l e m s ,w ed e r i v et h em a x i m u mp r i n c i p l ef o rt h i sl c i n d o fp a r t i a l l yo b s e r v e dr e c u r s i v eo p t i m a lc o n t r o lp r o b l e m u n d e rt h ef r a m e w o r ko f i n 山东大学博士学位论文 s t a t ec o n s t r a i n t s ,w ea l s og e tt h em a x i m u mp r i n c i p l ef o rt h i sk i n do fc o n t r o lp r o b - h mb yt h es i m i l a rm e t h o du s e di nt h i sc h a p t e r a sa na p p l i c a t i o no ft h em a x i m u m p r i n c i p l e ,o n ek i n do fp a r t i a l l yo b s e r v e dl i n e a rq u a d r a t i cr e c u r s i v eo p t i m a lc o n t r o l p r o b l e n i sa l s os t u d i e d r i s k - s e n s i t i v eo p t i m a lc o n t r o lp r o b l e mc a l lb eu s e dt od e s c r i b et h er i s k a t t i t u d e o fo n ei n v e s t o r ,t h e r e f o r ei t i sv e r yu s e f u lt os o l v es o m ef i n a n c i a la n de c o n o m i c p r o b l e m s i nc h a p t e r4 ,w ed i s c u s so n ek i n do fp a r t i a l l yo b s e r v e dr i s k - s e n s i t i v e o p t i m a lc o n t r o lp r o b l e m b yt h es i m i l a rm e t h o du s e di nc h a p t e r3 ,w eg e tt h e g e n e r a ls t o c h a s t i cm a x i m u mf o rt h i sk i n do fp a r t i a l l yo b s e r v e dr i s k - s e n s i t i v eo p t i m a l c o n t r o lp r o b l e m a l t h o u g ht h ef o r mo ft h em a x i m u mp r i n c i p l ei ss i m i l a rt oi t s r i s k - n e u t r a lc o u n t e r p a r t ,t h ev a r i a t i o n a li n e q u a l i t ya n dt h ea d j o i n te q u a t i o nh e a v i l y d e p e n do nt h er i s k - s e n s i t i v ep a r a m e t e r ,y t h i si so n eo ft h em a i nd i f f e r e n c ef r o m t h er i s k - n e u t r a lc a s e a sa s p e c i a lc a s eo fp a r t i a li n f o r m a t i o n ,t h eg e n e r a ls t o c h a s t i c m a x i m u mp r i n c i p l ef o rt h i sk i n do ff u l l yo b s e r v e dr i s k - s e n s i t i v eo p t i m a lc o n t r o l p r o b l e mi sa l s oo b t a i n e d a tt h el a s ti nt h i sc h a p t e r ,w eg i v et h r e ei n t e r e s t i n g e x a m p l e st os h o wt h ea p p l i c a t i o n so fo u rr i s k - s e n s i t i v em a x i m u mp r i n c i p l e t h e o p t i m a lp o r t f o l i oc h o i c ep r o b l e mf u r t h e ri l l u s t r a t e st h em e a n i n go ft h ew o r dr i s k - s e n s i t i v e i nt h el a s tc h a p t e r ,o n ek i n do fp a r t i a l l yo b s e r v e dl i n e a rq u a d r a t i cn o n - z e r o s u md i f f e r e n t i a lg a m ep r o b l e mi ss t u d i e d c o m b i n i n gt h es e p a r a t i o np r i n c i p l ew i t h t h et h e o r yo ff o r w a r da n db a c k w a r ds t o c h a s t i cd i f f e r e n t i a le q u a t i o n s ,w eo b t a i nt h e e x p l i c i to b s e r v a b l en a s he q u i l i b r i u mp o i n to ft h i sk i n do fg a m ep r o b l e m k e y w o r d s :p a r t i a l l yo b s e r v e ds t o c h a s t i cc o n t r o ls y s t e m ;k a l m a n - b u c y f i l t e r i n g ;m a x i m u mp r i n c i p l e ;l i n e a rq u a d r a t i cn o n - z e r os u md i f f e r e n t i a lg a m e s ;o p - t i m a lp o r t f o l i oc h o i c e l v 山东大学博士学位论文 r ” r ,0 4 a 一聚 i a i = 雁蠹m 瓣n 。i j 2 t r ( a ) ( ,) ( q ,只) ,尸) ( 五) 口( f ) e l 2 s ( o ,t ) 符号说明 v 几维实欧氏空间 所有( 礼m ) 实矩阵的集合 向量( 或矩阵) a 的转置 几维实欧氏空间舻的范数 m 礼矩阵a = ( ) 的范数 方阵a 的迹 实欧氏空间中的内积 带有滤子的完备概率空间 自然信息流 由随机变量f 生成的矿一代数 定义在( q ,( 五) ,p ) 上的数学期望 关于五一适应的平方可积过程全体 原创性声明 本人郑重声明:所呈交的学位论文,是本人在导师的指导下,独 立进行研究所取得的成果除文中已经注明引用的内容外,本论文不 包含任何其他个人或集体已经发表或撰写过的科研成果对本文的研 究作出重要贡献的个人和集体,均已在文中以明确方式标明本声明 的法律责任由本人承担 论文作者签名:矽名融日期:2 s 2 口7 , 关于学位论文使用授权的声明 本人完全了解山东大学有关保留和使用学位论文的规定,同意学 校保留或向国家有关部门或机构送交论文的复印件和电子版,允许论 文被查阅和借阅;本人授权山东大学可以将本学位论文的全部或部分 内容编入有关数据库进行检索,可以采用影印、缩印或其他复制手段 保存论文和汇编本学位论文 ( 保密论文在解密后应遵守此规定) 敝名叼彩p 名:够叫“多 山东大学博士学位论文 第一章绪论 在本章中,我们将给出本文工作的一些准备知识全章共分为两节第一节 给出了几个基本概念,回顾了滤波理论的历史,并介绍了一个重要引理方便起 见。我们在第二节概述了本文的主要结果 1 1预备知识 现时世界中的许多系统都不可避免的存在不确定性这些不确定性影响到人 类为寻找最优结果而付出的努力在本文,我们仅研究扩散系统由于系统本身 存在动态性,所以决策者依据获得的信息而制定的决策也是动态的决策者必须 从所有可能的决策中选择一个最优的,使得其目标期望值最小( 大) 这类优化问 题称为随机最优控制问题 通常说来,控制者不能完全观测到系统状态,而只能观测到与系统状态相关 的某个噪声过程形如这样的系统称为部分可观测的随机控制系统例如;一个 公司欲采用某种新工艺以提高生产,公司管理层不可能洞悉这种工艺的经济价 值,但是管理层能通过其它方式估计经济价值例如:通过采用新工艺后产品的 生产水平等 本文研究部分可观测的随机控制系统以及它们的应用部分可观测的随机系 统的控制问题包含两个方面的内容一个是滤波问题,而另一个则是控制问题 所谓滤波,通俗的讲就是把污染信号里的噪声尽可能地过滤掉,从中分离出所需 要的信号对于滤波问题的研究,我们可追溯到第二次世界大战期间上世纪四 十年代,维纳从原则上到方法上给出了解决滤波问题的一个途径,即所谓的维纳 滤波这套方法在第二次世界大战期间得到广泛应用它的不足之处在于:必须 用到全部的历史观测数据,存储量和计算量都很大;当获得新的观测数据时,没 有合适的递推算法;很难用于非平稳过程的滤波问题后来,随着科学技术的发 展,特别是空间技术的要求与电子计算机及计算技术的发展。为进一步更完善的 解决滤波问题提供了现实可能性,在这种条件下,卡尔曼和布西于上世纪六十年 代提出了所谓的卡尔曼一布西滤波( 请参见k a l m a nf 2 s ,k a l m a n 和b u c y 2 9 1 ) 对于线性状态方程和观测方程,该滤波理论给出了一种递推算法,它极大的克服 1 山东大学博士学位论文 了维纳滤波的缺陷对于非线性滤波问题,解决起来更加复杂从本质上讲,存 在两种完全不同的方法。k a i l a t h 2 5 1 ,k a i l a t h 和f r o s tf 2 6 1 基于所谓的更新过程 首先提出一种解决方法f u j i s a k ie ta 1 f 1 7 将这种方法进一步完善关于该方法 的系统介绍可参见l i p t s e r 和s h i r y a y e v 【3 4 ,k a l l i a n p u r 2 7 另一种方法形成于 上世纪六十年代,d u n c a n 【1 5 ,m o r t e n s e n 3 7 和z a k a i 5 5 】独立得到了状态变量 非标准的条件密度泛函所满足的方程,这就是所谓的d m z 方程对于该方法的 系统介绍可参见b e n s o u s s a n 6 1 与卡尔曼一布厦滤波不同,通常非线性滤波问 题不存在显式的滤波估计因此,许多学者致力于寻找存在显式滤波估计的非线 性滤波的例子请参见b e n e 1 4 1 ,h a u s s m a r m 和p a r d o u x1 2 2 1 ,c h a r a l a m b o u s 和 e l l i o t t 【8 】等对于线性系统的部分可观测的控制问题而言,我们可以用w o n h a m 【4 8 】介绍的分离原理饵决该原理告诉我们,部分可观测的线性系统的控制问题 可以分解为两个步骤解决也就是说,先计算状态的滤波估计;然后,用通常的方 法处理完全可观测的控制问题关于分离原理的应用可参见l i p t s e r 和s h i r y a y e v 3 4 i ,b e n s o u s s a n 6 】然而,分离原理一般不适用于非线性系统的部分可观测的控 制问题对于这种问题我们有两种不同的处理方法一种可参见b e n s o u s s a n 6 】, y o n g 和z h o u 【5 4 l i 和t a n g 【3 3 ,t a n g 【4 5 1 则提出解决该问题的另一种方法, 该方法类似于p e n g 4 1 1 在处理完全可观测的控制问题中所用的技术。 众所周知,滤波理论现已广泛应用于航空和通讯等工程领域近来,l a k i l e r 【3 2 】首先用滤波理论来解决金融市场中的一些投资组合选择问题关于这方面的 进展可参见y a n g 和m af 5 3 1 ,n a g a | i 和p e n g 【3 9 ,x i o n g 和z h o u 【5 1 】等 不难发现,上述工作都假定状态变量满足正向随机微分方程在本文,我们 研究部分可观测的正倒向随机系统及其应用方便起见,我们将在下一章给出正 倒向随机系统的一些进展 考虑下列一维状态方程和观测方程 r id 巩= a o ( t ,) + n 1 ( t ,f ) 巩1 d + b l ( t ,) d w ,l o ) + b 2 ( t , ) d w ,2 ( ) ,、 1 【1 1 ) i 心= 陋o ( t ,) + a l ( t ,) 0 t d t + 8 ( t ,) d ”,2 ( z ) 、 这里( w l ( ) ,w j ( ) ) 是定义在带滤子的完备概率空间( q ,( 五) ,p ) 上的二维标准 布朗运动,随机变量0 0 ,o 与布朗运动相互独立,自然信息流定义为 氕= 盯 w 1 ( s ) ,w 2 ( s ) :0ss ) ,j = 厅,0st t 2 山东大学博士学位论文 泛函a i ( t ,z ) ,a i ( t ,z ) ,b a t ,z ) ,b ( t ,z ) ,i = 0 ,1 ,j = 1 ,2 都是统一可测的,其中玩 是空间c ,上由值所生成的连续函数z = t :8 曼丁) 的盯一代数 我们需要下列假定 ( h 1 1 ) 对任意的z c t , z ( 三m 出,卅雠枷+ j = l , 2 霹( t 卅萨啪 佃 【a g ( t ,z ) + a i ( t ,x ) d t 0 ,0 t s t , i a l ( t ,z ) i l ,i a l ( t ,z ) l l ,e 日: + o 。, e 4 ( t ,f ) + 6 4 ( t ,f ) + 磋( t ,f ) 】d t + o o ( h 1 2 ) 对任意的z ,可c r ,存在非减的右连续函数0sk ( s ) 1 ,使得 i b ( t ,z ) 一b ( t ,y ) 1 2 l 1 l z 。一玑1 2 d k ( s ) + l 2 i 觑一轨1 2 , ,t j 0 b 2 ( t ,z ) l - o ( 1 + z :) d k ( s ) + k 2 ( 1 + z ;) ( h 1 3 ) e i 巩l + o o ,0 t e f t e i a , ( t ,f ) 巩i 出 0 ,a ( ) ,日( ) ,c ( ) ,f ( ) ,( t ) ,l ( f ) ,m ( f ) 和r ( ) 是定义在【0 ,明上的一致有界确定性函数,r 一1 ( t ) 有界且c t 是非负常数 我们的最优控制问题是,在状态方程( 2 1 ) 的限制下,选取合适的容许控制 o ( ) ,使得指标泛函( 2 2 ) 达到最小使( 2 2 ) 取的最小值的容许控制称为最优的 我们的任务就是寻找问题( 2 2 ) 的最优控制 在正向状态方程的所有系数含有控制变量且控制域非凸的假定下,p e n g 【4 1 】 得到了最优控制成立的必要条件一一般最大值原理由该最大值原理,我们很容 易得到 缸( t ) = 一日( ) 6 1 ( t ) ( f ) , a , e ,a 8 , 其中( z ( ) ,( t ) ,z ( ) ) 满足下列哈密尔顿系统 , id x ( t ) = ( a ( t ) x ( t ) 一g ( t ) y ( t ) + f ( t ) ) d t + c ( t ) d w l ( f ) , 一d y ( ) :( n ( ) z ( t ) + a ( f ) y ( ) ) d t z ( t ) d w l ( t ) , ( 2 3 ) i l z ( o ) = z o ,( 丁) = c 丁z ( t ) ,a ( t ) = b 2 ( ) b 一1 ( t ) 、 8 山东大学博士学位论文 根据p e n g 和w u 【4 4 ,f b s d e ( 2 3 ) 存在唯一解 假定状态过程( z ( ) ,可( ) ,z ( ) ) 不能被直接观测到,但是我们能观测到与z ( ) 相关的某个噪声过程z ( ) ,这里z ( ) 满足下列方程 r d z o ) 一o 净o ) + 以。以删( t ) ) r ( t ) 删2 0 ) ,( 2 4 ) 1 、一。, i z ( o ) = 0 注意到假定( h 2 1 ) ,我们知道方程( 2 4 ) 存在唯一解 小注2 2 1 尽管方程( 2 4 ) 的漂移项系数可以含有( 掣( t ) ,z ( t ) ) 的线性组合,但是 我们仍能用本文所介绍的方法处理这种情况,所以本章仅考虑上面的状态方程 我们的滤波问题是,依赖t 时刻前的可观测信息z ( ) 给出状态( z ( o ,可( t ) ,:( t ) ) 的最佳估计( 圣( t ) ,口( t ) ,2 ( t ) ) 的显式表达式即,我们需要计算 z ( t ) = c ( t ) 丕u ( t ,z ( t ) ) , ( 2 6 ) c ,z 陋= 卅”邮m 托) _ o 眨7 , c “( t ,z ) = i l c 。( t ) 昙u ( t ,z ) + ( a ( t ) z g ( t ) 札( t ,z ) + f o ) ) 未u ( t ,z ) 山东大学博士学位论文 注意到( 2 7 ) 的终端条件,我们设 “( t ,z ) = o ( t ) x + p ( t ) : :n ) 一g 。) q 2 ) + n 。) = o c z s , : :0 三。) 一g ( 。n 。”p 。) + f ( f ) q 。) = 。 c z 。, 若注意到布朗运动的相互独立性,则易知x ( t ) 和z ( t ) 均为高斯的,从而 ( z ( t ) ,y ( t ) ,z ( t ) ) r a 也是高斯的这就是说,( z ( ) ,y ( ) ,4 t ) ) 是一个高斯系统 此时,利用经典的正向随机系统的滤波理论,我们不难得到( 仝( t ) ,口( ) ,2 ( ) ) 的计 算公式 很明显, s ( t ) = c a ( 2 1 1 ) 因此,我们只需要计算9 ( t ) 和童( ) 令 p ( t ) = e ( z ( f ) 一圣( t ) ) 2 表示滤波估计圣( f ) 的均方误差如果注意到( z ( ) 一盒( t ) ) 上磊和士( ) 一圣( f ) 是 高斯的事实,那么我们断言z ( t ) 一壬( ) 独立于磊,从而 p ( t ) = e ( z 0 ) 一圣0 ) ) 2 = e 【( z ( ) 一圣( ) ) 2j z 0 = 孑( t ) 一2 ( f ) ( 2 1 2 ) 】o 山东大学博士学位论文 由l i p t s e r 和s h i r y a y e v 3 4 】的定理8 1 ,我们得到下列方程 d 圣o ) = 【( a ( t ) 一g ( ) d ( t ) ) 2 ( t ) + f ( t ) 一g ( t ) f l ( t ) d t + k ( t ) r 一1 ( t ) p ( t ) d 可旷( t ) , ( 2 1 3 ) 圣( o ) = z o , d ( t ) = 2 ( a c t ) 一g ( t ) a ( t ) ) 孑( t ) + 2 ( f ( t ) 一g ( t ) 口( t ) ) 量( t ) + c 2 ( t ) l d t + k ( t ) r 一1 ( t ) ( ( t ) 一盒( t ) 未( ) ) ( f 形( t ) , ( o ) = 碚, 勋) = 锱( 出h 冲+ 魄力 ( 2 1 4 ) ( t ) = 3 圣( t ) ( t ) 一2 圣3 ( t ) , 三 三二? 。) 一g 。) 。”尸 ) + k 2 ( 。r 一2 ( 尸2 ( 幻一俨。) = o - c z - s , 雪( t ) = q ( t ) 岔( t ) + p ( ) , 其中圣( t ) 是方程( 2 1 3 ) 的解,并且e ( t ) 是可观测的 ( 2 1 6 ) 山东大学博士学位论文 因此我们有 定理2 2 2 若令( h 1 ) 成立,则正倒向随机系统( 2 3 ) 的滤波估计 ( t ) ,雪( ) ,2 ( ) ) 由( 2 1 3 ) ,( 2 1 6 ) 和( 2 1 1 ) 给出,其中滤波估计的均方误差p ( t ) 满足方程( 2 1 5 ) 小注2 2 3 指标泛函( 2 2 ) 在状态方程和观测方程( 2 1 ) 和( 2 ,4 ) 的约束下,构成了 一类部分可观测的最优控制问题现在,让我们考虑该类部分可观测的最优控制问 题( 2 2 ) 一个控制变量v ( 0 被称为容许的,如果它是z t 一适应的平方可积过程在 完全可观测的情形下,问题( 2 2 ) 的最优控制是矗( ) = 一b ( t ) b 一1 ( ) 可( ) ,其中y ( t ) 满 足f b s d e ( 2 3 ) 根据条件数学期望的性质,显然v ( t ) = 一b ( o b 。( t ) e b ( t ) l 磊】可 看作部分可观测问题( 2 2 ) 的一个容许控制从这一观点来看,我们仅知道v ( t ) 是 容许控制,还不能说v ( t ) 一定是问题( 2 2 ) 的最优控制但是,我们的定理2 2 至少 给出了寻找其显式容许控制的一种方法我们希望在不久的将来用这种方法解决 一些部分可观测的最优控制问题这正是我们研究该类滤波问题的动机之所在 2 3 卡尔曼一布西滤波方程的稳定性 在该小节,我们首先研究滤波方程( 2 1 3 ) 和( 2 1 6 ) 对初值的稳定性,然后给 出一个具有稳定的显式滤波解的正倒向随机系统的例子 我们给出下列定义 定义2 3 1 对任意0 曼t t ,我们假定圣1 ( o ) 和奎2 ( o ) 是两个初值,圣l ( ) 和 圣2 ( ) 是相应的滤波估计值滤波方程( 2 1 3 ) 被称为稳定的,如果对任意的e 0 , 存在6 = 6 ( ) 0 使得当e ( 畲l ( o ) 一圣2 ( o ) ) 2 6 时,有 es u p ( 未1 ( ) 一圣2 ( t ) ) 2 0 ( t 在实际中,我们总希望当初始滤波估计有微小波动时,任意时刻的滤波估计 也应该有微小波动即,我们渴望得到稳定的滤波估计否则,我们的滤波方程 没有多少实际应用价值对滤波方程( 2 1 3 ) ,我们能给出一个更加一般的结果 解对参数的连续依赖性显然,滤波方程的稳定性只是该结果的推论 根据方程( 2 1 3 ) 和( 2 t 4 ) ,我们很容易得到下列依赖于一族参数d r 的 1 2 山东大学博士学位论文 s d e ( 2 1 7 ) 其中 巾) “沁) 划一( 鬻) 2 p q 战 ( t ) = 吝器脚) i r 沁) 纠卅( t ) 晰) , ( t ) ,0 5 ( t ) ,( t ) 和p 5 ( ) 分别满足方程( 2 3 ) ,( 2 ,8 ) ,( 2 9 ) 和( 2 1 5 ) 特别地,如果方程( 2 1 7 ) 的所有变量不依赖于参数6 ,那么它即退化为相应 于部分可观测的随机系统( 2 3 - 2 4 ) 的状态z ( t ) 的滤波方程( 2 。1 3 ) ( h 2 2 ) 假定( t ) ,6 6 ( ) ,a 6 ( t ) ,b 6 ( ) ,c 6 ( t ) ,f 6 ( f ) ,k 6 ( t ) ,( t ) ,m 6 ( t ) ,r 6 ( t ) 和 【搿( ) 】_ 1 关于参数6 连续,并且它们关于t 和6 一致有界 从而找幻有 定理2 3 2 若( h 2 2 ) 成立,则方程( 2 1 7 ) 的解( t ) 关于参数6 r 连续 证明方便起见,设 茔( ) = 圣n ( t ) 一2 ( t ) ,主( t ) = z 南( t ) 一z 幻( ) , ( t ) = 9 以( t ) 一9 幻( t ) ,f ( t ) = r 6 1c t ) 一r 如( t ) , ( h k ) ( t ) = 肿( t ) k 6 1 ( t ) 一肛( t ) 加( t ) , ( h r ) ( t ) = x ( t ) 印1 ( t ) 一h 6 :( t ) j 净( t ) 敢怄7 r z ( s ) 佝s 产( 5 ) d s + 7 z 双s ) d sr ( 邱) ) 2 d s + 7 加脚) ) 2 d s p ( s ) d s + 7 z o 衙d s z ( 州) 2 d s f 即) d s + 7 ( z 丽( s ) 彬( s ) ) = + 7 玳o ) , k 吼m 嘲 矿 + 帆o、u印 q , 0 + 罐 f f f f 删 巩 山东大学博士学位论文 sup孟2(t)=7gir孟2(s)ds+7,r百2(s)ds,t(圣)2ds0ststj o j oj o 孟2 ( t ) = 7 g 孟2+ 7 百2( 扣( s ) ) 2 十7 g o t 敢s ) d s + 7 f 耐( s ) d s z t ) 2 d s tt + 仃o 州d s + 7 。8 u 。蔓p m ( 丽。) d w 2 ( s ) ) 2 + 住2 ( o ) 根据b - d g 不等式,我们易得 es u p 孟2 ( t ) 7 c o e s u p 孟2 ( t ) d t + 铝( 6 l ,如) ,( 2 ,1 8 ) o t t3 0o 0 ,b ( t ) 和,( t ) 关于t 均为一致有界的确定性函数 假定我们不能直接观测到状态变量( z ( ) ,( ) ,z ( ) ) ,但是能观测到某个与z ( 一) 相关的噪声过程z ( ) ,而z ( ) 的动态性可以由下列方程描述 凹( t ) _ ( d o 扣o ) + 州”引t ) ) d 汁酬。删2 0 ) ( 2 2 2 ) 、4 , i z ( o ) = 0 , 其中d ( ) ,f ( t ) 和1 日( ) i e 0 关于t 是一致有界的确定性函数 在概率空间( n ,厂) 上定义一个新的概率测度q , a q 矿e x p f o 丁m 沪i 乃哪, 根据,( - ) 所满足的假定条件和g i r s a n o v 定理,我们断言随机过程 w 3 ( t ) = w 1 ( t ) 一f ( s ) d s 山东大学博士学位论文 是定义在新概率空间( q ,( 五) ,q ) 上的一维标准布朗运动此时不难证明,在 概率空间( q ,( 五) ,q ) 上,w 2 ( ) ,3 ( ) 和专相互独立,并且和2 ( ) 保持 原有的概率分布不变 :;三。) z 。) + b 。) t ,。) + g ) , ) ) d t + c 。) d w 3 ( c z z s , l d 暑,( ) = ( n ( ) z 2 ( t ) + 6 ( t ) 暑,( f ) + c ( t ) 秽2 ( t ) ) d t z ( t ) d ,3 ( t ) , ( 2 2 4 ) l ! ,( 丁) = z z ( t ) , 。4 j 0 ( ) ) = e 口p 2 ( r ) e j 6 ( t ) 出1 + e 口厂t “6 ( s ) d s 缸o ) 2 0 ) + c o ) 2 ( ) ) d t ,( 2 2 5 ) j 0 其中e o 表示定义在( q ,厂,( 五) ,q ) 上的数学期望 令 磊= 盯 z ( s ) ;0 s t ) 我们给出下列定义 定义2 4 i 控制变量口( ) 被称为容许的,如果t ,( ) 是磊一适应的且满足ej 矿( t ) d t + o 。容许控制变量的集合用玩d 表示 小注2 4 2 从定义2 4 1 可知,如果t j ( ) ,那么我们有e 口j 孑 4 ( t ) d t + o o 此时,e q x 4 ( t ) + o o ,从而有i e q y 2 ( t ) + o 。成立 我们的最优控制问题是,在观测方程和状态方程( 2 2 2 ) 和( 2 2 3 ) 的约束下寻 找合适的t ,( ) 玩d 使得j ( 口( ) ) 取得最小值我们的解决方法是,首先用分离原 理把原来部分可观测的最优控制问题转化成完全可观测的情形,然后结合一种 直接构造的方法给出问题的最优解 1 7 山东大学博士学位论文 慨? + b ( 咖堋彬) d t + 踯矿沁) p ( 咖_ ( 味仁z 。, w ( t ) = ,2 ( t ) + d ( s ) h 一1 ( s ) ( z ( s ) 一壬0 ) ) d s 三 三二:。p 。) + 。2 。) 日一2 ( t ) p 2 ( 。一c 2 ( f ) = o c 。7 , 小注2 4 3 ( 2 2 7 ) 是一类经典的r i c c a t i 方程,显然存在唯一解注意到z ( t ) 一圣( ) 是( q ,z ,( z t ) ,q ) 上的高斯过程,且( x ( t ) 一畲( t ) ) 上磊,因此我们有 p ( t ) = e q ( x ( t ) 一叠( t ) ) 2 lz t 】= e o ( z 0 ) 一圣( t ) ) 2 若注意到事实e q 【( z ( t ) 一( t ) ) 宝( t ) 】= 0 ,则指标泛函( 2 2 5 ) 可变形为 j ( 口( ) ) = e f t 6 ( t ) m e 。【( z ( r ) 一圣( + 圣( 丁) ) 2 + ,2e j b ( 。) 如( 口o ) ( z ( t ) 一圣( 亡) + 盒( t ) ) 2 + c ( t ) v 2 ( t ) ) d t l = e j 琊) d t e 口陋。( r ) + 厂1 ( 。o ) 圣2 0 ) + c ) v 2 ( o ) e j 7 吣) d s 出】 + p ( t ) e j 琊) 出+ 厂2 ) p o ) e 片6 ( s ) 山出, j o 其中圣( ) 和p ( t ) 分别是方程( 2 2 6 ) 和( 2 2 7 ) 的解函数n ( ) ,6 ( t ) ,p ( t ) 和p ( t ) 既不依赖于控制变量 ( ) ,也不依赖于滤波估计2 ( - ) 因此,原问题的最优控制 仳( ) 与下列最小化指标泛函 ( 。( ) ) :【圣2 ( t ) + ? e 一蜘) d s ( 。( ) 岔2 ( t ) + c ( ) 2 ( ) ) d 叫 ( 2 2 8 ) 1 8 山东大学博士学位论文 的最优控制一致这已经是一类完全可观测信息下的随机最优控制问题,关于该 类问题的其它理论请参见c h e n ,x l i 和z h o u 【1 1 ,c h e n 和z h o u 【1 2 1 ,a i tr a m i , m o o r e 和z h o u 【1 】等 因为方程( 2 2 6 ) 的漂移项系数含有c ( ) ,( t ) ,所以处理线性二次最优控制问 题的完全平方技术已不能用来解决我们的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 宝洁公司物流运作情况
- 2026年成人学士学位英语统一考试试题及详细答案解析
- 安全生产名言名语人生感悟
- 《物联网应用综合实训》课件-项目4网络传输层连接与配置
- 模具厂提成合同范本
- 委托工程测量合同范本
- 度假村招商合同范本
- 国际市场营销第二章国际市场营销环境
- 2026基于机器视觉的自钻自攻钉表面缺陷检测技术深度研究
- 安徽 华业化工招聘考试 需招聘 9 人
- 2026年吉林省中考英语真题(含答案)
- 2026盐城市国企招聘考试真题及答案
- 2025年全国成人高考(专升本)《政治》真题及答案(完整版)
- 2026秋新教材外研版(三起)小学英语六年级上册(全册)各单元达标测试卷及答案
- 中国创伤失血性休克急诊诊疗指南(2025 版)
- 欧盟RoHS指令中文版(2025修订完整版 2011-65-EU)
- 装配式叠合板安装监理实施细则
- 数字媒体内容审核合规性指导书
- 交管12123学法减分题库500题(含答案解析2025完整版)
- 《传感器与检测技术》课件 第八章 热电式传感器
- 老年骨质疏松症患者跌倒预防循证指南(2026版)
评论
0/150
提交评论