Skip to main content

Pokročilá teorie her ve světě kolem nás (Ukázka, strana 99)

Page 1

98

Pokročilá teorie her ve světě kolem nás

Požadavek: Chceme zvolit optimální trajektorii , přičemž známe a prázdněn, tedy .

, abychom minimalizovali celkové náklady . Navíc požadujeme, aby v čase byl sklad vy-

Řešení: Vývoj zboží na skladu bude záviset na tom, kolik se do něj bude dovážet, což je dáno intenzitou , a kolik vyvážet, což je zase dáno poptávkou , lze tedy napsat: (3.P1.2) d d d Vzorec (3.P1.2) nám dává pohybové rovnice prostředí, které je zde reprezentováno stavem skladu. Úlohu přeformulujeme do tvaru (3.10): (3.P1.3) max za podmínky:

d d d

Řešme úlohu podle principu maxima. Sestavíme Hamiltonovu funkci: (3.P1.4)

Nyní budeme hledat maximum této funkce na množině všech kladných funkcí . Z principu maxima také platí: (3.P1.5) d d

d d

d d

d

Dále přepíšeme podmínku prvního řádu pro Hamiltonovu funkci:

Ukázka elektronické knihy, UID: KOS190076


Problém regulace

99

(3.P1.6) d d Vyřešíme soustavu rovnic

3. P .5

3. P .6

a dojdeme k výsledku:

(3.P1.7) d d

d d

d

Nyní už lze při konkrétním předpisu funkce vypočíst funkci . Ještě zbývá ověřit, že se skutečně jedná o maximum funkce . Pro toto ověření provedeme druhou derivaci funkce podle : (3.P1.8) d d Nerovnost platí dle druhého předpokladu, tudíž vypočtené maximum Hamiltoniánu a tedy optimální strategií.

dle (3.P1.7) bude skutečně ◊

3.5.2 Možné tvary výsledku V úlohách regulace můžeme výstupy nebo řešení vyjádřit dvěma způsoby. Mějme situaci z příkladu 3.1 a máme za úkol napsat program, který by nám problém počítal. Regulačním parametrem byla intenzita výroby zboží a stavová veličina byla množství výrobků na skladě v čase . Úloha by řešila, stejně jako v našem příkladě, jak optimálně nastavovat výkon výrobních strojů tak, abychom měli co nejmenší náklady na výrobu plus skladování a zároveň vyráběli dostatečné množství výrobků k uspokojování poptávky. Jeden z možných výsledků programu by byl takový, že bychom zadávali jak čas, tak aktuální stav skladu a pro něj řešili optimalizační úlohu, tím pádem bychom nepotřebovali počáteční stav, ale zase bychom museli znát aktuální stav a čas. Druhý způsob by byla možnost zadat počáteční stav skladu a následně dopředu přednastavit pravidla, podle kterých se bude ve sledovaném časovém úseku sklad plnit. Pak by už stačilo pouze zadat časový interval a program by nalezl optimální nastavení výkonu. Každý ze způsobů je vhodný na řešení jiné situace. Strategie z prvního případu, kterou lze zapsat ve tvaru , se nazývá

Ukázka elektronické knihy, UID: KOS190076


100

Pokročilá teorie her ve světě kolem nás

Markovova strategie (nebo někdy též feedback strategie či strategie s uzavřenou smyčkouI). Markovovy strategie jsou založené na neustálém zhodnocování doposud dosažených výsledků. Systém se tak může učit z chyb, které udělal, a vylepšovat své další kroky. Tyto strategie posuzují úspěšnost výsledků z minulosti a tím ovlivňují volby do budoucna. Jednoduše řečeno, při rozhodování berou v úvahu zpětnou vazbu (feedback) výsledků z historie. Těchto Markovových strategií budeme využívat v následující kapitole. Strategie popsaná v druhém případě, tedy strategie, již lze zapsat ve tvaru , se nazývá Nemarkovova strategie (nebo též strategie s otevřenou smyčkouII). Jsou to tedy strategie, které pracují vždy jen s aktuálním stavem a nehledí do výsledků minulosti. Jejich optimalizační úloha je celá vyřešena od počátku . Taková strategie je vhodná, pokud máme k dispozici informaci o vývoji stavů v celém časovém úseku. Na závěr ještě poznamenejme, že tyto dva výstupy nejsou dvě různá řešení jednoho problému. Řešení pomocí obou výstupů jsou ekvivalentní, rozdílný je jen způsob prezentace výsledku. Pokud budou výsledky optimální regulace, tak podle Bellmanova principu optimality musí oba výsledky sledovat stejnou trajektorii optimální regulace. Každý výstup se však hodí do jiné situace a u každého z nich jsou kladeny různé požadavky na vstupní informace.

3.6 Nematematické shrnutí Tato kapitola se teorie her přímo netýká. Slouží jako předehra k diferenciálním hrám, které se probírají v kapitole 4. Látka zde vyložená se omezuje na definování tzv. problému optimální regulace, vysvětlení komplikací, které nastávají, když se ho snažíme řešit, a představení několika speciálních případů, v nichž jsme tento problém schopni řešit. Tato kapitola zahrnuje mnoho technických postupů, které je zbytečné popisovat zde v nematematické části. Proto není tato podkapitola příliš obsáhlá. I tak je ale užitečné pro nematematika se zájmem o poznání diferenciálních her porozumět problému, se kterým se tyto hry potýkají, a znát limity jeho řešení. Také zde vypíchneme některé základní principy, které jsou s tímto problémem spojeny, aby čtenář získal orientaci v dynamické optimalizaci. Problém optimální regulace je ilustrován na příkladu s loďkou v úvodu kapitoly, ale uvedeme i jiný příklad. Řekněme, že Jáchym je muž v domácnosti a snaží se regulovat své výdaje. Žije v prostředí, kde jsou nějaké výdaje, se kterými nemůže hýbat, například nájemné nebo poplatky za spotřebu energií. Pak jsou zde výdaje, se kterými bude moci hýbat, například výdaje za jídlo, za sportovní aktivity nebo jiné dobrovolné činnosti. Nakonec má mimořádné výdaje, s nimiž hýbat nemůže, ale které ani nejdou příliš předvídat. Například oprava ledničky při poruše. Všechny tyto vlivy udávají stav jeho bankovního účtu, který se v čase nějak vyvíjí. Stavu na bankovním účtu budeme říkat stav prostředí. Jáchym však může stav prostředí částečně ovlivnit tím, kolik peněz bude vydávat na dobrovolné aktivity. Budeme sledoI

Ang. closed-loop strategy.

II

Angl. open-loop strategy.

Ukázka elektronické knihy, UID: KOS190076


Turn static files into dynamic content formats.

Create a flipbook
Pokročilá teorie her ve světě kolem nás (Ukázka, strana 99) by Kosmas-CZ - Issuu