平均場ゲーム理論

From Wikipedia, the free encyclopedia

平均場ゲーム理論(へいきんばゲームりろん、Mean-field game theory)は、非常に大規模な集団における小さな相互作用エージェントによる戦略的意思決定の研究である。

ゲーム理論と確率分析および制御理論の交差点にある。「平均場」という用語の使用は、個々の粒子がシステムに与える影響がごくわずかである多数の粒子のシステムの挙動を考慮する物理学の平均場理論に触発されている。言い換えると、各エージェントは、他のエージェントの決定を考慮して、最小化または最大化の問題に従って行動し、その母集団が多いため、エージェントの数は無限大へ向かうと仮定でき、代表的なエージェントが存在するとも仮定できる。[1]

伝統的なゲーム理論では、研究対象は通常、2人のプレイヤーと離散的な時間空間を持つゲームであり、帰納法によって結果をより複雑な状況に拡張する。ただし、連続状態を持つ連続時間のゲーム(差分ゲームまたは確率的差分ゲーム)の場合、動的相互作用が生成する複雑さのために、この戦略は使用できない。一方、MFGでは、平均代表エージェントを介して多数のプレーヤーを処理できると同時に、複雑な状態のダイナミクスを記述できる。

このクラスの問題は、ボヤン・ヨバノビッチとロバート・W・ローゼンタールによる経済学文献[2]、ミンイ・ファン、ローランド・マルハメ、ピーター・E・ケインズによる工学文献[3][4][5] 、そして数学者ジャン・ミッシェル・ラスリーと ピエール=ルイ・リオンによって独立してほぼ同時に検討された[6][7]


連続時間では、平均場ゲームは通常、個人の最適制御を記述するハミルトン–ヤコビ–ベルマン方程式と、エージェントの集合分布のダイナミクスを記述するフォッカー–プランク方程式で構成される。かなり一般的な仮定の下では、平均場ゲームのクラスが次のようにNプレイヤーのナッシュ均衡の極限であることを証明できる[8]


平均場ゲームに関連する概念は、「平均場型制御」である。この場合、ソーシャルプランナーは状態の分布を制御し、制御戦略を選択する。平均場型制御問題の解は、通常、コルモゴロフ方程式と結合した二重随伴ハミルトン-ヤコビ-ベルマン方程式として表すことができる。平均場型ゲーム理論は、単一エージェント平均場型制御のマルチエージェント一般化である[9]

平均場ゲームの一般形式

次の連立方程式を使用して[10] 、典型的な平均場ゲームをモデル化できる。

この一連の方程式の基本的なダイナミクスは、平均的なエージェントの最適制御問題によって説明できる。平均場ゲームでは、平均的なエージェントは、次の方法で移動αを制御して、母集団の全体的な位置に影響を与えることができる。


はパラメータであり、 は標準ブラウン運動。 エージェントの動きを制御することにより、エージェントは、期間を通じて全体的な予想コスト を最小限に抑えることを目指している。

は時間におけるランニングコストで は時間におけるターミナルコスト。定義により、時間と位置について、 価値関数は以下のように決定できる。

価値関数 の定義が与えられると、ハミルトン-ヤコビ方程式 (1) で追跡できる。平均的なプレーヤーの最適なアクション は として求めることができる。すべてのエージェントは比較的小さく、集団のダイナミクスを単独で変更することはできないので、それらは個別に最適な制御を適応させ、人口はそのように移動する。これは、すべてのエージェントが他の特定の戦略のセットに応じて行動するナッシュ均衡に似ている。最適制御解は、コルモゴロフ-フォッカー-プランク方程式(2)につながる。

有限状態ゲーム

平均場の顕著なカテゴリは、有限数の状態と有限数のプレイヤーあたりのアクションを持つゲームである。これらのゲームでは、ハミルトン-ヤコビ-ベルマン方程式の類似物はベルマン方程式であり、フォッカー-プランク方程式の離散バージョンはコルモゴロフ方程式である。具体的には、離散時間モデルの場合、プレイヤーの戦略はコルモゴロフ方程式の確率行列である。連続時間モデルでは、プレイヤーは遷移率行列を制御することができる。

離散平均場ゲームはタプル ,で定義でき、 は状態空間、 は作用集合、 は遷移速度行列、は初期状態、はコスト関数、 は割引係数である。さらに、混合戦略は測定可能な関数, これは各状態 ごとに可能なアクションのセットに対する確率測度 に関連付ける。したがって、は、時間において、状態 のプレイヤーが戦略の下で行動をとる確率である。さらに、レート行列 は母集団分布の経時的な進化を定義し、ここで は時刻 における母集団分布である[11]

線形二次ガウスゲーム問題

Caines(2009)から、大規模ゲームの比較的単純なモデルは線形二次ガウスモデルである。個々のエージェントのダイナミクスは、確率微分方程式としてモデル化される。番目のエージェントの状態で, 番目のエージェントの制御, は 独立のに対するウィーナー過程である。 個々のエージェントのコストは、エージェント間の結合はコスト関数で発生する。

一般および応用用途

出典

外部リンク

Related Articles

Wikiwand AI