近接方策最適化
From Wikipedia, the free encyclopedia
近接方策最適化(きんせつほうさくさいてきか、英: proximal policy optimization, PPO)は強化学習のアルゴリズムの一種である。2017年にジョン・シュルマンによって発明され[1]、OpenAIのデフォルトの強化学習アルゴリズムとなった[2]。2018年には、PPOは、ロボットアームの制御や、Dota 2でのプロへの勝利や、Atariゲームでの成功など結果を残した[3]。他のアルゴリズムと比較した場合、PPOの主な利点は、シンプルさ、安定性、サンプル効率とされる[4]。
PPOは方策勾配法に分類される。PPOは方策の更新幅が極度になりすぎないように、クリッピング関数を用いる[4]。
2015年に、ジョン・シュルマンはPPOの初期バージョンとして信頼領域方策最適化 (TRPO) を開発した。 TRPOは、信頼領域制約を使用して古い方策と新しい方策の間のKLダイバージェンスに制約をかけることにより、DQNの不安定性問題に対処した。ただし、TRPOは2次最適化のため、計算及び実装が困難であった[5][6]。
2017 年、ジョン・シュルマンは、PPOに一次最適化を採用することで、TRPO の複雑さの問題を解決した。 彼らは新旧の方策間の尤度比が一定以上となるときにクリッピングするメカニズムを設計した[1][6]。言い換えれば、PPOは、過度な方策更新に対する罰を取り入れることでTRPO の目的関数を変更する。また、PPOは複雑な信頼領域の制約を削除し、代わりにクリッピング関数を利用する。結果として、PPOはTRPOのコンセプトや性能を損なわずに計算や実装を向上させた。