A3C-LSTM

LSTMを用いた強化学習手法A3CのPython実装で、CartPole環境で試しています。READMEによると収束しないため、DDPG版が紹介されています。

Xで共有ライセンス表記なし

概要

LSTMネットワークを使った強化学習アルゴリズムA3C(Asynchronous Advantage Actor-Critic)のPython実装で、OpenAI GymのCartPole環境で試されています。Arthur JulianiのTensorFlow解説とMnihらの2016年の論文をもとにしています。作者は例示用のコードであり、このモデルはCartPoleで収束しないと明記しています。

主な特長

  • TensorFlowで作ったLSTM付きA3Cエージェント
  • 30を超えるミニバッチでのみ学習
  • 報酬係数で高い学習率でも学習可能に
  • 100エピソードごとにモデルを保存し再利用可能

こんな人・用途に

LSTM付きA3Cの構成を学びたい人向けです。収束しないと明記されており、動作するモデルにはDDPG版が案内されています。

アップストリーム
liampetti/A3C-LSTM
GitHubのフォーク
Guo-astro/A3C-LSTM
アップストリームのスター数
48
カテゴリ
金融・データ・リサーチ
言語
Python
ライセンス
ライセンス表記なしライセンスがない場合、著作者がすべての権利を保持します。コードを再利用する前にアップストリームの作者に確認してください。
フォーク日
2018-05-20
同期状態
同期済み最終同期 2026-09-29