A3C-LSTM

结合LSTM的A3C强化学习算法的Python实现,在CartPole环境中测试。说明中提到该模型不收敛,并推荐DDPG版本。

分享到 X未声明许可证

概述

这是使用LSTM网络的A3C(异步优势Actor-Critic)强化学习算法的Python实现,在OpenAI Gym的CartPole环境上测试。它基于Arthur Juliani的TensorFlow教程和Mnih等人2016年的论文。作者说明这只是示例代码,该模型在CartPole上不收敛。

主要特点

  • 用TensorFlow实现带LSTM的A3C智能体
  • 仅在大于30的小批量上训练
  • 用奖励系数支持较快的学习率
  • 每100回合保存模型,可重载继续训练或测试

适用场景

适合想了解带LSTM的A3C如何搭建的读者。自述文件提醒它不收敛,并推荐用DDPG版本获得可用模型。

上游仓库
liampetti/A3C-LSTM
GitHub 上的 fork
Guo-astro/A3C-LSTM
上游 Star 数
48
分类
金融、数据与研究
编程语言
Python
许可证
未声明许可证没有许可证时,作者保留所有权利。复用代码前请先询问上游作者。
Fork 时间
2018-05-20
同步状态
已同步上次同步 2026-09-29