OpenAI出品的baselines项目提供了一系列deep reinforcementlearning(DRL,深度强化学习或深度增强学习)算法的实现。现在已经有包括DQN,DDPG,TRPO,A2C,ACER,PPO在内的近十种经典算法实现,同时它也在不断扩充中。它为对DRL算法的复现验证和修改实验提供了很大的便利。本文主要走读其中的PPO(ProximalPolicyOptimization)算法的源码实现。PPO是2017年由OpenAI提出的一种DRL算法,它不仅有很好的performance(尤其是对于连续控制问题),同时相较于之前的TRPO方法更加易于实现。之前写过一篇杂文《深度增强学习(DRL)漫谈- xinlai域(TrustRegion)系方法》对其历史、原理及相关方法做了简单介绍,因此本文主要focus在代码实现的学习了解上。
OpenAI baselines项目中对于PPO算法有两个实现,分别位于ppo1和ppo2目录下。其中ppo2是利用GPU加速的,官方号称会快三倍左右,所以下面主要是看ppo2。对应论文为《ProximalPolicy OptimizationAlgorithms》,以下简称PPO论文。本文我们就以atari这个经典的DRL实验场景为例看一下大体流程。启动训练的命令在readme中有:
$ python3 -mbaselines.ppo2.run_atari
运行项目并下载源码
bash
1
工程塑料
许可项目:货物进出口;技术进出口;进出口代理。(依法须经批准的项目,经相关部门批准后方可开展经营活动,具体经营项目以相关部门批准文件或许可证件为准)一般项目:技术服务、技术开发、技术咨询、技术交流、技术转让、技术推广;化工产品销售(不含许可类化工产品);合成材料销售;橡胶制品销售;塑料制品销售;专用化学产品销售(不含危险化学品);新型催化材料及助剂销售;金属
上海创井塑胶科技有限公司专注于塑胶原料进出口。同美国杜邦。日本宝理。科思创沙伯基础等建立良好合作关系公司代理各厂商PA66.PPA.POM.ABS.PC.TPU.TPEE.等十余大类600余牌号塑胶原料产品广泛应用于汽车,电子,电器。电机,玩具,箱包等众多工业领域...