PC 奇美 PC-122U 奇美PC 全系列

报价
请来电询价
联系手机
15618935162
微信号
15618935162

OpenAI出品的baselines项目提供了一系列deep reinforcementlearning(DRL,深度强化学习或深度增强学习)算法的实现。现在已经有包括DQN,DDPG,TRPO,A2C,ACER,PPO在内的近十种经典算法实现,同时它也在不断扩充中。它为对DRL算法的复现验证和修改实验提供了很大的便利。本文主要走读其中的PPO(ProximalPolicyOptimization)算法的源码实现。PPO是2017年由OpenAI提出的一种DRL算法,它不仅有很好的performance(尤其是对于连续控制问题),同时相较于之前的TRPO方法更加易于实现。之前写过一篇杂文《深度增强学习(DRL)漫谈- xinlai域(TrustRegion)系方法》对其历史、原理及相关方法做了简单介绍,因此本文主要focus在代码实现的学习了解上。


OpenAI baselines项目中对于PPO算法有两个实现,分别位于ppo1和ppo2目录下。其中ppo2是利用GPU加速的,官方号称会快三倍左右,所以下面主要是看ppo2。对应论文为《ProximalPolicy OptimizationAlgorithms》,以下简称PPO论文。本文我们就以atari这个经典的DRL实验场景为例看一下大体流程。启动训练的命令在readme中有:


$ python3 -mbaselines.ppo2.run_atari

运行项目并下载源码

bash

1


关键词

PC , 奇美 , PC-122U , 奇美PC

更新时间
黄金会员
第6年
统一社会信用代码
91310114MA1GXDFB48
成立日期
2020年10月26日
法定代表人
唐海琴
注册资本
100

主营产品

工程塑料

经营范围

许可项目:货物进出口;技术进出口;进出口代理。(依法须经批准的项目,经相关部门批准后方可开展经营活动,具体经营项目以相关部门批准文件或许可证件为准)一般项目:技术服务、技术开发、技术咨询、技术交流、技术转让、技术推广;化工产品销售(不含许可类化工产品);合成材料销售;橡胶制品销售;塑料制品销售;专用化学产品销售(不含危险化学品);新型催化材料及助剂销售;金属

公司简介

上海创井塑胶科技有限公司专注于塑胶原料进出口。同美国杜邦。日本宝理。科思创沙伯基础等建立良好合作关系公司代理各厂商PA66.PPA.POM.ABS.PC.TPU.TPEE.等十余大类600余牌号塑胶原料产品广泛应用于汽车,电子,电器。电机,玩具,箱包等众多工业领域...

查看公司详情
手机15618935162拨打邮箱2228689173@qq.com邮件
业务员刘强
地址上海市嘉定区华江路129弄7号J4651室
我们其他产品
我们的新闻
微信
电话