
DeepReinforcementLearning-DDPG-for-RoboticsControl:这是一项基于深度确定性策略梯度的研究
5星
- 浏览量: 0
- 大小:None
- 文件类型:ZIP
简介:
该算法是基于深度确定性策略梯度(DDPG)的深度强化学习方法,用于训练四自由度机械臂以实现目标位置控制。动作空间为连续变量,在此环境中,机器人将输出用于驱动机械臂执行任务的连续扭矩信号。
环境描述包含以下几部分:一个由20个完全相同的训练代理所组成的复杂系统,每个代理都独立拥有特定的环境配置。在这样的系统中,双臂能够自由度地定位目标位置。对于每一个动作阶段,当操作臂的手部准确到达目标位置时,将获得+0.1分奖励。任务要求在尽可能多的时间步数内保持手部位于目标位置。
观察空间由33个参数构成,涵盖手臂的位置、旋转角度及其运动速度等信息。每个动作被定义为四维向量,分别对应两个关节的驱动力矩控制。每一分量值应在-1至+1之间取整数值,以确保系统的稳定性运行。任务要求在每个情节结束后,所有训练代理的累计奖励总和须达到至少+30分。具体而言,在每个情节中,所有训练代理获得的即时奖励将被累加计算,作为评估该团队表现的重要指标。
全部评论 (0)
还没有任何评论哟~


