CQL(Conservative Q-Learning)是一种增强学习方法,旨在通过限制策略更新来提高算法稳定性。此源码实现了该算法的核心功能,适用于研究和实验。
在本存储库中提供了CQL(保守Q学习)算法的代码,该代码基于相关论文中的描述。我们为两个不同的实验场景提供两组独立的代码:一个用于Atari游戏环境下的实验,在atari目录下;另一个则针对D4RL数据集进行研究,在d4rl目录内。
鉴于新版本D4RL中包含的数据集有所变更,预计CQL算法在这些更新后的数据集中表现可能会有所不同。因此我们将持续在此自述文件里更新新的性能指标表,并及时反映最新的实验结果和改进情况。
如果我们的存储库对您的学术研究有所帮助,请引用以下参考文献:
@article{kumar2020conservative, author = {Aviral Kumar and Aurick Zhou and George Tucker and Sergey Levine}, title = {Conservative Q-Learning for Offline Reinforcement Learning}