AI資格 G検定(予想問題) その3

問題 97 / 160

連続行動空間に対するオフポリシーの深層強化学習アルゴリズムはどれか?

DDPG
DQN
PPO
A3C

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。