AI資格 G検定(予想問題) その7

問題 31 / 160

オフポリシー学習の代表的な強化学習アルゴリズムはどれか。

REINFORCE
SARSA
Q-learning
モンテカルロ方策評価

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。