AI資格 G検定(予想問題) その1

問題 137 / 160

オフポリシーで行動価値関数を直接学習し次状態の最大値を用いて更新する手法はどれですか。

Q学習
SARSA
方策勾配法
モデル予測制御

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。