AI資格 G検定(予想問題) その1
通常
試験時間: 00:00問題時間: 00:00
問題一覧
問題 137 / 160
オフポリシーで行動価値関数を直接学習し次状態の最大値を用いて更新する手法はどれですか。
①Q学習
②SARSA
③方策勾配法
④モデル予測制御
オフポリシーで行動価値関数を直接学習し次状態の最大値を用いて更新する手法はどれですか。
当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。