AI資格 G検定(予想問題) その4
通常
試験時間: 00:00問題時間: 00:00
問題一覧
問題 88 / 160
時刻tにおけるTD(0)アルゴリズムで価値関数を更新する際に用いるターゲットはどれか
①エピソード完了までの累積報酬の総和
②次状態における最大の行動価値のみ
③観測した報酬と割引された次状態の価値の和(bootstrapping)
④報酬の過去平均値
時刻tにおけるTD(0)アルゴリズムで価値関数を更新する際に用いるターゲットはどれか
当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。