AI資格 G検定(予想問題) その2

問題 18 / 160

連続値アクション空間を対象とする強化学習で代表的に利用される手法はどれか

タブラ型のQ学習(離散アクション向け)
DDPGやSACのようなアクタークリティック系アルゴリズム
離散行動専用のSARSA
古典的なモンテカルロ木探索

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。