AI資格 G検定(予想問題) その5

問題 91 / 160

オフライン評価で用いられる手法として誤っているものはどれか。

重要度サンプリングを使ってオフポリシーの期待報酬を推定する
モデルベースで環境を学習しその上で方策を評価する
単純にログ上で方策を直接試すことが常に可能である
保守的評価や下限推定を導入して過大評価を抑える

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。