AI資格 G検定(予想問題) その5

問題 136 / 160

連続アクションの探索を安定化させるために強化学習でよく用いられる手法はどれか

全ての行動をランダムに置き換える
非常に大きなノイズを常に加える
小さなガウスノイズなどを行動に加えて徐々に探索する
報酬を完全にゼロにして学習させる

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。