AI資格 G検定(予想問題) その9
通常
試験時間: 00:00問題時間: 00:00
問題一覧
問題 148 / 160
RLHF(人間のフィードバックを利用した強化学習)の説明として最も適切なのはどれか
①純粋な教師あり微調整で人間のラベルのみを学習する手法である
②人間の評価から報酬モデルを学習しその報酬で強化学習を行って出力を人間好みに調整する手法である
③事前学習段階で用いる自己教師あり学習の別名である
④トークン化アルゴリズムの一種である
RLHF(人間のフィードバックを利用した強化学習)の説明として最も適切なのはどれか
当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。