AI資格 G検定(予想問題) その9

問題 148 / 160

RLHF(人間のフィードバックを利用した強化学習)の説明として最も適切なのはどれか

純粋な教師あり微調整で人間のラベルのみを学習する手法である
人間の評価から報酬モデルを学習しその報酬で強化学習を行って出力を人間好みに調整する手法である
事前学習段階で用いる自己教師あり学習の別名である
トークン化アルゴリズムの一種である

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。