AI資格 G検定(予想問題) その4

問題 74 / 160

RLHFにおける報酬モデルの主な役割はどれか。

人間のフィードバックを数値化してモデル更新のための報酬信号を生成する
学習データを自動で増加させるデータ拡張手法
モデルの推論速度を最適化するためのハードウェア制御
事前学習で用いる大規模コーパスの収集

当サイトでは、ユーザー体験の向上を目的としてCookieを使用しています。サイトの利用を継続することで、Cookieの使用に同意したものとみなされます。