RLHF (rlhf)

RLHFは、Reinforcement Learning from Human Feedback の略で、人間の評価や修正を使ってモデルの振る舞いを調整する訓練手法。動画では、事前訓練済みの言語モデルを、単なるテキスト補完機械から有用なAIアシスタントへ近づけるための追加訓練として説明される。

人間が役に立たない出力や問題のある出力にフィードバックを与え、その結果に基づいてモデルのパラメーターがさらに変更される。これにより、ユーザーが好む応答や安全で有用な応答を出しやすくなる。