NLHFとは
NLHFとは、人間の好みを使って、どの相手と比べても一貫して好まれやすい回答方針を学ばせる手法です。Nash Learning from Human Feedbackの略で、RLHFの報酬モデルが人間の好みを1本の点数に押し込めすぎる問題への別案として、2023年12月に公開されました。
英語表記:Nash Learning from Human Feedback(NLHF)
NLHFの考え方
一般的なRLHFでは、人間の選好から報酬モデルを作り、その点数が高くなるようにAIを調整する流れ。NLHFは、回答を単独で点数化するのではなく、2つの回答を比べたときの好まれ方をモデル化する設計です。その上で、どの競合方針と比べても選ばれやすい安定した方針を探す方法です。社内評価でいえば、特定の採点者だけに刺さる案ではなく、相手が変わっても負けにくい案を作る発想。
TopicNashはゲーム理論のナッシュ均衡に由来する
NLHFのNashは、数学者ジョン・ナッシュに由来するゲーム理論の「ナッシュ均衡」から来た名前。ナッシュ均衡は、参加者が互いの動きを踏まえると、誰か一人だけが勝手に動いて得しにくい釣り合いを指します。NLHFも同じ発想で、単に高得点を取る回答ではなく、比較相手が変わっても選ばれやすい方針を目指すものです。
NLHFに関するよくある質問
- NLHFはRLHFを置き換えるものですか?
- 研究上はRLHFの別案として提案されていますが、企業利用で直ちに標準手法が置き換わるという意味ではありません。報酬モデルで人間の好みを単純化しすぎる課題を考えるための重要な研究です。
- なぜゲーム理論がAI調整に出てくるのですか?
- 人間の好みは一つの絶対点ではなく、比較相手や状況で変わります。ゲーム理論の考え方を使うと、相手が変わっても崩れにくい回答方針を考えやすくなります。