レポート一覧へ

AI / Technology

人のフィードバックで、言語モデルに指示への従い方を学ばせる

この論文についての3つの重要な質問

人のフィードバックで、言語モデルに指示への従い方を学ばせるはどの課題を扱いますか?

この論文の一文要約は、次単語予測で育ったGPT-3に、人が「こちらの回答のほうがよい」と示すフィードバックを追加し、実際の指示に沿う振る舞いへ調整した研究 である。最も強い結果はモデル規模を超えた人間の選好で、最大の宿題は、その「人間」が誰を指すのか、そして有害な指示にも従いやすい点にある。

人のフィードバックで、言語モデルに指示への従い方を学ばせるの中心的な主張を支える根拠は何ですか?

当時のFLANやT0は、公開NLPタスクを自然言語の指示付きでまとめて学習し、未知タスクへの汎化を狙っていた。本研究は代わりに、初期版InstructGPTへ実際に送られたAPI Playgroundの依頼とラベラー作成プロンプトを使い、その分布上での人の好み を直接学習信号にした。著者らの実装では、同じAPIプロンプト分布でInstructGPTの対ベースライン勝率が73.4、T0版が26.8、FLAN版が29.8だった。ただし、これは各手法の一般的な優劣ではなく、この利用分布への適合度を示す比較である。論文 §1

人のフィードバックで、言語モデルに指示への従い方を学ばせるを読むときに注意すべき限界は何ですか?

評価は、訓練に含まれない顧客のプロンプトに対する回答をラベラーが比較する形が中心だった。論文が報告した主要値は次の通りである。

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード