レポート一覧へ

AI / Technology

人のフィードバックで、言語モデルに指示への従い方を学ばせる

次単語予測と利用者意図の目的のずれ

図1 — 上段は文章としてもっともらしい続きを選ぶ目的、下段は利用者の意図に沿う目的。論文の概念を新しく図解したもの。

GPT-3の事前学習は、インターネット上の文章で「次に来るトークン」を当てるよう最適化する。しかし利用者が望むのは、依頼を理解し、役に立ち、事実を捏造せず、害を抑えた回答である。この二つは同じ目的ではない。モデルを大きくするだけでは、指示無視、もっともらしい作り話、有害・偏った文章が自然に消えるとは限らない。論文 §1

実演、順位付け、最適化からなるRLHFの流れ

図2 — 「実演 → 順位付け → 最適化」の役割分担。SFTが初期方策、報酬モデルが人の比較の代理、PPOが方策更新を担う。

約31,000件のラベルなしプロンプトに回答させ、報酬モデルのスコアが上がるようPPO(proximal policy optimization)でSFTモデルを更新する。報酬モデルの癖を極端に攻略しないよう、SFTモデルから離れすぎる回答にはKLペナルティをかける。さらにPPO-ptxでは事前学習データの更新も混ぜ、一般タスクの性能低下を抑えた。論文 §3.5・§4.2

少数のラベラーの判断と広い影響範囲

図3 — 学習信号を作る集団と、出力の影響を受ける人々は同じではない。「誰の好みか」を独立した設計問題として扱う必要がある。

RLHFは、人間一般の価値を自動発見する装置ではなく、集めた判断を増幅する仕組みと考えるほうが正確だ。製品では、誰が評価したか、意見の不一致をどう扱ったか、対象外の言語・文化・高リスク用途は何かを明示し、代表性の違う評価者による再評価やレッドチームを組み込む必要がある。これは論文結果から導く実務上の解釈であり、著者が万能な運用手順を実証したという意味ではない。

研究付録

原題: Training language models to follow instructions with human feedback
著者: Long Ouyang ほか19名(OpenAI)
公開: 2022年3月4日、arXiv:2203.02155
一次資料: arXiv概要 / 論文本文

要点

3つの持ち帰り

  1. 大きさより、目的の合わせ方が効いた。 人の実演と比較判断で調整した1.3BパラメータのInstructGPTが、人手評価では100倍超大きい175BのGPT-3より好まれた。論文 Abstract・§4.1
  2. 「良い答え」を直接書き尽くさず、順位から学ばせた。 実演で出発点を作り、複数回答の好みを報酬モデルに覚えさせ、その予測スコアをPPOで高める3段階である。論文 §3.1
  3. 整合したのは普遍的な人間の価値ではない。 主に英語話者の約40人のラベラー、研究者の指示、API利用者のプロンプトが作る特定の基準に近づいたにすぎず、安全性も未完成である。論文 §5.2–5.3

この論文の一文要約は、次単語予測で育ったGPT-3に、人が「こちらの回答のほうがよい」と示すフィードバックを追加し、実際の指示に沿う振る舞いへ調整した研究 である。最も強い結果はモデル規模を超えた人間の選好で、最大の宿題は、その「人間」が誰を指すのか、そして有害な指示にも従いやすい点にある。

問題

学習目標と利用者の目的のずれ

GPT-3の事前学習は、インターネット上の文章で「次に来るトークン」を当てるよう最適化する。しかし利用者が望むのは、依頼を理解し、役に立ち、事実を捏造せず、害を抑えた回答である。この二つは同じ目的ではない。モデルを大きくするだけでは、指示無視、もっともらしい作り話、有害・偏った文章が自然に消えるとは限らない。論文 §1

従来の指示学習との違い

当時のFLANやT0は、公開NLPタスクを自然言語の指示付きでまとめて学習し、未知タスクへの汎化を狙っていた。本研究は代わりに、初期版InstructGPTへ実際に送られたAPI Playgroundの依頼とラベラー作成プロンプトを使い、その分布上での人の好み を直接学習信号にした。著者らの実装では、同じAPIプロンプト分布でInstructGPTの対ベースライン勝率が73.4、T0版が26.8、FLAN版が29.8だった。ただし、これは各手法の一般的な優劣ではなく、この利用分布への適合度を示す比較である。論文 §1

方法

1. 実演から出発点を作る

まずラベラーが、プロンプトに対する望ましい回答例を書く。その約13,000件の学習プロンプトでGPT-3を教師あり微調整し、SFT(supervised fine-tuning)モデルを作る。これは「正解例をまねる」段階で、後の比較学習を始める足場になる。論文 §3.1–3.2

2. 比較から好みの採点器を作る

同じプロンプトに複数のモデル回答を出し、ラベラーが良い順に並べる。約33,000件の学習プロンプトから得た比較で、プロンプトと回答を受け取り1つのスコアを返す報酬モデル(RM)を訓練する。人がすべての良い答えを書く代わりに、候補間の相対判断を再利用できるのが要点だ。論文 §3.2・§3.5

3. 予測された好みを高める

約31,000件のラベルなしプロンプトに回答させ、報酬モデルのスコアが上がるようPPO(proximal policy optimization)でSFTモデルを更新する。報酬モデルの癖を極端に攻略しないよう、SFTモデルから離れすぎる回答にはKLペナルティをかける。さらにPPO-ptxでは事前学習データの更新も混ぜ、一般タスクの性能低下を抑えた。論文 §3.5・§4.2

証拠と限界

人手評価で見えた改善

評価は、訓練に含まれない顧客のプロンプトに対する回答をラベラーが比較する形が中心だった。論文が報告した主要値は次の通りである。

観点結果読み方
モデル規模をまたぐ比較1.3B InstructGPTが175B GPT-3より好まれた規模だけでなく微調整の目的が重要
175B同士InstructGPTがGPT-3より 85% ± 3% 好まれたAPIプロンプト分布での人手比較
few-shot GPT-3との比較InstructGPTが 71% ± 4% 好まれた丁寧なプロンプトだけでは差が残った
閉領域タスクの幻覚率InstructGPT 21%、GPT-3 41%入力外の情報を作る割合がほぼ半減
敬意ある指示を付けた毒性GPT-3より約 25% 少ない指示なし条件では改善が明確でない

出典: 論文 §1・§4.1–4.2。誤差は論文記載の95%信頼区間。TruthfulQAでは「真実かつ情報を含む回答」がGPT-3のおよそ2倍だった一方、WinogenderとCrowS-Pairsでは有意なバイアス改善がなかった。

何を証明していないか

この結果は、主にAPI Playground由来で96%以上が英語のプロンプト分布に強く結びついている。多言語やコードへの汎化は定性的な観察で、例は挙動を示すために選ばれており、広い性能保証ではない。公開NLPベンチマークではPPOだけだとSQuAD、DROP、HellaSwag、仏英翻訳などが悪化し、PPO-ptxで多くは緩和したものの、DROP、SQuADv2、翻訳ではGPT-3に届かなかった。論文 §4.2–4.3

さらに、約40人のラベラーは利用者全体を代表せず、比較の多くは費用上1人だけが付けた。モデルは事実を作り、有害・偏った内容を出し、誤った前提に合わせることもある。特に論文版の訓練方針では、有害な依頼でも「指示に従う」側を優先する場合があり、十分に安全なモデルを示した研究ではない。論文 §5.3–5.4

実務的な意味

モデルを大きくする前に、評価の輪を設計する

実務への示唆は、能力を増やすだけでなく、望む振る舞いを実演 → 比較 → 更新 → 再評価 の輪に落とすことだ。論文の計算量では、175B SFTが4.9、175B PPO-ptxが60 petaflops/s-daysで、GPT-3の事前学習3,640 petaflops/s-daysより小さい。ただし「安い」という結論は計算量だけでは決まらない。高品質な判断者の採用、指示設計、対立する価値判断の処理、継続監視にも費用がかかる。論文 §5.1

「誰に合わせたか」を製品仕様にする

RLHFは、人間一般の価値を自動発見する装置ではなく、集めた判断を増幅する仕組みと考えるほうが正確だ。製品では、誰が評価したか、意見の不一致をどう扱ったか、対象外の言語・文化・高リスク用途は何かを明示し、代表性の違う評価者による再評価やレッドチームを組み込む必要がある。これは論文結果から導く実務上の解釈であり、著者が万能な運用手順を実証したという意味ではない。

検証用メモ

  • データ: SFT 約13k、RM 33k、PPO 31kの学習プロンプト。API由来データはユーザーIDで分割し、訓練プロンプトから個人識別情報をフィルタした。論文 §3.2
  • モデル: GPT-3系の1.3B、6B、175B。報酬モデルは計算量と175B訓練の不安定さから6Bのみ。論文 §3.5
  • 主評価: 保留した顧客のAPIプロンプトに対する人間の選好。訓練用ラベラーとは別のラベラーでも予備評価したが、同じ委託元であり広い人口代表性は確認していない。論文 §3.4・§4.1
  • 確認すべき問い: 別言語・別文化・高リスク領域でも勝率は保たれるか。複数評価者が割れた例を平均化してよいか。報酬モデルを攻略する挙動は長期運用で増えないか。

この論文についての3つの重要な質問

人のフィードバックで、言語モデルに指示への従い方を学ばせるはどの課題を扱いますか?

この論文の一文要約は、次単語予測で育ったGPT-3に、人が「こちらの回答のほうがよい」と示すフィードバックを追加し、実際の指示に沿う振る舞いへ調整した研究 である。最も強い結果はモデル規模を超えた人間の選好で、最大の宿題は、その「人間」が誰を指すのか、そして有害な指示にも従いやすい点にある。

人のフィードバックで、言語モデルに指示への従い方を学ばせるの中心的な主張を支える根拠は何ですか?

当時のFLANやT0は、公開NLPタスクを自然言語の指示付きでまとめて学習し、未知タスクへの汎化を狙っていた。本研究は代わりに、初期版InstructGPTへ実際に送られたAPI Playgroundの依頼とラベラー作成プロンプトを使い、その分布上での人の好み を直接学習信号にした。著者らの実装では、同じAPIプロンプト分布でInstructGPTの対ベースライン勝率が73.4、T0版が26.8、FLAN版が29.8だった。ただし、これは各手法の一般的な優劣ではなく、この利用分布への適合度を示す比較である。論文 §1

人のフィードバックで、言語モデルに指示への従い方を学ばせるを読むときに注意すべき限界は何ですか?

評価は、訓練に含まれない顧客のプロンプトに対する回答をラベラーが比較する形が中心だった。論文が報告した主要値は次の通りである。

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード