レポート一覧へ

AI / Technology

知識集約型NLPタスクのための検索拡張生成

質問を検索し、取得したWikipedia文章と質問を生成器へ渡して回答するRAGの流れ

図1|RAGの読み方。外部メモから文章を検索し、元の質問と合わせて生成器へ渡す。論文Figure 1を写したものではなく、§1–2に基づく新規の教育用図解。

この論文の変更点は、言語モデルの重みに埋め込まれた知識だけに頼らず、必要な文章をその場で検索してから答えを生成する、汎用的な学習方法を示したことだ。

RAG-Sequenceは文全体に同じ文書を使い、RAG-Tokenは単語ごとに文書を切り替えられる

図2|二つの確率モデルの違い。§2.1に基づく概念図。

RAG-Sequenceは一つの出力文全体を同じ取得文書で説明する。RAG-Tokenは出力する単語ごとに別の取得文書を重みづけできるため、複数文書の情報を組み合わせやすい。どちらが常に上という話ではなく、実験でも課題によって優位な型が異なった。(§2.1、§4、pp. 2–7)

古い索引を新しい索引へ差し替え、同じ生成器から更新後の回答を得る

図3|外部メモの差し替え。生成器の再学習なしで知識を更新する発想を示す。§4.5に基づく概念図。

この結果から実務へ引ける教訓は、更新される知識をすべてモデルへ再学習させる代わりに、検査・更新できる文書索引へ逃がせることだ。82人の世界の指導者を問う実験では、2016年索引は2016年の答えに 70%、2018年索引は2018年の答えに 68% 正解したが、年代を逆にすると 12%4% へ落ちた。これは、索引の差し替えが回答を更新できることを示す一方、回答が索引の鮮度に強く依存することも示している。(§4.5、pp. 7–8)

研究付録

原題: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
著者: Patrick Lewis ほか11名|発表: NeurIPS 2020|版: arXiv v4(2021年4月12日)
一次資料: arXiv:2005.11401|本文中のページ番号はPDF版に対応

要点

3つだけ覚えるなら

  1. RAGは「記憶だけで答える生成モデル」に、検索できる外部メモを足す。 質問に近いWikipediaの文章を取り出し、質問と一緒に生成器へ渡す。(論文 §1–2、pp. 1–3)
  2. 検索と生成を一つの目的で学習できる。 正解文書を直接教えなくても、最終回答が出やすくなるように質問側の検索器と生成器を調整する。(§2.4、pp. 3–4)
  3. 強みは知識を使う生成、弱みは知識源への依存。 2020年当時の実験では複数の質問応答・生成課題でBARTなどを上回ったが、検索元の誤りや偏りまで消えるわけではない。(§4、Broader Impact、pp. 5–9)

一文でいうと

この論文の変更点は、言語モデルの重みに埋め込まれた知識だけに頼らず、必要な文章をその場で検索してから答えを生成する、汎用的な学習方法を示したことだ。

問題

モデル内部の知識だけでは扱いにくいこと

大きな言語モデルは学習内容をパラメータに蓄えられる一方、その知識を後から直すこと、答えの根拠をたどること、必要な事実を正確に取り出すことが難しい。論文は、これを「閉じた本を思い出して答える」状態から、「関連ページを開いてから答える」状態へ変えようとする。(§1、pp. 1–2)

先行手法との境目

REALMやORQAも検索器とニューラルモデルを組み合わせていたが、主に文書内の答えを抜き出す質問応答を扱っていた。RAGは検索結果を自由な文章生成 につなぎ、質問応答だけでなく、事実検証や質問生成にも同じ枠組みを微調整できるようにした。(§1、§5、pp. 1–2, 8–9)

方法

検索して、合わせて、生成する

入力文をDPRの質問エンコーダーでベクトル化し、Wikipedia索引から内積が大きい上位K件の100語パッセージを探す。各パッセージを元の入力へ連結し、4億パラメータのBART-largeが出力を生成する。実験の外部メモは2018年12月版Wikipediaを約2,100万パッセージに分けたものだった。(§2.2–2.3、§3、pp. 3–4)

文書を隠れた候補としてまとめる

どの取得文書が正解を支えたかを教師データで直接指定せず、各文書の「検索されやすさ」と「その文書から正解を生成する確率」を合わせ、上位K件について足し合わせる。学習時は文書側エンコーダーと索引を固定し、質問側エンコーダーとBART生成器を更新した。(§2.1, §2.4、pp. 2–4)

RAG-SequenceとRAG-Token

RAG-Sequenceは一つの出力文全体を同じ取得文書で説明する。RAG-Tokenは出力する単語ごとに別の取得文書を重みづけできるため、複数文書の情報を組み合わせやすい。どちらが常に上という話ではなく、実験でも課題によって優位な型が異なった。(§2.1、§4、pp. 2–7)

証拠と限界

どこで良くなったか

オープンドメイン質問応答のExact Matchでは、RAG-SequenceがNatural Questions 44.5、WebQuestions 45.2、CuratedTrec 52.2 を記録し、比較表のDPRは順に 41.5、41.1、50.6 だった。TriviaQAは評価分割で値が変わり、標準側ではDPR 57.9 に対しRAG-Sequence 56.8、T5比較用Wiki側ではRAG-Sequence 68.0 だった。したがって「すべての表の列で最高」ではなく、論文の主張は4課題で当時の最高水準(TriviaQAはT5比較用分割)という限定つきで読む必要がある。(Table 1、§4.1、pp. 5–6)

Jeopardy質問生成では、452組の人手比較で「RAGのほうが事実的」が 42.7%、「BARTのほうが事実的」が 7.1%。一方、評価に多数決がつかなかった例も 20.8% あった。FEVERでは、取得上位1件が正解根拠の記事と一致した割合が 71%、上位10記事内では 90% だった。(Table 4、§4.3–4.4、pp. 5–7)

何を証明していないか

  • 使用した知識源は固定されたWikipediaであり、ウェブ全体や社内文書、医療などで同じ品質になるとは示していない。
  • 検索結果が正しい、完全、公平である保証はない。著者自身も外部知識源の誤りと偏り、誤情報・なりすまし・スパムへの悪用を挙げている。(Broader Impact、p. 9)
  • 「幻覚がなくなる」とは証明していない。人手評価は特定のJeopardy生成課題での比較であり、全用途へ一般化できない。
  • コストも残る。元のWikipedia索引はCPUメモリ約 100GB、圧縮版でも 36GB を要し、取得件数を増やすと実行時間との交換条件が生じる。(Appendix C、p. 17;§4.5、p. 8)

実務的な意味

使いどころ

この結果から実務へ引ける教訓は、更新される知識をすべてモデルへ再学習させる代わりに、検査・更新できる文書索引へ逃がせることだ。82人の世界の指導者を問う実験では、2016年索引は2016年の答えに 70%、2018年索引は2018年の答えに 68% 正解したが、年代を逆にすると 12%4% へ落ちた。これは、索引の差し替えが回答を更新できることを示す一方、回答が索引の鮮度に強く依存することも示している。(§4.5、pp. 7–8)

導入前に確かめたいこと

実装判断では、生成モデルの大きさより先に、検索対象の品質、更新頻度、アクセス権、検索失敗時の挙動、取得文書を利用者へ見せられるかを確認したい。この論文が直接示したのは「検索を生成と一緒に最適化すると、2020年当時の複数ベンチマークで有効だった」ことまでであり、引用の正確さ、機密情報の分離、最新性の保証は別途設計と評価が必要である。

用語と検証メモ

  • パラメトリック記憶: BARTの重みに埋め込まれた知識。更新には通常、再学習が絡む。
  • ノンパラメトリック記憶: 人が読んだり差し替えたりできる文書索引。
  • 周辺化: 取得文書を一つに決め打ちせず、複数候補からの生成確率を検索確率で重みづけして足すこと。
  • 未解決の確認事項: 現代のより大きな生成器・異なる検索器・非Wikipedia知識源でも、同じ比較条件で利点とコストが保たれるか。

この論文についての3つの重要な質問

知識集約型NLPタスクのための検索拡張生成はどの課題を扱いますか?

RAG-Sequenceは一つの出力文全体を同じ取得文書で説明する。RAG-Tokenは出力する単語ごとに別の取得文書を重みづけできるため、複数文書の情報を組み合わせやすい。どちらが常に上という話ではなく、実験でも課題によって優位な型が異なった。(§2.1、§4、pp. 2–7)

知識集約型NLPタスクのための検索拡張生成の中心的な主張を支える根拠は何ですか?

Jeopardy質問生成では、452組の人手比較で「RAGのほうが事実的」が 42.7%、「BARTのほうが事実的」が 7.1%。一方、評価に多数決がつかなかった例も 20.8% あった。FEVERでは、取得上位1件が正解根拠の記事と一致した割合が 71%、上位10記事内では 90% だった。(Table 4、§4.3–4.4、pp. 5–7)

知識集約型NLPタスクのための検索拡張生成を読むときに注意すべき限界は何ですか?

オープンドメイン質問応答のExact Matchでは、RAG-SequenceがNatural Questions 44.5、WebQuestions 45.2、CuratedTrec 52.2 を記録し、比較表のDPRは順に 41.5、41.1、50.6 だった。TriviaQAは評価分割で値が変わり、標準側ではDPR 57.9 に対しRAG-Sequence 56.8、T5比較用Wiki側ではRAG-Sequence 68.0 だった。したがって「すべての表の列で最高」ではなく、論文の主張は4課題で当時の最高水準(TriviaQAはT5比較用分割)という限定つきで読む必要がある。(Table 1、§4.1、pp. 5–6)

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード