PaperBridge独自の証拠索引
重要なAI論文8本が実際に示したこと
人気ランキングでも、要旨をさらに短くした一覧でもありません。よく語られる主張、原論文が直接報告した結果、その証拠が届かない範囲を並べ、後の影響を当時の実験結果と混同しないための索引です。
PaperBridge Editorial·
この索引での証拠の扱い
各項目は原論文が直接報告した実験、指標、条件に限定します。限界を書くのは論文を否定するためではなく、後の製品能力、歴史的影響、宣伝表現を原論文の証明へ逆投影しないためです。PaperBridgeは実験を再現していないため、研究や製品判断では原論文も確認してください。
- よくある主張
- Transformerは、注意機構が従来のすべての系列モデルを置き換えられると証明した。
- 原論文の直接的な証拠
- 論文はWMT 2014の英独翻訳で28.4 BLEU、英仏翻訳で41.8 BLEUを報告し、再帰モデルより並列化しやすい学習構造を示しました。
- 証拠の限界
- 直接示されたのは機械翻訳における注意ベースの系列変換です。後のLLM能力すべてや、再帰・畳み込みが全タスクで不要だという結論までは証明していません。
- よくある主張
- BERTは、事前学習モデルがそのまま言語を理解できると証明した。
- 原論文の直接的な証拠
- 双方向事前学習とタスク別微調整により、11のNLPタスクで結果を更新しました。要旨ではGLUE 80.5%、MultiNLI 86.7%、SQuAD v1.1でF1 93.2、v2.0で83.1を報告しています。
- 証拠の限界
- 根拠は当時の英語ベンチマークと教師あり微調整です。一般的な言語理解、生成品質、事実性、多言語性能までは検証していません。
- よくある主張
- GPT-3は、モデルを十分に大きくすれば学習データや微調整が不要になると証明した。
- 原論文の直接的な証拠
- 1750億パラメータの自己回帰モデルが、重みを更新せずにゼロ・ワン・少数例のプロンプトで多様な課題を実行し、規模とともに文脈内学習が概ね向上しました。
- 証拠の限界
- 論文自身が失敗、偏り、不安定性を報告し、多くの課題で専用微調整モデルに及びませんでした。示したのはプロンプトによる適応であり、データや学習、専用モデルが不要ということではありません。
- よくある主張
- RAGはハルシネーションを防ぎ、必ず信頼できる引用を返す。
- 原論文の直接的な証拠
- 原論文は事前学習済み生成器とWikipediaの密検索を組み合わせ、3つのオープンドメインQAで当時最高の結果を報告し、パラメータ記憶のみの基準より具体的・多様・事実的な文章を生成しました。
- 証拠の限界
- 検索が知識集約型課題に役立つことは示しましたが、正しい検索、証拠への忠実性、検証可能な引用は保証しません。権限、古い情報、実運用の遅延も検証範囲外です。
- よくある主張
- DDPM論文が現在のtext-to-imageシステムを完成させた。
- 原論文の直接的な証拠
- 段階的なノイズ付加と逆向きノイズ除去を高品質な画像生成へ結びつけ、無条件CIFAR-10でInception Score 9.46、FID 3.17を報告し、256×256のLSUNサンプルを示しました。
- 証拠の限界
- 示したのは無条件拡散生成の品質です。現在のテキスト条件、潜在空間拡散、実運用システムまでは提案しておらず、元の生成には多数の除去stepが必要でした。
- よくある主張
- ViTは畳み込みネットワークが時代遅れだと証明した。
- 原論文の直接的な証拠
- 画像パッチをtoken列として標準Transformerへ入力し、大規模事前学習後に複数の画像分類で当時の畳み込み網と同等以上の結果を、より少ない学習計算で示しました。
- 証拠の限界
- 優位性は大規模事前学習と論文のデータ条件に依存します。Transformerが視覚の骨格になれることは示しましたが、小規模データや効率、他の視覚課題で畳み込みが無価値とは示していません。
- よくある主張
- LoRAはほぼ無コストで常に全パラメータ微調整と同じ性能になる。
- 原論文の直接的な証拠
- 事前学習済み重みを固定し低ランク更新だけを学習しました。GPT-3 175Bでは学習パラメータを最大約1万分の1、GPUメモリを約3分の1にし、評価したモデルと課題で同等以上の品質を報告しました。
- 証拠の限界
- 低ランク仮定、rank、対象層、課題、データに依存します。検証条件での効率的適応を示したもので、すべての場面で全微調整と同等になる保証ではありません。
- よくある主張
- RLHFによって言語モデルは安全・真実・すべての人間価値に整合した。
- 原論文の直接的な証拠
- デモ、選好順位、強化学習でInstructGPTを学習しました。論文のプロンプト分布と評価者集団では、13億モデルの出力が1750億GPT-3より全体として好まれ、真実性、毒性、指示追従の複数指標が改善しました。
- 証拠の限界
- 選好は特定の評価者と課題分布に由来し、指標はあらゆる害・事実・価値対立を網羅しません。有効な指示整合手順を示したのであり、完全な安全や普遍的価値整合ではありません。
FAQ
AI論文の証拠に関するFAQ
AI論文の直接的な証拠とは何ですか?
明示されたデータ、基準、指標、実験条件の下で論文が報告した結果です。後の製品成功や引用、業界への影響は重要ですが、原論文が直接検証した結果とは限りません。
なぜ証拠の限界を分けて書くのですか?
論文の結論は広い主張として伝わりやすいためです。実験で支持された範囲、著者の解釈、後の推論を分けることで、一つのベンチマークや歴史的影響を普遍的証明として扱う誤りを減らします。
この索引は原論文の代わりになりますか?
なりません。精読する価値と確認点を素早く判断するための入口です。再現、研究、高リスク判断では原文、付録、コード、独立した追試が必要です。