重要なAI論文を図解でわかりやすく

要約だけでなく、手法・根拠・限界まで理解する

公開可能な論文PDFのみ(最大25MB)
日本語のサンプルを見る

日本語で読める研究論文

AI / Technology / 日本語

深層畳み込みニューラルネットワークによるImageNet分類

Alex Krizhevsky、Ilya Sutskever、Geoffrey E. Hinton(NeurIPS 2012)

proceedings.neurips.cc2026/7/19
RGB画像から5つの畳み込み層、3つの全結合層を通って1000クラスへ進む情報の流れ
RGB画像から5つの畳み込み層、3つの全結合層を通って1000クラスへ進む情報の流れ
AI / Technology / 日本語

視覚指示チューニング

原題: Visual Instruction Tuning · 著者: Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee · 公開: arXiv:2304.08485v2(2023年12月11日改訂)/NeurIPS 2023 Oral · 一次資料: arXiv概要 ・ 論文本文

arXiv 2304.084852026/7/19
画像注釈を3種類の指示応答データへ変換する流れ
画像注釈を3種類の指示応答データへ変換する流れ
AI / Technology / 日本語

何でも切り出す

原題: Segment Anything 著者: Alexander Kirillov ほか(Meta AI Research, FAIR) 公開: 2023年4月5日、arXiv:2304.02643 一次資料: arXiv抄録 / 論文本文

arXiv 2304.026432026/7/19
1点が部分・物体・全体のどれを指すかは曖昧であり、SAMは複数候補で扱う
1点が部分・物体・全体のどれを指すかは曖昧であり、SAMは複数候補で扱う
AI / Technology / 日本語

ReAct:言語モデルで推論と行動を協調させる

原題: ReAct: Synergizing Reasoning and Acting in Language Models · 著者: Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao · 公開: arXiv:2210.03629 v3(2023年3月10日、ICLR camera-ready版) · 一次資料: arXiv抄録ページ · [論文全文](htt

arXiv 2210.036292026/7/19
標準、推論のみ、行動のみ、ReActの比較
標準、推論のみ、行動のみ、ReActの比較
AI / Technology / 日本語

計算予算に対して、モデルを大きくするより学習を十分に行うべきかを調べた研究

原題: Training Compute-Optimal Large Language Models · Jordan Hoffmann ほか, 2022 — arXiv:2203.15556

arXiv 2203.155562026/7/19
同じ学習計算量を、巨大なモデルと少ないデータに振る場合、より小さなモデルと多いデータに振る場合の比較
同じ学習計算量を、巨大なモデルと少ないデータに振る場合、より小さなモデルと多いデータに振る場合の比較
AI / Technology / 日本語

思考の連鎖プロンプティングは大規模言語モデルから推論を引き出す

原題: Chain-of-Thought Prompting Elicits Reasoning in Large Language Models · 著者: Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc V. Le, Denny Zhou · 発表: NeurIPS 2022 / arXiv:2201.11903v6 · 一次ソース: [arXiv 論文ページ](https://arxiv.org/abs/2201.

arXiv 2201.119032026/7/19
標準プロンプトは答えへ直行する一方、CoTプロンプトは途中ステップを例と出力に含める
標準プロンプトは答えへ直行する一方、CoTプロンプトは途中ステップを例と出力に含める
AI / Technology / 日本語

人のフィードバックで、言語モデルに指示への従い方を学ばせる

原題: Training language models to follow instructions with human feedback · 著者: Long Ouyang ほか19名(OpenAI) · 公開: 2022年3月4日、arXiv:2203.02155 · 一次資料: arXiv概要 / 論文本文

arXiv 2203.021552026/7/19
次単語予測と利用者意図の目的のずれ
次単語予測と利用者意図の目的のずれ
AI / Technology / 日本語

潜在拡散モデルによる高解像度画像生成

原題: High-Resolution Image Synthesis with Latent Diffusion Models · 著者: Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer · 発表: CVPR 2022 / arXiv:2112.10752(v2, 2022-04-13)

arXiv 2112.107522026/7/19
画素空間では大きな格子を何度も処理する一方、潜在空間では小さな表現上で反復し、最後に復号する比較図
画素空間では大きな格子を何度も処理する一方、潜在空間では小さな表現上で反復し、最後に復号する比較図
AI / Technology / 日本語

LoRA:大規模言語モデルを低ランク更新で適応する

原題: LoRA: Low-Rank Adaptation of Large Language Models · 著者: Edward J. Hu ほか 7名 · Microsoft Corporation · 公開: arXiv:2106.09685 v2(2021年10月16日) · 一次資料: arXiv abstract · 論文全文

arXiv 2106.096852026/7/19
全体微調整ではモデル全体を複製する一方、LoRAでは共有モデルに小さなタスク差分を付ける
全体微調整ではモデル全体を複製する一方、LoRAでは共有モデルに小さなタスク差分を付ける
AI / Technology / 日本語

自然言語による教師信号から、転用できる視覚モデルを学ぶ

原題: Learning Transferable Visual Models From Natural Language Supervision · 著者: Alec Radford, Jong Wook Kim, Chris Hallacy ほか(OpenAI) · 公開: arXiv:2103.00020、2021年2月26日 · 一次資料: 論文ページ / PDF

arXiv 2103.000202026/7/19
固定ラベル方式とCLIPの違い
固定ラベル方式とCLIPの違い
AI / Technology / 日本語

ノイズから画像を取り戻す拡散確率モデル

原題: Denoising Diffusion Probabilistic Models · 著者: Jonathan Ho, Ajay Jain, Pieter Abbeel · 発表: NeurIPS 2020 / arXiv:2006.11239v2 · 一次資料: arXiv 概要 · 論文 PDF

arXiv 2006.112392026/7/19
元画像にノイズを加える順過程と、ノイズから画像を復元する逆過程
元画像にノイズを加える順過程と、ノイズから画像を復元する逆過程
AI / Technology / 日本語

1枚の画像は16×16の言葉に値する:大規模画像認識のためのTransformer

原題: An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale · 著者: Alexey Dosovitskiy ほか(ICLR 2021) · 一次資料: arXiv:2010.11929 v2 ・ 論文PDF

arXiv 2010.119292026/7/19
注目の論文画像をパッチ列に変えて分類する流れ
画像をパッチ列に変えて分類する流れ
AI / Technology / 日本語

知識集約型NLPタスクのための検索拡張生成

原題: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks · 著者: Patrick Lewis ほか11名|発表: NeurIPS 2020|版: arXiv v4(2021年4月12日) · 一次資料: arXiv:2005.11401|本文中のページ番号はPDF版に対応

arXiv 2005.114012026/7/19
質問を検索し、取得したWikipedia文章と質問を生成器へ渡して回答するRAGの流れ
質問を検索し、取得したWikipedia文章と質問を生成器へ渡して回答するRAGの流れ
AI / Technology / 日本語

ニューラル言語モデルのスケーリング則

原題: Scaling Laws for Neural Language Models · 著者: Jared Kaplan, Sam McCandlish, Tom Henighan ほか(2020) · 一次資料: arXiv:2001.08361 / 本文 · 対象: 自己回帰型言語モデルの交差エントロピー損失(単位は nat。低いほど次のトークンを予測しやすい)

arXiv 2001.083612026/7/19
モデル規模・データ量・計算量を増やすと、他がボトルネックでない範囲で損失が下がるという概念図
モデル規模・データ量・計算量を増やすと、他がボトルネックでない範囲で損失が下がるという概念図
AI / Technology / 日本語

言語モデルは少数例から学べる

原題: Language Models are Few-Shot Learners · 著者: Tom B. Brown ほか(OpenAI) · 公開: arXiv:2005.14165v4、2020年7月22日 · 一次資料: arXiv概要・論文PDF

arXiv 2005.141652026/7/19
微調整と文脈内学習の違い
微調整と文脈内学習の違い
AI / Technology / 日本語

BERT:深い双方向Transformerの事前学習による言語理解

原題: BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding · 著者: Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova · 一次資料: arXiv:1810.04805(v2, 2019-05-24) / PDF · ひとことで:

arXiv 1810.048052026/7/19
一方向・別々の双方向・BERTの深い双方向を比べる模式図
一方向・別々の双方向・BERTの深い双方向を比べる模式図
AI / Technology / 日本語

注意機構だけで十分

原題: Attention Is All You Need · 著者: Ashish Vaswani ほか|公開: arXiv:1706.03762(初版 2017年6月12日、参照版 v7)|一次資料: arXiv 要旨・論文全文

arXiv 1706.037622026/7/19
RNNの逐次処理とSelf-Attentionの並列比較
RNNの逐次処理とSelf-Attentionの並列比較
AI / Technology / 日本語

Residual 学習で、深すぎるネットワークの学習を通しやすくする

Kaiming He、Xiangyu Zhang、Shaoqing Ren、Jian Sun による Deep Residual Learning for Image Recognition(2015年)。画像認識を題材に、層を増やすほど訓練しにくくなる問題へ「入力を近道で残し、必要な差分だけを学ぶ」という答えを示した論文です。 出典: arXiv:1512.03385 / 論文PDF

arXiv 1512.033852026/7/19
浅い Plain network と深い Plain network の最適化の違いを示す概念図
浅い Plain network と深い Plain network の最適化の違いを示す概念図
AI / Technology / 日本語

敵対的に学ぶ生成モデルの基本枠組み

Ian Goodfellow らの Generative Adversarial Nets(2014)を、仕組み・証拠・限界の順に読み解く。

arXiv 1406.26612026/7/19
注目の論文GANの基本ループ。乱数から生成例を作り、実データとともに識別器へ渡し、その学習信号を生成器へ返す。
GANの基本ループ。乱数から生成例を作り、実データとともに識別器へ渡し、その学習信号を生成器へ返す。
AI / Technology / 日本語

連続潜在変数をもつ生成モデルを速く学習する方法

Diederik P. Kingma と Max Wellingによるこの論文は、連続潜在変数をもつ生成モデルを、通常の確率的勾配法でまとめて学習できる形にした。現在「変分オートエンコーダー(VAE)」と呼ばれる方法の出発点である。正式題名・著者・版情報は arXiv:1312.6114 で確認できる。

arXiv 1312.61142026/7/19
従来の反復推論とAEVBの共有エンコーダーの比較
従来の反復推論とAEVBの共有エンコーダーの比較

FAQ

AI論文の図解に関するよくある質問

一般的なAI論文要約ツールとの違いは?

要旨と結論を短くするだけでなく、手法の仕組み、証拠の強さ、比較実験、限界、実際の意味をオリジナル図解とともに説明します。

どの論文リンクを使えますか?

arXivの要旨ページ、公開論文ページ、PDFの直接リンクを検索できます。既存レポートはすぐに開き、未作成の言語版はログイン後に生成できます。

対応言語は?

公開ライブラリは中国語、英語、日本語が中心です。生成フローはスペイン語にも対応しています。