AI 论文图解,一分钟读懂关键研究

用人话解释方法、证据和局限,而不只给一段摘要

仅上传可公开分享的论文 PDF(最大 25MB)
看一份中文样稿
AI / Technology / 中文

DeepSeek-Prover-V2:子目标分解怎样把数学直觉变成可验证证明

DeepSeek-V3 先把困难定理拆成形式子目标,7B 证明器递归填完局部证明,Lean 再把成功结果变成冷启动数据和强化学习奖励。

arXiv 2504.218012026/7/28
自然语言推理可以跳步,形式证明要求每一步都通过验证
算出答案和交出证明,中间隔着一台不接受省略的机器
AI / Technology / 中文

Kimi K3:开放前沿智能

Kimi K3 同时重做序列、深度、宽度与任务状态通路;这份深度解读逐步拆开 KDA、AttnRes、Stable LatentMoE、长上下文训练和可恢复智能体系统。

arXiv 2607.246532026/7/28
Kimi K3 分别处理序列、深度、宽度和任务时长
Kimi K3 同时扩了四条轴,不能压成一句“信息流更好”
AI / Technology / 中文

ZeRO 真正在做什么:长期分开存,计算时临时拼齐

用分布式系统的话说,ZeRO 把训练从“每张 GPU 都复制完整状态”,改成“状态分片保存,需要计算当前层时再临时物化”。它解决的是状态管理问题,不是让模型换一种学习方法。

arXiv 1910.020542026/7/27
四张 GPU 的最小例子:标准数据并行在每张卡保存 A、B、C、D 四块完整状态;ZeRO 让四张卡各自长期保存一块。
四张 GPU,不该长期保存四份完整训练状态
Robotics / NVIDIA / 中文

PLD:机器人基础模型怎样主动找到失败区域,再把修正经验学回自己?

官方标题:Self-Improving Vision-Language-Action Models with Data Generation via Residual RL · 作者:Wenli Xiao 等|ICLR 2026 论文|arXiv:2511.00091

arXiv 2511.000912026/7/26
冻结的通才模型会走进自己的失败区域
冻结的通才模型会走进自己的失败区域
Robotics / NVIDIA / 中文

DreamDojo:从大规模人类视频学会预演机器人动作

官方英文标题: DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos · 论文: arXiv:2602.06949 · 发表状态: ICML 2026 Spotlight

arXiv 2602.069492026/7/26
三类人类视频汇成大规模预训练数据
三类人类视频汇成大规模预训练数据
Robotics / NVIDIA / 中文

FLARE:让机器人不必画出未来,也能学会“先想后做”

官方题名: FLARE: Robot Learning with Implicit World Modeling · 作者: Ruijie Zheng 等|发表: 第 9 届机器人学习会议(CoRL 2025)|论文: arXiv:2505.15659

arXiv 2505.156592026/7/26
完整画面预测与任务线索压缩的对比
完整画面预测与任务线索压缩的对比
Robotics / NVIDIA / 中文

DreamGen:视频世界模型如何批量“梦出”机器人训练轨迹

官方标题: DreamGen: Unlocking Generalization in Robot Learning through Video World Models · 作者: Joel Jang 等 · 发表: CoRL 2025(第 9 届机器人学习大会)· 论文: arXiv:2505.12705 · 会议论文集

arXiv 2505.127052026/7/26
近期热门一小批真实示范是整条流水线的锚点
一小批真实示范是整条流水线的锚点
Robotics / NVIDIA / 中文

GR00T N1:一个面向通用人形机器人的开放基础模型

官方英文标题:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots · NVIDIA 技术报告,arXiv:2503.14734(v2,2025-03-27)。这是一份 arXiv 技术报告,不是已同行评审的顶会论文。 · 主来源:arXiv 摘要页 · 论文 HTML 全文

arXiv 2503.147342026/7/26
四类经验不是等价替代,而是分工互补
四类经验不是等价替代,而是分工互补
Robotics / Humanoid / 中文

HOVER:面向人形机器人的多功能神经全身控制器

官方英文标题:HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots · Tairan He 等,ICRA 2025;arXiv:2410.21229,本文依据 2025-03-06 的 v2。

arXiv 2410.212292026/7/26
人体动作先变成 H1 可执行的训练姿势
人体动作先变成 H1 可执行的训练姿势
Robotics / Humanoid / 中文

OmniH2O:从头和双手的轨迹,补出人形机器人的全身动作

官方标题:OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning · 论文:arXiv:2406.08858|作者:Tairan He 等|提交日期:2024-06-13

arXiv 2406.088582026/7/26
人类动作先被改造成 H1 可执行的训练动作
人类动作先被改造成 H1 可执行的训练动作
AI / Technology / 中文

三维 Kakeya 集的体积下界与管并集几乎最大体积

这篇论文研究:在三维空间里,一批很细的“管”如果方向分散、又不太能挤在一起,它们合起来到底能占多大体积。作者给出的核心结论是:在合适的非聚集条件下,这种并集的体积几乎达到最大;进一步,这个体积估计足以推出 ℝ^3 中 Kakeya 集的 Minkowski 维数和 Hausdorff 维数都等于 3。

arXiv 2502.176552026/7/24
白底信息图:多根细长蓝灰管在平面和三维空间中朝不同方向散开,左侧挤在一起形成较小占据区,右侧分散后铺满更大区域,箭头表示方向分散导致并集体积上升。
细管分散后为何体积会被迫变大
AI / Technology / 中文

MAGI-1:按视频块自回归生成的流式视频模型

这篇论文提出一种把视频按固定长度“块”来生成的方法:先生成前一块,再生成后一块,让视频可以边出边看,同时尽量不让后面的计算随着视频变长而暴涨。它的核心想法不是一次性处理整段视频,而是让时间顺序本身变成生成过程的一部分。

arXiv 2505.132112026/7/24
白色画布上的科研说明图:一条向右推进的视频时间轴被分成多个等长块,前面的块已经点亮并锁定,后面的块依次生成;右上角显示最多并行处理4个块的窄条队列。
按时间块前进的生成队列
AI / Technology / 中文

GAIA-2:面向自动驾驶的可控多视角生成式世界模型

官方题名: GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving · 作者: Lloyd Russell、Anthony Hu、Lorenzo Bertoni、George Fedoseev、Jamie Shotton、Elahe Arani、Gianluca Corrado · 来源: arXiv:2503.20523,2025-03-26 提交,Technical Report >

arXiv 2503.205232026/7/24
普通视频生成与自动驾驶世界模型的要求对比
普通视频生成与自动驾驶世界模型的要求对比
AI / Technology / 中文

LDA-1B:把异构具身数据统一成可训练的世界模型

这篇论文想解决的,不是单纯让机器人学会一个动作,而是让它从大量形态不同、质量不一的具身数据里,一起学到动作、动力学和未来画面。作者把这个方向做成了一个 1B 参数的统一训练系统,并配套整理了 EI-30k 数据集。

arXiv 2602.122152026/7/23
白色画布上的信息图:左侧有三类具身数据卡片,分别标注“高质示范”“低质轨迹”“仿真/第一人称视频”,它们通过三条蓝色箭头汇入中间的统一入口;入口右侧分成两条通道,一条写“物体变化”,另一条写“画面外观”,并用对比方式说明直接在像素里预测会把两者混在一起,造成训练更慢、更难扩展。
把碎片数据放进同一个入口
AI / Technology / 中文

ContentV:在256个64GB NPU上训练的8B文生视频模型

这篇论文提出 ContentV:一个基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型,目标是在算力受限但又要追求高质量的条件下,把长视频训练做得更稳、更省、更可复用。

arXiv 2506.053432026/7/23
白底信息图:左边是单张图像生成模块,右边是视频生成模块,视频模块旁边堆着更长的时间轴、更高分辨率和更大的显存负担,下面还有低质量重复视频样本把结果拉低的提示。
两阶段旧路为什么卡住
AI / Technology / 中文

用统一分类法梳理世界模型:架构、方法、推理与应用

这篇综述要解决的不是“某一个模型做得多好”,而是“世界模型这个领域到底在讲什么、怎么分、怎么比、能用到哪里”。作者把分散在强化学习、机器人、自动驾驶、视频生成和科学建模里的工作放到同一张地图上,试图补上一个统一框架。

arXiv 2606.001332026/7/23
一张白底信息图,展示世界模型研究分散在强化学习、机器人、自动驾驶、视频生成、科学建模、医学影像、教育测量和金融等多个圆形区域,中间有一个空白的统一框架位置,旁边用箭头指向四个分类轴:架构、方法族、推理策略、应用领域。
为什么世界模型需要统一框架
AI / Technology / 中文

二维 β-plane 上喷流—涡旋分解的全局良定性

这篇文章研究的是:在一个周期平面上,二维不可压流体如果带有“平均喷流”和“涡旋扰动”两部分,初值给定后,解会不会一直存在、会不会只有一个、会不会对初值的微小变化保持稳定。作者在 β-plane 近似下,把原始涡度方程改写成这两部分耦合的方程组,并证明在初值具有 (H^s) 正则性、(s\ge 0) 时,可以得到唯一的全局解。

arXiv 2303.000232026/7/22
白底科学示意图,二维周期方形区域中,一条较平滑的平均西风带与叠加其上的小尺度涡旋扰动同时存在,右侧标出 β-plane 的纬向变化,箭头表示扰动与平均流相互作用。
周期盒上的涡旋—平均流耦合问题
AI / Technology / 中文

ISO:把 RLVR 训练改写成“固定谱、优化奇异帧”

这篇论文在问一个很具体的问题:强化学习式后训练(RLVR)到底是在改模型的哪一部分。作者发现,很多 RLVR 检查点和基座模型在“奇异值谱”上非常接近,真正承载变化的,更多是两侧的奇异帧(singular frames)。

arXiv 2607.193312026/7/22
近期热门白底科研示意图,展示一个基座模型经过 RLVR 后形成的权重矩阵,矩阵被分解为奇异值和两个奇异帧,旁边用箭头说明奖励反馈写入模型时,作者关注的是哪些部分保持不变、哪些部分改变。
为什么 RLVR 优化层值得重看
AI / Technology / 中文

OpenAI Gym:把强化学习任务装进统一接口的基准工具包

这篇论文提出 OpenAI Gym,一个面向强化学习研究的工具包。它的核心想法很直接:把各种任务做成同一种“环境”接口,让研究者可以用相同方式接入、运行、记录和比较算法,而不必为每个任务重写一套对接代码。

arXiv 1606.015402026/7/22
近期热门白底信息图,展示多个强化学习任务散落在不同角落,研究者在不同任务间来回切换,难以直接比较结果。
为什么强化学习需要统一基准
AI / Technology / 中文

谱继承:把RLVR更新拆成“保留基谱、只学框架”

这篇工作研究的是一种很具体的后训练问题:在强化学习式的可验证奖励训练(RLVR)里,模型权重到底是怎么被改写的,以及能不能把“该保留什么”和“该学习什么”分开。作者的主张是,RLVR里很多检查点都接近基模型的固定谱家族,也就是奇异值结构几乎不变,但左右“框架”会继续适应。

xcttxbizwoicslcgogol.supabase.co2026/7/22
白色画布上的教学信息图,展示奖励反馈进入RLVR训练后,模型参数更新分成两条路径:一条保留来自基模型的结构,另一条改变可学习部分。
为什么RLVR里的“复用什么、改什么”值得单独分开看
AI / Technology / 中文

ATLAS:在不同环境里找出真正可迁移的潜在因素

论文:Yihong Gu、Katherine Liao、Tianxi Cai,Unveiling Invariant and Transferable Latent Factors Across Heterogeneous Environments via ATLAS,arXiv:2607.18209v1(2026-07-21)。本文仅把论文摘要中可核验的信息视为作者主张;由于当前源站未能提供可读取的 PDF 正文,未报告无法逐页核对的实验数字、数据集或基线。

arXiv 2607.182092026/7/21
三个环境的观测变量被拆为共享因子与环境特异因子
三个环境的观测变量被拆为共享因子与环境特异因子
AI / Technology / 中文

arxiv.org 论文解释

论文: Sharp Weitzenböck and PIC2 Estimates from Sectional-Scalar Curvature Pinching(Jian Ge,arXiv:2607.18216v1,2026-07-20) 一句话问题: 只知道每一点的最小截面曲率与平均曲率之间夹得够紧,能否推出流形的二阶拓扑消失,甚至逼近球形? 一句话改变: 论文给出一个各维度都尖锐的二形式 Weitzenböck 点态估计,并把同一个四标架不等式重新缩放成尖锐的 PIC2 判据。

arxiv.org2026/7/21
从局部夹逼到二形式消失的机制图
从局部夹逼到二形式消失的机制图
AI / Technology / 中文

智利重型交通的三条动力路线:柴油、纯电还是氢燃料电池?

论文:R. Leiva-Illanes、G. Amador、C. Herrera,Comparison of fuel cell electric vehicles, battery electric vehicles, and internal combustion engine vehicles to contribute to the energy transition in Chile,IOP Conference Series: Earth and Environmental Science 1500 (2025) 012072。开放获取,[论文原文](https://iop

DOI2026/7/21
柴油、纯电与氢燃料电池的能量路径
柴油、纯电与氢燃料电池的能量路径
AI / Technology / 中文

FourCastNet:使用自适应傅里叶神经算子的全球数据驱动高分辨率天气模型

原文标题: FourCastNet: A Global Data-driven High-resolution Weather Model using Adaptive Fourier Neural Operators · 作者: Jaideep Pathak 等 · 发表形式: arXiv 预印本(2022) · 论文: arXiv 2202.11214

arXiv 2202.112142026/7/21
粗细网格为何影响可见的天气结构
粗细网格为何影响可见的天气结构
AI / Technology / 中文

盘古气象:快速、准确的三维高分辨率全球天气预报模型

官方源标题: Pangu-Weather: A 3D High-Resolution Model for Fast and Accurate Global Weather Forecast · 作者: Kaifeng Bi、Lingxi Xie、Hengheng Zhang、Xin Chen、Xiaotao Gu、Qi Tian · 论文: arXiv:2211.02556(2022 年 11 月提交) · 阅读提示: 下文解释的是 arXiv 初版论文中的主张与实验,不代表今天的业务系

arXiv 2211.025562026/7/21
从三维大气到一周预报的总览
从三维大气到一周预报的总览
AI / Technology / 中文

GraphCast:学习高水平的全球中期天气预报

官方标题: GraphCast: Learning skillful medium-range global weather forecasting · 论文: Remi Lam 等,arXiv:2212.12794(v2,2023) · 研究领域: 全球中期天气预报 · 图神经网络 · 学习型模拟器 · 一句话定位: 它不是把天气图当普通图片处理,而是把全球大气放到球面多尺度图上,学习每隔 6 小时如何变化。

arXiv 2212.127942026/7/21
GraphCast 的一句话全景:两帧天气进入球面图,滚动得到十天预报
GraphCast 的一句话全景:两帧天气进入球面图,滚动得到十天预报
AI / Technology / 中文

扩散模型就是实时游戏引擎

官方原题: Diffusion Models Are Real-Time Game Engines · 作者: Dani Valevski、Yaniv Leviathan、Moab Arar、Shlomi Fruchter · 版本: arXiv:2408.14837v2,2025-04-24 修订;ICLR 2025 · 原文: arXiv 摘要 · HTML 全文

arXiv 2408.148372026/7/20
传统引擎与 GameNGen 的循环对比
传统引擎与 GameNGen 的循环对比
AI / Technology / 中文

用扩散模型构建世界模型:Atari 中的视觉细节很重要

原题: Diffusion for World Modeling: Visual Details Matter in Atari · 作者: Eloi Alonso、Adam Jelley、Vincent Micheli、Anssi Kanervisto、Amos Storkey、Tim Pearce、François Fleuret · 版本: arXiv:2405.12399v2,NeurIPS 2024 Spotlight · 来源: arXiv 摘要 · [论文全文](https

arXiv 2405.123992026/7/20
离散压缩与像素扩散对细节和动作选择的影响
离散压缩与像素扩散对细节和动作选择的影响
AI / Technology / 中文

UniSim:神经闭环传感器模拟器

官方标题: UniSim: A Neural Closed-Loop Sensor Simulator · 作者: Ze Yang、Yun Chen、Jingkang Wang、Sivabalan Manivasagam、Wei-Chiu Ma、Anqi Joyce Yang、Raquel Urtasun · 出处: CVPR 2023 Highlight;arXiv:2308.01898 · 一句话定位: 把一次真实道路采集变成可编辑的数字场景,让自动驾驶系统做出新动作后还能看到随

arXiv 2308.018982026/7/20
录像重放无法反馈动作,UniSim 则把更新后的场景送回下一轮传感器生成
录像重放无法反馈动作,UniSim 则把更新后的场景送回下一轮传感器生成
AI / Technology / 中文

GAIA-1:面向自动驾驶的生成式世界模型

官方标题: GAIA-1: A Generative World Model for Autonomous Driving · 作者: Anthony Hu、Lloyd Russell、Hudson Yeo、Zak Murez、George Fedoseev、Alex Kendall、Jamie Shotton、Gianluca Corrado · 来源: arXiv:2309.17080,2023 年 9 月 29 日提交,技术报告

arXiv 2309.170802026/7/20
同一场景可以通向多个合理未来
同一场景可以通向多个合理未来
AI / Technology / 中文

V-JEPA 2:自监督视频模型让理解、预测与规划成为可能

官方原题: V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning · 作者: Mahmoud Assran 等|发布日期: 2025 年 6 月 11 日|论文: arXiv:2506.09985|领域: 视频理解、世界模型、机器人规划

arXiv 2506.099852026/7/20
V-JEPA 2 先从大规模视频学视觉规律,再用少量机器人视频补上动作条件。
V-JEPA 2 先从大规模视频学视觉规律,再用少量机器人视频补上动作条件。
AI / Technology / 中文

Genie:生成式可交互环境

官方原题: Genie: Generative Interactive Environments · 作者: Jake Bruce、Michael Dennis、Ashley Edwards、Jack Parker-Holder 等 25 人(Google DeepMind) · 论文: arXiv:2402.15391 · 2024 年 2 月 23 日提交 · 研究类型: 生成式世界模型 · 视频建模 · 无监督动作学习

arXiv 2402.153912026/7/20
从被动视频到可交互生成
从被动视频到可交互生成
AI / Technology / 中文

TD-MPC2:面向连续控制的可扩展、稳健世界模型

官方标题: TD-MPC2: Scalable, Robust World Models for Continuous Control · 作者: Nicklas Hansen、Hao Su、Xiaolong Wang · 发表: ICLR 2024;arXiv:2310.16828(v2,2024-03-21) · 主来源: arXiv 摘要页 · 论文 PDF

arXiv 2310.168282026/7/20
控制导向的世界模型不必重建每个未来像素
控制导向的世界模型不必重建每个未来像素
AI / Technology / 中文

面向模型预测控制的时序差分学习

官方题名: Temporal Difference Learning for Model Predictive Control · 作者: Nicklas Hansen、Xiaolong Wang、Hao Su · 论文: arXiv:2203.04955 · ICML 2022 · arXiv v2(2022-07-19) · 领域: 强化学习、连续控制、机器人

arXiv 2203.049552026/7/20
TD-MPC 把短程规划和长期价值接在一起
TD-MPC 把短程规划和长期价值接在一起
AI / Technology / 中文

学会一个模型,靠规划掌握 Atari、围棋、国际象棋与将棋

论文信息 · 官方标题:Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model · 作者:Julian Schrittwieser 等|arXiv:1911.08265|2019(后续修订) · 主来源:arXiv 摘要 · 论文 PDF

arXiv 1911.082652026/7/20
两种建模目标的对比:复刻世界,或只保留规划需要的信息
两种建模目标的对比:复刻世界,或只保留规划需要的信息
AI / Technology / 中文

用世界模型掌握不同领域

官方题名:Mastering Diverse Domains through World Models > Danijar Hafner、Jurgis Pasukonis、Jimmy Ba、Timothy Lillicrap · arXiv:2301.04104v2 · 2024-04-17 · 主来源:arXiv 摘要页 · 论文全文

arXiv 2301.041042026/7/20
逐域调参与固定配置的对比
逐域调参与固定配置的对比
AI / Technology / 中文

用离散世界模型掌握 Atari

官方源标题: Mastering Atari with Discrete World Models · 作者: Danijar Hafner、Timothy Lillicrap、Mohammad Norouzi、Jimmy Ba · 发表: ICLR 2021;arXiv:2010.02193(v4,2022-02-12) · 主来源: arXiv 摘要与论文正文

arXiv 2010.021932026/7/20
DreamerV2 从真实经历到内部想象,再回到环境的核心循环
DreamerV2 从真实经历到内部想象,再回到环境的核心循环
AI / Technology / 中文

梦想控制:通过潜在想象学习行为

官方题名: Dream to Control: Learning Behaviors by Latent Imagination · 作者: Danijar Hafner、Timothy Lillicrap、Jimmy Ba、Mohammad Norouzi · 论文: arXiv:1912.01603,ICLR 2020

arXiv 1912.016032026/7/20
Dreamer 从真实经验到潜在想象,再回到环境的学习闭环
Dreamer 从真实经验到潜在想象,再回到环境的学习闭环
AI / Technology / 中文

从像素学习潜在动力学并用于规划

论文原题: Learning Latent Dynamics for Planning from Pixels · 作者: Danijar Hafner、Timothy Lillicrap、Ian Fischer、Ruben Villegas、David Ha、Honglak Lee、James Davidson · 版本: arXiv:1811.04551v5(2019-06-04) · 论文主页 · PDF

arXiv 1811.045512026/7/20
PlaNet 在潜在空间中评估候选动作,并只执行第一步
PlaNet 在潜在空间中评估候选动作,并只执行第一步
AI / Technology / 中文

世界模型

官方源标题: World Models · 作者: David Ha、Jürgen Schmidhuber · 时间: 2018 年 3 月 27 日(arXiv 首次提交) · 论文: arXiv:1803.10122 | 作者交互版全文

arXiv 1803.101222026/7/20
现实经验训练世界模型,世界模型生成练习环境,控制器再回到现实
现实经验训练世界模型,世界模型生成练习环境,控制器再回到现实
AI / Technology / 中文

Sora 2 系统卡:能力、风险与分层防护

官方来源标题: Sora 2 System Card · 发布方: OpenAI · 日期: 2025 年 9 月 30 日 · 篇幅: 7 页 · 原始资料: 官方 PDF · 阅读定位: 这是一份系统安全说明,不是披露模型架构与完整能力基准的技术论文。

cdn.openai.com2026/7/20
近期热门同一套更强的视频生成能力,同时放大创作价值与滥用风险
同一套更强的视频生成能力,同时放大创作价值与滥用风险
AI / Technology / 中文

大模型批评者帮助找出大模型的错误

官方来源标题: LLM Critics Help Catch LLM Bugs · 作者: Nat McAleese、Rai (Michael Pokorny)、Juan Felipe Cerón Uribe、Evgenia Nitishinskaya、Maja Trębacz、Jan Leike · 来源: arXiv:2407.00215 · 2024-06-28

arXiv 2407.002152026/7/20
CriticGPT 辅助人工复核的基本流程
CriticGPT 辅助人工复核的基本流程
AI / Technology / 中文

弱到强泛化:用弱监督唤出强模型的能力

官方原题: Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision · 作者: Collin Burns、Pavel Izmailov、Jan Hendrik Kirchner 等|发布: 2023-12-14|来源: arXiv:2312.09390

arXiv 2312.093902026/7/20
未来监督难题与今天实验的类比
未来监督难题与今天实验的类比
AI / Technology / 中文

从人类反馈中学习摘要

官方题名: Learning to summarize from human feedback · 作者: Nisan Stiennon、Long Ouyang、Jeff Wu、Daniel M. Ziegler、Ryan Lowe、Chelsea Voss、Alec Radford、Dario Amodei、Paul Christiano · 发表: NeurIPS 2020 · arXiv:2009.01325 · [会议论文 PDF](https://proceedings.neurips

arXiv 2009.013252026/7/20
模仿单一参考与学习人类偏好的差别
模仿单一参考与学习人类偏好的差别
AI / Technology / 中文

WebGPT:借助浏览器与人类反馈回答问题

官方标题: WebGPT: Browser-assisted question-answering with human feedback · 作者: Reiichiro Nakano 等 · 版本: arXiv:2112.09332v3(2022-06-01) · 论文: https://arxiv.org/abs/2112.09332

arXiv 2112.093322026/7/20
WebGPT 从问题到带引用回答的完整链路
WebGPT 从问题到带引用回答的完整链路
AI / Technology / 中文

Jukebox:一个音乐生成模型

官方标题: Jukebox: A Generative Model for Music · 作者: Prafulla Dhariwal、Heewoo Jun、Christine Payne、Jong Wook Kim、Alec Radford、Ilya Sutskever · 来源: arXiv:2005.00341,2020 年 4 月 30 日提交

arXiv 2005.003412026/7/20
四分钟原始音频先被压缩成离散音乐代码
四分钟原始音频先被压缩成离散音乐代码
AI / Technology / 中文

一致性模型:一步生成,也保留多步改进的余地

官方标题: Consistency Models · 作者: Yang Song、Prafulla Dhariwal、Mark Chen、Ilya Sutskever · 发表: ICML 2023 · arXiv:2303.01469 · 论文正文(PMLR)

arXiv 2303.014692026/7/20
扩散模型的多次去噪,与一致性模型的一步映射
扩散模型的多次去噪,与一致性模型的一步映射
AI / Technology / 中文

改进的去噪扩散概率模型

原文标题: Improved Denoising Diffusion Probabilistic Models · 作者: Alex Nichol、Prafulla Dhariwal · 发表: ICML 2021(PMLR 139) · 论文: arXiv:2102.09672 · PMLR 正文

arXiv 2102.096722026/7/20
论文核心权衡:质量、速度与覆盖
论文核心权衡:质量、速度与覆盖
AI / Technology / 中文

扩散模型如何在图像生成上击败 GAN

官方标题:Diffusion Models Beat GANs on Image Synthesis · 作者:Prafulla Dhariwal、Alex Nichol|arXiv: 2105.05233|首次提交:2021-05-11|版本:v4

arXiv 2105.052332026/7/20
GAN 与扩散模型的生成路径对比
GAN 与扩散模型的生成路径对比
AI / Technology / 中文

Shap‑E:生成条件三维隐式函数

官方标题: Shap-E: Generating Conditional 3D Implicit Functions · 作者: Heewoo Jun、Alex Nichol · 发布: 2023 年 5 月 3 日 · 论文: arXiv:2305.02463

arXiv 2305.024632026/7/20
Shap‑E 从条件直接生成隐式函数,再分成两种三维输出
Shap‑E 从条件直接生成隐式函数,再分成两种三维输出
AI / Technology / 中文

Point‑E:从复杂文字提示生成三维点云的系统

官方标题: Point-E: A System for Generating 3D Point Clouds from Complex Prompts · 作者: Alex Nichol、Heewoo Jun、Prafulla Dhariwal、Pamela Mishkin、Mark Chen · 来源: arXiv:2212.08751 · 2022 年 12 月 16 日提交 · cs.CV / cs.LG

arXiv 2212.087512026/7/20
Point‑E 的三段生成流程
Point‑E 的三段生成流程
AI / Technology / 中文

GLIDE:迈向由文字引导扩散模型生成与编辑照片级图像

官方题名: GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models · 作者: Alex Nichol、Prafulla Dhariwal、Aditya Ramesh、Pranav Shyam、Pamela Mishkin、Bob McGrew、Ilya Sutskever、Mark Chen · 来源: arXiv:2112.10741,v3,2022-03-0

arXiv 2112.107412026/7/20
文字提示经过随机噪声和多步去噪,逐渐形成目标图像
文字提示经过随机噪声和多步去噪,逐渐形成目标图像
AI / Technology / 中文

用 CLIP 潜变量分层生成文字条件图像

官方标题:Hierarchical Text-Conditional Image Generation with CLIP Latents · 作者:Aditya Ramesh、Prafulla Dhariwal、Alex Nichol、Casey Chu、Mark Chen · 发表时间:2022 年 4 月 · arXiv:2204.06125

arXiv 2204.061252026/7/20
文字先变成图像语义,再变成像素细节
文字先变成图像语义,再变成像素细节
AI / Technology / 中文

GPT-4o 系统卡:一个模型同时处理文字、图像与声音

官方源标题: GPT-4o System Card · 作者: OpenAI(2024) · 主来源: arXiv:2410.21276 · 论文全文 · 阅读定位: 这是一份系统卡。它重点说明模型能力、风险评测与部署护栏,并没有公开足以复现模型的完整架构和训练配方。

arXiv 2410.212762026/7/20
文字、声音、图像和视频进入同一个模型核心,再产生文字、声音和图像。
文字、声音、图像和视频进入同一个模型核心,再产生文字、声音和图像。
AI / Technology / 中文

GPT-4 技术报告:能力跃迁之后,边界仍在哪里?

官方标题: GPT-4 Technical Report · 作者: OpenAI 等|版本: arXiv v6(2024-03-04)|论文: arXiv:2303.08774 · 一句话定位: 这份报告展示了 GPT-4 的多模态能力、可预测扩展方法与安全缓解措施,同时明确提醒:更高的考试分数并不等于稳定、透明或无风险。

arXiv 2303.087742026/7/20
图像与文本共同进入模型,最终生成文本
图像与文本共同进入模型,最终生成文本
AI / Technology / 中文

DeepSeek-R1:用强化学习激发大语言模型的推理能力

官方英文标题: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning · 作者: DeepSeek-AI | 论文: arXiv:2501.12948 | 版本: v2(2026-01-04)

arXiv 2501.129482026/7/20
纯模仿与规则奖励反馈回路的对比
纯模仿与规则奖励反馈回路的对比
AI / Technology / 中文

DeepSeek-V3 技术报告

官方源标题:DeepSeek-V3 Technical Report · 作者:DeepSeek-AI|版本:arXiv v2,2025-02-18|论文:arXiv:2412.19437

arXiv 2412.194372026/7/20
一个 token 只激活部分专家
一个 token 只激活部分专家
AI / Technology / 中文

DeepSeek-V2:强大、经济且高效的混合专家语言模型

官方源标题: DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model · 作者: DeepSeek-AI · 版本: arXiv v5,2024-06-19 · 论文: arXiv:2405.04434

arXiv 2405.044342026/7/20
DeepSeek-V2 用稀疏激活与记忆压缩同时降低训练和生成负担
DeepSeek-V2 用稀疏激活与记忆压缩同时降低训练和生成负担
AI / Technology / 中文

DeepSeekMath:把开放数学推理模型推向新上限

官方标题: DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models · 作者: Zhihong Shao 等|版本: arXiv v3,2024-04-27|论文: arXiv:2402.03300

arXiv 2402.033002026/7/20
DeepSeekMath 从网页数据到数学回答的训练链
DeepSeekMath 从网页数据到数学回答的训练链
AI / Technology / 中文

DeepSeek-Coder:当大语言模型遇上编程——代码智能的崛起

论文原题: DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence · 作者: Daya Guo 等 · 版本: arXiv:2401.14196v2,2024-01-26 · 主来源: arXiv 摘要 · 论文 PDF

arXiv 2401.141962026/7/20
从公开仓库到训练序列的五步数据流程
从公开仓库到训练序列的五步数据流程
AI / Technology / 中文

DeepSeek LLM:以长期主义扩展开源语言模型

官方原题: DeepSeek LLM: Scaling Open-Source Language Models with Longtermism · 作者: DeepSeek-AI(Xiao Bi 等) · 提交日期: 2024-01-05 · 论文: arXiv:2401.02954 · 一句话定位: 先用小规模实验估算怎样分配训练算力,再据此训练 7B 与 67B 中英双语模型。

arXiv 2401.029542026/7/20
近期热门从小规模实验到完整模型的研究路径
从小规模实验到完整模型的研究路径
AI / Technology / 中文

EgoEdit:让第一人称视频编辑从“整段等待”走向“边拍边看”

论文:Runjia Li 等,EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing,CVPR 2026。 · 阅读提示:文中的“实时”是作者在单张 H100 GPU、512×384 分辨率等特定条件下测得的系统表现,不等于已在消费级 AR 眼镜上验证。

arXiv 2512.060652026/7/20
第三人称与第一人称视频编辑难度对比:第一人称画面同时承受快速视角变化、手部遮挡和物体出画。
第三人称与第一人称视频编辑难度对比:第一人称画面同时承受快速视角变化、手部遮挡和物体出画。
AI / Technology / 中文

阈值差分注意力:实现无注意力沉降、超稀疏且非弥散的语言建模

论文:Xingyue Huang 等,Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling,arXiv:2601.12145v2,2026-04-16。本文只解释 v2;论文目前的 arXiv 页面已有更新版本。原文:PDF · HTML

arXiv 2601.121452026/7/20
Softmax 与 TDA 的结构差异
Softmax 与 TDA 的结构差异
AI / Technology / 中文

arXiv 2211.01426 技术解释

论文: Reciprocity, Homophily, and Social Network Effects in Pictorial Communication: A Case Study of Bitmoji Stickers(CHI 2023) 研究对象: Snapchat 上的 Bitmoji 贴纸使用元数据;不分析消息、图片、视频或贴纸内容。

arXiv 2211.014262026/7/20
论文从元数据出发,依次研究行为类型、朋友相似性与匹配后的后续差异
论文从元数据出发,依次研究行为类型、朋友相似性与匹配后的后续差异
AI / Technology / 中文

直接偏好优化:你的语言模型其实就是奖励模型

官方原题: Direct Preference Optimization: Your Language Model is Secretly a Reward Model · 作者: Rafael Rafailov、Archit Sharma、Eric Mitchell、Stefano Ermon、Christopher D. Manning、Chelsea Finn · 发表: NeurIPS 2023;本文依据 arXiv v3(2024-07-29) · 一手来源: [arXiv 摘要页](https://arxiv.org/abs/2305.182

arXiv 2305.182902026/7/19
传统 RLHF 需要显式奖励模型与强化学习循环;DPO 将偏好对直接用于更新语言模型。
传统 RLHF 需要显式奖励模型与强化学习循环;DPO 将偏好对直接用于更新语言模型。
AI / Technology / 中文

大规模弱监督带来的鲁棒语音识别

官方标题: Robust Speech Recognition via Large-Scale Weak Supervision · 作者: Alec Radford、Jong Wook Kim、Tao Xu、Greg Brockman、Christine McLeavey、Ilya Sutskever · 来源: arXiv:2212.04356,2022 年 12 月 6 日提交

arXiv 2212.043562026/7/19
传统逐场景微调与多来源预训练后的零样本迁移对比
传统逐场景微调与多来源预训练后的零样本迁移对比
AI / Technology / 中文

零样本文本到图像生成

官方源标题: Zero-Shot Text-to-Image Generation · 作者: Aditya Ramesh、Mikhail Pavlov、Gabriel Goh、Scott Gray、Chelsea Voss、Alec Radford、Mark Chen、Ilya Sutskever · 版本: arXiv:2102.12092v2,2021-02-26|摘要页|论文 PDF

arXiv 2102.120922026/7/19
像素序列与压缩图像 token 的教学对比
像素序列与压缩图像 token 的教学对比
AI / Technology / 中文

用 Transformer 实现端到端目标检测

原始标题: End-to-End Object Detection with Transformers · 作者: Nicolas Carion、Francisco Massa、Gabriel Synnaeve、Nicolas Usunier、Alexander Kirillov、Sergey Zagoruyko · 来源: arXiv:2005.12872(v3,2020-05-28) · 阅读范围: 论文正文与附录;以下数字均来自论文报告的 COCO 2017 实验。

arXiv 2005.128722026/7/19
传统检测流程与 DETR 直接集合输出的对比
传统检测流程与 DETR 直接集合输出的对比
AI / Technology / 中文

用神经辐射场表示场景以合成新视角

论文原题: NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis · 作者: Ben Mildenhall、Pratul P. Srinivasan、Matthew Tancik、Jonathan T. Barron、Ravi Ramamoorthi、Ren Ng · 来源: arXiv:2003.08934,2020 年 3 月提交 · 阅读提示: 下文的实验数字和结论均来自论文;面向产品的判断

arXiv 2003.089342026/7/19
多个相机视角、空间采样点与最终像素之间的关系
多个相机视角、空间采样点与最终像素之间的关系
AI / Technology / 中文

用统一的文本到文本 Transformer 探索迁移学习的极限

官方原题:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer · 作者:Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu · 出版:JMLR 21(140):1–67, 2020;arXiv:1910.10683 · 一手来源:[JMLR 论文页](htt

arXiv 1910.106832026/7/19
多种 NLP 任务统一为文本到文本的流程
多种 NLP 任务统一为文本到文本的流程
AI / Technology / 中文

语言模型是无监督的多任务学习者

官方题名: Language Models are Unsupervised Multitask Learners · 作者: Alec Radford、Jeffrey Wu、Rewon Child、David Luan、Dario Amodei、Ilya Sutskever · 发布机构与年份: OpenAI,2019 · 主源: [论文 PDF(24 页)](https://cdn.openai.com/better-language-models/languagemodelsareunsupervisedmultitasklearners

cdn.openai.com2026/7/19
两种训练范式:逐任务标注与从多样网页文本中学习
两种训练范式:逐任务标注与从多样网页文本中学习
AI / Technology / 中文

通过生成式预训练提升语言理解

官方标题: Improving Language Understanding by Generative Pre-Training · 作者: Alec Radford、Karthik Narasimhan、Tim Salimans、Ilya Sutskever(OpenAI) · 来源: 论文 PDF · 预印本 / 进行中的工作 · 12 页

cdn.openai.com2026/7/19
两阶段迁移:无标注长文本经过生成式预训练进入同一个 Transformer,再用标注数据微调到多类理解任务。
两阶段迁移:无标注长文本经过生成式预训练进入同一个 Transformer,再用标注数据微调到多类理解任务。
AI / Technology / 中文

深度上下文化词表示

官方源标题: Deep contextualized word representations · 作者: Matthew E. Peters、Mark Neumann、Mohit Iyyer、Matt Gardner、Christopher Clark、Kenton Lee、Luke Zettlemoyer · 论文: arXiv:1802.05365,NAACL 2018;本文依据 arXiv v2(2018-03-22) · 一句话: ELMo 不再给每个词发一张永久不变的“身份证

arXiv 1802.053652026/7/19
静态词向量与上下文词表示的区别
静态词向量与上下文词表示的区别
AI / Technology / 中文

AlphaZero:用通用强化学习算法通过自我对弈掌握国际象棋与将棋

官方原题: Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm · 作者: David Silver、Thomas Hubert、Julian Schrittwieser 等|DeepMind|2017 · 主源: arXiv:1712.01815|论文 PDF

arXiv 1712.018152026/7/19
传统棋类程序依赖专家特征与广泛搜索;AlphaZero 以规则、自我对弈、神经网络和 MCTS 形成另一条路径。
传统棋类程序依赖专家特征与广泛搜索;AlphaZero 以规则、自我对弈、神经网络和 MCTS 形成另一条路径。
AI / Technology / 中文

近端策略优化算法

官方标题: Proximal Policy Optimization Algorithms · 作者: John Schulman、Filip Wolski、Prafulla Dhariwal、Alec Radford、Oleg Klimov · 来源: arXiv:1707.06347v2,2017-08-28 修订,12 页

arXiv 1707.063472026/7/19
同一批轨迹反复更新时,无护栏可能让策略跳太远;PPO 用裁剪限制有利方向上的过度更新。
同一批轨迹反复更新时,无护栏可能让策略跳太远;PPO 用裁剪限制有利方向上的过度更新。
AI / Technology / 中文

你只看一次:统一、实时的目标检测

原论文标题: You Only Look Once: Unified, Real-Time Object Detection · 作者: Joseph Redmon、Santosh Divvala、Ross Girshick、Ali Farhadi · 版本: arXiv:1506.02640v5,2016-05-09 · 主来源: arXiv 摘要页 · 论文 PDF

arXiv 1506.026402026/7/19
传统多阶段流程与 YOLO 单网络流程对比
传统多阶段流程与 YOLO 单网络流程对比
AI / Technology / 中文

批归一化:通过减少内部协变量偏移加速深度网络训练

官方标题: Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift · 作者: Sergey Ioffe、Christian Szegedy · 年份: 2015 · 来源: arXiv:1502.03167(v3)

arXiv 1502.031672026/7/19
近期热门上游参数变化使后层输入漂移,并可能把激活推入饱和区,最终削弱梯度。
上游参数变化使后层输入漂移,并可能把激活推入饱和区,最终削弱梯度。
AI / Technology / 中文

Adam:一种随机优化方法

官方原题: Adam: A Method for Stochastic Optimization · 作者: Diederik P. Kingma、Jimmy Ba · 发表: ICLR 2015 · 版本: arXiv v9(2017-01-30) · 主来源: arXiv:1412.6980 · 论文 PDF

arXiv 1412.69802026/7/19
同一全局步长面对陡峭、稀疏和噪声梯度时的困难
同一全局步长面对陡峭、稀疏和噪声梯度时的困难
AI / Technology / 中文

神经机器翻译:联合学习对齐与翻译

官方标题: Neural Machine Translation by Jointly Learning to Align and Translate · 作者: Dzmitry Bahdanau、Kyunghyun Cho、Yoshua Bengio · 来源: arXiv:1409.0473(2014 年 9 月提交;论文正文修订版标注为 2016 年 5 月) · 任务: WMT 2014 英语→法语新闻翻译

arXiv 1409.04732026/7/19
固定向量瓶颈示意
固定向量瓶颈示意
AI / Technology / 中文

用神经网络进行序列到序列学习

原文标题: Sequence to Sequence Learning with Neural Networks · 作者: Ilya Sutskever、Oriol Vinyals、Quoc V. Le · 版本: arXiv v3(2014-12-14) · 原文: arXiv 摘要页 · 论文 PDF

arXiv 1409.32152026/7/19
序列到序列架构:编码器把源序列压成固定长度向量,解码器据此逐步生成目标序列。
序列到序列架构:编码器把源序列压成固定长度向量,解码器据此逐步生成目标序列。
AI / Technology / 中文

在向量空间中高效估计词表示

官方源标题: Efficient Estimation of Word Representations in Vector Space · 作者: Tomas Mikolov、Kai Chen、Greg Corrado、Jeffrey Dean · 来源: arXiv:1301.3781v3(2013-09-07 修订)|论文 PDF · 阅读定位: 这是一篇 2013 年论文的原始贡献解读,不是对今天所有词向量方法

arXiv 1301.37812026/7/19
从孤立编号到连续向量空间:编号本身没有相似距离;连续向量可让使用方式相近的词靠近,并显露近似平行的关系。
从孤立编号到连续向量空间:编号本身没有相似距离;连续向量可让使用方式相近的词靠近,并显露近似平行的关系。
AI / Technology / 中文

用深度强化学习玩 Atari

原始标题: Playing Atari with Deep Reinforcement Learning · 作者: Volodymyr Mnih、Koray Kavukcuoglu、David Silver、Alex Graves、Ioannis Antonoglou、Daan Wierstra、Martin Riedmiller · 发表信息: 2013 年 12 月 19 日提交,NIPS Deep Learning Workshop 2013 · 主来源: [arXiv:1312.5602](https://arxiv.org/abs/1312.

arXiv 1312.56022026/7/19
DQN 的交互与学习闭环:画面经 Q 网络产生动作价值,动作改变环境;奖励与新画面被存入经验回放,再随机抽样更新网络。
DQN 的交互与学习闭环:画面经 Q 网络产生动作价值,动作改变环境;奖励与新画面被存入经验回放,再随机抽样更新网络。
AI / Technology / 中文

AlexNet:当深度学习第一次在大规模图像识别上拉开差距

论文:Alex Krizhevsky、Ilya Sutskever、Geoffrey E. Hinton,ImageNet Classification with Deep Convolutional Neural Networks,NIPS 2012。本文以论文 PDF为主要依据;页码均指 PDF 印刷页。

proceedings.neurips.cc2026/7/17
AlexNet 从图像到 Top-5 预测的教学流程图
AlexNet 从图像到 Top-5 预测的教学流程图
AI / Technology / 中文

让模型不只“看图说话”:LLaVA 与视觉指令微调

论文:Haotian Liu 等,Visual Instruction Tuning,NeurIPS 2023 Oral,arXiv v2(2023-12-11)。摘要页 · 论文 PDF

arXiv 2304.084852026/7/17
视觉指令数据生成流程:图像被转成字幕和目标框,文本教师再生成对话、详述与推理样本。
视觉指令数据生成流程:图像被转成字幕和目标框,文本教师再生成对话、详述与推理样本。
AI / Technology / 中文

一次点击,为什么能“抠出”几乎任何东西?

论文:Alexander Kirillov 等,Segment Anything(2023) · 原文:arXiv 摘要页 · PDF

arXiv 2304.026432026/7/17
任务、模型与数据引擎形成闭环
任务、模型与数据引擎形成闭环
AI / Technology / 中文

ReAct:把“想”与“做”交替起来的语言模型方法

这篇论文研究一个直白问题:大语言模型不只要会回答,还要会查证据、做决定、并在环境里执行动作。作者发现,单靠链式思维容易幻觉和错误传播,单靠动作又缺少抽象推理和计划能力。

arXiv 2210.036292026/7/17
一张结构图:模型内部思考、外部知识检索、环境动作和任务结果之间的关系,以及三种常见断裂点。
推理与行动分离的问题结构
AI / Technology / 中文

Chinchilla:在固定算力下,模型不一定越大越好

论文:Jordan Hoffmann 等,Training Compute-Optimal Large Language Models,2022。 · 原文:arXiv 摘要页 · PDF

arXiv 2203.155562026/7/17
固定训练算力下的两种分配方式
固定训练算力下的两种分配方式
AI / Technology / 中文

让语言模型更听懂“你想要什么”:InstructGPT 与 RLHF

论文:Long Ouyang 等,Training language models to follow instructions with human feedback,2022(arXiv:2203.02155)

arXiv 2203.021552026/7/17
参数更多不保证更符合人的偏好;行为微调改变了比较结果
参数更多不保证更符合人的偏好;行为微调改变了比较结果
AI / Technology / 中文

把扩散模型搬进“潜空间”:高分辨率图像生成如何少做无用功

论文:Robin Rombach 等,High-Resolution Image Synthesis with Latent Diffusion Models,CVPR 2022(arXiv v2,2022-04-13)。论文摘要与元数据 · 全文 HTML

arXiv 2112.107522026/7/17
像素空间与潜空间扩散的计算路径对比
像素空间与潜空间扩散的计算路径对比
AI / Technology / 中文

LoRA:给大模型的改动装进“小插件”

论文:Edward J. Hu 等,LoRA: Low-Rank Adaptation of Large Language Models,arXiv v2(2021)。摘要页 · 论文 PDF

arXiv 2106.096852026/7/17
近期热门全量微调需要任务副本;LoRA 复用共享基座,只保存小型任务模块
全量微调需要任务副本;LoRA 复用共享基座,只保存小型任务模块
AI / Technology / 中文

CLIP:把图片分类改写成“图文配对”

论文:Alec Radford 等,Learning Transferable Visual Models From Natural Language Supervision(2021) · 一句话问题:视觉模型怎样摆脱预先固定的标签表,在没有下游训练样本时也能按自然语言识别图片?

arXiv 2103.000202026/7/17
CLIP 对比预训练:图像与文字分别编码,正确配对在相似度矩阵的对角线上被拉近。
CLIP 对比预训练:图像与文字分别编码,正确配对在相似度矩阵的对角线上被拉近。
AI / Technology / 中文

把图片当成一串“词”:Vision Transformer 为什么成立

论文:Alexey Dosovitskiy 等,An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale,ICLR 2021,arXiv v2。 · 原文:摘要页 · PDF

arXiv 2010.119292026/7/17
CNN 逐层扩大局部视野;ViT 把图像块送入全局关联网络的原创教学对比图
CNN 逐层扩大局部视野;ViT 把图像块送入全局关联网络的原创教学对比图
AI / Technology / 中文

扩散概率模型:把图像生成拆成很多个小去噪步骤

论文:Jonathan Ho、Ajay Jain、Pieter Abbeel,Denoising Diffusion Probabilistic Models(2020) · 一句话问题:能否不用生成器与判别器对抗,而是从随机噪声出发,靠许多次容易学习的小修正生成高质量图像?

arXiv 2006.112392026/7/17
近期热门扩散模型的前向加噪与反向去噪
扩散模型的前向加噪与反向去噪
AI / Technology / 中文

RAG:让语言模型先查资料,再组织答案

论文:Patrick Lewis 等,Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,NeurIPS 2020;本文依据 arXiv v4 与其全文整理。

arXiv 2005.114012026/7/17
RAG 的问题、检索、生成流程
RAG 的问题、检索、生成流程
AI / Technology / 中文

GPT-3:把“教会模型”改成“在提示里示范”

论文:Tom B. Brown 等,Language Models are Few-Shot Learners,2020(arXiv v4) · 阅读定位:这篇论文证明的是一种有潜力但不稳定的新使用范式,不是“通用智能已经解决”。

arXiv 2005.141652026/7/17
传统微调与上下文学习的差别
传统微调与上下文学习的差别
AI / Technology / 中文

语言模型的“规模定律”:把训练当成一项可预测的预算工程

论文:Jared Kaplan 等,Scaling Laws for Neural Language Models(2020) · 原文:arXiv 摘要页 · PDF · 阅读提示:这是一项关于 Transformer 语言模型交叉熵损失 的经验研究,不是对通用能力、安全性或产品价值的直接证明。

arXiv 2001.083612026/7/17
三种规模因素需要协同增长,才能持续压低损失
三种规模因素需要协同增长,才能持续压低损失
AI / Technology / 中文

BERT:让同一个语言模型同时看见词的左边与右边

Jacob Devlin、Ming-Wei Chang、Kenton Lee、Kristina Toutanova,2018(arXiv v2,2019)。原论文:摘要页 · PDF

arXiv 1810.048052026/7/17
单向上下文与深层双向上下文的差别
单向上下文与深层双向上下文的差别
AI / Technology / 中文

GAN:让“造假者”和“鉴别者”一起学会生成

论文:Ian J. Goodfellow 等,Generative Adversarial Nets(2014) · 原文:arXiv:1406.2661

arXiv 1406.26612026/7/17
GAN 的输入、生成、判别与反馈回路
GAN 的输入、生成、判别与反馈回路
AI / Technology / 中文

VAE 的关键一步:让随机采样也能反向传播

论文:Diederik P. Kingma、Max Welling,Auto-Encoding Variational Bayes(arXiv:1312.6114,v11) · 原文:摘要页 · 全文 · 阅读提示:本文区分“论文报告的结果”和“面向实践的解释”;后者不会冒充作者结论。

arXiv 1312.61142026/7/17
共享编码器把逐样本推断变成一次前向计算
共享编码器把逐样本推断变成一次前向计算
AI / Technology / 中文

思维链提示:不是让模型变聪明,而是让它先把路走出来

重读 Wei 等人的《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》:一项简单的提示格式改动,为什么会在足够大的语言模型上释放多步推理能力?它又没有证明什么?

arXiv 2201.119032026/7/15
近期热门大语言模型把复杂问题拆成中间推理步骤后得到答案的封面图
大语言模型把复杂问题拆成中间推理步骤后得到答案的封面图
AI / Technology / 中文

ResNet:真正的突破不是“更深”,而是让深度变得可优化

图 0:ResNet 的核心不是无条件堆叠更多层,而是用恒等捷径为深层网络保留一条稳定的信息通路。

arXiv 1512.033852026/7/15
近期热门深度残差学习以恒等捷径贯穿深层网络
深度残差学习以恒等捷径贯穿深层网络
AI / NLP / Architecture / 中文

Transformer 原论文重读:它真正消除的不是顺序,而是训练中的递归依赖

重新回到 Attention Is All You Need 的原始证据,解释 Transformer 如何把序列中的递归计算改写为可并行的全局关系,同时保留位置、因果和自回归生成。

arXiv 1706.037622026/7/14
Transformer 从递归链转向全局注意力关系的概念封面
Transformer 从递归链转向全局注意力关系的概念封面
AI / Animation / Robotics / 中文

MotionBricks:把实时角色动作从“手工接线”变成“关键帧生成”

论文:Tingwu Wang、Olivier Dionne 等,MotionBricks: Scalable Real-Time Motions with Modular Latent Generative Model and Smart Primitives,arXiv:2604.24833v1,2026-04-27。论文标注为 CC BY 4.0;本文三幅图均为重新创作的教学示意图,不是论文图的复制。论文页 · DOI

arXiv 2604.248332026/7/17
传统状态机随行为增多而缠成网络;MotionBricks 用可复用控制原语连接共享生成骨干
传统状态机随行为增多而缠成网络;MotionBricks 用可复用控制原语连接共享生成骨干

FAQ

关于 AI 论文图解的常见问题

PaperBridge 和普通 AI 论文总结工具有什么不同?

普通总结常压缩摘要和结论;PaperBridge 还解释方法机制、证据强弱、对照实验、局限与实际意义,并用原创图解帮助建立直觉。

怎么找到或提交一篇论文?

可以搜索论文标题,也可以粘贴 arXiv、论文页面或公开 PDF 链接;登录后还能直接上传公开论文 PDF。已有报告会直接打开,没有对应语言版本时可以生成新解读。

目前支持哪些语言?

公开报告主要提供中文、英文和日文版本;生成流程也支持西班牙语。每种语言使用独立页面,方便读者和搜索引擎找到正确版本。