PaperBridge 和普通 AI 论文总结工具有什么不同?
普通总结常压缩摘要和结论;PaperBridge 还解释方法机制、证据强弱、对照实验、局限与实际意义,并用原创图解帮助建立直觉。
用人话解释方法、证据和局限,而不只给一段摘要
DeepSeek-V3 先把困难定理拆成形式子目标,7B 证明器递归填完局部证明,Lean 再把成功结果变成冷启动数据和强化学习奖励。

Kimi K3 同时重做序列、深度、宽度与任务状态通路;这份深度解读逐步拆开 KDA、AttnRes、Stable LatentMoE、长上下文训练和可恢复智能体系统。

用分布式系统的话说,ZeRO 把训练从“每张 GPU 都复制完整状态”,改成“状态分片保存,需要计算当前层时再临时物化”。它解决的是状态管理问题,不是让模型换一种学习方法。

官方标题: Grasp-MPC: Closed-Loop Visual Grasping via Value-Guided Model Predictive Control · 作者: Jun Yamada、Adithyavairavan Murali、Ajay Mandlekar、Clemens Eppner、Ingmar Posner、Balakumar Sundaralingam · 发表状态: ICRA 2026 论文 · arXiv:2509.06201

官方标题:Self-Improving Vision-Language-Action Models with Data Generation via Residual RL · 作者:Wenli Xiao 等|ICLR 2026 论文|arXiv:2511.00091

官方英文标题: DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos · 论文: arXiv:2602.06949 · 发表状态: ICML 2026 Spotlight

官方题名: FLARE: Robot Learning with Implicit World Modeling · 作者: Ruijie Zheng 等|发表: 第 9 届机器人学习会议(CoRL 2025)|论文: arXiv:2505.15659

官方标题: DreamGen: Unlocking Generalization in Robot Learning through Video World Models · 作者: Joel Jang 等 · 发表: CoRL 2025(第 9 届机器人学习大会)· 论文: arXiv:2505.12705 · 会议论文集

官方英文标题:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots · NVIDIA 技术报告,arXiv:2503.14734(v2,2025-03-27)。这是一份 arXiv 技术报告,不是已同行评审的顶会论文。 · 主来源:arXiv 摘要页 · 论文 HTML 全文

官方标题:ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills · Tairan He 等,arXiv:2502.01143v3(2025)|论文主页

官方英文标题:HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots · Tairan He 等,ICRA 2025;arXiv:2410.21229,本文依据 2025-03-06 的 v2。

官方标题:OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning · 论文:arXiv:2406.08858|作者:Tairan He 等|提交日期:2024-06-13

这篇论文研究:在三维空间里,一批很细的“管”如果方向分散、又不太能挤在一起,它们合起来到底能占多大体积。作者给出的核心结论是:在合适的非聚集条件下,这种并集的体积几乎达到最大;进一步,这个体积估计足以推出 ℝ^3 中 Kakeya 集的 Minkowski 维数和 Hausdorff 维数都等于 3。

这篇论文提出一种把视频按固定长度“块”来生成的方法:先生成前一块,再生成后一块,让视频可以边出边看,同时尽量不让后面的计算随着视频变长而暴涨。它的核心想法不是一次性处理整段视频,而是让时间顺序本身变成生成过程的一部分。

官方题名: GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving · 作者: Lloyd Russell、Anthony Hu、Lorenzo Bertoni、George Fedoseev、Jamie Shotton、Elahe Arani、Gianluca Corrado · 来源: arXiv:2503.20523,2025-03-26 提交,Technical Report >

这篇论文想解决的,不是单纯让机器人学会一个动作,而是让它从大量形态不同、质量不一的具身数据里,一起学到动作、动力学和未来画面。作者把这个方向做成了一个 1B 参数的统一训练系统,并配套整理了 EI-30k 数据集。

这篇论文提出 ContentV:一个基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型,目标是在算力受限但又要追求高质量的条件下,把长视频训练做得更稳、更省、更可复用。

这篇综述要解决的不是“某一个模型做得多好”,而是“世界模型这个领域到底在讲什么、怎么分、怎么比、能用到哪里”。作者把分散在强化学习、机器人、自动驾驶、视频生成和科学建模里的工作放到同一张地图上,试图补上一个统一框架。

这篇文章研究的是:在一个周期平面上,二维不可压流体如果带有“平均喷流”和“涡旋扰动”两部分,初值给定后,解会不会一直存在、会不会只有一个、会不会对初值的微小变化保持稳定。作者在 β-plane 近似下,把原始涡度方程改写成这两部分耦合的方程组,并证明在初值具有 (H^s) 正则性、(s\ge 0) 时,可以得到唯一的全局解。

这篇论文在问一个很具体的问题:强化学习式后训练(RLVR)到底是在改模型的哪一部分。作者发现,很多 RLVR 检查点和基座模型在“奇异值谱”上非常接近,真正承载变化的,更多是两侧的奇异帧(singular frames)。

这篇论文提出 OpenAI Gym,一个面向强化学习研究的工具包。它的核心想法很直接:把各种任务做成同一种“环境”接口,让研究者可以用相同方式接入、运行、记录和比较算法,而不必为每个任务重写一套对接代码。

这篇工作研究的是一种很具体的后训练问题:在强化学习式的可验证奖励训练(RLVR)里,模型权重到底是怎么被改写的,以及能不能把“该保留什么”和“该学习什么”分开。作者的主张是,RLVR里很多检查点都接近基模型的固定谱家族,也就是奇异值结构几乎不变,但左右“框架”会继续适应。

论文:Yihong Gu、Katherine Liao、Tianxi Cai,Unveiling Invariant and Transferable Latent Factors Across Heterogeneous Environments via ATLAS,arXiv:2607.18209v1(2026-07-21)。本文仅把论文摘要中可核验的信息视为作者主张;由于当前源站未能提供可读取的 PDF 正文,未报告无法逐页核对的实验数字、数据集或基线。

论文: Sharp Weitzenböck and PIC2 Estimates from Sectional-Scalar Curvature Pinching(Jian Ge,arXiv:2607.18216v1,2026-07-20) 一句话问题: 只知道每一点的最小截面曲率与平均曲率之间夹得够紧,能否推出流形的二阶拓扑消失,甚至逼近球形? 一句话改变: 论文给出一个各维度都尖锐的二形式 Weitzenböck 点态估计,并把同一个四标架不等式重新缩放成尖锐的 PIC2 判据。

论文:R. Leiva-Illanes、G. Amador、C. Herrera,Comparison of fuel cell electric vehicles, battery electric vehicles, and internal combustion engine vehicles to contribute to the energy transition in Chile,IOP Conference Series: Earth and Environmental Science 1500 (2025) 012072。开放获取,[论文原文](https://iop

原文标题: FourCastNet: A Global Data-driven High-resolution Weather Model using Adaptive Fourier Neural Operators · 作者: Jaideep Pathak 等 · 发表形式: arXiv 预印本(2022) · 论文: arXiv 2202.11214

官方源标题: Pangu-Weather: A 3D High-Resolution Model for Fast and Accurate Global Weather Forecast · 作者: Kaifeng Bi、Lingxi Xie、Hengheng Zhang、Xin Chen、Xiaotao Gu、Qi Tian · 论文: arXiv:2211.02556(2022 年 11 月提交) · 阅读提示: 下文解释的是 arXiv 初版论文中的主张与实验,不代表今天的业务系

官方标题: GraphCast: Learning skillful medium-range global weather forecasting · 论文: Remi Lam 等,arXiv:2212.12794(v2,2023) · 研究领域: 全球中期天气预报 · 图神经网络 · 学习型模拟器 · 一句话定位: 它不是把天气图当普通图片处理,而是把全球大气放到球面多尺度图上,学习每隔 6 小时如何变化。

官方题名: Robust deep learning–based protein sequence design using ProteinMPNN · 作者: J. Dauparas 等|期刊: Science 378, 49–56 (2022)|DOI: 10.1126/science.add2187 · 一句话问题: 已知想要的蛋白质骨架,怎样快速找到一条真的会折成这个形状的氨基酸序列?

论文原题: De novo design of protein structure and function with RFdiffusion · 作者: Joseph L. Watson、David Juergens、Nathaniel R. Bennett 等 · 发表于: Nature 620, 1089–1100(2023) · 论文: https://www.nature.com/articles/s41586-023-06415-8

官方题名: Accurate prediction of protein structures and interactions using a three-track neural network · 作者: Minkyung Baek 等 · 期刊: Science 373, 871–876 (2021) · DOI: 10.1126/science.abj8754 · 主来源: [Science 论文页](https://www.science.org/doi

原文标题: Evolutionary-scale prediction of atomic-level protein structure with a language model · 作者: Zeming Lin 等|期刊: Science 379, 1123–1130 (2023)|DOI: 10.1126/science.ade2574

原文标题: Accurate structure prediction of biomolecular interactions with AlphaFold 3 · 作者: Josh Abramson、Jonas Adler、Jack Dunger 等|期刊: Nature 630, 493–500 (2024)|发表: 2024-05-08 · 原文: Nature|DOI: 10.1038/s41586-024-07487-w

官方标题: Cosmos World Foundation Model Platform for Physical AI · 作者: NVIDIA,Niket Agarwal 等 · 版本: arXiv:2501.03575v3(2025-07-09) · 原文: arXiv 摘要页 · 论文全文

官方原题: Diffusion Models Are Real-Time Game Engines · 作者: Dani Valevski、Yaniv Leviathan、Moab Arar、Shlomi Fruchter · 版本: arXiv:2408.14837v2,2025-04-24 修订;ICLR 2025 · 原文: arXiv 摘要 · HTML 全文

原题: Diffusion for World Modeling: Visual Details Matter in Atari · 作者: Eloi Alonso、Adam Jelley、Vincent Micheli、Anssi Kanervisto、Amos Storkey、Tim Pearce、François Fleuret · 版本: arXiv:2405.12399v2,NeurIPS 2024 Spotlight · 来源: arXiv 摘要 · [论文全文](https

官方标题: UniSim: A Neural Closed-Loop Sensor Simulator · 作者: Ze Yang、Yun Chen、Jingkang Wang、Sivabalan Manivasagam、Wei-Chiu Ma、Anqi Joyce Yang、Raquel Urtasun · 出处: CVPR 2023 Highlight;arXiv:2308.01898 · 一句话定位: 把一次真实道路采集变成可编辑的数字场景,让自动驾驶系统做出新动作后还能看到随

官方标题: GAIA-1: A Generative World Model for Autonomous Driving · 作者: Anthony Hu、Lloyd Russell、Hudson Yeo、Zak Murez、George Fedoseev、Alex Kendall、Jamie Shotton、Gianluca Corrado · 来源: arXiv:2309.17080,2023 年 9 月 29 日提交,技术报告

官方原题: V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning · 作者: Mahmoud Assran 等|发布日期: 2025 年 6 月 11 日|论文: arXiv:2506.09985|领域: 视频理解、世界模型、机器人规划

官方原题: Genie: Generative Interactive Environments · 作者: Jake Bruce、Michael Dennis、Ashley Edwards、Jack Parker-Holder 等 25 人(Google DeepMind) · 论文: arXiv:2402.15391 · 2024 年 2 月 23 日提交 · 研究类型: 生成式世界模型 · 视频建模 · 无监督动作学习

官方标题: TD-MPC2: Scalable, Robust World Models for Continuous Control · 作者: Nicklas Hansen、Hao Su、Xiaolong Wang · 发表: ICLR 2024;arXiv:2310.16828(v2,2024-03-21) · 主来源: arXiv 摘要页 · 论文 PDF

官方题名: Temporal Difference Learning for Model Predictive Control · 作者: Nicklas Hansen、Xiaolong Wang、Hao Su · 论文: arXiv:2203.04955 · ICML 2022 · arXiv v2(2022-07-19) · 领域: 强化学习、连续控制、机器人

论文信息 · 官方标题:Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model · 作者:Julian Schrittwieser 等|arXiv:1911.08265|2019(后续修订) · 主来源:arXiv 摘要 · 论文 PDF

官方题名:Mastering Diverse Domains through World Models > Danijar Hafner、Jurgis Pasukonis、Jimmy Ba、Timothy Lillicrap · arXiv:2301.04104v2 · 2024-04-17 · 主来源:arXiv 摘要页 · 论文全文

官方源标题: Mastering Atari with Discrete World Models · 作者: Danijar Hafner、Timothy Lillicrap、Mohammad Norouzi、Jimmy Ba · 发表: ICLR 2021;arXiv:2010.02193(v4,2022-02-12) · 主来源: arXiv 摘要与论文正文

官方题名: Dream to Control: Learning Behaviors by Latent Imagination · 作者: Danijar Hafner、Timothy Lillicrap、Jimmy Ba、Mohammad Norouzi · 论文: arXiv:1912.01603,ICLR 2020

论文原题: Learning Latent Dynamics for Planning from Pixels · 作者: Danijar Hafner、Timothy Lillicrap、Ian Fischer、Ruben Villegas、David Ha、Honglak Lee、James Davidson · 版本: arXiv:1811.04551v5(2019-06-04) · 论文主页 · PDF

官方源标题: World Models · 作者: David Ha、Jürgen Schmidhuber · 时间: 2018 年 3 月 27 日(arXiv 首次提交) · 论文: arXiv:1803.10122 | 作者交互版全文

官方来源标题: Sora 2 System Card · 发布方: OpenAI · 日期: 2025 年 9 月 30 日 · 篇幅: 7 页 · 原始资料: 官方 PDF · 阅读定位: 这是一份系统安全说明,不是披露模型架构与完整能力基准的技术论文。

官方来源标题: LLM Critics Help Catch LLM Bugs · 作者: Nat McAleese、Rai (Michael Pokorny)、Juan Felipe Cerón Uribe、Evgenia Nitishinskaya、Maja Trębacz、Jan Leike · 来源: arXiv:2407.00215 · 2024-06-28

官方原题: Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision · 作者: Collin Burns、Pavel Izmailov、Jan Hendrik Kirchner 等|发布: 2023-12-14|来源: arXiv:2312.09390

官方题名: Learning to summarize from human feedback · 作者: Nisan Stiennon、Long Ouyang、Jeff Wu、Daniel M. Ziegler、Ryan Lowe、Chelsea Voss、Alec Radford、Dario Amodei、Paul Christiano · 发表: NeurIPS 2020 · arXiv:2009.01325 · [会议论文 PDF](https://proceedings.neurips

官方标题: WebGPT: Browser-assisted question-answering with human feedback · 作者: Reiichiro Nakano 等 · 版本: arXiv:2112.09332v3(2022-06-01) · 论文: https://arxiv.org/abs/2112.09332

官方标题: Jukebox: A Generative Model for Music · 作者: Prafulla Dhariwal、Heewoo Jun、Christine Payne、Jong Wook Kim、Alec Radford、Ilya Sutskever · 来源: arXiv:2005.00341,2020 年 4 月 30 日提交

官方标题: Consistency Models · 作者: Yang Song、Prafulla Dhariwal、Mark Chen、Ilya Sutskever · 发表: ICML 2023 · arXiv:2303.01469 · 论文正文(PMLR)

原文标题: Improved Denoising Diffusion Probabilistic Models · 作者: Alex Nichol、Prafulla Dhariwal · 发表: ICML 2021(PMLR 139) · 论文: arXiv:2102.09672 · PMLR 正文

官方标题:Diffusion Models Beat GANs on Image Synthesis · 作者:Prafulla Dhariwal、Alex Nichol|arXiv: 2105.05233|首次提交:2021-05-11|版本:v4

官方标题: Shap-E: Generating Conditional 3D Implicit Functions · 作者: Heewoo Jun、Alex Nichol · 发布: 2023 年 5 月 3 日 · 论文: arXiv:2305.02463

官方标题: Point-E: A System for Generating 3D Point Clouds from Complex Prompts · 作者: Alex Nichol、Heewoo Jun、Prafulla Dhariwal、Pamela Mishkin、Mark Chen · 来源: arXiv:2212.08751 · 2022 年 12 月 16 日提交 · cs.CV / cs.LG

官方题名: GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models · 作者: Alex Nichol、Prafulla Dhariwal、Aditya Ramesh、Pranav Shyam、Pamela Mishkin、Bob McGrew、Ilya Sutskever、Mark Chen · 来源: arXiv:2112.10741,v3,2022-03-0

官方标题:Hierarchical Text-Conditional Image Generation with CLIP Latents · 作者:Aditya Ramesh、Prafulla Dhariwal、Alex Nichol、Casey Chu、Mark Chen · 发表时间:2022 年 4 月 · arXiv:2204.06125

官方源标题: GPT-4o System Card · 作者: OpenAI(2024) · 主来源: arXiv:2410.21276 · 论文全文 · 阅读定位: 这是一份系统卡。它重点说明模型能力、风险评测与部署护栏,并没有公开足以复现模型的完整架构和训练配方。

官方标题: GPT-4 Technical Report · 作者: OpenAI 等|版本: arXiv v6(2024-03-04)|论文: arXiv:2303.08774 · 一句话定位: 这份报告展示了 GPT-4 的多模态能力、可预测扩展方法与安全缓解措施,同时明确提醒:更高的考试分数并不等于稳定、透明或无风险。

官方英文标题: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning · 作者: DeepSeek-AI | 论文: arXiv:2501.12948 | 版本: v2(2026-01-04)

官方源标题:DeepSeek-V3 Technical Report · 作者:DeepSeek-AI|版本:arXiv v2,2025-02-18|论文:arXiv:2412.19437

官方源标题: DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model · 作者: DeepSeek-AI · 版本: arXiv v5,2024-06-19 · 论文: arXiv:2405.04434

官方标题: DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models · 作者: Zhihong Shao 等|版本: arXiv v3,2024-04-27|论文: arXiv:2402.03300

论文原题: DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence · 作者: Daya Guo 等 · 版本: arXiv:2401.14196v2,2024-01-26 · 主来源: arXiv 摘要 · 论文 PDF

官方原题: DeepSeek LLM: Scaling Open-Source Language Models with Longtermism · 作者: DeepSeek-AI(Xiao Bi 等) · 提交日期: 2024-01-05 · 论文: arXiv:2401.02954 · 一句话定位: 先用小规模实验估算怎样分配训练算力,再据此训练 7B 与 67B 中英双语模型。

论文:Runjia Li 等,EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing,CVPR 2026。 · 阅读提示:文中的“实时”是作者在单张 H100 GPU、512×384 分辨率等特定条件下测得的系统表现,不等于已在消费级 AR 眼镜上验证。

论文:Xingyue Huang 等,Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling,arXiv:2601.12145v2,2026-04-16。本文只解释 v2;论文目前的 arXiv 页面已有更新版本。原文:PDF · HTML

论文: Reciprocity, Homophily, and Social Network Effects in Pictorial Communication: A Case Study of Bitmoji Stickers(CHI 2023) 研究对象: Snapchat 上的 Bitmoji 贴纸使用元数据;不分析消息、图片、视频或贴纸内容。

官方原题: Direct Preference Optimization: Your Language Model is Secretly a Reward Model · 作者: Rafael Rafailov、Archit Sharma、Eric Mitchell、Stefano Ermon、Christopher D. Manning、Chelsea Finn · 发表: NeurIPS 2023;本文依据 arXiv v3(2024-07-29) · 一手来源: [arXiv 摘要页](https://arxiv.org/abs/2305.182

官方标题: Robust Speech Recognition via Large-Scale Weak Supervision · 作者: Alec Radford、Jong Wook Kim、Tao Xu、Greg Brockman、Christine McLeavey、Ilya Sutskever · 来源: arXiv:2212.04356,2022 年 12 月 6 日提交

原文标题: Highly accurate protein structure prediction with AlphaFold · 作者: John Jumper、Richard Evans、Alexander Pritzel 等|期刊: Nature 596, 583–589 (2021)|发表: 2021-07-15|DOI: 10.1038/s41586-021-03819-2

官方源标题: Zero-Shot Text-to-Image Generation · 作者: Aditya Ramesh、Mikhail Pavlov、Gabriel Goh、Scott Gray、Chelsea Voss、Alec Radford、Mark Chen、Ilya Sutskever · 版本: arXiv:2102.12092v2,2021-02-26|摘要页|论文 PDF

原始标题: End-to-End Object Detection with Transformers · 作者: Nicolas Carion、Francisco Massa、Gabriel Synnaeve、Nicolas Usunier、Alexander Kirillov、Sergey Zagoruyko · 来源: arXiv:2005.12872(v3,2020-05-28) · 阅读范围: 论文正文与附录;以下数字均来自论文报告的 COCO 2017 实验。

论文原题: NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis · 作者: Ben Mildenhall、Pratul P. Srinivasan、Matthew Tancik、Jonathan T. Barron、Ravi Ramamoorthi、Ren Ng · 来源: arXiv:2003.08934,2020 年 3 月提交 · 阅读提示: 下文的实验数字和结论均来自论文;面向产品的判断

官方原题:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer · 作者:Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu · 出版:JMLR 21(140):1–67, 2020;arXiv:1910.10683 · 一手来源:[JMLR 论文页](htt

官方题名: Language Models are Unsupervised Multitask Learners · 作者: Alec Radford、Jeffrey Wu、Rewon Child、David Luan、Dario Amodei、Ilya Sutskever · 发布机构与年份: OpenAI,2019 · 主源: [论文 PDF(24 页)](https://cdn.openai.com/better-language-models/languagemodelsareunsupervisedmultitasklearners

官方标题: Improving Language Understanding by Generative Pre-Training · 作者: Alec Radford、Karthik Narasimhan、Tim Salimans、Ilya Sutskever(OpenAI) · 来源: 论文 PDF · 预印本 / 进行中的工作 · 12 页

官方源标题: Deep contextualized word representations · 作者: Matthew E. Peters、Mark Neumann、Mohit Iyyer、Matt Gardner、Christopher Clark、Kenton Lee、Luke Zettlemoyer · 论文: arXiv:1802.05365,NAACL 2018;本文依据 arXiv v2(2018-03-22) · 一句话: ELMo 不再给每个词发一张永久不变的“身份证

官方原题: Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm · 作者: David Silver、Thomas Hubert、Julian Schrittwieser 等|DeepMind|2017 · 主源: arXiv:1712.01815|论文 PDF

官方标题: Proximal Policy Optimization Algorithms · 作者: John Schulman、Filip Wolski、Prafulla Dhariwal、Alec Radford、Oleg Klimov · 来源: arXiv:1707.06347v2,2017-08-28 修订,12 页

原论文标题: You Only Look Once: Unified, Real-Time Object Detection · 作者: Joseph Redmon、Santosh Divvala、Ross Girshick、Ali Farhadi · 版本: arXiv:1506.02640v5,2016-05-09 · 主来源: arXiv 摘要页 · 论文 PDF

官方源标题: U-Net: Convolutional Networks for Biomedical Image Segmentation · 作者: Olaf Ronneberger、Philipp Fischer、Thomas Brox · 来源: arXiv:1505.04597,2015 年 5 月 18 日提交;论文共 8 页

官方标题: Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift · 作者: Sergey Ioffe、Christian Szegedy · 年份: 2015 · 来源: arXiv:1502.03167(v3)

官方原题: Adam: A Method for Stochastic Optimization · 作者: Diederik P. Kingma、Jimmy Ba · 发表: ICLR 2015 · 版本: arXiv v9(2017-01-30) · 主来源: arXiv:1412.6980 · 论文 PDF

官方标题: Neural Machine Translation by Jointly Learning to Align and Translate · 作者: Dzmitry Bahdanau、Kyunghyun Cho、Yoshua Bengio · 来源: arXiv:1409.0473(2014 年 9 月提交;论文正文修订版标注为 2016 年 5 月) · 任务: WMT 2014 英语→法语新闻翻译

原文标题: Sequence to Sequence Learning with Neural Networks · 作者: Ilya Sutskever、Oriol Vinyals、Quoc V. Le · 版本: arXiv v3(2014-12-14) · 原文: arXiv 摘要页 · 论文 PDF

官方源标题: Efficient Estimation of Word Representations in Vector Space · 作者: Tomas Mikolov、Kai Chen、Greg Corrado、Jeffrey Dean · 来源: arXiv:1301.3781v3(2013-09-07 修订)|论文 PDF · 阅读定位: 这是一篇 2013 年论文的原始贡献解读,不是对今天所有词向量方法

原始标题: Playing Atari with Deep Reinforcement Learning · 作者: Volodymyr Mnih、Koray Kavukcuoglu、David Silver、Alex Graves、Ioannis Antonoglou、Daan Wierstra、Martin Riedmiller · 发表信息: 2013 年 12 月 19 日提交,NIPS Deep Learning Workshop 2013 · 主来源: [arXiv:1312.5602](https://arxiv.org/abs/1312.

论文:Alex Krizhevsky、Ilya Sutskever、Geoffrey E. Hinton,ImageNet Classification with Deep Convolutional Neural Networks,NIPS 2012。本文以论文 PDF为主要依据;页码均指 PDF 印刷页。

论文:Haotian Liu 等,Visual Instruction Tuning,NeurIPS 2023 Oral,arXiv v2(2023-12-11)。摘要页 · 论文 PDF

论文:Alexander Kirillov 等,Segment Anything(2023) · 原文:arXiv 摘要页 · PDF

这篇论文研究一个直白问题:大语言模型不只要会回答,还要会查证据、做决定、并在环境里执行动作。作者发现,单靠链式思维容易幻觉和错误传播,单靠动作又缺少抽象推理和计划能力。

论文:Jordan Hoffmann 等,Training Compute-Optimal Large Language Models,2022。 · 原文:arXiv 摘要页 · PDF

论文:Long Ouyang 等,Training language models to follow instructions with human feedback,2022(arXiv:2203.02155)

论文:Robin Rombach 等,High-Resolution Image Synthesis with Latent Diffusion Models,CVPR 2022(arXiv v2,2022-04-13)。论文摘要与元数据 · 全文 HTML

论文:Edward J. Hu 等,LoRA: Low-Rank Adaptation of Large Language Models,arXiv v2(2021)。摘要页 · 论文 PDF

论文:Alec Radford 等,Learning Transferable Visual Models From Natural Language Supervision(2021) · 一句话问题:视觉模型怎样摆脱预先固定的标签表,在没有下游训练样本时也能按自然语言识别图片?

论文:Alexey Dosovitskiy 等,An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale,ICLR 2021,arXiv v2。 · 原文:摘要页 · PDF

论文:Jonathan Ho、Ajay Jain、Pieter Abbeel,Denoising Diffusion Probabilistic Models(2020) · 一句话问题:能否不用生成器与判别器对抗,而是从随机噪声出发,靠许多次容易学习的小修正生成高质量图像?

论文:Patrick Lewis 等,Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,NeurIPS 2020;本文依据 arXiv v4 与其全文整理。

论文:Tom B. Brown 等,Language Models are Few-Shot Learners,2020(arXiv v4) · 阅读定位:这篇论文证明的是一种有潜力但不稳定的新使用范式,不是“通用智能已经解决”。

论文:Jared Kaplan 等,Scaling Laws for Neural Language Models(2020) · 原文:arXiv 摘要页 · PDF · 阅读提示:这是一项关于 Transformer 语言模型交叉熵损失 的经验研究,不是对通用能力、安全性或产品价值的直接证明。

Jacob Devlin、Ming-Wei Chang、Kenton Lee、Kristina Toutanova,2018(arXiv v2,2019)。原论文:摘要页 · PDF

论文:Ian J. Goodfellow 等,Generative Adversarial Nets(2014) · 原文:arXiv:1406.2661

论文:Diederik P. Kingma、Max Welling,Auto-Encoding Variational Bayes(arXiv:1312.6114,v11) · 原文:摘要页 · 全文 · 阅读提示:本文区分“论文报告的结果”和“面向实践的解释”;后者不会冒充作者结论。

重读 Wei 等人的《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》:一项简单的提示格式改动,为什么会在足够大的语言模型上释放多步推理能力?它又没有证明什么?

图 0:ResNet 的核心不是无条件堆叠更多层,而是用恒等捷径为深层网络保留一条稳定的信息通路。

重新回到 Attention Is All You Need 的原始证据,解释 Transformer 如何把序列中的递归计算改写为可并行的全局关系,同时保留位置、因果和自回归生成。

论文:Tingwu Wang、Olivier Dionne 等,MotionBricks: Scalable Real-Time Motions with Modular Latent Generative Model and Smart Primitives,arXiv:2604.24833v1,2026-04-27。论文标注为 CC BY 4.0;本文三幅图均为重新创作的教学示意图,不是论文图的复制。论文页 · DOI

FAQ
普通总结常压缩摘要和结论;PaperBridge 还解释方法机制、证据强弱、对照实验、局限与实际意义,并用原创图解帮助建立直觉。
可以搜索论文标题,也可以粘贴 arXiv、论文页面或公开 PDF 链接;登录后还能直接上传公开论文 PDF。已有报告会直接打开,没有对应语言版本时可以生成新解读。
公开报告主要提供中文、英文和日文版本;生成流程也支持西班牙语。每种语言使用独立页面,方便读者和搜索引擎找到正确版本。