返回报告库

AI / Technology

DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推

这篇论文想同时解决两个痛点:长上下文太贵,以及开源模型在推理、工具使用和智能体任务上还不够强。作者给出的核心改动是 DeepSeek Sparse Attention(DSA),把主模型的注意力计算从密集改成稀疏,并配合更大规模的强化学习和合成智能体数据继续后训练。

这篇论文在补什么缺口

长上下文与工具智能体的双重压力

作者面对的是开源大模型的两个现实问题。第一,长上下文会把注意力计算推得很贵,尤其在检索、搜索、代码和工具调用里。第二,单靠通用预训练,模型在复杂推理、智能体行为和指令跟随上仍会落后于前沿闭源模型。

因此,论文不是只追求更大参数,而是想同时改计算结构和后训练方式:前者降低长序列成本,后者提高推理与工具使用能力。

密集注意力:简单,但长序列成本太高

稠密注意力在长序列上的代价

传统注意力会让每个 token 关注全部历史 token,计算量随长度迅速上升。论文把这种做法视为长上下文效率的主要瓶颈。

作者的对比对象包括 DeepSeek-V3.1-Terminus 这类仍以更密集注意力为主的模型路线。它们在长上下文上可用,但在计算上不够节省。

DeepSeek Sparse Attention:只让该看的部分参与注意力

DSA:先挑再算的稀疏注意力

论文的核心机制是 DeepSeek Sparse Attention(DSA)。可以先把它理解成:不是让模型看完整个历史,而是让它先筛出最有用的一小部分,再做主要计算。

正文里提到,DSA 使用 lightning indexer 和细粒度 token 选择;在 DeepSeek-V3.2-Exp 中,每个查询 token 只保留 2048 个 key-value tokens 参与稀疏阶段的计算。

两阶段继续训练:先热身,再稀疏化

从续训到后训练:算力、RL 与合成任务一起放大

持续预训练分成 dense warm-up 和 sparse training 两段,并都对齐 128K 长上下文数据。文中给出的训练细节是:warm-up 为 1000 steps、2.1B tokens、学习率 10^-3;sparse training 为 15000 steps、943.7B tokens、学习率 7.3×10^-6。

作者是在 DeepSeek-V3.1-Terminus 上继续训练,并在基于 MLA 的 MQA 模式里实现 DSA。这个设计的意思是:先让模型适应,再把稀疏注意力真正嵌进去。

这些证据,能把结论推到哪一步

更快的长上下文不等于完全省算力

DeepSeek-V3.2 提出 DeepSeek Sparse Attention(DSA),目标是在长上下文下压低注意力计算,同时尽量保住模型效果。

论文把训练改成了两段持续预训练:先 dense warm-up,再 sparse training;后者在 128K 长上下文数据上继续训练。

DSA 稀疏阶段对每个查询 token 只保留 2048 个 key-value tokens,并结合 lightning indexer 做检索式选择。

公开信息主要来自摘要和分节笔记,缺少完整消融、置信区间和训练细节。

路径一:搜索、代码和通用智能体的数据构建

面向产品的落地方式:搜索、代码、工具调用与竞赛式推理

作者把训练环境拆成不同类型:Search Agent、Code Agent、General Agent 和 Code Interpreter。搜索任务使用真实网络搜索 API,并保留 ground-truth 正确且所有候选都可证伪错误的样本。

Code Agent 从 GitHub 挖掘数百万 issue-PR 对来自动构建可执行环境;General Agent 通过 1,827 个任务导向环境最终得到 4,417 个任务。表中还给出 Search Agent 50,275、Code Agent 24,667、General Agent 4,417、Code Interpreter 5,908 的规模信息。

  • 这条路径的重点不是“更多数据”而已,而是“可验证、可执行、可复现”的数据。
  • 搜索、代码和通用任务分开构建,说明作者在追求任务分布的分工,而不是一锅端。
研究附录术语、来源与待验证问题

论文证据

高可信

DeepSeek-V3.2 提出 DeepSeek Sparse Attention(DSA),目标是在长上下文下压低注意力计算,同时尽量保住模型效果。

摘要;Paper section 3:DSA 将主模型核心注意力从 O(L²) 降到 O(Lk),并声称保持长上下文性能。

高可信

论文把训练改成了两段持续预训练:先 dense warm-up,再 sparse training;后者在 128K 长上下文数据上继续训练。

Paper section 3:warm-up 1000 steps / 2.1B tokens / 学习率 10^-3;sparse training 15000 steps / 943.7B tokens / 学习率 7.3×10^-6。

高可信

DSA 稀疏阶段对每个查询 token 只保留 2048 个 key-value tokens,并结合 lightning indexer 做检索式选择。

Paper section 3:sparse training 阶段选取每个查询 token 的 2048 个 key-value tokens;lightning indexer 仍为 O(L²)。

中可信

作者报告 DeepSeek-V3.2 在多项推理基准上接近 Kimi-k2-thinking 和 GPT-5;DeepSeek-V3.2-Speciale 在更高算力下进一步接近或超过前沿闭源模型。

摘要;Paper section 5:作者称 DeepSeek-V3.2 接近 Kimi-k2-thinking 和 GPT-5,Speciale 在部分竞赛级任务上达到金牌水平。

高可信

论文构建了大规模 agentic task synthesis pipeline,并把它用于搜索、代码、通用 agent、代码解释等训练环境。

摘要;Paper section 4:Table 1 显示 code agent 24667、search agent 50275、general agent 4417、code interpreter 5908。

高可信

作者在结果中报告,DeepSeek-V3.2-Speciale 在 IOI 2025、ICPC World Final 2025、IMO 2025、CMO 2025 达到金牌水平。

摘要;Paper section 5/6:作者明确写到 gold-medal 表现,且 section 6 列出竞赛相关评测流程。

高可信

在工具使用与搜索类任务上,作者报告 DeepSeek-V3.2 相比前代有更高分数,且 RL 预算增加与性能提升相关。

Paper section 5:RL 训练预算已超过预训练成本的 10%,性能随预算增加持续提升;section 6:Terminal Bench 2.0、SWE Verified、ToolUse、MCP-Universe 等指标均有提升。

能力边界与局限

  • 公开信息主要来自摘要和分节笔记,缺少完整消融、置信区间和训练细节。
  • DSA 的 lightning indexer 仍是 O(L²),并未消除全部长上下文开销。
  • 最大上下文长度只到 128K,且部分测试样例会超限。
  • Speciale 的 token efficiency 明显弱于 Gemini-3.0-Pro。
  • 工具/agent 评测很依赖具体框架与上下文管理策略。

和其他方案放在一起看

方案类型优势限制判断
DeepSeek-V3.2 vs DeepSeek-V3.1-Terminus同系比较DSA 版本在长上下文与多项 agent/推理评测上更强;section 6 给出若干任务分数提升。不少提升来自作者自报,缺少完整消融和统一评测协议细节。更优,但证据主要来自作者报告的内部评测。
DeepSeek-V3.2 vs GPT-5 / Kimi-k2-thinking闭源/开源前沿比较摘要声称 V3.2 可接近 GPT-5 和 Kimi-k2-thinking。摘要未给出完整任务集合、评分方法和统计细节。可视为接近前沿的主张,但证据不够细。
DeepSeek-V3.2-Speciale vs Gemini-3.0-Pro高算力变体比较摘要与 section 7 声称 Speciale 可与 Gemini-3.0-Pro 对齐或在部分竞赛任务上更强。特定任务上的 token 效率较弱,且不清楚是否在所有场景都成立。在高难度竞赛任务上很强,但效率代价较高。
DSA vs 标准 dense attention机制比较主注意力复杂度从 O(L²) 降到 O(Lk),更适合长上下文。lightning indexer 仍保留 O(L²) 成本,整体收益受实现影响。计算上更省,但不是完全线性化的无代价替代。

还不能确定的地方

DeepSeek-V3.2 与 GPT-5 / Gemini-3.0-Pro 的对比结论缺少完整评测协议。

现有信息只来自摘要和分节笔记,没有完整表格、任务集合、打分细则和统计显著性。

查看正文对应表格、附录和评测设置,确认任务列表、指标和运行条件。

DSA 带来的实际计算节省幅度尚不清楚。

只看到复杂度表达式 O(L²)→O(Lk),没有吞吐、延迟、显存或端到端成本数字。

查找系统实验部分的吞吐/延迟/显存表,并核对是否含不同上下文长度。

128K 以上上下文的效果不确定。

笔记只说明训练对齐到 128K,且部分测试样例超限。

查看长上下文基准的完整结果和是否有超过 128K 的外推实验。

Speciale 的高分是否稳定依赖更高推理预算。

笔记明确说 Speciale token efficiency 较弱,但没有给出统一预算下的分布。

对照不同 budget 下的竞赛与基准结果,检查是否存在明显预算敏感性。

工具/agent 提升是否可迁移到其他框架仍不确定。

评测依赖具体框架、上下文管理和自动合成环境,跨系统泛化未直接证明。

在不同 agent 框架和不同工具栈上复现实验。

术语表

DeepSeek Sparse Attention(DSA)
一种稀疏注意力机制。先筛选少量重要历史 token,再做主要计算,以降低长上下文成本。
lightning indexer
DSA 里的筛选器,用来从长历史里找出更值得保留的 token。
key-value tokens
注意力里被读取的历史 token。这里保留少量 key-value tokens 来减少计算量。
dense warm-up
稀疏训练前的密集预热阶段,用较短训练先让模型适应。
sparse training
把稀疏注意力真正纳入持续预训练的阶段。
post-training compute
预训练之后继续投入的训练算力,通常用于强化学习、偏好优化和任务对齐。
agentic task synthesis pipeline
自动合成智能体任务的数据流水线,用来生成搜索、代码和多轮工具使用训练样本。
non-thinking mode
不显式展开长思考轨迹的推理模式,通常更轻量,但可能略弱于思考模式。

参考来源

来源追踪

摘要: 提出 DSA,目标是降低长上下文注意力复杂度并保持性能。 arXiv 摘要

摘要: DeepSeek-V3.2 的表现可与 GPT-5 相当。 arXiv 摘要

摘要: DeepSeek-V3.2-Speciale 超过 GPT-5,并在 2025 IMO 和 IOI 取得金牌。 arXiv 摘要

Paper section 3: 持续预训练分为 dense warm-up 和 sparse training,且给出了 1000 / 15000 steps 与 token 数。 arXiv HTML full text

Paper section 3: 稀疏阶段每个查询 token 选择 2048 个 key-value tokens。 arXiv HTML full text

Paper section 4: 构建了搜索、代码、通用 agent、代码解释等多类 agentic 训练环境。 arXiv HTML full text

Paper section 5: RL 训练预算超过预训练成本 10%,且性能随预算上升而提升。 arXiv HTML full text

Paper section 6: 在 Terminal Bench 2.0、SWE Verified、ToolUse、MCP-Universe 等任务上报告了分数提升。 arXiv HTML full text

关于这篇论文的三个关键问题

DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推 解决了什么问题?

作者面对的是开源大模型的两个现实问题。第一,长上下文会把注意力计算推得很贵,尤其在检索、搜索、代码和工具调用里。第二,单靠通用预训练,模型在复杂推理、智能体行为和指令跟随上仍会落后于前沿闭源模型。

DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推 的核心结论有哪些证据?

DeepSeek-V3.2 提出 DeepSeek Sparse Attention(DSA),目标是在长上下文下压低注意力计算,同时尽量保住模型效果。 摘要;Paper section 3:DSA 将主模型核心注意力从 O(L²) 降到 O(Lk),并声称保持长上下文性能。

阅读 DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推 时最需要注意什么局限?

公开信息主要来自摘要和分节笔记,缺少完整消融、置信区间和训练细节。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro