AI / Technology
DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推
这篇论文想同时解决两个痛点:长上下文太贵,以及开源模型在推理、工具使用和智能体任务上还不够强。作者给出的核心改动是 DeepSeek Sparse Attention(DSA),把主模型的注意力计算从密集改成稀疏,并配合更大规模的强化学习和合成智能体数据继续后训练。
这篇论文在补什么缺口
作者面对的是开源大模型的两个现实问题。第一,长上下文会把注意力计算推得很贵,尤其在检索、搜索、代码和工具调用里。第二,单靠通用预训练,模型在复杂推理、智能体行为和指令跟随上仍会落后于前沿闭源模型。
因此,论文不是只追求更大参数,而是想同时改计算结构和后训练方式:前者降低长序列成本,后者提高推理与工具使用能力。
密集注意力:简单,但长序列成本太高
传统注意力会让每个 token 关注全部历史 token,计算量随长度迅速上升。论文把这种做法视为长上下文效率的主要瓶颈。
作者的对比对象包括 DeepSeek-V3.1-Terminus 这类仍以更密集注意力为主的模型路线。它们在长上下文上可用,但在计算上不够节省。
DeepSeek Sparse Attention:只让该看的部分参与注意力
论文的核心机制是 DeepSeek Sparse Attention(DSA)。可以先把它理解成:不是让模型看完整个历史,而是让它先筛出最有用的一小部分,再做主要计算。
正文里提到,DSA 使用 lightning indexer 和细粒度 token 选择;在 DeepSeek-V3.2-Exp 中,每个查询 token 只保留 2048 个 key-value tokens 参与稀疏阶段的计算。
两阶段继续训练:先热身,再稀疏化
持续预训练分成 dense warm-up 和 sparse training 两段,并都对齐 128K 长上下文数据。文中给出的训练细节是:warm-up 为 1000 steps、2.1B tokens、学习率 10^-3;sparse training 为 15000 steps、943.7B tokens、学习率 7.3×10^-6。
作者是在 DeepSeek-V3.1-Terminus 上继续训练,并在基于 MLA 的 MQA 模式里实现 DSA。这个设计的意思是:先让模型适应,再把稀疏注意力真正嵌进去。
这些证据,能把结论推到哪一步
DeepSeek-V3.2 提出 DeepSeek Sparse Attention(DSA),目标是在长上下文下压低注意力计算,同时尽量保住模型效果。
论文把训练改成了两段持续预训练:先 dense warm-up,再 sparse training;后者在 128K 长上下文数据上继续训练。
DSA 稀疏阶段对每个查询 token 只保留 2048 个 key-value tokens,并结合 lightning indexer 做检索式选择。
公开信息主要来自摘要和分节笔记,缺少完整消融、置信区间和训练细节。
路径一:搜索、代码和通用智能体的数据构建
作者把训练环境拆成不同类型:Search Agent、Code Agent、General Agent 和 Code Interpreter。搜索任务使用真实网络搜索 API,并保留 ground-truth 正确且所有候选都可证伪错误的样本。
Code Agent 从 GitHub 挖掘数百万 issue-PR 对来自动构建可执行环境;General Agent 通过 1,827 个任务导向环境最终得到 4,417 个任务。表中还给出 Search Agent 50,275、Code Agent 24,667、General Agent 4,417、Code Interpreter 5,908 的规模信息。
- 这条路径的重点不是“更多数据”而已,而是“可验证、可执行、可复现”的数据。
- 搜索、代码和通用任务分开构建,说明作者在追求任务分布的分工,而不是一锅端。
研究附录术语、来源与待验证问题
论文证据
DeepSeek-V3.2 提出 DeepSeek Sparse Attention(DSA),目标是在长上下文下压低注意力计算,同时尽量保住模型效果。
摘要;Paper section 3:DSA 将主模型核心注意力从 O(L²) 降到 O(Lk),并声称保持长上下文性能。
论文把训练改成了两段持续预训练:先 dense warm-up,再 sparse training;后者在 128K 长上下文数据上继续训练。
Paper section 3:warm-up 1000 steps / 2.1B tokens / 学习率 10^-3;sparse training 15000 steps / 943.7B tokens / 学习率 7.3×10^-6。
DSA 稀疏阶段对每个查询 token 只保留 2048 个 key-value tokens,并结合 lightning indexer 做检索式选择。
Paper section 3:sparse training 阶段选取每个查询 token 的 2048 个 key-value tokens;lightning indexer 仍为 O(L²)。
作者报告 DeepSeek-V3.2 在多项推理基准上接近 Kimi-k2-thinking 和 GPT-5;DeepSeek-V3.2-Speciale 在更高算力下进一步接近或超过前沿闭源模型。
摘要;Paper section 5:作者称 DeepSeek-V3.2 接近 Kimi-k2-thinking 和 GPT-5,Speciale 在部分竞赛级任务上达到金牌水平。
论文构建了大规模 agentic task synthesis pipeline,并把它用于搜索、代码、通用 agent、代码解释等训练环境。
摘要;Paper section 4:Table 1 显示 code agent 24667、search agent 50275、general agent 4417、code interpreter 5908。
作者在结果中报告,DeepSeek-V3.2-Speciale 在 IOI 2025、ICPC World Final 2025、IMO 2025、CMO 2025 达到金牌水平。
摘要;Paper section 5/6:作者明确写到 gold-medal 表现,且 section 6 列出竞赛相关评测流程。
在工具使用与搜索类任务上,作者报告 DeepSeek-V3.2 相比前代有更高分数,且 RL 预算增加与性能提升相关。
Paper section 5:RL 训练预算已超过预训练成本的 10%,性能随预算增加持续提升;section 6:Terminal Bench 2.0、SWE Verified、ToolUse、MCP-Universe 等指标均有提升。
能力边界与局限
- 公开信息主要来自摘要和分节笔记,缺少完整消融、置信区间和训练细节。
- DSA 的 lightning indexer 仍是 O(L²),并未消除全部长上下文开销。
- 最大上下文长度只到 128K,且部分测试样例会超限。
- Speciale 的 token efficiency 明显弱于 Gemini-3.0-Pro。
- 工具/agent 评测很依赖具体框架与上下文管理策略。
和其他方案放在一起看
还不能确定的地方
DeepSeek-V3.2 与 GPT-5 / Gemini-3.0-Pro 的对比结论缺少完整评测协议。
现有信息只来自摘要和分节笔记,没有完整表格、任务集合、打分细则和统计显著性。
查看正文对应表格、附录和评测设置,确认任务列表、指标和运行条件。
DSA 带来的实际计算节省幅度尚不清楚。
只看到复杂度表达式 O(L²)→O(Lk),没有吞吐、延迟、显存或端到端成本数字。
查找系统实验部分的吞吐/延迟/显存表,并核对是否含不同上下文长度。
128K 以上上下文的效果不确定。
笔记只说明训练对齐到 128K,且部分测试样例超限。
查看长上下文基准的完整结果和是否有超过 128K 的外推实验。
Speciale 的高分是否稳定依赖更高推理预算。
笔记明确说 Speciale token efficiency 较弱,但没有给出统一预算下的分布。
对照不同 budget 下的竞赛与基准结果,检查是否存在明显预算敏感性。
工具/agent 提升是否可迁移到其他框架仍不确定。
评测依赖具体框架、上下文管理和自动合成环境,跨系统泛化未直接证明。
在不同 agent 框架和不同工具栈上复现实验。
术语表
- DeepSeek Sparse Attention(DSA)
- 一种稀疏注意力机制。先筛选少量重要历史 token,再做主要计算,以降低长上下文成本。
- lightning indexer
- DSA 里的筛选器,用来从长历史里找出更值得保留的 token。
- key-value tokens
- 注意力里被读取的历史 token。这里保留少量 key-value tokens 来减少计算量。
- dense warm-up
- 稀疏训练前的密集预热阶段,用较短训练先让模型适应。
- sparse training
- 把稀疏注意力真正纳入持续预训练的阶段。
- post-training compute
- 预训练之后继续投入的训练算力,通常用于强化学习、偏好优化和任务对齐。
- agentic task synthesis pipeline
- 自动合成智能体任务的数据流水线,用来生成搜索、代码和多轮工具使用训练样本。
- non-thinking mode
- 不显式展开长思考轨迹的推理模式,通常更轻量,但可能略弱于思考模式。
参考来源
来源追踪
摘要: 提出 DSA,目标是降低长上下文注意力复杂度并保持性能。 arXiv 摘要
摘要: DeepSeek-V3.2 的表现可与 GPT-5 相当。 arXiv 摘要
摘要: DeepSeek-V3.2-Speciale 超过 GPT-5,并在 2025 IMO 和 IOI 取得金牌。 arXiv 摘要
Paper section 3: 持续预训练分为 dense warm-up 和 sparse training,且给出了 1000 / 15000 steps 与 token 数。 arXiv HTML full text
Paper section 3: 稀疏阶段每个查询 token 选择 2048 个 key-value tokens。 arXiv HTML full text
Paper section 4: 构建了搜索、代码、通用 agent、代码解释等多类 agentic 训练环境。 arXiv HTML full text
Paper section 5: RL 训练预算超过预训练成本 10%,且性能随预算上升而提升。 arXiv HTML full text
Paper section 6: 在 Terminal Bench 2.0、SWE Verified、ToolUse、MCP-Universe 等任务上报告了分数提升。 arXiv HTML full text
关于这篇论文的三个关键问题
DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推 解决了什么问题?
作者面对的是开源大模型的两个现实问题。第一,长上下文会把注意力计算推得很贵,尤其在检索、搜索、代码和工具调用里。第二,单靠通用预训练,模型在复杂推理、智能体行为和指令跟随上仍会落后于前沿闭源模型。
DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推 的核心结论有哪些证据?
DeepSeek-V3.2 提出 DeepSeek Sparse Attention(DSA),目标是在长上下文下压低注意力计算,同时尽量保住模型效果。 摘要;Paper section 3:DSA 将主模型核心注意力从 O(L²) 降到 O(Lk),并声称保持长上下文性能。
阅读 DeepSeek-V3.2:用稀疏注意力和大规模智能体后训练,把开源大模型往前推 时最需要注意什么局限?
公开信息主要来自摘要和分节笔记,缺少完整消融、置信区间和训练细节。