返回报告库

AI / Technology

DeepSeek-V3 技术报告

关于这篇论文的三个关键问题

DeepSeek-V3 技术报告 解决了什么问题?

大模型想学到更多模式,通常需要更多参数和数据。但如果每次生成都调用全部参数,训练和推理成本也会同步膨胀。DeepSeek-V3 的问题可以概括成一句话:怎样把模型容量推到 671B,同时让每个 token 的实际计算、生成缓存和跨机器通信仍可承受?来源:§1–§3

DeepSeek-V3 技术报告 的核心结论有哪些证据?

在作者统一评测的基础模型对比中,DeepSeek-V3-Base 的 MATH 为 61.6、HumanEval 为 65.2、MMLU 为 87.1;对应的 LLaMA-3.1 405B Base 分别为 49.0、54.9、84.4。聊天模型评测中,V3 的 MATH-500 为 90.2、LiveCodeBench CoT 为 40.5、LongBench v2 为 48.7。它也有明显短板:SimpleQA 为 24.9,低于 GPT-4o 的 38.2;SWE-Bench Verified 为 42.0,低于 Claude-3.5-Sonnet 的 50.8。来源:§4.4,表 3;§5.3,表 6

阅读 DeepSeek-V3 技术报告 时最需要注意什么局限?

大部分比较由作者自己的评测框架完成,闭源模型通过 API 测试;这能保证报告内部尽量统一,却不等于独立复现。论文没有公开 14.8T tokens 的完整数据构成,也没有给出从早期探索到最终模型的全部研发算力。作者还明确承认:推荐的部署单元较大,会给小团队带来负担;固定 benchmark 也可能让能力看起来比实际更好。来源:§4.4;§6

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro