返回报告库

AI / Technology

DeepSeek-V2强大、经济且高效的混合专家语言模型

关于这篇论文的三个关键问题

DeepSeek-V2:强大、经济且高效的混合专家语言模型 解决了什么问题?

混合专家模型像一座有许多科室的医院:每个病例只去少数科室,所以单次计算可以较小。但如果路由总把 token 发给同几位专家,部分专家学不到东西,部分设备又会过载;跨设备传输也可能抵消稀疏计算省下的时间。因此,真正难点不只是“少激活”,还包括怎样分工、均衡和通信。来源:第 2.2.3 节

DeepSeek-V2:强大、经济且高效的混合专家语言模型 的核心结论有哪些证据?

作者在 NVIDIA H800 集群上训练,并为通信、路由、专家计算和 MLA 做了专门优化。与 DeepSeek 67B 相比,论文报告每万亿 token 的训练成本从 300.6K GPU 小时降到 172.8K,约节省 42.5%;KV 缓存减少 93.3%。作者还按线上 DeepSeek 67B 服务的输入与输出长度分布,在单台 8×H800 节点上测得超过每秒 5 万生成 token,最高吞吐量是 DeepSeek 67B 的 5.76 倍。来源:第 3.2.3 节与图 1

阅读 DeepSeek-V2:强大、经济且高效的混合专家语言模型 时最需要注意什么局限?

这些效率数字依赖作者的 H800 集群、定制内核和并行策略,不能直接当成任意云平台的成本承诺。基准比较由作者的内部框架完成;开放式评分还依赖模型裁判或特定评测协议。作者也明确承认:知识不会在预训练后持续更新,回答可能包含未经核实的建议或幻觉;训练语料以中文和英文为主,其他语言能力有限;当前模型只处理文本。强化学习虽改善开放式生成,也可能让 BBH 等标准基准退步,论文称之为“对齐税”。来源:第 4.4 节与第 5 节

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro