返回报告库

AI / Technology

DeepSeek-Coder当大语言模型遇上编程——代码智能的崛起

关于这篇论文的三个关键问题

DeepSeek-Coder:当大语言模型遇上编程——代码智能的崛起 解决了什么问题?

真实代码常把定义和调用拆在不同文件里。一个补全点可能依赖别处的类、函数或配置;如果训练样本只保留当前文件,模型就看不到这些关系。论文把这视为现有代码模型难以处理项目级任务的一项原因。[来源:§2.2]

DeepSeek-Coder:当大语言模型遇上编程——代码智能的崛起 的核心结论有哪些证据?

最直接的证据来自 CrossCodeEval 消融。加入 BM25 检索后,完整 6.7B 模型在 Java、TypeScript、C# 的精确匹配率分别是 17.72%、14.03%、16.23%;去掉仓库级预训练后分别降到 16.64%、13.23%、14.48%。Python 几乎持平(16.14% 对 16.02%)。这支持“仓库组织有帮助”,但效果因语言而异,也不能证明所有提升都来自这一项设计。[来源:§4.3;Table 7]

阅读 DeepSeek-Coder:当大语言模型遇上编程——代码智能的崛起 时最需要注意什么局限?

HumanEval 和 MBPP 偏向短小题目,论文自己也指出它们未必代表程序员日常代码。CrossCodeEval 虽刻意使用晚于训练截止时间的仓库,但评测上下文最多只有 512 token,生成最多 50 token,仍远小于完整工程。论文没有报告训练算力与能耗、漏洞与恶意代码风险、许可证污染、真实 IDE 延迟、长期维护质量,也没有用开发者对照实验测生产力。[来源:§4.1 的 DS-1000 讨论;§4.3 实验设置;全文未报告项]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro