返回报告库

AI / Technology

DeepSeek-Coder代码模型为什么要看项目,而不只看单个文件

关于这篇论文的三个关键问题

DeepSeek-Coder:代码模型为什么要看项目,而不只看单个文件 解决了什么问题?

这篇论文不只是“再训练一个更大的代码模型”。它把三个容易混在一起的改动拆开做:按项目依赖组织训练数据、让模型练习补代码中间的缺口,再把可靠上下文扩到 16K。真正值得理解的是,这三件事各自解决什么问题,又有哪些结果能单独支撑它们。

DeepSeek-Coder:代码模型为什么要看项目,而不只看单个文件 的核心结论有哪些证据?

CrossCodeEval 是这里最接近因果检验的一组结果:在同一个 6.7B 模型、同样使用 BM25 检索的设置下,保留项目级预训练后,Python、Java、TypeScript 和 C# 的精确匹配率分别提高 0.12、1.08、0.80 和 1.75 个百分点。提升不算巨大,也不是每种语言一样大,但方向一致,说明依赖排序训练确实贡献了一部分跨文件能力。【论文 Table 7;§4.3,p. 14】

阅读 DeepSeek-Coder:代码模型为什么要看项目,而不只看单个文件 时最需要注意什么局限?

整体成绩更强,但不能全归给这一项。33B 基础模型在多语言 HumanEval 平均为 50.3%,MBPP 为 66.0%;同表中的 CodeLlama-Base 34B 分别是 41.0% 和 55.2%。33B 指令模型的多语言 HumanEval 平均为 69.2%,高于表中的 GPT-3.5-Turbo 64.9%,但 MBPP 是 70.0%,略低于 GPT-3.5-Turbo 的 70.8%。这些结果来自数据清洗、项目级组织、模型规模、FIM、长上下文和指令微调共同作用,论文没有把总提升完整拆到每个组件上。【论文 Table 3;§4.1,p. 11】

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro