返回报告库

AI / Technology

Kimi K3开放前沿智能

关于这篇论文的三个关键问题

Kimi K3:四条扩展轴怎样组成一套长任务系统 解决了什么问题?

Kimi K3 不是靠一个“神奇模块”把上下文拉到一百万 token。它同时扩大了序列长度、网络深度、模型宽度和任务时长,然后分别为四条轴设计信息通路。理解这篇论文的关键不是记住 KDA、AttnRes、MoE 三个名字,而是看清:每条通路保存什么、丢掉什么、付出什么代价,最后又怎样接到训练与运行系统上。

Kimi K3:四条扩展轴怎样组成一套长任务系统 的核心结论有哪些证据?

Kimi K3 有 93 层、2.78T 总参数、104.2B 激活参数、896 个路由专家,每个 token 选择 16 个专家,另有 2 个共享专家始终工作。注意力层不是清一色全局注意力,而是 69 层 KDA 与 24 层 MLA 混合;训练窗口从 Kimi K2 的 128K 提高到 1M。[论文表 1]

阅读 Kimi K3:四条扩展轴怎样组成一套长任务系统 时最需要注意什么局限?

Kimi K3 给四条轴安排了不同机制。KDA 沿序列轴维护固定形状状态;AttnRes 沿深度轴选择先前层或块;Stable LatentMoE 沿宽度轴只激活少量专家;外部 KV cache 与可恢复沙箱沿时间轴保存运行现场。先把这四件事分开,后面才不会把“支持百万上下文”和“能够长期自主执行”误写成同一个因果关系。[论文 §1、§2、§5]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro