暂无菜单项

一文读懂Kimi K3 预训练|3T模型,不再是魔法

发布于
60

几天之内,2T 以上大模型接连进入公众视野。Kimi K3 的总参数达到 2.78 万亿,每个 Token 激活约 1042 亿参数,拥有 896 个路由专家、93 层网络,并支持最长 100 万 Token 上下文。它让“3T 级模型如何训练”第一次有了足够具体的公开配方。

查看 Kimi K3 的产品能力和使用入口,可进入做视频网收录的 Kimi K3 站内详情页

不过,参数大不等于训练门槛已经消失。真正困难的是:模型和训练状态要装得下,长上下文要算得动,近千个专家之间的数据要传得动,数千张 GPU 要尽可能算得满,最后每单位 FLOPs 还要换来足够的模型质量。K3 的技术报告给出的答案,是架构与训练基础设施共同设计。

一、第一步不是“算”,而是先把 2.78T 装下

统一激活管理器在 GPU、CPU 与重计算之间调度训练中间结果
统一激活管理器在 GPU、CPU 与重计算之间调度训练中间结果

K3 是 MoE 模型。2.78T 是全部参数容量,并不是每个 Token 都要经过的计算量;每次只选择 16 个路由专家,再加上共享专家,激活参数约为 104.2B。仅把 2.78T 权重以 BF16 保存一份,理论上就需要约 5.56TB,训练时还要容纳梯度、优化器状态、中间激活和通信缓冲,实际管理的数据远高于权重本身。

张量并行、流水线并行、数据并行、上下文并行和专家并行可以把这些数据拆到不同设备,但训练中间结果并不会在同一时间以同样价值被使用。K3 的统一激活管理器以张量为粒度决定:哪些结果留在 GPU、哪些转移到 CPU、哪些压缩成 FP8,哪些直接丢弃并在反向传播时重新计算。

“70 多张 80GB GPU 理论上能放下 BF16 权重”只是一道容量除法,并不代表这些卡就能完成 K3 训练。训练还需要状态、激活、通信空间和足够吞吐,生产集群的规模与互联要求会高得多。
DeepSeek-V3、DeepSeek-V4 与 Kimi K3 的架构路线对比
DeepSeek-V3、DeepSeek-V4 与 Kimi K3 的架构路线对比

从 DeepSeek-V3 到更新一代超大 MoE,技术路线已经逐渐清晰:用稀疏专家扩大总容量,用线性或稀疏注意力降低长上下文成本,用低精度和专用内核压缩显存与通信,再通过负载均衡、流水线重排和优化器改造,提高硬件利用率与训练回报。K3 的不同之处,是把这套路线推进到 2.78T。

Kimi K3 的 KDA、Stable LatentMoE、AttnRes 与视觉通路架构
Kimi K3 的 KDA、Stable LatentMoE、AttnRes 与视觉通路架构

二、KDA:先解决百万上下文“算得动”

K3 从 K2 的 61 层增加到 93 层,上下文从 128K 扩大到 1M。如果全部沿用全局注意力,注意力矩阵的计算与存储会随序列长度近似平方增长。线性注意力则把历史信息不断压入固定大小状态,让长序列成本接近线性增长,但代价是历史细节可能在压缩中丢失。

KDA 与 Gated MLA 组成的 3比1 混合注意力结构
KDA 与 Gated MLA 组成的 3比1 混合注意力结构

KDA(Kimi Delta Attention)通过通道级遗忘门、Delta Rule 纠错写入和全秩输出门,更精细地决定哪些信息保留、如何修正记忆,以及哪些通道进入下一层。单步保留率设置下限,还可以避免并行计算时出现超出 BF16 范围的极端放大。

K3 没有完全放弃精确检索能力,而是采用 3:1 混合结构:连续三层 KDA 后插入一层 Gated MLA,最终由 69 层 KDA 和 24 层 Gated MLA 构成。KDA 控制大部分长上下文成本,MLA 定期重新查看完整历史,弥补固定状态难以无损记住每个字符的问题。

三、LatentMoE:专家翻倍,通信不跟着翻倍

Stable LatentMoE 将路由专家输入压缩至潜在空间
Stable LatentMoE 将路由专家输入压缩至潜在空间

K3 将路由专家从 384 个扩大到 896 个,每 Token 激活专家从 8 个增加到 16 个。更多专家让新增参数真正参与计算,却也会让专家并行中的 Token 分发压力骤增。Stable LatentMoE 的关键做法,是先把 Token 从 7168 维主空间下投影到 3584 维潜在空间,让 16 个路由专家只处理半宽表示,汇总后再投影回主空间。

这样一来,K2 的“8 × 7168”与 K3 的“16 × 3584”都等于 57,344。它没有让整套训练通信量保持不变,因为 K3 的层数也增加了;但它消除了最危险的乘法项:激活专家数量翻倍,不再直接乘上完整表示宽度。

KDA 上下文并行通过固定大小状态完成跨 GPU 交接
KDA 上下文并行通过固定大小状态完成跨 GPU 交接

KDA 上下文并行:跨卡交接固定大小状态

长上下文还要沿 Token 方向切给多张 GPU。全局注意力需要交换随序列增长的 Key 和 Value,KDA 上下文并行则让每张 GPU 先处理本地片段,只输出两类固定大小信息:本段如何修改已有记忆,以及在没有旧记忆时本段会生成什么状态。随后通过 Prefix Scan 按顺序合并,恢复各片段之前的准确状态。

Quantile Balancing 根据全局路由分布动态调整专家录取线
Quantile Balancing 根据全局路由分布动态调整专家录取线

Quantile Balancing:长期调整专家流量

MoE 路由器不会自然把 Token 均匀送给 896 个专家。固定步长调整专家偏置,在专家规模变大后可能反应太慢或过度修正。Quantile Balancing 根据全局 Batch 的路由分数分布计算动态录取线,让各专家长期接近目标 Token 数,同时避免用额外辅助损失直接干扰模型的主学习目标。

四、训练基础设施:让 GPU 真正“算得满”

Kimi K3 训练中的计算、通信与激活卸载重叠排程
Kimi K3 训练中的计算、通信与激活卸载重叠排程

峰值 FLOPs 只是理论算力。GPU 等待远端 Token、等待通信、只拿到过小矩阵,都会让真实利用率远低于标称性能。KDA 的递归状态、AttnRes 的跨层表示和近千个动态专家,也让通用训练框架必须重新排程。K3 通过计算、通信、激活卸载和重计算重叠,尽量把流水线气泡填满。

MoonEP 在 Micro-batch 层面实时平衡专家并行负载
MoonEP 在 Micro-batch 层面实时平衡专家并行负载

MoonEP:处理 Micro-batch 的即时拥堵

Quantile Balancing 管的是长期分布,但一个以代码为主的 Micro-batch 仍可能瞬间挤爆少数专家。MoonEP 在路由完成后读取真实分配,在其他 GPU 上临时复制过热专家并分流 Token,使每个专家并行设备接收相同数量的 Token。Zero-copy Communication 则让数据直接落到按专家分组的目标缓冲区,减少显存中的中转复制。

负载感知专家调度器重新组织 GPU 内部的专家计算任务
负载感知专家调度器重新组织 GPU 内部的专家计算任务

负载感知调度:把零碎任务拼成 GPU 喜欢的大矩阵

GPU 之间配平后,同一张 GPU 内的专家仍可能一忙一闲。负载感知专家调度器读取本批次各专家的 Token 数,结合硬件成本模型重新安排执行顺序和资源:热门专家获得更多处理资源,小任务穿插执行。总计算量没有减少,但计算单元的空等时间被压缩。

FlashKDA 将可并行准备工作从递归状态依赖中拆出
FlashKDA 将可并行准备工作从递归状态依赖中拆出

FlashKDA:把递归依赖压缩到最后

线性注意力的状态必须按序传递,天然不利于 GPU 并行。FlashKDA 先并行准备每个序列块的“更新卡”,包括遗忘门、Query/Key 归一化、衰减和块内纠错矩阵;最后只把状态交接与输出读取留在顺序阶段。它没有消除前后依赖,而是把大部分可并行工作提前拆出,让 KDA 节省的状态真正变成训练吞吐。

五、从“算得满”到“学得好”

硬件满载不等于训练划算。Scaling Efficiency 衡量的是达到同一验证损失需要多少总 FLOPs。Kimi 报告称,新架构、数据与训练配方共同带来相对 K2 约 2.5 倍整体规模扩展效率。这是整套系统的总账,并不应简单归因于某一个模块。

Kimi K3 在多项智能体任务中的得分与单任务成本
Kimi K3 在多项智能体任务中的得分与单任务成本

K3 的能力与成本曲线显示,大模型竞争不再只是榜单最高分,还包括达到这一分数需要多少推理费用。不过这些结果依赖具体 Agent Harness、推理强度和评测设置,不能直接视为所有真实项目中的稳定排名。

AttnRes 让深层网络按需检索不同历史层表示
AttnRes 让深层网络按需检索不同历史层表示

AttnRes:让 93 层网络按需读取历史层

传统残差连接不断把各层输出加进同一条主干,网络越深,浅层细节、中层结构和高阶语义越容易混成一份状态,新增层也可能逐渐接近恒等映射。AttnRes 把历史层表示视为候选信息,让当前层通过注意力选择需要读取的层,把固定残差通道变成可学习的纵向信息路由。

为了控制跨层检索开销,Block AttnRes 将连续层分成约 8 个 Block。相关论文在 48B 总参数、3B 激活参数模型上报告约 1.25 倍 Scaling Efficiency;K3 则把这一机制带到 93 层和 2.78T 总参数规模。

Kimi K3 在 AttnRes GPU 内核优化案例中的速度提升
Kimi K3 在 AttnRes GPU 内核优化案例中的速度提升

技术报告还展示了 AttnRes GPU 内核优化案例。这里更值得注意的是方法论:新的模型结构只有配合专用内核、真实硬件测试与持续性能分析,才能把理论效率兑现为端到端速度。结构创新和系统工程必须同时成立。

六、稳定性配方:数周训练不能被一次异常击穿

Kimi K3 长时间预训练的数值稳定性方案
Kimi K3 长时间预训练的数值稳定性方案

3T 级训练可能持续数周甚至更久,偶发的激活爆炸、数值溢出或梯度异常都可能带来昂贵回滚。K3 在专家汇总后加入 RMSNorm 稳定表示尺度;用 Per-Head Muon 分别更新注意力头,避免少数大梯度头主导整个投影矩阵;KDA 的衰减下限则兼顾数值范围与并行效率。

GLU、SwiGLU 与 SiTU-GLU 的门控曲线对比
GLU、SwiGLU 与 SiTU-GLU 的门控曲线对比

SiTU-GLU 用带平滑上限的双曲正切约束两个分支,在常用区间接近 SwiGLU,遇到极端输入时又不会无限放大。它更像生产线的限压阀:正常训练时尽量不改变信息流,异常数值出现时及时限制峰值。

K3 的 2.5 倍规模扩展效率,应理解为 KDA、AttnRes、Stable LatentMoE、数据和训练配方共同作用的结果。月之暗面没有在公开摘要中披露主预训练使用的具体 GPU 数、总训练 Token 与 GPU 小时,因此外界不能据此精确还原完整训练成本。

七、3T 级模型不再是魔法,但仍是顶级系统工程

回头看整套方案,K3 抓住了三条最危险的信息通道:KDA 改造 Token 与历史 Token 之间的信息流,让百万上下文不承担全局注意力的平方成本;AttnRes 改造不同网络层之间的信息流,让 93 层网络不只是不断累加历史表示;Stable LatentMoE 压缩 Token 与专家之间的信息流,让激活专家翻倍时通信宽度不随之翻倍。

基础设施则负责把架构收益兑现出来:统一激活管理器避免显存局部冒顶,KDA 上下文并行减少跨卡交换,Quantile Balancing 管长期流量,MoonEP 管即时拥堵,负载感知调度器减少 GPU 内部空转,FlashKDA 把递归依赖中的可并行部分提前拆出。

做视频网观点:这套思路对视频与 CG 团队同样有启发。大规模渲染、转码、光流、降噪和生成式视频训练,也常被显存峰值、节点通信、任务分配和数值稳定性限制。真正高效的 AI 制作系统不会只依赖更强 GPU,而会同时优化模型结构、数据通路、缓存、任务调度与验证机制。

结语

Kimi K3 证明,3T 级开放模型已经从无法解释的规模竞赛,变成一组能够被讨论和复用的工程方法。但“配方公开”不等于任何团队都能轻松复现:让近千个专家在大规模 GPU 集群上持续稳定运行,仍需要算法、内核、网络、调度、监控和数据工程长期协同。

更准确的结论不是“大模型训练已经没有门槛”,而是门槛已经从单纯堆卡,转移到了架构审美与系统工程。能装得下、算得动、传得动、算得满并且学得好,这五件事同时成立,2.78T 参数才真正有价值。

常见问题(FAQ)

Kimi K3 有多少参数,每个 Token 会用到多少?
Kimi K3总参数约2.78万亿,是MoE模型;每个Token选择16个路由专家并经过共享专家,激活参数约1042亿。
KDA 为什么能降低百万 Token 上下文成本?
KDA把历史压缩进固定大小状态,使大部分注意力成本随序列长度近似线性增长。K3再以3层KDA搭配1层Gated MLA,兼顾效率和精确历史检索。
Stable LatentMoE 如何控制专家通信量?
它先把Token从7168维主空间压缩到3584维潜在空间,再交给16个路由专家处理。这样激活专家翻倍时,不必让单层专家通信宽度同步翻倍。
MoonEP 和 Quantile Balancing 有什么区别?
Quantile Balancing根据全局Batch统计调整专家的长期录取线;MoonEP处理Micro-batch已经发生的即时拥堵,通过复制过热专家和分流Token实现设备间实时配平。
Kimi K3 的2.5倍规模扩展效率意味着训练成本降低2.5倍吗?
它表示达到相同验证损失所需计算量的综合改善,来自架构、数据和训练配方共同作用;不能直接等同于任意部署场景的账单下降2.5倍。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材