IT之家 7 月 29 日消息,月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。
同日,摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈,宣布完成 Kimi K3 的 Day-0 支持。

Kimi K3 是全球首个开源的 3 万亿级别模型,总参数达 2.8 万亿,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,采用 Gated MLA 与 Stable Latent MoE 等架构创新,原生支持视觉理解,并拥有 100 万 token 上下文窗口。
与传统 Transformer 模型不同,Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干,Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。
面对新架构对 AI 芯片软件栈提出的系统性挑战,摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新,团队分别完成了 Prefill 与 Decode 阶段的关键路径适配,并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool,用于管理 KDA 递归状态与卷积状态,覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。
针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模,摩尔线程快速完成了 DeepEP 适配,打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配,通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint,摩尔线程设计了加载期在线逐层量化方案,无需离线转换即可快速拉起推理。
IT之家查询获悉,MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡,单卡 AI 稠密算力最高可达 1000TFLOPS,配备 80GB 显存,显存带宽达 1.6TB/s,卡间互联带宽为 784GB/s,完整支持从 FP8 到 FP64 的全精度计算。




京公网安备 11011402013531号