当前位置: 首页 » 资讯 » 科技头条 » 正文

都怪Kimi

IP属地 中国·北京 编辑:李娜 锦缎 时间:2026-07-20 10:21:20

7月16日晚间,月之暗面发布了Kimi K3。2.8万亿参数,开源,多模态,上下文窗口超过100万。7月27日将完整开放权重。

消息传到华尔街的时候,交易员们正在为一轮已经持续了好几天的科技股抛售寻找新的解释。K3来得正是时候。

Artificial Analysis智力指数排全球第3,Arena Frontend Code排全球第1。Terminal-Bench 2.1得分88.3,和GPT-5.6 Sol的88.8之间只隔着一层薄薄的空气。FrontierSWE得分81.2,仅次于Fable 5的86.6,把GPT-5.6 Sol的71.3甩在身后。

一家中国公司的开源模型,在编程和长程推理这两个最硬的指标上,同时够到了全球顶尖闭源系统的肩膀。

于是有人说,K3戳破了全球算力扩展的泡沫,打破了Antheropic与OpenAI的估值逻辑,并加剧了近期高位科技股的巨震。

逻辑链条很直接:如果在有限算力下,开源模型仍可取得如此突破,那此前市场给予AI基础设施天价资本开支的定价,是否建立在一种过度乐观的假设之上?如果一家中国公司能用更少的资源做出接近顶尖水平的模型,那英伟达的订单簿、Anthropic与O喷AI的高毛利叙事,是否都在同一瞬间被打上了一个问号?

总而言之一句话:都怪KIMI。

01

2.8万亿的重型基建

先看一个最容易被忽略的事实,2.8万亿参数。这个数字本身的重量,比任何BenchMark都更有说服力。

把这么多参数塞进一个模型,让它们在896个专家模块中各司其职,每次推理只唤醒其中16个。这从来不是省算力的技术路线,这是重型基建。

模型权重在4比特浮点精度下就需要超过1.5太字节的HBM显存容量,推理时要在64卡以上的超节点上才能跑起来。专家并行方案采用了极高稀疏度的WideEP架构,对scale-up域的容量和带宽要求极高。

K3之所以看起来“省”,是因为它在每一分算力上都压榨出了成倍的效能,而不是因为它不需要算力。K3不是一架只为了滑翔的纸飞机,它是一架装配了更先进引擎的重型战斗机。引擎效率越高,飞得越远,但对燃料的绝对需求只会更大,不会更小。

这是整个论证的底座,不把这件事讲清楚,后面所有推论都会飘在空中。

02

一架超级引擎

K3真正让人兴奋的地方是它的超级引擎价值。月之暗面在K3上落地了三项关键技术:KDA混合线性注意力、注意力残差和高稀疏度MoE。三项技术指向同一个目标,把算力转化为模型效果的效率推到极致。

第一,KDA混合线性注意力。

Transformer最吃算力的地方是注意力机制。标准注意力随着序列长度增加,计算量呈平方级增长。百万级上下文的任务,大部分算力都烧在了维持长序列的注意力矩阵上。KDA机制将大部分注意力层的计算复杂度从平方级降到了线性。

根据月之暗面此前发布的Kimi Linear技术报告,在48亿参数和3亿激活参数的实验模型上,采用3比1的KDA与MLA混合比例,KV缓存占用最高削减了75%,100万上下文长度下的解码吞吐量提升到了原来的6倍。

对开发者来说,这意味着同样的GPU集群,可以同时服务更多用户,处理更长的任务。

第二,注意力残差。

模型大到万亿级别之后,信息在层与层之间传递会衰减,浅层信号传到底层时已经模糊了。注意力残差允许模型在深层直接跳回浅层提取原始特征,再融合进当前推理。

这解释了为什么K3在FrontierSWE这种需要持续数十分钟的长周期软件工程任务上表现格外出色,它能在漫长的推理链条中保持方向感,不会走着走着忘了自己为什么要出发。

第三,高稀疏度MoE。

896个专家,每次只激活16个。这个极端比例意味着每个专家模块必须在自己的领域内做到极致,否则整个系统会崩。

支撑这套架构的是Stable LatentMoE,通过低维隐空间做专家路由,再用历史思维链保留训练来维持跨轮推理的稳定性。

叠加训练方法和数据配方的优化,K3相比上一代K2的整体扩展效率提升了约2.5倍。

本质上,三项技术砍的不是算力,更不是Scaling Law,而是粗糙的算法浪费。把每一分算力转化为模型能力的效率推到极致,不叫省,这叫更会花。

03

到底恐慌什么

从K2.6到K3,几个月时间,Arena Code榜单从第18名跳到第1名,部分观点研判认为,K3可能将国产模型与海外前沿的代际差距缩短到了3个月以内。一年前这个数字是12到18个月,两年前开源模型甚至不在讨论范围里。

这个加速度,才是改变定价逻辑的东西。

Anthropic的Fable 5每百万Token输入10美元,输出50美元。GPT-5.6 Sol分别是5美元和30美元。K3是3美元和15美元,缓存命中0.3美元,只有Fable 5的30分之1。

当开源模型以更低的价格提供接近的性能时,闭源的高毛利叙事就开始松动:Anthropic推理毛利率长期在75%以上,这是它高估值的核心支柱。如果开源追赶的速度继续加快,这根柱子需要重新审视。

但市场在恐慌时忽略了一件事。定价权的转移不是价值的消失,是价值从一层流向了另一层。就像当年电力从爱迪生的直流发电机里流出来,流进西屋公司的交流变压器,流进福特工厂里的独立电动机。每一次流动都没有减少电力的价值,只是改变了谁在收电费。

这一次也一样。

04

SuperApp的种子

迫近顶尖水平、抹平基础壁垒之后发生的事,不是算力过剩,反而是算力在另一个维度上爆炸。

当K3把顶尖编程和Agent能力以开源方式交给全球开发者时,它点燃的东西比任何一张BenchMark排行榜都要深远。一个编程Agent从零构建GPU编译器,一个设计师用自然语言生成完整的前端工程,一个研究员把两周的科研编程压缩进两个小时。

这些已经在K3上线后出现了。

SuperApp的种子埋在开源的土壤里。当模型不再是瓶颈,算力就会成为瓶颈。用户量每一次增长,Agent任务每一次深层调用,都会变成巨量推理需求。

还有一个被忽略的技术细节,K3在默认最高思考强度下的思维链偏长,实际Token消耗比常规模型更高。在Kimi Work Max的高强度思考模式下,任务反馈速度稍慢,推理深度却更深,Token消耗也更大。

这意味着应用越普及,Agent越复杂,单次调用的Token消耗就越惊人,推理计算的规模也将以远超训练计算的速度膨胀。

05

还在路上

当然,K3距离AGI还有很长的路。

它缓存保留只有10分钟,可能源自KDA快照缓存的架构特性。指令模糊时容易过度主动,行为边界尚不稳定。62TPS的输出速度低于同档模型中位数72TPS。

这些是工程问题,能解。但更大的问题不在技术,在场景。

K3需要部署在64卡以上的超节点才能运行,这意味着它还远远不是一款普通企业或个人能随意消费的基础设施。从实验室到大规模普及,中间还隔着成本、稳定性、生态工具链的一整套工程化鸿沟。

它证明了这条路能走通,但还没走完。这目前是对它最准确的定位。

K3是一个节点,还不是终点。规模法则再次被验证有效,更大参数、更复杂架构、更长上下文,仍然在产生更好的模型。

各家不仅不会收手,反而会因为看到对手的底牌而加速。算力侧在加速,算法侧也在加速,两个轮子同时高速转动,中间挤出来的,是一轮从基础设施到应用的繁荣。

有一个古老的哲学命题是这样的:如果一支箭在飞行途中的每一个瞬间都静止在某一个位置上,那它永远也到达不了靶心。芝诺用这个悖论证明了运动的不可理解,但现实中每一支箭都稳稳钉在靶上。

K3这支箭已经飞过了从K2.6到K3的这段航程,正在飞向下一段。它经过了每一个瞬间,但它从未静止。

都怪KIMI,这句话放在K3发布之后的语境里,最大的讽刺在于,它被当成了一句甩锅。就像老王说,都怪隔壁老张把围墙修得太高,害我也得加砖。

K3不是全球科技股暴跌的肇事者,它是下一轮AI繁荣的报信人。它打破了安卧在万亿美元估值之上的垄断叙事,却开启了一个更宏大、更公平、更具爆发力的竞争周期。

算力的下半场,应用的上半场,都开始了。

标签: 模型 注意力 算力 开源 技术 全球 专家 顶尖 价值 公司 参数 编程 稳定性 逻辑 水平 效率 闭源 能力 证明 残差 链条 浅层 基础设施 科技股 架构 思维 天价 速度 任务 华尔街 芝诺

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。