当前位置: 首页 » 资讯 » 科技头条 » 正文

取次硅谷懒回顾,半缘DeepSeek半缘Kimi

IP属地 中国·北京 编辑:刘敏 数字力场 时间:2026-07-24 14:55:23
DeepSeek擅长以柔克刚,如果说“大力出奇迹”的scaling law路线是刚,那MoE稀疏激活+原生FP8训练框架+纯RL驱动的卸力打法就是柔。Kimi爆发力十足,犹记得1年前,Kimi还时常是作为DeepSeek的反面镜像被讨论,

文 | 数字力场 佘宗明

25年前,《少林足球》上映。片中有个名场面:半决赛时,少林队遇到了莫文蔚与张柏芝客串的玉面双飞龙,二人顶着夸张脏辫、贴着滑稽假胡,说想入决赛,先问问我们!

时间来到2026年,星爷新片《功夫女足》让这对传奇组合重生张小斐饰演的双双与迪丽热巴饰演的钰珑,名字合璧正好对应玉面双飞龙。

作为峨眉队队长的双双是全队攻防大脑,根基扎实,球路沉稳,招牌绝技是太极卸力盘带、太极沉劲远射等,招式守正出奇,强于以柔克刚;身为峨眉队前锋的钰珑是球队尖刀,身法灵动,攻势凌厉,独门绝技是十二路弹腿、旋风削球等,能精准破局,极具爆发力。

现在看,AI赛道的粤籍双雄梁文锋和杨植麟,也挺像这对组合。

犹记得,上个月,有网友在X上问马斯克:中国大模型何时能追上 Anthropic的Fable水平?马斯克预测要等到‌2027年一季度‌。随后智谱创始人唐杰回应:‌用不了那么久‌。

现在杨植麟用K3为他的清华老师这番话撑了腰。加州大学伯克利分校教授伊恩斯托伊卡就感慨:我们过去常说开源模型落后最前沿6至9个月,现在差距可能只剩2到3个月。从性能不及顶尖但价格属实美丽,到性能也能到顶尖水平,这样的迈步会让不少人想起中国制造早些年,中国制造给人的印象是能造出质量还行价格实惠的商品,而如今,中国制造也可以是高端制造的代名词。

03

说这些,不是要导向东升西落式的赢学叙事,也不是要回避整体差距依旧不小的基本事实。

DeepSeek-R1和Kimi K3,都让硅谷跟华尔街的中国AI巨物恐惧症发作了。但这不等于,差距已经被抹平了。

抛开模型能力代差不谈,从底层算力看,国内高端算力自主可控率仍大有提升空间,不能因为寒武纪不是小英伟达,英伟达是小寒武纪的段子,就真把横亘其间的天堑给无视了。

从生态成熟度看,硅谷AI经过多年积淀,形成了算力+模型+工具+场景+资本的完整闭环,上下游产业链高度成熟,中国AI生态则处于快速发展期,商业化体系等仍待完善。看看国内AI创企跟Anthropic、OpenAI的ARR量级差距,就知道了。

从人才储备看,国内工程师红利虽然让黄仁勋们眼红,但顶尖AI算法人才、底层架构人才的总量跟硅谷还有差距。在Our Chinese跟Their Chinese的PK中,我们还需要想方设法吸引更多的杨植麟、姚顺雨回来。

看到中国AI从单点技术突破到体系化能力成型的提升,跟看到中美AI的差距,不矛盾。

事实上,越是能看到差距,就越能在正视的基础上加速追赶。梁文锋就说过:我们经常说中国AI和美国有一两年差距,但真实的差距是原创和模仿之差。如果这个不改变,中国永远只能是追随者,所以有些探索也是逃不掉的。

也正因看到了差距,DeepSeek跟Kimi都实现了许多架构级的原创式创新。

如DeepSeek的原生链式思考(CoT)自主推演+R1-Zero无样本自进化机制+MoE稀疏架构+MLA优化长上下文承载力等;

又如Kimi的超大容量稀疏MoE基座+KDA混合线性注意力体系+原生百万Token上下文建模技术+Agent Swarm+RL Scaling全链路强化学习范式+MuonClip大规模训练优化器等。

得益于此,DeepSeek V4解决了大模型长文本推理卡顿、逻辑断层、算力浪费的行业痛点,在万亿级参数模型的轻量化部署上创下全球最优水平。Kimi K3则突破了超大参数模型的训练瓶颈,在长文本理解、复杂代码生成、多模态融合能力上实现了对海外旗舰模型的反超。

从DeepSeek R1到Kimi K3,都让人看到了将代差持续缩小的可能尽管差距依旧存在。

而这类接连涌现的突破,使得中国AI正实现从仰视到平视海外标杆的改变,也注定会让硅谷迎来心态的转变。

过去数十年,美国科技产业的核心优势在于技术迭代的持续性与领先性,顶尖技术诞生后,经常能长期保持代际优势。其他国家则照搬其技术框架、遵循其硬件标准、接受其定价体系。

但DeepSeek-R1和Kimi K3们,正撼动着这样的叙事。

一次可以叫偶然,两次不同企业在不同时间节点、不同技术路径上,都实现了深层突破,这难免让硅谷部分企业失去反正有追赶窗口期的心理优势。

对硅谷而言,它未必忌惮成为第二名的追随者哪怕其紧追不舍,却必定会忌惮跳出既定轨道的创新者即便其隔得很远。

04

取次硅谷懒回顾,半缘DeepSeek半缘Kimi,这是时下很多人的感受DeepSeek跟Kimi,都成了AI界争气机式的存在。

现在说对硅谷懒回顾,终究显得有些膨胀,但DeepSeek与Kimi确实呈现了中国AI最有活力的样子。

说起来,无论是DeepSeek,还是Kimi,都不是一开始就被看好能撼动硅谷的人。

DeepSeek起初在6(六小虎)+2(两家有特色创企)的行业头部格局中并不靠前,在V4跟R1之前,它充当的不过是大模型界拼多多的生态位。

Kimi虽然凭借长文本风光过一阵子,但到了2024年以后就拿到了过山车剧本,特别是在DeepSeek火了后,它更是被置于既生D何生K的同框对比中成为被群嘲对象。

但它们却在不怎么被看好的情况下跑了出来。

这跟梁杨二人的朝气锐气有关。

梁文锋说中美AI真实差距是原创和模仿之差,决意要做原创式创新。

杨植麟说很多时候你愿意去做一个你不知道的东西,其实你不知道有很多东西不知道,所以你才有这样的勇气去做。当你做了,你会发现有很多新的问题,也许这个东西就是创新的意义。Problems are inevitable, but problems are soluble。

言语之间,都挺显广东人的务实与锋芒。

他们代表了那股疯狂生长、锐意创新的力量。

这也跟当下相对纯粹的竞争环境有关。

回头看,DeepSeek跟Kimi的赛马其实从未停止:

2025年1月,DeepSeek-R1和Kimi K1.5同日上线,相隔仅两小时;2025年2月,两家前后脚发论文改造Transformer注意力机制;2025年4月,Kimi推出数学推理模型没多久,DeepSeek-Prover-V2也发布;今年4月,Kimi发布Kimi K2.6,支持300个子Agent协同,OpenRouter调用量直接冲到全球第一,3天后,DeepSeek发布V4系列

二者也相互致敬:Kimi采用的MLA注意力机制,核心思想源于DeepSeek早期工作;DeepSeek V4中关键的Muon优化器,其有效性由Kimi团队率先验证。

良好的竞争生态之上,才能长出更多的DeepSeek跟Kimi。

因而,要珍惜梁文锋杨植麟们身上的创新动能,要呵护让AI企业可以激烈良性竞争的市场氛围。

在适配创新生长的土壤气候里,DeepSeek和Kimi这样的新锐力量才会有更大的向上拓展空间,才会有更多的机会接着在全球AI角力场中证明

我们玉面双飞龙,可不是浪得虚名。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。