一个17岁的深圳高中生,为什么能让马斯克在3个月内给他点赞两次?
第一次,是给他参与写的论文;第二次,是给他这篇论文变成的模型。
Kimi K3现拥有2.8万亿参数,是目前全球最大的开源模型。
这是什么概念?当年震惊世界的GPT-3,也只有1750亿参数,而Kimi K3是它的16倍。
以往这种规模的模型,只有美国大厂烧钱才能做闭源,现在让一家中国公司做出来了,还是开源模型。
在7月16日发布没几天,这个模型就在加州大学伯克利分校的AI盲测平台Arena跑出1679分,把Claude Fable 5和GPT-5.6 Sol都甩在身后,稳居第一。
彭博社说,这是一个新的“DeepSeek时刻”。
做出这一切成果的Kimi核心团队里,有一位高中生叫陈广宇。然而在一年多前,他连Transformer是什么都不知道。
改变他的是一个建议,和一张通宵考题
2025年2月,一场中学生黑客松上,陈广宇在台上讲他的项目,一只“人类第三只机械手”,可以帮人干活的辅助机械臂。
台下评委席里坐着奇绩创坛的创始团成员董科涵。看完这个项目后,董科涵给了这个少年一个建议“把注意力放到最前沿的技术上。”
正是这个重要的建议,他听进去了。
那时候他还不知道Transformer是什么,但回去后他就开始疯狂补课,让AI带着他读论文,长期泡在GitHub上追开源项目。
他说,在这个时代,AI就是最好的老师。
这话要放在以前,一个门外汉想读懂最前沿的科技论文,起码得先学好几年科班训练。但现在AI直接把这道门槛给推平了,谁学会了,能直接领悟到最前沿的科技知识。
他能学得这么快,是真觉得这东西好很玩,也很用心。
但真正把他推上这条道路的,是一次通宵的考题。
2025年暑假前,他在X上发了一篇技术反思,刚好被硅谷一家AI初创公司的CEO刷到了。这家公司2024年底才成立,25年初刚拿到了800万美元的种子轮资金,公司背后的投资方有大家熟知的OpenAI、Anthropic等。
CEO看完这篇技术帖后,没问他要简历,也没安排面试,反倒是给他出了一道考题,在一个通宵内做完一道限时实验,做出来了就发offer。
CEO或许没想到的是,仅用一个通宵的时间,他真做出来了,后面他独自飞往旧金山实习期7周。
前两周的任务是,独立定义并推进一个动用144张H100显卡的探索项目;后面几周则参与公司的招聘系统搭建和融资策略讨论,还获得和硅谷传奇投资人Vinod Khosla的当面交流机会。
在这个同龄人还在背单词的年纪,他却在硅谷指挥144张H100。
这件事其实挺有意思的,一家前途未卜的初创公司,敢把这么贵的算力交给一个高中生实习生,赌的是什么?
就是那张通宵给出的考题。因为这个行业新到根本没有老师傅,这道考题就证明了他到底能不能干这一行的活。学历、资历、年龄等在这里都不重要。
暑假结束后,他直接回国。
全组都是博士,就他一个高中生
回国后,他直奔GitHub上的一个开源项目,Kimi的FLA,Flash Linear Attention(Kimi开源项目里的一个技术模块)。
他顺着这个项目一路往底层钻研,研究Triton kernel,琢磨注意力机制为什么能被重写、被加速。
就在他埋头钻研的期间,月之暗面公司向他发出了邀请。
2025年11月加入月之暗面后,他就拿了公司内部48小时黑客马拉松的冠军,直接进了核心研究组,给KDA——K3的两大核心架构之一,做底层计算内核的加速。
进这道门的路,不看简历、学历,也没有引荐,GitHub上的一个仓库就是他的入场券。
在这个核心研究组里,全组都是博士,就他一个高中生。
时间很快来到2026年3月16日,Kimi团队发布论文《Attention Residuals》,共同第一作者有3位:陈广宇、张宇、苏剑林,并标注3人有同等贡献。
苏剑林是谁?是RoPE旋转位置编码的提出者,是业内的封神人物;张宇也同样是Kimi高效模型架构的核心研发。
两个成名已久的人和一个17岁的高中生共享一作,享受同等贡献;这就是这个圈子给到牛人的出价。
马斯克当晚评论“Kimi的作品令人印象深刻。”
设计是谁提的?后来苏剑林在《Attention Residuals回忆录》里写得很明白,让整套方案落地的关键设计Block AttnRes,是陈广宇和张宇共同提出,并且被推进为整个项目的主线。
这个设计解决的是一个大模型老毛病,大模型会把每一层的信息不断往后累加,层数越深,早期的有用信息就会被稀释得越厉害,就像一个记性太好的人,把所有经历都用一样的分量存进大脑,重要的反而捞不出来。
而Block AttnRes干的活,就是让大模型学会“回头看”,按当前的需要从前面把有用的信息挑出来。
(AttnRes(注意力残差)示意图)
用不到2%的额外成本,换来约25%的训练效率提升。
这位高中生提的设计,让两位神级大佬愿意和他并列署名。
当全球都给他封神时,他只表示“不要造神”
今年7月16日。这套架构成了2.8万亿参数K3的地基,加上训练方法和数据配方的优化,K3整体扩展效率比K2提升了约2.5倍。
第二天,马斯克在一条第三方评测帖下面,再次留下一句“令人印象深刻”。
这个消息在全球传开后,AI圈准备集体封神时,陈广宇自己却先开口了。
“不要造神。”他在社交平台上反复写,他希望外界少写个人、多写技术和团队,并点名另外2位同等贡献的作者和负责基础设施的同事,都是缺一不可的。
(图源出自江南都市报)
回看他走过的路,教他的是AI,考他的是一张通宵考卷,GitHub替他递了简历,接他进门的人不问出处。
但这个孩子比谁都清楚,自己站在了什么上面。如今的AI时代,规则早就变了,只是大多数人还没察觉罢了。
而第一个站到台上的人,只有17岁。





京公网安备 11011402013531号