当前位置: 首页 » 资讯 » 科技头条 » 正文

中国让开源大模型工作更长时更“聪明”

IP属地 中国·北京 编辑:唐云泽 新华社 时间:2026-07-23 06:01:49

新华社北京7月22日电 题:中国让开源大模型工作更长时更“聪明”

新华社记者张漫子

北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3,参数规模达2.8万亿,其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。

企业业务负责人黄震昕表示,K3的突破不止于“信息能够装得更多”,更在于处理信息的方式更加高效。

这波大模型浪潮中,注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”,注意力机制则决定模型“会不会抓重点”,能不能从海量信息中快速找到关键、建立联系并形成答案。

黄震昕表示,K3的第一项创新,在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时,计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍,计算量就增至约四倍,这正是超长文本难落地的关键原因。

“KDA通过混合线性设计,把这一开销降到接近线性增长。”黄震昕说,这意味着,在同等算力下,模型能读得更长、处理更多信息、完成更复杂任务。

Kimi K3品牌视觉图。(月之暗面供图)

第二项创新是注意力残差技术。“模型越大、层数越多,信息传递的‘通路’就越长,信号容易衰减、失真,训练也就越容易‘翻车’。”黄震昕说,这是全球头部实验室共同面对的工程难题。

黄震昕介绍,注意力残差技术改进了信息在不同网络层之间的传递和复用方式,相当于为大模型加装了一套“稳定器”,使2.8万亿参数不仅“训得出来”,还能稳定高效地用起来。

KDA混合线性注意力机制解决的是“如何让大模型干活时长更长”,注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明,中国大模型企业的竞争力,正从扩大参数规模,延伸到基础架构和原创算法层面。

Kimi K3的发布引发国际研究机构关注。高盛集团在相关研报中,将Kimi K3视为中国模型走向定价权的新节点,并认为中国开源及开放权重模型的智能水平,正在达到面向全球扩散的关键临界点。

针对海外部分质疑,黄震昕回应称:“K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了,开源模型与中国大模型都不应当被贴上‘低价标签’。”

据悉,Kimi K3能够高效处理海量医学文献、药品说明书及临床指南,快速生成结构化、精准的辅助用药建议,且已实现标普与万得数据的插件接入,能够自动抓取并分析上市公司财报、债券评级、资金流向等数据,为金融行业降本增效。

黄震昕表示,中国开源大模型不仅是效率工具,更是连接技术红利与社会福祉的桥梁,能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。