当前位置: 首页 » 资讯 » 科技头条 » 正文

中文大模型谁最强?千问第一 DeepSeek未进前三

IP属地 中国·北京 快科技 时间:2026-08-06 20:18:03

快科技8月6日消息,SuperCLUE放出2026年7月中文大模型完整测评榜单,一共12款国产主流模型参与测试。

综合总分排名中,Qwen3.8-Max位列第一,Kimi-K3第二名,豆包Doubao-Seed-2.1-pro第三名,DeepSeek-V4-Flash位居第四名。

这次测评和以前不一样,把传统代码生成升级成智能体编程,权重直接给到25%,更贴合程序员真实开发流程。

剩下五项分别是数学推理18%、科学推理16%、精确指令遵循16%、幻觉控制16%、智能体任务规划9%,六大维度综合算出最终得分。


综合总分上,Qwen3.8-Max拿到71.48分,Kimi-K3是70.68分,两者只差0.8分。

豆包Doubao-Seed-2.1-pro拿到65.95分,DeepSeek-V4-Flash则是65.6分,DeepSeek-V4-Pro以64.4分位居第五名。

不同细分赛道各家长短板差别很大。智能体编程这块Kimi-K3是全场第一,拿到75.79分,写工程代码、多轮开发交互优势明显;千问排在第二,68.42分。数学推理DeepSeek-V4-Flash最强,78.95分;科学推理则是豆包表现最好,77.19分。

幻觉控制、智能体任务规划两个项目,千问直接断层领先,不容易编造虚假信息,拆分复杂任务的能力更强。

推理速度和性价比是另一套评判标准。DeepSeek-V4全系列属于高性价比区间,API定价低,推理质量在线,同时DeepSeek-V4-Flash、GLM-5.2、Hy3 三款处在高效能区,计算耗时短。

反观总分前两名的千问、Kimi,虽然推理得分高,但单次运算等待时间很长,属于低效能梯队,Kimi的耗时甚至是最快模型的三倍。

预算有限、做批量开发的开发者,优先选DeepSeek系列;日常办公、写文案、怕AI乱编内容,千问更合适;专业程序员、长期写工程代码,Kimi体验更好。


免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。