当前位置: 首页 » 资讯 » 科技头条 » 正文

AI大模型周榜:阿里qwen3.8-max冲进综合榜Top 6,国产多模型表现亮眼

IP属地 中国·北京 编辑:郑浩 IT之家 时间:2026-08-10 20:08:30

IT之家 8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。

国产模型在综合榜已有多款进入中上游,具体排名如下:

阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;

月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;

阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。

本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。

标签: 模型 claude-opus 分数 kimi max high 暗面 glm flash 头部

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新