当前位置: 首页 » 资讯 » 科技头条 » 正文

AI大模型周榜:Anthropic多款新模型密集入榜,国产kimi-k3-max稳定头部

IP属地 中国·北京 编辑:李娜 IT之家 时间:2026-08-17 18:12:15

IT之家 8 月 17 日消息,Arena(arena.ai)平台发布 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲测排名,本期最大看点是 Anthropic 多款 claude-opus-4 系列新模型密集入榜并占据综合榜前五位,国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位,在前端开发榜也保持第 2 位,qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本期综合榜头部几乎被 Anthropic 新模型包揽,claude-fable-5 以 1506 分蝉联榜首,新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二,同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内,属于误差范围内的并列。

谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名,表现亮眼。国产模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的国产模型。

国产模型整体处于榜单中上游,具体排名如下:

月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,较上周上升 2 位;

阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,较上周下降 2 位;

阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,较上周下降 3 位。

本周 Arena 榜单最显著的特征是海外厂商 Anthropic 集中发布多款新模型并迅速占据各榜单头部位置,验证了其模型迭代的技术积累;国产模型方面,kimi-k3-max 在综合、代码、前端开发三个核心榜单均稳定在前 15 名,前端开发榜更是稳居第二,qwen3.8-max 在智能体榜首秀即进入 Top 11,整体来看国产大模型在通用能力和智能体领域都在持续推进,与头部海外模型的差距仍在稳步缩小。下周市场预计将有更多国产新模型完成版本迭代,值得持续关注其排名表现。

标签: flash 模型 头部 榜首 误差 分数 max 榜单 kimi

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新