当前位置: 首页 » 资讯 » 科技头条 » 正文

超GPT-5.6 Sol:月之暗面Kimi K3模型AI智能体知识工作跑分仅次于Claude Fable 5

IP属地 中国·北京 编辑:赵静 IT之家 时间:2026-07-24 16:05:26

IT之家 7 月 24 日消息,Artificial Analysis 于 7 月 22 日更新 AI 智能体知识工作基准 AA-Briefcase,显示 Kimi K3 模型斩获 1543 分,超过 GPT-5.6 Sol(1501 分),仅次于 Claude Fable 5 模型(1574 分)。

IT之家注:AA-Briefcase 是独立 AI 评测机构 Artificial Analysis 于 2026 年 6 月推出的全新前沿 AI 智能体(Agent)知识工作基准测试。

它专为评估 AI 在处理长周期、高复杂度真实业务中的表现而设计,模拟企业中真实且混乱的办公环境,测试数据科学、产品管理、企业战略等场景,处理海量碎片化上下文(包括 25000+ 条 Slack 消息、3500+ 封电子邮件、会议纪要和财务报表等),并要求生成 Excel 财务模型、董事会汇报 PPT 等实际的商务交付物。

根据最新跑分结果显示,Kimi K3 模型在 AA-Briefcase 上的跑分达到 1543 分,仅次于 Claude Fable 5(1574 分),超过 GPT-5.6 Sol (最高 1501)、Claude Sonnet 5 (最高 1388) 和 Claude Opus 4.8 (最高 1347)。相比较而言 Kimi K2.6 模型在榜单上的成绩为 816 分。

标签: 模型 场景 智能 产品 科学 测试数据 复杂度 财务报表 实际 业务 会议纪要 商务 战略 企业 环境 办公 财务 董事会 汇报 暗面 榜单 碎片 海量 成绩 基准

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新