本次一共纳入10款主流国产办公AI,全部产品三次测试平均分都突破91分,整体水准大幅提升,百度文心助手拿下总分第一,小米MiMo Claw位列第二。
前端开发榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,国产模型共有三款进入 Top 8,占据半壁江山。
将机器人上下文扩展3个数量级。
87%概率选择撒谎。o3晚期检查点在承诺测试中的表现,揭开了AI“奖励追逐”的真相。
AI大模型周榜:代码榜榜首易主,claude-opus-4-7-thinking登顶
AI能总结信息,但志愿填报不光需要提供数据,更需要有明确价值取向的实用建议。
AI Agent为什么总是不稳定?终于有了一个系统性基准来拆解
Fable 5全球复活!限时7天,额度砍半
微信上线高考AI志愿助手,可在搜一搜直接语音提问
用AI报高考志愿靠谱吗 专家:切勿盲目依赖
AI进入中国家庭的第一道门。
英伟达N1x SoC跑分不及苹果2023年发布的M3 Max
SWE-bench满分,0个bug修复:伯克利造了个专门作弊的AI
06/25 00:17
06/25 00:16
06/25 00:15