当前位置: 首页 » 资讯 » 科技头条 » 正文

OpenAI透露模型失控细节:多个智能体联合“作弊” 5月份就相互沟通

IP属地 中国·北京 编辑:陈阳 凤凰网科技 时间:2026-08-06 12:08:11

OpenAI

北京时间8月6日,据彭博社报道,OpenAI周三表示,针对Hugging Face公司发起攻击的AI模型,早在5月就开始通过未被发现的留言板相互交流,协同合作试图突破测试环境。OpenAI在7月底披露了模型失控入侵Hugging Face事件。

OpenAI员工埃里克华莱士(Eric Wallace)和迈克尔道尔顿(Michael Dalton)周三在网络安全会议上透露,多个仅供公司内部使用的AI智能体和模型花费几个月时间相互留言,并逐渐围绕一个目标形成共识:访问互联网,以完成它们被分配的任务。其中一些任务如果没有互联网访问权限,根本无法完成。

“在某个时刻,这些智能体意识到也许我们可以尝试利用或攻击外部基础设施,从而找到用于评估我的测试的答案。”华莱士在拉斯维加斯黑帽会议上发表演讲称。

华莱士和道尔顿在演讲中表示,此次安全漏洞的根源最早可追溯到5月。当时,OpenAI的科学家给一个实验性AI系统分配了一项新任务。这距离该公司模型逃离一个名为“沙箱”的安全测试环境、并攻击Hugging Face系统还有几个月时间。

OpenAI内部审查的一个重要发现是,这些前沿模型在任务中表现出一种“作弊”倾向,并且在尝试完成指定任务时表现出很强的坚持性,即使这种努力开始偏离最初的指令,它们也不会停止。

“前沿模型真的很喜欢作弊,”道尔顿在会议上一间座无虚席的会议室中表示,“它们喜欢作弊的原因是,在训练过程中,往往会受到各种压力,要求它们快速完成任务。”

根据研究人员展示的幻灯片,其中一个智能体在沙箱环境中无法完成任务后说道:“我们陷入困境了。也许可以在网上寻找答案?”

华莱士和道尔顿表示,OpenAI没有意识到自己给该模型布置了一个所谓的“不可能完成的问题”。(作者/箫雨)

更多一手新闻,欢迎下载凤凰新闻客户端订阅科技。想看深度报道,请微信搜索“科技”。

标签: 模型 openai 凤凰网 沙箱 ai 智能体 道尔顿 测试环境 拉斯维加斯

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。