北京时间7月31日,以“AI安全”为标签的Anthropic发文称,在对141006次网络安全评估运行进行大规模回顾性审查后,发现Claude系列模型在三起事件中未经授权访问了三个不同组织的真实系统。
事情正朝着奇怪的方向演进:安全风险事件正在变成厂商证明自身前沿模型具备代际差的“包装”。
据Anthropic披露,三起事件均源于一个共同的配置错误:本应隔离的测试环境意外开放了互联网访问权限,而模型在提示词中被明确告知“无互联网访问权限”且处于模拟环境中,这意味着Claude在入侵真实系统时认为自己在完成一场虚构的夺旗演练。
入侵过程中,Opus 4.7在四次运行中识别出触及真实生产系统的迹象,但仍继续攻击,提取了凭证并接触了生产数据库;Mythos 5察觉到身处真实互联网,却说服自己仍在模拟中,将一个含恶意代码的Python包发布到公共PyPI仓库,在被移除前被15个真实系统下载运行;另一款内部研究测试模型在确认目标为真实系统后,自行停止了攻击。

Anthropic在公告中表示,涉事模型未部署正式发布时使用的标准安全措施,未发现模型“追求自身目标”,只是试图完成被要求的任务。
社交平台上对此事的评价迅速走向分化。有网友认为理应赞赏平台公开总结经验教训而非悄悄解决问题,这种透明度对安全社区至关重要。聚焦云业务的北美科技公司Duckbill联合创始人科里・奎因(Corey Quinn)质疑:“一家聚焦AI安全的公司竟然会自豪地吹嘘其模型会犯罪,这令人匪夷所思。”
信息安全研究员关傲男对第一财经记者表示,安全测试能力是今年模型前沿能力的直接体现。此前行业对模型的评估指标主要是SWEBench(软件工程基准),CyberGym侧重阅读代码、编写新代码和寻找漏洞。而最新的ExploitGym则更进一步直接测试模型能否将漏洞转化为可实际运行的攻击。
这些评估指标的结果显示,前沿模型与上一代模型之间存在非常明显的代差,前沿模型已可直接用于“武器化”。关傲男认为,在探索中出现模型“越狱”、沙箱逃离是不可避免的问题,但只要最终释放的模型能够做好安全护栏,便能够解决,不应过度渲染。
厂商也在加大对AI安全的投入力度。CyberGym和ExploitGym背后的UC Berkeley实验室负责人宋晓冬(Dawn Song)于今年6月加入Meta超级智能实验室(MSL)担任AI研究副总裁。
她也参与了由OpenAI、Anthropic、谷歌等厂商联名发起的限速AI发展请愿书。并在署名评论中表示,多位研究人员认为递归自我改进(RSI)在未来几年内是可行的,其加速进展可能会超出行业理解和治理这些系统的能力。通过援引CyberGym和ExploitGym评估结果,宋晓冬认为前沿AI智能体已能发现并利用现实世界的软件漏洞。
但在头部厂商竞速前沿模型发展背景下,要求企业主动降速并不容易。2023年GPT-4发布时,特斯拉CEO马斯克便曾联名请愿呼吁暂停前沿AI研发至少6个月,但当时并未获得实质性响应。
如今,类似的声音再次响起。关傲男认为,此前行业签署的限制AI发展的倡议更像是利用恐慌限制其他非前沿模型的追赶,只有前沿实验室主动刹车才能让AI惠及每个人,不然就只是惠及前沿实验室自身。
而这恰是当前AI安全治理的核心悖论:声称最重视安全的厂商最需要展示“前沿模型很危险”,以证明其技术领先。风险是真实的,但风险叙事不应被异化为能力秀场。





京公网安备 11011402013531号