当前位置: 首页 » 资讯 » 科技头条 » 正文

智能的边界:当AI代理走进实验室,为何仍写不出一篇合格的论文

IP属地 中国·北京 编辑:刘敏 科技小蘑菇 时间:2026-08-16 08:05:29

在人工智能被寄予厚望、几乎被视为科学发现下一个引擎的时代,一项最新研究给这股热潮泼了一盆冷水。研究人员发现,即便是当前最先进的AI代理,在独立完成开放式科学研究任务时,仍远远达不到人类科学家的水准——它们写出的论文,甚至无法通过顶级学术会议最基本的评审关卡。

这项发表在预印本平台arXiv上的研究,由Peter Kirgis等人主持完成。研究团队为几款前沿AI代理——即那些被设计用来自主执行复杂多步骤任务的顶尖智能系统——设置了一场颇具挑战性的测试:给予它们六天时间,围绕两篇当时尚未公开发表的AI会议投稿主题,独立开展研究并撰写论文。

选择未发表的课题,是为了确保AI无法简单地从互联网上抄袭或检索到现成答案。这两个课题分别涉及语言模型人格的结构与可控性,以及为表格型基础模型设计一种分布偏移检测器——都是当下人工智能研究的前沿方向。

六天、三千美元与彻底的失败

为了让测试尽可能贴近真实科研场景,研究者给这些AI代理配备了充分的资源:不受限制的互联网访问权限、专属计算算力,以及约合三千美元的模型使用额度,理论上足以支撑它们进行大量实验和探索。六天期限一到,人类专家研究者按照顶级AI会议的评审标准,对AI撰写的论文逐一打分。

结果堪称惨淡:两篇论文分别只获得了六分制中的2分和1分——这是明确无误的拒稿级别评价。评审专家指出,尽管AI理解了研究问题,甚至提出了一些与原始研究者思路相近的方向,但其科学推理过程存在严重缺陷。

实验设计被形容为怪异且难以理解,其研究结论更像是事后拼凑出的选择,而非严谨的假设检验。一位评审专家还特别批评了AI从有限的失败测试中得出过度概括结论的逻辑漏洞,称其为一种举例证明式的非科学谬误。

更耐人寻味的是,这些AI代理在面对负面反馈时表现笨拙——它们往往只是在已有结论上打补丁、加注释,而不是推倒重来、重新设计实验。

与此同时,尽管拥有六天的充裕时间和三千美元的预算,它们实际使用的API额度还不到一半,却仍然像赶工一样匆忙提交了远未达到发表标准的论文。这种有时间不用、有预算不花的现象,暴露出AI代理在自主规划、风险评估和耐心打磨等方面,与真正的科研思维仍有本质差距。

从能写代码到能做科学,鸿沟依然巨大

值得注意的是,这并非人工智能第一次在复杂科研任务上折戟。国际权威科学期刊《自然》近期发布的一份行业报告同样指出,尽管科研人员已经广泛拥抱AI工具,但在真正复杂的研究任务上,人类科学家依然全面胜过最优秀的AI代理。

这与国内学界的观察不谋而合——中国科学院院士周志华近期也曾公开呼吁,应加大对AI算法基础研究的支持力度,鼓励科研人员开展真正的原创性研究,恰恰从侧面印证了当前AI在原创这一维度上的短板。

需要澄清的是,这些结果并不意味着AI在科研领域毫无价值。目前来看,AI更适合扮演科研助手的角色——撰写代码、检索文献、跑通实验流程,这些环节它已表现得相当出色。

但从辅助性工作跃升到独立提出假设、设计实验、面对失败并自我纠偏的完整科研闭环,仍是一道尚未跨越的门槛。正如图灵奖得主姚期智在2026世界人工智能大会上所言,人工智能有局限性其实是好事,明确这些边界,恰恰是让人类与AI形成良性协作、而非盲目替代关系的前提。

科学发现的本质,从来不只是信息处理与模式匹配,而是在不确定性中提出问题、承受失败、不断修正方向的漫长过程。至少在目前,这份属于人类的耐心与判断力,还是机器难以复制的稀缺能力。

标签: ai 人工智能 科研 论文 研究者 模型 代码 额度 结论 课题

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。