当前位置: 首页 » 资讯 » 科技头条 » 正文

红杉资本深度对话:Transformer架构遇瓶颈,持续学习新架构或成AGI关键

IP属地 中国·北京 编辑:大力财经 头部财经 时间:2026-08-01 03:24:54

在红杉资本最新一期播客中,前OpenAI推理负责人杰瑞·特沃雷克与前Google Gemini预训练负责人罗汉·阿尼尔首次公开讨论了他们离开顶级实验室、创立Core Automation的初衷。两位专家提出一个大胆观点:Transformer架构已接近极限,通往通用人工智能(AGI)的真正障碍并非规模,而是架构本身。

特沃雷克指出,当前研究过度聚焦于让Transformer更高效、更廉价,却忽视了增强其表达力和适应能力。他强调,大规模预训练和强化学习虽已成熟,但单纯扩大规模已不足以突破现有瓶颈。"我们需要思考如何让模型变得更强,而非仅仅更大。"他以编程工具Codex为例,尽管这类系统已能自动化部分任务,但仍无法完全替代人类工作,这促使他思考自动化技术的下一步发展方向。

阿尼尔从架构设计角度补充道,Transformer的核心问题在于计算分配效率低下。他解释,当前模型通过增加token数量来延长推理时间,这种逐token生成的方式在计算深度上存在天然局限。他以QR分解算法为例,说明通过优化底层计算内核(kernel),可将运算速度提升60倍,这凸显了改进基础架构的迫切性。

两位创始人认为,现有实验室受制于市场竞争压力,难以投入资源探索替代方案。特沃雷克坦言:"当继续扩大Transformer规模就能赢得下个季度时,很难说服组织尝试可能一年后才见效的新路径。"这种行业现状促使他们决定创业,专注于开发能在部署后持续学习的新架构。

关于新架构的具体方向,他们强调需要突破"逐token推理"的范式。阿尼尔指出,当前系统通过思维链扩展计算深度的方式效率低下,理想架构应能直接在模型结构中表达学习过程。特沃雷克则提出,新系统需具备测试时学习能力,能够在真实世界任务中持续适应变化,而非仅依赖训练数据。

Core Automation的短期目标聚焦于自动化实验流程。阿尼尔透露,公司正致力于开发能自动生成和优化GPU内核的技术,这将大幅缩短从架构创新到硬件实现的周期。他们以线性代数操作优化为例,说明当前前沿模型仍无法独立解决这类底层计算问题,而自动内核生成技术可能成为突破关键。

对于AGI的定义,特沃雷克坚持认为,真正的AGI应具备自我改进能力。他提出一个实验标准:当系统能在没有人类干预的情况下持续提升自身性能时,才可视为接近AGI。"现在的系统仍需人类参与闭环优化,这离真正的自主进化还有很大距离。"

在研究方法上,Core Automation强调高效探索架构空间。特沃雷克描述了他们的理想状态:通过高度自动化的实验流程,快速验证大量架构假设。阿尼尔补充道,这需要结合先验知识和系统化搜索,而非盲目尝试所有可能性。他们计划优先验证那些能显著提升计算效率的新架构。

当被问及如何判断新架构成功时,特沃雷克描述了一个理想场景:系统能持续改进自身性能,甚至在研究人员休假期间仍能产生有价值的创新。这种自我进化能力,正是他们追求的核心目标。阿尼尔半开玩笑地建议,可以通过团队集体度假来测试系统的自主性,这引发现场笑声。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新