当前位置: 首页 » 资讯 » 科技头条 » 正文

阿里Qwen3.8正式发布,编程与办公再进化

IP属地 中国·北京 编辑:柳晴雪 时间:2026-08-04 04:07:14

今天,我们正式发布 Qwen3.8-Max——Qwen家族迄今最强大的模型。下周,我们将开源Qwen3.8-Max的模型权重,同时也将开源Qwen3.8-27B模型。

Qwen 3.8-Max 基于 Qwen 3.5 的架构基础构建,参数规模扩展至 2.4 万亿激活参数95B,支持100万上下文Tokens,在编程、办公、科研以及长周期任务等方面实现了全面提升。它不仅能应对更具挑战性的问题,还能更可靠地端到端完成复杂任务,输出值得信赖的成果。

现在,全球开发者都可通过千问AI平台获得Qwen3.8的API服务:国内每百万Tokens输入12元、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元,与海外相近智能的前沿模型比,Qwen3.8有更高性价比。

相关链接

技术Blog:https://qwen.ai/blog?id=qwen3.8

API(千问AI 平台):https://www.qianwenai.com/models/qwen3.8-max

直接体验(Qwen Studio):https://chat.qwen.ai/?models=qwen3.8-max

模型性能

三方榜单

Arena放榜,Qwen3.8-Max在 Text Arena、CodeArena、VisionArena上的成绩:

Text Arena :文本能力榜单,包含数学、代码、创业写作等领域。

CodeArena : 编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等。

VisionArena:视觉能力榜单,包含视觉推理等核心能力项目。

模型表现

编程能力:独立交付项目

对顶尖模型来说,今天的编程早已不是"你说需求、我写函数",而是从一个空文件夹出发,独立地把一个跨越数天的真实项目做到交付。我们用两个这样的挑战测试了 Qwen3.8-Max——每一份成果,都是它自己写代码、

自己跑测试、自己修复BUG,全程无人帮忙。

从零到有:构建自进化 Harness项目

本案例中,Qwen3.8-Max 被要求从零创建 oh-my-cli 项目,并在十天级长程自动编程中构建一套自进化 harness。它将用户反馈、先进社区实践与模型自测结果统一纳入工程循环,使需求能够被规范化为 issue、由 agent 自动领取并执行,并在代码、测试、预览和日志反馈中持续迭代。

项目完整 trace 均公开保存在 GitHub 仓库:

https://github.com/qwen-code-dev-bot/oh-my-cli

截至 2026 年 7 月 30 日,完全由 AI 自主运行约 16 天后,仓库累计留下 265 次 commits、127 个 PR 和 151 个 issues,展现出持续演进的自动编程能力。

最新研究论文的复现与超越

我们把一篇最新研究论文《Unified Data Selection for LLM Reasoning》交给模型,要求它:用代码复现论文实验,然后想办法做得更好。

复现的难点在于:Qwen3.8-Max 手里除了这篇论文和一批 GPU,别无他物,一切都得从零写起。

Qwen3.8-Max 开始完全地连续独立工作了约五天(125 小时),用约 37 个小时,就从零搭起论文里的整套训练与评测流水线,完整复现了论文的六项主要结论,并在高难数学基准上验证效果。

随后约 88 小时里,Qwen3.8-Max像人类研究员一样思考新的方法,开始跑起了科研循环:提出假设 → 写代码 → 上 GPU 跑 → 分析结果 → 再试。四轮下来,独立提出并测试了 18 种改进方向,最终找到一个超越论文原方法的新做法,在竞赛级数学基准 AIME24 上再提升 2.7 分。

最终五天下来,它写下约 7,600 行代码、执行超过 1,100 步操作、跑了 33 轮 GPU 训练——实现了论文的复现与超越。

办公助手:干得广,还要干得好

除了编程,另一条创造价值的主赛道,是那些琐碎多步骤、离不开各种工具的真实日常工作任务。让 Qwen3.8-Max 在这类工作里既干得广、又干得好,是我们的核心目标。

要做到这点,我们需要提供更强大的训练算力和更多种的工作环境,于是我们把真实世界的强化学习(RL)系统进行了拓展,还解决了拓展过程中三个重要的相互耦合挑战:

如何让工作环境多起来——让环境解耦:

我们把环境拆成三个独立维度:任务(从单步小活到跨多天的长程工作)、工作空间(从几个文件到格式混杂的大型项目)、工具链(不同类别、版本和技能配置)。三者各自沿复杂度递进,互不牵连,环境数量就随任一维度的扩展自然倍增,不需要为每种新组合单独搭一遍。

如何判断"干没干好"——统一奖励系统

不同活的验收方式天然不同:代码要跑通、文档要看格式、截图要核对渲染画面、操作路径本身也要审计。如果每种任务各配一套裁判,任务一多就维护不动,奖励还可能互相矛盾。我们把执行校验、文本评判、视觉检查、行为审计收进一套统一的评分标准,在更多样的RL工作环境中,模型收到的环境奖励始终一致。

如何让训练吃得稳——在线数据均衡:

模型是一批一批训练数据的。如果某一批全是简单代码题、下一批全是高难度文档题,模型收到的反馈信号差异极大,算力堆上去也转化不成能力。均衡器在每个 batch 组装时自动按任务类型、难度、工作区和工具链配平分布,让模型每一步收到的信号是均匀的,训练算力持续、稳定地转化为能力提升。

三者共同提供了广度、可靠奖励与稳定性——将“环境 × 算力”的联合扩展,提升了一批模型在最主流的 harness工具(QwenWork / Claude Code / Codex / OpenClaw / Hermes)上胜任通用工作的能力,让模型不仅干得广,还能干得好。

图 1. 随着 RL 训练持续 scale up,Qwen3.8-Max 在数十个 in-house / public 工作基准上取得稳步、一致的性能提升。

图 2. Qwen3.8-Max 在 QwenWork、Claude Code、 Codex、OpenClaw、Hermes 等众多 harness 上取得相当的性能表现。

在数百种职业里,检验它能干多广

我们在覆盖数百种高价值职业的高频工作场景里,压力测试了Qwen3.8-Max 交付生产级成果的广度。以下是几个代表性案例:

企业合规律师—— 面对数百份文档的语料,Qwen3.8-Max 单次通读即标出 1,284 条相关条款,全部审阅在一小时内完成。同等规模的文档审查通常需要法务助理团队协作执行约一周。 结构工程师—— Qwen3.8-Max 仅凭一份图纸,在浏览器中还原出 30 层写字楼的抗震结构模型,周期、基底剪力、层间位移角均支持悬停实时查看。传统流程需要工程师在专业建模软件中手工搭建,通常耗时一周以上。 体育数据分析师—— Qwen3.8-Max 将每名球员约 8,400 个攻防回合解析为可直接使用的球员战术画像与教练报告,耗时仅数十分钟。传统分析团队则需手工完成战术切片、成因归纳与报告撰写,通常耗时数个工作日。

一次对话,交付可盈利的端到端量化策略

Qwen3.8-Max拥有强大的动态工作流(Dynamic Workflows)构建能力,能够以编程方式驱动任务规划,精准编排大规模子智能体系统,从而把一次对话变成端到端、自动化的量化研发闭环。

论深度——从零跑通一套完整策略。 只给一句任务描述,它连续自主工作数小时,交出一套完整的 ETF 轮动策略:搭数据管道、生成候选因子(预测收益的特征信号)、多轮迭代筛选、回测验证、修正方向。

全程看证据做判断而非走固定脚本:

剪枝冗余因子——当验证期指标与设计期不符时,这通常是过拟合的信号。

加入多种子并集验证——当不同路径收敛到同一信号时,消除路径依赖。

切换策略框架——当小截面上三模型集成不如定向合成稳健时。

论广度——把几个月的活压进一次对话。 量化研究里最耗时的环节是"试因子"——传统做法是一个研究员顺着一条思路慢慢试,试完一条再换下一条。Qwen3.8-Max 把这一步并行化了:从动量、价值、质量等 6 个方向出发,每个方向拆出 50 条研究路径,同时调度约 330 个子智能体并行跑,总共完成约 6,000 次历史回测。最终入选的因子,超额年化收益与风险之比(Sharpe)达到 0.64–1.48,预测稳定性指标(IC)一致为正,介于 0.010–0.014。

原本需要研究员数周甚至数月串行推进的工作,现在一次对话内规模化交付。这也指向一个更大的可能性:模型在长时程自主工作(long-horizon autonomous work)上的更广阔潜力。

长程任务

面对极其复杂的长周期、多约束任务,Qwen3.8-Max 展现出了超越以往的系统级自主规划能力——无论是高精密、强物理约束的芯片设计,还是高度动态、博弈激烈的商业经营,它都能靠"执行—反馈—迭代"的自适应闭环,在数千轮的超长交互中完成算法与策略的深度重构。

自主演进芯片设计,全栈反馈优化性能

Qwen3.8-Max 独立完成了芯片设计中的逻辑重构、多约束优化和后端布局全链路执行。

我们让 Qwen3.8-Max 独立完成一款 GCD/RSA 密码硬件加速器的设计——这是一类典型的高度紧凑、逻辑密集的数字电路。

在没有参考设计、没有人类干预的条件下,它在一个集成了仿真、综合、物理设计工具链的沙箱里,独立完成了从算法架构、RTL 代码到多轮优化的全过程。

单次不间断运行中,它历经约 500 轮交互、71 次评估、13 个关键里程碑,把设计从首个跑通的 8,298 门一路优化到 678 门,在所有参评模型中表现最优。即使在数百轮交互后,Qwen3.8-Max 仍能发起重大的结构性演进,而未在早期局部收益中陷入瓶颈。

更关键的是,这套前端优化在真实物理实现中同样成立。它证明了:架构级别的深度演进,可以无缝、高效地转化为更小、更快、更好布线的实体芯片。

长程经营,持续学习

E-Commerce Bench 是一个模拟 365 天长周期电商经营的基准,基于淘宝天猫真实脱敏交易数据构建,还原了 12 种店铺、60 个商品类目、近 600 家供应商、7,000 种商品的复杂生态。模型手握 ¥100,000 启动资金同时运营多家网店,要独立完成选品、供应链议价、库存管理、动态定价、退货处理等全链路决策,目标是年末总现金最大化。

Qwen3.8-Max 展现出了两样过人之处:一是持续学习——它能把和某个供应商磨出来的议价经验,泛化到同类商品上,而其他模型的议价效率往往中期就陷入瓶颈;二是前瞻规划——它在经营最初期就投入最多资金布局,让后续资产增长更快,年终大促期间净利润突破 10 万元,是第二名 GLM 5.2 的近 2.4 倍。Qwen3.8-Max 最终以高达 ¥416,252(4.16×回报)的总现金胜出,比第二名 GLM 5.2 高出 38%,相较上一代旗舰模型 Qwen3.7-Max 提升 152%。这一结果表明,Qwen3.8-Max 不仅具备长程连贯决策优势,也拥有从交易反馈中自适应学习的能力。

多模态智能体

从它所看见的一切,到它所完成的一切,Qwen3.8-Max 展示的不只是“看懂图片、文档和视频”的能力,而是一套贯穿任务全流程的视觉生产力。

看得懂:海量信息一次吃透。

超 200 页财报、复杂 PDF,跨页读懂文字、图表与版面,直接提炼结论、生成可交付的报告和网页;超 100 小时长视频,不只定位片段,还把人物、事件、时间织成一张可查询的"视频 Graph 记忆"。原本一次消化不了的海量信息,被转成可检索、可追溯、可交互的知识结构

做得出:理解之外,真能动手交付

把生活素材剪成 Vlog,把一道题变成沉浸式教学动画,把一张界面截图还原成完整前端项目,把户型图建成 Blender(三维建模软件)3D 装修效果,甚至从一句需求开发出可交互的游戏和应用。

会观察:边做边看,自己纠错

视觉能力不只在任务的输入端。执行过程中,它持续观察自己的中间产物,检查页面布局、物体朝向、空间关系、动画与交互效果;一旦发现电视放反、界面错位、效果不对,就定位偏差、重新规划、自主修正。

在数字世界里,要独立地把一个复杂任务真正做完,往往需要同时做两件事:用代码实现底层逻辑,并亲手操作界面来推进任务、观察结果。这种 混合智能体(Hybrid Agent) 能力——即 编程(Coding)与 GUI 操作 的结合——让两条路径彼此互补:编程高效且大规模地完成繁重工作,GUI 操作则触达人类所能看见、所能操作的一切,更关键的是把真实运行系统中的实际反馈带回来检查自己的产物,做到在真实、运行中的应用上验证。

为衡量这一能力,我们构建了 RecreationBench——让模型面对一个正在运行的真实应用,没有源码、不能联网,只能像用户一样去点、去看、去试,然后从零复刻出整个应用,覆盖桌面、移动端和 Web 五大平台。Qwen3.8-Max 在此基准上已展现前沿水准,能靠"写代码—看效果—再改"的循环一步步逼近原版应用。

此外,我们推出Qwen-MM-Plugins,一个即插即用的多模态扩展库,让不同的 Agent 框架直接获得图像处理、视频剪辑、3D 建模等视觉能力,无需从头搭建。

用户反馈

对 Qwen3.8-Max 最真实的判断,来自真正拿它做事的人。无论是头部智能体应用平台、领先的开源算法团队,还是来自法律、金融、制造等领域的专业公司,新兴创业团队、个人开发者与学术科研者,都在把复杂、关键、长链路的任务持续交给它。

企业用户用它搭建和驱动大规模智能体系统,白领工作者把图片、手稿、视频等繁杂材料一次性交给它处理,开发者直接让它承担高强度工程任务,科研团队则用它跑通“文献—数据—仿真”的完整研究闭环。同一个模型,在不同领域、不同工作流中被反复用到“离不开”,最终得到一致的结论:Qwen3.8-Max 既能稳定承接长链路的自主任务,也能一次生成可直接交付的高质量结果。

完整性能结果

文本能力

视觉能力

总结

Qwen3.8-Max 是我们迄今最强大的模型,也是首个 Max 规模的开源权重模型。参数规模扩展至 2.4 万亿,它在编程、专业办公、长程任务与多模态智能体等方面实现全面提升——能够以极少的人工介入将复杂、开放的目标端到端完成,交付值得信赖的成果。模型权重将于下周开源,敬请期待。我们欢迎社区反馈,期待看到大家的创造。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。