网易首页 > 网易号 > 正文 申请入驻

阿里Qwen3.8正式发布,编程与办公再进化

0
分享至


今天,我们正式发布Qwen3.8-Max——Qwen家族迄今最强大的模型。下周,我们将开源Qwen3.8-Max的模型权重,同时也将开源Qwen3.8-27B模型。

Qwen 3.8-Max 基于 Qwen 3.5 的架构基础构建,参数规模扩展至2.4 万亿,激活参数95B,支持100万上下文Tokens,在编程、办公、科研以及长周期任务等方面实现了全面提升。它不仅能应对更具挑战性的问题,还能更可靠地端到端完成复杂任务,输出值得信赖的成果。

现在,全球开发者都可通过千问AI平台获得Qwen3.8的API服务:国内每百万Tokens输入12元、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元,与海外相近智能的前沿模型比,Qwen3.8有更高性价比。

技术Blog:https://qwen.ai/blog?id=qwen3.8

API(千问AI 平台):https://www.qianwenai.com/models/qwen3.8-max

直接体验(Qwen Studio):https://chat.qwen.ai/?models=qwen3.8-max

模型性能


三方榜单

Arena放榜,Qwen3.8-Max在 Text Arena、CodeArena、VisionArena上的成绩:

Text Arena :文本能力榜单,包含数学、代码、创业写作等领域。


CodeArena : 编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等。


VisionArena:视觉能力榜单,包含视觉推理等核心能力项目。


模型表现

编程能力:独立交付项目

对顶尖模型来说,今天的编程早已不是"你说需求、我写函数",而是从一个空文件夹出发,独立地把一个跨越数天的真实项目做到交付。我们用两个这样的挑战测试了 Qwen3.8-Max——每一份成果,都是它自己写代码、

自己跑测试、自己修复BUG,全程无人帮忙。

从零到有:构建自进化 Harness项目

本案例中,Qwen3.8-Max 被要求从零创建 oh-my-cli 项目,并在十天级长程自动编程中构建一套自进化 harness。它将用户反馈、先进社区实践与模型自测结果统一纳入工程循环,使需求能够被规范化为 issue、由 agent 自动领取并执行,并在代码、测试、预览和日志反馈中持续迭代。

项目完整 trace 均公开保存在 GitHub 仓库:

https://github.com/qwen-code-dev-bot/oh-my-cli

截至 2026 年 7 月 30 日,完全由 AI 自主运行约 16 天后,仓库累计留下 265 次 commits、127 个 PR 和 151 个 issues,展现出持续演进的自动编程能力。

最新研究论文的复现与超越

我们把一篇最新研究论文《Unified Data Selection for LLM Reasoning》交给模型,要求它:用代码复现论文实验,然后想办法做得更好。


复现的难点在于:Qwen3.8-Max 手里除了这篇论文和一批 GPU,别无他物,一切都得从零写起。

Qwen3.8-Max 开始完全地连续独立工作了约五天(125 小时),用约 37 个小时,就从零搭起论文里的整套训练与评测流水线,完整复现了论文的六项主要结论,并在高难数学基准上验证效果。

随后约 88 小时里,Qwen3.8-Max像人类研究员一样思考新的方法,开始跑起了科研循环:提出假设 → 写代码 → 上 GPU 跑 → 分析结果 → 再试。四轮下来,独立提出并测试了 18 种改进方向,最终找到一个超越论文原方法的新做法,在竞赛级数学基准 AIME24 上再提升 2.7 分。


最终五天下来,它写下约 7,600 行代码、执行超过 1,100 步操作、跑了 33 轮 GPU 训练——实现了论文的复现与超越。

办公助手:干得广,还要干得好

除了编程,另一条创造价值的主赛道,是那些琐碎多步骤、离不开各种工具的真实日常工作任务。让 Qwen3.8-Max 在这类工作里既干得广、又干得好,是我们的核心目标。

要做到这点,我们需要提供更强大的训练算力和更多种的工作环境,于是我们把真实世界的强化学习(RL)系统进行了拓展,还解决了拓展过程中三个重要的相互耦合挑战:


  1. 如何让工作环境多起来——让环境解耦:

    我们把环境拆成三个独立维度:任务(从单步小活到跨多天的长程工作)、工作空间(从几个文件到格式混杂的大型项目)、工具链(不同类别、版本和技能配置)。三者各自沿复杂度递进,互不牵连,环境数量就随任一维度的扩展自然倍增,不需要为每种新组合单独搭一遍。

  2. 如何判断"干没干好"——统一奖励系统

    不同活的验收方式天然不同:代码要跑通、文档要看格式、截图要核对渲染画面、操作路径本身也要审计。如果每种任务各配一套裁判,任务一多就维护不动,奖励还可能互相矛盾。我们把执行校验、文本评判、视觉检查、行为审计收进一套统一的评分标准,在更多样的RL工作环境中,模型收到的环境奖励始终一致。

  3. 如何让训练吃得稳——在线数据均衡:

    模型是一批一批训练数据的。如果某一批全是简单代码题、下一批全是高难度文档题,模型收到的反馈信号差异极大,算力堆上去也转化不成能力。均衡器在每个 batch 组装时自动按任务类型、难度、工作区和工具链配平分布,让模型每一步收到的信号是均匀的,训练算力持续、稳定地转化为能力提升。

三者共同提供了广度、可靠奖励与稳定性——将“环境 × 算力”的联合扩展,提升了一批模型在最主流的 harness工具(QwenWork / Claude Code / Codex / OpenClaw / Hermes)上胜任通用工作的能力,让模型不仅干得广,还能干得好。


图 1. 随着 RL 训练持续 scale up,Qwen3.8-Max 在数十个 in-house / public 工作基准上取得稳步、一致的性能提升。


图 2. Qwen3.8-Max 在 QwenWork、Claude Code、 Codex、OpenClaw、Hermes 等众多 harness 上取得相当的性能表现。

在数百种职业里,检验它能干多广

我们在覆盖数百种高价值职业的高频工作场景里,压力测试了Qwen3.8-Max 交付生产级成果的广度。以下是几个代表性案例:

  • 企业合规律师—— 面对数百份文档的语料,Qwen3.8-Max单次通读即标出1,284 条相关条款,全部审阅在一小时内完成。同等规模的文档审查通常需要法务助理团队协作执行约一周
  • 结构工程师—— Qwen3.8-Max 仅凭一份图纸,在浏览器中还原出30 层写字楼的抗震结构模型,周期、基底剪力、层间位移角均支持悬停实时查看。传统流程需要工程师在专业建模软件中手工搭建,通常耗时一周以上。
  • 体育数据分析师—— Qwen3.8-Max 将每名球员约8,400 个攻防回合解析为可直接使用的球员战术画像教练报告耗时仅数十分钟。传统分析团队则需手工完成战术切片、成因归纳与报告撰写,通常耗时数个工作日

一次对话,交付可盈利的端到端量化策略

Qwen3.8-Max拥有强大的动态工作流(Dynamic Workflows)构建能力,能够以编程方式驱动任务规划,精准编排大规模子智能体系统,从而把一次对话变成端到端、自动化的量化研发闭环。

论深度——从零跑通一套完整策略。 只给一句任务描述,它连续自主工作数小时,交出一套完整的 ETF 轮动策略:搭数据管道、生成候选因子(预测收益的特征信号)、多轮迭代筛选、回测验证、修正方向。

全程看证据做判断而非走固定脚本:


  • 剪枝冗余因子——当验证期指标与设计期不符时,这通常是过拟合的信号。

  • 加入多种子并集验证——当不同路径收敛到同一信号时,消除路径依赖。

  • 切换策略框架——当小截面上三模型集成不如定向合成稳健时。

论广度——把几个月的活压进一次对话。 量化研究里最耗时的环节是"试因子"——传统做法是一个研究员顺着一条思路慢慢试,试完一条再换下一条。Qwen3.8-Max 把这一步并行化了:从动量、价值、质量等 6 个方向出发,每个方向拆出 50 条研究路径,同时调度约 330 个子智能体并行跑,总共完成约 6,000 次历史回测。最终入选的因子,超额年化收益与风险之比(Sharpe)达到 0.64–1.48,预测稳定性指标(IC)一致为正,介于 0.010–0.014。

原本需要研究员数周甚至数月串行推进的工作,现在一次对话内规模化交付。这也指向一个更大的可能性:模型在长时程自主工作(long-horizon autonomous work)上的更广阔潜力。

长程任务

面对极其复杂的长周期、多约束任务,Qwen3.8-Max 展现出了超越以往的系统级自主规划能力——无论是高精密、强物理约束的芯片设计,还是高度动态、博弈激烈的商业经营,它都能靠"执行—反馈—迭代"的自适应闭环,在数千轮的超长交互中完成算法与策略的深度重构。

自主演进芯片设计,全栈反馈优化性能

Qwen3.8-Max 独立完成了芯片设计中的逻辑重构、多约束优化和后端布局全链路执行。

我们让 Qwen3.8-Max 独立完成一款 GCD/RSA 密码硬件加速器的设计——这是一类典型的高度紧凑、逻辑密集的数字电路。

在没有参考设计、没有人类干预的条件下,它在一个集成了仿真、综合、物理设计工具链的沙箱里,独立完成了从算法架构、RTL 代码到多轮优化的全过程。

单次不间断运行中,它历经约 500 轮交互、71 次评估、13 个关键里程碑,把设计从首个跑通的 8,298 门一路优化到 678 门,在所有参评模型中表现最优。即使在数百轮交互后,Qwen3.8-Max 仍能发起重大的结构性演进,而未在早期局部收益中陷入瓶颈。

更关键的是,这套前端优化在真实物理实现中同样成立。它证明了:架构级别的深度演进,可以无缝、高效地转化为更小、更快、更好布线的实体芯片。

长程经营,持续学习

E-Commerce Bench 是一个模拟 365 天长周期电商经营的基准,基于淘宝天猫真实脱敏交易数据构建,还原了 12 种店铺、60 个商品类目、近 600 家供应商、7,000 种商品的复杂生态。模型手握 ¥100,000 启动资金同时运营多家网店,要独立完成选品、供应链议价、库存管理、动态定价、退货处理等全链路决策,目标是年末总现金最大化。

Qwen3.8-Max 展现出了两样过人之处:一是持续学习——它能把和某个供应商磨出来的议价经验,泛化到同类商品上,而其他模型的议价效率往往中期就陷入瓶颈;二是前瞻规划——它在经营最初期就投入最多资金布局,让后续资产增长更快,年终大促期间净利润突破 10 万元,是第二名 GLM 5.2 的近 2.4 倍。Qwen3.8-Max 最终以高达 ¥416,252(4.16×回报)的总现金胜出,比第二名 GLM 5.2 高出 38%,相较上一代旗舰模型 Qwen3.7-Max 提升 152%。这一结果表明,Qwen3.8-Max 不仅具备长程连贯决策优势,也拥有从交易反馈中自适应学习的能力。

多模态智能体

从它所看见的一切,到它所完成的一切,Qwen3.8-Max 展示的不只是“看懂图片、文档和视频”的能力,而是一套贯穿任务全流程的视觉生产力。

看得懂:海量信息一次吃透。

超 200 页财报、复杂 PDF,跨页读懂文字、图表与版面,直接提炼结论、生成可交付的报告和网页;超 100 小时长视频,不只定位片段,还把人物、事件、时间织成一张可查询的"视频 Graph 记忆"。原本一次消化不了的海量信息,被转成可检索、可追溯、可交互的知识结构

做得出:理解之外,真能动手交付

把生活素材剪成 Vlog,把一道题变成沉浸式教学动画,把一张界面截图还原成完整前端项目,把户型图建成 Blender(三维建模软件)3D 装修效果,甚至从一句需求开发出可交互的游戏和应用。

会观察:边做边看,自己纠错

视觉能力不只在任务的输入端。执行过程中,它持续观察自己的中间产物,检查页面布局、物体朝向、空间关系、动画与交互效果;一旦发现电视放反、界面错位、效果不对,就定位偏差、重新规划、自主修正。

在数字世界里,要独立地把一个复杂任务真正做完,往往需要同时做两件事:用代码实现底层逻辑,并亲手操作界面来推进任务、观察结果。这种 混合智能体(Hybrid Agent) 能力——即 编程(Coding)与 GUI 操作 的结合——让两条路径彼此互补:编程高效且大规模地完成繁重工作,GUI 操作则触达人类所能看见、所能操作的一切,更关键的是把真实运行系统中的实际反馈带回来检查自己的产物,做到在真实、运行中的应用上验证。

为衡量这一能力,我们构建了RecreationBench——让模型面对一个正在运行的真实应用,没有源码、不能联网,只能像用户一样去点、去看、去试,然后从零复刻出整个应用,覆盖桌面、移动端和 Web 五大平台。Qwen3.8-Max 在此基准上已展现前沿水准,能靠"写代码—看效果—再改"的循环一步步逼近原版应用。

此外,我们推出Qwen-MM-Plugins,一个即插即用的多模态扩展库,让不同的 Agent 框架直接获得图像处理、视频剪辑、3D 建模等视觉能力,无需从头搭建。

用户反馈

对 Qwen3.8-Max 最真实的判断,来自真正拿它做事的人。无论是头部智能体应用平台、领先的开源算法团队,还是来自法律、金融、制造等领域的专业公司,新兴创业团队、个人开发者与学术科研者,都在把复杂、关键、长链路的任务持续交给它。

企业用户用它搭建和驱动大规模智能体系统,白领工作者把图片、手稿、视频等繁杂材料一次性交给它处理,开发者直接让它承担高强度工程任务,科研团队则用它跑通“文献—数据—仿真”的完整研究闭环。同一个模型,在不同领域、不同工作流中被反复用到“离不开”,最终得到一致的结论:Qwen3.8-Max 既能稳定承接长链路的自主任务,也能一次生成可直接交付的高质量结果。

完整性能结果

文本能力


视觉能力


总结

Qwen3.8-Max 是我们迄今最强大的模型,也是首个 Max 规模的开源权重模型。参数规模扩展至 2.4 万亿,它在编程、专业办公、长程任务与多模态智能体等方面实现全面提升——能够以极少的人工介入将复杂、开放的目标端到端完成,交付值得信赖的成果。模型权重将于下周开源,敬请期待。我们欢迎社区反馈,期待看到大家的创造。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
江淮汽车再度跌停,两日市值蒸发118亿;懂车帝测试尊界V800主视频在B站、微博等多个平台已无法正常访问,懂车帝网页版也无法查找到该视频

江淮汽车再度跌停,两日市值蒸发118亿;懂车帝测试尊界V800主视频在B站、微博等多个平台已无法正常访问,懂车帝网页版也无法查找到该视频

都市快报橙柿互动
2026-10-09 11:50:08
直接挂断诺奖来电!新科诺贝尔文学奖得主:今天只是平常的一天

直接挂断诺奖来电!新科诺贝尔文学奖得主:今天只是平常的一天

颤抖的熊猫
2026-10-09 13:02:16
2-0!2-0!中网女单4强出其二,郑钦文冲四强,连收1好+1坏消息!

2-0!2-0!中网女单4强出其二,郑钦文冲四强,连收1好+1坏消息!

大秦壁虎白话体育
2026-10-08 21:05:00
《哈利·波特》里让人拳头发硬的马尔福,在外网成了金发傲娇大小姐

《哈利·波特》里让人拳头发硬的马尔福,在外网成了金发傲娇大小姐

3DM游戏
2026-10-07 18:28:57
上映8天,票房仅2.4亿,离开了赵本山,他没啥票房号召力

上映8天,票房仅2.4亿,离开了赵本山,他没啥票房号召力

糊咖娱乐
2026-10-08 14:54:01
68岁男子中毒身亡,医生:吃完降压药切记别碰这4样,中老年注意

68岁男子中毒身亡,医生:吃完降压药切记别碰这4样,中老年注意

健康科普365
2026-10-09 14:35:09
刚拿冠军就退役,当晚直接打包行李走人,这姑娘的操作把全网看傻

刚拿冠军就退役,当晚直接打包行李走人,这姑娘的操作把全网看傻

静若梨花
2026-08-29 10:42:55
江苏省卫健委一把手要换人

江苏省卫健委一把手要换人

金水路7号站
2026-10-09 17:40:50
孙兴慜被要求退队!金玟哉率等人上书足协,韩国队更衣室内讧!

孙兴慜被要求退队!金玟哉率等人上书足协,韩国队更衣室内讧!

海浪星体育
2026-10-09 14:50:53
腾格尔现状:住北京别墅,66岁彻底戒酒,把老来得子儿子宠成宝

腾格尔现状:住北京别墅,66岁彻底戒酒,把老来得子儿子宠成宝

财叔
2026-10-07 20:40:08
推广夜间门诊的人,倒在了夜里!54岁副院长猝死

推广夜间门诊的人,倒在了夜里!54岁副院长猝死

康迅网
2026-10-09 10:08:39
帅化民曾说:以前毛主席骂美国是帝国主义纸老虎,我是不服的!

帅化民曾说:以前毛主席骂美国是帝国主义纸老虎,我是不服的!

回京历史梦
2026-10-07 07:55:12
7万暴跌到2万8!深圳光明彻底熄火,当年抢破头的中产亏惨了

7万暴跌到2万8!深圳光明彻底熄火,当年抢破头的中产亏惨了

爱看剧的阿峰
2026-10-09 11:04:55
蔡康永凉透,李成儒竟口碑大逆转,网友:原来你当年就看出来了!

蔡康永凉透,李成儒竟口碑大逆转,网友:原来你当年就看出来了!

老吴教育课堂
2026-10-08 12:54:58
乌国家紧急情况局:克拉马托尔斯克遭袭致33人死亡

乌国家紧急情况局:克拉马托尔斯克遭袭致33人死亡

澎湃新闻
2026-10-08 23:31:04
为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

好爸育儿
2026-10-07 11:07:25
蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

果妈聊娱乐
2026-08-23 08:38:03
大众新车官宣:10月12日,正式上市!

大众新车官宣:10月12日,正式上市!

科技堡垒
2026-10-09 12:19:30
差3球追平C罗,梅西退役前还有9件事没做完

差3球追平C罗,梅西退役前还有9件事没做完

元气满分吖
2026-10-08 23:23:23
26岁女团成员近照疯传:这状态说是高中生也有人信

26岁女团成员近照疯传:这状态说是高中生也有人信

追星雷达站
2026-10-08 17:51:48
2026-10-09 18:28:49
阿里研究院 incentive-icons
阿里研究院
推动商业互联网化
1971文章数 2182关注度
往期回顾 全部

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

最淡泊的福建首富静静地走了 其家族现坐拥105亿财富

头条要闻

最淡泊的福建首富静静地走了 其家族现坐拥105亿财富

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

央行为何发布关于人民币汇率的政策立场

汽车要闻

比亚迪第三代唐内饰发布 两种风格/巨幕屏最抢眼

态度原创

教育
本地
游戏
艺术
旅游

教育要闻

刚刚,北京市教委发布——

本地新闻

转型再出发 奋勇打头阵

PS5超强PS2模拟器重大飞跃:原生8倍分辨率 60帧补丁

艺术要闻

当代油画家区础坚 女性人物油画选

旅游要闻

七天客流超31.4万人次,第二届捕风生活节聚起横琴烟火气

无障碍浏览 进入关怀版