![]()
8月13日,阿里千问团队正式开放Qwen3.8-2.4T-A95B模型权重。这是千问历史上第一次把Max级别旗舰大模型对外开放,消息迅速在全球开发者社群传开。
![]()
就在近期,全球头部AI厂商接连推出新一代基座模型:马斯克Grok4.6登场、DeepSeek-V4-Pro正式落地,叠加本次千问旗舰开源。各家不再单纯比拼单次对话答题水平,不约而同押注同一个方向——长周期自主智能体。AI的竞争,正式从“一问一答”转向独立完成持续数日的复杂项目。
一、Qwen3.8旗舰开源:国产万亿参数模型迈出关键一步
本次开放权重的Qwen3.8-2.4T-A95B,正是8月3日发布的Qwen3.8-Max基座。模型总参数达到2.4万亿,采用MoE稀疏架构,每一轮推理只激活950亿参数,兼顾超大模型能力与推理效率。
模型原生支持262144Token上下文,经过拓展最高可处理101万Token文本,内置视觉输入、工具调用能力。不同于很多模型可以手动关闭思考流程,Qwen3.8全系默认开启思考模式,输出答案前会生成完整思考链路,并且无法关闭。
开发者可以直接在魔搭社区、HuggingFace下载完整权重,同时千问官方预告,轻量化版本Qwen3.8-27B也将在后续开放。在此之前,同规格顶级旗舰模型大多保持闭源,企业想要使用只能依赖云端API。此次权重开放,意味着科研团队、企业能够本地私有化部署、二次微调,搭建属于自己的高端AI底座。
部署层面,模型支持vLLM、SGLang、TokenSpeed主流推理引擎,不过想要稳定运行,需要搭配针对Qwen3.8优化的部署方案,根据显卡规格调整并行策略。原始完整权重体积达到4.9TB,对硬件存储提出极高门槛。
二、硬件门槛大幅降低,量化方案让本地运行成为可能
庞大的原始权重,一度让普通团队望而却步。开源项目UnslothAI很快拿出解决方案,依靠动态1-bit分层选择性量化技术,将模型体积压缩至397GB,存储空间直接缩减91%。
借助配套的Unsloth-Desktop工具,只要设备内存与显存总和超过410GB,就能够本地加载运行这套2.4万亿参数模型。虽然依旧需要高端服务器硬件,但和原本数TB的存储需求相比,落地门槛已经明显下降,不少科研实验室具备了测试条件。
![]()
这套量化方案,也方便全球开发者充分检验Qwen3.8的真实水平。在此之前,大家只能通过API体验Qwen3.8-Max,完整权重开放之后,开发者能够开展底层调试、安全测试与行业场景定制开发。
三、成绩单有亮点也有短板:专攻长周期自主任务
千问团队对外表示,Qwen3.8目标打造“除Fable5以外最强模型”,官方放出的基准测试成绩,呈现出明显的强弱分化。
优势赛道十分突出:论文复现评测PaperBench拿到93.0分,超越GPT-5.6Sol、Fable5;模拟操控电脑的OSWorld-Verified测试斩获86.1分排名第一;CAD参数化设计任务同样击败多款海外旗舰。
![]()
但它并非全面领先。在代码工程SWE-benchPro、终端操作TerminalBench2.1、长视频理解VideoMMEv2等测试中,分数略低于GPT-5.6Sol、ClaudeFable5等竞品。这份成绩单也清晰说明,不存在一款全能大模型,不同基座各有所长。
比起冰冷的跑分,Qwen3.8最值得关注的设计思路,是面向跨时长复杂任务。以往很多AI适合短任务即时交互,而千问这次着重验证长时间自主工作能力。
实测场景里,模型连续自主编程长达16天,持续收集需求、派发任务、生成代码并且自我修复;独立复现、改进学术论文;参与算法竞赛;在2000轮以上交互中运营虚拟电商。
![]()
简单来说,厂商想要实现的目标正在落地:不用人类持续指挥,AI可以独立推进一个持续数天甚至数周的完整项目,自主发现问题、迭代方案,这也是智能体走向实用化的核心前提。
四、全球三大模型集中更新,赛道转向智能体竞赛
近期接连登场的Grok4.6、DeepSeek-V4-Pro、Qwen3.8,释放出高度一致的行业信号。曾经各家热衷于比拼参数量、上下文长度、通用对话分数,新一轮竞争焦点已经切换。
所有头部团队都在集中资源攻克长周期智能体能力,比拼AI脱离人工干预、自主闭环完成完整项目的水平。未来AI不再只是聊天助手,更像可以长期委托工作的数字化员工。
同时,开源战略的价值持续凸显。海外顶尖旗舰大多严守闭源策略,阿里选择开放万亿级基座权重,丰富国内开源大模型生态。搭配清晰的API定价策略:国内输入每百万Tokens12元、输出36元;海外输入2美元、输出6美元,缓存调用价格更低,兼顾云端商用与本地部署两条路线。
从参数堆叠,到跑分内卷,再到如今全力攻坚长周期自主任务,大模型行业的竞争逻辑正在发生根本性转变。Qwen3.8旗舰权重开放,不只是一次技术发布,更是国产高端基座走向开放生态的重要一步。
跑分有高有低是常态,短期很难出现一款碾压所有对手的通用大模型。接下来,开发者社区的实测、行业场景落地、长时间运行稳定性,才是检验Qwen3.8真实实力的关键。随着更多顶尖模型陆续开源,属于AI智能体的落地浪潮,已经正式开启。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.