阿里巴巴Qwen团队发布了Qwen 3.5小模型系列——一系列涵盖0.8B、2B、4B和9B参数四种尺寸的紧凑型AI模型。该版本还包含了每种尺寸的基础模型,团队表示,这些模型旨在更好地支持研究、实验和实际工业应用。
这一发布凸显了人工智能发展的一个日益增长的趋势:以显著降低的计算成本交付竞争情报。
1.远超自身能力
头条新闻是效率。Qwen 3.5-9B——小系列中最大的型号——正在缩小性能差距,而性能则大一个数量级。与模型同时发布的基准数据显示,Qwen3.5-9B在多项评估中均与甚至超过GPT-OSS-120B,包括GPQA Diamond(81.7对71.5)、HMMT 2025年2月(83.2对76.7)、MMMU-Pro(70.1对59.7)和ERQA(55.5对44.3)。在多个类别中,9B模型的表现也优于体积更大的GPT-OSS-120B——对于一个规模仅为其一小部分的模型来说,这是一个令人瞩目的成绩。
![]()
在多语言基准测试(MMMLU)中,Qwen3.5-9B得分为81.2,略胜GPT-OSS的两个变体,并与Qwen3-Next-80B-A3B-Thinking的81.3分相匹配。在文档识别与理解方面(OmniDocBench v1.5),它以87.7分领先。
2.适用于每个用例的分层架构
Qwen 3.5小型系列设计有明确的分级策略。0.8B和2B型号优化速度和最小资源消耗,适合边缘设备、设备内推理及延迟敏感应用。4B定位为轻量级AI代理的多功能基础模型——在能力与占用空间之间实现了极少有同规模模型能达到的平衡。9B是该系列的旗舰紧凑型车型,性能在一年前的这一参数下根本难以想象。
![]()
所有模型均基于Qwen3.5基础架构构建,该架构具备原生多模态支持、改进的模型架构以及通过强化学习扩展的技术——这一训练方法在前沿规模模型中带来了显著的能力提升。
3.埃隆·马斯克注意到了
此次发布引起了科技界一个意想不到的角落的关注。埃隆·马斯克——近几个月来对OpenAI和Anthropic持批评态度,经常质疑他们模型的能力或方向——简洁地推荐了Qwen 3.5 Small Series在X上的节目,他简单地发帖说:“令人印象深刻的智能密度。”
这条评论虽简短,却意义重大。“智能密度”——能力与模型规模的比例——正是阿里巴巴Qwen团队通过本次发布想要展示的内容。对于一个很少错过质疑竞争对手AI进展机会的人来说,这一赞誉充分反映了更广泛的AI社区对这些结果的接受度。
但也有人对此持怀疑态度。Anthropic的Dario Amodei最近表示,中国模型在基准测试中表现优异,但在现实世界中表现不如预期。
4.坚持开源策略
基础模型与指令调优版本同时发布,是阿里巴巴深化围绕Qwen的开源生态系统的有意举措。基础模型为研究人员和开发者提供了基础,使其能够针对专门任务进行微调、构建专有应用或进行学术工作——而不受指令调优行为的限制。
更广泛的含义显而易见:开源与封闭专有模型之间的差距持续缩小,而中国的人工智能实验室正发挥着推动这一融合的核心角色。对于评估人工智能部署的企业——尤其是那些存在成本、延迟或数据主权限制的企业——Qwen 3.5小型系列是一个极具吸引力的新选择。以计算费用的一小部分进行前沿推理已不再是理论上的承诺。它是一个标杆性的结果。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.