我就不介绍全世界对 Qwen3.8-27B 的热爱有多么热烈
看看我收藏的这张图——肉麻的老外
![]()
我本人也是 Qwen 27B 狂热粉丝
![]()
Qwen3.6-27B 系列是我最受欢迎的文章
![]()
现在 Qwen3.8-27B 终于来了
本文先来一起简单看看它的实力以及部署去准备工作
我的 vLLM 正在升级,权重文件也正在龟速下载
![]()
模型简介
一句话总结:Qwen3.8-27B 是一款原生的视觉 - 语言稠密大模型,能够理解图像和视频,并具备灵活的思维控制能力,旨在更可靠地完成复杂的多步骤任务
![]()
Qwen3.8-27B混合注意力与原生多模态架构
具体而言,五项能力都有强化:
能力
核心能力
编码、专业工作、研究、长周期 agentic 任务全面提升
Agent 执行
自主规划更强,环境反馈处理更好,端到端完成率更高
下游兼容
支持更多主流 harness 与开发工具
思考控制
思考模式默认开启,可按请求关闭;reasoning_effort调深度,根据任务难度控制思考深度,本地部署更省资源;preserve_thinking保留历史推理
视觉理解
原生支持图像与视频,覆盖 STEM 图表、文档到小时级长视频
还有,Qwen3.8-27B 原生支持最多 256K token 的上下文长度,超过此限制的长程任务,可以使用 YaRN 来外推到 1M Tokens 上下文
最良心的还是开源:所有人都可免费下载部署及商用!
模型能力
这些分数来自 Qwen 官方模型卡,部分项目使用 Qwen 自建 Benchmark,部分公开 Benchmark 也采用了指定 Harness、修订题目或特定上下文配置,目前缺少第三方同条件验证,后面我要实测看看到底是不是这么神!
我挑了几项更接近真实工作的官方分数
Benchmark
Qwen3.8-27B
Qwen3.6-27B
Qwen3.7-Plus
提升信号
Terminal Bench 2.1
73.0
63.4
64.0
终端 Agent 更稳
SWE-bench Pro
61.7
53.5
57.6
真实软件工程能力上了一个台阶
CoWorkBench
70.7
61.0
65.1
长流程办公任务进步明显
OSWorld-Verified
84.3
63.9
73.3
电脑操作能力涨幅很大
WebArena-Verified
64.8
48.8
55.3
浏览器任务更值得期待
Vision2Web
62.9
45.0
42.1
看图复刻网页的能力提升明显
某些 Coding 场景可以硬碰 Opus4.6 Max,长周期办公任务 CoWorkBench 也超过 Opus4.6 Max
![]()
最让人吃惊的是视觉能力,GUI/Computer-use 断层领先
一个 27B 模型在电脑操作、手机操作上压过闭源旗舰,我有点不敢相信
![]()
不过,纯知识与硬推理仍有明显天花板,很多方面甚至不如 Qwen3.7-Plus
模型大小
原版 BF16,权重文件 56GB
![]()
同步放出 FP8,直接砍掉将近一半,权重文件 31GB
![]()
vLLM 放出的 Recipe,FP8 至少需要 38GB 现存,双 4090 才能跑了
![]()
资源不足的同学别伤心,你可以永远相信大模型量化翘楚 Unsloth
Unsloth 早已放话:要把 Qwen3.8-27 把压倒 17GB
![]()
结果,Qwen刚刚发布几乎同时, Unsloth 就拿出了全套量化版本!!!!!!
Unsloth 团队,你们TM才是肝神
果然4-bit只有17GB,上下文拉低 单卡4090真可以
![]()
本地部署:推理引擎升级
vLLM 最低版本需要 0.27.2,目前稳定版本才 0.27.1,只能选择 Nightly
![]()
升级时仅需注意 CUDA 版本
uv venv
source .venv/bin/activate
uv pip install -U vllm --pre \
--extra-index-url https://wheels.vllm.ai/nightly/cu130 \
--extra-index-url https://download.pytorch.org/whl/cu130 \
--index-strategy unsafe-best-match
# transformers 也要升级
uv pip install -U "transformers>=5.8.0"
我倾向于用 Docker 部署,因为我的机器装 transformers 总失败
另一个原因是我要移植到生产环境,Docker 更方便
![]()
根据自己显卡驱动选择匹配的 cuda 版本
![]()
先拉取镜像
docker pull vllm/vllm-openai:cu129-nightly
本地部署:模型下载这个简单,一行命令:modelscope download --model Qwen/Qwen3.8-27B-FP8
本地部署:vLLM 启动!
vllm serve Qwen/Qwen3.8-27B \
--tensor-parallel-size 1 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-encoder-tp-mode data
要开 MTP,再增加这一项
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
关闭思考
Qwen3.8-27B 默认会在响应前进行思考
调用时通过配置 API 参数,让模型直接返回响应而不进行思考
chat_response = client.chat.completions.create(
model="Qwen/Qwen3.8-27B-FP8",
messages=messages,
temperature=0.7,
top_p=0.8,
presence_penalty=1.5,
extra_body={
"top_k": 20,
"chat_template_kwargs": {"enable_thinking": False},
},
)
print("Chat response:", chat_response)
量化版本一键启动卧槽,lmstudio 动作也很快啊
这是最省事儿,功能做强大的大模型本地部署工具了,我感觉它比好用多了
![]()
这是世界上唯一值得本地玩的大模型了
大家使劲折腾吧,五花八门的版本后面肯定还会有,我后面再慢慢测
最后感叹一句,3.5 以前 Qwen 各种尺寸层出不穷的美丽时光,可能再也不会有了,珍惜吧
老章也很肝,求个三连,笔芯
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.