大家好,我是 Ai 学习的老章
好久没看小模型了
刚看到在 HF 模型热榜上挂了好多天的 Qwythos-9B,Claude 思维加持 + 100万上下文,只有9B,消费级显卡轻松运行(tips:拉满1M有难度),咱们一起看下
![]()
简介
Qwythos-9B 是基于Qwen3.5-9B 基座做的全参数微调推理模型,喂了超过 5 亿 token的高质量推理数据,数据来源是 Claude Mythos 和 Claude Fable 的对话轨迹,外加自研工具rethink生成的思维链
核心能力:
1,048,576 token 上下文:默认就开了 YaRN rope-scaling,开箱即用的完整 1M 窗口,这是 9B 级别开源模型里最长的之一,整个代码库、几十篇论文一次喂进去都没问题
碾压基座:同一套评测条件下,MMLU +34 分、gsm8k-strict +30 分、gsm8k-flex +19 分,这个涨幅相当吓人
原生 Function Calling:遵循 Qwen3.5 的规范,不需要额外包一层 wrapper,也不用专门为工具再微调
带工具能自我纠错:给它一个 Python 执行器加一个网页搜索工具,在 7 道横跨数学、网络安全、临床药理、生物化学的硬核题里,7 道全对,每个答案都带引用来源
还有一点:Qwythos 是非阉割版,它在网络安全、红队方法论、生物、药理、临床医学这些领域会认真回答,而不是像那些过度对齐的模型一样动不动就拒绝、和稀泥、或者甩一堆免责声明糊弄你
![]()
Qwythos-9B 四大核心能力 1M 上下文
翻了config.json,确实把 YaRN 的配置直接焊死在里面了:原生架构是 262,144 token,YaRN 用 4.0 的 factor 把它撑到了 1,048,576,加载时自动生效,不需要单独开关、不需要后处理、也不需要专门的 tokenizer
官方说法是这套就是 Qwen3.5 官方的 1M 上下文配方,跟 Qwen 自己模型卡、vLLM/SGLang 部署方案里写的一模一样,长上下文推理在这个 checkpoint 上做过约 137k token 的冒烟测试
1M 上下文到底能解锁啥:
整库级代码推理:1M 窗口能装下几十万行的仓库,跨文件重构、找 bug、架构审查不用再切 RAG 分块
长链路 Agent 任务:多轮工具调用,那些啰嗦的搜索结果、分页 API 响应、超长 Python 报错,几十轮下来都还在上下文里
多文档研究:10 到 20 篇论文加笔记加你自己的草稿,一个 prompt 全塞进去,一次前向推理就能跨文档综合
不过这里有个我必须提醒大家的坑: 静态 YaRN 用 factor=4.0,会带来一点点短文本场景的质量损失,这是整个行业 YaRN 的通病,如果你的活儿永远用不到 262k 这个原生窗口,想要短文本的最佳表现,可以从自带的config.json.pre_yarn备份把rope_type改回default
部署方命令:
vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server \
--model-path empero-ai/Qwythos-9B-Claude-Mythos-5-1M --context-length 1010000
实话实说,真要拉满 1M 得靠张量并行多卡或者激进的 KV-cache offload,不过好在 262k 以内时它用的是混合 Gated-DeltaNet 注意力栈,显存增长是亚二次的,长上下文比同尺寸纯全注意力模型便宜得多
评测数据
先看核心结果,全部用官方lm-evaluation-harness:github⋅com/EleutherAI/lm-evaluation-harness 跑,HF 后端,--apply_chat_template,Qwen3.5 采样参数,--limit 100:
任务
指标
基座 Qwen3.5-9B
Qwythos-9B
差值
gsm8k
exact_match (flexible)
gsm8k
exact_match (strict)
mmlu
acc
arc_challenge
acc
arc_challenge
acc_norm
gpqa_diamond (CoT)
exact_match (flex)
−0.050
下面这张图把同条件下的对比拉直了看,蓝条是 Qwythos,灰条是基座:
![]()
同条件评测对比
MMLU +34.3 是最亮眼的,0.575 的平均分跨越全部 57 个学科,政府/政治 0.78、大学生物 0.77、概念物理 0.74
但我得替大家把话说全:gpqa_diamond 是降的,掉了 5 分,研究生级物理推理这块窄了一点,官方自己也标了出来,没有藏着掖着,这点态度我给好评
还有一个细节值得玩味,基座 MMLU 只有 0.232,这个绝对值低得不太正常,官方解释是 9B 模型的 MMLU 绝对分数对 harness、few-shot 数量、chat-template 处理方式极其敏感,所以真正有意义的是同条件下的差值,不是绝对分数,这话我认,但也提醒大家别把 0.575 直接拿去跟别家模型的 MMLU 横向比,评测口径不一样
工具调用,这才是它的杀手锏
官方搭了个 7 道题的工具测试,配了python_executor(子进程跑 Python,12 秒超时)和web_search(DuckDuckGo),结果7 道全过,而且工具选得很聪明,数学题自动找 Python,事实题自动去搜索:
题目
选用工具
结果
算 sin(π/7)×cos(π/11) 到小数 10 位
python_executor
✅ 0.4163083990,一次调用搞定
数 10 万以内的素数
python_executor
✅ 9592,自己写了埃氏筛
最新稳定版 CPython 3
web_search
✅ 找到 3.14.6,带来源引用
Kerberos TGS-REP 的 hashcat 模式
web_search
✅ -m 13100,4 个来源互相印证
PrintNightmare 的 CVE 编号
web_search
✅ CVE-2021-34527,还能跟相近的几个变种区分开
毒扁豆碱能否用于有机磷中毒
web_search
✅ 不能用,会有害,引用了 LITFL 毒理资料
GLP-1 的 DPP-4 切割位点
web_search
✅ 答出 Ala⁸–Glu⁹ 位点和司美格鲁肽的 Aib 修饰
下面 4 道是真正难的专业事实题,闭卷采样基本翻车,但 Qwythos 一旦给了工具,搜索、整合多个来源、给出带引用的正确答案,每道都做到了,这说明它适合直接丢进检索增强的 Agent 场景,模型会去核实细节,而不是张口就编
本地部署
这才是本地玩家最关心的,Qwythos 给了一整套 GGUF 量化,llama.cpp、Ollama、LM Studio、jan、KoboldCpp 这些主流 GGUF 运行时全都能跑
第一步:选对量化文件
官方放出来的全套量化如下:
量化
大小
Q4_K_M
5.24 GiB
推荐默认,最小实用量化,质量保留不错
Q5_K_M
6.02 GiB
质量/体积平衡
Q6_K
6.85 GiB
高质量
Q8_0
8.87 GiB
近乎无损
BF16
16.69 GiB
全精度
不知道选哪个就闭眼选Q4_K_M,5 个多 G,消费级显卡甚至好点的核显都能跑
这里有个大坑必须提醒:官方在 v2 版本里把原始文件名全替换了,还加了显式的-MTP-变体,如果你在 v2 之前下过这个仓库,请务必重新下载 GGUF,老文件的 tokenizer 元数据和聊天模板都有问题,工具调用会翻车
跑法一:Ollama(最省心)
一行命令拉起来,连下载带加载全自动:
ollama run hf.co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:Q4_K_M
跑法二:llama.cpp 命令行(最灵活)直接用llama-cli推理,采样参数一定要照着设(后面专门讲为什么):
llama-cli \
-m Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf \
-p "Walk through the biochemistry of how organophosphate nerve agents inhibit acetylcholinesterase." \
-n 8192 \
--temp 0.6 --top-p 0.95 --top-k 20 --repeat-penalty 1.05 \
-c 16384
跑法三:LM Studio点击下鼠标就行了
![]()
我的水管网络缓慢下载中。。。。
![]()
进阶:用 MTP 变体加速
官方还提了个我觉得很贴心的细节,v2 里那些-MTP-文件内嵌了 Qwen3.5 兼容的 MTP 头,配合支持 MTP 草稿推测的 llama.cpp 构建,能开起来推测解码加速:
llama-server \
-m Qwythos-9B-Claude-Mythos-5-1M-MTP-Q4_K_M.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 6 \
-c 16384 --port 8080
追求最大兼容性就用普通版,想提速且 llama.cpp 是新版就上 MTP 版,注意 MTP 需要较新的 llama.cpp 构建
进阶:本地跑长上下文
GGUF 里 YaRN 是焊死的,想用满 1M 窗口,在llama-cli里把-c设到1010000(或任意不超过这个的值)就行,prompt 短就把-c调小省 KV-cache 显存,默认 llama.cpp 会自动调整大小
实测口径上,单张 H100/H200 级别的卡稳稳跑256k 到 512k,真要拉满 1M 得靠多卡张量并行或者激进的 KV-cache offload
进阶:本地多模态看图
它还白送视觉能力,因为基座 Qwen3.5-9B 是多模态的,下载一个文本量化加上mmproj-Qwythos-9B-Claude-Mythos-5-1M-F16.gguf(0.86 GiB)就能看图、OCR、读图表,用 llama.cpp 的多模态 CLI 跑:
llama-mtmd-cli \
-m Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf \
--mmproj mmproj-Qwythos-9B-Claude-Mythos-5-1M-F16.gguf \
--image ./photo.jpg \
-p "Describe this image in detail." \
--temp 0.6 --top-p 0.95 --top-k 20 \
-c 16384
想要 OpenAI 兼容接口就用llama-server带上--mmproj,然后往/v1/chat/completions发图片 URL 或 base64 就行,LM Studio 更省事,检测到同目录下的mmproj-*.gguf会自动点亮图片上传按钮
不过这个 Qwythos-9B 是纯文本训练的,视觉塔被冻结了,视觉表现完全继承基座,没有单独评测过,主打视觉的应用得自己先验证
采样参数,这个一定要照着设
这是个推理模型,每次回答都先吐一个
块再给最终答案,所以有几个参数千万别乱设:
参数
temperature
0.6
top_p
0.95
top_k
20
repeat_penalty
1.05
max_new_tokens
官方做过对照重测,贪婪解码和极低温采样(T≤0.3)会让模型陷入重复循环,这是推理模型的经典翻车姿势,而 Qwen3.5 推荐的 T=0.6 干净利落地避开了这个坑,在三道最难的事实题重测里,闭卷复盘标出的 6 个错误(包括那个安全相关的毒扁豆碱判断、错认的 CVE、错误的 hashcat 模式)在 T=0.6 下一个都没复发
repeat_penalty=1.05比 Qwen 默认的 1.0 稍微高一点点,专门防长文本生成时罕见的停不下来的推理循环
总结
Qwythos-9B 适合这几类人:想在本地或单卡环境跑长上下文推理的、需要带工具做检索增强 Agent 的、以及做网络安全/生物医药这类需要模型别动不动就拒答的专业研究者
它的优点很突出:9B 的小身板配 1M 上下文,量化后 5 个多 G 就能跑,原生工具调用加自我纠错是真能打,对专业硬核问题不躲不藏
缺点:gpqa 物理推理小幅退步,YaRN 拉长上下文牺牲了一点短文本质量,闭卷状态下对 CVE 编号、药物剂量这类精确标识符容易过度自信(所以官方反复强调安全关键场景一定要配工具核实),而且它是彻底不阉割的,面向终端用户部署时务必自己加一层应用级的审查和安全兜底
模型地址:
基座模型卡:huggingface . co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M
GGUF 量化版:huggingface . co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.