网易首页 > 网易号 > 正文 申请入驻

大模型量化翘楚,Unsloth 出桌面客户端了,这次没忘 Windows 用户

0
分享至

大模型量化翘楚 Unsloth 出原生桌面客户端了,macOS、Linux、Windows 三端齐发


Unsloth 是本号常客,几乎每个开源模型发布之后都有它的身影,T+1 就能拿出不同精度的量化版本。今晚,大家可以猜猜多久可以看到 Unsloth 放出的 GGUF

今年 3 月我写过它的 Studio,5 月写过它的 API:

那时候它的形态是浏览器里的 web UI,命令行敲一条装完,开 127.0.0.1:8888 用

Desktop 是把 Studio 包成了原生窗口,功能上更加完善、强大


我感觉,这次真正值得关注的地方,在于它把「本地模型」和「Agent 工具链」这两件事缝到了一起,加配本地部署的 Qwen3.8-27B,就能得到一个完全免费,离线运行、 安全可控的 Harness

Unsloth Desktop 是什么

一句话:免费、开源的本地模型客户端,跑模型和训练模型都在里面

  • 三平台全给 :Windows .exe 、macOS .dmg 、Linux 有 deb / AppImage / ARM64

  • 模型类型 :LLM、扩散图像/视频、MLX、GGUF、音频模型都能跑,也都能训

  • 硬件 :NVIDIA、AMD、Intel、Mac 的 GPU 和 CPU 都支持,多卡自动识别,纯 CPU 也能聊天

  • 许可 :双许可结构,核心包 Apache 2.0,Studio UI 部分是 AGPL-3.0

  • 隐私 :官方明确说无遥测,只采集 GPU 型号和设备类型用于兼容性判断,可以完全离线运行

Unsloth 现在实际是三个东西,我列个表:

形态

是什么

适合谁

Unsloth Desktop

原生桌面 App,双击安装

不想碰命令行的人,官方推荐从这里开始

Unsloth Studio

浏览器里的 web UI,命令行装

服务器、Colab、远程机器

Unsloth Core

pip 装的 Python 包

写代码微调的人


unsetunset安装unsetunset

Desktop 从官网或 GitHub Releases 下对应平台的包,安装就是双击的事儿


不过它要后台安装整套的 Unsloth Studio 这一步有点慢


unsetunset使用unsetunset 选模型:Model hub

模型中心有很多本地部署可用的模型,这块是 Unsloth 最有优势的地方,Dynamic GGUF 本来就是它家的东西,别人的客户端是去 HF 拉别人的量化版,它自己就是量化版的生产方

搜索、下载、切换都在一个界面里,还能自动检测你的电脑是否满足部署条件


也可以接入第三方模型,比如我配上了 DeepSeek


再回到主界面就可以直接调用了,本地和云端模型共用同一个聊天界面,云端这边还带 prompt caching,多轮下来省不少 token


功能设计上,感觉比之前 Studio 细节多了很多


图像、视频、音频的生成和训练都考虑到了


训练也都是 0 代码


再介绍几个我觉得比较亮眼的设计吧,很多其实都是底层实现,前端感受不到

一、自愈式工具调用,让本地小模型能干活

官方给的数字:工具调用准确率提升 50%,各模型区间是 30% 到 80% 更准,格式坏掉的 tool call 会被自动修复重试,单轮允许的工具调用次数放到 25 次以上,调用终止也更可靠,减少死循环

它放了一组 unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL) 开启搜索、代码执行和思考的对比,最直观的一项是 XML 泄漏从 10/10 降到 0/10

本地跑 4B、9B 这个量级的模型,模型聪不聪明其实排在后面,真正卡住人的是它 tool call 格式吐错,整条链当场断掉,前面思考得再好也白搭。这个能力补上,本地小模型才从「能聊天」跨到「能干活」

代码执行也是真沙箱,Bash 和 Python 都能跑,模型可以自己写脚本、跑出结果、验证答案,Claude Artifacts 那类程序也在沙箱里。MCP 也能接,本地模型可以调你自己那套工具

二、Deep Research:本地模型也有了带引用的研究模式

普通搜索是模型思考过程中顺手查,Deep Research 是完整流程:先出计划(你可以先审再改),再去搜、读、整理,最后产出带完整引用的报告

有两个设计蛮不错:

  • 写报告之前它会自查一遍 没有依据的断言、前后矛盾、还没填上的空白 ,没有直接证据支撑的建议会被标成「可验证推断」,跟事实分开摆

  • 搜索走 DuckDuckGo 的私有 API, 真的进页面抓正文 ,不只读搜索结果摘要

想更狠一点,可以设 UNSLOTH_RESEARCH_AUTO_SCRAPE=1 打开全页 grounding,把 top 结果整页读进临时 RAG 再合成,默认关着,因为费时间也吃上下文

多个对话现在可以同时生成,一边等报告一边聊别的,互不挡着

三、unsloth start:一行命令把本地模型接进 Claude Code

这个是较早之前就有的功能了,安装客户端的时候,自动就把 unsloth 命令行工具装好了


Claude Code 里跑的是 unsloth/Qwen3.5-9B-GGUF,正常读文件、跑命令、写文档

启动 Unsloth、加载模型、进项目目录,然后:

unsloth start claude

claude 换成别的就是别的 Agent:

Agent

命令

Claude Code

unsloth start claude

OpenAI Codex

unsloth start codex

Hermes Agent

unsloth start hermes

OpenClaw

unsloth start openclaw

OpenCode

unsloth start opencode

Pi Coding Agent

unsloth start pi

端点、API key、provider、模型、上下文长度这五样它自动配好,而且用的是临时或会话级注入,不会往你 Agent 的正式配置文件里塞东西,这个设计很克制,谁都不想为了试一下本地模型就让工具的全局配置被改乱

还能指定模型和量化版本,:UD-Q4_K_XL 这个后缀就是选 GGUF 量化档,本机没启 Unsloth 时它会拉一个临时 server,Agent 退出就自动关掉

我个人最喜欢的是 --as-subagent:

unsloth start claude --as-subagent --model unsloth/model-GGUF:quant

Claude Code、Codex、Pi 保持自己的主力云端模型不变,只把本地模型挂成 subagent 去干脏活累活。批量读文件、跑格式化、整理日志这类不需要智商但很烧 token 的任务交给本地模型,主力模型的额度留给真正需要脑子的地方,这个组合拳比「全用本地模型」现实得多

配套的 API 面板长这样,设置里建 token,OpenAI 兼容和 Anthropic 兼容两套格式都支持:


这条路上有几个坑,官方文档里写了,我给挑出来:

  • Claude Code 自带一条减速带 :它往系统提示最前面插一行每次都变的 attribution header,KV cache 每轮全部失效,本地模型直接慢 90%。启动时加 --settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0"}}' ,或者写进 ~/.claude/settings.json

  • Codex 目前必须用 GGUF 走 llama-server 后端 ,transformers 后端它不认

  • Codex、OpenClaw、Hermes、Pi 这四个的托管目录默认是临时的,想续会话,**第一次启动就得加 --persist **,后面每次也要加,再配 Agent 自己的 resume 参数

  • --yolo 映射到各 Agent 的免确认模式,Agent 可以不问就执行命令,只在你能接受这个后果的环境用

四、远程访问:--secure

unsloth studio --secure

这算是一个骚操作

一条命令开一个免费 Cloudflare 隧道,拿到一个公网 https://*.trycloudflare*com 地址,手机上就能看模型、看训练进度

关键在于它的默认姿态:进程仍然只绑 127.0.0.1,只通过隧道对外,隧道起不来就直接不启动(官方叫 fail closed),裸端口一次都不会露出去。对比之前那种 -H 0.0.0.0 直接把裸端口开在所有网卡上,安全性完全是两回事

这里必须把风险讲清楚,官方文档自己也写了:服务端工具(联网搜索、Python、终端代码执行)默认是开着的,而且以你的用户身份运行。谁拿到链接和 API key,谁就能在你这台机器上执行代码。对外暴露的时候,请加 --disable-tools,API key 千万别贴到截图和日志里

还有个实用细节:Cloudflare 快速隧道不支持 SSE,走隧道调 API 得把 stream 设成 false

五、训练:完全零代码

这算是 Unsloth 的老本行:500+ 模型,2 倍速度,省 70% 显存,无精度损失,LoRA、QLoRA、全参微调、预训练、RL、GRPO、DPO、FP8、DoRA 全套都在,多 GPU 自动生效。文本、视觉、TTS 音频、embedding 模型都能训

Unsloth 把整套能力放到了客户端上

数据集不用自己攒,扔 PDF、CSV、JSON、DOCX、TXT 进去就行:


Data Recipes 的官方配方:从答案反推指令、PDF 文档问答、OCR 抽取、文本转 Python,标了难度等级

Data Recipes 是图节点式的工作流,底层用的是 NVIDIA NeMo 的 Data Designer。「PDF Document QA」这个配方对企业场景挺实用,一堆非结构化 PDF 直接转成有出处的问答训练对

训起来之后有完整的监控面板:


训练监控:step 27/30、loss 1.1352、grad norm 0.041,右侧 GPU 利用率和显存占用实时刷,下面是 loss 和梯度范数曲线

loss、梯度范数、GPU 利用率、显存实时曲线,还能在手机上看进度,配合上面的 --secure,出门在外也能盯着自己那台机器在跑什么

训完导出给 safetensors、GGUF、NVFP4、FP8,直接进 llama.cpp、vLLM、Ollama、LM Studio。训练历史会存着,随时回去重导

Mac 用户也不用担心:训练、MLX 推理、GGUF 推理在 macOS 上全都支持,这在同类工具里不多见

几个已知局限

  1. 还是 Beta ,v0.1.70-beta,图省事可以,别往生产环境放

  2. 推理有时候会更慢 ,官方在 FAQ 里直接承认:联网搜索、代码执行、tool call 自愈这三样都吃时间,全关掉之后速度才等于普通 llama.cpp 应用。如果你只要纯推理速度,这些功能记得关

  3. 纯 CPU 目前只支持聊天和 Data Recipes ,训练还是得 NVIDIA、AMD 或者 Mac

  4. Vulkan 只加速 GGUF 推理 ,训练仍然需要 PyTorch 或 MLX 后端,别指望 Intel 核显能训模型

  5. 老硬件官方明说可能支持不好 ,太旧的卡先别抱期望

  6. Deep Research 目前 只支持本地模型 ,每个对话同时只能跑一个

总结

Unsloth 从一个加速微调的 Python 库,到浏览器里的 web UI,再到今天的原生桌面客户端。它一直在做的一件事,是把「本地跑大模型」从工程师的手艺变成普通人的按钮

具体到该不该装,我的建议:

  • Windows 用户,想在本地跑模型,又不想碰命令行 :直接下 exe,这是目前门槛最低的一条路,没有理由再等

  • 已经在用 LM Studio 或 Ollama 的 :值得迁过来的理由在 tool call 自愈、能直接训练、Data Recipes 这三样,纯推理速度它没有优势,官方自己都承认开了功能会变慢。迁移成本也低,你在 HF 缓存和 LM Studio 里下过的 GGUF 它自己就认出来了,不用重下

  • 想在 Claude Code、Codex 里省 token 的 :直接从 unsloth start claude --as-subagent 开始,本地模型当 subagent 干脏活,这是我看到的收益最实在的用法

  • 要微调但不想写代码的 :五步向导 + Data Recipes + 导出 GGUF 这条链是闭环的,目前本地方案里完整度最高

从哪一步开始?装完先只干一件事:下一个 20GB 以内的模型,把 unsloth start 接到你平时用的那个 Agent 上,跑一个真实的小任务,面对这类客户端,别看它宣传了几十个功能,就看一件事:它能不能接住你手上那个真实任务

目前我内网跑的还是 OpenWebUI,也在想要不要上个 Unsloth DeskTop 呢?


既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

小鋭有话说
2026-10-10 11:25:02
那天下跪的乘务员,是我

那天下跪的乘务员,是我

普陀动物世界
2026-10-11 00:10:00
美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

极目新闻
2026-10-10 14:46:03
买用户可以自由批评的车

买用户可以自由批评的车

吐槽青年
2026-10-09 21:54:10
赵福刚被美国禁止入境,后续来了

赵福刚被美国禁止入境,后续来了

环球时报国际
2026-10-10 08:02:20
开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

职场资深秘书
2026-10-09 15:14:01
中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

奥拜尔
2026-10-10 20:16:31
目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

股经纵横谈
2026-10-10 22:27:01
新疆发布评尊界刹车断裂风波

新疆发布评尊界刹车断裂风波

小南看车
2026-10-10 22:27:28
超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

小强热线
2026-10-09 21:27:18
大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

华庭讲美食
2026-10-11 01:54:37
程福波到中国移动调研

程福波到中国移动调研

政知新媒体
2026-10-10 12:38:01
加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

政知新媒体
2026-10-10 07:51:17
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

格斗社
2026-10-10 22:07:58
呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

百科密码
2026-10-10 16:47:24
果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

麓谷隐士
2026-10-10 00:10:04
女商务局长与前夫及九个情人的狗血剧情,够无耻

女商务局长与前夫及九个情人的狗血剧情,够无耻

雨秋闲话
2026-10-10 14:14:53
皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

懂球帝
2026-10-11 05:47:11
高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

人生录
2026-10-09 16:01:05
2026-10-11 07:12:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11198关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

健康
艺术
教育
本地
公开课

痘坑留下后,还能填平吗?

艺术要闻

黄沙万里不见泪|仇英《明妃出塞图》:昭君从来不是悲情美人

教育要闻

六年级思维训练,答对的学生寥寥无几

本地新闻

踏访沙县第一村,寻国民小吃本源

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版