智猩猩AI整理
编辑: 没方
大模型开源越来越快,普通开发者能下载到的模型也越来越强。
Qwen3.8、Kimi K3、DeepSeek-V4等新模型陆续开放以后,一个很现实的问题摆在了大家面前。
模型权重拿到了,自己的电脑却未必跑得动。就算勉强能够推理,想用私有数据再训练一遍,显存很快就会被占满。
全参数微调的成本尤其高。为了降低门槛,开发者通常会采用 LoRA,只训练一小部分新增参数。QLoRA 又把基础模型压缩到 4bit,在更少显存中完成训练。
即便如此,要上手本地模型训练,还得先啃下数据格式转换、训练脚本、超参调优、模型导出这一整套工程流程。
大模型是开源了,但"驯服"大模型的权力,依然锁在少数人手里。
开源项目 Unsloth 就是冲着这个问题来的。在特定模型和训练配置下,Unsloth 可以将模型训练速度提高到约 2 倍,同时最多减少约 70% 的显存占用,并保持训练精度不受影响。
![]()
打开 Unsloth 的仓库,凡是开源圈正在沸腾的模型,Unsloth 几乎都在发布当天完成适配。
截至今日,Unsloth 量化好的 Qwen3.8-27B GGUF 版本,已经冲到 Hugging Face 热门模型第 2 名,下载量已经达到了 701 万次(7.01M)。
![]()
甚至,Unsloth 团队还把“训练”做成了像打开App一样简单的桌面应用,把本地运行、数据制作、模型微调、强化学习、量化导出与Agent接入,全部放进了同一套工具里。极大地消解了技术门槛,让每个人都能轻松驾驭大模型的定制。
01
使用教程:
本地运行Qwen3.8
(1)安装
官网下载 Unsloth Desktop 应用并安装, macOS、Windows、Linux版本都有。安装完,界面如下:
![]()
如果你更喜欢手动安装,命令如下:
irm https://unsloth.ai/install.ps1 | iex从设置页面可以看到,Unsloth Desktop把模型中心、训练、图像、视频、音频、模型导出和 API 等能力都做成了独立模块,用户还可以自由调整侧边栏入口和顺序,更像一个围绕本地 AI 模型搭建的统一工作台。
![]()
(2)搜索并下载 Qwen3.8
在聊天界面上有个Select model,可以搜索你想要下载的模型。
Unsloth 会根据你电脑当前的显存/内存情况,自动判断某个量化版本能不能跑起来。
标了红色 OOM 的版本,表示以你现在的硬件配置,加载这个量化模型很可能会爆显存,跑不起来。
没标 OOM、并且标了绿色 recommended 的(比如 UD-IQ2_XXS 7.5GB),是当前推荐能跑的版本。
![]()
也可以在模型中心,选择想要下载的模型:
![]()
(3)运行 Qwen3.8
模型下载完成后,直接进入聊天窗口即可运行。Unsloth 会自动配置推理参数、聊天模板、上下文长度等,用户也可以根据需求手动调整。
![]()
(4)使用 Unsloth API 部署 Qwen3.8
Unsloth 还把本地模型变成了一个“私人 API 服务”。模型加载后,Unsloth 会通过 llama-server 形式将其暴露出来,并自动生成 API Key。开发者可以像调用 OpenAI 一样,在自己的 Agent、SDK 或聊天客户端中调用本地模型。
--chat-template-kwargs '{"reasoning_effort":"medium"}'02
Unsloth:让大模型训练
不再慢吞吞
Unsloth 的故事要从一个反着来的优化思路说起。
创始人 Daniel Han 曾在 NVIDIA 从事算法优化相关工作。在创办 Unsloth 前,他开发了机器学习优化库 Hyperlearn,通过重新设计和优化 Scikit-learn 生态中的常用算法,在多个机器学习任务中实现显著的速度提升,并降低了内存占用。
![]()
这段经历让他形成了一个判断:AI 性能提升并不一定只能依赖更强硬件,软件栈优化同样存在巨大空间。
2023 年,他和弟弟 Michael Han在一次机器学习竞赛中验证了这一想法。通过重新设计训练流程,可以在消费级 GPU 上实现约 2 倍训练速度提升,同时降低显存占用。同年底,Unsloth 正式开源,名字是 "unslothing" 的双关,意思是让大模型训练不再"慢吞吞"。
Unsloth 的核心加速秘密,是放弃了通用框架的"自动"路径。
主流框架用 PyTorch 的自动微分引擎自动计算梯度,Unsloth 则对性能关键算子手工推导反向传播公式,再用 OpenAI 的 Triton 语言编写专属内核。
这三年,Unsloth 已经从单一加速库长成了一个三层产品体系。最底层是核心 Python 库,提供 FastLanguageModel 接口,支持 LoRA、QLoRA、全参微调、DPO、GRPO 强化学习、FP8 训练等全部主流训练范式,兼容 Hugging Face Transformers 和 TRL 生态,训练完可一键导出 GGUF(Ollama、llama.cpp 直接加载)或 safetensors。
中间层是 Unsloth Studio,一个完全本地运行的无代码 Web 界面,把数据制备、模型推理、训练监控、模型对比和导出整合进一个浏览器页面,还内置了基于 NVIDIA NeMo DataDesigner 的 Data Recipes 可视化数据流水线,让没有工程背景的人也能把 PDF、CSV 加工成微调数据集。
![]()
最上层则是Unsloth Desktop,是能运行和训练模型的桌面 App,支持 Windows、macOS、Linux,把 FLUX、MiniMax-H3 这类图像视频生成模型也纳入其中,还自带代码沙盒、自修复工具调用和免费私有的网页搜索。
还有一件事让 Unsloth 在社区里赢得传奇口碑:对底层 bug 的敏锐嗅觉。
2024 年 3 月,Gemma 发布后训练不稳定,Daniel 一口气定位出 8 个 bug:tokenizer 缺陷、位置编码错误、数值精度问题,他把数学推导和修复方案全部公开。这波操作直接让Andrej Karpathy亲自下场转发,谷歌官方也迅速响应,将修复补丁合并进主干代码。
![]()
此外,Unsloth一般会在新模型发布后快速适配,因此它成为很多开源模型的重要训练工具。
03
总结
模型越开源越多,可真正跑得起、训得起的人却不多。74.6k stars的开源项目 Unsloth正在打破这道门槛,它能让模型训练快 2 倍、显存省 70%,让大家在新模型发布当天就能跑,还能像打开 App 一样完成微调。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.