如何使用 Unsloth Studio 运行模型
使用 Unsloth Studio 在本地运行 AI 模型、LLM 和 GGUF。
Unsloth Studio 让你在电脑上 100% 离线运行 AI 模型。可运行 GGUF 和 safetensors 等模型格式,来源于 Hugging Face 或本地文件。
适用于所有 MacOS、CPU、Windows、Linux、WSL 环境!无需 GPU
搜索 + 下载 + 运行 + 比较 任意模型,如 GGUF、LoRA 适配器、safetensors 等。
自动推理参数 调优(temp、top-p 等)并编辑聊天模板
上传图片、音频、PDF、代码、DOCX 及更多文件类型,与之聊天。

使用 Unsloth Studio Chat
Unsloth Studio Chat 会自动支持 多 GPU 配置 用于推理。

自动修复式工具调用
Unsloth Studio 不仅支持 工具调用,并会自动修复格式错误或损坏的工具调用,提升 50% 的修复率。
这意味着你始终会获得推理输出 而不会出现 损坏的工具调用。
例如,Qwen3.5-4B 搜索了 20+ 个网站并引用了来源,网页搜索发生在其思考轨迹中。


将 Unsloth 用作 API 端点
你现在可以通过以下工具使用本地 LLM: Claude Code 和 Codex 通过将其连接到 Unsloth 的 API 端点。这意味着你将能够直接在这些工具中运行 Qwen 和 Gemma 模型,并使用 Unsloth 的推理功能,其中包括自我修复式工具调用、网页搜索等功能。

自动推理设置
如以下推理参数: temperature, top-p, top-k, MTP 会为 Qwen3.5 等新模型自动预设,因此你无需担心设置就能获得最佳输出。你也可以手动调整参数并编辑系统提示词。
在 llama.cpp 的智能自动上下文功能下,已无需再调整上下文长度,它只会使用你需要的上下文,而不会额外加载任何内容。

连接提供方
Unsloth 可连接 到 OpenAI、Anthropic、Ollama、llama.cpp、vLLM 等。
添加 API 密钥或模型服务器 URL,然后在同一个聊天界面中使用外部模型,以及本地 + 云端模型。可使用 提示缓存、工具调用、思考,以及提供方原生功能,例如 OpenAI 的 网页搜索 和 代码执行.

搜索并运行模型
你可以通过 Hugging Face 搜索并下载任意模型,或使用本地文件。
Unsloth 支持广泛的模型类型,包括 GGUF、视觉-语言和文本转语音模型。可运行最新模型,例如 Qwen3.5 或 NVIDIA Nemotron 3.
上传图片、音频、PDF、代码、DOCX 及更多文件类型,与之聊天。

+50% 工具调用准确率
Unsloth 提供了多项独特功能,可改进工具调用,包括:
Unsloth 中所有模型的工具调用都 准确率高出 30% 到 80%.
网页搜索会检索实际网页内容,而不仅仅是摘要。
允许的最大工具调用次数为 超过 25 次。
工具调用终止得更可靠,从而减少循环和重复调用。
改进的工具调用修复和去重逻辑有助于防止 XML 泄漏到输出中。
查看以下测试结果: unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL) 启用网页搜索、代码执行和思考:
响应中出现 XML 泄漏
10/10
0/10
使用的 URL 抓取次数
0
10 次运行中有 4 次
使用正确歌曲名称的运行次数
0/10
2/10
平均工具调用次数
5.5
3.8
平均响应时间
12.3s
9.8s
模型竞技场
Unsloth Chat 让你能使用相同的提示词并排比较任意两个模型。例如,比较基础模型和 LoRA 适配器。推理会先加载一个模型,再加载第二个模型(并行推理正在开发中)。

训练后,你可以使用相同的提示词并排比较基础模型和微调后的模型,看看有哪些变化,以及结果是否有所改进。
这个工作流程能让你轻松看出微调如何改变了模型的回复,以及它是否改善了你的使用场景中的结果。

Unsloth Studio Chat 会自动运行于 多 GPU 配置 用于推理。
使用旧的 / 现有的 GGUF 模型
4 月 1 日更新: 你现在可以选择一个现有文件夹,让 Unsloth 从中检测。
3 月 27 日更新: Unsloth Studio 现在 会自动检测较旧 / 预先存在的模型 这些模型可来自 Hugging Face、LM Studio 等下载。

手动说明: Unsloth Studio 会检测下载到你的 Hugging Face Hub 缓存中的模型 (C:\Users{your_username}.cache\huggingface\hub)。如果你通过 LM Studio 下载了 GGUF 模型,请注意它们存储在 C:\Users\{your_username}.cache\lm-studio\models 或 C:\Users{your_username}\lm-studio\models 中,并且默认情况下 llama.cpp 无法看到它们——你需要将这些 .gguf 文件移动或复制到你的 Hugging Face Hub 缓存目录(或另一个 llama.cpp 可访问的路径)中,Unsloth Studio 才能加载它们。
在 Unsloth 中对模型或适配器完成微调后,你可以将其导出为 GGUF,并使用 llama.cpp 直接在 Unsloth Chat 中运行。Unsloth Studio 由 llama.cpp 和 Hugging Face 提供支持。
将文件添加为上下文
Unsloth Chat 直接在对话中支持多模态输入。你可以附加文档、图片或音频,作为提示的额外上下文。

这使得测试模型如何处理真实世界输入变得很容易,例如 PDF、截图或参考资料。文件会在本地处理,并作为上下文提供给模型。
删除模型文件
你可以通过模型搜索中的垃圾桶图标删除旧模型文件,或者从默认的 Hugging Face 缓存目录中移除相关的缓存模型文件夹。默认情况下,Hugging Face 使用 ~/.cache/huggingface/hub/ 在 macOS/Linux/WSL 上,以及 C:\Users\<username>\.cache\huggingface\hub\ 在 Windows 上。
MacOS、Linux、WSL:
~/.cache/huggingface/hub/Windows:
%USERPROFILE%\.cache\huggingface\hub\
如果 HF_HUB_CACHE 或 HF_HOME 已设置,则使用该位置。在 Linux 和 WSL 上, XDG_CACHE_HOME 也可以更改默认缓存根目录。
Unsloth 未检测到或未使用我的 GPU
如果模型在 Docker 中没有使用你的 GPU,可以尝试:
手动拉取最新镜像:
启动带有 GPU 访问权限的容器:
docker run:--gpus allDocker Compose:
capabilities: [gpu]
在 Linux 上,请确保已安装 NVIDIA Container Toolkit。
在 Windows 上:
检查
nvcc --version是否与以下位置显示的 CUDA 版本一致:nvidia-smi
最后更新于
这有帮助吗?


