For the complete documentation index, see llms.txt. This page is also available as Markdown.

📙Devstral 2 - 如何运行指南

本地运行 Mistral Devstral 2 模型的指南:123B-Instruct-2512 和 Small-2-24B-Instruct-2512。

Devstral 2 是 Mistral 面向软件工程的新代码与智能体型 LLM,提供 24B123B 两种规模。123B 模型在 SWE-bench、代码、工具调用和智能体用例上达到了 SOTA。24B 模型可放入 25GB RAM/VRAM,而 123B 可放入 128GB。

Devstral 2 支持视觉能力、256k 上下文窗口,并采用与 Ministral 3相同的架构。你现在可以本地运行并 微调 这两个模型,使用 Unsloth。

所有 Devstral 2 上传都使用我们的 Unsloth Dynamic 2.0 方法,在 Aider Polyglot 和 5-shot MMLU 基准上提供最佳性能。

Devstral-Small-2-24BDevstral-2-123B

Devstral 2 - Unsloth Dynamic GGUF:

Devstral-Small-2-24B-Instruct-2512
Devstral-2-123B-Instruct-2512

🖥️ 运行 Devstral 2

查看我们关于运行 Devstral 24B 以及大型 Devstral 123B 模型的分步指南。两个模型都支持视觉能力,但目前 不支持视觉 在 llama.cpp 中

⚙️ 使用指南

以下是推理的推荐设置:

  • 温度 ~0.15

  • Min_P 设为 0.01(可选,但 0.01 效果很好,llama.cpp 默认是 0.1)

  • 使用 --jinja 来启用系统提示词。

  • 最大上下文长度 = 262,144

  • 建议最小上下文:16,384

  • 安装最新的 llama.cpp,因为一个 2025年12月13日的拉取请求 修复了问题。

🎩Devstral-Small-2-24B

完整精度(Q8)的 Devstral-Small-2-24B GGUF 可放入 25GB RAM/VRAM。目前仅支持文本。

✨ 在 llama.cpp 中运行 Devstral-Small-2-24B-Instruct-2512

  1. 获取最新的 llama.cppGitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认开启。

  1. 如果你想使用 llama.cpp 直接加载模型,你可以执行下面的命令:(:Q4_K_XL)是量化类型。你也可以直接从 Hugging Face 拉取:

  1. 通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer 之后)。你可以选择 UD_Q4_K_XL 或其他量化版本。

  1. 在对话模式下运行模型:

👀Devstral 与视觉

  1. 为了体验 Devstral 的图像能力,我们先下载一张像这样的图片 使用 Unsloth 的 FP8 强化学习 如下:

  2. 我们通过以下方式获取图片 wget https://unsloth.ai/cgi/image/fp8grpolarge_KharloZxEEaHAY2X97CEX.png?width=3840%26quality=80%26format=auto -O unsloth_fp8.png 这会将图片保存为“unsloth_fp8.png”

  3. 然后通过以下方式加载图片 /image unsloth_fp8.png 在模型加载完成后,如下所示:

  4. 然后我们向它提问 描述这张图片 并得到如下结果:

🚚Devstral-2-123B

完整精度(Q8)的 Devstral-Small-2-123B GGUF 可放入 128GB RAM/VRAM。目前仅支持文本。

运行 Devstral-2-123B-Instruct-2512 教程

  1. 获取最新的 llama.cppGitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。

  1. 你可以直接通过 HuggingFace 拉取:

  1. 通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer 之后)。你可以选择 UD_Q4_K_XL 或其他量化版本。

  1. 在对话模式下运行模型:

🦥 使用 Unsloth 微调 Devstral 2

就像 Ministral 3一样,Unsloth 支持 Devstral 2 微调。训练速度快 2 倍,显存使用少 70%,并支持长 8 倍的上下文长度。Devstral 2 在 24GB VRAM 的 L4 GPU 上运行得很轻松。

不幸的是,Devstral 2 略微超出了 16GB VRAM 的内存限制,因此目前无法在 Google Colab 上免费微调。不过,你 可以 使用我们的 Kaggle 笔记本免费微调该模型,它支持双 GPU。只需将笔记本中的 Magistral 模型名称改为 unsloth/Devstral-Small-2-24B-Instruct-2512 模型。

  • Ministral-3B-Instruct 视觉笔记本 (视觉)(将模型名称改为 Devstral 2)

  • Ministral-3B-Instruct GRPO 笔记本 (将模型名称改为 Devstral 2)

Devstral 视觉微调笔记本

Devstral 数独 GRPO RL 笔记本

😎Llama-server 服务与部署

要将 Devstral 2 部署到生产环境,我们使用 llama-server 在一个新终端中,例如通过 tmux,按以下方式部署模型:

当你运行上面的命令时,你会得到:

然后在一个新终端中,在执行 pip install openai之后,执行:

这将直接打印 4。

🧰Devstral 2 工具调用教程

在完成 Devstral 2 之后,我们就可以加载一些工具,看看 Devstral 的实际表现!让我们创建一些工具——复制、粘贴并在 Python 中执行它们。

然后我们从一组随机可能消息中提出一个简单问题来测试模型:

然后我们使用下面的函数(复制并粘贴后执行),它们会自动解析函数调用——Devstral 2 可能会同时发起多个调用!

一分钟后,我们得到:

或者以 JSON 形式:

最后更新于

这有帮助吗?