将 llama.cpp 连接到 Unsloth:使用 llama-server 运行 GGUF
最后更新于
这有帮助吗?
这有帮助吗?
llama-server \
--model /path/to/model.gguf \
--host 0.0.0.0 \
--port 8080--api-key 1234-myapi-key--no-cache-prompt --ctx-size 8192 \ # 设置上下文长度
--parallel 2 \ # 设置并行槽位数量
--flash-attn on \ # 在支持时启用 Flash Attention
--jinja \ # 使用模型聊天模板
--api-key 1234-key \ # 需要 API 密钥
--no-cache-prompt # 禁用提示缓存