如何将Llama factory的训练结果导入Ollama中进行部署-编程阁

🚀 LlamaFactory 模型导入 Ollama 的步骤

整个过程主要分为两大部分：转换模型格式和导入 Ollama。

第一步：将 LlamaFactory 训练结果转换为 GGUF 格式

LlamaFactory 导出的模型权重通常是Hugging Face 格式（包含safetensors或 PyTorch 的.bin文件以及配置）。您需要使用llama.cpp提供的工具将其转换为 GGUF 格式。

1. 准备llama.cpp环境

首先，您需要克隆并编译llama.cpp仓库。

gitclone https://github.com/ggerganov/llama.cppcdllama.cppmake

2. 转换模型

进入llama.cpp目录后，使用convert.py或convert_hf_to_gguf.py脚本来执行转换。
如果是全量微调（Full Fine-Tuning）或合并了 LoRA 权重后的模型：

# 假设您的模型路径是 /path/to/your/lf_modelpython3 convert.py /path/to/your/lf_model --outfile /path/to/output/model.gguf

如果是 LoRA 适配器（Adapter）：
您需要先将 LoRA 权重与基础模型合并，再进行 GGUF 转换。LlamaFactory 通常提供了一键合并的脚本或功能。如果您在 LlamaFactory 训练时选择了保存合并后的模型，请使用合并后的模型路径进行转换。

3. 进行量化（可选但推荐）

GGUF 格式支持量化，可以大幅减小模型大小和显存/内存占用。您可以使用quantize工具对生成的 GGUF 文件进行量化（例如，转换为Q4_K_M格式）。

./quantize /path/to/output/model.gguf /path/to/output/model-quantized.gguf Q4_K_M

推荐的量化方法包括：Q4_K_M,Q5_K_M,Q8_0等。

第二步：在 Ollama 中导入 GGUF 模型

一旦您获得了 GGUF 格式的模型文件（例如my-finetune-model.gguf），就可以通过创建一个Modelfile将其导入 Ollama。

1. 创建 Modelfile

在一个新的文件夹中创建一个名为Modelfile的文件（注意：没有扩展名）。这个文件告诉 Ollama 如何加载和运行您的模型。

# Modelfile 的内容示例 FROM /path/to/your/my-finetune-model.gguf # 可选：定义模型在聊天中的行为，例如系统提示（System Prompt） # system """ # 你是一个乐于助人的 AI 助手，由 LlamaFactory 微调。 # """ # 更多可选参数，如温度、上下文大小等 # PARAMETER temperature 0.8 # PARAMETER num_ctx 4096 # 可选：定义提示模板，取决于您的模型微调时使用的格式 # TEMPLATE """{{ .Prompt }}"""

提示：FROM后的路径必须是您的 GGUF 文件的完整路径或相对路径。如果您不知道如何编写提示模板，可以参考 LlamaFactory 训练时使用的原始模型模板。

2. 导入模型到 Ollama

在包含Modelfile的目录下打开终端，运行ollama create命令来创建模型。

ollama create<您想给模型起的名字，例如 my-lf-model>-f Modelfile

导入过程会比较快，因为它只是将 GGUF 文件注册到 Ollama 中。

3. 运行您的新模型

导入成功后，您就可以运行它进行测试了。

ollama run<您给模型起的名字>

💡 总结流程

步骤	动作	工具	结果
1. 转换	将 Hugging Face 格式的模型转换为 GGUF 格式。	`llama.cpp`的`convert.py`	生成`.gguf`文件
2. 量化	(可选) 对 GGUF 文件进行量化。	`llama.cpp`的`quantize`	生成更小的`.gguf`文件
3. 定义	创建一个`Modelfile`，指定 GGUF 文件路径及运行参数。	文本编辑器	`Modelfile`文件
4. 导入	使用`ollama create`命令将模型注册到 Ollama。	`ollama`CLI	成功部署的模型
5. 运行	使用`ollama run`命令运行测试。	`ollama`CLI	模型开始运行

【计算机毕业设计案例】基于springboot的影院购票管理系统的设计与实现场次管理(同步影片排期、影厅座位、放映技术)、影院选座(程序+文档+讲解+定制)

博主介绍：✌️码农一枚 ，专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者，博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围：&am…

李华

国产数据库技术学习心得：DM数据库实操进阶之路

在信创浪潮推动下，国产数据库技术已成为IT从业者的必备技能。通过《国产数据库技术》课程的系统学习，我以达梦（DM）数据库为核心，从安装配置到SQL编程完成了全流程实操，深刻体会到国产数据库的高性能与适配性…

李华

【课程设计/毕业设计】基于springboot的校园零售管理系统的设计与实现:校园超市、便利店商品【附源码、数据库、万字文档】

李华

Java计算机毕设之基于Java的高校超市管理系统设计与实现基于springboot的校园零售管理系统的设计与实现（完整前后端代码+说明文档+LW，调试定制等）

李华

kubernetes中利用LXCFS控制容器资源可见性

背景 Linux 利用 Cgroup 实现了对容器的资源限制，但在容器内部依然缺省挂载了宿主机上的 procfs 的 /proc 目录，其包含如：meminfo、cpuinfo、stat、uptime 等资源信息。一些监控工具如 free、top 或业务应用还依赖上述文件内容获取资源配置和…

李华

扩展域并查集(种类并查集)

理解思想一.团伙给定若干满足如下两条的关系，求会构成多少个团伙：、为朋友。、为敌人。普通并查集维护朋友关系依靠的是朋友关系具有传递性，即朋友的朋友还是朋友。但是，敌人的敌人是朋友并不满足上述传递性，因此需要想…

李华