模型合并,转换,量化压缩,部署

训练好的LoRA适配器模型合并转换为GGUF量化压缩部署

复制代码
model_name_or_path: /home/aistudio/text_lora/models/Qwen/Qwen3-4B-Instruct-2507  # 你的基础模型路径
adapter_name_or_path: output/qwen3-4b-sft-v9                                   # 你的LoRA适配器输出路径
template: qwen                                                                 # 使用你模型对应的template,如qwen
finetuning_type: lora                                                          # 微调方式,与你训练时一致
export_dir: models/qwen3-4b-merged                                             # 合并后模型的保存路径
export_size: 4                                                                 # 单文件大小上限,单位为GB (可选)
export_device: cpu                                                             # 导出计算设备,推荐cpu (可选)
export_legacy_format: false                                                    # 是否使用旧格式 (可选)

conda activate /home/aistudio/work/my_conda_envs/llamafactory

执行命令:

复制代码
llamafactory-cli export merge_config.yaml

合并后的目录如下:

复制代码
git clone https://git.ustc.edu.cn/USTC-OS-Lab/llama.cpp

cd llama.cpp

cmake -B build

cmake --build build --config Release -j --target llama-quantize

开始转换

进入 llama.cpp 目录,执行转换命令。

  1. 基础转换 (FP16):首先将合并后的模型转换为 FP16 精度的 GGUF 文件。

    复制代码
    python convert_hf_to_gguf.py /home/aistudio/text_lora/LLaMA-Factory/models/qwen3-4b-merged/ --outfile /home/aistudio/llama.cpp/qwen3-4b-f16.gguf --outtype f16

量化压缩 (Q4_K_M) :使用 llama-quantize 工具对上一步生成的 FP16 文件进行量化,以减小模型体积并提升推理速度。

复制代码
./build/bin/llama-quantize /home/aistudio/llama.cpp/qwen3-4b-f16.gguf /home/aistudio/llama.cpp/qwen3-4b-q4_k_m.gguf Q4_K_M
相关推荐
枫叶丹420 小时前
MCP、A2A、AG-UI:一篇讲清 Agent 协议栈
人工智能·ui·chatgpt·agent·codex
纯爱掌门人20 小时前
从 Agent 到 Harness:AI 进入研发流程,真正缺的是什么?
人工智能·程序员·agent
悟道心20 小时前
2.智能体-Openclaw介绍
人工智能
ITmaster073120 小时前
前端 AI 面试题:高频考点与实战解析
前端·人工智能
Είναι η κοπέλα20 小时前
CNN 与模板匹配混合识别:ONNX 推理 + 置信度仲裁实战
人工智能·神经网络·cnn
嘟哩DuliDuli20 小时前
AI 短剧生成为什么要有角色库、场景库和镜头卡
android·人工智能·安全·ai·软件工程
技术深耕者20 小时前
2026年充电桩怎么选?如何判断充电桩哪个品牌质量好,权威市场声明可供参考
大数据·人工智能
wordbaby20 小时前
别再硬啃公式了:用“北京的天气怎么样”,零基础拆透 Transformer 注意力机制
人工智能
有脚就行20 小时前
第36篇-Token计费系统-LLM时代的精细化计量
人工智能
黑马水牛20 小时前
Carla仿真系列:9_Carla 单目障碍物测距,四种方法原理与实测
经验分享·python·深度学习·计算机视觉·ros·传感器·carla仿真