Llama-Factory微调 Qwen2.5-3B 模型 合并与导出(二)

1.概述

本文基于矩池云 RTX A2000 12G 服务器,使用 LlamaFactory 完成通义千问 Qwen2.5-3B 轻量化 LoRA 微调、权重合并导出、WebUI 对话验证全链路操作,完整覆盖训练配置、模型导出、推理测试三大核心环节,适配个人学习、竞赛小模型定制场景。 整套流程分为 4 个阶段:

  1. Train 训练页配置基础模型与 LoRA 微调权重;
  2. Export 导出页合并基础模型 + LoRA 适配器,生成独立完整模型;
  3. Chat 对话页加载合并后的成品模型,验证微调效果;
  4. 导出自动生成 Ollama 部署配置文件,支持轻量化本地推理。

LoRA 仅为增量权重,无法单独部署推理,必须将基座模型 + LoRA 微调权重合并,生成独立完整模型

2.导出页面关键配置

  1. 最大分块大小 5GB 大模型单文件体积超过 5GB 会自动切分多个safetensors分片,避免单文件过大导致读写、传输失败;导出完成后自动生成model.safetensors.index.json分片索引文件,推理时自动拼接加载。
  2. 导出量化等级:none 本次导出完整 bfloat16 精度模型,不做量化压缩;如需轻量化可在此选择 4bit/8bit 量化。
  3. 导出设备:CPU 合并权重对算力需求低,使用 CPU 导出不占用 GPU 显存,避免显存满载报错。
  4. 导出目录 成品模型输出路径 /mnt/llm/qwen2.5-3b-qlora4bit,目录内自动生成全套推理文件:
    • 模型权重分片、config.json模型配置、generation_config.json生成参数;
    • chat_template.jinja对话模板、分词器全套配置;
    • 自动生成 Ollama 专用Modelfile配置文件,一键构建 Ollama 本地模型。

导出流程自动读取checkpoint-90 LoRA 适配器,合并至 Qwen2.5-3B 31 亿参数基座模型,统一转换精度为bfloat16;写入进度 100% 无磁盘 IO 报错,解决前期Disk quota exceeded磁盘空间不足问题后,完整落地全套模型文件。

合并切换到Export,检查点路径选择微调生成的checkpoint相关文件的路径,

最大分块大小选5G,导出设备 auto,导出目录填写正确的目录地址。点击"开始导出"即可。过一会就会导出成功。

3.测试,Chat 对话页面加载成品模型,验证微调效果

选择chat选项卡,模型路径选择合并生成的模型路径

1. Chat 页面加载配置要点

  1. 模型路径替换为合并后的完整模型目录 /mnt/llm/qwen2.5-3b-qlora4bit
  2. 微调方法、检查点路径置空:合并后的模型已经集成 LoRA 权重,无需单独加载适配器;
  3. 推理引擎选择huggingface,原生 transformers 推理,兼容性最强;
  4. 额外参数补充{"vllm_enforce_eager":true},规避部分显卡推理兼容报错;
  5. 其余语言、对话模板、加速参数保持和训练阶段一致,点击「加载模型」完成初始化。

2. 对话实测效果验证

模型加载完成后开启对话测试,验证微调指令遵循能力:

  1. 英文提问 who are you:模型输出英文自我介绍 I am an AI assistant created by Aron...
  2. 中文提问 你是谁:模型精准输出定制中文人设「我是小聚,一个由 Aron 开发的 AI 助手...」; 结论:微调数据集内的人设指令已完全学习生效,中英文问答均能匹配训练设定的角色信息,loss 收敛效果落地到实际对话输出,微调任务达成预期目标。
相关推荐
嘟嘟嘟952713 分钟前
Kubernetes 引入 KYAML:更安全的 YAML 子集
人工智能·架构·开源
智购科技自动售货机厂家14 分钟前
2026自动售货机设备清洁效果自动验证:从图像比对到评分算法的工程实践~YH
人工智能·算法·计算机视觉
财迅通Ai19 分钟前
光智科技全景透视:一家被“光学元件”标签遮蔽的稀散金属材料平台
大数据·人工智能·科技·光智科技
AI技术新视界38 分钟前
失控的认知外包:大语言模型如何像病毒般入侵人类思维与社会生态
人工智能·llm·认知科学
后端小肥肠39 分钟前
还在找PPT 生成工具?我集成了 GitHub 高星 Skill,自动匹配最优方案
人工智能·aigc·agent
打破砂锅问到底00739 分钟前
115 行把 Qwen3-8B 跑进浏览器:WebLLM 本地推理实战
人工智能·ai·llm
二川bro40 分钟前
幻觉≠提示词注入!拆解GPT‑6 Astra三层防御架构的致命短板
人工智能
雪庭43 分钟前
pmb 面向 AI 编码智能体的本地记忆系统
人工智能
姜穆澜1 小时前
机器学习实战指南:从算法原理到工程落地
人工智能·算法·机器学习
styshoo1 小时前
[NVSentinel] gpu-health-monitor模块之dcgm_watcher
人工智能