Llama-Factory微调 Qwen2.5-3B 模型 合并与导出(二)

1.概述

本文基于矩池云 RTX A2000 12G 服务器,使用 LlamaFactory 完成通义千问 Qwen2.5-3B 轻量化 LoRA 微调、权重合并导出、WebUI 对话验证全链路操作,完整覆盖训练配置、模型导出、推理测试三大核心环节,适配个人学习、竞赛小模型定制场景。 整套流程分为 4 个阶段:

  1. Train 训练页配置基础模型与 LoRA 微调权重;
  2. Export 导出页合并基础模型 + LoRA 适配器,生成独立完整模型;
  3. Chat 对话页加载合并后的成品模型,验证微调效果;
  4. 导出自动生成 Ollama 部署配置文件,支持轻量化本地推理。

LoRA 仅为增量权重,无法单独部署推理,必须将基座模型 + LoRA 微调权重合并,生成独立完整模型

2.导出页面关键配置

  1. 最大分块大小 5GB 大模型单文件体积超过 5GB 会自动切分多个safetensors分片,避免单文件过大导致读写、传输失败;导出完成后自动生成model.safetensors.index.json分片索引文件,推理时自动拼接加载。
  2. 导出量化等级:none 本次导出完整 bfloat16 精度模型,不做量化压缩;如需轻量化可在此选择 4bit/8bit 量化。
  3. 导出设备:CPU 合并权重对算力需求低,使用 CPU 导出不占用 GPU 显存,避免显存满载报错。
  4. 导出目录 成品模型输出路径 /mnt/llm/qwen2.5-3b-qlora4bit,目录内自动生成全套推理文件:
    • 模型权重分片、config.json模型配置、generation_config.json生成参数;
    • chat_template.jinja对话模板、分词器全套配置;
    • 自动生成 Ollama 专用Modelfile配置文件,一键构建 Ollama 本地模型。

导出流程自动读取checkpoint-90 LoRA 适配器,合并至 Qwen2.5-3B 31 亿参数基座模型,统一转换精度为bfloat16;写入进度 100% 无磁盘 IO 报错,解决前期Disk quota exceeded磁盘空间不足问题后,完整落地全套模型文件。

合并切换到Export,检查点路径选择微调生成的checkpoint相关文件的路径,

最大分块大小选5G,导出设备 auto,导出目录填写正确的目录地址。点击"开始导出"即可。过一会就会导出成功。

3.测试,Chat 对话页面加载成品模型,验证微调效果

选择chat选项卡,模型路径选择合并生成的模型路径

1. Chat 页面加载配置要点

  1. 模型路径替换为合并后的完整模型目录 /mnt/llm/qwen2.5-3b-qlora4bit
  2. 微调方法、检查点路径置空:合并后的模型已经集成 LoRA 权重,无需单独加载适配器;
  3. 推理引擎选择huggingface,原生 transformers 推理,兼容性最强;
  4. 额外参数补充{"vllm_enforce_eager":true},规避部分显卡推理兼容报错;
  5. 其余语言、对话模板、加速参数保持和训练阶段一致,点击「加载模型」完成初始化。

2. 对话实测效果验证

模型加载完成后开启对话测试,验证微调指令遵循能力:

  1. 英文提问 who are you:模型输出英文自我介绍 I am an AI assistant created by Aron...
  2. 中文提问 你是谁:模型精准输出定制中文人设「我是小聚,一个由 Aron 开发的 AI 助手...」; 结论:微调数据集内的人设指令已完全学习生效,中英文问答均能匹配训练设定的角色信息,loss 收敛效果落地到实际对话输出,微调任务达成预期目标。
相关推荐
Qyr9914 分钟前
吞咽困难介护食:老龄化社会中的营养安全守护者
人工智能
火山引擎开发者社区14 分钟前
文件上传即可检索|实时多模态向量链路落地实践分享
人工智能
YYJ-F21 分钟前
Anthropic——AI安全人工智能研究公司,核心产品Claude Code辅助编程
人工智能·安全
具身智能进化论26 分钟前
协作机器人产业进入规模化部署期,未来几年的增长从何而来
大数据·运维·人工智能·机器人·自动化·工厂方法模式
hzcj88830 分钟前
汇正财经:储能装机回暖,估值有待提升
大数据·人工智能
妄想出头的工业炼药师43 分钟前
GLAM-SLAM
人工智能
一直都在5721 小时前
LangChain4j精讲
开发语言·人工智能
八号当铺1 小时前
使用 Figma Agent Kit:插件 + MCP + 还原 Skill,打通本地设计协作
前端·人工智能·ai编程
今天AI了吗1 小时前
时序大模型 TimechoAI 实战:从数据接入到智能时序分析全链路指南
人工智能
AI服务老曹1 小时前
多路摄像头AI分析完整流程:硬件选型与GPU/NPU算力估算指南
人工智能