大模型QLoRA微调——基于Qwen2-7B的自动化病历摘要生成系统

01 项目简介

(1)项目背景

医疗文档中包含大量的诊疗信息,例如疾病诊断、手术名称、解剖部位、药物使用以及影像和实验室检查结果。这些信息是医疗数据分析的核心,但由于医疗文本内容复杂、格式多样,提取这些关键内容具有一定挑战。为此,本项目基于 Qwen-7B大语言模型,通过QLoRA微调,使其从医疗文档中识别并提取这些信息。

(2)数据集介绍

本项目在Yidu-S4K数据集上进行指令微调任务,该数据共计包含1000条中文电子病历医疗实体识别数据。数据集地址如下:

https://tianchi.aliyun.com/dataset/144419

每条数据集如上图所示,因此需要先将其处理为qwen大模型要求的输入格式,本项目的处理结果如下:

(3)Qwen大模型介绍

Qwen是通义千问团队的开源大语言模型,由阿里云通义实验室研发。该系列模型包括5个尺寸的预训练和指令微调模型:Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B以及Qwen2-72B。对比当前最优的开源模型,Qwen2-72B在包括自然语言理解、知识、代码、数学及多语言等多项能力上均显著超越当前领先的Llama3-70B等大模型。

02 模型训练

(1)环境配置

(2)量化微调

**LoRA:**是一种低秩微调方法,用于在大模型中插入低秩矩阵,冻结原始模型参数,只微调插入的权重部分,显著减少了训练参数。

QLoRA (Quantized LoRA) **:**是在 LoRA 的基础上,引入了 4-bit量化技术。QLoRA 在不影响模型性能的前提下,将模型参数压缩为 4-bit 格式,并结合 LoRA 微调技术,进一步减少显存占用和计算资源消耗。显存占用如图所示。

本项目量化代码如下,使用了 4 比特量化的不同变体nf4量化,大大减少了内存占用。

python 复制代码
from transformers import BitsAndBytesConfig
nf4_config = BitsAndBytesConfig(   
load_in_4bit=True,   
bnb_4bit_quant_type="nf4",   
bnb_4bit_use_double_quant=True,   
bnb_4bit_compute_dtype=torch.bfloat16)

本项目设置的LoRA微调参数如下:

python 复制代码
config = LoraConfig(    
task_type=TaskType.CAUSAL_LM,    
target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],    
inference_mode=False,  # 训练模式    
r=8,  # Lora 秩    
lora_alpha=32,  # Lora alaph,具体作用参见 Lora 原理    
lora_dropout=0.1,  # Dropout 比例)

设置训练批次为8 ,梯度累计步数为4 ,学习率为1e-4,最终的显存占用和模型参数如下:

本项目通过结合 QLoRA 微调和医疗领域的任务设计,成功赋能 Qwen-7B 模型,使其能够精准地从医疗文本中提取诊疗信息。

03 界面演示

经过10轮训练,绘制其loss曲线,如下所示,可以看到模型已经收敛。

接下来,就是基于gradio设计了web界面,便于进行测试,具体演示如下:

qwen-zhaiy

【源码链接】

大模型QLoRA微调------基于Qwen2-7B的自动化病历摘要生成系统

你将会的到:本项目所有代码、处理好的数据集、训练好的权重、设计好的聊天 交互界面。

最后:

小编会不定期发布相关设计内容包括但不限于如下内容:信号处理、通信仿真、算法设计、matlab appdesigner,gui设计、simulink仿真......希望能帮到你!

相关推荐
GIS数据转换器16 小时前
智慧灌区管理平台
大数据·服务器·网络·数据库·人工智能·生活
STLearner17 小时前
ICML 2026 | LLM×Graph论文总结[2]【Graph4LLM,Graph4Agent,智能体记忆(Memory)
大数据·人工智能·python·深度学习·学习·机器学习·数据挖掘
ACP广源盛1392462567318 小时前
此芯 P1 AI BOX / AI NAS@ACP#IX8008、IX8024 应用场景与市场机会
大数据·人工智能·分布式·单片机·嵌入式硬件
凤山老林18 小时前
从美团全栈化看 AI 冲击:前端转全栈,是自救还是必然
前端·人工智能·状态模式
大龄码农有梦想18 小时前
企业如何利用 AI 大模型提升业务效率?企业 AI 应用应该从哪些场景切入
人工智能·ai agent·ai智能体·ai应用·ai工作流·ai赋能·智能体平台
其实防守也摸鱼18 小时前
KMP全栈开发:从Android到AI Agent的技术演进与实践
android·运维·网络·人工智能·学习·安全·macos
摇滚侠1 天前
AI 编程工具 《TRAE 官方手册》阅读笔记 AI 编程核心 上
人工智能·笔记
一个王同学1 天前
从零到一 | CV转多模态大模型 | week19 | 基于 FastAPI 和 vLLM 的多模态大模型部署
人工智能·深度学习·计算机视觉·fastapi·改行学it·vllm
m沐沐1 天前
【深度学习】YOLOv2目标检测算法——改进点、网络结构与聚类先验框解析
人工智能·pytorch·深度学习·算法·yolo·目标检测·transformer
企业老板ai培训1 天前
破解中小企业AI变现难:2026年企业AI培训与陪跑行业趋势深度报告,为何从‘陪跑’到‘变现’才是关键?
大数据·人工智能