大模型微调

Allen.Su7 天前
人工智能·python·lora·大模型微调
大模型 LoRA 微调全流程实战 - 车载问答全流程(跑通 + 参数详解 + 训练日志逐行解读 + 模型合并)运行环境:Windows 11 + Python 3.10 + PyTorch(CPU) + transformers 5.x + peft 基座模型:Qwen1.5-1.8B-Chat | 数据规模:30 条车载问答 | 训练耗时:CPU 约 34 分钟 源码仓库(Gitee):https://gitee.com/allensu0108/llm-fine-tuning | 训练脚本、合并脚本、30 条数据与 README 全在里面,可直接克隆运行: git clone https://gitee.com
承渊政道11 天前
人工智能·pytorch·chatgpt·预训练·rlhf·大模型微调
【从零开始大模型开发与微调:基于PyTorch与ChatGLM】(实战训练自己的ChatGPT从续写模型到对齐助手:RLHF、奖励模型与PPO精读)在2023年年初,OpenAI推出了一种大型语言模型,名为ChatGPT.这个模型最大的特点是可以像聊天机器人一样进行对话.与其他语言模型不同的是,ChatGPT经过微调,能够以对话的方式执行各种任务,比如回答查询、解决编码、制定营销计划、解决数学问题等.用户只需使用电子邮件地址创建OpenAI账户,登录ChatGPT并输入查询,就可以与这个模型进行对话.ChatGPT可以用自然人类语言回答用户的问题,如果回答不满足用户的需求,可以微调输入查询,直到获得预期的结果为止.对于用户来说,ChatGPT是一个非
一枚爱吃大蒜的程序员13 天前
人工智能·机器学习·语言模型·qlora·大模型微调·注意力约束
CSDN文章-注意力约束QLoRA教育大模型微调📌 论文原题:基于注意力约束QLoRA与指令样本增强的大模型微调方法研究 📌 核心成果:BLEU 44.1 / ROUGE-L 47.8 / F1 77.3% / 准确率 79.1%,较原生QLoRA提升5.6~10.6个百分点,峰值显存仅8.9GB,推理延迟130ms 📌 适用场景:职业院校、中小型教育机构等低资源条件下的垂直领域大模型微调
weixin_4402132925 天前
lora·大模型·peft·qlora·dora·大模型微调·参数高效微调
大模型参数高效微调:PEFT、LoRA、QLoRA、DoRA原理与对比摘要:大模型全参微调硬件门槛极高,PEFT参数高效微调成为工业界主流方案。本文讲解PEFT核心概念,对比LoRA、QLoRA、DoRA三者原理、优缺点、适用场景,附带代码示例与选型建议,帮助快速落地大模型微调。
uncle_ll1 个月前
llm·nlp·llama·ollama·大模型微调
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调在前沿生成式 AI 的落地应用中,开发者常面临两大工程痛点:本文将围绕开源大模型基座 Llama 3,提供一条“推理部署 + 轻量微调”的完整闭环方案:采用Ollama构建零门槛本地 API 服务,结合LLaMA Factory框架完成低算力消耗的 LoRA 参数高效微调(PEFT)。
GRITJW2 个月前
强化学习·大模型微调
从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布理解大模型后训练中的能力学习、泛化与遗忘大语言模型在预训练阶段阅读海量文本,并通过“预测下一个 token”学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎样遵循用户指令,也不一定会按照我们期待的格式回答,更不会自动把“对用户有帮助”“数学答案正确”或“代码能够通过测试”当作自己的优化目标。
小何code4 个月前
lora·llama·peft·qlora·大模型微调
人工智能【第53篇】大模型微调实战:LoRA与QLoRA技术详解作者的话:预训练的大语言模型(如GPT、LLaMA)虽然能力强大,但在特定领域任务上往往表现不佳。全量微调成本高昂,且需要大量计算资源。LoRA(低秩适配)和QLoRA(量化LoRA)技术的出现,让我们能够以极低的成本高效微调大模型。本文将深入解析这两种技术的原理,并带你完成完整的微调实战!
cooldream20094 个月前
大模型微调·llama-factory
基于 AutoDL 云算力使用 LLaMA Factory 微调大模型及 API 服务搭建完整记录大模型微调是让通用大模型适应特定任务或领域的重要手段。LLaMA Factory 是目前最流行的开源微调框架之一,提供了 WebUI 可视化界面和命令行两种使用方式,大大降低了大模型微调的门槛。本文详细介绍在 AutoDL 云服务器上使用 LLaMA Factory 进行大模型微调的完整操作流程,包括环境安装、WebUI 使用、模型训练、微调后对话、模型导出以及 API 部署等环节。通过本文,您将掌握使用 LLaMA Factory 对 Qwen 等系列模型进行 LoRA 微调的核心方法,并能够独立完成从
cooldream20094 个月前
大模型微调·llama.cpp·unsloth
利用网络算力使用 Unsloth 实现llama大模型的微调部署调用大模型微调是让通用大模型适应特定任务或领域的重要技术。传统全参数微调需要昂贵的 GPU 资源,而 Unsloth 通过 QLoRA 4bit 量化技术,将微调的显存需求降低 50% 以上,同时保持训练速度提升 2-5 倍。本文详细介绍在 AutoDL 云服务器上使用 Unsloth 进行大模型微调的完整操作流程,包括环境配置、模型下载、微调训练、权重合并以及 API 部署。
Wilber的技术分享4 个月前
人工智能·深度学习·面试·lora·peft·qlora·大模型微调
【大模型面试八股 3】大模型微调技术:LoRA、QLoRA等LoRA是一种参数高效的微调方法。神经网络包含很多全连接层,其借助于矩阵乘法得以实现,然而,很多全连接层的权重矩阵都是满秩的。当针对特定任务进行微调后,模型中权重矩阵其实具有很低的本征秩(intrinsic rank),因此通过引入低秩矩阵来调整预训练模型的权重。 LoRA(论文:LoRA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS),该方法的核心思想就是通过低秩分解来模拟参数的改变量,从而以极小的参数量来实现大模型的间接训练。 LoRA 假设权重更新的过程
Joseph Cooper4 个月前
人工智能·chatgpt·lora·peft·qlora·大模型微调·dpo
大模型微调技术完全指南:从原理到实践的系统性入门(2026 版)30 秒速览:微调是让通用大模型学会特定技能的过程。2026 年,用 QLoRA + 1000 条高质量数据 + 一张 RTX 4090,你就能在几小时内让 7B-9B 参数模型变成领域专家。本文从"什么是微调"讲到"怎么实操",覆盖完整方法演进(LoRA→QLoRA→DPO→GRPO)和 2026 年最佳实践。文章信息更新至 2026 年 5 月。
m0_650108245 个月前
论文阅读·lora·大模型微调·经典方法
LoRA:大语言模型低秩适配最近在几个项目中都用到了LoRA,所以决定回来读一下这篇经典...2021年,在通用预训练 + 下游任务适配已经成为自然语言处理领域的标准范式背景下,微软团队提出了LoRA(Low-Rank Adaptation),以极简优雅的设计,彻底改写了大模型高效微调的格局,成为如今几乎所有大模型部署与适配的标配技术。
AI、少年郎5 个月前
linux·运维·服务器·ai·大模型训练·大模型微调·大模型原理
MiniMind第 2 篇:破除大模型 “神秘感“, 环境搭建|Win/Linux 本地快速部署承接上一篇内容:我们完整介绍了 MiniMind 项目核心价值、硬件成本、模型体量与全流程能力,打破了「大模型训练只能依赖超算、高额算力」的固有认知。
AI、少年郎5 个月前
人工智能·ai编程·大模型训练·大模型微调·大模型原理
MiniMind第 3 篇:底层原理|Decoder-Only 小模型核心:RMSNorm/SwiGLU/RoPE 极简吃透承接上一篇内容:我们已经完成了 Windows / Linux 全平台环境搭建,成功跑通 MiniMind 依赖配置、CUDA 适配,现在终于可以「掀开小模型的 hood」,深入底层原理。
gz7seven5 个月前
lora·大模型·大模型微调·lora原理
大模型学习笔记------微调之LoRALoRA(Low-Rank Adaptation,低秩自适应) 是目前大模型微调领域最火、应用最广的“平民化”技术。
人道领域6 个月前
人工智能·llm·rag·大模型微调
《别再纠结了!2026年终极指南:RAG(检索增强生成)、微调与长上下文,到底该选谁?》大家好,我是北极的代码。最近在后台收到很多粉丝私信:“我想做私有知识问答,到底是该用RAG,还是应该微调一个模型?”“现在大模型上下文窗口都1M了,是不是RAG要凉了?”
小明_GLC7 个月前
人工智能·llama·peft·大模型微调·方法对比
大模型微调 PEFT vs LLaMA-Factory在 LLM(大语言模型)微调的圈子里,开发者通常会接触到两种截然不同的流派:一种是原生代码流,即直接使用 HuggingFace Transformers 和 PEFT 库编写 Python 代码;另一种是框架工具流,以 LLaMA-Factory 为代表的集成化工具。
郭庆汝8 个月前
大模型微调·llamafactory
大模型-微调相关内容相关概念:LlamaFactory框架安装:项目github官网下载地址:官方建议依赖版本:根据上述官方依赖版本,我采用python版本是3.11,torch==2.5.0对应的cuda版本是11.8,具体如下:
程序员老奥9 个月前
fine-tuning·大模型微调·ms-swift·认知微调
【有手就行】SWIFT:花20分钟把大模型的名字变成你的名字你有没有问过大模型“你是谁”?问了的话,拿到的答案清一色都是大模型厂商的名字。而如果你自己部署了一个模型的话,通常都希望有人在你的应用里问你是谁的时候能给出一个“你的答案”。这篇文章就是干这个事情的,20分钟让大模型的名字变成你自己的名字。