微调

张小泡泡2 天前
论文阅读·人工智能·语言模型·自然语言处理·自动化·微调
AUTO_EVAL:面向大语言模型的多层次自动化评测框架github.com/zhangshuwei932-ai/AUTO_EVAL — MIT License,欢迎 Star 与贡献。
薛定谔的猫198215 天前
大模型·微调·vllm·模版·llama factory·lmdeploy·对话模板
LLaMA Factory微调中的模版在vLLM或LMDeploy框架部署中对齐很多开发者都会遇到一个典型痛点:在 LlamaFactory 完成 LoRA 微调后,在网页上内对话效果完全符合预期;但把合并后的模型迁移至 vLLM、LMDeploy、Ollama、OpenWebUI 等框架部署时,模型输出风格、回答逻辑、停止时机全部跑偏,甚至出现无限生成、角色认知丢失、问答答非所问。 绝大多数人会怀疑权重导出、量化流程出错,而真正的核心诱因是对话模板不统一。本文完整拆解对话模板底层逻辑、各框架模板差异,给出标准化导出、对齐、自定义落地全流程,彻底解决微调与部署效果割裂问题。
冷小鱼19 天前
大模型·微调·优化·迭代·评估
Agent 大模型的后训练、微调、评估与迭代优化:从理论到工程实践摘要:随着大语言模型(LLM)从 “对话助手” 向 “自主 Agent” 演进,模型需要具备复杂指令理解、多步推理、工具调用和动态决策等能力。本文系统梳理了 Agent 场景下大模型的后训练(Post-Training)、微调(Fine-Tuning)、评估(Evaluation)与迭代优化(Iterative Optimization)全链路技术体系,结合最新研究进展与工程实践,为构建高性能 Agent 提供方法论指导。
ybdesire1 个月前
运维·服务器·人工智能·大模型·微调
微调LLM提升工具调用能力的ShareGPT数据格式我们做LLM微调,最常见的是Alpaca格式的数据,Alpaca是最简单、最通用的指令微调格式。它没有对话历史,只有 指令 (Instruction) + 输入 (Input) + 输出 (Output),适合单轮指令学习。
虎妞05002 个月前
深度学习·lora·大模型·微调·qlora
大模型微调实战:LoRA 与 QLoRA 原理精讲大语言模型(LLM)虽然在通用场景表现优异,但在特定领域任务上往往力不从心。以 GPT-4 为例,它在医学诊断、法律文书、企业私有知识等垂直场景的表现明显不足。**全量微调(Full Fine-tuning)**虽然效果最好,但开销巨大——训练 LLaMA-65B 需要 780GB+ 显存,绝非普通团队所能承受。
AndrewHZ2 个月前
人工智能·深度学习·大模型·llm·微调·预训练·rlhf
【LLM技术全景】预训练与微调:大模型如何“学习“摘要:本文是《LLM技术全景:从Token到部署》系列第四篇。大语言模型之所以强大,核心在于"预训练+微调"的两阶段范式。预训练让模型在海量无标注文本中学习语言的一般规律,微调则让模型学会遵循指令、匹配人类偏好。本期将深入解析预训练的技术原理(Next Token Prediction、语料选择、训练动态)、SFT有监督微调的核心技巧,以及RLHF/DPO等对齐技术的工作机制。配图将展示大模型训练的完整pipeline,帮助读者理解从"语言模型"到"助手"的技术跃迁。
qqxhb2 个月前
微调·prompt·rag
30|什么时候需要 RAG:直接 Prompt/微调/RAG 的决策欢迎来到 卷 4:知识与数据。 在前面的章节里,我们赋予了 AI 思考的框架(Prompt)和行动的手脚(MCP/Skills)。但如果现在你问 AI:“咱们公司昨天发布的新产品,退款政策是什么?”它一定会胡编乱造。 为什么?因为它脑子里只有它被“训练”时(通常是一年甚至更久以前)互联网上的公开数据,它完全不知道你们公司的内部机密和最新动态。
养肥胖虎3 个月前
ai·微调·rag
RAG学习笔记(2):关于rag和模型微调,同一个问题它们分别怎么处理好家伙,今天我们来聊一个很容易混在一起的问题:这两个东西看起来都能让大模型回答得更贴近业务.但它们解决的问题其实不一样.
TGITCIC3 个月前
微调·sft·llama·模型训练·训练·大模型训练·llama-factory
大模型训练师的炼丹之道 (1)-最新版llama-factory环境搭建和全排错在人工智能的演进图谱中,大模型训练始终占据着技术金字塔的顶端。它不仅是AI Agent开发的上层建筑,更是当Agent应用发展到一定深度后,不可避免必须跨越的技术鸿沟。唯有掌握底层模型的塑造能力,才能真正突破通用能力的天花板。
闲人编程3 个月前
ai·开源·微调·智能体·决策·自进化·决策矩阵
开源 vs 闭源:构建Agent该如何选择基座模型?“当你为Agent选择基座模型时,你不仅在选择一个‘大脑’,更是在选择成本曲线、隐私边界、可控程度和进化速度。开源与闭源早已不是宗教之争,而是一道需要精密计算的工程决策题。在2026年Agent全面落地的今天,这道题的答案比任何时候都更复杂。”
小何code3 个月前
lora·大模型·微调·prompt工程
人工智能【第26篇】大模型应用实战:Prompt工程与微调技巧作者的话:在前面的文章中,我们学习了GPT等大语言模型。然而,拥有强大的模型只是第一步,如何有效地使用这些模型才是真正的挑战。本文将深入讲解Prompt工程(提示工程)和微调技巧,帮助你从"会用"大模型进阶到"用好"大模型!
乔江seven3 个月前
人工智能·深度学习·计算机视觉·微调·imagenetdogs
【跟李沐学AI】24 狗的品种识别(ImageNet Dogs)本章内容与上一章节的图像分类任务(CIFAR-10)相近,主要区别在于:① 图像数据更复杂,多样性更大,图像增广处理不一致;② 使用预训练的模型,并采用冻结微调策略; ③ 预测的输出不再是类别,而是一个包含所有类别预测概率的向量。
xian_wwq3 个月前
笔记·学习·微调·llama factory
【学习笔记】大模型微调实战指南作为AI工程师,掌握大模型微调是落地垂直领域应用的核心技能。毕竟通用大模型无法覆盖企业私有知识、行业专属场景,而微调能让模型快速适配特定需求。
cooldream20093 个月前
微调·unsloth
Unsloth微调实战:用LoRA技术打造专属文言文翻译模型在大语言模型(LLM)飞速发展的今天,如何利用有限的显卡资源高效完成模型微调,成为了众多开发者和研究者关注的焦点。Unsloth 作为一款新兴的模型训练加速框架,通过优化显存占用和训练速度,让普通开发者也能在消费级GPU上完成高质量的模型微调工作。本文将以文言文翻译任务为实战案例,手把手教您搭建完整的Unsloth微调环境,并完成从环境配置到模型推理的全流程操作。
Flying pigs~~3 个月前
数据库·人工智能·缓存·微调·知识库·rag
RAG智慧问答项目核心技术:Python+LangChain+Milvus+BGE-M3+BGE-Reranker-Large+bert-base-chinese微调+Qwen2.5-14B (INT8)+光明AI大模型+PaddleOCR+MySQL+Redis+FastAPI+Docker+Vue3+Typescript
Java后端的Ai之路3 个月前
人工智能·lora·微调
什么是“多模态微调”?对了,分享一个我最近常看的AI人工智能学习渠道,讲得挺有章法的,不端着也不故弄玄虚。不感兴趣划走就行,感兴趣的可以自己去验证一下。
Flying pigs~~3 个月前
人工智能·深度学习·lora·大模型·微调·transformer
LoRA 面试完全指南:低秩分解原理 + Transformer 应用关键词:LoRA、低秩分解、参数高效微调、PEFT、TransformerLoRA(Low-Rank Adaptation)是一种参数高效微调方法,通过在预训练模型旁注入可训练的低秩分解矩阵,大幅减少需要训练的参数数量。
Flying pigs~~3 个月前
人工智能·大模型·微调·prompt
大模型Prompt-Tuning技术详解:从入门到进阶一文读懂NLP范式演进、Fine-Tuning与Prompt-Tuning的核心原理随着ChatGPT、GPT-4等大模型的爆火,Prompt-Tuning技术逐渐成为学术界和工业界关注的焦点。本文将系统介绍NLP任务的四种发展范式,深入剖析Fine-Tuning和Prompt-Tuning的核心原理,并带你了解面向超大规模模型的先进微调技术。
乔江seven3 个月前
人工智能·深度学习·计算机视觉·微调
【李沐 | 动手学深度学习】 21 计算机视觉:微调目录前言网络架构为什么要进行微调?1 微调详解1.1 微调的核心步骤1.2 常用的微调策略2 代码实现
kylin-运维3 个月前
微调·训练·unsloth studio·离线环境
Unsloth Studio 使用问题记录离线环境,官方docker镜像,k8s环境使用手动下载源码https://github.com/ggml-org/llama.cpp传到unsloth内 根据报错日志的路径,创建目录