技术栈
微调
Lee_jerome
1 天前
微调
·
bert
·
迁移学习
·
文本分类
·
预训练
·
小样本
·
冻结特征
python神经网络编程入门(四十四)——微调预训练 BERT 做下游任务
📍 路标:本篇位于《从零构建 Transformer》系列 第 15/16 章 · 实战篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16·本篇) ▸ 知识收官
像风一样自由2020
1 天前
postgresql
·
大模型
·
微调
·
milvus
14.什么时候用pgvector什么时候单独部署Milvus
码海寻道 · 大模型、智能体与 RAG 工程组件系列第 14 篇PostgreSQL 加 pgvector,还是 PostgreSQL 加 Milvus?
孙启超
8 天前
人工智能
·
lora
·
llm
·
微调
·
sft
·
token
·
rlhf
【大模型应用开发】LLM 到底是什么,以及它是怎么训练的
你有没有想过一个问题:为什么 ChatGPT 能跟你对话?它不是"搜答案"。如果你问它"1+1 等于几",它不是去百度查,而是"算"出来的。更准确地说,是"生成"出来的——它基于你输入的文字,一个 token 一个 token 地预测下一个字该是什么。
XLYcmy
14 天前
rnn
·
神经网络
·
llm
·
微调
·
transformer
·
训练
·
对齐
京东 算法实习一面 上
八股:Transformer完全基于注意力机制,摒弃了循环和卷积操作。Transformer出来之前,主流的序列转换模型都基于复杂的循环神经网络(RNN),包含编码器和解码器两部分。当时表现最好的模型还通过注意力机制将编码器和解码器连接起来。
张小泡泡
23 天前
论文阅读
·
人工智能
·
语言模型
·
自然语言处理
·
自动化
·
微调
AUTO_EVAL:面向大语言模型的多层次自动化评测框架
github.com/zhangshuwei932-ai/AUTO_EVAL — MIT License,欢迎 Star 与贡献。
薛定谔的猫1982
1 个月前
大模型
·
微调
·
vllm
·
模版
·
llama factory
·
lmdeploy
·
对话模板
LLaMA Factory微调中的模版在vLLM或LMDeploy框架部署中对齐
很多开发者都会遇到一个典型痛点:在 LlamaFactory 完成 LoRA 微调后,在网页上内对话效果完全符合预期;但把合并后的模型迁移至 vLLM、LMDeploy、Ollama、OpenWebUI 等框架部署时,模型输出风格、回答逻辑、停止时机全部跑偏,甚至出现无限生成、角色认知丢失、问答答非所问。 绝大多数人会怀疑权重导出、量化流程出错,而真正的核心诱因是对话模板不统一。本文完整拆解对话模板底层逻辑、各框架模板差异,给出标准化导出、对齐、自定义落地全流程,彻底解决微调与部署效果割裂问题。
冷小鱼
1 个月前
大模型
·
微调
·
优化
·
迭代
·
评估
Agent 大模型的后训练、微调、评估与迭代优化:从理论到工程实践
摘要:随着大语言模型(LLM)从 “对话助手” 向 “自主 Agent” 演进,模型需要具备复杂指令理解、多步推理、工具调用和动态决策等能力。本文系统梳理了 Agent 场景下大模型的后训练(Post-Training)、微调(Fine-Tuning)、评估(Evaluation)与迭代优化(Iterative Optimization)全链路技术体系,结合最新研究进展与工程实践,为构建高性能 Agent 提供方法论指导。
ybdesire
2 个月前
运维
·
服务器
·
人工智能
·
大模型
·
微调
微调LLM提升工具调用能力的ShareGPT数据格式
我们做LLM微调,最常见的是Alpaca格式的数据,Alpaca是最简单、最通用的指令微调格式。它没有对话历史,只有 指令 (Instruction) + 输入 (Input) + 输出 (Output),适合单轮指令学习。
虎妞0500
2 个月前
深度学习
·
lora
·
大模型
·
微调
·
qlora
大模型微调实战:LoRA 与 QLoRA 原理精讲
大语言模型(LLM)虽然在通用场景表现优异,但在特定领域任务上往往力不从心。以 GPT-4 为例,它在医学诊断、法律文书、企业私有知识等垂直场景的表现明显不足。**全量微调(Full Fine-tuning)**虽然效果最好,但开销巨大——训练 LLaMA-65B 需要 780GB+ 显存,绝非普通团队所能承受。
AndrewHZ
3 个月前
人工智能
·
深度学习
·
大模型
·
llm
·
微调
·
预训练
·
rlhf
【LLM技术全景】预训练与微调:大模型如何“学习“
摘要:本文是《LLM技术全景:从Token到部署》系列第四篇。大语言模型之所以强大,核心在于"预训练+微调"的两阶段范式。预训练让模型在海量无标注文本中学习语言的一般规律,微调则让模型学会遵循指令、匹配人类偏好。本期将深入解析预训练的技术原理(Next Token Prediction、语料选择、训练动态)、SFT有监督微调的核心技巧,以及RLHF/DPO等对齐技术的工作机制。配图将展示大模型训练的完整pipeline,帮助读者理解从"语言模型"到"助手"的技术跃迁。
qqxhb
3 个月前
微调
·
prompt
·
rag
30|什么时候需要 RAG:直接 Prompt/微调/RAG 的决策
欢迎来到 卷 4:知识与数据。 在前面的章节里,我们赋予了 AI 思考的框架(Prompt)和行动的手脚(MCP/Skills)。但如果现在你问 AI:“咱们公司昨天发布的新产品,退款政策是什么?”它一定会胡编乱造。 为什么?因为它脑子里只有它被“训练”时(通常是一年甚至更久以前)互联网上的公开数据,它完全不知道你们公司的内部机密和最新动态。
养肥胖虎
3 个月前
ai
·
微调
·
rag
RAG学习笔记(2):关于rag和模型微调,同一个问题它们分别怎么处理
好家伙,今天我们来聊一个很容易混在一起的问题:这两个东西看起来都能让大模型回答得更贴近业务.但它们解决的问题其实不一样.
TGITCIC
3 个月前
微调
·
sft
·
llama
·
模型训练
·
训练
·
大模型训练
·
llama-factory
大模型训练师的炼丹之道 (1)-最新版llama-factory环境搭建和全排错
在人工智能的演进图谱中,大模型训练始终占据着技术金字塔的顶端。它不仅是AI Agent开发的上层建筑,更是当Agent应用发展到一定深度后,不可避免必须跨越的技术鸿沟。唯有掌握底层模型的塑造能力,才能真正突破通用能力的天花板。
闲人编程
3 个月前
ai
·
开源
·
微调
·
智能体
·
决策
·
自进化
·
决策矩阵
开源 vs 闭源:构建Agent该如何选择基座模型?
“当你为Agent选择基座模型时,你不仅在选择一个‘大脑’,更是在选择成本曲线、隐私边界、可控程度和进化速度。开源与闭源早已不是宗教之争,而是一道需要精密计算的工程决策题。在2026年Agent全面落地的今天,这道题的答案比任何时候都更复杂。”
小何code
3 个月前
lora
·
大模型
·
微调
·
prompt工程
人工智能【第26篇】大模型应用实战:Prompt工程与微调技巧
作者的话:在前面的文章中,我们学习了GPT等大语言模型。然而,拥有强大的模型只是第一步,如何有效地使用这些模型才是真正的挑战。本文将深入讲解Prompt工程(提示工程)和微调技巧,帮助你从"会用"大模型进阶到"用好"大模型!
乔江seven
4 个月前
人工智能
·
深度学习
·
计算机视觉
·
微调
·
imagenetdogs
【跟李沐学AI】24 狗的品种识别(ImageNet Dogs)
本章内容与上一章节的图像分类任务(CIFAR-10)相近,主要区别在于:① 图像数据更复杂,多样性更大,图像增广处理不一致;② 使用预训练的模型,并采用冻结微调策略; ③ 预测的输出不再是类别,而是一个包含所有类别预测概率的向量。
xian_wwq
4 个月前
笔记
·
学习
·
微调
·
llama factory
【学习笔记】大模型微调实战指南
作为AI工程师,掌握大模型微调是落地垂直领域应用的核心技能。毕竟通用大模型无法覆盖企业私有知识、行业专属场景,而微调能让模型快速适配特定需求。
cooldream2009
4 个月前
微调
·
unsloth
Unsloth微调实战:用LoRA技术打造专属文言文翻译模型
在大语言模型(LLM)飞速发展的今天,如何利用有限的显卡资源高效完成模型微调,成为了众多开发者和研究者关注的焦点。Unsloth 作为一款新兴的模型训练加速框架,通过优化显存占用和训练速度,让普通开发者也能在消费级GPU上完成高质量的模型微调工作。本文将以文言文翻译任务为实战案例,手把手教您搭建完整的Unsloth微调环境,并完成从环境配置到模型推理的全流程操作。
Flying pigs~~
4 个月前
数据库
·
人工智能
·
缓存
·
微调
·
知识库
·
rag
RAG智慧问答项目
核心技术:Python+LangChain+Milvus+BGE-M3+BGE-Reranker-Large+bert-base-chinese微调+Qwen2.5-14B (INT8)+光明AI大模型+PaddleOCR+MySQL+Redis+FastAPI+Docker+Vue3+Typescript
Java后端的Ai之路
4 个月前
人工智能
·
lora
·
微调
什么是“多模态微调”?
对了,分享一个我最近常看的AI人工智能学习渠道,讲得挺有章法的,不端着也不故弄玄虚。不感兴趣划走就行,感兴趣的可以自己去验证一下。