sft

weixin_440213291 天前
微调·数据集·sft·预训练·模型量化·gptq·kv cache
大模型训练、微调、对齐、推理、量化、优化、数据集等本文汇总了大模型从预训练、持续预训练、后训练微调、RLHF对齐、主动学习、注意力优化、KV缓存、量化、归一化、数据集范式、评测体系等知识。
孙启超10 天前
人工智能·lora·llm·微调·sft·token·rlhf
【大模型应用开发】LLM 到底是什么,以及它是怎么训练的你有没有想过一个问题:为什么 ChatGPT 能跟你对话?它不是"搜答案"。如果你问它"1+1 等于几",它不是去百度查,而是"算"出来的。更准确地说,是"生成"出来的——它基于你输入的文字,一个 token 一个 token 地预测下一个字该是什么。
林间码客12 天前
sft·强化学习·grpo·agentic-rl
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”本章将深入探讨Agentic-RL(基于强化学习的智能体训练)这一让智能体实现“自主进化”的关键技术。从LLM训练的基础流程出发,解析监督微调(SFT)与群组相对策略优化(GRPO)的训练流程,对比PPO、DPO、GRPO、RLVR等核心算法的演进逻辑,并介绍HelloAgents框架中Agentic RL的四层架构设计与GSM8K数学推理数据集上的训练实践,帮助读者理解如何通过强化学习让智能体学会推理与工具使用。
XLYcmy12 天前
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
小红书 算法一面 四SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
XLYcmy14 天前
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制
小红书 算法一面 三# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
XLYcmy14 天前
llm·sft·memory·多模态·位置编码·grpo·视觉数据
小红书 算法一面 二### 二、视觉数据Memory设计核心解析视觉数据的核心特征是**空间结构化(图像是2D网格)、时序动态性(视频是3D时空)、高维度(像素/patch特征维度高)**,这和NLP的一维序列数据有本质区别。因此视觉memory的设计核心是:**在保留时空结构的前提下,高效存储、检索和复用多粒度视觉特征,平衡存储容量、检索效率和任务效果**。
thesky12345622 天前
大模型·sft·rlhf·ppo·dpo·面试准备·后训练
27届大模型面试准备(十六):后训练全攻略——SFT、RLHF、DPO、PPO 一次讲透上一篇《高效推理全攻略》讲的是"怎么让模型推理又快又省",属于部署侧。这一篇回到训练侧,把"预训练之后的所有事"——也就是后训练(Post-Training)——一次性讲透。覆盖 SFT、Reward Model、RLHF(PPO)、DPO 四条主线,外加一条工程副线(数据配方、课程学习、拒绝采样)。每节都给:原理 → 数学/算法骨架 → 代码片段 → 面试速答 + 高频追问。配合《LoRA/PEFT》(候选 A18)一起看,刚好串成"对齐怎么做、怎么省显存做"。
夫唯不争,故无尤也3 个月前
sft·蒸馏·dpo·deepseek
从DeepSeek-R1-Distill中学习蒸馏技术前言:deepseek中蒸馏主要通过强的teacher模型构建高质量推理数据集对参数模型进行SFT,随后再加上DPO加强模型偏好,约束模型输出格式,最后可以通过RL加强模型推理能力。
qcx233 个月前
人工智能·llm·sft·预训练·奖励模型·对齐·路线
【系统学AI】03 LLM训练全流程:预训练→SFT→对齐五条路线一个LLM从"一堆随机参数"变成"ChatGPT那样能用",要经过三个阶段。这篇文章把三步全部讲透——前两步定义清楚、流程画清楚、成本算清楚,重点拆解第三步(对齐训练)在2026年已经分化出的5条路线。
TGITCIC3 个月前
微调·sft·llama·模型训练·训练·大模型训练·llama-factory
大模型训练师的炼丹之道 (1)-最新版llama-factory环境搭建和全排错在人工智能的演进图谱中,大模型训练始终占据着技术金字塔的顶端。它不仅是AI Agent开发的上层建筑,更是当Agent应用发展到一定深度后,不可避免必须跨越的技术鸿沟。唯有掌握底层模型的塑造能力,才能真正突破通用能力的天花板。
zhangfeng11334 个月前
人工智能·lora·sft
带有embeding 同时训练的Lora 权重合并,合并后的权重的模型,再训练数的Loss 突然增加
阿杰学AI5 个月前
人工智能·深度学习·ai·语言模型·aigc·sft·监督微调
AI核心知识119—大语言模型之 监督微调 (简洁且通俗易懂版)监督微调 (Supervised Fine-Tuning, 简称 SFT) 是把大语言模型从一个“野生学霸” 变成“全能助理” 的第一道关键工序。
爱听歌的周童鞋6 个月前
llm·sft·math·assignment·cs336·expertiteration
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Assignment 5: SFT Implement在上篇文章 斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Assignment 5: SFT 中,我们已经了解了 SFT 的作业要求,下面我们就一起来看看这些作业该如何实现,本篇文章记录 CS336 作业 Assignment 5: Alignment 中的 SFT 实现,仅供自己参考😄
索木木8 个月前
大模型·sft·强化学习·思维链
强化学习与思维链一. 强化学习1.SFT与强化学习2.RM(奖励模型)ORM(结果奖励):标注困难,成本高PRM(过程奖励): 简单, 但存在结果对, 过程错的情况。
leo03089 个月前
llm·sft·huggingface·trl
【LLM微调】拒绝“假装聪明”:SFTTrainer 中 completion_only_loss 新旧版本用法详解在指令微调(SFT)大模型时,你是否遇到过:训练 Loss 迅速降到 0.0x,准确率飙升到 99%,但模型实际推理效果却很差?
赋范大模型技术社区9 个月前
大模型·微调·sft·模型训练·rl
大模型训练的“最后一公里”:为什么强化学习(RL)不可或缺?训练一个出色的大语言模型(LLM),如同培养一个孩子从呱呱坠地到成长为社会精英,需要经历循序渐进的几个核心阶段。我们可以将其类比为一个人的成长历程:
沛沛老爹10 个月前
人工智能·llm·sft·raft·rag
AI入门知识之RAFT方法:基于微调的RAG优化技术详解图片来源网络RAFT(Retrieval-Augmented Fine-Tuning,检索增强微调)是一种结合检索增强生成(RAG)与监督微调(SFT)的新型训练方法,旨在提升大型语言模型(LLM)在特定领域RAG任务中的性能。其核心目标是通过模拟“不完美检索环境”(即训练数据中包含相关文档与干扰文档),让模型学会识别并利用有效文档,同时忽略无关干扰,从而在真实RAG场景中生成更准确、可靠的答案。
安如衫10 个月前
人工智能·llm·sft·后训练·deepseek
【学习笔记更新中】Deeplearning.AI 大语言模型后训练:微调与强化学习导论在构建LLM Agent应用的征程中,我们都可能遇到过这样的困境:尽管尝试了精妙的提示词工程(Prompt Engineering)、更换了更强大的模型提供商,甚至将复杂任务进行了拆解,但LLM组件就是不“work”。
万事可爱^1 年前
运维·服务器·llm·sft·llama·模型微调·ai agent
如何在云服务器上使用LLaMA Factory框架微调模型LLaMA Factory是一款开源低代码大模型微调框架,集成了业界广泛使用的微调技术,支持通过Web UI界面零代码微调大模型。本文以DeepSeek-R1-Distill-Qwen-14B模型为例,介绍如何使用云平台(这里以阿里云平台为例,其他平台区别不大)及LLaMA Factory训练框架,完成模型的中文化微调和评估,以及为评估后的合并和本地模型注册ollama的方法。
大熊猫侯佩1 年前
人工智能·sft·ai 大模型·apple 本地大模型·foundationmodel·苹果智能·applebot
苹果 AI 探秘:代号 “AFM” —— “温柔的反叛者”锡安指挥中心的全息投影闪烁着幽蓝光芒,凯 —— 尼奥消失后新一代 “接口者”,指尖还沾着刚从矩阵抽离时残留的代码微光。