大模型应用技术实践

lyshark8 天前
大模型应用技术实践
MysticMirror 自研大模型全维度自动化测试套件(42 项用例)本文档为 MysticMirror 自研大模型的全覆盖自动化回归测试套件,整合原有 22 项基础回归测试与 20 项新增边界能力测试,共计 42 个测试用例。全面覆盖模型配置校验、RoPE 位置编码(原生 / YaRN 缩放 / 长序列外推)、注意力掩码、KV 缓存两种格式兼容性、混合精度训练、权重绑定、MoE 混合专家机制、训练梯度与损失收敛、解码策略、采样参数校验、输入合法性校验、流式生成、模型保存加载、dropout 与隐层输出、多终止符生成、异常报错分支等核心模块。可完整验证模型前向推理、训练流程
lyshark8 天前
大模型应用技术实践
LangGraph 基于状态图构建工作流入门传统LangChain是LLM应用的组件工具箱,以Chain与Runnable为核心抽象,提供提示词模板、文档处理、向量检索、工具调用、记忆能力等标准化组件,目的是快速构建简单线性的LLM任务。而LangGraph是面向复杂场景的状态图编排运行时,专注于有状态、可动态迭代的智能体工作流精细管控。它基于节点、边与全局状态三大原语,并支持带环拓扑结构,能够高效适配智能体自主决策、循环迭代的复杂生产级业务场景。
lyshark12 天前
大模型应用技术实践
基于 LlamaIndex+PostgreSQL 实现RAG持久化前文《基于 LlamaIndex 实现 RAG 向量检索入门》已完成本地大模型与 Embedding 向量检索的基础搭建,但仅支持临时向量存储,无法持久化复用。本文将在此基础上实现 RAG 持久化存储方案,借助 PostgreSQL + pgvector 向量插件对接 LlamaIndex。环境采用 CentOS Stream 10,演示数据库编译安装与插件配置,基于 VectorStoreRetriever 实现持久化向量检索,搭建可稳定复用的本地 RAG 服务。
lyshark13 天前
大模型应用技术实践
基于 LlamaIndex 实现RAG向量检索入门本章将通过多个案例实现私有数据集检索功能,虽然 LangChain 也可以实现向量检索,但在企业级项目中,通常会选用 LlamaIndex 这类专门面向检索场景的框架。LlamaIndex 是 MIT 协议开源、以 RAG 为核心的大模型应用开发框架。它充当大模型与私有数据之间的中间层,能够接入 PDF、Word 等各类本地或内网文档,对原始数据构建索引,以此解决大模型无法读取私有资料、容易产生幻觉的问题,可用于搭建知识问答、AI 智能体等应用。
lyshark15 天前
大模型应用技术实践
基于魔搭 MS-Swift 实现大模型微调落地指南在大模型二次开发学习阶段,手写训练代码可以帮助我们吃透模型微调底层逻辑,做到知其然更知其所以然。但落地到企业生产环境,我们更追求标准化流程、高复用能力与稳定可靠的工程化方案。MS-Swift 作为阿里达摩院魔搭社区开源的一站式大模型开发框架,集成了模型训练、微调、推理、量化部署全链路能力,兼容数百款大主流模型与多种微调、对齐算法。本章我们就借助 MS-Swift 这类成熟工具,学习如何用标准化流程快速完成大模型二次训练,实现快速将模型能力深度集成进企业业务系统。
lyshark18 天前
大模型应用技术实践
基于 HuggingFace Tokenizers 训练自定义分词器在大模型开发流程中,分词器(Tokenizers)是文本预处理的核心组件。神经网络无法直接理解人类的原始文本,分词器的核心作用,就是将自然语言转换为模型可用于计算的数值序列。Hugging Face Tokenizers 是底层由 Rust 编写的高性能开源分词库,原生支持 BPE、WordPiece、Unigram 等多种分词算法,内置批量处理、padding、truncate 等能力,可适配绝大多数开源大模型。本文将编写分词器训练脚本,基于高质量语料,参考 Qwen3 分词器的设计思路,从零训练一套自
lyshark19 天前
大模型应用技术实践
基于 vLLM+Nginx 构建负载均衡推理集群企业内部私有环境部署大模型推理集群时,很容易遇到流量调度混乱、节点负载失衡、会话上下文丢失、接口缺少鉴权防护等一系列问题,单 vLLM 推理节点难以支撑并发请求。本文基于 Ubuntu 22.04 系统环境,搭建 Nginx + vLLM-Semantic-Router + vLLM-Router + vLLM Node 多层推理集群。全文从环境准备、模型拉取、组件分步部署、Nginx SSE 流式反向代理,一直到接口联调验证,完整记录一套可直接复现的落地方案。
lyshark20 天前
大模型应用技术实践
LLama-Factory 实现大模型LoRA-SFT微调指南LLaMA Factory 是一款开源、低代码、一站式大语言与多模态模型微调框架,用于降低大模型的微调落地门槛。框架兼容 Qwen、LLaMA、ChatGLM、LLaVA 等上百款主流开源模型,支持增量预训练、SFT 监督微调、DPO、KTO、ORPO 等多种训练对齐方案,原生集成 LoRA、QLoRA 量化微调技术,可在消费级显卡完成轻量级模型微调。框架支持可视化网页端和命令行双操作模式,完整覆盖模型训练、评估、权重合并、推理部署全流程,适配科研实验、行业轻量化模型定制等场景。
lyshark22 天前
大模型应用技术实践
千问大模型完整RLHF全参数微调指南大模型微调是实现模型领域定制的核心方案,本文承接《千问大模型二次 LoRA‑SFT 指令微调指南》部分内容,聚焦 Qwen3.5‑Base 纯文本基座全参数微调,完整复现 ChatGPT 风格 RLHF 对齐工程链路,覆盖数据预处理、SFT 监督微调、RM 奖励模型训练、PPO 强化学习、DPO 直接偏好优化全实验流程,提供可直接运行的工程脚本,帮助开发者完成千问小模型的垂直领域轻量化定制,为后续模型推理、业务上线部署提供完整实践参考。
lyshark23 天前
大模型应用技术实践
千问大模型二次LoRA‑SFT指令微调指南大模型微调是实现模型领域定制的核心方案。本文基于 Ubuntu 22.04 服务器环境,依托 NVIDIA RTX 家用高性能显卡,选用千问 Qwen3.5‑0.8B‑Instruct 指令模型,完整演示二次 LoRA‑SFT 微调全流程,包含环境搭建、模型选型、ChatML 数据集制作校验、LoRA 参数配置、SFT 训练、效果验证、权重合并,附带可直接运行的工程脚本,便于开发者快速实现千问模型轻量化定制与上线部署。
lyshark1 个月前
大模型应用技术实践
轻量化小模型MiniMind从训练到落地指南本文基于 Ubuntu 22.04 服务器环境,依托 NVIDIA RTX 家用高性能显卡,手把手讲解 MiniMind 轻量大语言模型从零搭建、数据集部署、全流程训练、可视化Web服务搭建及GGUF格式量化的完整实操方案。全程摒弃复杂高阶封装,基于原生 PyTorch 实现,适配个人开发者、人工智能入门学习者低成本完成大模型训练全链路的需求,整套方案仅需极低算力与成本,3小时即可完成基础对话训练,完美适配新手入门大模型训练、模型私有化部署、及底层原理学习等场景,是一套低成本、可落地、可复现全流程实战教程
lyshark1 个月前
大模型应用技术实践·linux 系统运维技术实践
Ubuntu 大模型HF转GGUF全流程实践指南本文基于 Ubuntu 26.04 系统、纯CPU无CUDA硬件环境,完整演示基于 llama.cpp 实现 HF 原始模型转换 GGUF 格式与CPU量化的落地实操流程。以 Qwen2-0.5B-Instruct 中文对话模型为案例,循序渐进讲解Swap分区配置、系统依赖安装、llama.cpp源码编译、Python虚拟环境部署、原生HF模型下载、HF模型转GGUF格式封装、Q4_K_M等级量化的完整步骤。
lyshark1 个月前
大模型应用技术实践
LangChain 消息流输出与结构化处理LangChain 是目前大模型应用开发领域最主流、最成熟的开源框架之一,广泛应用于私有化部署、智能体开发、工具调用、流式交互等各类场景。本文基于 LangChain 最新稳定版接口,适配本地私有化 GGUF 模型部署环境,拆解框架四大核心基础能力,标准化消息机制、闭环工具调用链路、多场景流式传输、规范化结构化输出功能,这四个功能是学习后续框架的基础部分,也是必须要熟练掌握的重点。
lyshark1 个月前
大模型应用技术实践
Python 原生封装 Llama.cpp 大模型推理接口本文以通义千问Qwen量化GGUF模型为案例,基于Llama.cpp框架展示本地大模型调用与功能开发的完整实现原理及流程。全文采用原生Python编写代码案例,无需依赖重型AI框架,依次实现模型元数据解析、本地接口单次对话调用、多轮对话持久化记忆、自定义工具调用拓展等功能实现逻辑,针对直接调用大模型上下文断裂、功能单一、拓展性不足等问题,通过轻量化对话记忆与工具解析执行框架完成优化实现,拆解本地对话交互运行原理,帮助开发者掌握大模型的基础调用原理。
lyshark1 个月前
大模型应用技术实践
LangGraph Server Agent 框架本地部署指南本文讲解基于 LangGraph Server 服务搭建本地离线 AI Agent 的完整部署流程,适配 Windows 开发环境,全程无需调用公有大模型接口,实现纯本地化 AI 推理与工作流编排,帮助开发者快速搭建可调试、可复用的本地私有化 AI Agent 服务,适用于个人开发、本地功能调试、轻量化私有化 AI 场景落地。
lyshark1 个月前
大模型应用技术实践
LangChain 实现AdvancedRAG增强向量检索生成Advanced‑RAG 是基于 Naive RAG 演化而来的高级检索增强生成方案,针对朴素RAG检索不准、上下文相关性差、召回噪声多等缺陷进行多层优化。该方案完全沿用朴素RAG的基础流水线模式、不改动核心架构,仅在各流程节点嵌入预处理、后处理增强模块,精细化优化检索环节。通过引入查询改写、重排序、上下文压缩、自我校验等多种增强策略,对召回的文档片段过滤去噪、重排优先级,精准筛选高价值上下文送入大模型,以此来提升提升知识库问答的精准度与稳定性,是目前工业级RAG落地的主流优化方案。
lyshark1 个月前
大模型应用技术实践
LangChain 实现NaiveRAG朴素向量检索生成向量检索增强生成(RAG,Retrieval‑Augmented Generation),是弥补大语言模型固有缺陷的关键技术。它可接入私有文档、内部笔记等外部数据源,有效缓解训练数据滞后、知识固化、回答幻觉等问题,输出更为精准可信的内容。Naive RAG 即朴素 RAG,是 RAG 体系中最基础原始的实现方式,也是各类进阶 RAG 技术的底层基石。该方案架构极简、落地门槛低,舍弃复杂优化手段,只保留检索加生成的核心能力。很适合新手学习实践,同时该方式也多用于搭建轻量化知识库问答服务,适配各类简单问答场景
lyshark1 个月前
大模型应用技术实践
LangGraph+PostgreSQL 会话记忆持久化存储本文基于LangGraph会话记忆管理相关内容,聚焦对话持久化存储方案,以LangChain官方推荐的PostgreSQL数据库为载体,拆解Checkpointer检查点存储与Store通用长期存储两大核心体系。通过对比两套存储机制的底层逻辑、差异特点与适用场景,结合可运行实战代码,实现会话重启续聊、跨线程记忆共享、语义检索、用户档案管理等核心能力,为LangGraph生产级智能体项目提供标准化持久化实现思路。
lyshark1 个月前
大模型应用技术实践
LangChain+FastMCP 搭建大模型工具调用服务为解决大模型外部工具调用、上下文传递标准不统一、适配混乱的痛点,本文基于 MCP 模型上下文协议,使用轻量化 FastMCP 构建 MCP 服务端,借助 langchain‑mcp‑adapters 完成与 LangChain 生态集成。文章介绍 Streamable HTTP 传输模式的适配场景,以天气查询作为实战案例,完成自定义工具、资源接口、提示词模板开发,并演示 LangChain 客户端加载工具、读取资源、解析提示词、多服务协同调用完整流程,附带可运行代码与依赖配置,提供一套轻量化标准化的大模型
我是有底线的