LangChain 概述

1.为什么需要 Langchain?

1.1 从传统应用到智能体时代

PC 时代是网页 ,移动时代是App ,AI 时代是智能应用 / 智能体 Agent ,而 LangChain 就是用来开发 AI 智能应用的工具链

1.2 单一大语言模型的局限性

直接调用一个大模型,它很聪明,但有三个天生的短板:

  • 知识受限于训练数据: 大模型的知识截止于训练数据的时间点,无法获取当下最新数据。比如:你问它昨天的新闻、公司最新的财报,它不知道 ------ 因为它被关在训练那一刻的 "时间胶囊" 里。
  • 无法直接与外部系统交互: 无法主动查询数据库,调用API,读取数据库,访问互联网和外部应用,只能输出文字。像一个被关在玻璃罩里的聪明人 ------ 看得见,摸不着。
  • 不具备状态保持能力: 不具备上下文记忆的能力

LangChain 存在的意义,就是:给这个 "聪明但受限" 的大模型装上三样东西:外接知识库(RAG)、动手的工具(Tools/Agent)、以及上下文记忆(Memory)

1.3 LangChain框架定位

LangChain定位: LangChain 作为大模型和应用层之间的中间层开发框架,解决原生 LLM 知识、交互、记忆三大短板

核心定位有3点:

  • 打通大模型与外部资源:统一接口对接数据库、检索引擎、API、文件系统等(解决知识问题)
  • 封装底层复杂逻辑:抽象工具调用、记忆等能力,降低智能体开发难度(解决交互,记忆问题)
  • 支撑多智能体协作:依托 LangGraph 等生态,从单智能体拓展至多智能体协作,可构建工业 级智能体

1.4 LangChain应用场景

围绕"补知识、接工具、加记忆" 三大能力,LangChain 已经形成了六大成熟应用场景:

1.RAG 检索增强生成

痛点:解决大模型知识滞后和幻觉问题

功能检索外部知识库(文档/数据库)并向量化,让模型基于最新、最相关的资料回答

应用:构建企业知识库并将其接入大模型,让 AI 基于知识库内容回答问题,不再胡说八道,也不用每次更新知识就重新训练模型

2.Agent 智能体

痛点解决 LLM 无法直接执行复杂任务的问题

功能 : 将模型作为"推理引擎",自主规划路径并动态调用外部工具, 实现复杂任务

应用:让大模型自己思考下一步该做什么、调用哪个工具 ------ 比如你说 "帮我订明天去北京的机票",Agent 会自动查航班、比对价格、完成预订,而不是只给你一段文字建议

3.对话系统和聊天机器人

痛点解决多轮对话中的"记忆"流失问题

功能集成记忆管理系统,记住用户偏好和历史交互,并结合私有数据(如教育教材、订单库)提供专业服务

应用:给聊天机器人加上记忆和业务数据对接能力,做到多轮对话上下文不断线,还能查订单、查教材,变成真正能用的客服 / 助手

4.多模态应用

痛点跨越单一文本交互的限制

功能融合图像识别、语音转文字等技术,让模型具备处理音视频和图片的综合推理能力

应用:图片识别、语音转写、文字处理、语音合成一条龙,做能看能听能说的 AI 应用

5.内容自动生成

痛点解决生成内容格式不标准、质量不稳定的问题

功能配合提示词模板(Templates)与输出解析器(Parsers),自动产出规范的报告、合同或 邮件

应用:从业务系统取数据,套模板自动输出法律文书、周报、合同,解决大模型输出格式不稳定的问题

6.数据连接与处理

痛点解决非结构化数据难以被模型直接利用的问题

功能 : 强大的数据连接能力使大模型能够与各种数据源和结构化数据交互。比如,从 PDF、Excel 中提取关键信息,或实现自然语言与 SQL 的自动转换

应用:读 PDF、读 Excel、自动写 SQL 查数据库、生成可视化报告 ------ 把大模型变成一个能直接操作企业数据的分析师

1.5 大模型相关岗位

AI 大模型完整技术栈分为 5 层,本专栏 LangChain 开发聚焦最上层「应用与 Agent 层」,对应岗位:大模型与 Agent 应用开发工程师

1. 算力与 Infra 基础设施层

内容:GPU/NPU 算力集群、K8s、Docker、Dify 部署等底层平台

对应岗位大模型运维、Infra 工程师

职责:负责硬件资源调度、容器化、模型服务部署,保障模型稳定运行

2. 数据治理层

内容:结构化 / 非结构化数据、数据清洗、标注、数据接口

对应岗位数据开发 / 清洗工程师

职责:采集、清洗、标注高质量数据,是大模型训练、RAG 知识库的原料来源

3. Model Foundation 通用基座大模型层

内容:文心一言、通义千问、ChatGPT、豆包等通用基础大模型;Ollama、LocalAI 本地推理引擎

对应岗位大模型基座开发 / 优化工程师

职责:基座模型预训练、推理加速、底层模型能力优化。

4. 行业 / 多模态层

内容:面向制造、医疗、金融、电商的行业大模型;文本、图像、音视频多模态模型

对应岗位大模型微调 / 算法工程师

职责:基于通用基座做行业微调,开发多模态能力,让模型适配垂直领域。

5. 应用与(Agent)层

内容:B 端(智能制造、智能客服)、C 端(AI 问答、文生图)、G 端(城市大脑)业务; Agent 编排:LangChain、LangGraph、多智能体 Multi-Agent 系统; 典型 Agent:代码助手、工作流自动化、简历筛选助手

对应岗位大模型与 Agent 应用开发工程师

  • C端应用:面向普通个人消费者;比如:AI问答,文生图/文生视频,AI翻译,个人简历助手等应用
  • B端应用:面向企业,组织,解决企业业务效率问题;比如:电商平台的AI客服,工厂里的AI助手,企业内部文档助手
  • G端应用:面向政府机构,解决政务效率问题;比如:城市大脑,智慧交通,在线业务

2.LangChain 是什么?

2.1 LangChain 发展时间线

第1阶段:诞生(2022年10月)

创始人:哈佛大学的机器学习项目工程师 哈里森·蔡斯

  • 项目在 ChatGPT 发布前一个月开源;名称来自 **Language(语言模型) + Chain(链式连接),**核心思想:把大模型和外部数据、工具连接起来
  • 最初只有两大基础组件:LLM 抽象层 + Chain 链式调用
  • 初期只是个人开源小项目,关注度很低

第2阶段:爆发增长期(2022 年底 --- 2023 全年)

  • GitHub Star 快速飙升,也就是图里曲线陡峭上升的一段
  • 陆续完善核心模块:Prompt 模板、Memory 记忆、Tool 工具调用、RAG 检索增强、Agent 智能体
  • 推出 LangSmith(调试 / 观测平台)、LangHub 提示词仓库,生态快速扩大;2023 年 4 月完成融资,公司化运营
  • 大量开发者用 LangChain 开发知识库问答、企业 AI 助手

第3阶段:架构重构期(2024 年初)

  • 发布 v0.1.0,重大架构拆分:拆出 langchain-core 核心包、langchain-community 社区组件包;推出 LCEL LangChain 表达式语言,支持声明式链式编写
  • 正式发布 LangGraph:从简单线性 Chain,升级为支持循环、分支、状态持久化的图式工作流,专门用来开发复杂 Agent、多智能体系统
  • 推出 LangServe,方便把 LangChain 应用快速部署成 API 服务

第4阶段:Agent 成熟生态期(2024 下半年~至今)

  • 正式推出 Deep Agent ,官方定位为 Agent Harness(智能体执行框架) ,在LangGraph 和 LangChain 之上运行,标志着LangChain 生态进入新阶段,让开发者可构建基于多智能体的复杂化智能 体系统
  • 框架稳定性持续提升,成为企业落地 RAG、Agent 应用的主流开发框架
  • GitHub Star 持续稳步上涨,就是图右侧平缓向上的曲线

2.2 Langchain v1.2主要模块

LangChain 2024 架构拆分:core 为轻量核心,社区 / OpenAI 等供应商包独立维护,langgraph 负责 Agent 编排,classic 向后兼容旧版代码。

  • langchain-core :官方推荐的核心API;比如 Runnable, BaseMessage等
  • langchain-classic :冗余代码移或不推荐使用的经典API移到此;比如0.x中常用而1.x移除的API都 在这里
  • langchain-community :第三方集成,比如:合作伙伴包 langchain-openai,langchain anthropic等,按需安装、避免臃肿
  • langgraph:深度整合 LangGraph 1.0,协调多个Chain,Agent,Tools完成更复杂的任务,并 且还支持循环调用,是langchain图形化的增强版

想要关注更多API可访问官方文档: LangChain - Python API Reference | LangChain Reference

2.3 API文档

官网: LangChain: the open agent platform to own your intelligence

Github地址: LangChain

中文文档地址: LangChain 概述 - LangChain 文档 - LangChain 教程

英文文档地址: LangChain overview - Docs by LangChain

API文档查询地址: langchain | LangChain Reference

3.LangChain 家族四大支柱

截至2025年11月,LangChain 已从一个独立的开发框架,成长为一个覆盖智能体系统全生命周期的技术生态。该生态由四大核心支柱构成: LangChain 、 LangGraph 、 Deep Agent 与LangSmith

1. 基础能力层(LangChain)

积木化基础组件:大模型连接、工具调用、数据加载、向量库、提示词模板等

作用:给上层提供最基础能力单元,是 RAG、简单链式应用的基石

2. 运行时编排层(LangGraph)

负责状态管理、分支判断、循环流程、多智能体协作; 区别于旧版线性 Chain:不再是单向顺序执行,可以让 Agent 反复思考、循环调用工具,适合复杂任务

3. 智能体抽象层(Deep Agent)

更高阶封装,核心能力:复杂任务拆解、自主决策; 接收用户的大目标,自动拆成多个子任务,自主判断下一步动作,是 Agent "思考" 的顶层抽象

4. 监控与评估层(LangSmith)

项目上线后的观测平台,能力:应用监控、性能评估、问题调试;可以追踪每一轮大模型调用日志、查看输入输出、评估回答质量,定位幻觉、调用失败等问题,持续迭代优化应用

上三层框架不是竞争关系,并非互斥,复杂项目完全可以同时应用到这三层

4.大模型应用场景介绍

大模型应用技术特点:门槛低,天花板高

4.1 RAG开发

4.1.1 背景

大模型的知识受限于训练数据:随着 LLM 规模扩大,训练成本与周期相应增加,模型无法实时学习到最新的信息或动态变化;导致 LLM 难以应对诸如"请推荐现在的热门影片"等时间敏感的问题。

大模型幻觉:涉及到大模型从未在训练过程中学习过的信息时,大模型无法给出准确的答复,转而开始臆想和编造答案

4.1.2 何为RAG?

RAG :Retrieval-Augmented Generation(检索增强生成

RAG操作过程:

图1:

检索-增强-生成过程:检索可以理解为第10步,增强理解为第13步(这里的提示词包含检索到的数 据),生成理解为第15步

图2:

这些过程中的难点:文件解析,文件切割,知识检索,知识重排序

  • 文件解析:如果是pdf,内部包含文件、图片、表格,图片上还有文字,需要处理。
  • 文件切割:没有固定的格式
  • 知识重排序:在 RAG 应用中,随着文档数量增加,召回准确率会下降;引入reranker(重排器)可对初步召回的较多 chunk(如 top 20 或 top 50)进行精排,提高召回准确率,防止LLM 处理无关信息,减少时间和成本。此外,与基于基本矢量搜索的 RAG 相比,reranker 增强型 RAG 的成本更高,但与仅依靠LLM 生成答案相比,它的成本低些

reranker使用场景:

适合 :追求回答高精度和高相关性的场景中特别适合使用 Reranker,例如专业知识库或者客服

不适合 :引入 reranker 会增加召回时间,增加检索延迟。服务对响应时间要求高时,使用 reranker可能不合适

4.2 Agent开发

Agent 智能体:充分利用 LLM 的推理决策能力,通过增加规划、记忆和工具调用的能力,构造一个能够独立思考、逐步完成给定目标的 Agent(智能体)

现代 Agent 架构:

一个数学公式来表示:Agent = LLM + Planning + Tools + Memory + Action

Agent 核心要素被细化为以下模块:

  • LLM大语言模型 :提供推理、规划和知识理解能力,是AI Agent的决策中枢
  • 规划决策Planning :**通过任务分解、反思与自省框架实现复杂任务处理;**例如,利用思维链 (Chain of Thought)将目标拆解为子任务,并通过反馈优化策略
  • 工具使用Tools调用外部工具(如API、数据库)扩展能力边界
  • 记忆Memory
    • 短期记忆存储单次对话周期的上下文信息,属于临时信息存储机制;受限于模型的上下文窗口长度
    • 长期记忆可以横跨多个会话或时间周期,可存储并调用核心知识,非即时任务。比如,关于用户的偏好,过去执行过的指令等
  • 行动Action ::实际执行决策的模块,涵盖软件接口操作(如自动订票)和物理交互(如机器人执行搬运);比如:检索、推理、编程等。

4.3 大模型应用开发的4个场景

4.3.1 场景1:纯 Prompt

  • Prompt是操作大模型的唯一接口
  • 当人看:你说一句,ta回一句,你再说一句,ta再回一句..

4.3.2 场景2:Agent + Function Calling(函数调用)

  • Agent:AI 主动提要求
  • Function Calling:需要对接外部系统时,AI 要求执行某个函数
  • 当人看:你问 ta「我明天去杭州出差,要带伞吗?」,ta 让你先看天气预报,你看了告诉ta,ta 再告诉你要不要带伞

4.3.3 场景3:RAG

RAG:需要补充领域知识时使用

  • Embeddings:把文字转换为更易于相似度计算的编码;这种编码叫向量
  • 向量数据库:把向量存起来,方便查找向量
  • 搜索:根据输入向量,找到最相似的向量

举例:考试答题时,到书上找相关内容,再结合题目组成答案

4.3.4 场景4:Fine-tuning(微调)

微调 :在预训练大模型基础上,用自己的标注数据继续训练,修改模型内部参数,把知识 / 风格内化进模型本身

举例:努力学习考试内容,长期记住,活学活用

特点:成本最高;通常在上述场景解决不了问题的情况下,再使用

4.4 如何选择相关技术?

面对一个需求,如何开始,如何选择技术方案?以下是常用思路:

相关推荐
专业程序开发源1 小时前
springbootLivehouse票务系统-计算机课程设计、毕业设计
vue.js·spring boot·后端·python·django·课程设计·pygame
李高钢1 小时前
Python Django 框架入门:从零搭建你的第一个 Web 应用
前端·python·django
2601_966949651 小时前
从轮询到策略消费:量化系统如何高效处理五档盘口数据
开发语言·python·数据分析·pandas·量化交易·股票数据·quantdash
玉宇夕落1 小时前
llm模块二 结构化输出 LangChain 结构化输出完全指南:从 JSON 解析到 withStructuredOutput
langchain·llm
萧鼎1 小时前
2026实战:用 accelerate 库加速 PyTorch 训练,核心语法与避坑指南
python·开源·教程·python库·accelerate
我命由我123452 小时前
人脸识别 - 去重时间窗口
java·开发语言·python·学习·java-ee·学习方法·python3.11
王志来137944730082 小时前
安防监控工控工业服务器配套
运维·服务器·python
投票竞赛2 小时前
作品投票版权注意事项,线上评选上传图片视频须知
python·音视频
2601_962293532 小时前
人工智能 & 神经网络完整入门路线(零基础可走,分阶段)
人工智能·python·深度学习·神经网络·机器学习