2.1 前端(用户交互界面)
作用:给用户提供输入、展示AI结果
- Web:Vue3 / React + TypeScript,UI库(Element Plus、Ant Design)
- 移动端:UniApp、React Native、Flutter
- 桌面端:Electron、Tauri
- 特殊交互:实时语音流、视频流、数字人画面渲染
2.2 后端 & 业务服务(核心调度层)
作用:接收前端请求、调用AI接口、业务校验、权限、数据库、Agent流程编排
- 语言&框架:
- Python:FastAPI、Flask(AI项目最常用,调试快)
- Go:Gin(高并发、推理接口网关,适合呼叫中心、实时音视频)
- Java:SpringBoot(传统企业系统对接)
- Node.js:Express/NestJS(前端人员快速全栈)
- 中间件:
- 消息队列:RabbitMQ、Redis、Kafka(异步任务,比如文档解析、批量推理)
- 数据库:MySQL/PostgreSQL(业务数据)、Redis(缓存上下文、会话)
2.3 AI能力接入层
1)公有API方案(低成本、快速落地,适合独立开发者)
直接调用厂商封装好的能力,不用自己跑大模型
- 大模型:DeepSeek、通义千问、文心一言、OpenAI等
- 语音:ASR语音转文字、TTS语音合成(适合呼叫中心、智能外呼)
- 视觉:OCR、图片理解、目标检测
2)开源模型私有化方案(数据不出内网,工业、政企场景)
- 大模型:Llama3、Qwen、GLM、DeepSeek 等
- 视觉:YOLO、SAM、LLaVA(图文理解)
- 语音:Whisper、FunASR
2.4 RAG / 向量知识库(智能问答必备)
做私有文档问答、知识库检索,解决大模型幻觉
- 向量数据库:Chroma、FAISS、Milvus、Qdrant、PGVector(Postgres向量扩展)
- 文档处理:LangChain、LlamaIndex
- 文档解析:PDF解析、Markdown、Word、PPT、切片(Chunk)、文本清洗
2.5 Agent智能体开发(自动执行任务)
让大模型调用工具、链式完成多步骤任务
- 框架:LangGraph、AutoGen、OpenManus
- 工具调用:函数调用(Function Call),对接外部API、数据库、脚本
2.6 模型推理 & 优化(私有化部署重点)
模型跑起来、降低显存、提速
- 推理框架:vLLM、TensorRT-LLM、Ollama(本地快速跑模型)
- 量化:GPTQ、AWQ、GGUF(减小模型显存占用,普通显卡也能跑)
2.7 部署、容器、监控
- 容器:Docker、K8s(Kubernetes,多模型服务编排)
- 反向代理/网关:Nginx、Traefik
- 监控:Prometheus + Grafana(看推理延迟、GPU占用、请求量)
- 日志:ELK / Loki,记录AI输入输出,用于评估幻觉、错误案例
2.8 配套工具(工程化)
- 提示词管理:Prompt版本管理平台
- 评测:Datasets、Ragas,测试问答准确率
- 实时音视频:WebRTC、RTMP(数字人、实时语音对话、视频质检)