LocalAI、LocalAGI、LocalRecall

LocalAI

官网,Go+TypeScript等语言实现、开源(GitHub,48.8K Star,4.4K Fork)OpenAI替代方案,无需高端GPU,消费级硬件在本地环境中运行LLM,功能涵盖生成文本、音频、视频、图像,语音克隆等。

解决核心痛点:

  • 隐私焦虑:用ChatGPT这类云服务时,输入的敏感数据(比如公司文档、个人信息)会被上传,存在泄露风险。LocalAI让数据全程在本地处理,从根源上避免这个问题;
  • 成本高昂:云服务按调用次数收费,长期使用成本不低;
  • 依赖网络:离线就能运行,适合网络不稳定的场景;
  • 硬件门槛:能在普通CPU上运行轻量化模型,大大降低入门成本。

功能

  • OpenAI无缝兼容:API接口和OpenAI完全一致,基于OpenAI的代码、工具(如LangChain、Flowise),几乎不用修改就能直接对接LocalAI,迁移成本几乎为零;
  • 多模态全能:支持文本生成、图像生成(如Stable Diffusion)、语音转文字(基于whisper.cpp)、图像理解(如LLaVA)、目标检测(最新支持rf-detr模型)。
  • P2P分布式推理:多台设备可组成AI集群,共同分担模型运行压力。比如一台笔记本算力不够,可联合家里的其他设备一起处理,特别适合边缘计算场景;
  • 模型自由切换:支持从Hugging Face直接下载模型,兼容llama.cpp、vLLM、diffusers等多种后端框架。想换模型?改个配置文件就行,不用重新部署整个系统;
  • 轻量易部署:提供Docker镜像、二进制包、一键安装脚本等多种部署方式。

优点:

  • 隐私绝对可控:数据不离开本地,适合处理敏感信息;
  • 零成本试用:开源免费,硬件门槛低,普通电脑就能跑;
  • 高度兼容:无缝对接OpenAI生态,学习和迁移成本低;
  • 社区活跃:更新频繁,新模型支持快,问题解决及时。

缺点:

  • 性能上限有限:CPU运行大模型时,速度比云端GPU慢;
  • 配置有门槛:复杂场景(如P2P集群)需要一定技术储备;
  • 模型依赖社区:部分新模型的适配可能滞后于云服务。

架构

解读:

  • API层:Go实现,用户直接接触的部分,负责接收请求(如聊天、图像生成),解析参数,并转发给对应的后端。完全模拟OpenAI的API格式,确保兼容性。
  • 后端层:多语言混合,算力中心,整合多种语言的AI推理框架:
    • C++:llama.cpp(LLM推理)、whisper.cpp(语音处理)、stablediffusion.cpp(图像生成);
    • Python:部分模型依赖diffusers、transformers等库;
    • Go:部分轻量推理逻辑直接用Go实现,通过gRPC与API层通信,实现按需加载,用哪个模型就启动哪个后端,不浪费资源。
  • 模型层:存储各种预训练模型文件,支持从HuggingFace自动下载,也能手动导入本地模型。模型配置文件(如.yaml)定义模型参数、使用的后端等信息,让切换模型变得简单。

实战

Sad but true,官方对Windows支持不友好,GitHub Release页面并没有提供Windows二进制安装包,可考虑使用Docker部署方式:

bash 复制代码
curl https://localai.io/install.sh | sh
# 或
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest
# CPU
docker run -p 8080:8080 --name local-ai -ti localai/localai:latest-aio-cpu
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-12
# Jetson
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-nvidia-l4t-arm64

测试API

bash 复制代码
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{
	"model": "phi-2",
	"messages": [{"role": "user", "content": "你是谁"}]
}'

LocalAGI

开源(GitHub,2K Star,287 Fork)

复制代码
复制代码

LocalRecall

开源(GitHub,972 Star,120 Fork)

相关推荐
漂流瓶jz8 小时前
【AI】大模型本地部署与量化:Ollama、transformers、llama.cpp实践
人工智能·llm·ai编程
张彦峰ZYF12 小时前
MCP 从“能连工具”到“像 Web 一样部署”——无状态核心、扩展框架与企业级 Agent 基础设施的真正分水岭
人工智能·llm·agent·mcp
Darling噜啦啦14 小时前
LLM 记忆管理三剑客:截断、总结、检索,彻底搞懂 Agent 的 Memory 系统
langchain·llm·agent
今日无bug15 小时前
大模型的回答是怎么一个字一个字蹦出来的?前端流式输出解析
前端·llm·agent
桃西西呀19 小时前
《牛来》票房涨 1000 倍是真的吗?——2026暑期档 124 亿里的数学
人工智能·数据分析·llm
tachibana220 小时前
如何设计多 Agent 的协作与动态切换机制?
网络·人工智能·ai·大模型·llm·agent
程序员三明治21 小时前
【体验毛坯房】Deep Harness 入门教程
java·人工智能·后端·大模型·llm·deepseek·dsh
桃西西呀1 天前
AI 为什么一本正经地胡说八道?3 个底层原因 + 2 个防坑法
人工智能·llm·ai编程
阿黎梨梨1 天前
AI也有记忆?LangChain Memory 管理指南
langchain·node.js·llm