LocalAI
官网,Go+TypeScript等语言实现、开源(GitHub,48.8K Star,4.4K Fork)OpenAI替代方案,无需高端GPU,消费级硬件在本地环境中运行LLM,功能涵盖生成文本、音频、视频、图像,语音克隆等。
解决核心痛点:
- 隐私焦虑:用ChatGPT这类云服务时,输入的敏感数据(比如公司文档、个人信息)会被上传,存在泄露风险。LocalAI让数据全程在本地处理,从根源上避免这个问题;
- 成本高昂:云服务按调用次数收费,长期使用成本不低;
- 依赖网络:离线就能运行,适合网络不稳定的场景;
- 硬件门槛:能在普通CPU上运行轻量化模型,大大降低入门成本。
功能
- OpenAI无缝兼容:API接口和OpenAI完全一致,基于OpenAI的代码、工具(如LangChain、Flowise),几乎不用修改就能直接对接LocalAI,迁移成本几乎为零;
- 多模态全能:支持文本生成、图像生成(如Stable Diffusion)、语音转文字(基于
whisper.cpp)、图像理解(如LLaVA)、目标检测(最新支持rf-detr模型)。 - P2P分布式推理:多台设备可组成AI集群,共同分担模型运行压力。比如一台笔记本算力不够,可联合家里的其他设备一起处理,特别适合边缘计算场景;
- 模型自由切换:支持从Hugging Face直接下载模型,兼容
llama.cpp、vLLM、diffusers等多种后端框架。想换模型?改个配置文件就行,不用重新部署整个系统; - 轻量易部署:提供Docker镜像、二进制包、一键安装脚本等多种部署方式。
优点:
- 隐私绝对可控:数据不离开本地,适合处理敏感信息;
- 零成本试用:开源免费,硬件门槛低,普通电脑就能跑;
- 高度兼容:无缝对接OpenAI生态,学习和迁移成本低;
- 社区活跃:更新频繁,新模型支持快,问题解决及时。
缺点:
- 性能上限有限:CPU运行大模型时,速度比云端GPU慢;
- 配置有门槛:复杂场景(如P2P集群)需要一定技术储备;
- 模型依赖社区:部分新模型的适配可能滞后于云服务。
架构

解读:
- API层:Go实现,用户直接接触的部分,负责接收请求(如聊天、图像生成),解析参数,并转发给对应的后端。完全模拟OpenAI的API格式,确保兼容性。
- 后端层:多语言混合,算力中心,整合多种语言的AI推理框架:
- C++:
llama.cpp(LLM推理)、whisper.cpp(语音处理)、stablediffusion.cpp(图像生成); - Python:部分模型依赖diffusers、transformers等库;
- Go:部分轻量推理逻辑直接用Go实现,通过gRPC与API层通信,实现按需加载,用哪个模型就启动哪个后端,不浪费资源。
- C++:
- 模型层:存储各种预训练模型文件,支持从HuggingFace自动下载,也能手动导入本地模型。模型配置文件(如
.yaml)定义模型参数、使用的后端等信息,让切换模型变得简单。
实战
Sad but true,官方对Windows支持不友好,GitHub Release页面并没有提供Windows二进制安装包,可考虑使用Docker部署方式:
bash
curl https://localai.io/install.sh | sh
# 或
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest
# CPU
docker run -p 8080:8080 --name local-ai -ti localai/localai:latest-aio-cpu
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-12
# Jetson
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-nvidia-l4t-arm64
测试API
bash
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "phi-2",
"messages": [{"role": "user", "content": "你是谁"}]
}'
LocalAGI
开源(GitHub,2K Star,287 Fork)
LocalRecall
开源(GitHub,972 Star,120 Fork)