告别部署繁琐:LlamaPi 一键搭建本地 Agent 推理底座

告别部署繁琐:LlamaPi 一键搭建本地 Agent 推理底座

一、端侧大模型落地的三道门槛

端侧 AI 与本地 Agent 正在快速落地,各类端侧硬件的 NPU 推理算力也得到大幅提升。但不少开发者在实际落地时依旧要面对重重门槛,整个流程耗时长、上手门槛高,阻碍了端侧大模型与 Agent 项目的快速验证。

常见门槛 具体表现 LlamaPi 的对应能力
模型获取与转换 手动下载权重、反复调试模型转换、转换后精度受损 模型库一键下载,按平台提供已适配的模型格式
推理环境搭建 手写 NPU 推理代码、依赖冲突、硬件算力无法充分释放 单条命令拉起推理服务,运行时自动对接 NPU
长期运行与调度 部署不稳定、启停靠手工、重启后需重新加载 服务调度 + 持久化部署(开机自动加载)

LlamaPi 的思路是把复杂的部署流程封装简化,为开发者提供一套开箱即用的离线私有 Agent 推理底座。

二、一条命令跑起本地模型

以往端侧部署大模型,需要手动完成模型下载、格式转换、推理环境配置等一连串操作。LlamaPi 把这套流程收敛为单条命令:

bash 复制代码
# 以 Qwen3.5-4B 为例:自动拉取模型 + 启动本地推理服务
llamapi run qwen3.5-4b

执行命令后,LlamaPi 会自动把模型拉取至本地,并依托端侧 NPU 硬件加速,快速提供高性能的本地大模型推理服务。对于不希望使用命令行的用户,它还配套了桌面客户端应用,提供可视化图形界面,点选操作即可完成模型运行与对话交互,降低上手门槛。

三、整体架构:三层结构

分层 组件 说明
应用层 OpenCode / OpenClaw / Hermes Agent / 其他 OpenAI 兼容应用 通过 OpenAI 兼容 API 把推理请求发给 LlamaPi
兼容层 LlamaPi 推理服务 对内统一完成模型管理与服务调度,对外提供 OpenAI 兼容 API
硬件层 RK3588 / RK1828 / RK1820 等 NPU 硬件加速,按平台加载对应格式的模型

上层各类第三方应用通过 OpenAI 兼容 API 将推理请求发送给 LlamaPi;LlamaPi 对内统一完成模型管理、服务调度,把推理任务交付给设备的 NPU 完成加速计算,推理结果再原路返回给上层应用。

四、模型库管理:查询 / 下载 / 清理

在端侧开发过程中,往往会同时测试多款不同的大模型。LlamaPi 具备完整的模型管理能力,帮助开发者完成模型的查询、下载与清理,不必手动维护零散的权重文件。

命令 作用
llamapi list 列出本地已下载的所有模型
llamapi list --online 查看适配当前设备的全部可用模型,包含尚未下载的模型
llamapi pull <model_name> 下载指定模型至设备本地
llamapi rm <model_name> 从设备上删除指定模型

llamapi list --online 会同时给出模型对应的推理平台与体积,便于评估是否适配当前硬件:

实测设备上可用的模型清单如下(PLATFORM 列表示该条目对应的推理后端与芯片组合):

MODEL PLATFORM SIZE LOCAL
bge-m3 rknn2/rk3588 1.1 GB installed
gemma4:e4b rknn3/rk1828 -- not installed
gemma4:12b rknn3/rk1828 -- not installed
qwen3:0.6b rkllm/rk3588 -- not installed
qwen3:0.6b rknn3/rk1828 -- not installed
qwen3:1.7b rkllm/rk3588 -- not installed
qwen3:1.7b rknn3/rk1828 -- not installed
qwen3:4b rkllm/rk3588 -- not installed
qwen3:4b rknn3/rk1828 -- not installed
qwen3:8b rknn3/rk1828 -- not installed
qwen3-vl:4b rknn3/rk1828 -- not installed
qwen3.5:0.8b rkllm/rk3588 1.5 GB installed
qwen3.5:0.8b rknn3/rk1828 1.1 GB installed
qwen3.5:2b rkllm/rk3588 -- not installed
qwen3.5:2b rknn3/rk1828 -- not installed
qwen3.5:4b rkllm/rk3588 -- not installed
qwen3.5:4b rknn3/rk1828 3.9 GB installed
qwen3.5:9b rknn3/rk1828 -- not installed
qwen3.5:27b rknn3/rk1828 -- not installed
qwen3.8:27b rknn3/rk1828 16.8 GB installed

从清单可以看出两条典型路线:

平台 承载硬件 覆盖规模 适用场景
rkllm/rk3588 主控 NPU 0.6B ~ 4B 轻量对话、低功耗常驻任务
rknn2/rk3588 主控 NPU(v2 运行时) 向量/嵌入类模型 语义检索、知识库 embedding
rknn3/rk1828 M.2 NPU 加速卡 0.6B ~ 27B 大模型对话、多模态、代码 Agent

同一模型往往会在不同平台上分别提供条目,便于按实际硬件选择对应的版本。

五、服务调度:加载 / 卸载 / 开机自启

完成模型下载之后,还需要灵活管控模型的运行状态:包括加载启动、停止释放、查看当前正在运行的模型,或是配置设备开机自动加载模型。在桌面客户端中可以直接对已下载模型执行加载、卸载、设置开机自启,并直观查看当前运行状态。

客户端「部署管理」页面中的模型组信息如下(1 个运行中 · 共 4 个模型组):

模型组 ID MODEL TYPE PLATFORM STATUS 实例
qwen3.8:27b@rknn3-rk1828 qwen3.8:27b chat rknn3/rk1828 运行中 1
qwen3.5:4b@rknn3-rk1828 qwen3.5:4b chat rknn3/rk1828 未加载 --
qwen3.5:0.8b@rkllm-rk3588 qwen3.5:0.8b chat rkllm/rk3588 未加载 --
bge-m3@rknn2-rk3588 bge-m3 embedding rknn2/rk3588 未加载 --

命令行同样覆盖全部调度能力,适合快速调试与脚本化运维:

命令 作用
llamapi ps 查看设备上当前已经部署运行的模型状态
llamapi load <model_name> 加载并启动本地已下载的指定模型
llamapi unload <model_name> 卸载正在运行的模型,释放硬件资源
llamapi enable <model_name> 设置模型持久化部署,设备重启后自动加载该模型

llamapi ps 的输出包含模型 ID、MODEL、TYPE、PLATFORM、STATUS 与实例数,另有一列 ENABLE 表示是否已设为开机自启。上述实测中,27B 模型处于 active 状态、1 个实例;unload 后立即释放,随后可用 load 拉起另一个模型。

六、接入第三方应用:OpenAI 兼容 API

当模型在设备内部署完成后,LlamaPi 会自动输出 OpenAI 兼容 API,无需额外开发,就可以将本地端侧推理能力对接各类第三方 AI 应用,快速搭建完整的离线私有 AI 工作流。

配置项 填写内容
服务提供方 OpenAI 或 OpenAI-compatible
自定义服务地址(Base URL / API Endpoint) http://<设备 IP>:9265/v1
模型 ID 通过 llamapi ps 命令或客户端「部署管理」页查看

第三方应用配置流程:

步骤 操作
1 在第三方应用中选择 OpenAI 或 OpenAI-compatible 服务提供方
2 找到自定义服务地址(Base URL / API Endpoint)配置项,填入 http://<设备 IP>:9265/v1
3 填写对应的模型 ID,模型 ID 可通过 llamapi ps 命令或在客户端部署管理页面中查看
4 保存后即可在应用内调用本地模型,构建离线私有 AI 工作流

七、命令速查表

分类 命令 说明
快速启动 llamapi run <model> 拉取模型并直接运行
模型查询 llamapi list 列出本地已下载的模型
模型查询 llamapi list --online 查看当前设备全部可用模型
模型管理 llamapi pull <model> 下载指定模型
模型管理 llamapi rm <model> 删除指定模型
服务调度 llamapi ps 查看运行中的模型状态
服务调度 llamapi load <model> 加载并启动模型
服务调度 llamapi unload <model> 卸载模型、释放资源
持久化 llamapi enable <model> 设备重启后自动加载
应用接入 OpenAI 兼容 API http://<设备 IP>:9265/v1

八、小结

LlamaPi 把端侧大模型部署中「模型下载 → 格式转换 → NPU 推理 → 服务接口」这几段最耗时的流程做了封装:单条命令即可拉起本地推理服务;模型库与部署管理覆盖查询、下载、清理、加载、卸载与开机自启;对外通过 OpenAI 兼容 API 直接对接 OpenCode、OpenClaw、Hermes Agent 等第三方应用。对于需要离线、私有化、低门槛验证端侧大模型与本地 Agent 的场景,这是一条值得尝试的路径。

相关推荐
65岁退休Coder15 小时前
PI Agent 开发一个生产级 Harness
后端·node.js·agent
贾伟康15 小时前
【HarmonyOS 7新能力|026】Agent Framework Kit工程封装:把接入逻辑放进可维护的分层结构
agent·harmonyos·arkts·a2a·harmonyos 7
深蓝电商API16 小时前
MCP 与 AI Agent 如何改变爬虫开发模式?
爬虫·agent·mcp
星野云联AIoT技术洞察17 小时前
RK3588 边缘 AI 盒子适合什么工业视觉场景
计算机视觉·边缘计算·rk3588·语音识别·图像识别·边缘网关·边缘计算盒子
Ticnix17 小时前
多租户 RAG:让每个用户只检索到自己的知识库
后端·python·agent
青梅煮酒论英雄17 小时前
我们是怎么让 AI 找到那个 Bug 的
agent·ai编程·harness
Ticnix17 小时前
我删了 200 行 if-else,把决策逻辑全写进了 System Prompt
python·llm·agent
镜舟科技18 小时前
Semantic View 技术解析(二):业务口径如何进入数据库执行路径
数据库·sql·agent
wangruofeng18 小时前
开源看板 Multica:让人和 26 个 AI Agent 共用一个团队
aigc·agent·ai编程