大模型端侧部署

小饕8 天前
人工智能·机器人·大模型端侧部署
Jetson TensorRT vs RK3588 RKNN:两块板子都跑通了 LLM 和 VLM 之后,我悟了先交代背景:我手头有两块边缘设备,一块 NVIDIA Jetson Orin(8GB,GPU 路线),一块 Orange Pi 5 Plus(RK3588,16GB,NPU 路线)。过去一段时间我把 LLM 和 VLM 在两块板上各部署了一遍——Jetson 上用过 TensorRT、TensorRT-Edge-LLM、MLC-LLM、llama.cpp,RK3588 上用 rknn-llm 官方工具链跑通了文本和多模态。全部真实数据,全部亲自踩坑。
小饕15 天前
人工智能·llama·大模型端侧部署
llama.cpp 参数调优指南:Jetson 8GB 实战手记llama.cpp 参数调优指南:Jetson 8GB 实战手记 平台:Jetson Orin Nano Super 8GB(JetPack 6.2 / CUDA 12.6) 模型:Qwen2.5-3B Q4_K_M、Qwen2.5-VL-3B Q4_K_M + mmproj-f16 数据基准:全部真机实测(tegrastats + 自写 bench 脚本),未实测处明确标注 很多人用 llama.cpp 就是 ./llama-server -m model.gguf 一把梭,能用,但在 8GB 这种资源
小饕17 天前
机器人·大模型端侧部署
语音+大模型指挥机器人:LLM Agent × ROS2 端到端实战语音+大模型指挥机器人:LLM Agent × ROS2 端到端实战 你对着麦克风说"左转九十度",Gazebo 里的小车真的转了 90°; 你问"前面有障碍物吗",机器人用激光雷达的真实数据开口回答你。 全程离线,没有一个请求发到云端。这篇文章记录这个系统从零到闭环的完整实战。 一、这个系统长什么样 先看最终形态的数据流: 麦克风 ──▶ voice_input ──/voice_text──▶ llm_agent ──/robot_command──▶ robot_controller ──▶ Gaz
小饕18 天前
人工智能·大模型端侧部署
llama‑cpp边缘部署内存溢出(OOM)问题排查报告硬件平台:Jetson Orin Nano Super 8GB,CPU与GPU共用统一内存,内存资源有限。 推理服务:llama‑cpp 项目的 llama‑server HTTP推理服务,源码为最新版本本地编译。 测试模型:先后使用通义千问Qwen2.5‑1.5B‑Instruct纯文本大模型、Qwen2.5‑VL‑3B‑Instruct视觉‑语言多模态模型。
小饕1 个月前
人工智能·开源·大模型端侧部署
ONNX与国产AI芯片生态全解析:从格式标准到工具开源状态原创不易,如需转载请联系作者 作者:AI技术实践者 发布时间:2026-08-12在深度学习模型部署领域,ONNX (Open Neural Network Exchange) 已经成为事实上的行业标准格式。它解决了深度学习框架碎片化的问题,让"一次训练,多处部署"成为可能。
小饕1 个月前
人工智能·大模型端侧部署
Jetson 设备上部署 ONNX 模型的完整指南:从环境配置到生产级推理本文详细介绍了在 NVIDIA Jetson Orin 设备上部署深度学习模型的完整流程,涵盖环境搭建、模型转换、引擎生成、性能优化到生产部署的全过程。利用一个imageNet图片识别的模型部署为例, 通过实际测试数据,我们展示了 TensorRT 相比 ONNX Runtime 实现了 7-30倍 的性能提升。
我是有底线的