M2 运行 llamafile

安装llamafile很简单,进入官网,按照步骤安装运行即可。

https://github.com/Mozilla-Ocho/llamafile

  1. 下载 llava-v1.5-7b-q4.llamafile
  2. 赋予运行权限chmod +x llava-v1.5-7b-q4.llamafile
  3. 运行 ./llava-v1.5-7b-q4.llamafile -ngl 9999

    速度确实是比 ollama 快,ollama 用 qwen 1.5 7B 的模型。llamafile运行的是LLaVA 1.5,也是 7B 模型。下次试试能不能把 qwen 模型接入。

运行时遇到了一个问题

the cpu feature AVX was required at build time but isn't available on this system,解决这个问题,首先用 arm64 的 shell,然后用 root 启动 llamafile。

复制代码
arch -arm64 sh
su
./llava-v1.5-7b-q4.llamafile -ngl 9999
相关推荐
weipt10 小时前
从ollama到llama.cpp
linux·服务器·llama
wulitoud2 天前
把 Claude、Codex、Gemini 的引擎换成本地模型:免费、离线、数据不出本机
人工智能·llama·claude·本地模型
goodlook01233 天前
LLaMa factory 大模型高效微调(三)
llama
福大大架构师每日一题5 天前
ollama v0.32.14正式发布:WebP 自动转码、Qwen 系统消息兼容升级与 llama.cpp、MLX 更新全解析
android·java·llama
zyl837215 天前
LLaMA‑Factory 使用条件 + 学习手册
llama
刻BITTER5 天前
让 Intel NPU 跑AI 大模型?一次 llama.cpp OpenVINO 后端的完整实测
人工智能·llama·openvino
微软技术分享5 天前
Windows 环境下 llama.cpp 编译运行指南
windows·llama
zhy295636 天前
【DNN】Llama 3.2 1B模型LORA微调与QAIRT部署
人工智能·dnn·llama
Flynt6 天前
花一下午把Qwen3.8-27B跑在本地,最坑的不是显存
开源·llm·llama
uncle_ll7 天前
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调
llm·nlp·llama·ollama·大模型微调