oMLX 部署本地大模型

云端 Token 太贵?用 oMLX 本地部署大模型,构建你的私有 AI 推理服务

在 AI 应用开发中,越来越多工程师开始接入大模型能力(如 Copilot、AI 搜索、Agent 等)。但随着使用频率提升,一个现实问题逐渐暴露:

云端 AI Token 成本不可控,且存在网络依赖与数据隐私问题。

因此,本地化部署大模型(On-device LLM Inference)成为一个值得认真考虑的工程方向。


一、什么是 oMLX?

oMLX 是一个专为 Apple Silicon(M 系列芯片)设计的本地大模型推理服务器。

从工程角度来看,它的本质是: 一个运行在本地的 LLM Inference Server(模型推理服务层)

它提供三层能力:

1️⃣ 本地模型运行(替代云端推理)

  • 模型运行在你的 Mac 上(CPU / GPU / Neural Engine)
  • 不依赖远程 API
  • 无网络延迟、无调用费用

2️⃣ OpenAI 兼容 API

oMLX 会启动一个本地服务,例如:

复制代码
http://localhost:8000/v1

可以直接用现有代码调用:

复制代码
// 前端 / Node.js 直接复用 OpenAI SDK
const client = new OpenAI({
  baseURL: "http://localhost:8000/v1",
  apiKey: "none"
});

3️⃣ 针对 Mac 的深度优化

oMLX 并不是简单封装,而是专门针对 Apple 芯片做了优化:

  • MLX 推理加速(Apple 官方 ML 框架)
  • 内存/显存调度优化
  • KV Cache 管理(性能关键)

注意:

使用 oMLX(https://github.com/jundot/omlx/blob/main/README.zh.md)部署,仅支持M 系列芯片的Mac。

Windows 用户,请改为 Ollama(https://github.com/ollama/ollama)或 LM Studio(https://github.com/lmstudio-ai/lms)。


二、安装与启动 oMLX

直接在下载页(https://github.com/jundot/omlx/releases),找到最新正式版本。(为了稳定起见,请不要找标注 dev 的版本。)

点击 Assets,根据操作系统版本下载,然后直接安装:

下载完成后安装并直接运行:

端口和其他配置保持默认,自定义 API Key,点击启动服务(Start Sever),再点击打开管理面板(Open admin Panel & Close)。


三、安装模型

管理面板打开后,接着安装模型。在顶部菜单,点击「模型」-「下载器」。页面打开后,点击魔塔社区。

点击「模型下载器」旁边的设置按钮,修改镜像为 https://hf-mirror.com,点击「保存」按钮。

切换回HuggingFace:搜索Qwen3.5-9B-MLX-4bit模型,这个模型的性能对于一些常规需求已经非常足够了。运行起来占用大概 6G 左右内存。找到后,点击「下载」按钮。

等待下载完成后会自动安装,在「设置」-「模型设置」中可以看到已安装的模型:

点击最右边设置按钮图标:这里推荐设置「聊天模版参数」,点击「添加」,设置enable_thinking为false。不然每次聊天,都会思考很久。

其他设置根据自己的电脑配置来调整,完成后点「保存」。点击「就绪」按钮,会变成「已加载」状态:


四、使用模型

模型已经运行起来了,继续点击导航栏的「聊天」按钮:

会跳转到聊天页面:

确认下顶部选择了正确的模型。现在可以直接发消息给它,AI 马上就会进行回复。

回到「仪表盘」里,可以看到Token统计信息:

相关推荐
程序员-李俞26 分钟前
Mistral OCR 4真正改变的不是“识字”:文档AI正在变成Agent的数据入口
人工智能·windows·ai作画·aigc·ocr·ai编程·ai写作
JavaGuide27 分钟前
GitHub 4.5 万+ Star!GitNexus 把代码仓库变成了 Claude Code / Codex 能查询的知识图谱
后端·ai编程
小虎AI生活37 分钟前
DeepSeek Harness 技术拆解:全插件架构、九项能力对比与本地实测
ai编程
ServBay1 小时前
DeepSeek Harness 实战:如何搭建完整的 AI Agent 本地开发环境
aigc·ai编程·deepseek
plainGeekDev2 小时前
从设计到实现:登录模块的 Loop 实战记录
ai编程·claude
土豆12502 小时前
半年 20 万 Star 的「反 Vibe Coding」:Matt Pocock 是如何用一套 Skill 驯服 AI 编程代理的
人工智能·ai编程
9i编程3 小时前
四大准则也还是不靠谱啊:定好了铁律,AI 照样偷懒给你看
人工智能·openai·ai编程
名不经传的养虾人3 小时前
从0到1:企业级AI项目迭代日记 Vol.87|记忆链路切换了,系统接管有了质量门
大数据·人工智能·ai编程·企业ai·多agent协作
Mr_liu_6664 小时前
Claude非专业入门实战笔记(4):Claude运行方式简单解析——从RAG到代理循环
笔记·ai编程·claude
黑科技iOS上架5 小时前
摆脱Appstore4.3拒审泥潭
经验分享·ai编程