17. Unsloth下载、安装及加载本地大模型 ❀ 老梅子学AI

  【简介】在LM Studio上测得Qwen3.8-Flash-Next速度为37 tokens/s,这个速度一个人勉强,多人用就不够了,那有没有办法加快速度呢?


模型平台

  上一篇文章,虽然测得Qwen3.8-Flash-Next性能基本能满足要求,但是在长时间测试的时候Mac系统重启了一次。这不得不让我有再重新找过大模型的想法了。

  ① 再次让ChatGPT推荐大模型,选择了GLM-5.3-Flash,下载的是98.71GB的版本,这里发现一个诀窍,就是早上下载时的速度最快。无意中看见在下载界面可以进入到下载目录,点击【Open downloads directory】。

  ② 原来LM Studio并不是将所有模型放在同一目录下,可以根据模型类别分别存放,我们点击【ddalcu】。

  ③ 这里存放的是前面下载的Qwen3.8-Flash- Next-MLX-Server-mixed-4-8bit模型,由于体积太大(107GB),无法在LM Studio下使用,可以在Max-Serve下使用。

  ④ 该模型由许多小文件组成。那么什么是ddalcu?

  ⑤ ddalcu其实是GitHub用户名,在本地模型圈子里能看到它,基本都是指ddalcu/mls-serve这个项目。mlx-serve是专门给Apple Silicon(M系列Mac)做的原生本地大模型推理服务。表示这个大模型在mlx-serve下使用。

  ⑥ 再看看lmstudio-community目录,里面是我们第一个下载的Qwen3.8-27B-MLX-8bit模型。

  ⑦ 这个模型是我们运行的第一个本地大模型,只有30多G,也是有很多小文件组成。那lmstudio-community又是什么呢?

  ⑧ lmstudio-community是Hugging Face上的一个组织帐号,专门存放社区量化好、直接适配LM Studio的模型。它是由社区爱好者、贡献者把原版开源大模型做量化(GGUF/MLX格式),上传到这个组织下,目标就是开箱即用,直接在LM Studio里面搜索下载,不用自己本地量化模型。

  ⑨ 最后看看unsloth目录,有两个大模型,一个是昨天测试OK的Qwen3.8-Flash-Next-GGUF,另一个就是刚下载的模型,我们先看看Qwen3.8目前里有啥。

  ⑩ 这里面就比较简单了,除了将近100GB的模型拆成3个主模型文件,还有一个专门处理图片的文件。

  ⑪ 另一个刚刚下载,还没来得及测试的GLM 5.3大模型,里面的文件结构也是一样的。那么unsloth又是什么呢?

  ⑫ Unsolth是本地大模型圈非常火的开源项目,两件核心东西:Python微调库+Unsloth Desktop(桌面GUI),HuggingFace上也有unsloth模型组织帐号。最早出名是微调(Fine-tune),同样的硬件、微调显示存少约60%,速度快2倍,适合做模型二次调教、做私有Agent、知识库定制。

  ⑬ unsloth/前缀的模型,在Unsloth团队自己量化打包的GGUF模型,这些GGUF模型LM Studio、mlx-seve、llama.cpp、Ollama全都可以加载,这就是为什么上一篇文章可以在LM Studio使用Qwen3.8-Flash-Next模型的原因了。

【总结】

现有工具对比:

  ● mlx-serve: 主打Apple Silicon原生MLX推理,Zig写,侧重高性能推理服务

  ● LM Studio: 跨平台GUI,GGUF/MLX双引擎,模型商店友好

  ● Unsloth Desktop: 即能跑推理,又能直接在本机做模型微调,自带UD系列高质量GGUF,也支持图像/视频生成

Unsloth 下载与安装

  即然Unsolth Desktop这么厉害,那么我们来试试。

  ① unsloth(unsloth.ai)首页点击【Download for Mac】。

  ② 双击下载后的安装文件,弹出窗口,拖动Unsloth到Applications。

  ③ 打开Launchpad(启动台),点击Unsloth图标。

  ④ 出现unsloth安装提示,点击【Get Started】。

  ⑤ 经过几分钟耐心的等待,unsloth安装完成进入主介面。提示模型来源切换成ModelScope,这里关闭提示,点击菜单【模型中心】。

  ⑥ 点击【On Device】,惊奇的发现竟然已经找到LM Studio下载的四个模型文件,这个非常友好,得加分。

Unsloth 模型装载与测试

  为了能装下近100GB的模型,我们需要空出内存来。

  ① 重启Mac,只启动SiliconScope和浏览器,目前只占用10.6GB内存。

  ② 打开unsloth,选择菜单【模型心中】,选择【On Device】,选择模型【GLM-5.3-Flash-GGUF】,点击【Run】。

  ③ 提示正在将模型装入内存。

  ④ 模装装载完成后,再看SiliconScope,发现AI RUNTIME 是 llama.cpp,占108.7GB内存,减去10.6G基础占用,这个大模型占内存102G,说明整个模型文件都装载到内存中了。

  ⑤ 用同样的问题,让unsloth下的GLM-5.3写一篇1000字的文章,思考时间用了3秒钟,而上一篇文章中,LM Studio下的Qwen3.8,同样问题,思考时间是3.46秒。

  ⑥ 鼠标移动到问题最后的28.6 tok/s上,弹出菜单显示更多的内容。LM Studio下的Qwen3.8,显示的是38.28 token/s,由于是不同模型,不同平台,这个只做一个简单参考,谁好谁差,还要深入研究才能知道答案。

  ⑦ 同样在断网的情况下背讼滕王阁序,unsloth加GLM5.3的反应时间只有4秒钟,而LM Studio加Qwen3.8是1分钟,到低是模型太强,还是unsloth比LM Studio更快呢?你们想不想知道?


相关推荐
打工仔折腾 AI1 小时前
把AI Agent托管在家用电脑:UU远程终端与端口映射实测记录
人工智能·后端·python·langchain·ai agent 实战
零基础1231 小时前
Agent 的 Memory 怎么做科研:以中医诊断场景为例
人工智能·经验分享·python·语言模型
归秋1421 小时前
人声节奏对齐软件推荐:从专业DAW到AI人声制作工具怎么选
人工智能
2601_962966642 小时前
数学与应用数学专业想进管理咨询,2027届秋招需要补哪些商业知识和技能?
人工智能
ss2733 小时前
AI全栈实战 | 3.2-01 Python 基础:四大数据容器怎么选,推导式为什么是 Pythonic 的灵魂
开发语言·人工智能·python
Sweet锦3 小时前
不调 Python,不装向量库:我用纯 Java 写了一套以图搜图引擎
java·人工智能·开源·图搜索
fpcc3 小时前
AI和大模型—JEV模型
人工智能
weixin_446260853 小时前
面向演进式企业AI智能体技能的持续流程级评估
人工智能
量子-Alex3 小时前
【大模型后训练SFT】Finetuning with Sampling: SFT Learns Better Than You Think
人工智能·深度学习·机器学习