1928_llama.cpp部署Qwen 3.6-35B-A3B扩充识图功能

前面我已经把千问 3.6-35B-A3B 的模型量化版本在我的电脑上跑起来了,而且已经把它给融入到了我日常工作以及学习的工作流程之中,目前正在尝试打磨。我知道这一个模型是一个多模态的模型,能够识别图像等信息。但是我发现我自己在模型这方面的能力一直欠缺。但是由于我自己工作流程之中处理的主要还是文本或者是代码,因此这一方面我就没有着急尝试去扩展。但是总觉得这一个多模态的功能如果是扩充起来,那么给这个模型的可用性就留下了更多的想象空间。因此在我自己个人的计划里面,除了尝试对我当前自己本地大模型的功能以及性能进行优化之外,还得把这个功能给扩充上去。

现在有了各种免费可用的各家大模型,可以去作为材料的搜集以及问题分析的一个很好的工具。尝试扩充这样的功能,的确是容易多了,至少是比我自己预期的简单了很多。我在 DeepSeek 上尝试提问了一下,就想知道如何在我现有的模型架构基础上扩充识图能力。它给出了非常详细的步骤,只是没有给我提供图形识别的模型下载链接。而这一部分我自己也算是轻车熟路,直接去模搭社区,很快就找到了一个。之后把我原来的启动脚本,以及我现在的电脑的配置信息情况,以及新的模型文件等等相关的信息,直接扔给 DeepSeek,让它给我修改启动脚本。之后一把就成功了,至少是识图的功能已经能够正常使用了。

但是看了一下启动服务器的 log,发现这里面还是有一些提示信息。于是一股脑的又把这些提示信息扔给 DeepSeek,让它给我分析。DeepSeek 阅读了之后,提出了一些潜在的风险点以及改进的方案,顺便把 log 中中提示到的一些配置修改项一块给我改完了。这样我现在的多模态的模型基本上就完全就绪了。

测试了一下识图以及推理结合的状态之下,我的这个大模型的配置,目前的 Token 生成速度每秒钟成了 40 多个,现在的性能只有原来的大概一半。结合之前的一些使用体验来说,我觉得这一个速度基本上也是可以保证我工作之中尝试拿来做做简短的代码分析,或者是写点简单的代码框架,很好的一个速度保证,不会对我整体的使用体验有太大的影响。至于这个速度是不是还有继续提升打磨的空间,后面可以继续去尝试。

最后增加一下我自己调试过程之中电脑的一些相关信息,以及测试时候记录的一些截图信息,最后附加我的启动脚本。

以上是我这次增加的识图的模型,来自于魔搭社区。我找到了3个版本,最后在DeepSeek的建议下选择了这个。既能够保证精度,还有一定的压缩优化,是一个比较平衡的选择。

bash 复制代码
C:\llama.cpp>llama-server --host 0.0.0.0 --port 8080 -m "C:\llama.cpp\models\Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-I-Compact.gguf" --mmproj "C:\llama.cpp\models\mmproj-BF16.gguf" -ngl 999 -c 128000 -t 6 --flash-attn on --n-cpu-moe 10 -ctk q8_0 -ctv q8_0 -b 2048 -ub 2048 --parallel 1 --mlock --no-mmap --jinja
0.03.194.334 I cmn  common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.03.257.930 W srv  llama_server: -----------------
0.03.258.080 W srv  llama_server: CORS is set to allow all origins ('*') and no API key is set
0.03.258.084 W srv  llama_server: this can be a security risk (cross-origin attacks)
0.03.258.085 W srv  llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655
0.03.258.085 W srv  llama_server: -----------------
0.03.277.037 I srv    load_model: loading model 'C:\llama.cpp\models\Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-I-Compact.gguf'
0.03.688.564 W common_fit_params: failed to fit params to free device memory: n_gpu_layers already set by user to 999, abort
0.12.292.200 W load_hparams: Qwen-VL models require at minimum 1024 image tokens to function correctly on grounding tasks
0.12.292.208 W load_hparams: if you encounter problems with accuracy, try adding --image-min-tokens 1024
0.12.292.208 W load_hparams: more info: https://github.com/ggml-org/llama.cpp/issues/16842

0.16.640.568 I srv    load_model: loaded multimodal model, 'C:\llama.cpp\models\mmproj-BF16.gguf'
0.16.905.475 I srv    load_model: initializing, n_slots = 1, n_ctx_slot = 128000, kv_unified = 'false'
0.16.950.478 I srv          init: chat template supports preserving reasoning, consider enabling it via --reasoning-preserve
0.16.951.369 I srv  llama_server: model loaded
0.16.951.378 I srv  llama_server: listening on http://0.0.0.0:8080

上面是我第一次尝试启动的时候,系统提示出来的log,我让DeepSeek给我分析并优化了启动的脚本。

修改之后,模型启动加载我的电脑任务管理器中看到的资源占用情况。

有了识图功能之后,在文件添加的部分多了一个图像文件的添加选项(之前是不可选状态)。实际使用的嘶吼,这个地方可以不用选择文件,直接复制粘贴也是可以的。

这是我直接复制粘贴,让A3B的模型给我做分析的情况。

值得注意的是,加了这个多模态之后,推理的速度变慢了。以前纯文本推理的速度,90 tokens/s的稳定速度,现在不太到60 tokens/s。平均下来大概是56 tokens/s左右,慢的时候能够到40 tokens/s。

最后附加我的启动脚本如下:

llama-server ^

--host 0.0.0.0 ^

--port 8080 ^

-m "C:\llama.cpp\models\Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-I-Compact.gguf" ^

--mmproj "C:\llama.cpp\models\mmproj-BF16.gguf" ^

-ngl 999 ^

-c 128000 ^

-t 6 ^

--flash-attn on ^

--n-cpu-moe 10 ^

-ctk q8_0 ^

-ctv q8_0 ^

-b 2048 ^

-ub 2048 ^

--parallel 1 ^

--mlock ^

--no-mmap ^

--jinja ^

--image-min-tokens 1024

相关推荐
码云骑士9 小时前
78-LLaMA-Factory微调实战-零代码训练-LoRA参数配置-训练曲线解读
python·llama
寒水馨1 天前
Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)
linux·ubuntu·llm·llama·本地部署·llama.cpp·推理引擎
千天夜2 天前
让大模型“先想再答”:Chain-of-Thought Prompting 论文精读——CoT 为什么能激发多步推理?
人工智能·深度学习·llm·gpt-3·llama
网络工程小王2 天前
【HCIE-AI】10.pytorch模型迁移分析
人工智能·学习·华为·llama
寒水馨4 天前
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)
windows·llm·大语言模型·llama·本地部署·ollama·模型运行
老刘说AI5 天前
AI服务核心: 高并发原理与性能监控调优
人工智能·神经网络·langchain·llama·持续部署
头茬韭菜6 天前
Kronos 模型推理性能基准测试报告
llama
亮亮在江湖6 天前
# 手写原生Transformers SFT脚本 vs LLaMA Factory 训练 核心完整对比
llama
染指11106 天前
61.RAG-RAG存在的问题
人工智能·llama·rag·llama_index·llamaindex