速度起飞 笔记本电脑6G显卡llama运行Qwen3.6 35BA3B MTP 大模型

最新测试,如果开启MTP功能,速度可以大幅提升5倍,思考速度可以达到150token每秒,这还是6G显存,虽然还是比较难用,但是已经可以堪堪摸到可用的门槛了,离谱!!!

做了个比较颠的测试,看看在6G显存的笔记本能不能运行这个350亿参数的大模型,得益于它的moe架构,可以把大部分模型参数放到内存里面去,好歹算是跑起来了,虽然运行的非常吃力。

显存占用5G,内存占用20G

推理的速度大概是8 Token每秒。

做了一个简单的代码理解工作,耗时4分钟多。

最后的llama 运行脚本奉上

@echo off

chcp 65001 > nul

REM Qwen3.6-35B-A3B MoE Server for 6G GPU

REM Usage: Normal llama.cpp + CPU-MOE offload + KV cache quantization

REM Only 3B params active per inference, inactive experts stay on disk

cd /d "f:\qwen35\llamagpu"

set MODEL=f:\qwen35\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf

set PORT=7777

set CTX_SIZE=320000

echo ============================================

echo Qwen3.6-35B-A3B MoE Server (6G GPU)

echo Model: Q4_K_M (~19GB)

echo Active Params: 3B / Total: 35B

echo API: http://localhost:%PORT%

echo ============================================

echo.

echo 6G GPU Tuning:

echo --n-cpu-moe: MOE layers on CPU (6G GPU try 40-50)

echo If OOM --^> increase --n-cpu-moe (45, 50)

echo If GPU low --^> decrease --n-cpu-moe (35, 30)

echo Goal: GPU VRAM ~80%%, room for KV cache

echo.

llama-server.exe ^

--host 0.0.0.0 ^

--port %PORT% ^

--timeout 600 ^

--threads -1 ^

--batch-size 2048 ^

--ctx-size %CTX_SIZE% ^

--n-gpu-layers 99 ^

--flash-attn auto ^

--cache-type-k q4_0 ^

--cache-type-v q4_0 ^

--cont-batching ^

--metrics ^

--no-mmap ^

--n-cpu-moe 40 ^

--temp 0.7 ^

--top-p 0.8 ^

--top-k 20 ^

--min-p 0 ^

--presence-penalty 1.5 ^

--chat-template-kwargs "{\"enable_thinking\":false}" ^

--model %MODEL%

pause

相关推荐
hahaha601637 分钟前
HLS高层次综合设计技巧--UART_TX接收模块设计案例
人工智能·算法·计算机视觉
天天被压力39 分钟前
【零依赖量化数据实战 #31】沪深A实时盘口全景:逐笔·全盘实时·最新价·历史逐笔
java·人工智能·python
Mr数据杨39 分钟前
小样本图像分类实战 Cleaned vs Dirty V2 盘子清洁识别案例解析
人工智能·数据分析·kaggle竞赛
zzzll11111 小时前
Ollama 本地大模型部署与使用指南
人工智能
天辛大师1 小时前
天辛大师浅谈AI时代,“学会学习“本身的内涵也需要被重新定义?
人工智能·深度学习·学习·启发式算法·量子计算
_codeOH1 小时前
Agent 记忆系统设计实战:让 AI 拥有长期记忆的工程方案
人工智能·ai编程
学弟1 小时前
【系列梳理】文档解析系列梳理
人工智能·ocr
幂律智能1 小时前
穿透到合同,管控到付款
大数据·人工智能
今天AI了吗1 小时前
【AI】一文讲清 RAG:从大模型局限到企业级知识库落地流程
前端·javascript·人工智能·python·深度学习·机器学习·easyui
“AI国潮设计-小江”1 小时前
《Python实战 | 用SDXL大模型生成“潮汕英歌舞”国潮IP头像,已申请外观专利,附Prompt思路!》
人工智能·python·prompt·aigc·scikit-learn