速度起飞 笔记本电脑6G显卡llama运行Qwen3.6 35BA3B MTP 大模型

最新测试,如果开启MTP功能,速度可以大幅提升5倍,思考速度可以达到150token每秒,这还是6G显存,虽然还是比较难用,但是已经可以堪堪摸到可用的门槛了,离谱!!!

做了个比较颠的测试,看看在6G显存的笔记本能不能运行这个350亿参数的大模型,得益于它的moe架构,可以把大部分模型参数放到内存里面去,好歹算是跑起来了,虽然运行的非常吃力。

显存占用5G,内存占用20G

推理的速度大概是8 Token每秒。

做了一个简单的代码理解工作,耗时4分钟多。

最后的llama 运行脚本奉上

@echo off

chcp 65001 > nul

REM Qwen3.6-35B-A3B MoE Server for 6G GPU

REM Usage: Normal llama.cpp + CPU-MOE offload + KV cache quantization

REM Only 3B params active per inference, inactive experts stay on disk

cd /d "f:\qwen35\llamagpu"

set MODEL=f:\qwen35\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf

set PORT=7777

set CTX_SIZE=320000

echo ============================================

echo Qwen3.6-35B-A3B MoE Server (6G GPU)

echo Model: Q4_K_M (~19GB)

echo Active Params: 3B / Total: 35B

echo API: http://localhost:%PORT%

echo ============================================

echo.

echo 6G GPU Tuning:

echo --n-cpu-moe: MOE layers on CPU (6G GPU try 40-50)

echo If OOM --^> increase --n-cpu-moe (45, 50)

echo If GPU low --^> decrease --n-cpu-moe (35, 30)

echo Goal: GPU VRAM ~80%%, room for KV cache

echo.

llama-server.exe ^

--host 0.0.0.0 ^

--port %PORT% ^

--timeout 600 ^

--threads -1 ^

--batch-size 2048 ^

--ctx-size %CTX_SIZE% ^

--n-gpu-layers 99 ^

--flash-attn auto ^

--cache-type-k q4_0 ^

--cache-type-v q4_0 ^

--cont-batching ^

--metrics ^

--no-mmap ^

--n-cpu-moe 40 ^

--temp 0.7 ^

--top-p 0.8 ^

--top-k 20 ^

--min-p 0 ^

--presence-penalty 1.5 ^

--chat-template-kwargs "{\"enable_thinking\":false}" ^

--model %MODEL%

pause

相关推荐
言乐63 小时前
Python游戏水平测试辅助系统
开发语言·python·游戏·django·pygame
Shockang7 小时前
AI 智能体安全沙盒实战
人工智能
yuhulkjv3358 小时前
Claude表格复制到word不再崩溃,AI导出鸭批量导出+格式无损一键搞定
人工智能·ai·c#·word·ai导出鸭
从零开始学习人工智能9 小时前
【踩坑实录】WSL2 解决 onnxruntime\-gpu ImportError: libcudart\.so\.13 无 CUDA13 运行库问题
python
大明者省9 小时前
WSL2 Ubuntu22.04 GPU训练环境配置指南
人工智能·算法·计算机视觉
抱抱宝9 小时前
Agent-study项目教程(03):手写 Mini-ReAct Agent(不依赖框架)
javascript·人工智能·gpt·react.js·prompt·agent
抱抱宝9 小时前
大模型应用开发教程08 | 构建完整 RAG 应用(Chroma/FAISS 实战)
人工智能·gpt·prompt·agent
美团技术团队9 小时前
KDD‘26 美团学术论文精选及KDD Cup‘26 DataAgents赛道冠军思路解读
人工智能
AKAMAI10 小时前
当AI模型超出存储增长时
人工智能·云计算