技术栈
qwen3.8-9b
Anesthesia丶
31 分钟前
ubuntu
·
opencode
·
llama-server
·
qwen3.8-9b
llama-server编译部署+opencode验证记录(Ubuntu, GPU)
之前也用了 vllm 部署 qwen3.8-9b-gptq-int4 版本,其他的没什么,就是感觉 显存占用太高了,常驻显存约 16g,基本上没法干其它的事儿了。 ollama 倒是方便,但是对我来讲,感觉模型的管理机制又束缚了我,毕竟我只是想找一个好一点的模型让我用起来,它想加自定义的模型相对不是那么方便。
我是有底线的