技术栈
llama-cpp
ONE_SIX_MIX
11 天前
ai
·
qwen3
·
llama-cpp
llama-server 部署 Qwen3.8-27B:真正开启 512K 上下文,突破 256K 截断
使用 llama-server 部署 Qwen3.8-27B 时,启动命令中设置了 -c 512000,但实际请求一旦超过 256K tokens,服务端要么报错,要么返回截断结果。日志中的 ctx_size 虽然显示为 512000,但模型内部依然卡在 256K。
belldeep
5 个月前
python
·
ai
·
llama
·
llama-cpp
AI: llama.cpp 编译成功后,入门教程
参阅上一篇:llama.cpp 如何下载、编译mkdir ggml cd ggml git clone https://github.com/ggml-org/llama.cpp cd llama.cpp 如果仅使用 CPU,不用显卡 GPU cmake -B build -DGGML_CURL=OFF cmake --build build --config Release -j 8
我是有底线的