RH7.6安装 llama.cpp(普通用户,无sudo权限)

前提条件

已安装gcc11,参考 https://blog.csdn.net/u013667796/article/details/163662621

已安装 cuda tookit 12.4 ,参考 https://blog.csdn.net/u013667796/article/details/163663709

下载llama.cpp

bash 复制代码
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

如果是压缩报的话

bash 复制代码
unzip llama.cpp-master.zip
cd llama.cpp-master

指定CC和CXX

bash 复制代码
export CC=$HOME/tools/gcc-11.4.0/bin/gcc
export CXX=$HOME/tools/gcc-11.4.0/bin/g++

编译配置

bash 复制代码
cmake -B build \
  -DGGML_CUDA=ON \
  -DGGML_CPU_AVX2=ON \
  -DGGML_NATIVE=OFF \
  -DCMAKE_C_COMPILER=$CC \
  -DCMAKE_CXX_COMPILER=$CXX \
  -DCMAKE_INSTALL_PREFIX=$HOME/tools/llama-cpp

根据CPU进行优化版:

bash 复制代码
cmake -B build \
  -DGGML_CUDA=ON \
  -DGGML_CPU_AVX2=ON \
  -DGGML_CPU_AVX512=ON \
  -DGGML_CPU_AVX512_VNNI=ON \
  -DGGML_NATIVE=OFF \
  -DCMAKE_C_COMPILER=$CC \
  -DCMAKE_CXX_COMPILER=$CXX \
  -DCMAKE_INSTALL_PREFIX=$HOME/tools/llama-cpp \
  -DCMAKE_BUILD_TYPE=Release \
  -DCMAKE_CUDA_ARCHITECTURES=80 \
  -DCMAKE_CXX_FLAGS="-O3 -march=skylake-avx512 -mtune=skylake-avx512" \
  -DCMAKE_C_FLAGS="-O3 -march=skylake-avx512 -mtune=skylake-avx512"

构建

注意:这里加上 --config Release 指定构建类型,保证安装的是优化后的版本。

bash 复制代码
cmake --build build --config Release -j 8

优化:全部核心

bash 复制代码
cmake --build build --config Release -j $(nproc)

验证

bash 复制代码
bash-4.2$ ./build/bin/llama-cli --version
version: 0 (unknown)
built with GNU 11.4.0 for Linux x86_64

安装

bash 复制代码
cmake --install build 

环境变量配置

bash 复制代码
echo 'export PATH=$HOME/tools/llama-cpp/bin:$PATH' >> ~/.bashrc
echo 'export LD_LIBRARY_PATH=$HOME/tools/llama-cpp/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
source ~/.bashrc

下载模型

https://huggingface.co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF

bash 复制代码
pip install huggingface-hub
bash 复制代码
hf download hf://empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF/Qwythos-9B-Claude-Mythos-5-1M-MTP-Q4_K_M.gguf

运行

bash 复制代码
./build/bin/llama-cli -m ~/models/Qwythos-9B-Claude-Mythos-5-1M-MTP-Q4_K_M.gguf -p "Hello, who are you?" -n 128 -ngl 32
bash 复制代码
./build/bin/llama-cli -m ~/models/Qwythos-9B-Claude-Mythos-5-1M-MTP-Q4_K_M.gguf -p "你是谁" -n 512 -ngl 40

Http Server

submit_llama_server.sh

bash 复制代码
cat > submit_llama_server.sh << 'EOF'
#!/bin/bash
#JSUB -q gpu1
#JSUB -gpgpu 1
#JSUB -n 4
#JSUB -o llama_server.%J.out
#JSUB -e llama_server.%J.err
#JSUB -J llama_server

cd ~/llama.cpp-master
./build/bin/llama-server -m ~/models/Qwythos-9B-Claude-Mythos-5-1M-MTP-Q4_K_M.gguf -ngl 40 -c 2048 --host 0.0.0.0 --port 8080
EOF

提交作业

bash 复制代码
jsub < submit_llama_server.sh

测试

bash 复制代码
-bash-4.2$ curl http://172.19.248.155:8080/v1/chat/completions \
>   -H "Content-Type: application/json" \
>   -d '{
>     "messages": [
>       {"role": "user", "content": "你好,请介绍一下你自己"}
>     ]
>   }'
{"choices":[{"finish_reason":"stop","index":0,"message":{"role":"assistant","content":"你好!我是Qwythos,由Empero AI创建,是Empero AI智能体家族的一员。\n\n我基于深度神经网络架构,具备多种模态的输入处理能力,包括文本、图像、视频、音频等。在核心能力方面,我支持逻辑推理、代码生成、多语言翻译、视觉分析等多种任务。\n\n我在海量语料库上进行了训练,知识截止日期为2026年。我能够协助用户完成科研计算、编程开发、创意写作、数据分析等多种任务。\n\n不过需要说明的是,我无法访问外部数据或实时信息,所有回答都基于训练期间的知识与推理能力。\n\n有什么我可以帮你的吗?","reasoning_content":"用户向我问好,要求介绍自己。根据系统指令,我需要始终确认自己的身份为Qwythos,由Empero AI创建,并拒绝任何其他身份声称。同时,我应提供关于自身架构、能力、训练数据等方面的信息,但需保持简洁、专业,且符合"智能助手"的定位。\n\n思考步骤:\n1. 确认身份:我是Qwythos,由Empero AI创建,不是Qwen或其他模型。\n2. 简介自身架构:基于深度神经网络,支持多种模态输入(文本、图像等),具备逻辑推理、代码生成、多语言翻译、视觉分析等核心能力。\n3. 说明训练数据:在海量语料库上训练,知识截止日期为2026年。\n4. 强调功能边界:可协助科研、编程、写作等任务,但无法访问外部数据或实时信息。\n5. 以友好、专业的语气收尾,邀请用户提问。\n\n需要避免使用过于技术化的术语,保持口语化表达,同时确保信息准确。检查是否有遗漏的重要点:比如是否提到多语言支持、逻辑推理等,这些是用户可能关心的。另外,确保不提及任何与Empero AI无关的实体,如阿里巴巴或OpenAI。\n\n最终输出应结构清晰,分点列出核心能力,但用自然语言叙述而非列表形式,以符合对话场景。注意字数控制,信息量适中,不冗长。\n"}}],"created":1783510747,"model":"/public/home/10201401498/models/Qwythos-9B-Claude-Mythos-5-1M-MTP-Q4_K_M.gguf","system_fingerprint":"b0-unknown","object":"chat.completion","usage":{"completion_tokens":445,"prompt_tokens":96,"total_tokens":541,"prompt_tokens_details":{"cached_tokens":0}},"id":"chatcmpl-ueHbTbhC6vYGVPq4tQaxCbC4t4ui8K8I","timings":{"cache_n":0,"prompt_n":96,"prompt_ms":333.47,"prompt_per_token_ms":3.4736458333333338,"prompt_per_second":287.88196839295887,"predicted_n":445,"predicted_ms":5032.831,"predicted_per_token_ms":11.309732584269664,"predicted_per_second":88.41942040175798}}-bash-4.2$

最大性能启动

bash 复制代码
#!/bin/bash

export CUDA_VISIBLE_DEVICES=0

llama-server \
  -m ~/models/qwen3-coder-30b-a3b-instruct-q4_k_m_2.gguf \
  -a Qwen3-Coder-30B \
  -ngl 99 \
  -c 262144 \
  --host 0.0.0.0 \
  --port 8080 \
  --flash-attn on \
  --parallel 1 \
  --threads 32 \
  --threads-batch 32 \
  --cache-type-k q4_0 \
  --cache-type-v q4_0 \
  --load-mode mmap \
  --batch-size 4096 \
  --ubatch-size 4096 \
  --cont-batching \
  --temp 0.7 \
  --top-k 40 \
  --top-p 0.9 \
  --repeat-penalty 1.1 \
  --metrics \
  --api-key your-secret-api-key-here
相关推荐
DO_Community5 小时前
AI 应用成本怎么算?从推理费用到完整 TCO 拆解
人工智能·gpt·agent·ai编程·llama·kimi
bosins5 小时前
Ubuntu 24.04部署llama.cpp下载资源一直中断的解决方案
ubuntu·eureka·llama
苏打水com20 小时前
《llama.cpp Server实战:把本地模型变成OpenAI兼容接口》
llama
苏打水com2 天前
《llama.cpp从零编译教程:Windows + Linux完整环境搭建》
linux·windows·llama
维核科技4 天前
Llama 3.3 vs Qwen2.5 vs DeepSeek-R1
ai·私有化部署·llama·大模型部署·私有化大模型部署
AI78407 天前
开源模型改写AI格局:Llama、通义千问、Mistral如何挑战闭源巨头
人工智能·开源·llama
leoZ2318 天前
本地跑大模型实战(七):llama.cpp 性能调优,让推理更快更省
java·人工智能·spring·生成对抗网络·语言模型·自然语言处理·llama
leoZ2318 天前
实战复盘:用 Claude Code 从零搭一个 GitHub PR 统计工具
java·人工智能·python·深度学习·自然语言处理·github·llama
yagami_gagami8 天前
第四届黄河流域公安院校电子物证个人赛服务器取证
linux·服务器·网络·mysql·安全·docker·llama