llama.cpp 部署qwen3.5 2B 高通芯片安卓实战

本文利用llama.cpp在高通芯片安卓系统部署Qwen3.5 2B模型的全流程,全套代码由豆包辅助生成,豆包最成功的一点是可以不断修正,就错误发给豆包,一步步改进,最终完成。

1、将模型转化为gguf格式

Qwen3.5 2B模型,从阿里魔塔下载,存放在Qwen3.5-2B目录下。

复制代码
python convert_hf_to_gguf.py /home/**/work/models/Qwen3.5-2B --outfile qwen3.5-2b-f16.gguf
2、量化,生成qwen3.5-2b-q4km.gguf文件
复制代码
/home/**/work/mycharm/llama.cpp/build/bin/llama-quantize qwen3.5-2b-f16.gguf qwen3.5-2b-q4km.gguf q4_k_m

构建目录进行交叉编译

注意要下载NDK并设置环境变量

安卓NDK存放目录,/opt/android-ndk-r26c

export NDK=/opt/android-ndk-r26c

复制代码
mkdir build-android
cd build-android
cmake .. \
  -DCMAKE_TOOLCHAIN_FILE=${NDK}/build/cmake/android.toolchain.cmake \
  -DANDROID_ABI="arm64-v8a" \
  -DANDROID_PLATFORM=24 \
  -DANDROID_USE_LEGACY_TOOLCHAIN=OFF \
  -DLLAMA_NATIVE=OFF \
  -DLLAMA_BUILD_SERVER=OFF \
  -DLLAMA_BUILD_EXAMPLES=ON \
  -DLLAMA_BUILD_TESTS=OFF \
  -DLLAMA_OPENMP=OFF \
  -DCMAKE_BUILD_TYPE=Release

最后输出以下内容表示成功

-- Build files have been written to: /home/**/work/mygit/llama.cpp/build-android

然后执行

复制代码
make -j$(nproc)

生成的内容在bin目录下

复制代码
adb push bin/* /data/local/tmp/qwen35/bin
3、推送文件到安卓车机

推送bin目录下文件到车机

另外需要把libomp.so这个库也推送车机bin目录

复制代码
adb push /opt/android-ndk-r26c/toolchains/llvm/prebuilt/linux-x86_64/lib/clang/17/lib/linux/aarch64/libomp.so /data/local/tmp/qwen35/bin

推送模型到车机目录

复制代码
adb push qwen3.5-2b-q4km.gguf /data/local/tmp/qwen35/models

进入车机

复制代码
adb shell
cd /data/local/tmp/qwen35/
export LD_LIBRARY_PATH=/data/local/tmp/qwen35/bin:$LD_LIBRARY_PATH
/data/local/tmp/qwen35/bin

模型文件目录

4、模型启动

执行以下命令启动模型

复制代码
./llama-simple-chat -m /data/local/tmp/qwen35/models/qwen3.5-2b-q4km.gguf
相关推荐
梅雅达编程笔记2 天前
开源模型的安全悖论——越开放,越危险?
llama·qwen·开源大模型·ai安全·模型越狱·权重投毒·大模型治理
白萝卜弟弟2 天前
【大模型Qwen3.8 27B】llama.cpp 本地大模型部署与使用
ai·大模型·agent·llama·qwen3.8
仙人掌_lz3 天前
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准
人工智能·llm·llama·vllm·判别模型·jev
代数狂人3 天前
异构双卡大模型部署指南:18GB显存突破单卡瓶颈 llama.cpp 层并行部署
llama
写bug如流水3 天前
【LLM】Qwen3.5 35B A3B 单卡 RTX 3090 部署教程
人工智能·llama
promanz4 天前
llamap.cpp 和 llama-index连接
人工智能·llama
GPU实战笔记11 天前
本地跑不动 llama.cpp,临时租云 GPU 怎么搭?从启动服务到环境复用
java·服务器·网络·人工智能·深度学习·llama
牛马工作号13 天前
RK3588 使用 rk-llama.cpp + RKNPU2 部署 Qwen3.5:从零开始的 NPU 本地大模型实战
人工智能·语言模型·llama
书源丶13 天前
Qwen3-Embedding-0.6B 纯 CPU
网络·语言模型·embedding·llama
ayaya_mana14 天前
Qwen3.5-9B融合DeepSeek-V4-Flash小模型实测与部署
windows·本地大模型·qwen3.5