让 Intel NPU 跑AI 大模型?一次 llama.cpp OpenVINO 后端的完整实测机器:Intel Core Ultra 9 275HX + RTX 5070 Ti Laptop我们的离线 PDF 转 Markdown 项目用 llama.cpp 加载 OvisOCR2(0.8B 视觉文档解析模型), CUDA 后端 + RTX 5070 Ti 已经跑得飞快(单页约 2 秒)。某天听到一个说法:llama.cpp 可以用 Intel CPU 内置的 NPU 当推理后端,底层是 OpenVINO。核显之外的免费算力,听着 很诱人——于是有了这次探索。结论先放前面:最终没跑成,但把整条链路