vllm 大模型启动缓存相关环境变量 export

你设置的这些环境变量,本质上是在把默认缓存目录从 /root/.cache 改到指定目录

逐个解释:

环境变量 控制内容 默认目录(未设置时) 你现在设置后
HF_HOME Hugging Face 模型/Tokenizer 缓存 /root/.cache/huggingface /hyperai/input/input0/hub
VLLM_CACHE_ROOT vLLM 编译缓存 /root/.cache/vllm /local_nvme/vllm_cache
FLASHINFER_CACHE_DIR FlashInfer CUDA kernel 编译缓存 /root/.cache/flashinfer /local_nvme/flashinfer_cache
TORCHINDUCTOR_CACHE_DIR PyTorch Inductor 编译缓存 /tmp/torchinductor_<user> 或用户 cache 目录(版本有关) /local_nvme/torch_cache
TRITON_CACHE_DIR Triton kernel 缓存 ~/.triton/cache /local_nvme/triton_cache

1. HF_HOME

你设置:

复制代码
export HF_HOME=/hyperai/input/input0/hub

原来:

复制代码
/root/.cache/huggingface/

里面通常:

复制代码
/root/.cache/huggingface/
├── hub/
│   ├── models--xxx
│   └── snapshots/
├── assets/
└── datasets/

设置后:

复制代码
/hyperai/input/input0/hub/
├── models--unsloth--Qwen3.6-27B-NVFP4/
│   └── snapshots/
│       └── ccdaab7...
│           ├── config.json
│           ├── model.safetensors
│           └── tokenizer.json

你现在这个:

复制代码
models--unsloth--Qwen3.6-27B-NVFP4

就是 HF cache 格式。


2. VLLM_CACHE_ROOT

你设置:

复制代码
export VLLM_CACHE_ROOT=/local_nvme/vllm_cache

原来:

复制代码
/root/.cache/vllm/

例如:

复制代码
/root/.cache/vllm/
└── torch_compile_cache/
    └── cca9c83bef/
        └── rank_0_0/
            └── backbone/

设置后:

复制代码
/local_nvme/vllm_cache/
└── torch_compile_cache/
    └── cca9c83bef/
        └── rank_0_0/

保存:

  • torch.compile graph

  • vLLM 编译产物


3. FLASHINFER_CACHE_DIR

你设置:

复制代码
export FLASHINFER_CACHE_DIR=/local_nvme/flashinfer_cache

原来:

复制代码
/root/.cache/flashinfer/

你之前看到:

复制代码
/root/.cache/flashinfer/0.6.12/120f/

设置后:

复制代码
/local_nvme/flashinfer_cache/
└── 0.6.12/
    └── 120f/
        └── cached_ops/
            └── fp4_gemm_cutlass_sm120/

这里就是:

你的:

复制代码
Qwen3.6-27B-NVFP4

启动时编译的:

复制代码
FP4 GEMM kernel

4. TORCHINDUCTOR_CACHE_DIR

你设置:

复制代码
export TORCHINDUCTOR_CACHE_DIR=/local_nvme/torch_cache

原来可能:

复制代码
/tmp/torchinductor_root/

或者:

复制代码
/root/.cache/torch/

保存:

PyTorch 2.x:

复制代码
torch.compile
        |
        v
TorchDynamo
        |
        v
Inductor
        |
        v
生成CUDA代码

例如:

复制代码
/local_nvme/torch_cache/
├── fxgraph/
├── triton/
└── xxx.so

5. TRITON_CACHE_DIR

你设置:

复制代码
export TRITON_CACHE_DIR=/local_nvme/triton_cache

原来:

复制代码
/root/.triton/cache

保存:

Triton kernel:

例如:

复制代码
attention kernel
layernorm kernel
matmul kernel

结构:

复制代码
/local_nvme/triton_cache/
├── xxx/
│   └── kernel.so

你的最终目录结构大概会变成

推荐:

复制代码
/local_nvme/
|
├── vllm_cache/
│   └── torch_compile_cache/
|
├── flashinfer_cache/
│   └── 0.6.12/
|
├── torch_cache/
│
└── triton_cache/


/hyperai/input/input0/
|
└── hub/
    └── models--unsloth--Qwen3.6-27B-NVFP4/

关系:

复制代码
                 模型
                  |
                  v
HF_HOME  -----------------> safetensors权重


启动vLLM
    |
    +---- FlashInfer
    |          |
    |          v
    |     FLASHINFER_CACHE_DIR
    |
    +---- torch.compile
    |          |
    |          v
    |     VLLM_CACHE_ROOT
    |
    +---- Triton
               |
               v
        TRITON_CACHE_DIR

针对你现在的 RTX PRO 6000 + Qwen3.6-27B-NVFP4,这个设置是合理的:

  • /hyperai/input/input0/hub:可以共享(模型)

  • /local_nvme/*cache:每台 GPU 节点独立保存(编译产物)

这样既避免重复下载模型,也避免不同 GPU 节点之间污染 CUDA kernel 缓存。

相关推荐
m0_380743875 小时前
给大模型调用加一层本地缓存,让重复请求直接命中磁盘
缓存
ltl6 小时前
实时 OS 巡礼:VxWorks、QNX、Zephyr 与 PREEMPT_RT
linux
我是谁??6 小时前
Ubuntu22.04更换清华源
linux·运维·服务器
Shell运维手记7 小时前
Linux 常用基础命令学习笔记
linux·运维·笔记·学习·算法·github
FakeOccupational7 小时前
【电路笔记 STM32】Cortex-M7 内核上的数据缓存(D-Cache)结构+MPU+DMA&Cache+STM32CubeMX配置
笔记·stm32·缓存
测试运维日常笔记8 小时前
Linux系统安装配置TigerVNC服务器完整指南
linux·运维·服务器
雾时之林9 小时前
Linux----cron定时服务
linux·运维·服务器
wengqidaifeng11 小时前
1.从“会敲命令”到理解 Linux:15 个基础指令、文件树与命令执行的本质
linux·运维·服务器·ubuntu
l1t12 小时前
DeepSeek总结的在 pg_stat_statements 中诊断高基数工作负载
数据库·缓存·postgresql
奔跑的架构师13 小时前
[A-49]ARMv9/v8-PSCI接口规范与工作流程简介
android·linux·arm开发·arm