llama-本地推理大模型多模型同时运行

单模型

llama-server.exe -m "G:\AI-AI\LLM\stablediffusionv2.gguf" --port 8081

多模型

llama-server.exe --config_file <config_file>

复制代码
{
    "host": "0.0.0.0",
    "port": 8080,
    "models": [
        {
            "model": "models/OpenHermes-2.5-Mistral-7B-GGUF/openhermes-2.5-mistral-7b.Q4_K_M.gguf",
            "model_alias": "gpt-3.5-turbo",
            "chat_format": "chatml",
            "n_gpu_layers": -1,
            "offload_kqv": true,
            "n_threads": 12,
            "n_batch": 512,
            "n_ctx": 2048
        },
        {
            "model": "models/OpenHermes-2.5-Mistral-7B-GGUF/openhermes-2.5-mistral-7b.Q4_K_M.gguf",
            "model_alias": "gpt-4",
            "chat_format": "chatml",
            "n_gpu_layers": -1,
            "offload_kqv": true,
            "n_threads": 12,
            "n_batch": 512,
            "n_ctx": 2048
        },
        {
            "model": "models/ggml_llava-v1.5-7b/ggml-model-q4_k.gguf",
            "model_alias": "gpt-4-vision-preview",
            "chat_format": "llava-1-5",
            "clip_model_path": "models/ggml_llava-v1.5-7b/mmproj-model-f16.gguf",
            "n_gpu_layers": -1,
            "offload_kqv": true,
            "n_threads": 12,
            "n_batch": 512,
            "n_ctx": 2048
        },
        {
            "model": "models/mistral-7b-v0.1-GGUF/ggml-model-Q4_K.gguf",
            "model_alias": "text-davinci-003",
            "n_gpu_layers": -1,
            "offload_kqv": true,
            "n_threads": 12,
            "n_batch": 512,
            "n_ctx": 2048
        },
        {
            "model": "models/replit-code-v1_5-3b-GGUF/replit-code-v1_5-3b.Q4_0.gguf",
            "model_alias": "copilot-codex",
            "n_gpu_layers": -1,
            "offload_kqv": true,
            "n_threads": 12,
            "n_batch": 1024,
            "n_ctx": 9216
        }
    ]
}
相关推荐
猫先生Mr.Mao几秒前
大模型之Attention Is All You Need详解:Transformer如何用注意力重写序列建模
深度学习·大模型·transformer·注意力机制·论文解读
thesky12345617 分钟前
27届大模型面试准备(七十四):大模型长上下文推理与服务化工程——分块 Prefill、KV 卸载与 Ring Attention
大模型·服务化·chunked prefill·长上下文推理·kv卸载·ring attention·序列并行
寻道码路39 分钟前
大模型工程化实战(七):JSON Schema 强约束——模型吐的 json 不合规?schema 校验不通过,重试、兜底、降级一条龙
大模型·agent·rag·json schema·ai工程化·llmops`
KeepSeek1 小时前
大模型推理优化面试题
大模型
deepseek231 小时前
Claude Fable 5.1 深度拆解:推理强度、缓存降价,Agent 工作流成本如何省 45%
大模型·claude·ai agent
七夜zippoe2 小时前
我用 Qwen3.8-Max 搭了一个 AI 作业辅导助手,拍照讲题 + 错题本诊断一次搞定
人工智能·ai·大模型·qwen3.8-max·build with qwen
腾视科技-AI2 小时前
腾视科技AI大模型应用:提效、破局与落地,重塑智能新生态
大数据·人工智能·科技·大模型·ai大模型·腾视科技·ai算力盒
dozenyaoyida12 小时前
AI与大模型新闻日报 | 2026-09-01
人工智能·ai·大模型·新闻
ReleaseU15 小时前
Harness + MCP:打通企业工具链的最后一步
人工智能·大模型
tachibana21 天前
如何设计多 Agent 的协作与动态切换机制?
网络·人工智能·ai·大模型·llm·agent