Python FastAPI 介绍以及常用方法python·fastapi·vllm·ai infra
RTX 3090 如何跑 13B 级大模型推理?4-bit AWQ、vLLM 部署与并发调优实战模型量化·vllm·大模型推理·awq·算家云·rtx3090
Qwen3.8-27B 做 GRPO 需要几张 GPU?4×RTX 4090 与 8×RTX 4090 显存、vLLM 和 ZeRO-3 配置分析deepspeed·qlora·大模型训练·vllm·rtx4090·grpo·qwen3.8
Qwen3.8-27B 本地推理 Benchmark 解析:llama.cpp、vLLM、SGLang 与长 Context 的性能差异服务器·人工智能·大模型·qwen·vllm·sglang·context长度
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型llama·qwen·vllm·大模型推理·大模型部署·rtx4090