技术栈

ensorrt-llm

circuitsosk
2 小时前
python·云原生·agent·vllm·推理加速·大模型部署·ensorrt-llm
不止于API调用:大模型推理加速与云原生服务化部署指南训练一个效果好、能力强的模型,在今天已经不再是最大的门槛。真正考验工程能力的,是把这个动辄几十GB、甚至上百GB的“巨兽”,在保障生成质量的前提下,用尽可能低的延迟和成本,稳定地服务成千上万的用户。
我是有底线的