技术栈
ensorrt-llm
circuitsosk
2 小时前
python
·
云原生
·
agent
·
vllm
·
推理加速
·
大模型部署
·
ensorrt-llm
不止于API调用:大模型推理加速与云原生服务化部署指南
训练一个效果好、能力强的模型,在今天已经不再是最大的门槛。真正考验工程能力的,是把这个动辄几十GB、甚至上百GB的“巨兽”,在保障生成质量的前提下,用尽可能低的延迟和成本,稳定地服务成千上万的用户。
我是有底线的