技术栈

动态批处理

智码看视界
3 小时前
nvidia·模型部署·mlops·triton·gpu推理·推理服务化·动态批处理
AI 推理优化 | Triton Inference Server 架构解析:单机多模型并发推理的工业级方案一个典型的算法团队,线上跑的模型往往不止一个:CV 类、NLP 类、推荐类、自研 PyTorch 模型。最常见的"朴素部署"是:
我是有底线的