技术栈
动态批处理
智码看视界
3 小时前
nvidia
·
模型部署
·
mlops
·
triton
·
gpu推理
·
推理服务化
·
动态批处理
AI 推理优化 | Triton Inference Server 架构解析:单机多模型并发推理的工业级方案
一个典型的算法团队,线上跑的模型往往不止一个:CV 类、NLP 类、推荐类、自研 PyTorch 模型。最常见的"朴素部署"是:
我是有底线的