【支持语言模型和视觉语言模型的推理引擎sglang】

介绍

sglang是一个AI推理引擎, 是一个专门为大语言模型和视觉语言模型 设计的高效服务框架

就像F1赛车需要顶级发动机一样,大语言模型也需要高效的推理引擎来发挥潜力。

而sglang正是这样一个性能怪兽

根据LMSys组织的官方公告,最新的sglang Runtime v0.2版本简直就是AI界的"闪电侠":

  • 比TensorRT-LLM快2.1倍

  • 比vLLM快3.8倍

  • 支持从Llama-8B到405B的超大模型

  • 兼容A100/H100显卡

  • 支持FP8/BF16精度

支持的模型

  • Llama / Llama 2 / Llama 3 / Llama 3.1
  • Mistral / Mixtral
  • Gemma / Gemma 2
  • Qwen / Qwen 2 / Qwen 2 MoE
  • LLaVA 1.5 / 1.6
    • python -m sglang.launch_server --model-path liuhaotian/llava-v1.5-7b --tokenizer-path llava-hf/llava-1.5-7b-hf --chat-template vicuna_v1.1 --port 30000
    • python -m sglang.launch_server --model-path liuhaotian/llava-v1.6-vicuna-7b --tokenizer-path llava-hf/llava-1.5-7b-hf --chat-template vicuna_v1.1 --port 30000
    • python -m sglang.launch_server --model-path liuhaotian/llava-v1.6-34b --tokenizer-path liuhaotian/llava-v1.6-34b-tokenizer --port 30000
  • LLaVA-NeXT-Video
  • Yi-VL
  • StableLM
  • Command-R
  • DBRX
  • Grok
  • ChatGLM
  • InternLM 2
  • Mistral NeMo

使用

docker run --gpus all \

-p 30000:30000 \

-v ~/.cache/huggingface:/root/.cache/huggingface \

--env "HUGGING_FACE_HUB_TOKEN=<secret>" \

--ipc=host \

lmsysorg/sglang:latest \

python3 -m sglang.launch_server --model-path meta-llama/Meta-Llama-3-8B-Instruct --host 0.0.0.0 --port 30000

ollama是否支持呢?

有个创业公司,核心就是推理引擎吧

最新的开源模型可以上去体验

https://api.together.xyz/playground/chat/databricks/dbrx-instruct

相关推荐
喜欢吃豆9 分钟前
从指令遵循到价值对齐:医疗大语言模型的进阶优化、对齐与工具集成综合技术白皮书
人工智能·python·语言模型·自然语言处理·大模型·强化学习·constitutional
진영_9 分钟前
LLMs From Scratch(一)---理解大语言模型
人工智能·语言模型·自然语言处理
无风听海9 分钟前
神经网络之理解梯度和方向导数
人工智能·深度学习·神经网络
亚马逊云开发者22 分钟前
亚马逊云科技 WAF 指南(十)用 Amazon Q Developer CLI 解决 DDoS 防护与 SEO 冲突问题
人工智能
攻城狮7号40 分钟前
吴恩达的Agentic AI新课:让AI学会“干活”,而不只是“答题”
人工智能·ai课程·吴恩达·agentic ai
Dave.B1 小时前
vtkImageThreshold 图像阈值处理指南:从基础到实战优化
图像处理·人工智能·计算机视觉
Hody911 小时前
【XR硬件系列】AR眼镜的终极形态会是“普通眼镜”吗?技术瓶颈还有哪些?
人工智能·ar·xr
羊羊小栈1 小时前
基于「多模态大模型 + BGE向量检索增强RAG」的新能源汽车故障诊断智能问答系统(vue+flask+AI算法)
vue.js·人工智能·算法·flask·汽车·毕业设计·大作业
山烛1 小时前
深入解析 YOLO v2
人工智能·yolo·计算机视觉·目标跟踪·yolov2
GISer_Jing1 小时前
AI/CICD/Next/React Native&Taro内容
人工智能·react native·taro