VLLM历次会议(2024.7)

支持LLama3.1:

量化:

vllm git下的子项目:llm-compressor

CPU offloading

允许跑更大的模型;会变慢些;在CPU-GPU之间有NVLink的机器上,变慢的幅度小。

新增对Medusa(用1个Head并行推出好几个output tokens)和MLP-Speculor(考虑output token的上下文依赖):

相关推荐
安逸sgr3 小时前
优化器是什么?SGD、Momentum、Adam 有什么区别?
人工智能·ai·大模型·agent·智能体
小田学Python16 小时前
重新定义 Agent:为什么大模型不能直接干活,需要一层“壳”
大模型·api·ai agent
白拾18 小时前
【arXiv 2026】Nemotron-Labs-Diffusion:三模式语言模型 统一自回归、扩散与自推测解码|从大模型推理加速视角
大模型·推理加速·扩散语言模型·并行解码·自推测解码·arxiv 2026
dozenyaoyida20 小时前
AI与大模型新闻日报 | 2026-08-13
人工智能·ai·大模型·新闻
thesky1234561 天前
27届大模型面试准备(二十九):长文本推理与高效注意力——FlashAttention、稀疏/线性注意力与推理侧长度外推
大模型·面试准备·flashattention·推理优化·稀疏注意力·长文本推理·长度外推
tachibana21 天前
文件上传分布式限流如何做?
人工智能·ai·大模型·llm·prompt
智码看视界1 天前
Day49-AI微服务化-将大模型能力封装为标准微服务
java·微服务·ai·架构·大模型·sse流式输出·ai中台
程序员老陆1 天前
OpenGL 在视频渲染里的角色:它到底加速了什么?
音视频·gpu·opengl
安逸sgr1 天前
激活函数有什么用?Sigmoid、Tanh、ReLU 到底怎么选?
人工智能·ai·大模型·agent·智能体