VLLM历次会议(2024.7)

支持LLama3.1:

量化:

vllm git下的子项目:llm-compressor

CPU offloading

允许跑更大的模型;会变慢些;在CPU-GPU之间有NVLink的机器上,变慢的幅度小。

新增对Medusa(用1个Head并行推出好几个output tokens)和MLP-Speculor(考虑output token的上下文依赖):

相关推荐
songsong.2 小时前
一个简单通用的ChatLLM类设计与使用
大模型·openai·大语言模型
像风一样自由20209 小时前
20.Milvus常见问题检索不到维度错误和数据一致性
人工智能·大模型·milvus
这张生成的图像能检测吗20 小时前
(论文速读)Scaling Rectified Flow Transformers:Rectified Flow + MM-DiT 的高分辨率文生图路线
大模型·文生图·多模态·扩散模型·图像生成
蒸鱼Yuzheng20 小时前
游戏 Shader 与材质怎么测:丢失、变粉、编译卡顿与平台差异
gpu·游戏测试·shader测试·材质测试·图形兼容
众人皆醒我独醉1 天前
Kubernetes GPU 调度与管理的完整机制——从节点上架到 Pod 拿到 GPU
面试·kubernetes·gpu
是Yu欸1 天前
实测openPangu-2.0-Pro:昇腾原生, 505B大模型的开源答卷
人工智能·开源·大模型·昇腾·pangu
Tom·Ge1 天前
【AI前沿】2026.08.17 SpaceX 600亿收购Cursor正式完成·DeepSeek V4 Pro万亿开源·人形机器人生态全面爆发
人工智能·大模型·ai前沿
程序员-Benothing2 天前
OpenAI断供Cursor:当AI巨头开始“清理门户“,开源生态的中立性还能撑多久?
人工智能·开源·大模型
thesky1234562 天前
27届大模型面试准备(七十三):大模型强化学习对齐工程实战——RLHF、PPO 与 GRPO 的训练流水线
大模型·rlhf·奖励模型·ppo·dpo·grpo·强化学习对齐
tachibana22 天前
微调和 RAG 各自的优劣势是什么?
人工智能·ai·大模型·llm·agent