VLLM历次会议(2024.7)

支持LLama3.1:

量化:

vllm git下的子项目:llm-compressor

CPU offloading

允许跑更大的模型;会变慢些;在CPU-GPU之间有NVLink的机器上,变慢的幅度小。

新增对Medusa(用1个Head并行推出好几个output tokens)和MLP-Speculor(考虑output token的上下文依赖):

相关推荐
weixin_666593995 小时前
自然资源时空智能体建设方案:从数字化到智能化的演进路径
大数据·人工智能·大模型·云计算·agent·云平台·空间数据库
aqi005 小时前
15天学会AI应用开发(十六)LangChain实现对话记忆功能
人工智能·python·大模型·ai编程·ai应用
zzzll11115 小时前
Agent 开发的五种架构范式及选型思路
人工智能·架构·大模型·llm
Pokerhead6 小时前
如何评价 DeepSeek-V4 的价格?
人工智能·大模型·ai编程·deepseek
user-猴子7 小时前
AiPy + Kimi K3:2048小游戏生成的技术分析
人工智能·语言模型·大模型·prompt
GPUStack1 天前
怎么优雅地在GPUStack上使用minerU?
ai·大模型·llm·gpu·vllm·gpu集群·gpustack
薛定谔的猫19821 天前
LLaMA Factory微调中的模版在vLLM或LMDeploy框架部署中对齐
大模型·微调·vllm·模版·llama factory·lmdeploy·对话模板
Pokerhead1 天前
如何评价 OpenAI 的超级对话模型 ChatGPT ?
人工智能·chatgpt·大模型·openai·ai编程
晓子文集1 天前
Tushare接口文档:现金流量表(cashflow)
大数据·数据库·大模型·金融数据·量化投资·tushare
牧子川1 天前
何时拒绝使用工具:Agent 不是万能钥匙
人工智能·大模型·agent·tools·functioncalling