gpustack

GPUStack3 天前
ai·大模型·llm·gpu·vllm·gpu集群·sglang·gpustack
Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。
GPUStack9 天前
ai·大模型·模型推理·gpustack
Day 0 实测|在 GPUStack 上部署 GLM-5.2-FP8-DSpark本文由 GPUStack 社区用户实测分享整理。GLM-5.2-FP8-DSpark 是在 GLM-5.2-FP8 基础上,通过挂载 RedHatAI 提供的外置草稿模型(Speculator)做投机解码(Speculative Decoding)的增强方案——同一份主模型权重,额外加载一个草稿模型,用来提升解码吞吐。社区用户在模型放出当天(Day 0)就在 8 卡 H20-141G 环境上,通过 GPUStack 完成了部署,并和原生 GLM-5.2-FP8 做了同硬件对比压测。
GPUStack17 天前
ai·大模型·llm·gpu集群·gpustack
你的 GPU 算力,到底被谁、用在了哪儿?GPUStack 用量统计上线,一张图说清楚买了一堆 GPU,跑了一堆模型,月底老板问一句"这些卡到底用得值不值",你能答上来吗?如果答不上来,这篇文章你得看完。
Aray12343 个月前
vscode·ecc·gpustack·claude code
VS Code 中使用 Claude Code 调用 GPUStack 本地大模型及 ECC 安装教程在日常编程开发中,AI 编程助手能极大提升开发效率,Claude Code 作为 Anthropic 推出的智能编程工具,不仅支持代码生成、调试与重构,还可无缝对接 GPUStack 本地大模型,实现内网/离线开发辅助,搭配 ECC 插件更能解锁丰富的开发工作流。本文介绍了如何在 VS Code 中配置 Claude Code、调用 GPUStack 本地大模型,并完成 ECC 插件的安装与使用,帮助开发者快速搭建高效的 AI 编程环境。
GPUStack3 个月前
ai·性能调优·模型推理·gpustack·deepseek-v4
NVIDIA H200/H20 DeepSeek-V4-Pro 部署指南、压测性能与稳定性调优建议随着 DeepSeek 正式发布 DeepSeek-V4 系列,大模型的工程边界再次被明显推高。该系列基于 MoE 架构,提供了 DeepSeek-V4-Flash 284B 和 DeepSeek-V4-Pro 1.6T 两种规格,同时在推理阶段仅激活数十亿参数,在性能与成本之间取得了新的平衡。配合百万级上下文窗口与全新的注意力优化机制,其在长文本理解、复杂推理以及智能体任务中的表现,已经开始逼近甚至挑战当前主流闭源模型。
GPUStack3 个月前
大模型·ascend·模型推理·deepseek·gpustack
Day 0 部署:昇腾 910B DeepSeek-V4 部署指南与压测表现随着 DeepSeek 正式发布 DeepSeek-V4 系列,大模型的工程边界再次被明显推高。该系列基于 MoE 架构,提供了 DeepSeek-V4-Flash 284B 和 DeepSeek-V4-Pro 1.6T 两种规格,同时在推理阶段仅激活数十亿参数,在性能与成本之间取得了新的平衡。配合百万级上下文窗口与全新的注意力优化机制,其在长文本理解、复杂推理以及智能体任务中的表现,已经开始逼近甚至挑战当前主流闭源模型。
GPUStack5 个月前
ai·模型推理·gpustack·openclaw
Token 不再焦虑:用 GPUStack + OpenClaw 搭一个“无限用”的本地 AI 助手关注🌟⌈GPUStack⌋ 💻 一起学习 AI、GPU 管理与大模型相关技术实践。这两年,越来越多团队把 AI 接入了日常工作流。 但很快,一个现实问题摆在了面前:
GPUStack7 个月前
ai·wsl2·模型推理·gpustack·高性能推理
GPUStack Windows(WSL2)部署指南GPUStack v2 以高性能推理与生产级稳定性为核心演进方向,对整体架构进行了全面重构,实现了组件间的灵活解耦,并对多推理引擎和异构算力进行了深度优化,充分释放推理引擎在吞吐、延迟与并发方面的性能潜力。
我叫安查查7 个月前
linux·ubuntu·docker·gpustack
在Ubuntu系统上使用docker部署GPUStack教程【亲测成功】GPUStack 是一个开源的 GPU 集群管理器,用于统一纳管多平台、多厂商的算力资源并提供大模型推理服务。 它支持在Linux、Windows、macOS上管理 NVIDIA、AMD、Apple Silicon、昇腾、海光、摩尔线程等异构 GPU,覆盖 LLM、VLM、Embedding、Reranker、扩散图像、语音 STT/TTS 等多类型模型 提供OpenAI 兼容 API 与可视化控制台,便于快速搭建企业级私有模型服务。项目采用Apache License 2.0,代码托管于 GitHub
博士僧小星8 个月前
开源·大模型·gpu·gpustack
环境配置|GPUStack——为大模型而生的开源GPU集群管理器经过 Seal 研发团队几个月来持续的开发和测试,新产品 GPUStack发布,GPUStack 是一个用于运行 LLM(大型语言模型)的开源 GPU 集群管理器。尽管如今大语言模型作为公共的云上服务已经被广泛推广并在公有云上变得更加易于使用,但对企业来说,部署托管自己私有的 LLM 供企业和组织在私有环境使用仍然非常复杂。
胡耀超9 个月前
人工智能·docker·ai·大模型·milvus·rag·gpustack
AI应用开发入门,docker部署 Milvus + GPUStack (Attu+MinIO)的基础入门!熟悉完后可以整合dify:使用 Milvus 部署 Dify;统计用Directus自动生成REST API 和 GraphQL API接口,完整的 CRUD 功能;https://directus.io/
mzak1 年前
qwen·鲲鹏·昇腾·deepseek·gpustack
鲲鹏+昇腾部署集群管理软件GPUStack,两台服务器搭建双节点集群【实战详细踩坑篇】配置:2台鲲鹏32C2 + 2Atlas300I duo,之前看网上文档,目前GPUstack只支持910B芯片,想尝试一下能不能310P也部署试试,毕竟华为的集群软件要收费。 系统:openEuler22.03-LTS 驱动:24.1.rc3
我是有底线的