大模型部署

虎虎(_ _)。゜zzZ4 天前
mysql·aigc·fastapi·大模型部署·lifespan·python异步
FastAPI-lifespan生命周期管理实战先看老写法:看起来没毛病,用的人也不少。但 Starlette 团队废弃它是有道理的:核心问题:startup 和 shutdown 是两个独立函数,但它们要共享的资源和状态只能挂在全局或 app.state 上。
谢白羽9 天前
笔记·llm·论文·agent·vllm·大模型部署·sglang
SGLang模型加载过程笔记1.如果dp_size大于1 PP = 2 TP = 2 DP = 1因此会创建:2.如果dp_size大于1 DP Controller 根据轮询、当前请求数或 Token 数,把每个请求交给负载较低的模型副本。
傲笑风9 天前
人工智能·文本转语音·大模型部署
【Audio】Qwen3-TTS-12Hz-1.7B-CustomVoice服务化部署和请求
维核科技9 天前
私有化部署·模型部署·大模型部署·私有化大模型部署
装了一周环境,还没跑起来一个模型一个工程师的依赖地狱求生手记一 那个让我失眠三晚的周五下午事情是这样的。领导说下周要给客户做一场私有化部署的演示,让我把 Qwen-7B 先跑起来。我看了看那台服务器:单卡 RTX 4090,Ubuntu 22.04,驱动 525,觉得挺稳的。我以为最多两天,毕竟 Qwen-7B 已经是开源社区验证过无数遍的模型。
缘友一世10 天前
开源项目·vllm·大模型部署·项目复盘·a800·minimax-m3
MiniMax-M3 on A800:部署、Bug 修复与压测完整复盘参考链接:环境变量:系列文章:
江厌0110 天前
大模型部署·deepseek·ai工作站·商红科技·联想thinkstation
DeepSeek V4本地部署实战:联想ThinkStation P7+商红科技全流程交付解析2026年1月,DeepSeek V4正式版发布,以671B参数总规模、MoE架构激活37B参数的创新设计,让企业本地部署AI大模型不再是遥不可及的梦想。但一个现实问题摆在面前:如何选择一台既能跑通DeepSeek V4,又不至于让预算爆表的AI工作站?
缘友一世11 天前
vllm·大模型部署·a800·glm5.2 nvfp4
GLM-5.2-NVFP4 在 8×A800 上部署实战(下)上篇讲了为什么 A800 跑不了 GLM-5.2,以及如何打补丁、修 API 漂移。本篇进入实操:构建镜像、启动、验证、踩坑和性能数据。 配套开源仓库:glm52-nvfp4-a800-vllm-deploy(Gitee)。
缘友一世11 天前
vllm·大模型部署·a800·glm5.2 nvfp4
GLM-5.2-NVFP4 在 8×A800 上部署实战(上)背景:把官方主打 Blackwell(B200/B300)的 GLM-5.2-NVFP4 模型,硬塞到 8 张中国特供版 A800(sm80)上,实测单流 74–85 tok/s,4 并发 × 32k 上下文可跑通。
谢白羽13 天前
llm·agent·tts·vllm·大模型部署
vLLM-Omni 部署 IndexTTS 2.51.第一阶段:autoregressive talker(自回归 Talker 模块) 输入文本,不直接生成音频,输出语义编码(semantic codes)。 语义编码是中间抽象表示:包含说话内容、韵律、停顿、音色信息,是离散 token 序列。
Albart57518 天前
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案本文为生产级 vLLM 多卡分布式部署踩坑复盘,聚焦全网高频疑难问题:CUDA error: worker 进程异常退出。
维核科技20 天前
私有化部署·大模型部署·私有化大模型部署
训练推理一致性:大模型投产的“最后一公里”从实验室到生产线的精度保卫战一、上线即翻车的“最后一公里”去年某头部电商在大促前夜上线新版智能客服大模型。离线评测中,新模型在意图识别基准上比旧版高出 4.2 个百分点,团队信心满满。然而上线半小时后,后台告警接连触发:用户投诉“答非所问”的量级激增三倍,长尾问题的拒答率从 1.1% 跳到 6.8%。紧急回滚复盘后才发现,问题不在模型本身,而藏在“训练推理不一致”里——模型在实验室跑的是 FP32、固定单批、确定性采样的干净环境,而线上是 INT8 量化、连续批处理、多副本并行的真实战场。
进军的码农25 天前
大模型部署·deepseek·qwen3·浪潮服务器·gpu服务器·glm-5.2
浪潮服务器怎么选?DeepSeek V4、GLM-5.2、Qwen3三大开源模型本地部署方案与代理商选购指南基于公开资料整理,不构成商业推荐。文中代理商信息均来自浪潮官方合作伙伴门户、爱企查、天眼查等公开渠道。
维核科技1 个月前
ai·私有化部署·llama·大模型部署·私有化大模型部署
Llama 3.3 vs Qwen2.5 vs DeepSeek-R1开源大模型选型实战对比一、选型背景:开源大模型格局剧变2024至2026年,开源大语言模型(LLM)生态经历了前所未有的洗牌。Meta的Llama系列、阿里云的Qwen系列以及深度求索(DeepSeek)旗下的R1/V3系列,共同构成了当前中文开发者圈最具影响力的三大开源阵营。三者在模型架构、训练范式、能力侧重与商业授权上各具特色,也让技术选型变得前所未有地复杂。
circuitsosk1 个月前
python·云原生·agent·vllm·推理加速·大模型部署·ensorrt-llm
不止于API调用:大模型推理加速与云原生服务化部署指南训练一个效果好、能力强的模型,在今天已经不再是最大的门槛。真正考验工程能力的,是把这个动辄几十GB、甚至上百GB的“巨兽”,在保障生成质量的前提下,用尽可能低的延迟和成本,稳定地服务成千上万的用户。
咋吃都不胖lyh2 个月前
大模型部署
VSCode 通过官方的 Remote - SSH 插件实现远程开发VSCode 通过官方的 Remote - SSH 插件实现远程开发:代码文件、运行环境、算力 / 显存全部在云服务器上,你本地的 VSCode 只是一个编辑界面,体验和在本地写代码几乎一致。
薛定谔的猫19822 个月前
大模型部署·lmdeploy
LMDeploy安装及部署 Qwen/Qwen3-0.6B教程https://internlm.intern-ai.org.cn/ 书生·浦语欢迎来到 LMDeploy 的中文教程! — lmdeploy 教程
rebibabo3 个月前
人工智能·vllm·推理加速·大模型部署·kvcache
KV Cache 与 PagedAttention 详解:理论推导 + RTX 3090 实测数据前两篇文章分别建立了 BF16 基线和 AWQ INT4 量化实验,我们发现了一个有趣的现象:AWQ 量化把模型权重从 14 GB 压缩到 4 GB,TPOT 降了 65%,但吞吐却翻了一倍多——这个倍数远超 TPOT 降幅能解释的范围。
Python私教3 个月前
人工智能·语言模型·qwen·ollama·本地大模型·大模型部署·deepseek
Cursor + Claude Code 全流程实战:搭一套生产级 AI 编程工作流(2026 最新版)这是专栏「AI编程实战:Cursor与Claude Code」的第 1 篇。读完你会得到一套可以照抄进真实项目的 AI 编程工作流:Cursor 与 Claude Code 各自的定位与协作分工、项目级提示词(rules)的写法、一个真实小项目从 0 到跑通的多文件改造、以及 8 个我在生产中真实踩过的报错的「原文 + 根因 + 解法」。不是"怎么装个插件试试看",而是"明天上班就能用上、还能少踩坑"。
小何code3 个月前
vllm·大模型部署·推理优化·pagedattention
人工智能【第55篇】大模型推理优化:vLLM与推理加速技术作者的话:随着大语言模型的规模不断增长,推理成本已成为AI应用落地的关键瓶颈。一个70B参数的模型,单次推理可能需要数GB显存和数秒延迟。vLLM等推理引擎通过PagedAttention、连续批处理等创新技术,将吞吐量提升了数十倍。本文将深入解析大模型推理优化的核心技术,并带你完成vLLM的实战部署!
碳基硅坊3 个月前
人工智能·llama·大模型部署
Qwen3.6-27B 本地部署三大工具:Ollama、LM Studio、llama.cpp 谁更快?阿里开源的 Qwen3.6-27B ,很多人想在本地跑起来。Ollama、LM Studio、llama.cpp 三个工具怎么选?