大模型部署

维核科技4 天前
私有化部署·本地部署·大模型部署·维核智创·gpu服务器维修
知识库增量更新:让“新鲜事”实时可用业务知识每天都在变:新产品上线、政策更新、流程调整。知识库如果不能及时更新,再好用的 RAG 也会“答过时的问题”。
论文复现现场5 天前
模型量化·vllm·a100·大模型部署·int8·fp8·qwen3.8
A100 跑 Qwen3.8-27B,FP8 还是 INT8?显存、速度、精度与微调兼容性怎么选直接结论:在算家云 A100 SXM4 80GB 环境验证 Qwen3.8-27B 时,建议先用 BF16 建立基线,再重点测试 INT8 W8A8。FP8 在 A100 上通常只能走权重-only 兼容路径,不能直接套用 H100 的 FP8 性能结论。
维核科技5 天前
私有化部署·本地部署·大模型部署·离线部署·维核智创
AI 网络安全:攻防的新战线当 AI 越来越强,攻防两端都发生了变化。攻击者用 AI 自动挖掘漏洞、生成钓鱼内容,防守者也开始用 AI 实时识别威胁、自动响应。
维核科技7 天前
私有化部署·本地部署·大模型部署·离线部署
冷启动与预热优化大模型服务最尴尬的时刻,往往是“刚启动”的那几分钟——模型要加载、显存要分配,请求全在排队。这个冷启动问题,值得专门优化。
爱上纯净的蓝天8 天前
人工智能·大模型·私有化部署·agent·大模型部署
自包含推理一体机四层架构拆解:128G 统一内存、256K 上下文与实测口径现在有一类设备,把推理引擎、计量网关、任务沙箱、智能体编排四层软件预置进一台 1.2 公斤的小机器,通电、接网、登录就能用,不用自己搭环境。这篇文章拆它的分层结构,重点是参数口径和容易踩的坑,所有性能数字都标清来源和边界。
论文复现现场9 天前
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
11路没有终点10 天前
大模型部署
从 0 到 1:华为昇腾部署 Qwen3-30B-A3B 大模型推理服务前置检查命令:⚠️ 官方文档明确:Atlas A2(64GB 单卡)运行 Qwen3-30B-A3B,tensor-parallel-size 至少为 2;如果是 32GB 显存版本则至少 4。910B4 为 64GB,推荐 TP=2 或 TP=4,配合专家并行效果最佳。
谢白羽10 天前
笔记·llm·论文·大模型部署·sglang
MiniMax-H3 : 4卡 H20-3e一套权重部署实践/8卡H200部署优化实测H3-Base 将各模态编码后组织为统一序列,由同一个 Omni Transformer 联合预测视频与音频的潜在表示,再交给各自的 VAE 解码。文字和视觉条件会经过 H3-Encoder,视觉内容还通过 Visual VAE 表示,音频则由 Audio VAE 编码。这使参考素材的类型和长度都可能改变工作量;只验证文本生成,不能覆盖有声视频或混合参考的编码路径。
虎虎(_ _)。゜zzZ25 天前
mysql·aigc·fastapi·大模型部署·lifespan·python异步
FastAPI-lifespan生命周期管理实战先看老写法:看起来没毛病,用的人也不少。但 Starlette 团队废弃它是有道理的:核心问题:startup 和 shutdown 是两个独立函数,但它们要共享的资源和状态只能挂在全局或 app.state 上。
谢白羽1 个月前
笔记·llm·论文·agent·vllm·大模型部署·sglang
SGLang模型加载过程笔记1.如果dp_size大于1 PP = 2 TP = 2 DP = 1因此会创建:2.如果dp_size大于1 DP Controller 根据轮询、当前请求数或 Token 数,把每个请求交给负载较低的模型副本。
傲笑风1 个月前
人工智能·文本转语音·大模型部署
【Audio】Qwen3-TTS-12Hz-1.7B-CustomVoice服务化部署和请求
维核科技1 个月前
私有化部署·模型部署·大模型部署·私有化大模型部署
装了一周环境,还没跑起来一个模型一个工程师的依赖地狱求生手记一 那个让我失眠三晚的周五下午事情是这样的。领导说下周要给客户做一场私有化部署的演示,让我把 Qwen-7B 先跑起来。我看了看那台服务器:单卡 RTX 4090,Ubuntu 22.04,驱动 525,觉得挺稳的。我以为最多两天,毕竟 Qwen-7B 已经是开源社区验证过无数遍的模型。
缘友一世1 个月前
开源项目·vllm·大模型部署·项目复盘·a800·minimax-m3
MiniMax-M3 on A800:部署、Bug 修复与压测完整复盘参考链接:环境变量:系列文章:
江厌011 个月前
大模型部署·deepseek·ai工作站·商红科技·联想thinkstation
DeepSeek V4本地部署实战:联想ThinkStation P7+商红科技全流程交付解析2026年1月,DeepSeek V4正式版发布,以671B参数总规模、MoE架构激活37B参数的创新设计,让企业本地部署AI大模型不再是遥不可及的梦想。但一个现实问题摆在面前:如何选择一台既能跑通DeepSeek V4,又不至于让预算爆表的AI工作站?
缘友一世1 个月前
vllm·大模型部署·a800·glm5.2 nvfp4
GLM-5.2-NVFP4 在 8×A800 上部署实战(下)上篇讲了为什么 A800 跑不了 GLM-5.2,以及如何打补丁、修 API 漂移。本篇进入实操:构建镜像、启动、验证、踩坑和性能数据。 配套开源仓库:glm52-nvfp4-a800-vllm-deploy(Gitee)。
缘友一世1 个月前
vllm·大模型部署·a800·glm5.2 nvfp4
GLM-5.2-NVFP4 在 8×A800 上部署实战(上)背景:把官方主打 Blackwell(B200/B300)的 GLM-5.2-NVFP4 模型,硬塞到 8 张中国特供版 A800(sm80)上,实测单流 74–85 tok/s,4 并发 × 32k 上下文可跑通。
谢白羽1 个月前
llm·agent·tts·vllm·大模型部署
vLLM-Omni 部署 IndexTTS 2.51.第一阶段:autoregressive talker(自回归 Talker 模块) 输入文本,不直接生成音频,输出语义编码(semantic codes)。 语义编码是中间抽象表示:包含说话内容、韵律、停顿、音色信息,是离散 token 序列。
Albart5751 个月前
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案本文为生产级 vLLM 多卡分布式部署踩坑复盘,聚焦全网高频疑难问题:CUDA error: worker 进程异常退出。
维核科技1 个月前
私有化部署·大模型部署·私有化大模型部署
训练推理一致性:大模型投产的“最后一公里”从实验室到生产线的精度保卫战一、上线即翻车的“最后一公里”去年某头部电商在大促前夜上线新版智能客服大模型。离线评测中,新模型在意图识别基准上比旧版高出 4.2 个百分点,团队信心满满。然而上线半小时后,后台告警接连触发:用户投诉“答非所问”的量级激增三倍,长尾问题的拒答率从 1.1% 跳到 6.8%。紧急回滚复盘后才发现,问题不在模型本身,而藏在“训练推理不一致”里——模型在实验室跑的是 FP32、固定单批、确定性采样的干净环境,而线上是 INT8 量化、连续批处理、多副本并行的真实战场。
进军的码农2 个月前
大模型部署·deepseek·qwen3·浪潮服务器·gpu服务器·glm-5.2
浪潮服务器怎么选?DeepSeek V4、GLM-5.2、Qwen3三大开源模型本地部署方案与代理商选购指南基于公开资料整理,不构成商业推荐。文中代理商信息均来自浪潮官方合作伙伴门户、爱企查、天眼查等公开渠道。