模型部署

缘友一世3 天前
模型部署·故障修复·deepseek·dsv4flash
DeepSeek-V4 长时运行宕机复盘 + 稳定性加固:为什么一个 5-token 请求会压垮整个服务2026-08-20 复盘一句话结论: 这不是"前缀缓存清理不掉" —— vLLM 前缀缓存是 LRU 自动淘汰。真正的根因是单个超长上下文请求的 decode 单步耗时随长度超线性增长, 最终压垮 worker, 而 vLLM 的 EngineCore 超时后不自愈, 导致服务永久僵死。
维核科技3 天前
私有化部署·模型部署·大模型部署·私有化大模型部署
装了一周环境,还没跑起来一个模型一个工程师的依赖地狱求生手记一 那个让我失眠三晚的周五下午事情是这样的。领导说下周要给客户做一场私有化部署的演示,让我把 Qwen-7B 先跑起来。我看了看那台服务器:单卡 RTX 4090,Ubuntu 22.04,驱动 525,觉得挺稳的。我以为最多两天,毕竟 Qwen-7B 已经是开源社区验证过无数遍的模型。
缘友一世4 天前
模型部署·模型推理·deepseek·moe model
在8×A800上把 DeepSeek-V4-Flash 榨到极限:从5倍提速到TP+EP双实例的完整实测单机 8 卡,双实例,一路从 50 tok/s 到 479 tok/s——我把每一步的决策、测量和踩坑都写在这里。
Lee_jerome10 天前
pytorch·边缘计算·rk3588·模型部署·onnx·resnet18·int8量化
从 PyTorch 权重到 RK3588 板端推理:ResNet18 二分类模型完整部署教程在边缘 AI 项目中,模型训练(PyTorch)与最终部署(RK35xx 系列 NPU 板卡)之间隔着一条"格式鸿沟":RKNN 工具链不能直接读取 *.pth,必须经过 ONNX 中间表示才能进入 Rockchip 的专有格式。这条链路看似只有两个转换命令,真正决定成败的却是预处理一致性、量化标定、运行库版本配套这些细节。
阿钱真强道19 天前
目标检测·模型部署·yolov8·int8量化
28 YOLOv8 ONNX输出的cls与box提取详解——从[1,84,8400]到检测框配套代码:本文末附完整可运行的 Python 代码演示,可复制到本地直接运行 一句话总结:YOLOv8 默认导出 ONNX 后,输出 [1, 84, 8400]——通道 0-3 是 box 坐标(值域 0~640),通道 4-83 是 cls 置信度(值域 0~1,已过 Sigmoid)。box 值域是 cls 的 ~700 倍。
Briwisdom1 个月前
模型部署·vllm·eagle·llama.cpp·prefill·speculative·decoding
Speculative Decoding:用小模型给大模型“打草稿“,推理加速 2-3×副标题: 大模型每生成一个 token 都要搬一次 KV Cache——瓶颈在搬数据,不在算。投机解码做的事就是:用更快的方式"猜"出几个 token 凑成一批,大模型一次验证,用"批处理"省掉重复搬运。
虎妞05003 个月前
pytorch·深度学习·ai·模型部署·cuda
PyTorch 2.0 生产级部署与性能优化指南torch.compile 通过图捕获和算子融合将训练速度提升 30-200%。三种模式:default(平衡)、reduce-overhead(小 batch 优化)、max-autotune(极致推理性能)。
小七-七牛开发者3 个月前
agent·llama·模型部署·ollama·本地模型
本地模型为什么能跑起来?从 llama.cpp 量化说起上周,Google 发布了 Gemma 4 12B。这个模型最大的亮点是,官方说它可以在 16GB VRAM 或 unified memory 的消费级笔记本上本地运行。
碳基硅坊3 个月前
人工智能·模型部署·gemma-4-26b-a4b
在Mac上跑26B大模型:M4 Max + MLX量化推理实测今天我们来聊聊在Mac Studio M4 Max(32核GPU)上,使用oMLX平台部署gemma-4-26B-A4B-it-QAT-MLX-4bit模型的真实性能表现。
weixin_468466853 个月前
人工智能·深度学习·ai·分类·数据挖掘·图像分类·模型部署
图像分类技术落地应用与实战指南在电商大促期间,面对海量新增 SKU,运营团队往往需要耗费数天时间手动分类商品属性并上架,不仅效率低下,还容易出现归类错误导致流量流失。而在医疗领域,放射科医生每天要审阅成百上千张影像片子,长时间的高强度工作难免产生视觉疲劳,细微的病灶极易被漏诊。这些看似截然不同的行业痛点,背后其实都指向同一个技术突破口:利用计算机视觉与深度学习技术,让机器具备“看”和“判断”的能力。
盼小辉丶3 个月前
android·pytorch·python·模型部署
PyTorch深度学习实战(55)——在Android上部署PyTorch模型我们已经学习了如何将 PyTorch 模型作为生产系统服务进行部署。虽然将机器学习 (Machine Learning, ML) 模型部署为云端服务仍是最主流的 ML 部署方式,但在以下场景中,我们需要将模型部署到移动设备:
小何code3 个月前
模型部署·mlops·mlflow·机器学习运维·模型监控
人工智能【第46篇】AI系统的模型监控与运维:MLOps实战指南作者的话:训练出一个性能优秀的AI模型只是第一步,如何将其稳定、高效地部署到生产环境,并持续监控和运维才是真正的挑战。MLOps借鉴DevOps理念,为机器学习系统全生命周期管理提供系统化方法论和工具链。
追巨4 个月前
ai·模型部署
H200 安装驱动并使用sglang启动模型机器信息 系统:rocklinux 9.4 架构:x86 前置操作:关闭防火墙和selinux如果没有互联网环境,可以使用iso文件搭建本地镜像仓库,这两个包的版本一定要和当前系统的内核版本一致
Pyeako5 个月前
人工智能·python·大模型·客户端·模型部署·服务端·路由-端口
大模型--模型部署模型部署(Model Deployment)是指将训练好的机器学习模型集成到实际的生产环境或应用系统中,使其能够接收输入数据(例如图片、文本、数值等),并实时或批量地输出预测结果,从而为最终用户或其他服务提供智能能力。
Emmamkq~~5 个月前
ai绘画·模型部署·图片生成
麦橘超然与Midjourney对比:可控性与版权优势分析你是否曾为一张AI生成图支付高昂订阅费,却无法完全掌控输出内容?或者担心商业使用时陷入版权纠纷?今天我们要聊的“麦橘超然”(MajicFLUX),正是一款试图打破这些限制的离线图像生成工具。
盼小辉丶6 个月前
人工智能·pytorch·深度学习·模型部署
PyTorch实战(30)——使用TorchScript和ONNX导出通用PyTorch模型我们已经深入探讨了 PyTorch 模型部署,这可能是将 PyTorch 模型投入生产系统中最关键的一环。在本节中,我们将聚焦另一个重要维度:模型导出。我们已经学习了如何在经典的 Python 脚本环境中保存和加载 PyTorch 模型。但是我们还需要更多的方式来导出 PyTorch 模型,主要是出于以下考虑:
盼小辉丶6 个月前
深度学习·transformer·模型部署
Transformer实战(36)——Transformer模型部署我们已经学习了如何从零开始训练和使用 Transformer 模型,还掌握了如何针对多种任务进行微调。但我们尚未学习如何在实际生产环境中部署这些模型。本节将介绍如何在生产环境中部署基于 Transformer 的自然语言处理 (Natural Language Processing, NLP) 解决方案。我们将介绍 TensorFlow Extended (TFX) 作为机器学习部署的解决方案。此外,还会讲解如何通过 FastAPI 等工具将 Transformer 模型作为 API 提供服务。还将了解
长路 ㅤ   6 个月前
模型部署·vllm·xinference·推理引擎·ai框架
快速了解VLLM推理引擎博主介绍:✌目前全网粉丝4W+,csdn博客专家、Java领域优质创作者,博客之星、阿里云平台优质作者、专注于Java后端技术领域。
盼小辉丶6 个月前
人工智能·pytorch·深度学习·模型部署
PyTorch实战(29)——使用TorchServe部署PyTorch模型在 PyTorch 深度学习模型部署一节,我们学习了如何使用 Flask 库创建可远程部署、通过网络提供预测服务的模型服务器。在本节中,我们将继续讨论使用 TorchServe 将一个已经训练并测试过的 PyTorch 深度学习模型对象部署到一个独立的环境中,使其能够对新输入数据进行预测或推理。这也称为模型的生产化,即将模型部署到生产系统中。
星野云联AIoT技术洞察7 个月前
深度学习·esp32·模型部署·aiot·esp-idf·ota升级·固件开发
ESP32 Edge AI 架构设计:固件、OTA 与端侧推理的完整实践在传统的 IoT 架构中,传感器数据通常被透传至云端进行处理。然而,随着带宽成本的提升、隐私需求的加剧以及实时性要求的演进,边缘 AI(Edge AI) 已成为工业与智能家居领域的必然选择。