技术栈
模型部署
缘友一世
3 天前
模型部署
·
故障修复
·
deepseek
·
dsv4flash
DeepSeek-V4 长时运行宕机复盘 + 稳定性加固:为什么一个 5-token 请求会压垮整个服务
2026-08-20 复盘一句话结论: 这不是"前缀缓存清理不掉" —— vLLM 前缀缓存是 LRU 自动淘汰。真正的根因是单个超长上下文请求的 decode 单步耗时随长度超线性增长, 最终压垮 worker, 而 vLLM 的 EngineCore 超时后不自愈, 导致服务永久僵死。
维核科技
3 天前
私有化部署
·
模型部署
·
大模型部署
·
私有化大模型部署
装了一周环境,还没跑起来一个模型
一个工程师的依赖地狱求生手记一 那个让我失眠三晚的周五下午事情是这样的。领导说下周要给客户做一场私有化部署的演示,让我把 Qwen-7B 先跑起来。我看了看那台服务器:单卡 RTX 4090,Ubuntu 22.04,驱动 525,觉得挺稳的。我以为最多两天,毕竟 Qwen-7B 已经是开源社区验证过无数遍的模型。
缘友一世
4 天前
模型部署
·
模型推理
·
deepseek
·
moe model
在8×A800上把 DeepSeek-V4-Flash 榨到极限:从5倍提速到TP+EP双实例的完整实测
单机 8 卡,双实例,一路从 50 tok/s 到 479 tok/s——我把每一步的决策、测量和踩坑都写在这里。
Lee_jerome
10 天前
pytorch
·
边缘计算
·
rk3588
·
模型部署
·
onnx
·
resnet18
·
int8量化
从 PyTorch 权重到 RK3588 板端推理:ResNet18 二分类模型完整部署教程
在边缘 AI 项目中,模型训练(PyTorch)与最终部署(RK35xx 系列 NPU 板卡)之间隔着一条"格式鸿沟":RKNN 工具链不能直接读取 *.pth,必须经过 ONNX 中间表示才能进入 Rockchip 的专有格式。这条链路看似只有两个转换命令,真正决定成败的却是预处理一致性、量化标定、运行库版本配套这些细节。
阿钱真强道
19 天前
目标检测
·
模型部署
·
yolov8
·
int8量化
28 YOLOv8 ONNX输出的cls与box提取详解——从[1,84,8400]到检测框
配套代码:本文末附完整可运行的 Python 代码演示,可复制到本地直接运行 一句话总结:YOLOv8 默认导出 ONNX 后,输出 [1, 84, 8400]——通道 0-3 是 box 坐标(值域 0~640),通道 4-83 是 cls 置信度(值域 0~1,已过 Sigmoid)。box 值域是 cls 的 ~700 倍。
Briwisdom
1 个月前
模型部署
·
vllm
·
eagle
·
llama.cpp
·
prefill
·
speculative
·
decoding
Speculative Decoding:用小模型给大模型“打草稿“,推理加速 2-3×
副标题: 大模型每生成一个 token 都要搬一次 KV Cache——瓶颈在搬数据,不在算。投机解码做的事就是:用更快的方式"猜"出几个 token 凑成一批,大模型一次验证,用"批处理"省掉重复搬运。
虎妞0500
3 个月前
pytorch
·
深度学习
·
ai
·
模型部署
·
cuda
PyTorch 2.0 生产级部署与性能优化指南
torch.compile 通过图捕获和算子融合将训练速度提升 30-200%。三种模式:default(平衡)、reduce-overhead(小 batch 优化)、max-autotune(极致推理性能)。
小七-七牛开发者
3 个月前
agent
·
llama
·
模型部署
·
ollama
·
本地模型
本地模型为什么能跑起来?从 llama.cpp 量化说起
上周,Google 发布了 Gemma 4 12B。这个模型最大的亮点是,官方说它可以在 16GB VRAM 或 unified memory 的消费级笔记本上本地运行。
碳基硅坊
3 个月前
人工智能
·
模型部署
·
gemma-4-26b-a4b
在Mac上跑26B大模型:M4 Max + MLX量化推理实测
今天我们来聊聊在Mac Studio M4 Max(32核GPU)上,使用oMLX平台部署gemma-4-26B-A4B-it-QAT-MLX-4bit模型的真实性能表现。
weixin_46846685
3 个月前
人工智能
·
深度学习
·
ai
·
分类
·
数据挖掘
·
图像分类
·
模型部署
图像分类技术落地应用与实战指南
在电商大促期间,面对海量新增 SKU,运营团队往往需要耗费数天时间手动分类商品属性并上架,不仅效率低下,还容易出现归类错误导致流量流失。而在医疗领域,放射科医生每天要审阅成百上千张影像片子,长时间的高强度工作难免产生视觉疲劳,细微的病灶极易被漏诊。这些看似截然不同的行业痛点,背后其实都指向同一个技术突破口:利用计算机视觉与深度学习技术,让机器具备“看”和“判断”的能力。
盼小辉丶
3 个月前
android
·
pytorch
·
python
·
模型部署
PyTorch深度学习实战(55)——在Android上部署PyTorch模型
我们已经学习了如何将 PyTorch 模型作为生产系统服务进行部署。虽然将机器学习 (Machine Learning, ML) 模型部署为云端服务仍是最主流的 ML 部署方式,但在以下场景中,我们需要将模型部署到移动设备:
小何code
3 个月前
模型部署
·
mlops
·
mlflow
·
机器学习运维
·
模型监控
人工智能【第46篇】AI系统的模型监控与运维:MLOps实战指南
作者的话:训练出一个性能优秀的AI模型只是第一步,如何将其稳定、高效地部署到生产环境,并持续监控和运维才是真正的挑战。MLOps借鉴DevOps理念,为机器学习系统全生命周期管理提供系统化方法论和工具链。
追巨
4 个月前
ai
·
模型部署
H200 安装驱动并使用sglang启动模型
机器信息 系统:rocklinux 9.4 架构:x86 前置操作:关闭防火墙和selinux如果没有互联网环境,可以使用iso文件搭建本地镜像仓库,这两个包的版本一定要和当前系统的内核版本一致
Pyeako
5 个月前
人工智能
·
python
·
大模型
·
客户端
·
模型部署
·
服务端
·
路由-端口
大模型--模型部署
模型部署(Model Deployment)是指将训练好的机器学习模型集成到实际的生产环境或应用系统中,使其能够接收输入数据(例如图片、文本、数值等),并实时或批量地输出预测结果,从而为最终用户或其他服务提供智能能力。
Emmamkq~~
5 个月前
ai绘画
·
模型部署
·
图片生成
麦橘超然与Midjourney对比:可控性与版权优势分析
你是否曾为一张AI生成图支付高昂订阅费,却无法完全掌控输出内容?或者担心商业使用时陷入版权纠纷?今天我们要聊的“麦橘超然”(MajicFLUX),正是一款试图打破这些限制的离线图像生成工具。
盼小辉丶
6 个月前
人工智能
·
pytorch
·
深度学习
·
模型部署
PyTorch实战(30)——使用TorchScript和ONNX导出通用PyTorch模型
我们已经深入探讨了 PyTorch 模型部署,这可能是将 PyTorch 模型投入生产系统中最关键的一环。在本节中,我们将聚焦另一个重要维度:模型导出。我们已经学习了如何在经典的 Python 脚本环境中保存和加载 PyTorch 模型。但是我们还需要更多的方式来导出 PyTorch 模型,主要是出于以下考虑:
盼小辉丶
6 个月前
深度学习
·
transformer
·
模型部署
Transformer实战(36)——Transformer模型部署
我们已经学习了如何从零开始训练和使用 Transformer 模型,还掌握了如何针对多种任务进行微调。但我们尚未学习如何在实际生产环境中部署这些模型。本节将介绍如何在生产环境中部署基于 Transformer 的自然语言处理 (Natural Language Processing, NLP) 解决方案。我们将介绍 TensorFlow Extended (TFX) 作为机器学习部署的解决方案。此外,还会讲解如何通过 FastAPI 等工具将 Transformer 模型作为 API 提供服务。还将了解
长路 ㅤ
6 个月前
模型部署
·
vllm
·
xinference
·
推理引擎
·
ai框架
快速了解VLLM推理引擎
博主介绍:✌目前全网粉丝4W+,csdn博客专家、Java领域优质创作者,博客之星、阿里云平台优质作者、专注于Java后端技术领域。
盼小辉丶
6 个月前
人工智能
·
pytorch
·
深度学习
·
模型部署
PyTorch实战(29)——使用TorchServe部署PyTorch模型
在 PyTorch 深度学习模型部署一节,我们学习了如何使用 Flask 库创建可远程部署、通过网络提供预测服务的模型服务器。在本节中,我们将继续讨论使用 TorchServe 将一个已经训练并测试过的 PyTorch 深度学习模型对象部署到一个独立的环境中,使其能够对新输入数据进行预测或推理。这也称为模型的生产化,即将模型部署到生产系统中。
星野云联AIoT技术洞察
7 个月前
深度学习
·
esp32
·
模型部署
·
aiot
·
esp-idf
·
ota升级
·
固件开发
ESP32 Edge AI 架构设计:固件、OTA 与端侧推理的完整实践
在传统的 IoT 架构中,传感器数据通常被透传至云端进行处理。然而,随着带宽成本的提升、隐私需求的加剧以及实时性要求的演进,边缘 AI(Edge AI) 已成为工业与智能家居领域的必然选择。