模型部署

HIT_Weston6 天前
人工智能·模型部署
242、【AI】【模型部署】基座模型研究:注意力机制深入【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除
HIT_Weston6 天前
人工智能·模型部署
15、【数学】【基础】欧拉公式是怎么来的:从级数、微分方程到旋转【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除
I Am a robert girl7 天前
深度学习·模型部署·量化·kv cache·线性注意力·显存优化·循环状态
STEPQuant:Delta-Rule 循环状态量化中,误差何时何地才真正致命从今天觉醒,技术赋予每一个人数字生命当你把一个聊天模型部署成服务时,最先撞上的墙往往不是算力,而是显存。传统 Transformer 的注意力机制需要一个随序列长度线性增长的 KV Cache——上下文越长,缓存越大。线性注意力(Linear Attention)及其变体用固定大小的**循环状态(recurrent state)**替代了这份不断膨胀的缓存,把内存占用从 O(n) 压到 O(1),这在长上下文并发服务场景里几乎是救命稻草。
HIT_Weston9 天前
人工智能·模型部署
239、【AI】【模型部署】基座模型研究:反向传播的已知、所求与场景【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除
智码看视界10 天前
nvidia·模型部署·mlops·triton·gpu推理·推理服务化·动态批处理
AI 推理优化 | Triton Inference Server 架构解析:单机多模型并发推理的工业级方案一个典型的算法团队,线上跑的模型往往不止一个:CV 类、NLP 类、推荐类、自研 PyTorch 模型。最常见的"朴素部署"是:
Java的搬运工10 天前
python·机器学习·docker·fastapi·模型部署·mlops·ai工程化
【无标题】你大概用过不少健康管理类的App——输入年龄、性别、BMI、血压,再填几项血液指标,它就能给出一个风险评分或健康提示。
HIT_Weston12 天前
人工智能·模型部署
233、【AI】【模型部署】基座模型研究:基座与 Instruct 的差别【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除
蔡俊锋18 天前
大模型·模型部署·ai架构·国产算力·华为昇腾
华为昇腾 960 超节点发布:4096 卡、5500 个光引擎替 4.8 万光模块——国产算力拐点到了吗?核心结论:9 月 17 日华为全联接大会发布昇腾 960 超节点——全球首个采用 NPO 光引擎的超节点,单节点 4096 卡、5500 个自研光互联产品替代原本需要的 4.8 万颗 800G 光模块,功耗直降 550 多千瓦,系统可用度 99.8%。配合灵衢互联协议和多轨道拓扑,最大可扩到 100 万卡集群。对企业架构师的含义是:国产算力正在从"能用"跨到"好用"——智谱刚把 2026 年 ARR 指引从 24 亿美元上调到 30 亿美元,验证了这条路线的商业化闭环。 这篇文章从工程视角拆解 NPO 光
进阶的猪18 天前
rknn·模型部署·c api
RKNN C API模型部署完整流程参考文档 https://github.com/airockchip/rknn-toolkit2/blob/master/doc/01_Rockchip_RKNPU_Quick_Start_RKNN_SDK_V2.3.2_CN.pdf 配置 源码 tag v1.6.0 Python 3.8 Conda 环境 rknndemo Toolkit2 1.6.0 rknn_model_zoo v1.6.0 Runtime 1.6.0 rknn_api.h 1.6.0 GCC 7.5.0 Driver 0.8.2
HIT_Weston20 天前
人工智能·模型部署
227、【AI】【模型部署】基座模型研究:RoPE 旋转位置编码【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除
HIT_Weston24 天前
人工智能·模型部署
224、【AI】【模型部署】基座模型研究:Qwen2 架构总览与 config 对照【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除
thesky12345625 天前
人工智能·深度学习·模型部署
用 ONNX Runtime 把 PyTorch 模型变成跨平台极速推理引擎:导出、优化、量化完整实训练完一个 PyTorch 模型,下一步往往是 deployment 噩梦:生产环境没有 Python、没有 CUDA,甚至要跑在 Windows 工控机或浏览器里。直接 pip install torch 把模型塞进服务端的做法,既重又慢,还绑死了技术栈。
HIT_Weston1 个月前
人工智能·模型部署
214、【AI】【模型部署】阿里云 PAI:从开发到部署的一站式平台【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除
缘友一世1 个月前
模型部署·故障修复·deepseek·dsv4flash
DeepSeek-V4 长时运行宕机复盘 + 稳定性加固:为什么一个 5-token 请求会压垮整个服务2026-08-20 复盘一句话结论: 这不是"前缀缓存清理不掉" —— vLLM 前缀缓存是 LRU 自动淘汰。真正的根因是单个超长上下文请求的 decode 单步耗时随长度超线性增长, 最终压垮 worker, 而 vLLM 的 EngineCore 超时后不自愈, 导致服务永久僵死。
维核科技1 个月前
私有化部署·模型部署·大模型部署·私有化大模型部署
装了一周环境,还没跑起来一个模型一个工程师的依赖地狱求生手记一 那个让我失眠三晚的周五下午事情是这样的。领导说下周要给客户做一场私有化部署的演示,让我把 Qwen-7B 先跑起来。我看了看那台服务器:单卡 RTX 4090,Ubuntu 22.04,驱动 525,觉得挺稳的。我以为最多两天,毕竟 Qwen-7B 已经是开源社区验证过无数遍的模型。
缘友一世1 个月前
模型部署·模型推理·deepseek·moe model
在8×A800上把 DeepSeek-V4-Flash 榨到极限:从5倍提速到TP+EP双实例的完整实测单机 8 卡,双实例,一路从 50 tok/s 到 479 tok/s——我把每一步的决策、测量和踩坑都写在这里。
Lee_jerome2 个月前
pytorch·边缘计算·rk3588·模型部署·onnx·resnet18·int8量化
从 PyTorch 权重到 RK3588 板端推理:ResNet18 二分类模型完整部署教程在边缘 AI 项目中,模型训练(PyTorch)与最终部署(RK35xx 系列 NPU 板卡)之间隔着一条"格式鸿沟":RKNN 工具链不能直接读取 *.pth,必须经过 ONNX 中间表示才能进入 Rockchip 的专有格式。这条链路看似只有两个转换命令,真正决定成败的却是预处理一致性、量化标定、运行库版本配套这些细节。
阿钱真强道2 个月前
目标检测·模型部署·yolov8·int8量化
28 YOLOv8 ONNX输出的cls与box提取详解——从[1,84,8400]到检测框配套代码:本文末附完整可运行的 Python 代码演示,可复制到本地直接运行 一句话总结:YOLOv8 默认导出 ONNX 后,输出 [1, 84, 8400]——通道 0-3 是 box 坐标(值域 0~640),通道 4-83 是 cls 置信度(值域 0~1,已过 Sigmoid)。box 值域是 cls 的 ~700 倍。
Briwisdom3 个月前
模型部署·vllm·eagle·llama.cpp·prefill·speculative·decoding
Speculative Decoding:用小模型给大模型“打草稿“,推理加速 2-3×副标题: 大模型每生成一个 token 都要搬一次 KV Cache——瓶颈在搬数据,不在算。投机解码做的事就是:用更快的方式"猜"出几个 token 凑成一批,大模型一次验证,用"批处理"省掉重复搬运。
虎妞05004 个月前
pytorch·深度学习·ai·模型部署·cuda
PyTorch 2.0 生产级部署与性能优化指南torch.compile 通过图捕获和算子融合将训练速度提升 30-200%。三种模式:default(平衡)、reduce-overhead(小 batch 优化)、max-autotune(极致推理性能)。