pytorch

海天一色y17 小时前
pytorch·onnx
模型部署的「通用语」:ONNX 转换摘要:你花了三个月把模型 mAP 刷到了 SOTA,老板说「下周上线」,然后你发现——训练用的 PyTorch 推理引擎不认、生产机是张老旧的 Intel CPU、客户要在边缘盒子上跑、QPS 要求 2000 而你的 model() 只能跑到 60。这几乎是每个算法工程师都会撞上的墙:训练和部署,是两个世界。
Thomas.Sir1 天前
pytorch·ai
第26课:工业零部件外观缺陷检测系统:从学术Demo到产线工程的重构实战关键词:PyTorch 工业质检 缺陷检测 阈值寻优 ONNX 部署 FastAPI 类别不平衡 工程化
Zguigo2 天前
人工智能·pytorch·深度学习
【CUDA6】CUDA Stream 是什么,为什么 CUDA 是异步执行,如何正确测量 GPU 时间以及多个任务如何重叠执行之前在实验中我们写过c_gpu = a_gpu + b_gpu,CPU 执行这行代码时,并不是一定要等 GPU 把加法彻底做完,CPU 发出任务后,可以继续干自己的事情,CUDA默认一个非常重要的特性:CPU 发起 GPU 工作,GPU 异步执行,它更像是CPU–CUDA Stream–KernelA,B,C–GPU执行,Stream就是组织这些GPU工作的机制之一,这也是我们写torch.cuda.synchronize()的原因,它实现了CPU 等 GPU,把当前已经提交的工作执行完。
论文复现现场2 天前
人工智能·pytorch·python·深度学习·cuda·rtx3090
RTX 3090 24GB 适合科研吗?单卡论文复现、PyTorch 显存检查与 OOM 排错RTX 3090 24GB 适合不少单卡深度学习科研实验,包括图像分类、二维分割、小模型微调和部分量化大模型实验。是否够用,要看训练方式、输入尺寸和批大小;能启动程序,也不等于能复现论文指标。
论文复现现场2 天前
pytorch·深度学习·云计算·gpu
AutoDL、算家云与公有云 GPU 怎么选?环境复现、计费与断点恢复对比个人开发者先看环境搭建和完整成本,科研用户先看版本复现与任务恢复,企业团队先看网络、权限和运维接入。选择 GPU 平台,应先明确任务约束,再用同一套验收流程筛选。
盘古开天16663 天前
人工智能·pytorch·算法
PPO算法代码实战(三):PyTorch从零实现PPO求解CartPole前面两篇文章我们详细讲解了PPO算法的原理,从策略梯度到TRPO,再到PPO的Clip机制。光说不练假把式,本篇我们就用PyTorch从零实现一个完整的PPO算法,在经典的CartPole平衡杆环境上跑通训练流程。
Είναι η κοπέλα3 天前
人工智能·pytorch·python
PyTorch 安装与验证系列第 2 篇。上一篇 GPU 底座打完,本篇装本地 AI 的核心框架 PyTorch。重点解决四个问题:去 pytorch.org 选择器怎么选 pip 命令;cu124 / cu118 / cpu 三种 wheel 怎么选;国内怎么加速;装完用哪三步验证"真的上卡了"。读完你能装出一个 torch.cuda.is_available() 返回 True 的环境,并避开 32 位 Python、CPU 版装成默认这两类最阴的坑。
盼小辉丶4 天前
人工智能·pytorch·深度学习·强化学习
PyTorch强化学习实战(27)——进化策略在强化学习中的应用在本节中,我们将改变对强化学习 (Reinforcement Learning, RL) 训练的视角,转而讨论黑盒优化方法,它们在大规模 RL 问题中具有适用性,并能与价值迭代和策略梯度方法竞争。尽管存在时间较长,这类方法在某些情境下仍然更具效率。具体而言,本节将介绍黑盒优化方法:进化策略。
weixin_447195294 天前
pytorch·python
【无标题】面向有一点 Python、但没有机器学习背景的读者。全文用一个「预测 RNA 碱基」的四分类例子贯穿,所有数字都可复现。
bigdata-余建新4 天前
人工智能·pytorch·深度学习
week2目标: 尝试完成一个多分类任务的训练:一个随机向量,哪一维数字最大就属于第几类。内容:
HwJack204 天前
pytorch·harmonyos·材质
【共创稿事节】HarmonyOS 7材质与光照:真实感的营造与性能的平衡一块界面元素看起来"真不真",取决于两件事:它的表面是什么材质,以及光是怎么打到它上面的。材质给了物体性格,光照给了物体体积,两者叠加才有立体感。问题在于,真实感的东西都要算——模糊要算、反射要算、阴影要算,而空间计算的每一帧都紧张。设计的功夫在于知道哪些能省、哪些不能省。
头发够用的程序员5 天前
c++·人工智能·pytorch·python·深度学习·边缘计算·jetson
TensorRT 自定义算子插件实战(一):从零手写 customScaledTanh但上一篇结尾我特别强调过:这其实只是 “上半场”。导出的那个 custom::xxx 节点只是个 “空壳”——onnxruntime 跑不了,TensorRT 也跑不了,因为 TensorRT 根本不知道这个节点该怎么算。
论文复现现场5 天前
pytorch·深度学习·cuda·rtx5090
RTX 5090 32GB 适合科研计算吗?单卡训练、推理、论文复现与 OOM 判断方法RTX 5090 的 32GB 显存可作为许多单卡论文复现、7B/8B 推理与 QLoRA、常见视觉训练的候选;全参数大模型训练、FP64 密集计算和超大样本不应只看显存下结论。
论文复现现场5 天前
开发语言·pytorch·batch·cuda·rtx3090
论文复现看到“RTX 3090 or higher”:显存、CUDA、batch size 与 OOM 怎么判断?“RTX 3090 or higher”通常表示作者至少在24GB显存、Ampere级CUDA环境中验证过,不代表显卡型号越新就一定能运行。应先看显存峰值,再检查CUDA兼容性,最后用最小输入实跑。
zh路西法5 天前
pytorch·python·神经网络·cnn·resnet·resnet18
【ResNet18】从图像到视觉特征:卷积神经网络如何理解图像Input 输入图像Conv2d 卷积Feature Map 特征图Conv2d 卷积Feature Map 特征图
FPGA小徐5 天前
pytorch·yolo·ubuntu
Ubuntu 22.04 安装 Miniconda、PyTorch 与 YOLOv8 并完成 CPU 推理本文记录在 VMware Ubuntu 22.04 虚拟机中安装 Miniconda、PyTorch CPU 版和 Ultralytics YOLOv8,并使用 YOLOv8n 对示例图片进行目标检测的完整过程。
CAE虚拟与现实6 天前
人工智能·pytorch·scikit-learn
PyTorch和scikit-learn的区别PyTorch 和 scikit-learn 是 Python 机器学习生态里两个定位完全不同的库。简单说:scikit-learn 是“传统机器学习工具箱”,PyTorch 是“深度学习框架”。
程序猿编码6 天前
c语言·人工智能·pytorch·神经网络·卷积神经网络·大模型推理
不用 PyTorch!纯 C 实现 N 维张量 + 反向传播,完成手写数字识别训练深度学习框架的本质是什么? PyTorch、TensorFlow这类框架底层核心就是张量存储 + 算子实现 + 自动微分引擎。很多同学学习深度学习,直接调用高层API,只懂调包,不明白反向传播、梯度怎么一步步算出来。
技术狂人1686 天前
pytorch·具身智能·deepspeed·世界动作模型·idm逆动力学
WAM-Trainer世界动作模型训练实战:IDM/FDM模块化架构与DeepSpeed ZeRO-2多卡训练最近把WAM-Trainer这个世界动作模型训练平台完整跑了一遍,从5.18亿帧第一视角数据的清洗对齐,到IDM逆动力学和FDM前动力学的模块化训练,再到8×A100上用DeepSpeed ZeRO-2跑通,最后WebSocket策略服务器把推理延迟压到150ms。LIBERO跑到99.3%,这里把工程上几个关键模块的代码和配置记录下来,方便做具身智能方向的同学参考。