pytorch

承渊政道2 小时前
人工智能·pytorch·开源·llm·chatglm
【从零开始大模型开发与微调:基于PyTorch与ChatGLM】(开源大模型ChatGLM使用详解)近几年,大模型技术的发展速度越来越快,但对于很多刚接触这一领域的开发者来说,真正的难点往往不是“知道有哪些模型”,而是如何把一个开源大模型真正跑起来、用起来,并进一步完成自己的应用开发.从环境配置、模型下载,到推理调用、参数设置、对话交互,再到后续的微调与部署,每一步都会遇到不少实际问题.在众多开源大模型中,ChatGLM 对中文场景支持较好,同时具备较完整的开源生态,非常适合作为学习大模型开发的入门对象.因此,本篇将围绕 ChatGLM 的实际使用 展开,结合PyTorch,从模型获取、环境搭建、加载运
129Lab20 小时前
pytorch·python·cfd·pinn·物理信息神经网络·仿真加速·电池热管理
电池热管理仿真的AI加速:用Python+PINN物理信息神经网络替代传统CFD的可行性探索🔍 你认为PINN在电池热管理领域的近期最可能落地场景是什么?A. 单体/模组级温度场快速预测(设计优化迭代)
Είναι η κοπέλα1 天前
开发语言·人工智能·pytorch·python·conda
llama.cpp 与 GGUF 格式:本地大模型的“裸引擎“本篇拆到"发动机"层:llama.cpp 是什么、GGUF 为什么成为本地模型的主流容器格式、Windows/Linux 怎么获取、llama-cli 怎么跑模型、llama-server 怎么起 OpenAI 兼容服务。适合想搞懂底层、想榨性能、想把自己应用接到轻量级推理服务上的人。读完你会:拿到 llama.cpp 可执行文件、跑通第一个 .gguf 模型、理解 Q4_K_M/Q8_0 量化档位、用 curl 调通 8080 端口的 /v1/chat/completions。
头发够用的程序员1 天前
人工智能·pytorch·python·深度学习·神经网络·边缘计算·jetson
TensorRT 自定义算子插件实战(三):手搓 2×2 最大池化 customMaxpool承接《TensorRT 自定义算子插件实战》系列前两篇:第一篇 customScaledTanh(单输入、逐元素、带参)、第二篇 customGatedTanh(双输入、融合、带参)。本篇实现第三个形态、也是真正拉开差距的一个:customMaxpool——一个 2×2 核、stride=1、无参数的窗口算子。它的难点不再是"多输入",而是两个全新问题:算子没有参数(参数机制整个被砍掉)、输出尺寸发生变化(不再等于输入)。这三个算子加起来,正好覆盖了自定义插件的三大典型形态。
for_ever_love__2 天前
pytorch·python·深度学习·自动求导
PyTorch 张量与 autograd——自动求导怎么工作承上:上一篇《神经网络与反向传播原理》我们手推了每一个梯度,写得很爽也很累。本篇:本篇把它交给 PyTorch:Tensor、requires_grad、backward 自动求导。
Είναι η κοπέλα3 天前
人工智能·pytorch·python·开源·conda
显存计算与模型选择:你的显卡能跑多大的模型本篇解决本地部署里被问烂的问题:跑一个模型到底要多少显存?我这块卡能跑多大的模型? 如果你刚装好 NVIDIA 驱动或 Ollama,面对一堆 7B/14B/32B/70B 不知道选哪个,或者已经被 “CUDA out of memory” 撞过墙,这篇给你一套公式、一张各显存档位经验表,外加「24G 显存能跑什么」的直接答案。读完你能对着任意模型自己估算显存,不再靠玄学。
海天一色y4 天前
pytorch·onnx
模型部署的「通用语」:ONNX 转换摘要:你花了三个月把模型 mAP 刷到了 SOTA,老板说「下周上线」,然后你发现——训练用的 PyTorch 推理引擎不认、生产机是张老旧的 Intel CPU、客户要在边缘盒子上跑、QPS 要求 2000 而你的 model() 只能跑到 60。这几乎是每个算法工程师都会撞上的墙:训练和部署,是两个世界。
Thomas.Sir4 天前
pytorch·ai
第26课:工业零部件外观缺陷检测系统:从学术Demo到产线工程的重构实战关键词:PyTorch 工业质检 缺陷检测 阈值寻优 ONNX 部署 FastAPI 类别不平衡 工程化
Zguigo5 天前
人工智能·pytorch·深度学习
【CUDA6】CUDA Stream 是什么,为什么 CUDA 是异步执行,如何正确测量 GPU 时间以及多个任务如何重叠执行之前在实验中我们写过c_gpu = a_gpu + b_gpu,CPU 执行这行代码时,并不是一定要等 GPU 把加法彻底做完,CPU 发出任务后,可以继续干自己的事情,CUDA默认一个非常重要的特性:CPU 发起 GPU 工作,GPU 异步执行,它更像是CPU–CUDA Stream–KernelA,B,C–GPU执行,Stream就是组织这些GPU工作的机制之一,这也是我们写torch.cuda.synchronize()的原因,它实现了CPU 等 GPU,把当前已经提交的工作执行完。
论文复现现场5 天前
人工智能·pytorch·python·深度学习·cuda·rtx3090
RTX 3090 24GB 适合科研吗?单卡论文复现、PyTorch 显存检查与 OOM 排错RTX 3090 24GB 适合不少单卡深度学习科研实验,包括图像分类、二维分割、小模型微调和部分量化大模型实验。是否够用,要看训练方式、输入尺寸和批大小;能启动程序,也不等于能复现论文指标。
论文复现现场5 天前
pytorch·深度学习·云计算·gpu
AutoDL、算家云与公有云 GPU 怎么选?环境复现、计费与断点恢复对比个人开发者先看环境搭建和完整成本,科研用户先看版本复现与任务恢复,企业团队先看网络、权限和运维接入。选择 GPU 平台,应先明确任务约束,再用同一套验收流程筛选。
盘古开天16666 天前
人工智能·pytorch·算法
PPO算法代码实战(三):PyTorch从零实现PPO求解CartPole前面两篇文章我们详细讲解了PPO算法的原理,从策略梯度到TRPO,再到PPO的Clip机制。光说不练假把式,本篇我们就用PyTorch从零实现一个完整的PPO算法,在经典的CartPole平衡杆环境上跑通训练流程。
Είναι η κοπέλα6 天前
人工智能·pytorch·python
PyTorch 安装与验证系列第 2 篇。上一篇 GPU 底座打完,本篇装本地 AI 的核心框架 PyTorch。重点解决四个问题:去 pytorch.org 选择器怎么选 pip 命令;cu124 / cu118 / cpu 三种 wheel 怎么选;国内怎么加速;装完用哪三步验证"真的上卡了"。读完你能装出一个 torch.cuda.is_available() 返回 True 的环境,并避开 32 位 Python、CPU 版装成默认这两类最阴的坑。
盼小辉丶7 天前
人工智能·pytorch·深度学习·强化学习
PyTorch强化学习实战(27)——进化策略在强化学习中的应用在本节中,我们将改变对强化学习 (Reinforcement Learning, RL) 训练的视角,转而讨论黑盒优化方法,它们在大规模 RL 问题中具有适用性,并能与价值迭代和策略梯度方法竞争。尽管存在时间较长,这类方法在某些情境下仍然更具效率。具体而言,本节将介绍黑盒优化方法:进化策略。
weixin_447195297 天前
pytorch·python
【无标题】面向有一点 Python、但没有机器学习背景的读者。全文用一个「预测 RNA 碱基」的四分类例子贯穿,所有数字都可复现。
bigdata-余建新7 天前
人工智能·pytorch·深度学习
week2目标: 尝试完成一个多分类任务的训练:一个随机向量,哪一维数字最大就属于第几类。内容:
HwJack207 天前
pytorch·harmonyos·材质
【共创稿事节】HarmonyOS 7材质与光照:真实感的营造与性能的平衡一块界面元素看起来"真不真",取决于两件事:它的表面是什么材质,以及光是怎么打到它上面的。材质给了物体性格,光照给了物体体积,两者叠加才有立体感。问题在于,真实感的东西都要算——模糊要算、反射要算、阴影要算,而空间计算的每一帧都紧张。设计的功夫在于知道哪些能省、哪些不能省。
头发够用的程序员8 天前
c++·人工智能·pytorch·python·深度学习·边缘计算·jetson
TensorRT 自定义算子插件实战(一):从零手写 customScaledTanh但上一篇结尾我特别强调过:这其实只是 “上半场”。导出的那个 custom::xxx 节点只是个 “空壳”——onnxruntime 跑不了,TensorRT 也跑不了,因为 TensorRT 根本不知道这个节点该怎么算。
论文复现现场8 天前
pytorch·深度学习·cuda·rtx5090
RTX 5090 32GB 适合科研计算吗?单卡训练、推理、论文复现与 OOM 判断方法RTX 5090 的 32GB 显存可作为许多单卡论文复现、7B/8B 推理与 QLoRA、常见视觉训练的候选;全参数大模型训练、FP64 密集计算和超大样本不应只看显存下结论。
论文复现现场8 天前
开发语言·pytorch·batch·cuda·rtx3090
论文复现看到“RTX 3090 or higher”:显存、CUDA、batch size 与 OOM 怎么判断?“RTX 3090 or higher”通常表示作者至少在24GB显存、Ampere级CUDA环境中验证过,不代表显卡型号越新就一定能运行。应先看显存峰值,再检查CUDA兼容性,最后用最小输入实跑。