pytorch+cpu版本对Intel Ultra 9 275HX性能的影响

最近在用Intel Ultra 9 275HX跑RL,发现其运行效率很慢,于是对其性能进行了测试。U9 275HX,是8P+16E,24线程。测试过程中发现,只用8P而限制E核的使用,性能会有所提升。且pytorch的版本好对于8P的加载,起着关键的作用。

仅用 8 个 P 核执行 PyTorch 计算,禁用 E 核参与,代码如下

import os

必须在import torch之前设置,否则不生效

os.environ"OMP_NUM_THREADS" = "8" # 严格等于P核数量

os.environ"MKL_NUM_THREADS" = "8" # MKL线程数也设置为8,避免过度线程化

优化线程亲和性,绑定连续P核,避免跨核/跨NUMA调度

os.environ"KMP_AFFINITY" = "granularity=fine,compact,1,0"

os.environ"KMP_BLOCKTIME" = "1" # 减少OpenMP线程休眠,提升响应速度

import torch

1.pytorch2.4.1+cpu

运行时发现,它启用的是2P+6E全开

2.pytorch2.9.0+cpu

正常启用的是8P全开

这也告诉我们,在安装包时,也要考虑对cpu或者gpu架构的支持。如5060TI仅支持cuda12.8+.

相关推荐
IT_陈寒39 分钟前
Redis的持久化配置把我坑惨了:你以为数据安全了?
前端·人工智能·后端
miaowu35743 分钟前
AI智能体推动数字化转型:从流程自动化到决策辅助的完整路线图
大数据·人工智能·自动化
阿里云大数据AI技术1 小时前
阿里云 Elasticsearch 日志采集与加工服务:让日志链路少一串组件,多一份稳定
人工智能·elasticsearch
ksueh1 小时前
AI写小说长篇创作中的上下文局限与外部记忆系统实践
人工智能
互联网江湖1 小时前
珞石机器人:向左科技股,向右零部件制造商?
大数据·人工智能
阿里云大数据AI技术2 小时前
从数据湖到多模态湖仓-基于阿里云EMR Serverless StarRocks与DLF Paimon构建AI时代的统一分析检索架构
人工智能
前端的阶梯2 小时前
浅谈Workflow和Agent的区别
人工智能
正在走向自律2 小时前
Deepseek V4 Flash 高效应用实战指南
人工智能·deepseek·deepseek v4·ai赋能中心
我的xiaodoujiao2 小时前
快速学习Python基础知识详细图文教程9--函数进阶
开发语言·python·学习·测试工具
Xzaveir2 小时前
别把所有“认证”都塞进 AuthService:实名、一键登录与号码身份的领域拆分
android·人工智能