pytorch+cpu版本对Intel Ultra 9 275HX性能的影响

最近在用Intel Ultra 9 275HX跑RL,发现其运行效率很慢,于是对其性能进行了测试。U9 275HX,是8P+16E,24线程。测试过程中发现,只用8P而限制E核的使用,性能会有所提升。且pytorch的版本好对于8P的加载,起着关键的作用。

仅用 8 个 P 核执行 PyTorch 计算,禁用 E 核参与,代码如下

import os

必须在import torch之前设置,否则不生效

os.environ"OMP_NUM_THREADS" = "8" # 严格等于P核数量

os.environ"MKL_NUM_THREADS" = "8" # MKL线程数也设置为8,避免过度线程化

优化线程亲和性,绑定连续P核,避免跨核/跨NUMA调度

os.environ"KMP_AFFINITY" = "granularity=fine,compact,1,0"

os.environ"KMP_BLOCKTIME" = "1" # 减少OpenMP线程休眠,提升响应速度

import torch

1.pytorch2.4.1+cpu

运行时发现,它启用的是2P+6E全开

2.pytorch2.9.0+cpu

正常启用的是8P全开

这也告诉我们,在安装包时,也要考虑对cpu或者gpu架构的支持。如5060TI仅支持cuda12.8+.

相关推荐
要加油哦~几秒前
论文 | vision2web 基于代理验证的可视化网站开发分层基准测试
人工智能·论文
重生之高冷汉堡包1 分钟前
AI 智能体如何通过 auth.md 注册 Bright Date:完整实操指南
人工智能
鱼宵5 分钟前
Spring AI 可观测与透明化:traceId 串起全链路,思考过程实时直播给用户
java·人工智能·spring·链路追踪·springai
狗凯之家源码网8 分钟前
AI 步数修改提交系统源码应用场景与落地指南
android·数据库·人工智能·运动步数
Είναι η κοπέλα9 分钟前
模型量化完全指南:GGUF、GPTQ、AWQ 怎么选
人工智能·pytorch·python
yi01112 分钟前
LeetCode 15:三数之和|排序 + 双指针,如何避免重复答案?
笔记·python·算法·leetcode·双指针
Zelman18 分钟前
第06章-超节点
人工智能·后端
用户794572239541319 分钟前
当卖 token 的遇上修高速公路的:AI 周期的真空期在哪
人工智能·agent
2601_9689007721 分钟前
意图召回与相关性过滤实战:把出价放在排序之后
人工智能
weixin1997010801622 分钟前
《1688消息服务落地方案:alibaba.message.* 与 Webhook 回调的可靠性与重试策略》(附Python源码)
开发语言·python