聊聊Python多进程

写在前面

之前一直没关注过多进程这方面,朋友问起时感觉很奇怪,因为进程是资源分配的最小单元,线程是运算调度的最小单元,代码程序本质上只是一些文本文件,给他分配对应的资源运行起来才是进程,那为什么会有多进程呢?看了看文档发现原来是通过创建子进程并管理来实现多进程。

多进程和多线程有什么区别?

虽然同样是并发,同样是均衡CPU与IO之间差距过大的运行速率,多线程是多个线程共享一个CPU,好处是线程间通信或切换很容易,坏处是目前CPU都是多核的,很容易出现一核有难八核围观的问题,同时python具有GIL(全局锁),让每个CPU在同一时间只能执行一个线程,这让我们很难实现并行计算。而多进程避免了这个问题,同时也要注意,多个进程之间的通信与切换成本更大。

因此python的多线程并不适合CPU密集型的任务,更适合IO密集型的任务

fork vs spawn

fork速度会更快,因为他是对父进程的整个虚拟内存进行写时复制,包括已经初始化过的python解释器,内存中构造的对象,而不需要识别哪些资源是必要的,仅将内存页作为一个整体复制。但这也会带来问题,比如由于fork不会复制父进程的线程,如果其他线程持有的存储在内存中的锁也被复制的话,但是因为没有对应的线程进行解锁,就会导致死锁。

spawn从头开始启动一个python子进程,所以安全,不继承父进程的资源,所以也不臃肿,但是启动会较慢。

进程池

进程池Pool 会帮我们实现简单的多进程任务,我们可以通过apply() 和map() 来执行任务并阻塞直到子进程计算完成任务。看下官网代码:

Python 复制代码
import multiprocessing

def function_square(data):
    result = data*data
    return result

if __name__ == '__main__':
    inputs = list(range(100))
    pool = multiprocessing.Pool(processes=4)
    pool_outputs = pool.map(function_square, inputs)
    pool.close()
    pool.join()
    print ('Pool    :', pool_outputs)

map可以将可迭代的数据的每一个元素作为一个任务来执行。任务执行结束后可以通过 pool.close() 告诉进程池不再接受新的任务,而pool.join()会一直阻塞,知道进程池中的所有工作进程都结束。

有点反常,在使用map的情况下是否不再需要join?

笔者自己试了下,确实不需要在pool.map后添加join。

相关推荐
m0_640602448 分钟前
2026 年餐饮收银系统前后端技术实现——核心架构与原理详解
后端·微服务·云原生·架构
Scene21611 分钟前
Flux 与 Mono:Project Reactor 核心响应式类型深度解析
后端
weixin_4713830314 分钟前
17 Self-RAG —— 幻觉检测 + 答案质量评估
python·agent
lingran__16 分钟前
C++ STL unordered系列(哈希) 底层剖析与模拟实现万字详解 | 基于哈希表,复刻 SGI-STL 泛型哈希容器架构
开发语言·c++·后端·哈希算法·哈希表·泛型编程·unordered系列
叠层归一研究院20 分钟前
如何用程序搭建一个 AGI 种子系统(三):生长如何对接物理与数学宇宙
人工智能·python·算法·机器学习·transformer·agi
小林ixn27 分钟前
NestJS 入门实战:从 0 到 1 撸一个 Todo CRUD,感受装饰器与模块化的优雅
后端·mvc·nestjs
jufeng130732 分钟前
【系列:手搓自主 AI Agent:Hermes 架构原理剖析 · 第 5 篇】
python·ai agent·上下文压缩
AndrewHZ32 分钟前
图像处理入门008 | 阶段总结:环境测试与基础概念测验
图像处理·python·opencv·计算机视觉·cv
阿弱33 分钟前
graph-core 的边与命令模式设计
java·后端·agent
智驭未来掌门人34 分钟前
利用Qt设计实现一款桌面程序
后端