
生产服务器告警:创建线程总数超过32000个故障。服务器的总线程数无法突破32000的问题在 "k8s的pod容器中微服务无法创建新线程unable to create new native thread" 文章中提过,现在再谈谈单个服务的线程数怎么优化。
目前统计到的节点上微服务的线程总数可达到5000以上。
那先看看服务中线程组成:

服务框架
springboot2 、springcloud、服务间feign调用、undertow、mybatis-plus、redis、rabbitmq、线程池threadpool调用。
线程数组成
Java
总线程数 ≈
Undertow Worker线程
+ Feign 调用线程池
+ RabbitMQ Listener线程池
+ Redis 连接池 (Lettuce/Jedis)
+ 业务线程池 (@Async)
+ Spring 内部线程
+ GC/编译/JVM线程
| 层级 | 组件 | 线程类型 | 设置 |
| Web 接入层 | Undertow | IO Threads + Worker Threads | IO≈CPU核数, Worker≈8×IO |
| RPC 调用层 | Feign + Ribbon + Hystrix | HTTP连接池线程 / Hystrix线程池 | 取决于隔离策略 |
| 数据访问层 | MyBatis-Plus + HikariCP | 连接池线程(非独立线程,但占用OS线程/连接) | max-pool-size |
| 缓存层 | Redis (Lettuce) | Netty EventLoop | 默认很少 |
| 消息层 | RabbitMQ | Listener Container 工作线程 | concurrency ~ max-concurrency |
| 业务层 | 自定义 ThreadPool | 业务线程 | 自定义 |
| 框架层 | Spring @Async / @Scheduled | 任务/调度线程 | 默认 1 或 8 |
| JVM 系统层 | GC / JIT / 引用处理 | 系统守护线程 | 与 GC 策略相关 |
根据当时告警时的线程数统计
NIO线程数到达1000(达到设置的最大值)、thread线程2000多(用的Async没有用线程池设置)、Hystrix线程3000多、数据库连接100多、少量redis和mq的线程。
因此从统计来看大头在NIO线程、thread线程和Hystrix线程的治理。
下面分别进行问析:
-
Undertow设置过大1000,其实用不到这么大,可以缩小。
-
因为没有用线程池导致thread线程会不停的进行创建,这里需要改成线程池配置,另外涉及到@Async的使用方式不规范问题。
-
Hystrix线程没有进行配置,或配置没有生效,导致线程也是不停的进行创建,也同时涉及到Hystrix的使用规范问题。
如何有效合理的配置
Undertow (Web容器)
节点一般是用8核,因此IO设置为8
YAML
server:
undertow:
threads:
worker: 512 # 默认 CPU核数 * 8
io: 8 # 默认 CPU核数
buffer-size: 1024
direct-buffers: true
Feign (Spring Cloud OpenFeign)
Feign + Ribbon + Hystrix这是线程最复杂的叠加区域,取决于你使用的 HTTP Client 和熔断隔离策略。
Feign 本身不直接创建业务线程,但底层 HTTP Client 会维护连接池和 I/O 线程。
启用了 Hystrix 且使用 THREAD 隔离策略(默认),每个 Feign Client 会对应一个 Hystrix ThreadPool
YAML
hystrix:
threadpool:
default:
coreSize: 100 # 核心线程数
maxQueueSize: 200 # 队列大小
queueSizeRejectionThreshold: 300
allowMaximumSizeToDivergeFromCoreSize: true
command:
default:
execution:
isolation:
strategy: THREAD
thread:
timeoutInMilliseconds: 5000
陷阱:那这里提出一个问题,hystrix.threadpool.default.maxQueueSize=50 如果一个微服务里面feign调用3个另外的服务,则总线程数据是每个服务最大都是50,总3*50=150;还是 3个服务共用这最大50个线程?
在源码中execution.isolation.strategy的配置地方。

答案是每个服务各自独立一个线程池,不是共用,即每个 Feign Client 各拥有最多 50 的队列容量,总资源是 3×50,不是共用。default 是未显式配置 ThreadPoolKey 时的默认值模板,所有没有单独配置的线程池,都会用这套 default 参数来初始化。
所以3个服务就是
线程池 A (base-server): coreSize=10, maxQueueSize=50
线程池 B (msg-server): coreSize=10, maxQueueSize=50
线程池 C (如果还有第3个不同的服务): coreSize=10, maxQueueSize=50
总计:3 × 10 = 30 个核心线程,各自队列容量 50
微服务依赖 10 个下游服务,且都使用 THREAD 隔离,默认就会创建 10 个 Hystrix 线程池。若每个 coreSize=100,仅 Hystrix 一项就固定占用 1000 个线程
也可以为特定服务单独配置
YAML
hystrix:
threadpool:
default:
coreSize: 10
maxQueueSize: 50
base-server: # 为特定 GroupKey 覆盖配置
coreSize: 20
maxQueueSize: 100
业务线程池 (需代码配置)
Java
@Configuration
@EnableAsync
public class ThreadPoolConfig {
@Bean("businessExecutor")
public ThreadPoolTaskExecutor businessExecutor() {
ThreadPoolTaskExecutor executor = new ThreadPoolTaskExecutor();
executor.setCorePoolSize(20);
executor.setMaxPoolSize(50);
executor.setQueueCapacity(200);
executor.setThreadNamePrefix("biz-");
return executor;
}
}
MyBatis-Plus (连接池依赖DataSource)
Java
spring:
datasource:
druid:
initial-size: 5
max-active: 20
min-idle: 5
Redis (Lettuce连接池)
YAML
spring:
redis:
lettuce:
pool:
max-active: 16 # 最大连接数
max-idle: 8
min-idle: 4
RabbitMQ Listener
YAML
spring:
rabbitmq:
listener:
simple:
concurrency: 5 # 最小消费者线程
max-concurrency: 20 # 最大消费者线程
prefetch: 10
acknowledge-mode: auto