systemd-resolved.service实验实战3

Systemd 设计模式:CrashGuard (防止无限重启)

痛点 (The Problem):

你给服务设置了 Restart=always,但程序有 Bug,启动后 1 秒即崩。
后果:Systemd 陷入死循环(重启风暴),CPU 飙升 100%,日志塞满磁盘,甚至导致无法 SSH 登录。

解法 (The Solution):

不要无脑重启。限制频率 ,并在彻底失败后触发备用方案

1. 核心机制 (背下这 3 个参数)

  • StartLimitIntervalSec: 时间窗口 (例如 10秒)。
  • StartLimitBurst: 允许崩溃的最大次数 (例如 3次)。
  • OnFailure: 当达到限制后,Systemd 放弃重启,转而启动的服务。

2. 实战配置

服务 A:不稳定的主程序 (受害者)

/etc/systemd/system/unstable-app.service

ini 复制代码
[Unit]
Description=My Buggy App
# 【规则】如果在 10秒 内崩溃超过 3次...
StartLimitIntervalSec=10
StartLimitBurst=3
# 【动作】彻底停止尝试,并启动下面这个服务:
OnFailure=safe-mode.service

[Service]
# 模拟崩溃 (1秒后退出)
ExecStart=/bin/bash -c "sleep 1 && exit 1"
Restart=always
RestartSec=1
服务 B:安全模式 (救世主)

/etc/systemd/system/safe-mode.service

ini 复制代码
[Unit]
Description=Safe Mode Alert

[Service]
Type=oneshot
# SE 的自救动作:点亮红灯、发短信报警、或者回滚分区
ExecStart=/bin/echo "CRITICAL: 检测到重启风暴,已进入安全模式!"

3. 运行流程 (The Flow)

  1. 启动 : unstable-app 启动 -> 崩溃
  2. 重试 1 : Systemd 重启它 -> 崩溃
  3. 重试 2 : Systemd 重启它 -> 崩溃
  4. 触发阈值 : Systemd 发现 "10秒内崩了3次"。强制停止 unstable-app
  5. 故障转移 : Systemd 自动启动 safe-mode.service

SE 经验总结:

永远不要只写 Restart=always 而不加 StartLimit

这是"偶尔故障"和"设备变砖"之间的区别。

相关推荐
程与留5 小时前
15_国际化和本地化:tr()、ts 文件、QM 文件、多语言切换
c++·qt
GeW6 小时前
超详细!RHCE10版通用备考策略,内含评分细则解读
linux
用户041328465136 小时前
Linux 服务开机自启动怎么配置?systemctl enable 原理详解
linux
程与留7 小时前
14_Qt 样式表(QSS)入门(语法、选择器、美化实战)
c++·qt
BreezeJiang13 小时前
从域名到 Node.js:一次云服务器请求经过了哪些层?
服务器
欧特克_Glodon15 小时前
OpenCV计算机视觉开发入门与实践<二十七>:图像分割概述
c++·人工智能·opencv·计算机视觉
蒸蒸yyyyzwd15 小时前
cpp 选手秋招学习笔记 day21
c++·面试·八股
草莓熊Lotso15 小时前
【Redis 初阶】Set 类型深度解析:去重集合的运算能力与实战场景
linux·网络·数据库·windows·redis·tcp/ip·缓存
张文君15 小时前
ubuntu26.04坏道坏块分区隔离急速版260831-V0.12
linux·python
贝锐1 天前
从国产化信创设备到商用安卓终端,向日葵如何帮助企业实现统一运维管理?
linux·运维·远程控制