【ceph】ceph中osd报错,have spurious read error

本站以分享各种运维经验和运维所需要的技能为主

《python零基础入门》:python零基础入门学习

《python运维脚本》: python运维脚本实践

《shell》:shell学习

《terraform》持续更新中:terraform_Aws学习零基础入门到最佳实战

《k8》暂未更新

《docker学习》暂未更新

《ceph学习》ceph日常问题解决分享

《日志收集》ELK+各种中间件

《运维日常》运维日常

《linux》运维面试100问

ceph中osd报错,have spurious read error

在使用过程中,有时可能会遇到一些问题,如OSD(Object Storage Daemon)报告"spurious read error"。

"Spurious read error"通常表示在尝试读取某些数据时,数据的校验和与预期不符。这可能是由于硬盘错误、网络问题、内存错误等原因导致的。

以下是一些可能的解决步骤:

  1. 检查硬盘健康状况 :使用SMART工具(如smartctl)检查硬盘的健康状况。如果发现有错误,可能需要更换硬盘。

  2. 检查网络:如果你的Ceph集群跨越了多个网络,检查网络连接是否稳定。网络问题可能会导致数据在传输过程中出错。

  3. 检查内存 :内存错误也可能导致数据错误。你可以使用工具如memtest86+来检查内存是否有问题。

  4. 检查OSD日志 :查看出问题的OSD的日志,可能会有更多的错误信息。你可以使用ceph daemon osd.<id> log命令来查看OSD的日志。

  5. 修复OSD:如果你确定硬盘、网络和内存都没有问题,你可以尝试修复OSD。首先,将出问题的OSD标记为out,然后清除OSD,最后再添加回去。这将触发数据的重新复制,可能会修复错误。

其实ceph的很多报错的排障过程都是这样:

硬件(cpu、内存、磁盘) --- 网络 --- 具体到某个组件的日志

基本上都是盘坏了(可以使用smartctl去查看盘状态),直接换盘就好。

相关推荐
吾皇斯巴达3 天前
ceph index-less桶可以用radosgw-admin bucket rm吗
ceph
运维全栈笔记15 天前
腾讯云 CVM 搭建 Ceph 集群部署笔记
笔记·ceph·腾讯云
刘某的Cloud17 天前
ceph osd 导入导出 rbd volume 卷
linux·运维·ceph·volume
heimeiyingwang17 天前
【架构实战】Kubernetes存储实战:从EmptyDir到Ceph CSI的持久化存储选型指南
ceph·架构·kubernetes
DLYSB_1 个月前
存储运维实战:基于 Ceph Event 监听与 Python 适配器的分布式存储健康度物理声光响应架构
运维·ceph·python·报警灯
AAA@峥1 个月前
Ceph 分布式文件系统 CephFS 实战指南
运维·分布式·ceph
AAA@峥1 个月前
Ceph RBD 块存储全解析:原理与实操汇总
运维·分布式·ceph
AAA@峥1 个月前
Ceph 集群配置管理完整指南
运维·数据库·分布式·ceph
胖兔纸22 个月前
OpenStack 1.7.2 & Ceph 9.2.1 运维命令
运维·ceph·openstack
seacracker2 个月前
Ceph 太重运维成本高?轻量统一存储 PowerFS 对比测评(HPC/AI 场景首选)
运维·人工智能·ceph·ai存储·统一存储