OB 集群最近磁盘 IO 使用率偏高,从哪些维度入手排查比较有效?比如合并(major freeze)调度、日志盘写入、慢查询等因素,希望有经验的同行指点一下排查思路。
可以OCP上看下集群的性能监控->数据库性能->集群维度 看下物理IO耗时的是哪个指标。
正常生产环境我们要求SSD磁盘,一般是毫秒以下的延迟。
1)是否同盘部署,即数据盘和日志盘同盘,二者会争抢磁盘IO,且clog日志盘对IO要求比较高。
2)磁盘类型是否符合要求,SSD磁盘。
3)如果都符合,大概率是慢查询,一般会体现sstore read 延迟比较高,可以在OCP 看下哪个租户的sstore read或者cpu负载高,去对应租户的sql诊断查看 top sql 和 slow sql 信息,确认下是否有异常,一般出现性能问题的sql,点开后下面会有优化建议,如果没有就需要咱们分析下这些sql是否有问题了。
