【 使用环境 】生产环境 or 测试环境
【 OB or 其他组件 】OCP
【 使用版本 】社区版 4.4.2
【问题描述】清晰明确描述问题
第二张图片是下面对应的各个指标的最大值 平均值 和当前值
我疑惑的是
这个响应时间监控是不是有问题,99-all 95-all 的最大值 在14分钟和 6分钟,但是all 的最大值17秒,select 最大值19秒。 平均值那一列也是,99-all 95-all 都比all 和 select 大,不应该all 是全部的sql 吗,所以all 的最大值不应该比99-all 95-all 大或者相等吗,而且这差的太多了,这个帮忙看下是什么原因,
淇铭
#3
不是监控算错,而是 all 和 99-all 根本不是同一类指标。
- 看整体负载:看
all / select 含义:平均响应时间(总耗时 ÷ 次数,来自 sysstat)
- 看尾部体验:看
99-all / 95-all 含义:P99 / P95 分位数(来自 v$ob_query_response_time_histogram )
为何能差这么多
平均会被大量快 SQL 稀释;P99 看的是长尾。例如 99% 很快、1% 跑十几分钟时,平均可能只有几秒~十几秒,P99 仍可到分钟级。当前值其实是自洽的:99-all ≈ 9 ms > all ≈ 574 μs。