前阵子给一套 OB 做压测,踩了个思维的坑,记录下。
一开始死盯 TPS 和 QPS,调参数调半天,结果发现瓶颈根本不在数据库,是应用那边的连接池太小,请求压根没打满。
后来换思路,重点看几个地方:
-
cpu_quota的实际使用率,看租户 CPU 是不是真吃满了; - memstore 的水位和合并频率,有没有被写放大拖住;
- SQL 的执行计划,有没有突然从索引扫变成全表扫。
还有个教训:压测数据得接近真实,拿几万行测出来的结论,上了亿级数据完全不是一回事。
仅供参考,欢迎交流你们的压测套路。