【 使用环境 】测试环境
【 OB or 其他组件 】
ob-operator V2.3.4、
OceanBase Dashboard V0.5.0、
oceanbase-cloud-native 4.3.5.5-105000012025111711
【 使用版本 】
【问题描述】清晰明确描述问题
通过ob-operator V2.3.4、OceanBase Dashboard V0.5.0 部署ob集群到3个节点、zone有3个, 集群运行一周时间数据库服务正常。之后的一天服务器A无法ssh连接,处理之后可以正常登录连接。登录之后服务器A上的zone是正常的。服务器B和C的zone不正常,一直在重启。pod的相关日志: Found backup config file, start without parameter。 Start observer failed, signal: killed.
【复现路径】问题出现前后相关操作
【附件及日志】
【备注】基于 LLM 和开源文档 RAG 的论坛小助手已开放测试,在发帖时输入 [@论坛小助手] 即可召唤小助手,欢迎试用!
2 个赞
论坛小助手
#3
根据您的描述,问题涉及到OceanBase集群中节点的自愈能力和observer进程启动失败的问题。这可能是由于配置文件的问题或者某些系统资源限制导致observer进程被杀死。
推荐使用obdiag工具进行日志采集,以便我们能够更深入地理解问题的本质所在。
日志采集场景: observer无故重启
日志采集命令: obdiag gather scene run --scene=observer.restart
这个命令将收集与observer服务重启相关的信息,帮助我们定位具体的原因。
此外,麻烦您提供以下信息以便我们更好地帮助您解决问题:
- 您是否修改过任何OceanBase相关的配置文件?如果有,请指出具体的更改内容。
- 服务器B和C上是否有足够的磁盘空间?
- 当错误发生时,服务器的CPU、内存使用率如何?请尝试获取当时的系统状态信息。
- 是否有查看到更详细的错误日志或警告消息?如果方便的话,请分享这部分信息。
- 在这个问题出现之前,是否存在对集群执行了扩容或其他管理操作?
通过上述提供的数据以及运行obdiag后的日志包,我们可以进一步分析根本原因并提供解决建议。
附上敏捷诊断工具 obdiag 使用帮助链接
旭辉
#4
kubectl logs <pod> --previous
执行这个看下
其中1个pod输出日志: Prepare observer dir failed, exit status 1. 另外一个pod输出日志Start observer failed, singnal: killed
旭辉
#8
-- 其中1个pod输出日志: Prepare observer dir failed, exit status 1
对这个容器执行
kubectl describe pvc <pvc-name> -n <namespace>
kubectl exec -it <pod-name> -n <namespace> -- ls -la /home/admin/oceanbase
kubectl logs <pod> -c init-observer-dir
-- 对另一个pod执行
kubectl describe pod <pod> | grep -A 5 "Last State"
kubectl get obcluster <cluster> -o yaml | grep -A 10 resources
kubectl describe node <node>