k8s中节点的zone无法自愈

【 使用环境 】测试环境
【 OB or 其他组件 】
ob-operator V2.3.4、
OceanBase Dashboard V0.5.0、
oceanbase-cloud-native 4.3.5.5-105000012025111711
【 使用版本 】
【问题描述】清晰明确描述问题
通过ob-operator V2.3.4、OceanBase Dashboard V0.5.0 部署ob集群到3个节点、zone有3个, 集群运行一周时间数据库服务正常。之后的一天服务器A无法ssh连接,处理之后可以正常登录连接。登录之后服务器A上的zone是正常的。服务器B和C的zone不正常,一直在重启。pod的相关日志: Found backup config file, start without parameter。 Start observer failed, signal: killed.
【复现路径】问题出现前后相关操作
【附件及日志】

【备注】基于 LLM 和开源文档 RAG 的论坛小助手已开放测试,在发帖时输入 [@论坛小助手] 即可召唤小助手,欢迎试用!

2 个赞

根据您的描述,问题涉及到OceanBase集群中节点的自愈能力和observer进程启动失败的问题。这可能是由于配置文件的问题或者某些系统资源限制导致observer进程被杀死。

推荐使用obdiag工具进行日志采集,以便我们能够更深入地理解问题的本质所在。
日志采集场景: observer无故重启
日志采集命令: obdiag gather scene run --scene=observer.restart

这个命令将收集与observer服务重启相关的信息,帮助我们定位具体的原因。

此外,麻烦您提供以下信息以便我们更好地帮助您解决问题:

  1. 您是否修改过任何OceanBase相关的配置文件?如果有,请指出具体的更改内容。
  2. 服务器B和C上是否有足够的磁盘空间?
  3. 当错误发生时,服务器的CPU、内存使用率如何?请尝试获取当时的系统状态信息。
  4. 是否有查看到更详细的错误日志或警告消息?如果方便的话,请分享这部分信息。
  5. 在这个问题出现之前,是否存在对集群执行了扩容或其他管理操作?

通过上述提供的数据以及运行obdiag后的日志包,我们可以进一步分析根本原因并提供解决建议。

附上敏捷诊断工具 obdiag 使用帮助链接

kubectl logs <pod> --previous 

执行这个看下

其中1个pod输出日志: Prepare observer dir failed, exit status 1. 另外一个pod输出日志Start observer failed, singnal: killed

找到原因了吗

找到原因了吗

1 个赞
-- 其中1个pod输出日志: Prepare observer dir failed, exit status 1
对这个容器执行

kubectl describe pvc <pvc-name> -n <namespace>
kubectl exec -it <pod-name> -n <namespace> -- ls -la /home/admin/oceanbase
kubectl logs <pod> -c init-observer-dir

-- 对另一个pod执行
kubectl describe pod <pod> | grep -A 5 "Last State"
kubectl get obcluster <cluster> -o yaml | grep -A 10 resources
kubectl describe node <node>