ocp执行ob集群升级出错

【 使用环境 】 测试环境
【 OB or 其他组件 】ob
【 使用版本 】OceanBase 构建版本号:4.2.5.7-107010012026030415
【问题描述】清晰明确描述问题
【复现路径】问题出现前后相关操作
【附件及日志】推荐使用OceanBase敏捷诊断工具obdiag收集诊断信息,详情参见链接(右键跳转查看):

【SOP系列 22 】——故障诊断第一步(自助诊断和诊断信息收集)

【备注】基于 LLM 和开源文档 RAG 的论坛小助手已开放测试,在发帖时输入 [@论坛小助手] 即可召唤小助手,欢迎试用!
ocp 执行ob集群升级出错 ,报错如下:
LS(1) has no enough valid paxos member after stop zone, stop zone not allowed

MySQL [oceanbase]> SELECT  LS_ID, SVR_IP, ROLE,PROPOSAL_ID,CONFIG_VERSION,ACCESS_MODE,PAXOS_MEMBER_LIST,PAXOS_REPLICA_NUM  FROM GV$OB_LOG_STAT WHERE tenant_id = 1010 order by 1;
+-------+-------------+----------+-------------+------------------------------------+-------------+----------------------------------------------------------+-------------------+
| LS_ID | SVR_IP      | ROLE     | PROPOSAL_ID | CONFIG_VERSION                     | ACCESS_MODE | PAXOS_MEMBER_LIST                                        | PAXOS_REPLICA_NUM |
+-------+-------------+----------+-------------+------------------------------------+-------------+----------------------------------------------------------+-------------------+
|     1 | 10.59.12.14 | LEADER   |          21 | {proposal_id:21, config_seq:49263} | APPEND      | 10.59.12.14:2882:1,10.59.12.16:2882:1                    |                 3 |
|     1 | 10.59.12.15 | FOLLOWER |          21 | {proposal_id:0, config_seq:0}      | RAW_WRITE   |                                                          |                 0 |
|     1 | 10.59.12.16 | FOLLOWER |          21 | {proposal_id:21, config_seq:49263} | APPEND      | 10.59.12.14:2882:1,10.59.12.16:2882:1                    |                 3 |
|  1001 | 10.59.12.14 | LEADER   |          22 | {proposal_id:22, config_seq:49298} | APPEND      | 10.59.12.14:2882:1,10.59.12.16:2882:1                    |                 3 |
|  1001 | 10.59.12.15 | FOLLOWER |          22 | {proposal_id:0, config_seq:0}      | RAW_WRITE   |                                                          |                 0 |
|  1001 | 10.59.12.16 | FOLLOWER |          22 | {proposal_id:22, config_seq:49298} | APPEND      | 10.59.12.14:2882:1,10.59.12.16:2882:1                    |                 3 |
|  1004 | 10.59.12.14 | LEADER   |           1 | {proposal_id:1, config_seq:2}      | APPEND      | 10.59.12.14:2882:1,10.59.12.15:2882:1,10.59.12.16:2882:1 |                 3 |
|  1004 | 10.59.12.15 | FOLLOWER |           1 | {proposal_id:1, config_seq:2}      | APPEND      | 10.59.12.14:2882:1,10.59.12.15:2882:1,10.59.12.16:2882:1 |                 3 |
|  1004 | 10.59.12.16 | FOLLOWER |           1 | {proposal_id:1, config_seq:2}      | APPEND      | 10.59.12.14:2882:1,10.59.12.15:2882:1,10.59.12.16:2882:1 |                 3 |
+-------+-------------+----------+-------------+------------------------------------+-------------+----------------------------------------------------------+-------------------+
查看 确实 缺少了1、1001 日志流 的 PAXOS 成员,
2 个赞

根据您描述的问题,OceanBase 集群在升级过程中遇到了一个关于 Paxos 成员不足的问题,这导致了集群无法顺利地完成升级操作。LS(1) has no enough valid paxos member after stop zone, stop zone not allowed 这个错误提示表明在尝试停止某个区域时,发现指定的日志流(例如 LS 1)缺少足够的 Paxos 成员来保证系统的正常运行。

推荐使用 obdiag 工具来进行日志采集,以获取更详细的信息帮助诊断问题的根本原因。虽然针对这种情况没有直接的根因分析场景,但通过收集相关日志我们可以深入分析可能的原因,并给出进一步的建议或解决方案。

日志采集场景: [未能明确问题的场景]
日志采集命令:

obdiag gather scene run --scene=observer.unknown

这个命令会触发对未知问题的通用日志收集流程,它可以帮助我们搜集到集群当前状态下的关键信息,包括但不限于系统日志、配置文件等,从而为后续的问题定位提供支持。

为了更好地理解情况并加快问题解决速度,请您回答以下几个问题:

  1. 在执行升级前,是否进行了任何特定的操作如手动调整分区、增加或移除节点?
  2. 升级过程中是否有其他异常报错?请提供尽可能多的详细信息。
  3. 您能否分享一下完整的日志文件或是上述 SELECT 语句的输出结果?这将有助于我们更准确地判断Paxos成员的具体状况。
  4. 整个集群中有多少个Zone?每个Zone内有多少个副本?
  5. 是否有网络问题或其他外部因素可能影响到了集群中节点间的通信?

请先尝试执行上述日志采集命令并将结果打包发送给我们。同时,也欢迎您提供更多关于上述问题的答案,以便于我们能够更快速地找到解决问题的方法。

附上敏捷诊断工具 obdiag 使用帮助链接

1 个赞

这个租户 是怎么建成功的 是个疑问,租户肯定有问题。这种情况下,能修复吗?
现在ocp 升级任务到了 Stop zone 阶段,租户的ddl 任务都不能执行了,想 复制租户 也不可能了。

看着租户的日志流 应该不满足多福本的情况吧

你这是哪个版本升级到哪个版本 是ob集群升级 还是ocp的metadb升级呀

我从 4.2.5.7 升级到 4.4.2.1 ,还没升级 就出错了。
通过ocp升级

OB业务集群升级

MySQL [oceanbase]> SELECT tenant_name, locality, primary_zone FROM DBA_OB_TENANTS WHERE tenant_id = 1010;
 +-------------+---------------------------------------------+-------------------+
| tenant_name | locality                                    | primary_zone      |
+-------------+---------------------------------------------+-------------------+
| CMDBXZZC    | FULL{1}@zone1, FULL{1}@zone2, FULL{1}@zone3 | zone1,zone2,zone3 |
+-------------+---------------------------------------------+-------------------+

意思是准备升级 停止zone的时候 就报错了是么?
当时升级时候的ocp-server.log日志 还有ocp上下载一下报错的日志

陈波(60232038)邀请您在VDrive2.0协作
内容: 业务ob集群升级(ocplog、subtask).7z

点击链接查看: https://sdrivesdt.catl.com/l/noscDu
提取码: guuy
到期日: 无限制

从报错的信息来看 这个问题是预期内的 租户 Locality 配置不合理 stop zone1 后无足够副本。

这个怎么修复 ?

信息查一下

– 1. 查看 LS(1) 副本分布与状态
SELECT ls_id, svr_ip, svr_port, zone, role, member_list, replica_type, status
FROM CDB_OB_LS_LOCATIONS
WHERE tenant_id = 1010 AND ls_id = 1;

– 2. 查看各 zone 状态
SELECT zone, status FROM DBA_OB_ZONES;

– 3. 查看 server 状态
SELECT svr_ip, svr_port, zone, status, start_service_time
FROM DBA_OB_SERVERS;