集群机架掉电,无法启动

【 使用环境 】生产环境
【 OB or 其他组件 】
ocp部署的3节点结群
【 使用版本 】
4.2.5.7
【问题描述】周末3台机器所在的机柜掉电, 现在启动集群无法启动,手工./bin/observer 也报一样的错误,三台机器的observer.log相同
【复现路径】问题出现前后相关操作
【附件及日志】
observerlog.zip (50.4 KB)

5 个赞

查看三个节点的config.bin也是好的
strings etc/observer.config.bin
observer_id=5
local_ip=172.16.xx.xx1
_ob_enable_direct_load=True
enable_cgroup=True
_upgrade_stage=NONE
data_disk_usage_limit_percentage=99
all_server_list=172.16.xx.xx1:2882,172.16.xx.xx2:2882,172.16.xx.xx3:2882
clog_sync_time_warn_threshold=1s
__min_full_resource_pool_memory=4294967296
enable_rereplication=True
resource_hard_limit=150
log_disk_size=409600M
recyclebin_object_expire_time=7d
enable_ddl=True
min_observer_version=4.2.5.7
server_permanent_offline_time=7200s
enable_sys_table_ddl=False
memstore_limit_percentage=60
large_query_threshold=600s
enable_syslog_recycle=True
max_syslog_file_count=300
alert_log_level=WARN
syslog_level=WDIAG
obconfig_url=http://10.10.xx.xxx:8080/services?Action=ObRootServiceInfo&User_ID=alibaba&UID=ocpmaster&ObRegion=dw_ob_test
cluster_id=2
cluster=dw_ob_test
rootservice_list=172.16.xx.xx1:2882:2881;172.16.xx.xx2:2882:2881;172.16.xx.xx3:2882:2881
enable_upgrade_mode=False
enable_record_trace_log=False
tenant_task_queue_size=16384
net_thread_count=8
zone=zone3
devname=p4p1
mysql_port=2881
rpc_port=2882
config_additional_dir=/redo/dw_ob_test/etc2;/data/dw_ob_test/etc3
datafile_disk_percentage=85
datafile_size=460800M
data_dir=/opt/oceanbase/oceanbase/store/dw_ob_test
compaction_low_thread_score=12
major_freeze_duty_time=02:00
enable_rebalance=True
log_archive_concurrency=10
compatible=4.2.5.7
undo_retention=3600
cpu_quota_concurrency=10
[1001]
compatible=4.2.5.7
[1002]
enable_sql_extension=True
compaction_low_thread_score=12
major_freeze_duty_time=02:00
log_archive_concurrency=10
compatible=4.2.5.7
undo_retention=3600
[1003]
compatible=4.2.5.7
[1004]
_enable_sql_audit_query_sql=True
compaction_low_thread_score=12
major_freeze_duty_time=03:00
log_archive_concurrency=10
compatible=4.2.5.7
undo_retention=3600
[1005]
compatible=4.2.5.7
[1006]
compaction_low_thread_score=16
major_freeze_duty_time=04:00
log_archive_concurrency=10
compatible=4.2.5.7
freeze_trigger_percentage=30
undo_retention=3600
[1017]
compatible=4.2.5.7
[1018]
_prexec_prepare_with_params=True
_update_all_columns_for_trigger=True
_server_full_schema_refresh_parallelism=OBJECT
_system_trig_enabled=False
enable_ps_parameterize=False
_enable_ddl_worker_isolation=True
_ob_immediate_row_conflict_check=False
compaction_low_thread_score=0
major_freeze_duty_time=01:45
partition_balance_schedule_interval=0
log_archive_concurrency=10
log_transport_compress_all=True
_parallel_ddl_control=TRUNCATE_TABLE:ON, SET_COMMENT:ON, CREATE_INDEX:ON, CREATE_VIEW:ON, DROP_TABLE:ON
compatible=4.2.5.7
_enable_mysql_compatible_dates=True
[1019]
compatible=4.2.5.7
[1020]
_prexec_prepare_with_params=True
_update_all_columns_for_trigger=True
_server_full_schema_refresh_parallelism=OBJECT
_system_trig_enabled=False
enable_ps_parameterize=False
_enable_ddl_worker_isolation=True
_ob_immediate_row_conflict_check=False
compaction_low_thread_score=0
major_freeze_duty_time=02:30
partition_balance_schedule_interval=0
log_archive_concurrency=10
log_transport_compress_all=True
_parallel_ddl_control=TRUNCATE_TABLE:ON, SET_COMMENT:ON, CREATE_INDEX:ON, CREATE_VIEW:ON, DROP_TABLE:ON
compatible=4.2.5.7
_enable_mysql_compatible_dates=True
[1021]
compatible=4.2.5.7
[1022]
_prexec_prepare_with_params=True
_update_all_columns_for_trigger=True
_server_full_schema_refresh_parallelism=OBJECT
_system_trig_enabled=False
enable_ps_parameterize=False
_enable_ddl_worker_isolation=True
_ob_immediate_row_conflict_check=False
partition_balance_schedule_interval=0
log_transport_compress_all=True
_parallel_ddl_control=TRUNCATE_TABLE:ON, SET_COMMENT:ON, CREATE_INDEX:ON, CREATE_VIEW:ON, DROP_TABLE:ON
compatible=4.2.5.7
_enable_mysql_compatible_dates=True

3 个赞

OB_INVALID_DATA (-4070,“Invalid data”)
看起来是日志(clog,slog)或者data等损坏了

你发下 observer.log.wfrootservice.log 再看下

3 个赞

log.zip (2.1 MB)
我上午e2fsck -c检查了下clog/data分区 前50%左右都是0/0/0 太大了 没跑完 取消了

2 个赞

看着日志信息不全 把启动后的日志信息 都取一下 启动的时候设置了这个参数了么enable_async_log=true
把这个参数关闭重新启动 把日志发一下

3 个赞

observer.config.bin里有这个参数 怎么修改这个文件呢 原本ocp部署的
日志太大了 我就取了最近1w条日志 要全部的话 我来打包侠

2 个赞

手动启动的时候指定这个参数 enable_async_log=false 就类似这样 如果切换了 用户就不用了
su - admin
cd /home/admin/oceanbase && bin/observer -o “enable_async_log=false”

3 个赞

试过了 还是类似的错误 日志下载地址为:
https://tech-deepwise.oss-cn-beijing.aliyuncs.com/15-软件共享/tmp/log.zip?x-oss-credential=LTAI5tJbwvN4ZE3SRbMXotou%2F20260803%2Fcn-beijing%2Foss%2Faliyun_v4_request&x-oss-date=20260803T085617Z&x-oss-expires=32400&x-oss-signature-version=OSS4-HMAC-SHA256&x-oss-signature=bf741e64d4cf30b6386baa5a2e4e113038d990f43ce2fb81695f5d397c452cc8

1 个赞

主要是要详细日志信息 看看具体什么问题导致的 目前看是4070 可能是文件损坏了导致的

1 个赞

嗯 等会我在看下 不行就重做拿备份恢复下

1 个赞

学习了

1 个赞

666666

机房的配置

后面折腾了下 还是有问题 我看了datafile和clog的文件头都是一致 也不知道后续怎么处理了 然后昨晚直接用备份恢复到掉电时间了。

block manager 成功后,存储元数据回放 + 租户拉起失败(-4070 )因为本地 slog / log pool / 租户存储元数据无效或不一致导致的。更详细的日志看不到 从你解析文件 datafile和clog的文件头都是一致 这个应该判断不了 observer能启动或者不能启动 应该还是有些块损坏了 导致的

1 个赞

好的 谢大佬