【 使用环境 】生产环境 物理机
【 OB or 其他组件 】
【 使用版本 】observer 4.5.3.6 ocp 4.3.3
【问题描述】重启observer主机,主机恢复后,ocp拉起ocp_agent,obproxy,启动observer时报错超时 mgragent.log日志截图如下:
咨询有办法查超时原因吗? observer日志中无相关记录,截图中的命令可以执行
【 使用环境 】生产环境 物理机
【 OB or 其他组件 】
【 使用版本 】observer 4.5.3.6 ocp 4.3.3
【问题描述】重启observer主机,主机恢复后,ocp拉起ocp_agent,obproxy,启动observer时报错超时 mgragent.log日志截图如下:
启动的mgragent.log 和observer启动时候observer.log 都发一下
![]()
![]()
![]()
![]()
observer启动时候的observer.log日志发一下
上面那个截图是启动时observer的日志信息,18:04:38停止observer 不再刷日志,18:20:41手动拉起后的打印,observer这块需要看哪些?不方便发全部日志
那也麻烦发出来吧 主要前面的日志信息 也看不到 不知道具体发生了什么 也没有看到启动的日志信息
蹲一个
mgragent 自动拉起 → 前台启动命令 10s 超时 → observer进程拉起来又被kill了 不知道什么原因导致的
18:09 mgragent 重启后 AutoStartObserver 以前台方式启动 Observer,但 shell 超时仅 10 秒,启动未完成即被 SIGTERM/SIGKILL 杀掉,报 auto start observer failed 。
/var/log/messages 日志取一下
计划/运维操作
→ 18:04:38 主动 SIGTERM 停止 Observer
→ 18:09:52 主机重启
→ 重启后 etcd/oblb 启动顺序异常
→ 18:09:57 ocp_agent 启动,18:10:00 就绪
→ 18:10:09 AutoStartObserver 10s 超时失败
→ 18:20:41 人工/OCP 再次启动 Observer
目前这个不确定是谁操作的
18:04:38 的 SIGTERM不知道谁发的:OCP「停止 Observer」任务、OBD 运维脚本、或重启前停服脚本
应该是主机关机的操作,执行的shutdown -r now
看着是18:09:57启动很失败的原因是
18:09:57 etcd 启动失败:bind: cannot assign requested address(网卡 IP 尚未就绪
8:10:03网络就绪,bond0 获得 10.122.4.28,oblb/keepalived 启动
18:09:59–18:10:09 mgragent AutoStartObserver 10s 超时失败
mgragent 18:10:09 keepalived check_oblb 返回 3(健康检查失败)
8:10:15 启动失败:No such process(Observer 已被超时杀掉)systemd 登记 session 时进程已不存在
可以理解为keepalived检测不正常导致启动observer超时?可以调整超时时间来临时解决这种问题吗
应该是etcd oblb/keepalived导致的 AutoStartObserver 10s 超时失败 超时以后Observer 被超时杀掉了 这个超时应该是默认的 改不了
干货满满
没太理解,observer是ocp_agent来管理启动,和oblb中的keepalived有关联?
意思是说 这个影响的