obproxy频繁出现sql执行失败告警 failed,-4016

【 使用版本 】
obprox:4.1.35
oceanbase:4.2.5.7
ocp-agent:4.4.2
【问题描述】清晰明确描述问题
OCP频繁出现告警,都是SQL执行失败。
级别状态:预警 手动处理中
告警名称:SQL执行失败次数超限
告警对象:alarm_template_id=0:obproxy_cluster=xxxxx-5:host=xxx:odp_schema=xxx
告警内容:告警概述:alarm_template_id=0:obproxy_cluster=xxxxxxxx-5:host=xxx:odp_schema=xxxxxx SQL执行失败次数超限
告警详情:OBProxy实例:xxxx,部署单元:xxxx,数据库:xxxxxx,告警:数据库SQL执行失败次数 1 超过阈值 0。
触发时值:1
OCP链接:http://xxxxx/alarm/event/896
触发时值:
首次触发时间:2026-08-31 19:50:22
持续时长:0s
发送时间:2026-08-31 19:50:22

1.查询obproxy_error的日志,发现都是统一的failed,-4016
1.3/obproxy_stat.log.20260909060259:44309:2026-09-09 05:40:59.501024,obcluster_obproxy,obclust_sz:nodeman:bk_esb,OB_MYSQL,OTHERS,failed,-4016,1,0,0,0,54us,0us,0us
1.4/obproxy_error.log:1:2026-09-09 04:05:47.142093,obcluster_obproxy,obclust_sz:nodeman,OB_MYSQL,COM_QUERY,OTHERS,failed,-4016,SELECT node_man_processstatus.bk_host_id%2C node_man_processstatus.name%2C node_man_processstatus.version FROM node_man_processstatus WHERE (node_man_processstatus.is_latest = 1 AND node_man_processstatus.name IN (‘uptimecheckbeat’) AND node_man_processstatus.source_type = ‘default’),0us,0us,0us,0us,Y0-00007F47BE3DC740,192.168.0.1:29440,0,Connect error,
1.4/obproxy_error.log:3:2026-09-09 04:05:47.837539,obcluster_obproxy,obclust_sz:nodeman,OB_MYSQL,COM_QUERY,OTHERS,failed,-4016,SELECT node_man_processstatus.bk_host_id%2C node_man_processstatus.name%2C node_man_processstatus.version FROM node_man_processstatus WHERE (node_man_processstatus.is_latest = 1 AND node_man_processstatus.name IN (‘dbcheck’) AND node_man_processstatus.source_type = ‘default’),0us,0us,0us,0us,Y0-00007F47BE3DC5C0,192.168.0.1:29956,0,Connect error,

2.obproxy_diagnosis.log的 timeou_event:"CLIENT_WAIT_TIEMOUT"和trace_type:“TIMEOUT_TRACE” error_code:-10022 error_msg:“OBProxy inactivity timeout”

1.4/obproxy_diagnosis.log.20260909084151:89833:[2026-09-09 04:05:47.900810] [1193378][Y0-00007F47BDF9BCC0] [CONNECTION](trace_type=“TIMEOUT_TRACE”, connection_diagnosis={cs_id:4294321, ss_id:0, proxy_session_id:748443079954118219, server_session_id:0, client_addr:“192.168.0.1:34293”, server_addr:“Not IP address [0]:0”, proxy_server_addr:“Not IP address [0]:0”, cluster_name:“obclust_sz”, tenant_name:“db”, user_name:“admin”, error_code:-10022, error_msg:“OBProxy inactivity timeout”, request_cmd:“COM_QUERY”, sql_cmd:“COM_QUERY”, req_total_time(us):0}{timeout(us):57600000000, timeout_event:“CLIENT_WAIT_TIMEOUT”})
1.4/obproxy_diagnosis.log.20260909084151:190021:[2026-09-09 05:37:48.214424] [1193373][Y0-00007F47BDF9B280] [CONNECTION](trace_type=“TIMEOUT_TRACE”, connection_diagnosis={cs_id:4275965, ss_id:0, proxy_session_id:748443079954099333, server_session_id:0, client_addr:“192.168.0.1:51103”, server_addr:“Not IP address [0]:0”, proxy_server_addr:“Not IP address [0]:0”, cluster_name:“obclust_sz”, tenant_name:“db”, user_name:“admin”, error_code:-10022, error_msg:“OBProxy inactivity timeout”, request_cmd:“COM_QUERY”, sql_cmd:“COM_QUERY”, req_total_time(us):0}{timeout(us):57600000000, timeout_event:“CLIENT_WAIT_TIMEOUT”})

3.根据官方文档已经把observer wait_timeout变量修改为57600000000,但是仍然频繁出现,是否有其他解决方案?

能把整个日志 都发一下么?odp的版本信息也发一下

odp版本是4.3.1.15

1.2log.zip (12.5 MB)

户端连接在 OBProxy 上长期空闲,超过会话 wait_timeout 后被主动断开。 不是 Observer 连不上,也不是把 wait_timeout 调得不够大。