问题现象:3节点的Patroni + PostgreSQL集群 postgresql-0 节点异常,一直处于starting状态,Lag in MB 显示 unknown,postgresql-0使用的pv、etcd集群排查都没有问题,集群状态及日志报错如下图所示,输出排查步骤及恢复方案

image.png

image.pngimage.png


qwen3.8-max

基于您提供的截图和描述,这是一个典型的 Patroni + PostgreSQL 集群中备...

Continue reading >>

kubectl执行命令卡住,访问apiserver:6443 报504连接超时报错,k8s集群无法操作,根据经验感觉 etcd 集群是出问题了,查看 etcd 集群发现只剩一个节点的etcd还在运行,登陆异常 etcd 节点发现etcd容器一直在不断重启,拿到报错日志,备份3个master节点上etcd数据,将etcd报错信息截图和故障现象描述发给 qwen...

Continue reading >>

客户有个好几年前的k8s老环境,部署新的应用就出问题了,从部署的服务pod里访问k8s svc地址端口 172.16.0.1:443 不通,宿主机上访问都是通的,kube-proxy mode是 iptables 模式,endpoints检察都正常,svc 后端apiserver 6443 也都能正常访问,重建kube-proxy、kubernetes svc 后 pod 访问 svc 依然不通,...

Continue reading >>

最近在给客户部署一套 k8s 集群时,主节点master1安装完后,master2 join时提示 etcd 证书报错,铲掉重装后问题还是稳定复现,客户提供的机器操作系统为Ubuntu 22.04、Kernel:Linux 5.15.x,报错信息节选如下

error execution phase control-plane-prepare/certs: error creating PKI as...

Continue reading >>

踩了个研发建表没有设置主键的坑,mark一下。数据库实例是 tdsql mysql 5.7,服务建表的时候直接报错:ERROR 1173 (42000):This table type requires a primary key,最后乖乖加上主键解决。

tdsql中设置建表必须需要显式主键的参数为 reject_table_no_pk

1745590748906718.png

至于为什么建表必须创建主键应该是主要有两个原因,一个是...

Continue reading >>

最近遇到一个客户k8s测试集群经常崩溃,最终定位是etcd磁盘IO性能不足,最终替换成ssd盘解决,记录一下排查过程。

集群是跑在客户的共享虚机上,磁盘是机械硬盘,问题现象如下:

  1. kube-system下涉及高可用的组件 kube-apiserver、kube-controller-manager、kube-scheduler 频繁重启,某些选主模式的组件、服务反复重启,频繁CrashLoopBack...

Continue reading >>