运维
Ceph 架构与运维
· ☕ 7 分钟
Ceph 是支持块存储(RBD)、对象存储(RGW)、文件存储(CephFS)的统一分布式存储。可以使用官方 cephadm 以容器(Docker 或者 Podman + Containerd)编排各守护进程,详情见《容器部署 Ceph》。 1. 架构 1.1 拓扑与数据路径 下图是五节点常见拓扑(

容器部署 VictoriaMetrics
· ☕ 4 分钟
VictoriaMetrics(简称 VM)是兼容 Prometheus 生态的时序数据库,资源占用低于 Prometheus,支持单机版与集群版。单机版可直接替换 Prometheus 存储;集群版通过 vmstorage / vminsert / vmselect 拆分读写与存储,水平扩展能力更强。 1. VictoriaMetrics 单节点 单机版(victoria-me

如何将 Kubernetes 中的 Events 分离到独立的 Etcd
· ☕ 1 分钟
对原 etcd 所在磁盘压力减少 5% 以下,风险系数很低,集群没有异常 1. 部署 Events Etcd 集群 Events 对一致性要求低于主 Etcd,建议部署 3 节点 集群。磁盘建议使用 SSD,数据目录与主 Etcd 分开。 采用静态 Pod 方式部署,kubelet 会自动管理 Etcd 进程,与 kube-apiserver 的部署方式一致。 1.1 集群部

推理应用故障排查清单
· ☕ 1 分钟
Pod 查看 1 号进程的子进程 1 ps --ppid 1 -f 查看 Time_Wait 连接 1 netstat -anp | grep TIME_WAIT Istio Ingress 1 kubectl -n istio-ingress logs -l app=istio-ingress |grep vlm-tag-v1 EastWestGateway 1 kubectl -n istio-ingress logs -l app=istio-eastwestgateway |grep vlm-tag-v1 XDS 推送慢 1 2 3 4 5 histogram_quantile(0.99, sum by (le, pod, type) ( rate(pilot_xds_push_time_bucket{}[1m]) ) ) 达到 30s 就需要注意优化推送。 Node 抓包 1 tcpdump -i bond0 -n -v -tttt 指定目标 IP 和端口 1 tcpdump -i bond0 -n -v -tttt host 10.0.0.10 AI 安装 Nodejs 1 2 3 4 5 6 7 curl -o-

Elasticsearch troubleshooting
· ☕ 1 分钟
处理 Red 状态的 ES 索引 GET _cat/shards?v=true&h=index,shard,prirep,state,node,unassigned.reason&s=state 1 2 ops-pod-loggie-2026.06.11 0 p UNASSIGNED NODE_LEFT ops-pod-loggie-2026.06.11 0 r UNASSIGNED ALLOCATION_FAILED 尝试重新分配 1 POST _cluster/reroute?retry_failed=true 或者直接删除 1 DELETE ops-pod-loggie-2026.06.11 定时清理索引 全部索引仅保留 7 天 创建 ILM 策略 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 PUT _ilm/policy/ops-delete-after-7d { "policy": { "phases": { "hot": { "actions": {} }, "delete": { "min_age": "7d", "actions": { "delete": {} } } } } } 创建索引模板 1 2 3 4 5 6 7 8 9 10 PUT _index_template/ops-delete-after-7d