跳转到主要内容

监控告警

如何在 Pigsty 中监控 Node?如何使用 Node 本身的管控面板?有哪些告警规则值得关注?
如何在 Pigsty 中监控 Node?如何使用 Node 本身的管控面板?有哪些告警规则值得关注?

Pigsty 当前在 NODE 仪表盘目录中提供 10 个监控面板和完善的告警规则。


监控面板

NODE 仪表盘目录当前包含 10 个监控仪表板;其中 JuiceFS 与 Claude Code 面板只有在部署并产生相应指标后才会有数据。

NODE Overview

展示当前环境所有主机节点的总体情况概览。

node-overview.jpg

NODE Cluster

显示特定主机集群的详细监控数据。

node-cluster.jpg

Node Instance

呈现单个主机节点的详细监控信息。

node-instance.jpg

NODE Alert

集中展示环境中所有主机的告警信息。

node-alert.jpg

NODE VIP

监控 L2 虚拟 IP 的详细状态。

node-vip.jpg

Node Haproxy

追踪 HAProxy 负载均衡器的运行情况。

node-haproxy.jpg

Node Disk

聚焦单盘 I/O 延迟、吞吐与队列深度等存储指标。

node-disk.webp

Node Vector

查看 Vector 采集与转发状态,以及日志管道健康度。

node-vector.webp

Node JuiceFS

查看 JuiceFS 客户端的缓存、对象存储、元数据操作与读写性能。

打开 Node JuiceFS Dashboard

Claude Code

查看 Claude Code 通过 OpenTelemetry 上报的会话、Token、成本与日志数据。

打开 Claude Code Dashboard


告警规则

Pigsty 针对 NODE 实现了以下告警规则:

可用性告警

规则 级别 说明
NodeDown CRIT 节点离线
HaproxyDown CRIT HAProxy 服务离线
VectorDown WARN 日志收集代理离线(Vector)
DockerDown WARN 容器引擎离线
KeepalivedDown WARN Keepalived 守护进程离线

CPU 告警

规则 级别 说明
NodeCpuHigh WARN CPU 使用率超过 70%

调度告警

规则 级别 说明
NodeLoadHigh WARN 标准化负载超过 100%

内存告警

规则 级别 说明
NodeOutOfMem WARN 可用内存少于 10%
NodeMemSwapped WARN Swap 使用率超过 1%

文件系统告警

规则 级别 说明
NodeFsSpaceFull WARN 磁盘使用率超过 90%
NodeFsFilesFull WARN Inode 使用率超过 90%
NodeFdFull WARN 文件描述符使用率超过 90%

磁盘告警

规则 级别 说明
NodeDiskSlow INFO 读写延迟超过 32ms

网络协议告警

规则 级别 说明
NodeTcpErrHigh WARN TCP 错误率超过 1/分钟
NodeTcpRetransHigh INFO TCP 重传率超过 1%

时间同步告警

规则 级别 说明
NodeTimeDrift WARN 系统时间未同步