Node İzleme

Kümenizin Nabzı Tek Ekranda

SSH ile node dolaşmak yerine Prometheus tabanlı metrikler, sağlık kontrolleri ve uyarılarla kümenizin gerçek durumunu anlık görün.

SSH'sız metrik toplama

Node ajanları metrikleri Prometheus'a akıtır — 100+ node'a doğal ölçeklenir.

Panele gömülü gözlemlenebilirlik

Grafana kurup bakım yapmadan grafikler, uyarılar ve loglar panelin içinde.

Neler Var

Metrikten Uyarıya Uçtan Uca İzleme

Envanterden GPU'ya, sağlık kontrolünden merkezi loga — izleme yığınının tamamı kurulumla birlikte gelir.

Birleşik Envanter

Tüm node'lar tek listede: durum, satır içi CPU/RAM özeti ve detayda sekmeli görünüm.

Canlı Metrikler

CPU, RAM, disk, ağ ve InfiniBand zaman serileri — node başına ve küme genelinde.

GPU İzleme

DCGM ile NVIDIA GPU envanteri, kullanım ve sıcaklık metrikleri.

Sağlık Kontrolleri

Servis ve node sağlık probları; birleşik olay zaman çizelgesine otomatik kayıt.

Uyarı Kuralları

Eşik tabanlı kurallar; SMTP, webhook ve panel bildirimi; susturma ve bakım pencereleri.

Merkezi Log

Node logları RELP+mTLS ile merkeze akar; panelden LogsQL ile arayın — 90 gün saklama.

Envanterden Aksiyona

İzlemek yetmez — TULPAR gördüğünüz soruna aynı ekrandan müdahale etmenizi sağlar.

Metrikler node_exporter ve tulpar-agent'tan Prometheus'a toplanır; panel PromQL üzerinden okur — SSH tabanlı toplamanın ölçek sınırları yoktur.

Node, iş ve servis olayları tek kronolojik akışta birleşir; tip ve önem derecesine göre filtrelenir.

Kural → firing → bildirim → ack akışı; süre sınırlı susturmalar ve bakım pencereleriyle uyarı yorgunluğu yaşamazsınız.

Drain, resume ve reboot doğrudan node detayından; otomasyon motoru aynı aksiyonları kurala bağlayabilir.

%