

Monitoring ma prowadzić do działania. Nie do ściany czerwonych wykresów.
Ustalamy, które sygnały są ważne, kto reaguje i kiedy alert staje się incydentem. Patrzymy też na trendy: pojemność, stabilność i powtarzalne błędy.
Dobry alert mówi, co się dzieje, jaki jest wpływ i kto ma zrobić kolejny krok.
Alert ma znaczenie dopiero wtedy, gdy prowadzi do działania.
Nie chodzi o tysiące wykresów. Ustalamy zestaw sygnałów, które rzeczywiście mówią coś o dostępności, wydajności, bezpieczeństwie i możliwości odtworzenia.
- DOSTĘPNOŚĆ
- hosty, usługi, łącza, DNS, VPN, certyfikaty
- ZASOBY
- CPU, RAM, storage, pojemność, temperatury
- BACKUP
- status zadań, czas, pojemność, ostatni restore
- PATCHING
- braki aktualizacji, wyjątki, reboot required
- BEZPIECZEŃSTWO
- EDR/AV, krytyczne zdarzenia i ekspozycja
Monitoring nie kończy się na wysłaniu maila z alertem.
-
01
DETECT
sygnał przekracza próg
-
02
TRIAGE
ocena wpływu i priorytetu
-
03
ACTION
reakcja / automatyzacja / eskalacja
-
04
VERIFY
potwierdzenie powrotu
-
05
PROBLEM
przyczyna, jeśli zdarzenie się powtarza
Raport ma powiedzieć, co się zmieniło i czy trzeba podjąć decyzję.
przerwy, flapping, problemy łączy i usług oraz ich wpływ na użytkowników
storage, pamięć, CPU, przepustowość i elementy zbliżające się do limitu
błędy, zaległości, wyjątki oraz systemy wymagające ręcznej decyzji
sygnały, które nie powinny wracać — trafiają do problem management
konkretne działania prewencyjne zamiast samej historii zdarzeń






