Den Betrieb und die Verfügbarkeit von Netzwerken überwachen und gewährleisten
Ein Netzwerk gilt nicht schon dann als betriebsbereit, wenn Geräte erreichbar sind. Verfügbarkeit, Leistung, Konfigurationsstand und Sicherheitsereignisse müssen kontinuierlich überwacht werden. Störungen werden schichtweise eingegrenzt und nach ihrer Auswirkung priorisiert.
Messbare Betriebsziele festlegen
Service Level beschreiben unter anderem Betriebszeit, Verfügbarkeit, Reaktions- und Wiederherstellungszeiten. Messpunkt und Zeitraum müssen eindeutig sein. Ein einzelner Geräte-Ping kann die Verfügbarkeit einer Anwendung nicht vollständig nachweisen.
| Kennzahl | Aussage |
|---|---|
| Verfügbarkeit | Anteil vereinbarter Servicezeit ohne Ausfall |
| Latenz | Zeit für die Übertragung oder Antwort |
| Jitter | Schwankung der Laufzeit |
| Paketverlust | Anteil nicht zugestellter Pakete |
| Durchsatz | tatsächlich übertragene Nutzdaten pro Zeit |
Monitoring sinnvoll aufbauen
Gerätezustand, Schnittstellen, Routing, Dienste und Ende-zu-Ende-Funktion werden kombiniert überwacht. SNMP kann Zustände und Zähler liefern, Syslog Ereignisse zentral sammeln und Flow-Daten Kommunikationsbeziehungen sichtbar machen. Aktive Prüfungen erzeugen Testverkehr; passive Verfahren beobachten vorhandenen Verkehr.
Schwellenwerte müssen Normalzustand und Lastprofile berücksichtigen. Warnung und kritischer Alarm sollten genügend Zeit für Reaktion lassen.
- Zeitquellen aller Systeme synchronisieren
- Alarm eindeutig Gerät, Dienst und Dringlichkeit zuordnen
- Abhängigkeiten nutzen, um Alarmfluten zu reduzieren
- Dashboards von revisionssicheren Langzeitprotokollen unterscheiden
Fehler schichtweise eingrenzen
Eine strukturierte Diagnose verhindert zufällige Änderungen. Je nach Symptom kann von der physischen Schicht nach oben oder von der Anwendung nach unten geprüft werden. Ein Vergleich mit funktionierenden Geräten oder Wegen hilft bei der Eingrenzung.
Wichtige Werkzeuge sind Status- und Fehlerzähler, Ping, Traceroute, Namensauflösung, Routingtabelle, ARP-/Neighbor-Tabelle, Portprüfung und Paketmitschnitt. Jeder Test beantwortet eine konkrete Hypothese.
Ein Benutzer, ein VLAN, ein Standort oder alle Nutzer betroffen?
Link, Fehlerzähler, Signal und Verkabelung prüfen.
Adresse, Präfix, Gateway, VLAN und DHCP kontrollieren.
Routing, Filter und Rückweg untersuchen.
Port, Prozess, DNS und Anwendung testen.
Nach der Behebung denselben Ende-zu-Ende-Test wiederholen.
Redundanz und Konvergenz kontrollieren
Redundante Links und Geräte erhöhen nur dann die Verfügbarkeit, wenn Fehler erkannt und Pfade kontrolliert umgeschaltet werden. Konvergenzzeit beschreibt, wie lange das Netzwerk benötigt, um einen stabilen neuen Zustand zu erreichen.
Regelmäßige Failover-Tests zeigen, ob Routing, Spanning Tree, Link Aggregation, Gateway-Redundanz und Anwendungen wie vorgesehen reagieren. Ein blockierter Ersatzpfad oder eine veraltete Konfiguration kann unbemerkt bleiben, solange der Primärpfad funktioniert.
- aktive und passive Rolle eindeutig überwachen
- symmetrischen Hin- und Rückweg bei zustandsbehafteten Firewalls beachten
- Umschaltzeit mit Anwendungsanforderung vergleichen
- Rückschaltung und erneute Redundanz ebenfalls prüfen
Konfigurationen sichern und Änderungen verfolgen
Gerätekonfigurationen werden regelmäßig und nach Änderungen gesichert. Versionen, Firmware, Module und Lizenzen gehören zur Wiederherstellungsinformation. Ein Konfigurationsvergleich kann unautorisierte oder versehentliche Änderungen erkennen.
Vor Änderungen werden Abhängigkeiten, Wartungsfenster und Rückfallplan festgelegt. Nach der Umsetzung folgen technischer Test, Monitoringkontrolle und Aktualisierung der Dokumentation.
| Vor Änderung | Nach Änderung |
|---|---|
| aktuellen Zustand und Konfiguration sichern | Soll-Konfiguration und Version vergleichen |
| Auswirkung und Rückfallweg prüfen | Erreichbarkeit und Dienste testen |
| betroffene Stellen informieren | Monitoring und Protokolle kontrollieren |
| Freigabe dokumentieren | Änderung und Ergebnis abschließen |
Störungen priorisieren und kommunizieren
Priorität ergibt sich aus Auswirkung und Dringlichkeit. Ein Ausfall eines zentralen Standorts betrifft mehr Nutzer als ein einzelner Port, kann aber durch vorhandene Ersatzwege weniger dringend sein. Statusmeldungen nennen Auswirkung, Bearbeitungsstand und nächsten Zeitpunkt für ein Update, ohne unbestätigte Ursachen als Tatsache darzustellen.
Wiederkehrende Vorfälle werden einer Ursachenanalyse zugeführt. Kapazitäts- und Trenddaten helfen, proaktiv zu handeln.
- Ticket mit Zeit, Symptom, Umfang und bisherigen Tests führen
- Eskalation nach technischer und organisatorischer Zuständigkeit
- Workaround klar von dauerhafter Lösung unterscheiden
- nach schwerer Störung Verbesserungsmaßnahmen festlegen
Typischer Lösungsweg in der Prüfung
- Messwert, Messpunkt und Zeitraum gemeinsam lesen.
- Störungsumfang vor der Ursache bestimmen.
- Diagnosewerkzeug passend zur Schicht wählen.
- Hin- und Rückweg sowie Abhängigkeiten berücksichtigen.
- Redundanz durch Test statt nur durch Zeichnung bewerten.
- Behebung, Kontrolle und Dokumentation vollständig nennen.
