IT-Systeme administrieren und betreiben
Nach der Inbetriebnahme beginnt der dauerhaft verantwortete Betrieb eines IT-Systems. Administration umfasst deshalb weit mehr als das Anlegen von Benutzern: Systeme müssen sicher konfiguriert, überwacht, aktualisiert, dokumentiert und bei Störungen kontrolliert wiederhergestellt werden. In der Prüfung zählt besonders, Betriebsdaten richtig zu deuten und aus ihnen eine begründete Maßnahme abzuleiten.
Betrieb planbar und nachvollziehbar organisieren
Ein stabiler Betrieb benötigt definierte Zuständigkeiten, wiederholbare Abläufe und eine aktuelle Dokumentation. Für jeden wichtigen Dienst sollte klar sein, wer ihn betreibt, welche Abhängigkeiten bestehen, wie er überwacht wird und was bei einer Störung geschieht. Betriebsaufgaben werden nach festen Intervallen oder durch Ereignisse ausgelöst.
Standardisierte Tätigkeiten wie Benutzeranlage, Patchen oder Zertifikatswechsel sollten als Arbeitsanweisung beschrieben werden. Das reduziert Fehler und macht Vertretung möglich. Kritische Änderungen benötigen zusätzlich Freigabe, Sicherung und Rückfallplan.
| Betriebsaufgabe | Auslöser | Erforderlicher Nachweis |
|---|---|---|
| Monitoring prüfen | fortlaufend oder nach Alarm | Messwert, Zeitstempel und Bearbeitungsstatus |
| Updates einspielen | Patchzyklus oder Sicherheitsmeldung | Freigabe, Test, Installation und Ergebnis |
| Berechtigungen kontrollieren | regelmäßig sowie bei Rollenwechsel | Soll-Ist-Abgleich und dokumentierte Freigabe |
| Datensicherung prüfen | nach Sicherungslauf und Wiederherstellungstest | Protokoll, Fehlerbehandlung und Restore-Nachweis |
| Dokumentation pflegen | nach jeder relevanten Änderung | Version, Verantwortlicher und Änderungsgrund |
Identitäten, Rollen und Berechtigungen verwalten
Benutzer erhalten nur die Rechte, die sie für ihre Aufgabe benötigen. Statt Einzelberechtigungen werden möglichst Rollen oder Gruppen verwendet. Dadurch lassen sich Änderungen nachvollziehbar umsetzen und regelmäßig kontrollieren. Administrative Konten werden von normalen Benutzerkonten getrennt; gemeinsam genutzte Konten sind zu vermeiden, weil Handlungen sonst nicht eindeutig zugeordnet werden können.
Der Lebenszyklus einer Identität beginnt beim Eintritt, umfasst Rollenwechsel und endet beim Austritt. Besonders kritisch sind verwaiste Konten, dauerhaft gültige temporäre Rechte und technische Dienstkonten mit zu weitreichenden Berechtigungen. Für privilegierte Zugänge sind zusätzliche Schutzmaßnahmen wie Mehrfaktorauthentifizierung und gesicherte Administrationsgeräte sinnvoll.
Identität nach bestätigtem Auftrag anlegen, Grundrolle zuweisen und Erstanmeldung absichern.
Bei Aufgabenwechsel alte Rechte entfernen und neue Rechte nach Freigabe ergänzen.
Zugang fristgerecht sperren, Geräte und Daten übergeben sowie Gruppenmitgliedschaften auflösen.
Verantwortliche bestätigen regelmäßig, dass Rollen und Sonderrechte weiterhin benötigt werden.
Konfigurationen und Änderungen kontrollieren
Konfigurationsmanagement hält fest, welche Komponenten und Einstellungen zu einem System gehören. Ein dokumentierter Soll-Zustand erleichtert Vergleiche, Wiederherstellung und Fehlersuche. Änderungen sollten über einen geregelten Prozess erfolgen, damit technische Auswirkungen, Sicherheitsrisiken und betroffene Geschäftszeiten vorab bewertet werden.
Nicht jede Änderung benötigt denselben Aufwand. Eine vorab genehmigte Standardänderung ist risikoarm und wiederholt sich häufig. Eine normale Änderung wird geplant und freigegeben. Eine Notfalländerung darf beschleunigt umgesetzt werden, muss aber trotzdem dokumentiert und nachträglich bewertet werden.
- Ziel, Umfang und betroffene Systeme eindeutig beschreiben
- Abhängigkeiten, Ausfallrisiko und Wartungsfenster bewerten
- Sicherung sowie technisch realistischen Rückfallweg festlegen
- Änderung zunächst in einer geeigneten Testumgebung prüfen
- Ergebnis kontrollieren und Betriebsdokumentation aktualisieren
Patch- und Versionsmanagement sicher durchführen
Updates schließen Sicherheitslücken, korrigieren Fehler oder ändern Funktionen. Sie dürfen weder ungeprüft auf alle Systeme verteilt noch unbegrenzt verschoben werden. Grundlage ist eine aktuelle Inventarisierung: Nur bekannte Betriebssysteme, Anwendungen, Firmwarestände und Abhängigkeiten können gezielt bewertet werden.
Die Priorität ergibt sich aus Kritikalität der Schwachstelle, Erreichbarkeit des Systems, Schutzbedarf und verfügbaren Gegenmaßnahmen. Nach dem Test folgt eine gestufte Verteilung, etwa zunächst auf Pilotgeräte. Anschließend werden Installation, Dienstzustand und fachliche Funktion kontrolliert. Fehlgeschlagene Installationen müssen erkannt und behandelt werden.
Herstellerhinweise, Schwachstellenbewertung und betroffene Versionen prüfen.
Risiko, Dringlichkeit, Abhängigkeiten und notwendige Ausfallzeit bestimmen.
Kompatibilität, Installation, Deinstallation und Rückfallweg erproben.
Freigegebenes Update kontrolliert und möglichst gestuft ausrollen.
Versionsstand, Dienste, Protokolle und fachliche Kernfunktionen prüfen.
Monitoring, Logging und Alarmierung unterscheiden
Monitoring erfasst Zustände und Messwerte, beispielsweise Erreichbarkeit, CPU-Last, Speicherbelegung, Antwortzeit oder Ablaufdaten von Zertifikaten. Logging zeichnet Ereignisse auf und unterstützt Nachvollziehbarkeit sowie Fehleranalyse. Eine Alarmierung bewertet Messwerte oder Ereignisse anhand festgelegter Regeln und benachrichtigt die zuständige Stelle.
Ein einzelner Messwert ist selten ausreichend. Hohe CPU-Last kann eine Störung, eine geplante Verarbeitung oder lediglich einen kurzen Laststoß darstellen. Deshalb werden Zeitverlauf, Vergleichswerte und zusammenhängende Messgrößen betrachtet. Schwellenwerte benötigen eine sinnvolle Dauer und Hysterese, damit kurzzeitige Ausschläge nicht unnötig alarmieren.
| Signal | Mögliche Bedeutung | Sinnvolle nächste Prüfung |
|---|---|---|
| Datenträger fast voll | Wachstum, temporäre Dateien oder fehlerhafte Protokollrotation | Verzeichnisgrößen, Wachstumsrate und Aufbewahrung |
| Antwortzeit steigt | Last, Netzwerk, Datenbank oder abhängiger Dienst | Zeitverlauf und Messwerte aller beteiligten Komponenten |
| Viele Fehlanmeldungen | Fehlkonfiguration, vergessenes Kennwort oder Angriff | Quelle, Konto, Zeitraum und betroffene Systeme |
| Sicherung dauert länger | größere Datenmenge, langsames Ziel oder Netzengpass | Datenrate, Änderungsmenge, Zielsystem und Fehlerprotokoll |
Kapazität und Verfügbarkeit im laufenden Betrieb sichern
Kapazitätsmanagement beobachtet nicht nur aktuelle Grenzwerte, sondern Trends. Aus Wachstumsrate und verbleibender Reserve wird abgeleitet, wann eine Erweiterung erforderlich wird. Dabei sind technische Grenzen, Beschaffungszeit, Wartungsfenster und Lizenzierung zu berücksichtigen.
Verfügbarkeit wird über einen definierten Zeitraum gemessen. Geplante Wartung kann je nach Vereinbarung ein- oder ausgeschlossen sein. Die reine Prozentzahl muss immer im Zusammenhang mit dem Zeitraum betrachtet werden: Dieselbe Ausfallzeit wirkt sich bei monatlicher und jährlicher Betrachtung unterschiedlich aus.
- Messzeitraum und Servicezeit eindeutig festlegen
- ungeplante Ausfallzeit von vereinbarter Wartung unterscheiden
- Kapazität anhand von Trends statt erst beim Erreichen von 100 Prozent erweitern
- Redundante Systeme regelmäßig auf tatsächliche Umschaltfähigkeit prüfen
- wiederkehrende Störungen als Problem und nicht nur als einzelne Tickets behandeln
Datensicherung und Wiederherstellung betreiben
Im Betrieb muss nach jedem Sicherungslauf erkennbar sein, ob alle vorgesehenen Daten geschützt wurden. Ein erfolgreich beendeter Job ist noch kein vollständiger Nachweis: Aufbewahrung, Verschlüsselung, Trennung vom Produktivsystem und Wiederherstellbarkeit müssen ebenfalls kontrolliert werden.
Für die Wiederherstellung werden Reihenfolge und Abhängigkeiten festgelegt. Häufig müssen zunächst Infrastruktur- oder Identitätsdienste, anschließend Datenbanken und erst danach Anwendungen verfügbar sein. Regelmäßige Restore-Tests prüfen nicht nur die Daten, sondern auch Zugangsdaten, Dokumentation, Verantwortlichkeiten und benötigte Zeit.
| Kontrolle | Zu prüfender Punkt |
|---|---|
| Sicherungslauf | Vollständigkeit, Fehler, Datenmenge, Dauer und Sicherungsziel |
| Aufbewahrung | Generationen, Löschfristen, unveränderliche oder getrennte Kopie |
| Schutz | Berechtigungen, Verschlüsselung und gesicherte Schlüssel |
| Restore-Test | Lesbarkeit, Konsistenz, benötigte Zeit und fachliche Nutzbarkeit |
| Dokumentation | Reihenfolge, Zuständigkeit, Zugang und Eskalationsweg |
Störungen strukturiert analysieren und beheben
Bei einer Störung steht zunächst die Wiederherstellung des vereinbarten Dienstes im Vordergrund. Gleichzeitig müssen unkoordinierte Änderungen vermieden werden. Symptome, Zeitpunkt, betroffene Nutzer und zuletzt erfolgte Änderungen werden erfasst. Danach wird der Fehlerbereich schrittweise eingegrenzt und jede Hypothese durch eine gezielte Prüfung bestätigt oder verworfen.
Ein Incident beschreibt die aktuelle Beeinträchtigung. Ein Problem untersucht die zugrunde liegende Ursache, insbesondere bei wiederkehrenden oder schweren Störungen. Ein Workaround stellt den Dienst vorübergehend wieder her, beseitigt aber nicht zwingend die Ursache. Nach der Lösung werden Maßnahmen und Erkenntnisse dokumentiert.
Symptom, Beginn, Umfang, Dringlichkeit und betroffene Dienste dokumentieren.
Gemeinsamkeiten, Abhängigkeiten, Änderungen und Protokolle auswerten.
Eine mögliche Ursache formulieren und mit einer gezielten Prüfung testen.
Freigegebene Maßnahme umsetzen oder einen sicheren Workaround verwenden.
Technische Messwerte und fachliche Funktion gemeinsam prüfen.
Ursache, Lösung, Auswirkungen und vorbeugende Maßnahmen festhalten.
Betriebs- und Sicherheitsdokumentation aktuell halten
Dokumentation ist Teil des Betriebs und kein nachträglicher Zusatz. Eine Systemdokumentation beschreibt Aufbau, Konfiguration und Abhängigkeiten. Betriebshandbücher enthalten wiederkehrende Tätigkeiten, Überwachung, Sicherung, Start- und Stoppreihenfolge sowie Störungsverfahren. Änderungen müssen versioniert und für berechtigte Personen erreichbar sein.
Geheimnisse wie Kennwörter oder private Schlüssel gehören nicht ungeschützt in allgemeine Dokumente. Stattdessen wird beschrieben, wo und durch wen diese sicher verwaltet werden. Auch Protokolldaten benötigen Zugriffsschutz und festgelegte Aufbewahrungsfristen.
- Netz-, System- und Datenflusspläne nach Änderungen aktualisieren
- Konfigurationswerte und bewusst getroffene Abweichungen begründen
- Betriebsverfahren mit Voraussetzungen, Schritten und Erfolgskontrolle beschreiben
- Notfallkontakte und Eskalationswege regelmäßig überprüfen
- Änderungshistorie und Freigabestand nachvollziehbar führen
Typischer Lösungsweg in der Prüfung
Prüfungsaufgaben verbinden häufig ein Fehlerbild mit Auszügen aus Monitoring, Protokollen oder Konfigurationen. Werte nicht isoliert betrachten: Ordne zuerst Dienst, Abhängigkeiten und zeitlichen Verlauf ein. Schlage danach eine Maßnahme vor, die Ursache und Risiko berücksichtigt, und nenne eine Kontrolle, mit der sich der Erfolg nachweisen lässt.
- Soll-Zustand und beobachtetes Symptom gegenüberstellen.
- Betroffene Nutzer, Systeme und Zeiträume eingrenzen.
- Protokolle und Messwerte auf gemeinsame Ursache und Reihenfolge prüfen.
- Vor einer Änderung Sicherung, Auswirkung und Rückfallweg berücksichtigen.
- Maßnahme fachlich begründen und nicht nur einen Befehl nennen.
- Erfolg durch Messwert, Funktionstest oder Restore-Nachweis kontrollieren.
