Site Reliability Engineer (SRE) (m/w/d)
Deutsche Telekom AG –
Nürnberg
Gehalt: Von 26.500,00 € bis 171.900,00 €
Gehalt: Von 26.500,00 € bis 171.900,00 €
Über T-Systems International GmbHBei T-Systems bieten wir unseren Geschäftskunden die richtigen Systemlösungen für ihr digitales Business. Mit unserem Portfolio stellen wir sicher, dass digitale Transformation Komplexität reduziert, Kosten einspart und die alltägliche Arbeit erleichtert. Unsere Schwerpunkte sind Konnektivität, Digital, Cloud & Infrastruktur sowie Sicherheit - Let's power higher performance!Über die PositionAls Site Reliability Engineer stehen Sie an vorderster Front, um die Stabilität, Performance und Skalierbarkeit unserer kritischen Systeme sicherzustellen. Sie spielen eine zentrale Rolle bei der Entwicklung, dem Aufbau und der Wartung einer hochzuverlässigen und effizienten Infrastruktur.
- Mit Ihrer Expertise in modernen Monitoring-, Observability- und Cloud-Native-Technologien gestalten Sie den Aufbau und Betrieb eines leistungsfähigen Monitoring-Stacks auf Basis von Prometheus, Grafana, Loki und AlertManager für verteilte Fog- und Edge-Infrastrukturen. Dabei entwickeln Sie spezialisierte Dashboards zur Überwachung von Hardwarezuständen, Ressourcenauslastung und Netzwerkverbindungen und schaffen so die Grundlage für einen transparenten und stabilen Betrieb.
- Sie konzipieren und implementieren Alerting-Strategien für autonome Betriebsmodelle sowie Disconnected- und Air-Gap-Szenarien und stellen sicher, dass kritische Ereignisse auch unter eingeschränkten Netzwerkbedingungen zuverlässig erkannt und verarbeitet werden. Darüber hinaus verantworten Sie die Umsetzung von lokalen Retention-Konzepten, Log-Rotation-Mechanismen und effizienten Datenmanagement-Strategien für ressourcenbeschränkte Umgebungen.
- Ein weiterer Schwerpunkt Ihrer Tätigkeit liegt in der kontinuierlichen Performance-Optimierung des Monitoring-Stacks unter Berücksichtigung begrenzter CPU-, Speicher- und Storage-Ressourcen auf Fog-Nodes. Sie integrieren Kubernetes-Monitoring-Lösungen, analysieren Betriebs- und Performancedaten und identifizieren proaktiv Optimierungspotenziale zur Steigerung von Stabilität, Verfügbarkeit und Effizienz der Plattform.
- Durch den Einsatz von Infrastructure-as-Code-Ansätzen und YAML-basierten Konfigurationen automatisieren Sie die Bereitstellung und Verwaltung der Monitoring-Komponenten und leisten einen wesentlichen Beitrag zur Weiterentwicklung einer robusten, skalierbaren und hochverfügbaren Observability-Plattform für moderne Edge- und Fog-Computing-Umgebungen.
- Monitoring & Observability
- PromQL
- Federation
- Remote Write
- Local Retention Management
- Dashboarding & Visualisierung
- Dashboard-Entwicklung
- Alerting
- Provisioning-as-Code
- Log Management
- LogQL
- Retention Management
- Compaction
- Alerting & Incident Management
- Standalone Routing
- Alert Inhibition
- Eskalations- und Benachrichtigungskonzepte
- Kubernetes & Cloud Native
- Erfahrung im Monitoring und Betrieb von Kubernetes-Umgebungen
- Verständnis von Container-Plattformen und Cloud-Native-Architekturen
- Edge & Fog Computing
- Erfahrung mit ressourcenbeschränkten Umgebungen
- Optimierung von CPU-, Memory- und Storage-Nutzung
- Verständnis von Offline-, Air-Gap- und Disconnected-Betriebsszenarien
- Sehr gute Kenntnisse in YAML
- Ausgeprägtes Verständnis für IT-Sicherheit und Security Awareness
- Analytische und strukturierte Arbeitsweise
- Erfahrung im Site Reliability Engineering oder Infrastruktur-Betrieb
- Sehr gutes Deutsch in Wort und Schrift (C1-Niveau)
- Infrastructure as Code (z. B. Terraform, Ansible)
- GitOps-Ansätze
- Linux-Systemadministration
- OpenTelemetry und moderne Observability-Konzepte
- Erfahrung in kritischen oder hochverfügbaren Infrastrukturen