Site Reliability Engineer (SRE) (m/w/d)
Deutsche Telekom AG –
Leinfelden-Echterdingen
Gehalt: Von 26.500,00 € bis 172.000,00 €
Gehalt: Von 26.500,00 € bis 172.000,00 €
Über T-Systems International GmbHBei T-Systems bieten wir unseren Geschäftskunden die richtigen Systemlösungen für ihr digitales Business. Mit unserem Portfolio stellen wir sicher, dass digitale Transformation Komplexität reduziert, Kosten einspart und die alltägliche Arbeit erleichtert. Unsere Schwerpunkte sind Konnektivität, Digital, Cloud & Infrastruktur sowie Sicherheit - Let's power higher performance!Über die PositionAls Site Reliability Engineer mit Schwerpunkt Observability tragen Sie maßgeblich dazu bei, Transparenz, Stabilität und Zuverlässigkeit unserer verteilten Cloud-, Edge- und Kubernetes-Plattformen sicherzustellen. Sie übernehmen eine zentrale Rolle bei der Konzeption, Implementierung und kontinuierlichen Weiterentwicklung moderner Observability-Lösungen und schaffen die Grundlage für einen zuverlässigen Betrieb komplexer, cloud-nativer Infrastrukturen.Mit Ihrer Expertise in OpenTelemetry, Distributed Tracing und modernen Telemetrie-Architekturen entwickeln und betreiben Sie leistungsfähige Pipelines für Metrics, Logs und Traces. Dabei integrieren Sie den OpenTelemetry Collector, OTLP sowie SDKs und Auto-Instrumentation in bestehende Plattformen und schaffen eine durchgängige End-to-End-Observability über verteilte Anwendungen und Services hinweg.Sie implementieren und betreiben Jaeger als zentrale Plattform für Distributed Tracing und entwickeln Korrelationsmechanismen zwischen Logs, Metrics und Traces, um Fehlerursachen schnell zu identifizieren und komplexe Abhängigkeiten innerhalb verteilter Systeme transparent darzustellen. Dabei berücksichtigen Sie moderne Sampling-Strategien, Context Propagation sowie effiziente Konzepte für Trace Storage und die performante Auswertung großer Telemetriedatenmengen.Darüber hinaus integrieren Sie Security-, Infrastruktur- und Plattform-Events in zentrale SIEM-Lösungen und entwickeln standardisierte Telemetrie- und Instrumentierungskonzepte für Kubernetes- und Cloud-Native-Plattformen. Mit Ihren Programmierkenntnissen in Go, Python oder Shell automatisieren Sie Integrations- und Betriebsprozesse und leisten einen wesentlichen Beitrag zur Weiterentwicklung einer skalierbaren, hochverfügbaren und zukunftssicheren Observability-Plattform für moderne verteilte Infrastrukturen.Must-Have SkillsSehr gute Kenntnisse in OpenTelemetry, insbesondere im Umgang mit dem OpenTelemetry Collector, OTLP, SDKs sowie Auto-Instrumentation
- Fundierte Erfahrung mit Distributed Tracing, einschließlich Span Correlation, Context Propagation und Sampling-Strategien
- Erfahrung im Aufbau und Betrieb von Jaeger, insbesondere hinsichtlich Trace Storage, Indexierung und Query-Optimierung
- Fundierte Kenntnisse in der Integration von SIEM-Lösungen, im Security Event Management sowie im Einsatz von CEF- und Syslog-basierten Protokollen
- Gute Programmierkenntnisse in Go, Python oder Shell zur Umsetzung von Telemetrie-, Integrations- und Automatisierungsaufgaben
- Erfahrung im Bereich Kubernetes Observability, Cloud-Native-Plattformen sowie moderner Telemetrie-Architekturen
- Ausgeprägtes Verständnis für IT-Sicherheit und Security Awareness
- Analytische und strukturierte Arbeitsweise
- Erfahrung im Site Reliability Engineering oder Infrastruktur-Betrieb
- Sehr gutes Deutsch in Wort und Schrift (C1-Niveau)
- Integration, Administration und kontinuierliche Optimierung von Jaeger zur Visualisierung und Analyse verteilter Services und Anwendungen
- Konzeption und Umsetzung von Korrelationsmechanismen zwischen Logs, Metrics und Traces zur Schaffung einer durchgängigen End-to-End-Observability
- Integration von Security-, Infrastruktur- und Plattform-Events in zentrale SIEM- und Analyseplattformen zur Unterstützung von Monitoring- und Security-Prozessen
- Entwicklung und Etablierung von Telemetrie-, Instrumentierungs- und Observability-Standards für Cloud-Native- und Kubernetes-Plattformen
- Sicherstellung eines zuverlässigen und performanten Betriebs von Observability-Lösungen in Air-Gap-, Edge-, Fog- und verteilten Infrastrukturen