Site­Reliability­Engineer­(SRE)­(m/w/d)­{Site­Reliability­Engineer}
Über diesen Job
Als Site Reliability Engineer (SRE) bei der Deutschen Telekom AG sind Sie verantwortlich für die Transparenz und Stabilität von Cloud-, Edge- und Kubernetes-Plattformen. Sie entwickeln und implementieren moderne Observability-Lösungen und arbeiten mit Technologien wie OpenTelemetry und Jaeger, um eine durchgängige End-to-End-Observability sicherzustellen. Freuen Sie sich auf ein flexibles Arbeitsumfeld, ein attraktives Gehalt und zahlreiche Weiterbildungsmöglichkeiten in einem innovativen Team. Bewerben Sie sich jetzt und gestalten Sie die Zukunft der digitalen Infrastruktur aktiv mit!
Aufgaben
- Transparenz, Stabilität und Zuverlässigkeit der verteilten Cloud-, Edge- und Kubernetes-Plattformen sicherstellen
- Moderne Observability-Lösungen konzipieren, implementieren und kontinuierlich weiterentwickeln
- Leistungsfähige Pipelines für Metrics, Logs und Traces entwickeln und betreiben
- OpenTelemetry Collector, OTLP sowie SDKs und Auto-Instrumentation in bestehende Plattformen integrieren
- Durchgängige End-to-End-Observability über verteilte Anwendungen und Services schaffen
- Jaeger als zentrale Plattform für Distributed Tracing implementieren und betreiben
- Korrelationsmechanismen zwischen Logs, Metrics und Traces entwickeln
- Fehlerursachen schnell identifizieren und komplexe Abhängigkeiten transparent darstellen
- Moderne Sampling-Strategien, Context Propagation sowie effiziente Konzepte für Trace Storage berücksichtigen
- Security-, Infrastruktur- und Plattform-Events in zentrale SIEM-Lösungen integrieren
- Standardisierte Telemetrie- und Instrumentierungskonzepte für Kubernetes- und Cloud-Native-Plattformen entwickeln
- Integrations- und Betriebsprozesse mit Programmierkenntnissen in Go, Python oder Shell automatisieren
Anforderungen
- Sehr gute Kenntnisse in OpenTelemetry, insbesondere im Umgang mit dem OpenTelemetry Collector, OTLP, SDKs sowie Auto-Instrumentation
- Fundierte Erfahrung mit Distributed Tracing, einschließlich Span Correlation, Context Propagation und Sampling-Strategien
- Erfahrung im Aufbau und Betrieb von Jaeger, insbesondere hinsichtlich Trace Storage, Indexierung und Query-Optimierung
- Fundierte Kenntnisse in der Integration von SIEM-Lösungen, im Security Event Management sowie im Einsatz von CEF- und Syslog-basierten Protokollen
- Gute Programmierkenntnisse in Go, Python oder Shell zur Umsetzung von Telemetrie-, Integrations- und Automatisierungsaufgaben
- Erfahrung im Bereich Kubernetes Observability, Cloud-Native-Plattformen sowie moderner Telemetrie-Architekturen
- Ausgeprägtes Verständnis für IT-Sicherheit und Security Awareness
- Analytische und strukturierte Arbeitsweise
- Erfahrung im Site Reliability Engineering oder Infrastruktur-Betrieb
- Sehr gutes Deutsch in Wort und Schrift (C1-Niveau)
Benefits
- Flexible Arbeitszeiten
- Mobiles Arbeiten
- Hybrides Arbeitsmodell
- Attraktives Gehalt
- Weiterbildungsmöglichkeiten
- Modernes Arbeitsumfeld
- Offene Unternehmenskultur
- Gesundheitsförderung
- Betriebliche Altersvorsorge
- Mitarbeiterrabatte
- Jobticket
Ist dir ein Fehler aufgefallen?
Teile uns mit, was nicht funktioniert hat, damit wir es schnell beheben können. Sende eine E-Mail an fachkraefte(at)img-sachsen-anhalt.de