Site­Reliability­Engineer­(SRE)­(m/w/d)
Über diesen Job
Als Site Reliability Engineer mit Schwerpunkt Observability bei T-Systems gestalten Sie aktiv den Aufbau einer modernen Observability-Plattform und tragen zur Stabilität und Zuverlässigkeit komplexer Cloud- und Kubernetes-Infrastrukturen bei. Ihre Expertise in OpenTelemetry und Distributed Tracing ist entscheidend für die Implementierung leistungsfähiger Telemetrie-Lösungen. Freuen Sie sich auf ein flexibles Arbeitsumfeld, attraktive Vergütung und zahlreiche Entwicklungsmöglichkeiten in einem innovativen Team. Nutzen Sie die Chance, Teil eines technologisch anspruchsvollen Unternehmens zu werden!
Aufgaben
- Transparenz, Stabilität und Zuverlässigkeit der verteilten Cloud-, Edge- und Kubernetes-Plattformen sicherstellen
- Moderne Observability-Lösungen konzipieren, implementieren und kontinuierlich weiterentwickeln
- Pipelines für Metrics, Logs und Traces entwickeln und betreiben
- OpenTelemetry Collector, OTLP sowie SDKs und Auto-Instrumentation in bestehende Plattformen integrieren
- End-to-End-Observability über verteilte Anwendungen und Services schaffen
- Jaeger als zentrale Plattform für Distributed Tracing implementieren und betreiben
- Korrelationsmechanismen zwischen Logs, Metrics und Traces entwickeln
- Moderne Sampling-Strategien, Context Propagation und Konzepte für Trace Storage berücksichtigen
- Security-, Infrastruktur- und Plattform-Events in zentrale SIEM-Lösungen integrieren
- Standardisierte Telemetrie- und Instrumentierungskonzepte für Kubernetes- und Cloud-Native-Plattformen entwickeln
- Integrations- und Betriebsprozesse mit Programmiersprachen wie Go, Python oder Shell automatisieren
- Eine skalierbare, hochverfügbare und zukunftssichere Observability-Plattform weiterentwickeln
Anforderungen
- Sehr gute Kenntnisse in OpenTelemetry, insbesondere im Umgang mit dem OpenTelemetry Collector, OTLP, SDKs sowie Auto-Instrumentation
- Fundierte Erfahrung mit Distributed Tracing, einschließlich Span Correlation, Context Propagation und Sampling-Strategien
- Erfahrung im Aufbau und Betrieb von Jaeger, insbesondere hinsichtlich Trace Storage, Indexierung und Query-Optimierung
- Fundierte Kenntnisse in der Integration von SIEM-Lösungen und im Security Event Management sowie im Einsatz von CEF- und Syslog-basierten Protokollen
- Gute Programmierkenntnisse in Go, Python oder Shell zur Umsetzung von Telemetrie-, Integrations- und Automatisierungsaufgaben
- Erfahrung im Bereich Kubernetes Observability und Cloud-Native-Plattformen sowie moderner Telemetrie-Architekturen
- Ausgeprägtes Verständnis für IT-Sicherheit und Security Awareness
- Analytische und strukturierte Arbeitsweise
- Erfahrung im Site Reliability Engineering oder Infrastruktur-Betrieb
- Sehr gutes Deutsch in Wort und Schrift (C1-Niveau)
Benefits
- Flexibles Arbeiten
- Wettbewerbsfähiges Gehalt
- Weiterbildungsangebote
- Modernes Arbeitsumfeld
- Offene Unternehmenskultur
- Gesundheitsförderung
- Betriebliche Altersvorsorge
- Mitarbeiterrabatte
- Jobticket
Ist dir ein Fehler aufgefallen?
Teile uns mit, was nicht funktioniert hat, damit wir es schnell beheben können. Sende eine E-Mail an fachkraefte(at)img-sachsen-anhalt.de