Site­Reliability­Engineer­(SRE)­(m/w/d)

T-Systems International GmbH
Aachen Berlin Bielefeld Darmstadt Dresden Düsseldorf Frankfurt am Main Hamburg Hannover Karlsruhe Kassel Leinfelden-Echterdingen Leipzig Magdeburg München Nürnberg Saarbrücken
Flexible Arbeitszeitregelungen Health & Wellness Moderne Arbeitsplätze Vollzeit Festanstellung Hybrid IT
Mehr erfahren

Über diesen Job

Als Site Reliability Engineer mit Schwerpunkt Observability bei T-Systems gestalten Sie aktiv den Aufbau einer modernen Observability-Plattform und tragen zur Stabilität und Zuverlässigkeit komplexer Cloud- und Kubernetes-Infrastrukturen bei. Ihre Expertise in OpenTelemetry und Distributed Tracing ist entscheidend für die Implementierung leistungsfähiger Telemetrie-Lösungen. Freuen Sie sich auf ein flexibles Arbeitsumfeld, attraktive Vergütung und zahlreiche Entwicklungsmöglichkeiten in einem innovativen Team. Nutzen Sie die Chance, Teil eines technologisch anspruchsvollen Unternehmens zu werden!

Aufgaben

  • Transparenz, Stabilität und Zuverlässigkeit der verteilten Cloud-, Edge- und Kubernetes-Plattformen sicherstellen
  • Moderne Observability-Lösungen konzipieren, implementieren und kontinuierlich weiterentwickeln
  • Pipelines für Metrics, Logs und Traces entwickeln und betreiben
  • OpenTelemetry Collector, OTLP sowie SDKs und Auto-Instrumentation in bestehende Plattformen integrieren
  • End-to-End-Observability über verteilte Anwendungen und Services schaffen
  • Jaeger als zentrale Plattform für Distributed Tracing implementieren und betreiben
  • Korrelationsmechanismen zwischen Logs, Metrics und Traces entwickeln
  • Moderne Sampling-Strategien, Context Propagation und Konzepte für Trace Storage berücksichtigen
  • Security-, Infrastruktur- und Plattform-Events in zentrale SIEM-Lösungen integrieren
  • Standardisierte Telemetrie- und Instrumentierungskonzepte für Kubernetes- und Cloud-Native-Plattformen entwickeln
  • Integrations- und Betriebsprozesse mit Programmiersprachen wie Go, Python oder Shell automatisieren
  • Eine skalierbare, hochverfügbare und zukunftssichere Observability-Plattform weiterentwickeln

Anforderungen

  • Sehr gute Kenntnisse in OpenTelemetry, insbesondere im Umgang mit dem OpenTelemetry Collector, OTLP, SDKs sowie Auto-Instrumentation
  • Fundierte Erfahrung mit Distributed Tracing, einschließlich Span Correlation, Context Propagation und Sampling-Strategien
  • Erfahrung im Aufbau und Betrieb von Jaeger, insbesondere hinsichtlich Trace Storage, Indexierung und Query-Optimierung
  • Fundierte Kenntnisse in der Integration von SIEM-Lösungen und im Security Event Management sowie im Einsatz von CEF- und Syslog-basierten Protokollen
  • Gute Programmierkenntnisse in Go, Python oder Shell zur Umsetzung von Telemetrie-, Integrations- und Automatisierungsaufgaben
  • Erfahrung im Bereich Kubernetes Observability und Cloud-Native-Plattformen sowie moderner Telemetrie-Architekturen
  • Ausgeprägtes Verständnis für IT-Sicherheit und Security Awareness
  • Analytische und strukturierte Arbeitsweise
  • Erfahrung im Site Reliability Engineering oder Infrastruktur-Betrieb
  • Sehr gutes Deutsch in Wort und Schrift (C1-Niveau)

Benefits

  • Flexibles Arbeiten
  • Wettbewerbsfähiges Gehalt
  • Weiterbildungsangebote
  • Modernes Arbeitsumfeld
  • Offene Unternehmenskultur
  • Gesundheitsförderung
  • Betriebliche Altersvorsorge
  • Mitarbeiterrabatte
  • Jobticket

Kontakt

Tel: 069200600

Email: thomas.arbeit@t-systems.com


Ist dir ein Fehler aufgefallen?

Teile uns mit, was nicht funktioniert hat, damit wir es schnell beheben können. Sende eine E-Mail an fachkraefte(at)img-sachsen-anhalt.de