Senior Data Engineer - Spark / Data Lakehouse
- Salary
- PLN 145–PLN 160/hr
- Hiring from
- Poland
- Work type
- Hybrid
- Posted
510,914 remote jobs, straight from company career pages
100% free · New jobs every hour
Show job descriptionHide job description
Senior Data Engineer - Spark / Data Lakehouse
Clurgo to firma stworzona przez developerów dla developerów. Nasze zespoły łączą pełne spektrum kompetencji - od rozwoju oprogramowania i infrastruktury, przez analizę oraz testy, aż po strategiczne zarządzanie produktem i procesami. Realizujemy różnorodne projekty IT dla klientów z wielu branż, dbając o dobre praktyki programistyczne i zachowanie work-life balance. Tworzymy rozwiązania, które mają znaczenie - dla firm w Polsce i na całym świecie.
✅Dołącz do zespołu Data Platform naszego Klienta z sektora bankowego, gdzie będziesz projektować i wdrażać rozwiązania do rekoncyliacji danych w ODS opartym o MongoDB oraz budować warstwy danych w architekturze Data Lakehouse. Rola łączy rozwój rozwiązań opartych o Apache Spark, PySpark i Spark SQL z optymalizacją przetwarzania danych, wdrażaniem CI/CD oraz monitoringiem procesów batch i streamingowych. Będziesz mieć wpływ na jakość, wydajność i niezawodność kluczowych procesów danych w środowisku dużej organizacji bankowej.
✅Technologie i narzędzia: Python, Apache Spark, PySpark, Spark-SQL, DataFrames, Structured Streaming, MongoDB, MongoDB Spark Connector, Delta Lake, Apache Iceberg, Hudi, Jenkins, Prometheus, Grafana, OpenTelemetry, Dynatrace, Kubernetes, Docker, Spark Operator
✅Model hybrydowy: 1 raz w tygodniu z biura we Wrocławiu
Szukamy Ciebie, jeśli:
👉 Posiadasz min. 4 lata praktycznego doświadczenia w środowiskach produkcyjnych z wykorzystaniem Apache Spark
👉 Masz doświadczenie z PySpark, Spark-SQL, DataFrames oraz Structured Streaming
👉 Posiadasz doświadczenie w odczycie i zapisie danych z/ do MongoDB przy użyciu MongoDB Spark Connector
👉 Posiadasz praktyczne doświadczenie z architekturą Data Lakehouse (zarządzanie tabelami wersjonowanymi przy użyciu Iceberg, Delta Lake lub Hudi)
👉 Znasz Jenkinsa i potrafisz automatyzować testy (unit/integration) oraz procesy deploymentu aplikacji Spark
👉 Znasz narzędzia do monitoringu i obserwowalności (Prometheus, Grafana)
👉 Swobodnie komunikujesz się w języku angielskim (min. B2) i efektywnie pracujesz w metodykach Agile (Scrum/Kanban)
Mile widziane:
- Praktyczna znajomość Dynatrace i OpenTelemetry
- Doświadczenie z Docker oraz Spark Operator w środowisku Kubernetes
Zadania:
- Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi
- Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector
- Optymalizacja odczytów z MongoDB
- Budowa architektury medalionowej z wykorzystaniem technologii Iceberg/Delta Lake/Hudi
- Implementacja CI/CD dla schematów tabel, migracji i wersjonowania
- Kosztowa optymalizacja zapytań w środowisku Data Lakehouse
- Konfiguracja metryk (Prometheus + Grafana), logów oraz śledzenia (OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream
- Definiowanie SLA/SLO oraz alertów
- Diagnoza problemów z rekordami, opóźnieniami i niezgodnościami danych
- Praca w Scrum/Kanban z Data Engineerami, Business Analystami, testerami i zespołem DevOps
Czego możesz się spodziewać:
- współpracy w oparciu o kontrakt B2B
- pracy hybrydowej: raz w tygodniu z biura we Wrocławiu
- profesjonalnego procesu rekrutacyjnego – zawsze otrzymasz od nas feedback niezależnie od decyzji
Poznaj nas lepiej👉 https://www.facebook.com/clurgo/