Senior Data Engineer Spark Developer
- Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
- Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
- Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
- Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
- Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
- Dobra znajomość języka Python.
- Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
- Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
- Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
- Praktyczna znajomość Jira i Confluence.
- Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)
Mile widziane
- Doświadczenie z Delta Lake lub Apache Hudi.
- Znajomość Kubernetes, Docker oraz Spark Operator.
- Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
- Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
- Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).
O projekcie
Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.
,[Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL)., Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności., Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii., Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold., Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych., Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych., Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark., Implementacja monitoringu, metryk i alertowania dla procesów danych., Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator., Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych., Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków., Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi., Udział w code review oraz mentoring mniej doświadczonych członków zespołu.] Requirements: Apache Spark, PySpark, Spark, SQL, API, MongoDB, Prometheus, Jenkins, Jira, Kubernetes, Docker, Azure, AWS, GCP
Podobne oferty
Data Warehouse Engineer
Capgemini Polska Sp. z o.o.
WROCŁAW
2026-09-04
Spark Data Lakehouse Developer
Upvanta
WROCŁAW
2026-09-01
Data Platform Engineer Kafka & Event Streaming
Mindbox Sp. z o.o.
WROCŁAW
2026-08-31
HR Data Analyst
Antal
WROCŁAW
2026-08-19
Data Engineer Defence & Security
Spyrosoft
WROCŁAW
2026-08-19
Senior Data Engineer Databricks
Spyrosoft
WROCŁAW
2026-08-19
People Analytics Specialist Data & Strategy
Antal
WROCŁAW
2026-08-19
Senior Datacenter Engineer Cisco area
Klient TeamQuest
WROCŁAW
2026-08-06
Principal Go Engineer Distributed Systems & Data Platform
Klient TeamQuest
WROCŁAW
2026-08-06
Regular Datacenter Engineer Cisco area
Klient TeamQuest
WROCŁAW
2026-08-06