← Back to jobs

Senior Data Engineer / Spark Developer @ Upvanta

Skills

agileapiawsazureci cdconfluencedata governancedata lakedata qualitydelta lakedevopsdockerdynatracegcpgrafanaicebergjenkinsjirakanbankuberneteslakehousemongodbobservabilityopentelemetry

Description

O projekcie

Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

  • Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
  • Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
  • Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
  • Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
  • Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
  • Dobra znajomość języka Python.
  • Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
  • Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
  • Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
  • Praktyczna znajomość Jira i Confluence.
  • Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)

Mile widziane

  • Doświadczenie z Delta Lake lub Apache Hudi.
  • Znajomość Kubernetes, Docker oraz Spark Operator.
  • Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
  • Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
  • Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).

O projekcie

Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

,(Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL)., Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności., Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii., Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold., Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych., Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych., Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark., Implementacja monitoringu, metryk i alertowania dla procesów danych., Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator., Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych., Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków., Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi., Udział w code review oraz mentoring mniej doświadczonych członków zespołu.) Requirements: Apache Spark, PySpark, Spark, SQL, API, MongoDB, Prometheus, Jenkins, Jira, Kubernetes, Docker, Azure, AWS, GCP

Get similar jobs in Poland by email

We'll email you when new jobs similar to this one appear.

Similar jobs

Explore more Data Engineer jobs in Poland.

No similar openings right now. Refine your search or create an alert above.