DataBricks Engineer

Elite
Plano, TX, United States
21 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Job source

Tech stack

Big Data Databases Continuous Integration Data Architecture Data Validation Information Engineering Data Governance Extract Transform Load (ETL) Data Transformation Data Warehousing Apache Hadoop Apache Hive
+14 more
Performance Tuning Role-Based Access Control SQL Databases Grafana Apache Spark Data Lakes Pyspark Infrastructure Automation Frameworks Data Lineage Data Management Data Pipelines Amazon Elastic Mapreduce (EMR) Legacy Systems Databricks

Job description

We are seeking an experienced Databricks Engineer with strong expertise in migration of PySpark/Hive workloads from AWS EMR or legacy platforms data platforms while ensuring data quality, security, and scalability, * Design, develop, and maintain scalable data pipelines using Databricks Implement and manage Unity Catalog for centralized data governanance

  • Develop and optimize Spark Declarative Pipelines (SDP) and moderatePerform end-to-end data validation, reconciliation, and quality assurance.
  • Lead migration projects involving:
  • PySpark jobs from AWS EMR to Databricks Hive-based ETL workloads to Databricks and Delta Lake.
  • Legacy data platforms to Databricks Lakehouse architecture.
  • Convert and optimize Hive SQL, Spark SQL, and PySpark workloads forImple and automation for validation and PySparkjobs from AWS EMR to Databricks.
  • Hive-based ETL workloads to Databricks and Delta Lake.
  • Legacy data platforms to Databricks Lakehouse architecture.
  • Convert and optimize Hive SQL, Spark SQL, and PySpark workloads for Database Implement data quality frameworks and automation for validation and reconcilation Work closely with architects, business stakeholders, and data consumers to Optimize Databricks jobs for performance, reliability, and cost efficiency.
  • Manage CI/CD processes and infrastructure automation for Databricks deplo Ensure compliance with enterprise data security, governance.

Requirements

  • Databricks & Data Engineering Strong experience with Databricks Lakehouse Platform.
  • Hands-on experience with Delta Lake, Medallion Architecture, and Databric Expertise in PySpark and Spark SQL.
  • Experience working with large-scale data processing and performance tuning Unity Catalog Strong understanding of: Unity Catalog setup and administration.
  • Strong understanding of Unity Catalog setup and administration Fine-grained access control (RBAC). Data lineage and audit capabilities.
  • Data governance and security implementation.
  • Spark Declarative Pipelines (SDP) Hands-on experience implementing and maintaining SDP pipelines.
  • Knowledge of pipeline orchestration, monitoring, and optimization.
  • Experience building reusable and scalable data transformation framework Data Validation & Quality Experience designing and implementing data validation frameworks.
  • Data reconciliation between source and target systems. Validation of migrated datasets to ensure accuracy and completeness.
  • Experience with data quality monitoring and observability tools.
  • Migration Experience Proven experience in migratingPySparkworkloads from AWS EMR to Databricks.
  • Mive-based ETL jobs to Databricks. Legacy data warehouses and Hadoop ecosystems to Databricks.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.dice.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:28 min

Defining big data and machine learning fundamentals

Ayon Roy · LIVE

3:03 min

Career evolution in data engineering and AI platforms

Maria Apazoglou · Coffee With Developers

10:40 min

Visualizing Prometheus open metrics using custom Grafana dashboards

Stijn Polfliet · LIVE

4:32 min

Harnessing Spark with Python using PySpark and Py4J

Ayon Roy · LIVE

2:10 min

Why organizations combine big data and machine learning

Ayon Roy · LIVE

2:34 min

Capabilities of the Apache Spark processing engine

Ayon Roy · LIVE

Videos

See all

Related articles

See all