Informatica Data Engineer

Getnet Platforms
Madrid, Spain
10 days ago
Apply on www.buscojobs.com.es
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours

Tech stack

Amazon Web Services Amazon S3 Cluster Analysis Continuous Integration Extract Transform Load (ETL) Data Transformation Software Debugging Distributed Systems Machine Learning SQL Databases YAML Apache Spark
+15 more
Electronic Medical Records AWS Lambda Change Data Capture Git Cloudformation Data Lakes Pyspark Information Technology AWS Glue Data Analytics Apache Kafka Spark Streaming Functional Programming Terraform Confluent

Job description

SE REQUIERE Experiencia ~3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala.Estudios ~ Technical degree-level education: Bachelor’s degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar.Technical skills Apache Spark con PySpark o Scala: batch y Spark Structured Streaming.Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas.Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium.Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless.AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso.Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning.SQL avanzado y modelado de datos dimensional.Change Data Capture y Slowly Changing Dimensions.Git, CI/CD y buenas prácticas de testing en proyectos de datos.Otras informaciones Se valorará: Experiencia con Kafka Streams o ksqlDB.Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters.Conocimientos de Terraform o CloudFormation para infraestructura como código.Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago.Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.Buscamos un perfil con capacidad para realizar debugging profundo en sistemas distribuidos, autonomía y mentalidad "you build it, you run it".RESPONSABILIDADES CLAVE ~ Diseñar, construir y operar pipelines de ingesta y transformación de datos en tiempo real y por lotes sobre una plataforma AWS nativa de streaming basada en Kafka/Confluent, Spark Structured Streaming y Delta Lake, con foco en fiabilidad, rendimiento y escalabilidad.Actividades principales Diseñar, desarrollar y mantener pipelines de streaming con Spark Structured Streaming y procesos batch sobre AWS.Implementar lógica CDC, joins de enriquecimiento, gestión de checkpoints y offsets, y tratamiento de DLQ.Integrar y mantener conectores y componentes de Confluent Kafka, incluyendo topics, Schema Registry, particionado y optimización del throughput.Construir y optimizar tablas Delta Lake mediante particionado, Z-Ordering o Liquid Clustering, compactación, operaciones MERGE/upsert y gestión de esquemas.Desarrollar y mantener jobs en AWS Glue, incluyendo crawlers, catálogo y procesos ETL, así como funciones AWS Lambda para orquestación y procesamiento event-driven.Operar y optimizar cargas Spark en EMR y EMR Serverless mediante tuning de memoria, particionado, shuffle, Adaptive Query Execution y resolución de cuellos de botella.Colaborar con los equipos de Data Science y Machine Learning en la preparación de datasets y pipelines de features para SageMaker.Diseñar estrategias para gestionar tablas de referencia o lookup a gran escala, utilizando point lookup, caching y particionado para realizar joins de enriquecimiento eficientes.Implementar monitorización, alertado y mecanismos de resiliencia para pipelines 24/7, incluyendo heartbeats, reintentos y checkpointing.Evolucionar el framework interno de ETL basado en YAML y Spark, aplicando CI/CD, testing e infraestructura como código.#J-*****-Ljbffr

Requirements

SE REQUIERE Experiencia ~3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala. Estudios ~ Technical degree-level education: Bachelor’s degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar. Technical skills Apache Spark con PySpark o Scala: batch y Spark Structured Streaming. Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas. Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium. Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless. AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso. Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning. SQL avanzado y modelado de datos dimensional. Change Data Capture y Slowly Changing Dimensions. Git, CI/CD y buenas prácticas de testing en proyectos de datos. Otras informaciones Se valorará: Experiencia con Kafka Streams o ksqlDB. Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters. Conocimientos de Terraform o CloudFormation para infraestructura como código. Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago. Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.buscojobs.com.es
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:03 min

Career evolution in data engineering and AI platforms

Maria Apazoglou · Coffee With Developers

6:21 min

Investigating push inefficiencies with upstream Git experts

Jonathan Creamer · Coffee With Developers

1:35 min

Centralizing configuration logic with native YAML block references

Matthieu Vincent Matthieu Vincent · Europe 2026 Virtual

4:32 min

Harnessing Spark with Python using PySpark and Py4J

Ayon Roy · LIVE

3:37 min

Scaling machine learning pipelines from prototypes to petabytes

Julian Joseph · LIVE

3:14 min

Structuring career paths and localized data architectures

Ulrich Wurstbauer +1 · LIVE

Videos

See all

Related articles

See all