Informatica Data Engineer
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+15 more
Job description
SE REQUIERE Experiencia ~3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala.Estudios ~ Technical degree-level education: Bachelor’s degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar.Technical skills Apache Spark con PySpark o Scala: batch y Spark Structured Streaming.Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas.Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium.Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless.AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso.Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning.SQL avanzado y modelado de datos dimensional.Change Data Capture y Slowly Changing Dimensions.Git, CI/CD y buenas prácticas de testing en proyectos de datos.Otras informaciones Se valorará: Experiencia con Kafka Streams o ksqlDB.Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters.Conocimientos de Terraform o CloudFormation para infraestructura como código.Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago.Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.Buscamos un perfil con capacidad para realizar debugging profundo en sistemas distribuidos, autonomÃa y mentalidad "you build it, you run it".RESPONSABILIDADES CLAVE ~ Diseñar, construir y operar pipelines de ingesta y transformación de datos en tiempo real y por lotes sobre una plataforma AWS nativa de streaming basada en Kafka/Confluent, Spark Structured Streaming y Delta Lake, con foco en fiabilidad, rendimiento y escalabilidad.Actividades principales Diseñar, desarrollar y mantener pipelines de streaming con Spark Structured Streaming y procesos batch sobre AWS.Implementar lógica CDC, joins de enriquecimiento, gestión de checkpoints y offsets, y tratamiento de DLQ.Integrar y mantener conectores y componentes de Confluent Kafka, incluyendo topics, Schema Registry, particionado y optimización del throughput.Construir y optimizar tablas Delta Lake mediante particionado, Z-Ordering o Liquid Clustering, compactación, operaciones MERGE/upsert y gestión de esquemas.Desarrollar y mantener jobs en AWS Glue, incluyendo crawlers, catálogo y procesos ETL, asà como funciones AWS Lambda para orquestación y procesamiento event-driven.Operar y optimizar cargas Spark en EMR y EMR Serverless mediante tuning de memoria, particionado, shuffle, Adaptive Query Execution y resolución de cuellos de botella.Colaborar con los equipos de Data Science y Machine Learning en la preparación de datasets y pipelines de features para SageMaker.Diseñar estrategias para gestionar tablas de referencia o lookup a gran escala, utilizando point lookup, caching y particionado para realizar joins de enriquecimiento eficientes.Implementar monitorización, alertado y mecanismos de resiliencia para pipelines 24/7, incluyendo heartbeats, reintentos y checkpointing.Evolucionar el framework interno de ETL basado en YAML y Spark, aplicando CI/CD, testing e infraestructura como código.#J-*****-Ljbffr
Requirements
SE REQUIERE Experiencia ~3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala. Estudios ~ Technical degree-level education: Bachelor’s degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar. Technical skills Apache Spark con PySpark o Scala: batch y Spark Structured Streaming. Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas. Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium. Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless. AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso. Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning. SQL avanzado y modelado de datos dimensional. Change Data Capture y Slowly Changing Dimensions. Git, CI/CD y buenas prácticas de testing en proyectos de datos. Otras informaciones Se valorará: Experiencia con Kafka Streams o ksqlDB. Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters. Conocimientos de Terraform o CloudFormation para infraestructura como código. Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago. Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role — technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
Top Big Data Technologies That You Need to Know
Making Data Warehouses Fast: A Developer’s Story
Top-Paying Tech Jobs (with Salaries)
Highest Paying Tech Companies for Developers