Senior Data Engineer (Data Scraping), Madrid

WayOps
Madrid, Spain
about 1 month ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience required
4 years minimum
Working hours
Regular working hours

Tech stack

Artificial Intelligence Airflow Amazon Web Services Amazon S3 Databases Data Integration Amazon DynamoDB Identity and Access Management PostgreSQL MongoDB MySQL Unstructured Data
+7 more
Large Language Models State Machines Generative AI Backend AWS Glue Cloudwatch Amazon Simple Queue Service (SQS)

Job description

contenido en webs dinámicas y altamente protegidas. El especialista también deberá procesar y transformar grandes volúmenes de datos dentro de arquitecturas cloud-native, integrando los resultados en los sistemas analíticos de la organización. PROYECTO EQUIPO El proyecto tiene como objetivo habilitar la automatización completa de la adquisición de datos externos y su disponibilidad en AWS para alimentar plataformas analíticas y modelos de IA Generativa. Esto incluirá el desarrollo de crawlers inteligentes, estrategias anti-bot, rotación de proxies y la estructuración de datos no estructurados en formatos optimizados para su posterior consumo. El perfil seleccionado trabajará en estrecha colaboración con los Data Scientists, AI Engineers y equipos de Backend, bajo la supervisión del Product Manager y siguiendo las directrices arquitectónicas definidas para entornos AWS. El ecosistema integra servicios como Lambda, ECS, S3, Step Functions y bases de datos distribuidas

Requirements

Infraestructura en AWS (imprescindible):- S3, Lambda, ECS/ECR, Step Functions - CloudWatch (monitorización de crawlers), IAM (segmentación de permisos) - SQS/SNS (orquestación y comunicación) - AWS Glue o EMR (deseable) - Bases de datos:- PostgreSQL, MySQL, MongoDB o DynamoDB - Integración de datos y diseño de modelos de almacenamiento para alto volumen Además se valorará positivamente contar con experiencia o conocimientos en: - Orquestación: Airflow, Prefect o Dagster - Infraestructura serverless y contenedores optimizados para crawling - Integración de datos con LLMs, RAG pipelines o agentes inteligentes - Visualización o análisis exploratorio de datos - Diseño de pipelines distribuido

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on empleate.gob.es

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:14 min

Structuring career paths and localized data architectures

Ulrich Wurstbauer +1 · LIVE

2:18 min

Scaling MySQL databases for massive user growth

Johannes Nicolai Johannes Nicolai +1 · LIVE

2:15 min

Empowering domain teams with an open data platform

Sandhya Menon Sandhya Menon · WWC Europe 2026

2:01 min

Migrating existing applications from MongoDB to Postgres

Nikita Shamgunov Nikita Shamgunov · WWC 2024

1:41 min

Open source technology stack for workflow orchestration

Phil Nash · Coffee With Developers

1:48 min

Analyzing network packets with database protocol tools

Daniël van Eeden Daniël van Eeden · WWC Europe 2026

Videos

See all

Related articles

See all