Senior Data Engineer (Data Scraping)

Wayops
Madrid, Spain
14 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience required
4 years minimum
Working hours
Regular working hours

Tech stack

HTML Artificial Intelligence Airflow Amazon Web Services Amazon S3 Data Analysis Proxy Servers Cloud Engineering Databases Data Cleansing Web Scraping Extract Transform Load (ETL)
+16 more
Amazon DynamoDB Identity and Access Management JSON Python (Programming Language) MongoDB MySQL Selenium Unstructured Data Extensible Markup Language (XML) Large Language Models State Machines Generative AI Backend Pandas Pyspark Playwright

Job description

ph3Overview /h3 pBuscamos un perfil Senior Data Scraping Analysis Specialist con sólida experiencia en Python que quiera desarrollar su carrera profesional construyendo pipelines de crawling inteligente y extracción masiva de datos desplegados en ecosistemas AWS de alto rendimiento./p h3Responsabilidades /h3 pLa persona seleccionada se incorporará al equipo Funcional con la misión crítica de conectar fuentes externas de información con los sistemas internos de análisis y los nuevos agentes de IA en la nube.El rol implica diseñar y mantener pipelines avanzados de scraping y crawling, capaces de operar a gran escala en entornos AWS, garantizando resiliencia, trazabilidad, observabilidad y cumplimiento de estándares de seguridad./p pSerá imprescindible dominar técnicas clásicas de scraping (Playwright, Selenium, BeautifulSoup) junto con nuevas soluciones impulsadas por IA, como Firecrawl, Crawl4AI o agentes LLM capaces de automatizar la navegación y extracción de contenido en webs dinámicas y altamente protegidas.El especialista también deberá procesar y transformar grandes volúmenes de datos dentro de arquitecturas cloud-native, integrando los resultados en los sistemas analíticos de la organización./p h3Proyecto Equipo /h3 pEl proyecto tiene como objetivo habilitar la automatización completa de la adquisición de datos externos y su disponibilidad en AWS para alimentar plataformas analíticas y modelos de IA Generativa.Esto incluirá el desarrollo de crawlers inteligentes, estrategias anti-bot, rotación de proxies y la estructuración de datos no estructurados en formatos optimizados para su posterior consumo./p pEl perfil seleccionado trabajará en estrecha colaboración con los Data Scientists, AI Engineers y equipos de Backend, bajo la supervisión del Product Manager y siguiendo las directrices arquitectónicas definidas para entornos AWS.El ecosistema integra servicios como Lambda, ECS, S3, Step Functions y bases de datos distribuidas, por lo que la capacidad de diseñar pipelines cloud-native será clave para el éxito del rol./p h3Experiencia Conocimientos /h3 pBuscamos un perfil con al menos 4 años de experiencia en scraping avanzado y análisis de datos, y una profunda especialización en Python aplicada a crawling masivo y automatización web./p pSe valorará especialmente la experiencia construyendo scrapers distribuidos en AWS y la exposición reciente a tecnologías de scraping impulsado por IA./p pSerá necesario tener experiencia con: /p ul libCore Scraping Crawling: /b ul liPlaywright, Selenium, BeautifulSoup, Requests / aio liFirecrawl, Crawl4AI, Browserless o agentes LLM para crawling inteligente /li liEstrategias anti-bot, rotación de proxies y browser fingerprinting /li /ul /li libProcesamiento Data Engineering: /b ul liPython (Pandas, Polars, PySpark) /li liPipelines ETL/ELT, normalización y limpieza de datos masivos /li liParsing avanzado (HTML, JSON, XML, documentos estructurados y no estructurados) /li /ul /li libInfraestructura en AWS (imprescindible): /b ul liS3, Lambda, ECS/ECR, Step Functions /li liCloudWatch (monitorización de crawlers), IAM (segmentación de permisos) /li liSQS/SNS (orquestación y comunicación) /li liAWS Glue o EMR (deseable) /li /ul /li libBases de datos: /b ul liPostgreSQL, MySQL, MongoDB o DynamoDB /li liIntegración de datos y diseño de modelos de almacenamiento para alto volumen /li /ul /li /ul pAdemás se valorará positivamente contar con experiencia o conocimientos en: /p ul liOrquestación: Airflow, Prefect o Dagster /li liInfraestructura serverless y contenedores optimizados para crawling /li liIntegración de datos con LLMs, RAG pipelines o agentes inteligentes /li liVisualización o análisis exploratorio de datos /li liDiseño de pipelines distribuidos de alta concurrencia /li /ul h3Contratación Ubicación /h3 pLa posición tiene sede en Madrid y se rige por un contrato a tiempo completo con vocación de estabilidad.Dada la criticidad del proyecto y la necesidad de una colaboración estrecha con los equipos de negocio y técnicos, el rol requiere presencialidad en las oficinas (operando bajo un modelo híbrido, habitualmente de 3 días presenciales y 2 de teletrabajo)./p /p #J-*****-Ljbffr /li

Requirements

p h3Experiencia Conocimientos /h3 pBuscamos un perfil con al menos 4 años de experiencia en scraping avanzado y análisis de datos, y una profunda especialización en Python aplicada a crawling masivo y automatización web. /p pSe valorará especialmente la experiencia construyendo scrapers distribuidos en AWS y la exposición reciente a tecnologías de scraping impulsado por IA. /p pSerá necesario tener experiencia con: /p ul libCore Scraping Crawling: /b ul liPlaywright, Selenium, BeautifulSoup, Requests / aio liFirecrawl, Crawl4AI, Browserless o agentes LLM para crawling inteligente /li liEstrategias anti-bot, rotación de proxies y browser fingerprinting /li /ul /li libProcesamiento Data Engineering: /b ul liPython (Pandas, Polars, PySpark) /li liPipelines ETL/ELT, normalización y limpieza de datos masivos /li liParsing avanzado (HTML, JSON, XML, documentos estructurados y no estructurados) /li /ul /li libInfraestructura en AWS (imprescindible): /b ul liS3, Lambda, ECS/ECR, Step Functions /li liCloudWatch (monitorización de crawlers), IAM (segmentación de permisos) /li liSQS/SNS (orquestación y comunicación) /li liAWS Glue o EMR (deseable) /li /ul /li libBases de datos: /b ul liPostgreSQL, MySQL, MongoDB o DynamoDB /li liIntegración de datos y diseño de modelos de almacenamiento para alto volumen /li /ul /li /ul pAdemás se valorará positivamente contar con experiencia o conocimientos en: /p ul liOrquestación: Airflow, Prefect o Dagster /li liInfraestructura serverless y contenedores optimizados para crawling /li liIntegración de datos con LLMs, RAG pipelines o agentes inteligentes /li liVisualización o análisis exploratorio de datos /li liDiseño de pipelines distribuidos de alta concurrencia /li /ul h3Contratación Ubicación /h3 pLa posición tiene sede en Madrid y se rige por un contrato a tiempo completo con vocación de estabilidad. Dada la criticidad del proyecto y la necesidad de una colaboración estrecha con los equipos de negocio y técnicos, el rol requiere presencialidad en las oficinas (operando bajo un modelo híbrido, habitualmente de 3 días presenciales y 2 de teletrabajo).

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.buscojobs.com.es

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:02 min

Assembling the tech stack for scalable indexing workflows

Chris Heilmann +2 · LIVE

3:47 min

Exploring JSON, CBOR, and JOSE for data serialization

Aaron Russell · LIVE

2:21 min

Projecting external HTML content using default and named slots

Rowdy Rabouw Rowdy Rabouw · WWC 2022

2:18 min

Scaling MySQL databases for massive user growth

Johannes Nicolai Johannes Nicolai +1 · LIVE

5:54 min

The technical evolution of modern web scraping infrastructure

Chris Heilmann +4 · LIVE

2:03 min

Distinguishing type definition constructs from data validation routines

Clemens Vasters Clemens Vasters · WWC 2025

Videos

See all

Related articles

See all