Senior Data Engineer (Data Scraping)
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+16 more
Job description
ph3Overview /h3 pBuscamos un perfil Senior Data Scraping Analysis Specialist con sólida experiencia en Python que quiera desarrollar su carrera profesional construyendo pipelines de crawling inteligente y extracción masiva de datos desplegados en ecosistemas AWS de alto rendimiento./p h3Responsabilidades /h3 pLa persona seleccionada se incorporará al equipo Funcional con la misión crÃtica de conectar fuentes externas de información con los sistemas internos de análisis y los nuevos agentes de IA en la nube.El rol implica diseñar y mantener pipelines avanzados de scraping y crawling, capaces de operar a gran escala en entornos AWS, garantizando resiliencia, trazabilidad, observabilidad y cumplimiento de estándares de seguridad./p pSerá imprescindible dominar técnicas clásicas de scraping (Playwright, Selenium, BeautifulSoup) junto con nuevas soluciones impulsadas por IA, como Firecrawl, Crawl4AI o agentes LLM capaces de automatizar la navegación y extracción de contenido en webs dinámicas y altamente protegidas.El especialista también deberá procesar y transformar grandes volúmenes de datos dentro de arquitecturas cloud-native, integrando los resultados en los sistemas analÃticos de la organización./p h3Proyecto Equipo /h3 pEl proyecto tiene como objetivo habilitar la automatización completa de la adquisición de datos externos y su disponibilidad en AWS para alimentar plataformas analÃticas y modelos de IA Generativa.Esto incluirá el desarrollo de crawlers inteligentes, estrategias anti-bot, rotación de proxies y la estructuración de datos no estructurados en formatos optimizados para su posterior consumo./p pEl perfil seleccionado trabajará en estrecha colaboración con los Data Scientists, AI Engineers y equipos de Backend, bajo la supervisión del Product Manager y siguiendo las directrices arquitectónicas definidas para entornos AWS.El ecosistema integra servicios como Lambda, ECS, S3, Step Functions y bases de datos distribuidas, por lo que la capacidad de diseñar pipelines cloud-native será clave para el éxito del rol./p h3Experiencia Conocimientos /h3 pBuscamos un perfil con al menos 4 años de experiencia en scraping avanzado y análisis de datos, y una profunda especialización en Python aplicada a crawling masivo y automatización web./p pSe valorará especialmente la experiencia construyendo scrapers distribuidos en AWS y la exposición reciente a tecnologÃas de scraping impulsado por IA./p pSerá necesario tener experiencia con: /p ul libCore Scraping Crawling: /b ul liPlaywright, Selenium, BeautifulSoup, Requests / aio liFirecrawl, Crawl4AI, Browserless o agentes LLM para crawling inteligente /li liEstrategias anti-bot, rotación de proxies y browser fingerprinting /li /ul /li libProcesamiento Data Engineering: /b ul liPython (Pandas, Polars, PySpark) /li liPipelines ETL/ELT, normalización y limpieza de datos masivos /li liParsing avanzado (HTML, JSON, XML, documentos estructurados y no estructurados) /li /ul /li libInfraestructura en AWS (imprescindible): /b ul liS3, Lambda, ECS/ECR, Step Functions /li liCloudWatch (monitorización de crawlers), IAM (segmentación de permisos) /li liSQS/SNS (orquestación y comunicación) /li liAWS Glue o EMR (deseable) /li /ul /li libBases de datos: /b ul liPostgreSQL, MySQL, MongoDB o DynamoDB /li liIntegración de datos y diseño de modelos de almacenamiento para alto volumen /li /ul /li /ul pAdemás se valorará positivamente contar con experiencia o conocimientos en: /p ul liOrquestación: Airflow, Prefect o Dagster /li liInfraestructura serverless y contenedores optimizados para crawling /li liIntegración de datos con LLMs, RAG pipelines o agentes inteligentes /li liVisualización o análisis exploratorio de datos /li liDiseño de pipelines distribuidos de alta concurrencia /li /ul h3Contratación Ubicación /h3 pLa posición tiene sede en Madrid y se rige por un contrato a tiempo completo con vocación de estabilidad.Dada la criticidad del proyecto y la necesidad de una colaboración estrecha con los equipos de negocio y técnicos, el rol requiere presencialidad en las oficinas (operando bajo un modelo hÃbrido, habitualmente de 3 dÃas presenciales y 2 de teletrabajo)./p /p #J-*****-Ljbffr /li
Requirements
p h3Experiencia Conocimientos /h3 pBuscamos un perfil con al menos 4 años de experiencia en scraping avanzado y análisis de datos, y una profunda especialización en Python aplicada a crawling masivo y automatización web. /p pSe valorará especialmente la experiencia construyendo scrapers distribuidos en AWS y la exposición reciente a tecnologÃas de scraping impulsado por IA. /p pSerá necesario tener experiencia con: /p ul libCore Scraping Crawling: /b ul liPlaywright, Selenium, BeautifulSoup, Requests / aio liFirecrawl, Crawl4AI, Browserless o agentes LLM para crawling inteligente /li liEstrategias anti-bot, rotación de proxies y browser fingerprinting /li /ul /li libProcesamiento Data Engineering: /b ul liPython (Pandas, Polars, PySpark) /li liPipelines ETL/ELT, normalización y limpieza de datos masivos /li liParsing avanzado (HTML, JSON, XML, documentos estructurados y no estructurados) /li /ul /li libInfraestructura en AWS (imprescindible): /b ul liS3, Lambda, ECS/ECR, Step Functions /li liCloudWatch (monitorización de crawlers), IAM (segmentación de permisos) /li liSQS/SNS (orquestación y comunicación) /li liAWS Glue o EMR (deseable) /li /ul /li libBases de datos: /b ul liPostgreSQL, MySQL, MongoDB o DynamoDB /li liIntegración de datos y diseño de modelos de almacenamiento para alto volumen /li /ul /li /ul pAdemás se valorará positivamente contar con experiencia o conocimientos en: /p ul liOrquestación: Airflow, Prefect o Dagster /li liInfraestructura serverless y contenedores optimizados para crawling /li liIntegración de datos con LLMs, RAG pipelines o agentes inteligentes /li liVisualización o análisis exploratorio de datos /li liDiseño de pipelines distribuidos de alta concurrencia /li /ul h3Contratación Ubicación /h3 pLa posición tiene sede en Madrid y se rige por un contrato a tiempo completo con vocación de estabilidad. Dada la criticidad del proyecto y la necesidad de una colaboración estrecha con los equipos de negocio y técnicos, el rol requiere presencialidad en las oficinas (operando bajo un modelo hÃbrido, habitualmente de 3 dÃas presenciales y 2 de teletrabajo).
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Apply on www.buscojobs.com.esGood distractions
Talks and stories from around this role — technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
Find a Developer Job: 12 Best Job Sites For Developers
Where To Find Software Engineering Jobs
Spanish Business Culture and Etiquette
Dev Digest 121 - AI goes offline