🇪🇸 Spain · 17h ago

Ingeniero de Datos / Data Engineer (Python, SQL, ETL)

Grupo TECDATA Engineering

LinkedInsenior
Ingeniero de Datos / Data Engineer (Python, SQL, ETL)Modalidad: 100% RemotoHorario: Alta flexibilidad horaria (salida aprox. a las 17:00h) y jornada intensiva los viernes. (posibilidad de hablar con el cliente si el candidato perfecto tiene por ejemplo reducción de jornada por algún hecho)Sobre el rol: Buscamos un perfil altamente técnico, un desarrollador "hands-on" para un entorno de datos fuertemente orientado al open source. Es imprescindible que estés acostumbrado a picar código desde cero. En este proyecto no se utilizan herramientas ETL visuales o de "drag & drop"; el trabajo es puro código ("pantalla negra"), construyendo y orquestando soluciones de datos directamente mediante scripts en Python y sentencias SQL complejas. El cliente utiliza StarRocks como motor analítico de alto rendimiento, por lo que buscamos a alguien con una base relacional y de Data Warehousing tan sólida que pueda adaptarse rápidamente a esta tecnología.Requisitos Imprescindibles:Python (Scripting & Procesamiento): Capacidad para crear scripts desde cero para el tratamiento e ingesta de datos. Experiencia sólida en procesamiento de archivos (ej. CSVs) gestionando las limitaciones de memoria, uso de estructuras de datos (listas vs diccionarios) y gestión robusta de errores en ingestas mediante código puro.SQL Avanzado: Amplio dominio en sentencias complejas, tipologías de relaciones, joins, funciones de agregación y filtros complejos (WHERE vs HAVING). Capacidad para detectar duplicados, manejar registros huérfanos y dominio de Window Functions para cálculos sobre conjuntos de datos.PostgreSQL (Rendimiento y Tunning): Experiencia real trabajando con grandes volúmenes de tablas. Creación, gestión y optimización de índices. Conocimiento profundo de planes de ejecución (uso del comando EXPLAIN) y capacidad para identificar cuándo un índice es contraproducente.Desarrollo de ETL / ELT (Código puro): Sólida base en diseño de flujos de datos programados a medida. Dominio conceptual y práctico de cargas incrementales frente a cargas totales, gestión de fallos en mitad de una ingesta (ej. qué hacer si falla al 80%) y aplicación de controles de calidad de datos mediante código.Requisitos Valorables (Nice to have):StarRocks / Bases de datos analíticas: Experiencia o interés en StarRocks (o bases de datos columnares similares como ClickHouse, Apache Doris). Al ser una tecnología de nicho, valoramos enormemente la capacidad de aprendizaje si traes una buena base OLAP.Data Warehousing: Comprensión profunda de modelos en estrella, tablas de hechos y dimensiones, y las diferencias arquitectónicas entre entornos OLTP y OLAP.Buenas prácticas de Software Engineering: Experiencia con control de versiones (Git) y conocimientos básicos de herramientas de orquestación de código open source (ej. Apache Airflow, Cron avanzado, etc.) para la automatización de los scripts.Conocimientos de visualización de datos (ej. PowerBI) a nivel de conceptos básicos.Nota: Para esta posición no buscamos perfiles orientados a ecosistemas Big Data tradicionales (Spark, Hadoop, Hive, HDFS) ni usuarios de herramientas ETL visuales (Talend, DataStage, etc.). Buscamos un enfoque puro en la ingeniería de datos relacional y analítica con Python + SQL.

Sourced from LinkedIn. Relocantly aggregates public job postings; apply on the original site.