Descripción
Como Desarrollador/a de Databricks, diseñará y construirá las canalizaciones de datos empresariales que impulsan las iniciativas de análisis, informes e inteligencia artificial para una empresa líder del sector energético. Únase a un equipo de ingeniería de datos completamente remoto que trabaja directamente con la más avanzada tecnología Lakehouse.
PROYECTOS DE DATOS DE ALTO IMPACTO
TECNOLOGÍA LAKEHOUSE MÁS RECIENTE
COMPLETAMENTE REMOTO
APRENDIZAJE Y CRECIMIENTO
¿No cumple todos los requisitos? Si cumple aproximadamente el 70 % de los requisitos anteriores, ¡le animamos igualmente a presentar su candidatura!
SOBRE EL PUESTO
Buscamos un/a Ingeniero/a de Datos altamente cualificado/a con 5+ años de experiencia para diseñar, construir y optimizar canalizaciones de datos empresariales sobre la plataforma Databricks Lakehouse para una empresa líder del sector energético. En este puesto, será el/la responsable técnico/a práctico/a encargado/a de transformar los datos crudos en conjuntos de datos de alta calidad y listos para su uso. Construirá y mantendrá una arquitectura Medallion, optimizará cargas de trabajo Spark y garantizará que la infraestructura de datos respalde sin interrupciones los análisis avanzados, los paneles de BI y las aplicaciones emergentes de inteligencia artificial generativa.
RESPONSABILIDADES CLAVE
Ingeniería de Canalizaciones de Datos
* Diseñar, construir y mantener canalizaciones ETL/ELT escalables y robustas mediante Python, SQL y Apache Spark dentro del entorno Databricks.
* Implementar y gestionar una arquitectura Medallion sólida (capas Bronze, Silver y Gold) para procesar y refinar datos procedentes de diversas fuentes.
* Desarrollar y mantener la capa semántica Gold específicamente optimizada para un consumo de alto rendimiento por herramientas de BI (por ejemplo, Power BI).
Optimización y Arquitectura de Plataforma
* Optimizar cargas de trabajo de Databricks, configuraciones de clústeres y consultas Spark para garantizar un alto rendimiento y una eficiencia de costes.
* Trabajar extensivamente con formatos abiertos de tablas, especialmente Delta Lake y Apache Iceberg, para asegurar la conformidad ACID, el viaje en el tiempo (time travel) y un almacenamiento eficiente de datos.
* Ejecutar migraciones de datos complejas, incluida la transición de cargas de trabajo heredadas desde almacenes de datos en la nube tradicionales (por ejemplo, AWS Redshift) hacia el Lakehouse de Databricks.
Gobernanza y Automatización de Datos
* Implementar políticas de gobernanza de datos y control de acceso a nivel de tabla, fila y columna mediante Databricks Unity Catalog.
* Automatizar los procesos de despliegue y la orquestación de canalizaciones mediante Databricks Workflows, tuberías CI/CD (por ejemplo, GitHub Actions, Azure DevOps) y herramientas como Terraform.
* Integrar comprobaciones y monitoreo de calidad de datos directamente en las canalizaciones para garantizar el cumplimiento riguroso de los estándares de Gestión de Datos Maestros (MDM).
Soporte para IA y Analítica Avanzada
* Colaborar estrechamente con científicos de datos e ingenieros de IA para proporcionar datos limpios y estructurados destinados al entrenamiento e inferencia de modelos de aprendizaje automático.
* Apoyar los fundamentos de datos necesarios para marcos de IA generativa (GenAI), agentes autónomos y plataformas de observabilidad de IA.
HABILIDADES Y EXPERIENCIA REQUERIDAS
* 5+ años de experiencia específica en ingeniería de datos en entornos empresariales.
* Competencia experta en Python y SQL.
* Amplia experiencia práctica con Databricks, Apache Spark y Delta Lake.
* Sólida comprensión de sistemas distribuidos, arquitecturas de big data y técnicas de modelado de datos (por ejemplo, Kimball, Data Vault).
* Conocimiento profundo de servicios de datos nativos en la nube (AWS, Azure o GCP), especialmente almacenamiento en la nube (S3/ADLS) y aprovisionamiento de recursos computacionales.
* Experiencia demostrable con control de versiones (Git), metodologías CI/CD y ciclos de vida ágiles de desarrollo de software.
DESEABLE
* Experiencia evaluando y trabajando con Apache Iceberg junto a Delta Lake.
* Familiaridad con arquitecturas de datos en tiempo real (por ejemplo, Structured Streaming, Kafka).
* Experiencia desarrollando frameworks de backend o herramientas internas mediante bibliotecas ligeras como Streamlit.
FORMACIÓN ACADÉMICA
* Título universitario (Licenciatura o Máster) en Ciencias de la Computación, Tecnologías de la Información, Ingeniería de Datos o campo relacionado.
CERTIFICACIONES PREFERENTES
* Certificación Databricks Certified Data Engineer Associate o Professional.
* Certificaciones de datos o nube de AWS, Azure o GCP.
MODELO LABORAL
Posición completamente remota.