Data Engineer Databricks Lyon H/F - Komeet Technologies
Publié le 9 septembre 2026Les missions du poste
Le besoin
Contexte
En tant que Data Engineer, vous intervenez sur la conception, le développement et l'optimisation de pipelines de données robustes et scalables. Vous travaillez au coeur des plateformes Data afin de garantir la qualité, la disponibilité et la performance des données utilisées par les équipes métiers, BI et Data Science.
Missions
Concevoir, développer et optimiser des pipelines de données robustes et scalables
Collaborer efficacement au sein d'équipes agiles et pluridisciplinaires, en lien avec les équipes Data, IT et métiers
Garantir la qualité, la disponibilité et la performance des données
Prioriser les tâches, gérer les contraintes et respecter les engagements
Communiquer clairement avec des interlocuteurs techniques et non techniques
Appliquer les bonnes pratiques de développement logiciel pour assurer la maintenabilité et la testabilité des pipelines
Concevoir des pipelines Data comme de véritables produits logiciels, en tenant compte de la maintenabilité, de l'évolutivité et de l'observabilité
Mettre en place des stratégies de tests automatisés pour les pipelines, incluant tests unitaires et contrôles de qualité des données
Outils & Environnement
Plateforme Databricks dans un contexte Data Engineering
Apache Spark via PySpark et Spark SQL pour le développement de pipelines Data
Delta Lake et ses mécanismes clés (Delta log, ACID, schema evolution, time travel)
Méthodes d'ingestion de données sur la plateforme Databricks
Framework Spark Declarative Pipelines
Outils de tests automatisés : pytest, contrôles qualité des données (DQX, SDP Expectations)
Gestion de version avec Git et workflows collaboratifs associés
Langage SQL pour interrogation des données
Programmation en Python avec bonnes pratiques de software engineering (structuration, modularité, conventions de nommage, gestion des dépendances)
Environnements Business Intelligence, Big Data et architectures Lakehouse
Plateformes Data modernes (Cloud)
Conditions de travail
Expérience attendue : 3 à 8+ ans en ingénierie Data
Rémunération : 42-50K€
Certifications recommandées : Databricks Certified Data Engineer Associate (ou équivalent)
Le profil recherché
Profil recherché
3 à 8+ ans d'expérience en ingénierie Data
Capacité à évoluer efficacement au sein d'équipes agiles et pluridisciplinaires
Fort esprit analytique et grande rigueur
Autonomie, proactivité et sens des responsabilités
Capacité à communiquer clairement avec des interlocuteurs techniques et non techniques
Savoir prioriser les tâches, gérer les contraintes et respecter les engagements
Esprit de synthèse et orientation résultats et valeur métier
Bonne connaissance des environnements Business Intelligence, Big Data et des architectures Lakehouse
Expérience sur des plateformes Data modernes (Cloud)
Maîtrise de SQL et notions de modélisation de données (architecture médaillon, modèle en étoile)
Bagage en software engineering pour écrire un code robuste, lisible, maintenable et testable, notamment en Python
Application des bonnes pratiques de développement : structuration du code, modularité, gestion des dépendances, conventions de nommage
Sensibilisation aux principes de qualité logicielle (tests unitaires, tests d'intégration, revue de code)
À l'aise avec les outils de versioning (Git) et workflows collaboratifs
Capacité à concevoir des pipelines Data comme des produits logiciels, en tenant compte de la maintenabilité, évolutivité et observabilité
Bonne maîtrise de la plateforme Databricks en contexte Data Engineering
Utilisation avancée d'Apache Spark via PySpark et Spark SQL pour le développement de pipelines Data
Connaissance de Delta Lake et de ses mécanismes clés (Delta log, ACID, schema evolution, time travel)
Maîtrise des différentes méthodes d'ingestion de données de la plateforme
Connaissance et implémentation du framework Spark Declarative Pipelines
Mise en place de stratégies de tests automatisés pour les pipelines incluant : tests unitaires (ex. pytest), contrôles de qualité des données (DQX, SDP Expectations)
Certification recommandée : Databricks Certified Data Engineer Associate (ou équivalent)
Compétences requises
- Python
- Autonomie
- Big data
- Développement logiciel
- Pro-activité
- Git
- Contrôle qualité
- Modélisation des données
- Esprit d'analyse
- SQL
- Business Intelligence
- Apache spark