Superset DataFusion
Superset DataFusion
Implémentation d’un driver implémentant DataFusion dans les drivers Python utilisés par Superset. Cette intégration permet l’utilisation de fichiers .parquet dans Superset pour l’analyse de données.
Vue d’ensemble
Ce projet fournit une intégration entre Apache Superset et Apache DataFusion, permettant d’analyser des données stockées dans des formats Parquet, notamment sur S3. Le driver permet à Superset d’utiliser DataFusion comme moteur d’exécution de requêtes SQL.
Chronologie (dépôt Git) : démarrage en septembre 2025 (Initial commit, puis add inital code), développement intensif sur une semaine (driver, Docker Compose, CI), dernière mise à jour du dépôt le 14 septembre 2025.
Fonctionnalités principales
- Support Parquet : Analyse de fichiers Parquet directement depuis Superset
- Intégration S3 : Accès aux données stockées sur S3
- Moteur SQL : Utilisation de DataFusion comme moteur d’exécution de requêtes
- Driver Python : Implémentation comme driver Python pour Superset
Cas d’usage
- Analyse de données volumineuses stockées en Parquet
- Intégration avec des données sur S3
- Requêtes SQL performantes sur données columnaires
- Tableaux de bord et visualisations de données
Technologies
- Python : Langage d’implémentation du driver
- DataFusion : Moteur de requêtes SQL en Rust
- Superset : Plateforme de BI et visualisation
- Parquet : Format de stockage columnaire
Contributions
Le projet est ouvert aux contributions. Les améliorations du driver, le support de nouvelles fonctionnalités DataFusion et les optimisations de performance sont les bienvenues.
Références et concepts clés
Voici les sources et documentations officielles des technologies et concepts utilisés dans ce projet :
- Apache Superset (Wikipedia) : Plateforme d’exploration et de visualisation de données (Business Intelligence) open source.
- Apache DataFusion (Site officiel) : Moteur d’exécution de requêtes SQL extensible et ultra-rapide, écrit en Rust, optimisé pour l’analyse de données à grande échelle. (Voir aussi le dépôt GitHub officiel).
- Apache Parquet (Wikipedia) : Format de stockage de données orienté colonnes (columnaire), conçu pour optimiser le stockage et la vitesse de traitement des requêtes analytiques complexes.
- Amazon S3 (Simple Storage Service) (Wikipedia) : Service de stockage d’objets hautement disponible utilisé ici pour héberger les fichiers Parquet.
- SQL (Structured Query Language) (Wikipedia) : Langage standardisé pour la définition, la manipulation et la requête de bases de données relationnelles.
- Python (Wikipedia) : Langage de programmation dynamique utilisé pour écrire le driver d’intégration.
- MQTT (Wikipedia) : Protocole de messagerie léger de type publication-abonnement, particulièrement adapté aux communications IoT (utilisé dans les projets associés).
Projet associé
Projets proches sur ce site (données columnaires, SQL, IoT) :
- IoT Monitor : supervision MQTT avec Parquet, DataFusion et requêtes SQL (rsiotmonitor)
- MQTT IoT Stuff : organisation regroupant rsiotmonitor et l’écosystème MQTT
Pages connexes
Pour approfondir le fil données, analytics et open source sur ce site :
- Projets Open Source — collection des contributions techniques
- IoT Monitor — fusion de données et historique sur dispositifs IoT
- MQTT IoT Stuff — agents et monitoring IoT (DataFusion côté rsiotmonitor)
- À propos — Frett27 Consulting — expertise architectures logicielles et plateformes de données