Si chaque rapport Power BI fait son propre ETL, le chaos s'installe vite : la même donnée est extraite différemment par chaque rapport et, dès le lendemain, la discussion sur « quel chiffre est le bon » commence. Le dataflow est la couche centralisée de préparation des données qui met fin à ce désordre. Avec Microsoft Fabric, arrivé fin 2024, Power BI est devenu une plateforme capable d'atteindre le niveau d'un entrepôt de données d'entreprise. Cet article aborde le rôle du dataflow, les composants de Fabric et la façon dont ils se combinent dans une architecture médaillon.
01. Qu'est-ce qu'un dataflow et pourquoi l'utiliser ?
Un dataflow est une couche ETL réutilisable, hébergée dans Power BI Service. Il extrait et nettoie la donnée une seule fois ; plusieurs rapports consomment ensuite cette donnée nettoyée.
Ses bénéfices :
- La même logique ETL au même endroit (principe DRY)
- Une durée d'actualisation réduite par rapport
- La possibilité de séparer les rôles de développeur ETL et de concepteur de rapports
- Un stockage au format Common Data Model, conforme aux standards du cloud
02. La confusion entre dataflow et jeu de données
Ces deux notions sont souvent confondues :
- Le dataflow extrait la donnée des sources, la nettoie et la déverse dans un lac (Azure Data Lake ou Fabric OneLake)
- Le jeu de données, désormais appelé modèle sémantique, contient les mesures DAX, les relations et les tables prêtes pour le rapport
L'enchaînement : source → dataflow (bronze/argent) → modèle sémantique (or) → rapport. Cette distinction est le fondement d'une architecture Power BI d'entreprise.
03. Microsoft Fabric : l'écosystème élargi de Power BI
Disponible depuis 2024, Microsoft Fabric réunit sur une seule plateforme SaaS :
- Data Factory (ETL, pipelines Power Query)
- Synapse Data Engineering (traitement fondé sur Spark)
- Data Warehouse (entrepôt SQL)
- Real-Time Analytics (données en flux)
- Data Science (modèles d'apprentissage automatique)
- Power BI (restitution)
Tout repose sur un stockage commun nommé OneLake. C'est la réunion sous un même toit de ce qui exigeait auparavant d'assembler séparément Azure Synapse, Data Factory et Power BI.
04. L'architecture médaillon : bronze, argent, or
L'architecture recommandée dans Fabric repose sur des couches en médaillon :
- Bronze : la donnée brute, copie conforme du système source (la table des factures dans son état d'origine)
- Argent : la donnée nettoyée et enrichie des règles métier (facture rapprochée des informations client)
- Or : le modèle dimensionnel prêt pour l'analyse (faits de vente, dimension client, dimension date)
La couche de restitution s'alimente à la couche or. Tant que celle-ci ne change pas, le rapport reste intact. Les modifications du bronze remontent d'abord vers l'argent, puis vers l'or. Cette isolation constitue la référence en matière de santé des données.
05. Quand Fabric, quand Power BI classique ?
À petite échelle, avec quelques sources et une complexité moyenne, Power BI Pro classique (dataflow et modèle sémantique) suffit.
Les signaux d'un passage à Fabric :
- Un volume de données dépassant 500 Go
- Plus de dix systèmes sources différents
- Un besoin d'analytique en temps réel (IoT, e-commerce en direct)
- Une intégration data science et apprentissage automatique
- Des exigences de gouvernance des données
Le modèle de coût de Fabric repose sur la capacité réservée : dépense superflue à petite échelle, économie notable à grande échelle.
06. DirectLake : la fonction qui change la donne
La fonction la plus novatrice de Fabric est le mode DirectLake. Power BI classique n'offrait que deux modes :
- Importation (rapide, mais la donnée est copiée et doit être actualisée)
- DirectQuery (en direct, mais lent)
DirectLake ouvre une troisième voie : la donnée est stockée dans OneLake au format Delta Parquet, et Power BI l'interroge aussi vite que si elle était importée, sans pourtant la copier.
Résultat : les performances de l'importation sur des milliards de lignes, la souplesse de DirectQuery, et aucune charge d'actualisation. Un changement de fond pour la stratégie de données d'une entreprise.
07. Chemin de migration et notes pratiques
Le passage de Power BI classique à Fabric doit se planifier par phases :
- Phase 1 : porter les dataflows existants vers Dataflow Gen2 dans Fabric
- Phase 2 : déplacer les couches bronze et argent vers un Lakehouse ou un Warehouse
- Phase 3 : basculer les modèles sémantiques en mode DirectLake
- Phase 4 : ajouter les composants temps réel et data science
Chaque phase doit être validée sur des résultats de production ; le comportement de coût de Fabric diffère de celui de Power BI classique et demande un suivi attentif. L'application Fabric Capacity Metrics, gratuite, montre l'usage réel : c'est un outil de supervision obligatoire pendant le déploiement.
Découvrez notre solution Power BI
Pour en savoir plus, vous pouvez réserver un entretien de conseil gratuit.