Data Factory est le composant qui amène les données dans le lac au sein de Fabric. Les transferts réguliers depuis ERP, bases, fichiers et API se définissent ici.
01. Deux briques
Les flux de données transforment via une interface visuelle et sont familiers à qui connaît Power Query. Les pipelines sont la couche d'orchestration qui enchaîne les étapes et gère conditions et boucles.
02. Chargement incrémental
Reprendre toute la table chaque nuit ne pose pas problème sur de petits volumes et brûle de la capacité sur des millions de lignes. Ne récupérer que les nouveaux enregistrements par date de modification ou clé croissante doit être la norme.
03. Sources sur site
Pour atteindre un SQL ou un ERP sur votre réseau, une passerelle est nécessaire. La disponibilité de la machine qui l'héberge est celle de tout le pipeline.
04. Gestion des erreurs
Ce qui se passe en cas d'échec doit être défini : réessayer, sauter l'étape suivante, avertir qui. Des travaux nocturnes arrêtés en silence font lire le matin des données périmées.
05. Séparation des environnements
Développement et production doivent occuper des espaces de travail distincts, les paramètres de connexion étant gérés par paramètres. Sinon, chaque publication exige une correction manuelle.
06. Documentation
Quel pipeline alimente quelle table et à quelle fréquence doit être écrit. C'est le seul moyen pratique de trouver les rapports affectés quand une source change.