Si en Power BI cada informe hace su propio ETL, el caos llega enseguida: el mismo dato se extrae de forma distinta en cada informe y al día siguiente empieza la discusión de «qué cifra es la buena». El Dataflow es la capa central de preparación de datos que acaba con ese caos. Y con la llegada de Microsoft Fabric a finales de 2024, Power BI se convirtió en una plataforma capaz de llegar al nivel de un almacén de datos corporativo. En este artículo vemos el papel del Dataflow, los componentes de Fabric y cómo encajan con la arquitectura medallón.
01. ¿Qué es un Dataflow y por qué usarlo?
El Dataflow es una capa de ETL reutilizable que vive dentro de Power BI Service. Extrae y limpia el dato una sola vez, y a partir de ahí varios informes usan ese dato ya depurado.
Sus ventajas:
- La misma lógica de ETL en un único sitio
- Se reduce el tiempo de actualización por informe
- Permite separar los roles de desarrollador de ETL y diseñador de informes
- Se almacena en formato CDM (Common Data Model), compatible con el estándar de la nube
02. La confusión entre Dataflow y Dataset
Estos dos conceptos se mezclan a menudo:
- Dataflow: extrae los datos de los orígenes, los limpia y los vuelca a un lago (Azure Data Lake u OneLake de Fabric)
- Dataset (ahora Modelo Semántico): medidas DAX, relaciones y tablas listas para el informe
El orden es: origen → Dataflow (bronce/plata) → Dataset (oro) → informe. Esa separación es la base de una arquitectura corporativa de Power BI.
03. Microsoft Fabric: el ecosistema ampliado de Power BI
Microsoft Fabric, disponible de forma general desde 2024, reúne en una única plataforma SaaS:
- Data Factory (ETL, canalizaciones de Power Query)
- Synapse Data Engineering (procesamiento basado en Spark)
- Data Warehouse (almacén de datos SQL)
- Real-Time Analytics (datos en streaming)
- Data Science (modelos de aprendizaje automático)
- Power BI (informes)
Todo funciona sobre un almacenamiento común llamado OneLake. Es la versión reunida bajo un mismo techo de lo que antes era montar por separado Azure Synapse, Data Factory y Power BI.
04. Arquitectura medallón: bronce, plata y oro
La arquitectura recomendada en Fabric son las capas medallón:
- Bronce: dato en bruto, copia exacta del sistema de origen (la tabla de facturas tal cual)
- Plata: dato limpio y enriquecido con reglas de negocio (facturas cruzadas con los datos de cliente)
- Oro: modelo dimensional listo para el análisis (hecho de ventas + dimensión de cliente + dimensión de fecha)
La capa de informes se alimenta del oro. Mientras el oro no cambie, el informe no se rompe. Los cambios en bronce fluyen primero a plata y de ahí a oro. Ese aislamiento es el estándar de oro de la salud del dato corporativo.
05. ¿Cuándo Fabric y cuándo Power BI clásico?
En escenarios pequeños, con pocas fuentes y complejidad media, basta con Power BI Pro clásico (Dataflow + Dataset).
Señales de que toca pasar a Fabric:
- Más de 500 GB de volumen de datos corporativo
- Más de diez sistemas de origen distintos
- Necesidad de analítica en tiempo real (IoT, comercio electrónico en vivo)
- Integración con ciencia de datos y aprendizaje automático
- Requisitos de gobierno del dato
El modelo de costes de Fabric se basa en capacidad (Capacity Unit); a pequeña escala supone un gasto innecesario y a gran escala puede suponer un ahorro importante.
06. DirectLake: la función que cambia las reglas
La característica más innovadora de Fabric es el modo DirectLake. En el Power BI clásico había dos modos:
- Importación (rápido, pero el dato se copia y hay que actualizarlo)
- DirectQuery (en vivo, pero lento)
DirectLake ofrece una tercera vía: el dato se guarda en OneLake en formato Delta Parquet y Power BI lo consulta con la rapidez de la importación, pero sin copiarlo en realidad.
El resultado: rendimiento de importación sobre miles de millones de filas, flexibilidad de DirectQuery y ninguna carga de actualización. Un cambio de fondo en la estrategia de datos corporativa.
07. Ruta de migración y notas prácticas
El paso del Power BI clásico a Fabric debe planificarse por fases:
- Fase 1: llevar los Dataflow actuales a Dataflow Gen2 en Fabric
- Fase 2: mover las capas bronce y plata a un Lakehouse o Warehouse
- Fase 3: pasar los modelos semánticos al modo DirectLake
- Fase 4: incorporar los componentes de tiempo real y ciencia de datos
Cada fase debe probarse con datos de producción; el comportamiento de costes de Fabric es distinto al del Power BI clásico y hay que vigilarlo de cerca. La aplicación Fabric Capacity Metrics es gratuita, muestra el consumo y es una herramienta de seguimiento obligatoria durante la puesta en marcha.
Explore nuestra solución de Power BI
Puede reservar una consultoría gratuita para obtener información detallada.