Ingerir datos es solo la mitad del trabajo. Una vez que llegan a Bronze, el reto pasa a ser transformarlos de forma confiable, incremental y con control de calidad, sin escribir orquestación a mano para cada tabla. Ahí es donde entra Lakeflow Declarative Pipelines (SDP): en lugar de programar cada paso, declaras qué resultado debe existir y cómo se relaciona con los demás, y el framework se encarga de mantenerlo actualizado.
3 Key Points
Lakeflow declara el resultado
(Pipeline, Flow, Dataset, Sink) y el framework gestiona la ejecución para mantenerlo actualizado.
La calidad de datos va integrada con Expectations:
decides si un registro se deja pasar, se descarta o detiene el pipeline.
Auto CDC aplica cambios
automáticamente y permite elegir entre estado actual (SCD Type 1) o historial completo (SCD Type 2).
Qué es Lakeflow Declarative Pipelines
Es un framework declarativo para construir pipelines batch y streaming en SQL o Python, construido sobre Apache Spark Declarative Pipelines y extendido por Databricks con capacidades para producción: procesamiento incremental (solo datos nuevos o cambios, cuando el tipo de dataset lo permite), un mismo framework para batch y streaming, observabilidad integrada, y calidad de datos como parte del pipeline, no como un paso aparte.
Las piezas del framework
| Componente | Función |
|---|---|
| Pipeline | Unidad de desarrollo y ejecución; agrupa código y configuración. |
| Flow | Ejecuta una query o transformación desde una fuente hacia un target. |
| Dataset | Representa los datos que otros componentes pueden consumir. |
| Sink | Publica datos en streaming hacia un destino fuera del pipeline. |
Lakeflow deriva automáticamente el grafo de dependencias a partir de las relaciones y referencias que declaras en el código.
Tres formas de representar un dataset
| Tipo | Modelo mental | Uso principal |
|---|---|---|
| Streaming Table | Procesa lo nuevo | Ingesta incremental, eventos, CDC, backfills |
| Materialized View | Mantiene correcto un resultado | Joins, agregaciones, KPIs, reporting |
| Temporary View | Reutiliza lógica sin materializar | Transformaciones intermedias |
La calidad, integrada desde el origen
Con Quality Expectations, la validación deja de ser una revisión posterior y pasa a ocurrir como parte del procesamiento. Ante un registro que no cumple una regla, puedes decidir qué hacer: dejarlo pasar con la alerta registrada (WARN), descartarlo antes de que llegue al dataset destino (DROP), o detener el flow por completo cuando protege una condición crítica (FAIL). Cuando no quieres perder un registro inválido, puedes separarlo en cuarentena para diagnóstico o reproceso — un patrón de diseño, no una acción nativa de Expectations.
Cuándo se ejecuta el pipeline
El modo de ejecución es independiente del tipo de dataset: Triggered procesa los datos disponibles y termina —ideal para procesos programados o por intervalos—, mientras que Continuous permanece activo procesando nuevos datos a medida que llegan, para los casos donde se necesita mayor frescura. Streaming o batch definen cómo se procesan los datos; Triggered o Continuous definen cuándo.
Observabilidad y gobierno con Unity Catalog
Lakeflow ofrece observabilidad en varios niveles: el grafo de dependencias entre datasets, métricas de qué tan rápido y qué volumen procesó cada flow, el perfil de ejecución física de Spark, y un event log con progreso, calidad, linaje y errores de cada corrida. Los datasets que produce se publican, gobiernan y consumen directamente desde Unity Catalog —con permisos, linaje y organización por catálogo y esquema— sin pasos adicionales.
Con calidad, control de cambios y observabilidad integradas al mismo framework, Lakeflow deja de ser solo un mecanismo de ingesta: se convierte en el camino declarativo para transformar datos crudos en datos que el negocio realmente puede usar.
Si quieres verlo aplicado paso a paso, puedes revisar la grabación de nuestro webinar «Ruta LakeFlow: De datos crudos a datos útiles», con David Orozco, Ingeniero de Datos en DataKnow — míralo aquí.


