Analítica Big Data

De datos crudos a datos útiles: transformación declarativa con Lakeflow

goal oriented entrepreneur luxurious corporate office plans strategy

Ingerir datos es solo la mitad del trabajo. Una vez que llegan a Bronze, el reto pasa a ser transformarlos de forma confiable, incremental y con control de calidad, sin escribir orquestación a mano para cada tabla. Ahí es donde entra Lakeflow Declarative Pipelines (SDP): en lugar de programar cada paso, declaras qué resultado debe existir y cómo se relaciona con los demás, y el framework se encarga de mantenerlo actualizado.

3 Key Points

Lakeflow declara el resultado

(Pipeline, Flow, Dataset, Sink) y el framework gestiona la ejecución para mantenerlo actualizado.

La calidad de datos va integrada con Expectations:

decides si un registro se deja pasar, se descarta o detiene el pipeline.

Auto CDC aplica cambios

automáticamente y permite elegir entre estado actual (SCD Type 1) o historial completo (SCD Type 2).

Qué es Lakeflow Declarative Pipelines

Es un framework declarativo para construir pipelines batch y streaming en SQL o Python, construido sobre Apache Spark Declarative Pipelines y extendido por Databricks con capacidades para producción: procesamiento incremental (solo datos nuevos o cambios, cuando el tipo de dataset lo permite), un mismo framework para batch y streaming, observabilidad integrada, y calidad de datos como parte del pipeline, no como un paso aparte.

Las piezas del framework

ComponenteFunción
PipelineUnidad de desarrollo y ejecución; agrupa código y configuración.
FlowEjecuta una query o transformación desde una fuente hacia un target.
DatasetRepresenta los datos que otros componentes pueden consumir.
SinkPublica datos en streaming hacia un destino fuera del pipeline.

Lakeflow deriva automáticamente el grafo de dependencias a partir de las relaciones y referencias que declaras en el código.

8438396 12397

Tres formas de representar un dataset

Tipo Modelo mental Uso principal
Streaming Table Procesa lo nuevo Ingesta incremental, eventos, CDC, backfills
Materialized View Mantiene correcto un resultado Joins, agregaciones, KPIs, reporting
Temporary View Reutiliza lógica sin materializar Transformaciones intermedias

La calidad, integrada desde el origen

Con Quality Expectations, la validación deja de ser una revisión posterior y pasa a ocurrir como parte del procesamiento. Ante un registro que no cumple una regla, puedes decidir qué hacer: dejarlo pasar con la alerta registrada (WARN), descartarlo antes de que llegue al dataset destino (DROP), o detener el flow por completo cuando protege una condición crítica (FAIL). Cuando no quieres perder un registro inválido, puedes separarlo en cuarentena para diagnóstico o reproceso — un patrón de diseño, no una acción nativa de Expectations.

2150169846

Cuándo se ejecuta el pipeline

El modo de ejecución es independiente del tipo de dataset: Triggered procesa los datos disponibles y termina —ideal para procesos programados o por intervalos—, mientras que Continuous permanece activo procesando nuevos datos a medida que llegan, para los casos donde se necesita mayor frescura. Streaming o batch definen cómo se procesan los datos; Triggered o Continuous definen cuándo.

Observabilidad y gobierno con Unity Catalog

Lakeflow ofrece observabilidad en varios niveles: el grafo de dependencias entre datasets, métricas de qué tan rápido y qué volumen procesó cada flow, el perfil de ejecución física de Spark, y un event log con progreso, calidad, linaje y errores de cada corrida. Los datasets que produce se publican, gobiernan y consumen directamente desde Unity Catalog —con permisos, linaje y organización por catálogo y esquema— sin pasos adicionales.

Con calidad, control de cambios y observabilidad integradas al mismo framework, Lakeflow deja de ser solo un mecanismo de ingesta: se convierte en el camino declarativo para transformar datos crudos en datos que el negocio realmente puede usar.

Si quieres verlo aplicado paso a paso, puedes revisar la grabación de nuestro webinar «Ruta LakeFlow: De datos crudos a datos útiles», con David Orozco, Ingeniero de Datos en DataKnow — míralo aquí.