Cada fuente de datos implica credenciales, mecanismos de integración, monitoreo y lógica propios. Cuando una organización tiene decenas de fuentes bases de datos, aplicaciones SaaS, archivos en la nube, mantener esa integración a mano se vuelve, rápidamente, el verdadero cuello de botella de la ingeniería de datos. Este artículo repasa cómo Databricks resuelve ese problema, desde los métodos más simples para traer archivos hasta la ingesta administrada de sistemas empresariales completos con Lakeflow Connect.
3 Key Points
Databricks ofrece tres métodos de ingesta de archivos
CTAS, COPY INTO y Auto Loader según volumen y escenario.
Lakeflow Connect administra la ingesta de bases de datos, SaaS y ERP/CRM
sin código propio, con integración nativa a Unity Catalog.
Conectar una tabla bien exige definir cómo detectar cambios
identificarlos por PK y cómo representarlos en destino.
Ingesta desde almacenamiento en la nube
El punto de partida más común es traer archivos —CSV, JSON, XML, Parquet— desde Amazon S3, Azure Data Lake Storage o Google Cloud Storage, y convertirlos en tablas Delta listas para análisis. Databricks ofrece tres mecanismos para esto, cada uno pensado para un escenario distinto:
| Método | Procesamiento | Reprocesa archivos | Escenario recomendado |
|---|---|---|---|
| CTAS | Batch | Sí | Cargas iniciales |
| COPY INTO | Incremental Batch | No | Cargas incrementales programadas |
| Auto Loader | Incremental Batch / Streaming | No | Grandes volúmenes y procesamiento continuo |
COPY INTO es un comando SQL puro para cargas incrementales e idempotentes: procesa solo archivos nuevos, sin generar duplicados, y mantiene automáticamente el historial de lo ya procesado a diferencia de CTAS, que vuelve a leer todo cada vez. Es ideal cuando el volumen de archivos es moderado y el equipo trabaja principalmente en SQL.
Auto Loader es el mecanismo recomendado para proyectos nuevos. Usa una fuente especial llamada cloudFiles una extensión de Structured Streaming que detecta automáticamente archivos nuevos, evoluciona el esquema, y administra el progreso mediante checkpoints (RocksDB) para garantizar procesamiento exactly-once. Soporta CSV, JSON, XML, Parquet, Avro, ORC, TXT y binarios, incluso comprimidos, y escala a millones de archivos. Se puede construir de dos formas:
Más allá del almacenamiento en la nube
CTAS, COPY INTO y Auto Loader resuelven la ingesta basada en archivos, pero gran parte de los datos empresariales vive en otro lugar: bases de datos relacionales (SQL Server, Oracle, PostgreSQL…), aplicaciones SaaS (Salesforce, Workday, ServiceNow…) y sistemas ERP/CRM (Dynamics 365, NetSuite, SAP…). Para eso existe Lakeflow Connect.
Lakeflow Connect: ingesta administrada para fuentes empresariales
Sin un servicio como este, conectar cada sistema implica escribir código JDBC propio, gestionar autenticación manualmente, resolver cargas iniciales ad-hoc, controlar la evolución de esquemas, programar reintentos y checkpoints, orquestar todo, y escalar la infraestructura y el mantenimiento de APIs por cuenta propia. Lakeflow Connect administra la extracción —no reemplaza la lógica de negocio ni las transformaciones— y aporta:
- Low-code: configuración point-and-click o vía API.
- Totalmente administrado: Databricks gestiona la infraestructura.
- Integración con Unity Catalog: credenciales y permisos centralizados.
- Ingesta incremental: solo se procesan datos nuevos o cambiados.
- Escalabilidad automática según el volumen.
- Conectores nativos para SaaS y bases de datos empresariales.
Cuando no existe un conector nativo, o se requieren capacidades más especializadas, Databricks integra soluciones de terceros a través de Partner Connect (Fivetran, Informatica, Qlik, Rivery, Alteryx, Prophecy), aunque esto puede implicar licencias y costos adicionales, y el nivel de integración con Unity Catalog varía según el proveedor.
Cómo fluyen los datos desde una base de datos
Las bases de datos suelen vivir en redes privadas, así que el flujo requiere componentes adicionales para garantizar conectividad y aislamiento: un Ingestion Gateway se autentica contra la base, hace la lectura inicial (snapshot) y captura los cambios (CDC); un Volume de Unity Catalog sirve de área de staging, desacoplando la extracción del procesamiento y guardando checkpoints; y una ingesta administrada serverless lee ese staging, procesa y sincroniza los datos hacia tablas Delta en streaming.
Tres preguntas antes de conectar una tabla
Configurar correctamente una fuente requiere responder tres cosas: ¿cómo detecto filas nuevas o modificadas? (cursor o mecanismo CDC), ¿a qué fila existente corresponde ese cambio? (primary key) y ¿cómo represento el cambio en el destino? (SCD Type 1, Type 2 o Append-only). Son decisiones que forman una estrategia conjunta, no elecciones aisladas.
Una guía rápida para decidir
| Pregunta | Camino sugerido |
|---|---|
| ¿Existe un Managed Connector para la fuente? | Empieza por ahí. |
| ¿Necesitas baja latencia o cambios frecuentes? | Prefiere CDC si el conector lo soporta. |
| ¿No puedes habilitar CDC? | Evalúa Query-Based con un cursor confiable. |
| ¿Necesitas lógica de extracción muy particular? | Evalúa Partner Connect, Lakeflow Pipelines o Structured Streaming. |
| ¿La base de datos está en red privada? | Evalúa conectividad y componentes de gateway requeridos. |
El nivel de administración, el mecanismo de incrementalidad y la conectividad de red se evalúan siempre juntos: no son decisiones independientes, sino parte de una misma estrategia de ingesta.
Si quieres ver todo esto explicado con ejemplos en vivo, puedes revisar la grabación de nuestro webinar «Ruta LakeFlow: Ingesta de datos, conecta tus fuentes», con Carlos Rodríguez, Ingeniero de Datos en DataKnow míralo aquí.


