Qué es un data lake y en qué se diferencia de un data warehouse

Ingeniera de datos caminando entre servidores de una sala tecnica luminosa mientras revisa en una tablet un diagrama de tuberias de datos
Escrito por
Shakers Seguir

Shakers es infraestructura de talento potenciada por IA. Ayudamos a las empresas a cerrar el implementation gap: el hueco entre probar IA y ponerla en produccion con equipos que saben ejecutarla.

• ...

Directo al grano: un data lake es un repositorio que guarda los datos en su formato original, estructurados o no, sin imponerles un esquema previo, para que el procesamiento llegue después. El nombre describe bien la idea. Todo cae al lago, del grifo y del río, y cada consumidor toma lo que necesita. Este es el mapa del tema: qué es un data lake, en qué se diferencia de un data warehouse, cuándo lo necesita una empresa y cuándo no, qué tecnologías lo forman hoy y qué equipo hace falta para construirlo y gobernarlo.

Que ya no es un debate de gabinete lo dice el mercado: más de 100 ofertas técnicas activas en España mencionan data lake de forma literal en su texto (análisis de mercado de Shakers, corte del 5 de octubre de 2026, recuento literal sobre título, skills y descripción). El término lleva una década en el argot de datos. Lo nuevo es que el mercado español ya lo está contratando, y eso obliga a las empresas a decidir si lo necesitan antes de que se lo pidan en una licitación.

TL;DR. Un data lake guarda datos crudos de cualquier formato (tablas, logs, texto, imágenes) sin esquema previo; el procesamiento y la estructura se aplican al leer. Se diferencia del data warehouse en que este exige modelo de datos antes de cargar y sirve al reporting, mientras el lago sirve a la exploración y al machine learning. El lakehouse (Delta Lake, Apache Iceberg) combina los dos modelos sobre almacenamiento de objetos.

Qué es un data lake y para qué sirve

La mayoría de lo que una empresa produce como dato no nace en forma de tabla. Logs de aplicaciones, eventos de producto, documentos, correos, imágenes, datos de sensores, respuestas de modelos de IA. Un almacén clásico exige decidir antes qué columnas tiene cada cosa y rechazar lo que no encaja. El data lake invierte el orden: guarda primero, con el mínimo de metadatos, y la estructura se aplica cuando alguien lee. En inglés, schema-on-read.

Esa inversión abre tres usos que el warehouse cubre mal. El primero, exploración. Cuando nadie sabe todavía qué pregunta hacer, el lago retiene la materia prima sin coste de modelado. Segundo, machine learning: los modelos entrenan con texto, imágenes y series completas que no caben en un modelo tabular. Tercero, historia: conservar lo crudo permite re-procesar con criterios nuevos lo que ya se ingirió hace años, sin volver a pedirlo al origen.

En qué se diferencia de un data warehouse

La frontera práctica entre ambos no es técnica sino de contrato con los datos: quién los estructura y cuándo.

Criterio Data lake Data warehouse
Esquema Al leer (schema-on-read) Al escribir (schema-on-write)
Datos Crudos, cualquier formato Modelados, tabulares
Usuario típico Data engineer, científico de datos Analista, negocio
Pregunta que responde Explorar y entrenar Reportar y decidir
Coste de almacenamiento Bajo por gigabyte, objetos Mayor, servicio gestionado

El mercado ha ido cerrando la grieta entre los dos mundos con el lakehouse: almacenamiento de objetos barato como base, formatos abiertos con transacciones ACID encima y una capa de gobierno única. Las tres piezas que lo materializan son Delta Lake, Apache Iceberg y el enfoque de Microsoft con OneLake en Fabric. La consecuencia práctica para una empresa es que la elección ya no es lago o almacén: la mayoría de plataformas nuevas hacen los dos sobre la misma infraestructura.

Cuándo necesita una empresa un data lake y cuándo no

Tres condiciones, en la práctica, justifican el lago: fuentes de datos variadas o no estructuradas que el modelo tabular no absorbe, volumen de historia suficiente para que re-procesar resulte más barato que re-pedir, y una ambición de analítica avanzada o IA que vaya más allá del reporting. Si una de las tres falta, el warehouse resuelve y el lago sobra.

Conviene decirlo claro porque el término arrastra moda: una pyme con un ERP, un CRM y necesidad de informes mensuales no necesita un data lake. Necesita un almacén, o ni eso. Subir al lago por madurez, porque toca, es el peor de los motivos; el bueno es un problema concreto de variedad y volumen. La decisión se toma por el tipo de dato, igual que se toma el resto de la arquitectura.

Qué tecnologías forman un data lake hoy

El stack se ha estandarizado alrededor de cinco capas, y casi todas las plataformas comerciales son combinaciones de estas piezas.

Capa Qué hace Piezas habituales
Almacenamiento Guardar objetos con coste bajo y durabilidad alta S3, ADLS, GCS
Procesamiento Transformar y consultar a escala Spark, motores SQL distribuidos
Formatos abiertos Transacciones y evolución de esquema sobre objetos Delta Lake, Apache Iceberg
Catálogo y gobierno Saber qué hay, quién puede y qué significa Unity Catalog, Purview, catálogos Iceberg
Consumo BI, notebooks y entrenamiento Power BI, notebooks, Databricks

El error frecuente al comprar esta capa es confundir el lago con un producto. Databricks, Snowflake o Fabric son plataformas que resuelven partes del stack, pero el lago es una decisión de arquitectura: qué se guarda crudo, con qué gobierno y para quién. Los productos se eligen después de esa decisión, no antes.

Qué equipo necesitas para construirlo y gobernarlo

El censo citado en la apertura ayuda a dimensionar el esfuerzo: el perfil dominante en esas ofertas no es el científico de datos, es el data engineer que construye y mantiene las tuberías. Y la demanda acelera: la señal semanal de la skill creció un 150% la semana pasada, con 44 menciones (análisis de mercado de Shakers, octubre de 2026, ventana de 7 días).

Un lago sin gobierno se convierte en un pantano: datos sin dueño, sin linaje y sin permisos que nadie se atreve a borrar. El equipo mínimo que lo evita tiene dos perfiles: quien construye la ingesta y el procesamiento, y quien sostiene catálogo, permisos y calidad. El segundo es el que suele faltar. La frontera con la operación de modelos, cuando el lago alimenta IA, se explica en la referencia de cómo se automatiza el flujo de machine learning.

Cuánto cuesta montar un data lake

Tres partidas cambian respecto a un almacén tradicional. El almacenamiento de objetos es barato por gigabyte, así que retener historia deja de ser el problema. El cómputo se paga por uso y puede dispararse si nadie gobierna las consultas, que es el coste que sorprende a las empresas en la factura. Y el gobierno, catálogo, permisos y calidad, no se compra: se cubre con personas. El presupuesto realista se construye sobre las tres, no solo sobre la primera.

Preguntas frecuentes sobre el data lake

¿Qué es un data lake en términos sencillos?

Un repositorio donde la empresa guarda sus datos en el formato original, sin obligarles a encajar en tablas antes de entrar. La estructura se aplica cuando alguien lee los datos, no al guardarlos. Sirve para retener materia prima que hoy no se sabe cómo explotar y explotarla mañana.

¿Cuál es la diferencia entre data lake y data warehouse?

El contrato con los datos. El warehouse exige modelo antes de cargar y sirve al reporting con usuarios de negocio; el lago guarda crudo y sirve a la exploración y al machine learning con perfiles técnicos. Muchas plataformas actuales hacen los dos sobre la misma base de almacenamiento.

¿Qué es un data lakehouse?

La arquitectura que combina lago y almacén: almacenamiento de objetos barato, formatos abiertos con transacciones como Delta Lake o Apache Iceberg y una capa de gobierno común. Permite reporting y ciencia de datos sobre los mismos datos sin duplicar plataformas.

¿Es Snowflake un data lake?

No. Snowflake nació como almacén gestionado y ha añadido capacidades de lago, pero su modelo sigue siendo de servicio con datos modelados. Un lago clásico se apoya en almacenamiento de objetos del proveedor de nube con formatos abiertos; la diferencia importa al negociar costes y salida del proveedor.

¿Qué roles trabajan en un data lake?

El perfil central es el data engineer, que construye ingesta y procesamiento. Lo acompaña quien gobierna: catálogo, permisos, calidad y linaje. Los científicos y analistas consumen. En las ofertas medidas en España domina el data engineer, no el perfil de investigación.

¿Es seguro un data lake?

Es tan seguro como su gobierno. Guardar todo crudo concentra riesgo si faltan permisos por dominio, cifrado y linaje. Un lago bien gobernado con catálogo y control de acceso por roles es auditable; uno sin gobierno es el activo más difícil de defender de la empresa.

El data lake responde a un problema de variedad y volumen que el mercado español empieza a pagar, y por eso es infraestructura de decisión más que de moda. Quien lo plantee bien empieza por el tipo de dato y el equipo que lo va a gobernar, y deja la elección de plataforma para el final. Ese orden, raro de ver en las licitaciones, es el que separa los lagos que se usan de los que se abandonan.

Para la pieza vecina de gobierno del dato, la referencia es cómo funciona el data mesh en empresas; para el salto del lago a los modelos, la de MLOps en producción.

Recursos relacionados