Data lake é um repositório centralizado que armazena grandes volumes de dados no formato bruto, sejam eles estruturados, semiestruturados ou não estruturados, até que alguém precise usá-los.
A metáfora funciona bem porque é exatamente dessa forma que ele funciona: como um lago que recebe água de vários afluentes, sem filtrá-la antes de entrar. Registros de vendas, logs de sistema, arquivos de áudio, imagens, dados de sensores IoT, faturas de telecom, mensagens de e-mail, tudo entra e fica armazenado no formato original.
Isso é diferente de como as empresas armazenavam os dados tradicionalmente. No modelo antigo, os dados precisavam ser estruturados e transformados antes de serem armazenados, já com o data lake, a lógica se inverte: primeiro você armazena, depois define como vai usar cada um deles.
Neste guia, você vai entender o que é, como ele funciona, qual a diferença entre data lake e data warehouse, quando usar cada um e como o data lake se aplica à gestão de dados corporativos.

O que é data lake?
É uma arquitetura de armazenamento de dados que centraliza grandes volumes de informações no formato bruto, sem ter a necessidade de estruturação prévia.
Esse conceito foi popularizado por James Dixon, CTO da Pentaho, em 2010. Ele usou a analogia do lago para contrastar com o data mart, que ele comparou a uma garrafa de água engarrafada, filtrada, processada e embalada para um uso específico, o lago, em contrapartida, representa o estado natural dos dados, disponível em uma quantidade muito maior e para múltiplos usos futuros.
Na prática, data lake é um sistema que permite que qualquer tipo de dado entre sem precisar passar por transformação prévia. Isso inclui:
Dados estruturados: tabelas de banco de dados, planilhas, registros de CRM, faturas.
Dados semiestruturados: arquivos JSON, XML, logs de aplicação, e-mails.
Dados não estruturados: imagens, vídeos, áudios, documentos em PDF, dados de sensores.
A transformação e a estruturação desses dados acontecem no momento do consumo, não na entrada. Esse princípio se chama schema on read e é uma das características centrais do data lake.
Saiba mais sobre o que é gestão de dados e por que ela é a base de qualquer estratégia de analytics.
Como o data lake funciona na prática
O funcionamento segue quatro etapas principais e são elas:
Ingestão de dados
Dados de diferentes fontes chegam através de: sistemas transacionais, APIs, dispositivos IoT, arquivos de log, redes sociais, ERPs, CRMs e a ingestão pode ser em tempo real (streaming) ou em lotes (batch), dependendo da necessidade.
Nessa etapa, os dados não são transformados, o que significa que eles entram no formato original e ficam armazenados exatamente como foram gerados.
Armazenamento em zona bruta
Depois de armazenados, os dados chegam primeiro à zona bruta, também chamada de raw zone ou landing zone e aqui ficam os dados originais, intocados, que servem como fonte de verdade.
Curadoria e organização por zonas
A maioria das arquiteturas de data lake organiza os dados em zonas de maturidade:
Raw zone: são os dados brutos, sem nenhum tipo de processamento.
Curated zone: dados limpos e validados, que já estão prontos para uso analítico.
Consumption zone: dados processados e modelados para casos de uso específicos, como relatórios, machine learning ou dashboards.
Consumo e análise
Os dados são acessados por engenheiros de dados, cientistas de dados e ferramentas de analytics conforme a necessidade. O schema é aplicado no momento da leitura, isso dá uma flexibilidade para usar os mesmos dados de formas diferentes dependendo da pergunta que está sendo respondida.
Data lake vs data warehouse: qual a diferença
A comparação entre data lake e data warehouse é uma das mais frequentes em arquitetura de dados. As duas tecnologias resolvem problemas diferentes e, na maioria das empresas maduras, coexistem.
| Característica | Data lake | Data warehouse |
| Tipo de dado | Estruturado, semiestruturado e não estruturado | Principalmente estruturado |
| Schema | Schema on read (aplicado na leitura) | Schema on write (aplicado na escrita) |
| Custo de armazenamento | Baixo | Alto |
| Velocidade de consulta | Mais lenta (depende da transformação) | Alta (dados já processados) |
| Flexibilidade | Alta | Menor |
| Usuários típicos | Cientistas de dados, engenheiros de dados | Analistas de negócio, BI |
| Casos de uso | Machine learning, analytics exploratório, big data | Relatórios, dashboards, analytics operacional |
Quando usar data lake
Deve ser usado para armazenar grandes volumes de dados brutos de múltiplas fontes, especialmente quando o caso de uso ainda não está totalmente definido, é ideal para projetos de machine learning, análise preditiva e exploração de dados.
Quando usar data warehouse
É usado para consultas analíticas rápidas sobre dados já estruturados e com casos de uso bem definidos, ideal para relatórios operacionais, dashboards de BI e análises financeiras recorrentes.
Sua empresa está estruturando uma arquitetura de dados e quer entender como TEM e MDM geram dados que podem ser integrados ao seu data lake?
Entenda como o Business Intelligence se conecta com a gestão de dados corporativos.
O que é data lakehouse
Data lakehouse é uma arquitetura mais recente que combina características do data lake e do data warehouse em uma única plataforma.
O conceito foi popularizado pela Databricks e resolve um problema clássico da arquitetura: os dados brutos são baratos de armazenar, mas difíceis de consultar com performance. Já o data warehouse é rápido, mas caro e inflexível.
O data lakehouse propõe um meio-termo: armazenamento de baixo custo como o data lake, com as capacidades analíticas e de governança do data warehouse. Plataformas como Delta Lake, Apache Iceberg e Apache Hudi são as tecnologias que viabilizam essa arquitetura.
Para empresas que estão começando a estruturar sua arquitetura de dados, o data lakehouse tem ganhado espaço como alternativa ao modelo tradicional de dois sistemas separados.
Vantagens e limitações do data lake
O data lake resolve problemas reais de armazenamento e análise de dados em escala, mas ele também traz desafios que precisam ser considerados antes da implementação. Conhecer os dois lados é o que separa uma decisão bem fundamentada de uma adoção por tendência.
Vantagens do data lake
Flexibilidade de dados
Como falamos anteriormente, ele aceita qualquer tipo de dado, de qualquer fonte, sem necessidade de transformação prévia. Isso permite capturar dados que podem ser úteis no futuro, mesmo sem saber exatamente como.
Custo de armazenamento baixo
O data lake usa armazenamento de objetos, como Amazon S3, Azure Data Lake Storage ou Google Cloud Storage, que é muito mais barato do que bancos de dados relacionais.
Escala
Consegue lidar com volumes de dados que seriam inviáveis em um data warehouse tradicional.
Suporte a machine learning e IA
Dados não estruturados, como imagens, textos e áudios, são insumos essenciais para modelos de machine learning e o data lake armazena esses dados de forma nativa.
Limitações do data lake
Risco de data swamp
Sem uma governança adequada, o data vira um “pântano de dados”, onde ninguém sabe o que está armazenado, os dados acabam ficando desatualizados e a qualidade cai.
Performance de consulta
Consultas sobre dados brutos são mais lentas do que consultas em um data warehouse com dados já processados.
Complexidade de governança
Catalogar, documentar e controlar o acesso a dados em um data lake exige processos e ferramentas específicas.
Curva de aprendizado
As equipes que vêm de um ambiente de data warehouse precisam adaptar ferramentas, processos e habilidades para trabalhar com data lake.
Saiba mais sobre como a análise preditiva usa dados armazenados em data lakes para gerar modelos de previsão.
Quando usar data lake na sua empresa
O fato é: nem toda empresa precisa de um data lake. A decisão depende do volume de dados, da maturidade da equipe de dados e dos casos de uso que a empresa quer suportar.
Faz sentido considerar um data lake quando:
A empresa gera ou recebe grandes volumes de dados de múltiplas fontes com formatos diferentes, nesses casos há necessidade de projetos de machine learning ou análise preditiva que precisam de dados históricos em volume. A equipe tem engenheiros de dados com capacidade de estruturar e governar o ambiente e o custo de armazenamento de dados estruturados em data warehouse está se tornando proibitivo.
Pode não fazer sentido quando
A empresa ainda está nos primeiros passos da maturidade em dados, quando os casos de uso de analytics são bem definidos e se baseiam em dados estruturados, não há equipe técnica com experiência em engenharia de dados e o volume de dados é gerenciável com ferramentas de BI tradicionais.
Os dados que o data lake armazena são a matéria-prima da análise preditiva. Como transformar esse volume em previsões que a operação realmente usa.
Data lake e gestão de dados corporativos
Para empresas com operações complexas de TI e telecom, o data lake tem um papel específico: centralizar os dados que hoje estão fragmentados em múltiplos sistemas.
Faturas de telecom, registros de uso de dispositivos, logs de acesso, dados de localização de equipes em campo, históricos de contratos. Cada uma dessas fontes gera dados que, analisados em conjunto, revelam padrões que nenhum sistema isolado consegue mostrar.
O TEM (Telecom Expense Management) é uma fonte rica de dados estruturados sobre custos e uso de telecom. O MDM (Mobile Device Management) gera dados sobre dispositivos, apps instalados, consumo de dados e localização e quando todos esses dados chegam a um data lake junto com outras fontes corporativas, as possibilidades de análise se multiplicam.
Uma empresa pode, por exemplo, cruzar dados de consumo de telecom por região com dados de performance de vendas em campo, ou identificar padrões de uso de dispositivos que precedem falhas operacionais e até detectar anomalias de custo que indicam uso indevido.
Perguntas frequentes sobre data lake
O que é data lake?
Qual a diferença entre data lake e data warehouse?
O que é data lakehouse?
O que é schema on read?
O que é data swamp?
Toda empresa precisa de um data lake?
Como o data lake se relaciona com a gestão de dados de TI e telecom?
Data lake resolve o armazenamento, o que vem depois (governança, acesso, análise) é onde a maioria das empresas trava.
Converse com a Enghouse Navita sobre como estruturar essa camada na sua operação.
