---
data lake

Data lake é um repositório centralizado que armazena grandes volumes de dados no formato bruto, sejam eles estruturados, semiestruturados ou não estruturados, até que alguém precise usá-los. 

A metáfora funciona bem porque é exatamente dessa forma que ele funciona: como um lago que recebe água de vários afluentes, sem filtrá-la antes de entrar. Registros de vendas, logs de sistema, arquivos de áudio, imagens, dados de sensores IoT, faturas de telecom, mensagens de e-mail, tudo entra e fica armazenado no formato original. 

Isso é diferente de como as empresas armazenavam os dados tradicionalmente. No modelo antigo, os dados precisavam ser estruturados e transformados antes de serem armazenados, já com o data lake, a lógica se inverte: primeiro você armazena, depois define como vai usar cada um deles. 

Neste guia, você vai entender o que é, como ele funciona, qual a diferença entre data lake e data warehouse, quando usar cada um e como o data lake se aplica à gestão de dados corporativos. 

data lake

O que é data lake? 

É uma arquitetura de armazenamento de dados que centraliza grandes volumes de informações no formato bruto, sem ter a necessidade de estruturação prévia. 

Esse conceito foi popularizado por James Dixon, CTO da Pentaho, em 2010. Ele usou a analogia do lago para contrastar com o data mart, que ele comparou a uma garrafa de água engarrafada, filtrada, processada e embalada para um uso específico, o lago, em contrapartida, representa o estado natural dos dados, disponível em uma quantidade muito maior e para múltiplos usos futuros. 

Na prática, data lake é um sistema que permite que qualquer tipo de dado entre sem precisar passar por transformação prévia. Isso inclui: 

Dados estruturados: tabelas de banco de dados, planilhas, registros de CRM, faturas. 

Dados semiestruturados: arquivos JSON, XML, logs de aplicação, e-mails. 

Dados não estruturados: imagens, vídeos, áudios, documentos em PDF, dados de sensores. 

A transformação e a estruturação desses dados acontecem no momento do consumo, não na entrada. Esse princípio se chama schema on read e é uma das características centrais do data lake. 

Saiba mais sobre o que é gestão de dados e por que ela é a base de qualquer estratégia de analytics. 

Como o data lake funciona na prática 

O funcionamento segue quatro etapas principais e são elas: 

Ingestão de dados 

Dados de diferentes fontes chegam através de: sistemas transacionais, APIs, dispositivos IoT, arquivos de log, redes sociais, ERPs, CRMs e a  ingestão pode ser em tempo real (streaming) ou em lotes (batch), dependendo da necessidade. 

Nessa etapa, os dados não são transformados, o que significa que eles entram no formato original e ficam armazenados exatamente como foram gerados. 

Armazenamento em zona bruta 

Depois de armazenados, os dados chegam primeiro à zona bruta, também chamada de raw zone ou landing zone e aqui ficam os dados originais, intocados, que servem como fonte de verdade.  

Curadoria e organização por zonas 

A maioria das arquiteturas de data lake organiza os dados em zonas de maturidade: 

Raw zone: são os dados brutos, sem nenhum tipo de processamento.  

Curated zone: dados limpos e validados, que já estão prontos para uso analítico.  

Consumption zone: dados processados e modelados para casos de uso específicos, como relatórios, machine learning ou dashboards. 

Consumo e análise 

Os dados são acessados por engenheiros de dados, cientistas de dados e ferramentas de analytics conforme a necessidade. O schema é aplicado no momento da leitura, isso dá uma flexibilidade para usar os mesmos dados de formas diferentes dependendo da pergunta que está sendo respondida. 

Data lake vs data warehouse: qual a diferença 

A comparação entre data lake e data warehouse é uma das mais frequentes em arquitetura de dados. As duas tecnologias resolvem problemas diferentes e, na maioria das empresas maduras, coexistem. 

Característica Data lake Data warehouse 
Tipo de dado Estruturado, semiestruturado e não estruturado Principalmente estruturado 
Schema Schema on read (aplicado na leitura) Schema on write (aplicado na escrita) 
Custo de armazenamento Baixo Alto 
Velocidade de consulta Mais lenta (depende da transformação) Alta (dados já processados) 
Flexibilidade Alta Menor 
Usuários típicos Cientistas de dados, engenheiros de dados Analistas de negócio, BI 
Casos de uso Machine learning, analytics exploratório, big data Relatórios, dashboards, analytics operacional 

Quando usar data lake 

Deve ser usado para armazenar grandes volumes de dados brutos de múltiplas fontes, especialmente quando o caso de uso ainda não está totalmente definido, é ideal para projetos de machine learning, análise preditiva e exploração de dados. 

Quando usar data warehouse 

É usado para consultas analíticas rápidas sobre dados já estruturados e com casos de uso bem definidos, ideal para relatórios operacionais, dashboards de BI e análises financeiras recorrentes. 

Sua empresa está estruturando uma arquitetura de dados e quer entender como TEM e MDM geram dados que podem ser integrados ao seu data lake? 

Entenda como o Business Intelligence se conecta com a gestão de dados corporativos.

O que é data lakehouse 

Data lakehouse é uma arquitetura mais recente que combina características do data lake e do data warehouse em uma única plataforma. 

O conceito foi popularizado pela Databricks e resolve um problema clássico da arquitetura: os dados brutos são baratos de armazenar, mas difíceis de consultar com performance. Já o data warehouse é rápido, mas caro e inflexível. 

O data lakehouse propõe um meio-termo: armazenamento de baixo custo como o data lake, com as capacidades analíticas e de governança do data warehouse. Plataformas como Delta Lake, Apache Iceberg e Apache Hudi são as tecnologias que viabilizam essa arquitetura. 

Para empresas que estão começando a estruturar sua arquitetura de dados, o data lakehouse tem ganhado espaço como alternativa ao modelo tradicional de dois sistemas separados.

Vantagens e limitações do data lake 

O data lake resolve problemas reais de armazenamento e análise de dados em escala, mas ele também traz desafios que precisam ser considerados antes da implementação. Conhecer os dois lados é o que separa uma decisão bem fundamentada de uma adoção por tendência.

Vantagens do data lake 

Flexibilidade de dados

Como falamos anteriormente, ele aceita qualquer tipo de dado, de qualquer fonte, sem necessidade de transformação prévia. Isso permite capturar dados que podem ser úteis no futuro, mesmo sem saber exatamente como.

Custo de armazenamento baixo

O data lake usa armazenamento de objetos, como Amazon S3, Azure Data Lake Storage ou Google Cloud Storage, que é muito mais barato do que bancos de dados relacionais.

Escala

Consegue lidar com volumes de dados que seriam inviáveis em um data warehouse tradicional.

Suporte a machine learning e IA

Dados não estruturados, como imagens, textos e áudios, são insumos essenciais para modelos de machine learning e o data lake armazena esses dados de forma nativa.

Limitações do data lake 

Risco de data swamp

Sem uma governança adequada, o data vira um “pântano de dados”, onde ninguém sabe o que está armazenado, os dados acabam ficando desatualizados e a qualidade cai.

Performance de consulta

Consultas sobre dados brutos são mais lentas do que consultas em um data warehouse com dados já processados.

Complexidade de governança

Catalogar, documentar e controlar o acesso a dados em um data lake exige processos e ferramentas específicas.

Curva de aprendizado

As equipes que vêm de um ambiente de data warehouse precisam adaptar ferramentas, processos e habilidades para trabalhar com data lake.

Saiba mais sobre como a análise preditiva usa dados armazenados em data lakes para gerar modelos de previsão. 

Quando usar data lake na sua empresa 

O fato é: nem toda empresa precisa de um data lake. A decisão depende do volume de dados, da maturidade da equipe de dados e dos casos de uso que a empresa quer suportar. 

Faz sentido considerar um data lake quando: 

A empresa gera ou recebe grandes volumes de dados de múltiplas fontes com formatos diferentes, nesses casos há necessidade de projetos de machine learning ou análise preditiva que precisam de dados históricos em volume. A equipe tem engenheiros de dados com capacidade de estruturar e governar o ambiente e o custo de armazenamento de dados estruturados em data warehouse está se tornando proibitivo. 

Pode não fazer sentido quando

A empresa ainda está nos primeiros passos da maturidade em dados, quando os casos de uso de analytics são bem definidos e se baseiam em dados estruturados, não há equipe técnica com experiência em engenharia de dados e o volume de dados é gerenciável com ferramentas de BI tradicionais. 

Os dados que o data lake armazena são a matéria-prima da análise preditiva. Como transformar esse volume em previsões que a operação realmente usa.

Data lake e gestão de dados corporativos 

Para empresas com operações complexas de TI e telecom, o data lake tem um papel específico: centralizar os dados que hoje estão fragmentados em múltiplos sistemas. 

Faturas de telecom, registros de uso de dispositivos, logs de acesso, dados de localização de equipes em campo, históricos de contratos. Cada uma dessas fontes gera dados que, analisados em conjunto, revelam padrões que nenhum sistema isolado consegue mostrar. 

O TEM (Telecom Expense Management) é uma fonte rica de dados estruturados sobre custos e uso de telecom. O MDM (Mobile Device Management) gera dados sobre dispositivos, apps instalados, consumo de dados e localização e quando todos esses dados chegam a um data lake junto com outras fontes corporativas, as possibilidades de análise se multiplicam. 

Uma empresa pode, por exemplo, cruzar dados de consumo de telecom por região com dados de performance de vendas em campo, ou identificar padrões de uso de dispositivos que precedem falhas operacionais e até detectar anomalias de custo que indicam uso indevido.

Perguntas frequentes sobre data lake 

O que é data lake?  

Data lake é um repositório centralizado que armazena grandes volumes de dados no formato bruto, sem necessidade de estruturação prévia. Ele aceita: dados estruturados, semiestruturados e não estruturados de múltiplas fontes, e aplica a estrutura no momento do consumo, não na entrada. 

Qual a diferença entre data lake e data warehouse?  

O data lake armazena dados brutos de qualquer tipo e aplica o schema na leitura e o data warehouse armazena dados já estruturados e processados, com schema definido na escrita. O data lake é mais flexível e barato, mas mais complexo de consultar e o data warehouse é mais rápido para consultas analíticas, mas mais caro e menos flexível. 

O que é data lakehouse?  

Data lakehouse é uma arquitetura que combina o armazenamento de baixo custo do data lake com as capacidades analíticas e de governança do data warehouse, como: plataformas como Delta Lake, Apache Iceberg e Apache Hudi viabilizam essa arquitetura. 

O que é schema on read?  

Schema on read é o princípio pelo qual a estrutura dos dados é definida no momento da leitura, não da escrita. No data lake, os dados entram no formato bruto e a estrutura é aplicada quando alguém vai consumi-los, isso contrasta com o schema on write do data warehouse, onde os dados precisam ser estruturados antes de entrar. 

O que é data swamp?  

Data swamp é o resultado de um data lake mal-governado, quando não há catalogação, documentação e controle de qualidade dos dados, o lake vira um pântano onde ninguém sabe o que está armazenado e os dados perdem utilidade. Por isso pontuamos que a governança de dados é o principal fator que diferencia um data lake funcional de um data swamp. 

Toda empresa precisa de um data lake?  

Não, o data lake faz sentido para empresas com grandes volumes de dados de múltiplas fontes, equipes técnicas com experiência em engenharia de dados e casos de uso que incluem machine learning ou análise exploratória. Empresas com menor volume e casos de uso bem definidos podem resolver suas necessidades com ferramentas de BI e um data warehouse. 

Como o data lake se relaciona com a gestão de dados de TI e telecom?  

Dados gerados por sistemas de TEM e MDM, como faturas, logs de dispositivos, dados de consumo e registros de localização, podem ser centralizados em um data lake junto com outras fontes corporativas, isso permite análises cruzadas que revelam padrões e oportunidades de otimização que nenhum sistema isolado consegue identificar. 

Data lake resolve o armazenamento, o que vem depois (governança, acesso, análise) é onde a maioria das empresas trava.

Converse com a Enghouse Navita sobre como estruturar essa camada na sua operação.