Lakehouse

Para sustentar e evoluir o ecossistema de dados corporativo, projetamos uma arquitetura com ingestão contínua, processamento escalável e consumo governado.

A solução centraliza o dado na arquitetura medalhão, automatiza limpeza e enriquecimento, e disponibiliza informação com segurança e alta performance para BI, Analytics e caso de uso de IA, acelerando decisão orientada por dado.

Meu papel

Fui responsável por montar o time do projeto e gerir o cronograma junto a fornecedores e especialistas externos, do desenho da arquitetura até a entrada em operação. Não é o código de um só, é a coordenação de gente diferente concordando sobre uma arquitetura só.

Resultado

Métricas do projeto

Volume e escala

+16 TB

Armazenados

400 GB

De crescimento por mês

+85M

Eventos processados por dia

+40

Datasets catalogados

Impacto

4x

Agilidade em queries

-35%

Redução no custo de cloud

65%

Redução no tempo de processamento

Arquitetura

Como o dado flui, do bruto ao consumo

Fluxo da arquitetura de dados do case Lakehouse Ingestao continua alimenta a camada bronze, passa por limpeza e enriquecimento ate a camada prata e a camada ouro, com catalogo e governanca em paralelo, e chega ao consumo analitico via Athena e QuickSight. Ingestão EKS + Kinesis Firehose Bronze S3 dado bruto Silver Lambda + EMR Serverless Gold S3 pronto p/ consumo Consumo Athena + QuickSight Orquestração EventBridge + Step Functions Arquivamento Glacier Metadados DynamoDB Catálogo Glue Data Catalog Governança Glue + descoberta
Arquitetura medalhão: bronze recebe o dado bruto, prata limpa e enriquece, ouro entrega pronto para consumo. Orquestração, catálogo e arquivamento correm em paralelo.

Capacidades

Funcionalidades

Ingestão e buffering

EKSKinesis Firehose

ETL e enriquecimento escalável

EMR Serverless

Limpeza e qualidade

Lambda

Metadados

DynamoDB

Catálogo, governança e descoberta

GlueData Catalog

Orquestração e automação

EventBridgeStep Functions

Políticas de arquivamento

Glacier

Consumo analítico

AthenaQuickSight

Integração com o ecossistema atual

RDSEKS DispatchFila

Consequência

Da arquitetura ao produto

Com o lakehouse maduro, o passo seguinte foi expor esse dado para quem não escreve consulta técnica. Construímos uma plataforma de consulta em linguagem natural sobre os dados centralizados: a pessoa pergunta em português, a plataforma traduz isso em consulta sobre a base e devolve resposta, sem exigir conhecimento técnico de quem pergunta.

Como funciona a consulta em linguagem natural sobre o lakehouse A pessoa marca as fontes que quer cruzar, escreve a pergunta em português em vez de escrever SQL, a plataforma consulta o lakehouse e devolve o resultado já cruzado entre as fontes selecionadas. FONTES Sistemas internos Bases de dados APIs externas Planilhas e arquivos PERGUNTA EM LINGUAGEM NATURAL Quais clientes cresceram mais neste trimestre? O QUE NINGUÉM PRECISA ESCREVER SELECT c.nome, SUM(v.total) FROM clientes c JOIN vendas v ... LAKEHOUSE dado já tratado RESPOSTA Resultado QUATRO FONTES CRUZADAS
A camada de IA fica entre a pergunta e o lakehouse. Quem pergunta escolhe as fontes e escreve em português, sem precisar saber que existe uma consulta técnica por trás.

Consulta

Busca em linguagem natural

Pergunta em português sobre qualquer dado da operação, sem escrever consulta nem conhecer a estrutura da base por trás.

Integração

Múltiplas fontes, um ambiente só

Conecta sistema, API e base de dados diferentes num único ponto de consulta centralizado.

Decisão

Análise e visualização

Dashboard e análise de alta performance, para reduzir o tempo entre pergunta e decisão.

Nenhum dado catalogado sozinho vira decisão melhor. O que muda o jogo é a governança por trás dele, o que permite alguém confiar no dado que está consumindo sem precisar perguntar de onde ele veio.

Na sua operação, quem decide com dado sabe de onde ele vem, ou confia porque não tem outra opção?

Todos os cases