
Gestão de dados mestre em Databricks: padronização, enriquecimento e unificação de dados
Como uma grande empresa do setor logístico reconstruiu sua gestão de dados mestres em Databricks, reduzindo custos em cerca de cinco vezes, com o projeto entregue em apenas 3 meses.

Toda operação logística depende de uma coisa simples de enunciar e difícil de garantir: saber, com certeza, quem é cada cliente, cada mercadoria, cada ativo que passa pela cadeia. Quando essa informação está espalhada em quatro sistemas diferentes, cada um com sua própria versão da verdade, a operação inteira fica exposta a erros de cadastro, retrabalho e decisões tomadas em cima de dados desatualizados.
Foi esse o cenário que uma grande empresa brasileira de logística enfrentava antes de reestruturar sua estratégia de dados mestres (MDM). O resultado do projeto, conduzido pela MG Info, virou um dos primeiros grandes cases da empresa rodando 100% em Databricks.
O desafio
O cadastro de clientes, pessoas jurídicas que contratam os serviços da companhia, é um dos dados mais críticos da operação: ele sustenta desde o atendimento comercial até o planejamento logístico e financeiro.
O problema é que esse cadastro nascia e vivia em múltiplos sistemas diferentes dentro da empresa:
- Um CRM, usado como cadastro principal;
- Um ERP corporativo, que recebia uma sincronização automática do CRM, mas também podia receber cadastros diretos em caso de instabilidade;
- Um sistema específico de uma área operacional, com cadastro autônomo para atender clientes que ainda não haviam chegado ao CRM;
- Um sistema de emissão de documentos fiscais, com sua própria lógica de cadastro antecipado.
Cada um deles podia registrar o mesmo cliente com um endereço diferente, uma razão social escrita de forma diferente, ou informações fiscais divergentes. Sem um processo de unificação, a empresa corria o risco de operar com clientes duplicados e dados inconsistentes entre áreas.
A companhia já resolvia parte desse problema com uma ferramenta de MDM de mercado, mas o custo da licença colaborou para a busca por uma alternativa mais econômica sem abrir mão da robustez do processo.
A solução: reescrever o MDM em Databricks
A resposta foi reconstruir toda a lógica de integração, unificação e qualidade de dados dentro do Databricks, plataforma que a empresa já vinha adotando para sua camada analítica, mas que não possui um módulo nativo de MDM. Isso significou desenhar do zero, com engenharia de dados, tudo o que antes era entregue "pronto" pela ferramenta de mercado.
O fluxo funciona assim:
1. Captura em tempo quase real: toda alteração cadastral em qualquer um dos quatro sistemas de origem gera um evento, que é publicado em um tópico de mensageria (TIBCO EMS) e capturado pelo MDM com poucos segundos de defasagem.
2. Processamento em ciclos: um job recorrente, hoje configurado para rodar a cada 30 minutos por uma questão de custo de processamento, consolida os dados recebidos.
3. Padronização: campos como endereço e classificação fiscal, registrados de formas diferentes em cada sistema, são convertidos para uma linguagem corporativa única.
4. Unificação (matching): como a base é majoritariamente formada por pessoas jurídicas, o CNPJ funciona como campo forte para identificar que dois registros pertencem ao mesmo cliente. É um modelo determinístico, mais simples do que abordagens probabilísticas usadas quando não existe um identificador único e confiável, como ocorre em bases com grande volume de pessoas físicas.
5. Sobrevivência de atributos: quando o mesmo cliente aparece em mais de um sistema com informações diferentes, um ranking de prioridade decide qual dado "sobrevive" para compor o registro único, atributo por atributo. O endereço da nota fiscal eletrônica, por exemplo, tem prioridade por ser considerado a fonte mais confiável para esse campo específico.
6. Enriquecimento: dados incompletos são complementados automaticamente com bases externas, como a base de CEPs dos Correios, e por regras de negócio que preenchem atributos a partir de outros já validados.
Esse fluxo segue uma arquitetura em camadas (bronze, silver e gold), até chegar ao que a equipe chama de Golden Record: a visão única e confiável de cada cliente.
O dado unificado não fica parado. Ele é publicado de volta em uma fila de mensageria própria do MDM, para que os próprios sistemas de origem se sincronizem com a versão consolidada e, também, é disponibilizado para a camada analítica da empresa, alimentando os dashboards de vendas, transporte e relacionamento no Power BI.
Além da visão detalhada de cada cliente, o modelo também entrega duas camadas de agrupamento: uma visão por grupo econômico, usada para planejamento de embarques e logística, e uma visão por segmento, usada por times de marketing e comercial.
Resultados
Redução de custo de aproximadamente 5x na comparação entre a licença da ferramenta de MDM de mercado e o custo de processamento no Databricks.
Projeto de conversão entregue em 3 meses, frente aos cerca de 9 meses que o projeto original havia levado, e abaixo da média de 6 meses que costuma ser necessária para mapear sistemas, modelar dados e construir as regras de um MDM do zero.
Go-live com o processo rodando de forma estável e totalmente automatizada desde então, sem necessidade de intervenção manual além do monitoramento de logs de processamento.
Governança como parte da solução
Um cuidado que fez diferença nesse projeto foi tratar a governança como parte da entrega, não como uma etapa separada. Para cada domínio de dado mestre, a equipe mapeia o ciclo de vida da informação, desde onde ela nasce até quem a consome, e define um responsável de negócio para aquele dado: o que a metodologia DAMA de governança de dados chama de Data Steward, ou curador de dados.
É essa pessoa que garante que o cadastro continue sendo corporativo no dia a dia, e não volte a se fragmentar em soluções paralelas conforme novos sistemas e áreas passam a lidar com aquele dado.
Para saber como podemos ajudar a sua empresa
Entre em contato




