Arquiteturas de dados que sustentam operação real
Lukas Rozado · Engenheiro de Dados · Azure/AWS · PostgreSQL · Python
Projeto e implemento arquiteturas de dados escaláveis e pipelines resilientes. Trabalho com ingestão de alta performance, integração em nuvem e bancos otimizados pra ambiente crítico. Um dos pipelines roda com >99,9% de uptime em produção.
Projetos
Mostrando todos os projetos
Enterprise Crypto Data Lake: Ingestão Multi-Conta: Arquitetura de auditoria financeira contínua para dezenas de contas institucionais numa exchange de criptoativos, com backfill histórico desde a criação de cada conta. O núcleo é um rate limiter compartilhado entre processos que lê, em cada resposta HTTP, o header oficial de cota consumida (nunca uma estimativa por contagem de chamadas), o que elimina o padrão de bloqueio de IP que existia antes dessa arquitetura. Uma camada Bronze obrigatória guarda o payload bruto em JSONB e alimenta um modelo Medallion completo; a carga roda via COPY nativo do PostgreSQL, tabela temporária e UPSERT, sustentando dezenas de milhões de registros por ano com credenciais isoladas em Azure Key Vault.
Unified Banking Ledger Platform: Plataforma que unificou dois pipelines financeiros separados (banking/PIX e reconciliação de ledger) num só sistema, rodando de minuto em minuto, persistente e orquestrado. Cada domínio de dado (contas, chaves PIX, transações PIX, parceiros, movimentos de ledger, mesa OTC) tem fila produtor-consumidor própria, cursor e marca d'água isolados, e descarrega em lotes de 5 mil registros direto no banco. Endpoints sem filtro nativo de delta usam early-exit: leem do topo e param sozinhos assim que N páginas seguidas já cruzaram a marca d'água salva, sem precisar revarrer o histórico inteiro a cada execução. Saldo de parceiro roda em duas estratégias, delta a cada 15 minutos pra quem movimentou recente e full diário pra todo mundo. Um auditor de ciclo de vida separado corrige status de transação PIX que muda depois de capturada, sem re-escanear nada além do necessário.
High-Concurrency Financial Reconciliation Pipeline: Pipeline híbrido pra dado financeiro de alta transacionalidade: uma via de API quase em tempo real, guiada por high-water mark, e uma via diária que baixa CSV e faz anti-join contra o banco pra recuperar lacuna invisível à API (offset drift de paginação). A extração roda em arquitetura producer-consumer com fila limitada, e o checkpoint fica por página, não por dia, pra retomar do ponto exato de interrupção depois de qualquer falha. O backfill histórico roda num processo procedural estritamente sequencial, isolado da ingestão em produção.
OTC Desk Reconciliation Pipeline: ETL diário que ingere planilha operacional mantida por humanos (sem chave primária estável, com linhas reordenadas, apagadas e recriadas na origem) pra um data warehouse relacional, resolvendo nome de contraparte digitado de forma inconsistente via fuzzy matching com limiar de 92% de similaridade. Em vez de upsert incremental, a carga usa Full Replace (truncate + reload integral) a cada execução. Deduplicação roda por hash SHA-256 sobre a assinatura da transação mais um contador de ocorrência (nonce), preservando de propósito splits legítimos idênticos em vez de colapsá-los. Uma camada de blindagem de schema extrai estritamente as colunas financeiras esperadas e ignora qualquer coluna nova que a área de negócio adicione sem aviso.
Fiscal Document Consolidation Pipeline: Pipeline mensal incremental que baixa pares XML+PDF de documentos fiscais via API de um provedor de documentos fiscais, resolve a empresa dona de cada documento por substring match do identificador tributário no conteúdo bruto decodificado, sem depender de tag explícita de referência, e consolida a saída num ZIP geral mais um ZIP por empresa, organizados por tipo de documento e data.
Unified Multi-Chain Ledger Integrator: Pipeline resiliente pra consolidar transações em dezenas de blockchains e contratos (EVM e Solana), lendo direto do nó via RPC crua (eth_getLogs filtrado por tópico de evento) em vez de depender de indexador de terceiro. Faixas de bloco densas demais pra API se dividem recursivamente até caber. O diferencial é o motor de auto-reconciliação: compara, faixa por faixa, a contagem de eventos on-chain contra o banco, cura sozinho qualquer divergência apagando e re-extraindo o lote, e fecha com uma checagem contábil final comparando o supply total on-chain contra o supply líquido calculado no PostgreSQL.
Institutional Digital Asset Custody Integrator: Orquestrador de ingestão pra custódia institucional de criptoativos, com cada workspace regional isolado, credencial própria via Key Vault e duas esteiras paralelas: transação e snapshot de saldo por vault. Uma máquina de estado alterna sozinha entre backfill completo e modo incremental, com sobreposição de 5 minutos na virada pra nunca perder registro na borda da janela. Um auditor separado, mais barato, revarre só as transações ainda em status não-terminal, a partir do registro pendente mais antigo, e faz UPSERT no que mudou, sem re-escanear o histórico inteiro pra pegar uma transação que demorou a fechar.
BaaS & Financial Settlement Data Sink: Pipeline de integração programática que centraliza dados de liquidação financeira multibancos (Banking-as-a-Service), desenhado pra garantir segurança máxima na comunicação entre sistemas isolados, com autenticação corporativa via Azure Active Directory e tokens. Antes de qualquer COPY nativo do PostgreSQL, toda carga passa por uma camada de sanitização dedicada; um motor de flattening transforma logs aninhados em colunas de auditoria consultáveis direto, sem join; e o script de backfill histórico roda isolado do checkpoint de produção, sem risco de reprocessar ou corromper o incremental em andamento.
Pipeline Preditivo no Competitivo e ML Engine: Motor algorítmico end-to-end orquestrado para trading quantitativo. A arquitetura engloba web scraping massivo diário, normalização rigorosa e uma Feature Engine otimizada que alimenta a 'Model Factory' com 42 variáveis estruturais. O sistema gerencia autonomamente o retreinamento (backtesting) e a inferência ao vivo, enviando sinais de alta precisão para estratégias de hedge e dashboards.
LCK Spring 2024 Players Statistics: Dataset público e verificável com estatísticas completas do split Spring 2024 da LCK (League of Legends Champions Korea): jogadores, campeões e partidas organizados em três tabelas relacionais. Coleta via web scraping com BeautifulSoup e Selenium sobre o Gol.gg, normalização rigorosa de métricas e organização pronta para EDA, visualização e modelagem preditiva. Publicado no Kaggle com nota máxima de usabilidade.