Observabilidade
Toda peça publicada é monitorada automaticamente. Você não configura nada para isso acontecer.
O que a plataforma mostra
| Sinal | Responde a pergunta |
|---|---|
| Métricas | Quantas mensagens passaram? Quanto tempo levaram? Quantas falharam? |
| Logs | O que exatamente aconteceu nesta peça, mensagem a mensagem |
| Estado | A peça está no ar, subindo ou com falha? |
| Lag | Quantas mensagens ainda faltam ser consumidas de cada tópico? |
Como usar no dia a dia
O fluxo está saudável?
Olhe o lag dos tópicos da pipeline. Lag perto de zero significa que os Outputs estão acompanhando o Input. Lag crescendo significa que alguma peça está mais lenta do que a que vem antes dela.
Lag crescendo não é perda de dado — as mensagens estão guardadas no tópico esperando. É um aviso de que o ritmo não está se sustentando.
Onde está o gargalo?
Compare o lag peça por peça. A primeira com lag alto é a que está segurando o fluxo. Nela, olhe:
- Uso de CPU e memória — se estiver no limite, a peça precisa de mais recursos ou de mais cópias.
- Erros — se estiver reprocessando as mesmas mensagens por falha, o problema é o sistema de destino, não a plataforma.
Por que uma mensagem não chegou?
- Confira o contador de mensagens recebidas do Input. Se não subiu, a mensagem não chegou à plataforma — o problema está antes.
- Se subiu, siga o caminho peça por peça até achar onde ela parou.
- Nos logs da peça onde parou está a razão: credencial inválida, formato inesperado, destino fora do ar.
A mensagem sumiu sem erro nenhum
Alguns Outputs descartam mensagens em silêncio quando elas não têm o que ele precisa:
- Elasticsearch e GCS em Parquet descartam mensagens com Value vazio ou que não sejam JSON.
- Um Transform que devolve um slice vazio descarta a mensagem de propósito.
Se o contador de entrada sobe e o de saída não, é quase sempre isso. A página de cada Output descreve o que ele exige da mensagem e o que descarta.
A peça está reiniciando
Reinícios repetidos aparecem no estado da peça. As causas mais comuns:
- Configuração inválida — credencial errada, tabela de destino que não existe, chave sem índice único. Nesses casos a peça falha logo ao subir e o log traz a mensagem exata.
- Falta de memória — o lote configurado é maior do que a peça consegue segurar. Reduzir o tamanho do lote resolve.
- Destino inacessível — rede, firewall ou o sistema de destino fora do ar.
Peça ajuda à Aruna
Em vez de percorrer métricas, logs e eventos por conta própria, você pode simplesmente perguntar:
"A pipeline
erp-para-datalakeestá com problema. O que está acontecendo?"
A Aruna consulta as mesmas fontes desta tela — métricas, logs, eventos dos pods, lag por tópico, estado do ArgoCD — e cruza tudo para responder. Para investigação, costuma ser o caminho mais rápido.
Retenção
Métricas e logs ficam disponíveis por um período limitado. Para guardar histórico além disso, envie os dados para um destino próprio — um índice no Elasticsearch ou um bucket no GCS, por exemplo.