Pular para o conteúdo principal

Observabilidade

Toda peça publicada é monitorada automaticamente. Você não configura nada para isso acontecer.

O que a plataforma mostra

SinalResponde a pergunta
MétricasQuantas mensagens passaram? Quanto tempo levaram? Quantas falharam?
LogsO que exatamente aconteceu nesta peça, mensagem a mensagem
EstadoA peça está no ar, subindo ou com falha?
LagQuantas mensagens ainda faltam ser consumidas de cada tópico?

Como usar no dia a dia

O fluxo está saudável?

Olhe o lag dos tópicos da pipeline. Lag perto de zero significa que os Outputs estão acompanhando o Input. Lag crescendo significa que alguma peça está mais lenta do que a que vem antes dela.

Lag crescendo não é perda de dado — as mensagens estão guardadas no tópico esperando. É um aviso de que o ritmo não está se sustentando.

Onde está o gargalo?

Compare o lag peça por peça. A primeira com lag alto é a que está segurando o fluxo. Nela, olhe:

  • Uso de CPU e memória — se estiver no limite, a peça precisa de mais recursos ou de mais cópias.
  • Erros — se estiver reprocessando as mesmas mensagens por falha, o problema é o sistema de destino, não a plataforma.

Por que uma mensagem não chegou?

  1. Confira o contador de mensagens recebidas do Input. Se não subiu, a mensagem não chegou à plataforma — o problema está antes.
  2. Se subiu, siga o caminho peça por peça até achar onde ela parou.
  3. Nos logs da peça onde parou está a razão: credencial inválida, formato inesperado, destino fora do ar.

A mensagem sumiu sem erro nenhum

Alguns Outputs descartam mensagens em silêncio quando elas não têm o que ele precisa:

  • Elasticsearch e GCS em Parquet descartam mensagens com Value vazio ou que não sejam JSON.
  • Um Transform que devolve um slice vazio descarta a mensagem de propósito.

Se o contador de entrada sobe e o de saída não, é quase sempre isso. A página de cada Output descreve o que ele exige da mensagem e o que descarta.

A peça está reiniciando

Reinícios repetidos aparecem no estado da peça. As causas mais comuns:

  • Configuração inválida — credencial errada, tabela de destino que não existe, chave sem índice único. Nesses casos a peça falha logo ao subir e o log traz a mensagem exata.
  • Falta de memória — o lote configurado é maior do que a peça consegue segurar. Reduzir o tamanho do lote resolve.
  • Destino inacessível — rede, firewall ou o sistema de destino fora do ar.

Peça ajuda à Aruna

Em vez de percorrer métricas, logs e eventos por conta própria, você pode simplesmente perguntar:

"A pipeline erp-para-datalake está com problema. O que está acontecendo?"

A Aruna consulta as mesmas fontes desta tela — métricas, logs, eventos dos pods, lag por tópico, estado do ArgoCD — e cruza tudo para responder. Para investigação, costuma ser o caminho mais rápido.

Retenção

Métricas e logs ficam disponíveis por um período limitado. Para guardar histórico além disso, envie os dados para um destino próprio — um índice no Elasticsearch ou um bucket no GCS, por exemplo.