Consultoria

Monitoramento e observabilidade de rede

Monitoramento não serve para provar que a rede caiu. Serve para avisar antes do cliente ligar e para dizer onde está o problema quando ele acontece. A maior parte das instalações que eu encontro não faz nenhuma das duas coisas.

Sinais de que o monitoramento não funciona

  • O time desligou as notificações porque o sistema alerta demais e acerta de menos.
  • A queda foi descoberta pelo cliente no WhatsApp, não pelo alerta.
  • Existem dashboards bonitos que ninguém abre há meses.
  • Não dá para responder quem consumiu a banda que saturou o link ontem às 21h.
  • O syslog dos equipamentos vai para o vazio, então não existe histórico para investigar.

Se pelo menos dois desses itens descrevem a sua rede hoje, o diagnóstico costuma pagar o próprio custo já na primeira correção.

O que entra no escopo

Coleta que cobre a rede inteira

SNMP em roteadores, switches e OLTs, com template por modelo e descoberta automática de interface e porta PON.

Alerta com critério

Limiar por tipo de elemento, dependência entre itens e supressão em cascata. Um enlace que cai gera um alerta, não quarenta.

Análise de tráfego

NetFlow ou sFlow respondendo quem consumiu o quê, para onde e em qual horário.

Log centralizado

Syslog agregado, com retenção definida e busca útil na hora do incidente.

Painéis por público

Uma visão para o NOC, uma para a diretoria e uma para o time de campo. Cada uma responde perguntas diferentes.

Trabalho com
  • Zabbix
  • Grafana
  • Prometheus
  • Elastic
  • LibreNMS

Como o trabalho é conduzido

  1. 1

    Inventário dos elementos

    O que existe na rede, o que já é monitorado e o que está invisível hoje.

  2. 2

    Modelagem do que importa

    Definição dos indicadores que realmente antecipam falha, antes de instalar qualquer coisa.

  3. 3

    Implantação e ajuste fino

    Coleta, alertas e painéis, seguidos de duas a quatro semanas de calibragem contra falso positivo.

  4. 4

    Treinamento do NOC

    A equipe interna precisa saber ler o painel e agir. Sem isso, o projeto vira enfeite.

Perguntas frequentes sobre Monitoramento e Observabilidade

Zabbix ou Prometheus?

Zabbix se encaixa melhor em rede de provedor, porque SNMP, descoberta de interface e dependência entre itens são nativos. Prometheus brilha em aplicação e container. Em muitos clientes os dois convivem, cada um no seu papel.

Dá para monitorar OLT e ONT do assinante?

Dá. Potência óptica, alarme de PON, quantidade de ONTs por porta e queda em massa entram como itens monitorados, com alerta separado do resto da rede.

Vocês usam a nossa instalação ou montam do zero?

Se já existe Zabbix, prefiro sanear o que está lá: costuma ser mais rápido e preserva o histórico. Reinstalação só quando a base atual não tem conserto.

Quanto tempo até o alerta ficar confiável?

A coleta sobe em dias. Alerta confiável exige de duas a quatro semanas de ajuste contra falso positivo, e essa etapa faz parte do escopo.

Serviços relacionados

Suporte Nível 3

Perda intermitente, latência sem causa aparente e rota que some. Diagnóstico com captura de pacote e laudo com evidência.

Suporte

GPON e FTTH

Dimensionamento de OLT Huawei MA5800, padronização de line e service profile, provisionamento em escala e integração com ERP.

Fibra

Looking Glass e Diagnóstico

Consulta pública de BGP, ping e traceroute a partir da sua borda, sem expor o roteador e com página de informações do AS.

Diagnóstico

Descreva o cenário de Monitoramento e Observabilidade

Conte o que está acontecendo na sua rede hoje. Eu respondo com as perguntas técnicas que faltam e, quando o caso está claro, com uma proposta de escopo fechado.

Respondo em até 1 dia útil. Segunda a sexta, das 9h às 18h (horário de Brasília).