Captura e leitura de pacote
tcpdump e Wireshark no ponto certo da rede. Retransmissão, MTU, handshake e latência lidos no pacote, não no achismo.
Consultoria
Existe um tipo de problema que o suporte interno não resolve porque ele não aparece no gráfico: perda intermitente, latência que sobe sem motivo, rota que some por trinta segundos. Esse é o problema que eu pego.
Se pelo menos dois desses itens descrevem a sua rede hoje, o diagnóstico costuma pagar o próprio custo já na primeira correção.
tcpdump e Wireshark no ponto certo da rede. Retransmissão, MTU, handshake e latência lidos no pacote, não no achismo.
Timers de IGP e BGP, BFD, flapping de sessão e o tempo real que a rede leva para se recuperar de cada tipo de falha.
MTR, traceroute com controle de origem, verificação de assimetria e comparação entre o caminho de ida e o de volta.
Syslog, contadores de interface, NetFlow e SNMP cruzados com a janela exata da reclamação.
Relatório com a causa, a evidência que sustenta a conclusão e a correção recomendada. Sem "reinicie o equipamento e veja se melhora".
Quando começa, quem sente, o que mudou antes. Boa parte dos casos já estreita aqui.
Instrumentação nos pontos que importam, com captura ativa durante a janela do problema.
Hipótese testada contra evidência. Só vira conclusão o que o dado sustenta.
Aplicação da correção e ajuste do monitoramento para que o mesmo sintoma seja detectado antes do cliente ligar.
Os dois. Incidente pontual é cobrado por escopo fechado; quem tem rede grande costuma preferir horas mensais de retaguarda.
Para diagnóstico preciso, sim. O acesso pode ser somente leitura em boa parte dos casos, e o escopo do que será acessado fica registrado antes de começar.
Depende da frequência do sintoma. Problema constante costuma fechar em um a dois dias. Problema que aparece uma vez por semana exige instrumentação e espera pela janela.
O relatório entrega o que foi descartado com evidência, o que restou como hipótese e qual instrumentação falta. Descartar caminho errado também é resultado.
Zabbix, SNMP, syslog, NetFlow e Grafana configurados para avisar antes do cliente ligar e apontar onde está o problema.
OperaçãoASN próprio, peering no IX.br, multi-homing com failover que funciona de verdade e filtros de prefixo com RPKI.
RoteamentoConsulta pública de BGP, ping e traceroute a partir da sua borda, sem expor o roteador e com página de informações do AS.
DiagnósticoConte o que está acontecendo na sua rede hoje. Eu respondo com as perguntas técnicas que faltam e, quando o caso está claro, com uma proposta de escopo fechado.
Respondo em até 1 dia útil. Segunda a sexta, das 9h às 18h (horário de Brasília).