Consultoria

Suporte nível 3 para redes de provedores

Existe um tipo de problema que o suporte interno não resolve porque ele não aparece no gráfico: perda intermitente, latência que sobe sem motivo, rota que some por trinta segundos. Esse é o problema que eu pego.

Sintomas que chegam até mim

  • Cliente reclama de instabilidade, mas o monitoramento mostra tudo verde.
  • Perda de pacote aparece só em determinado horário ou só para determinado destino.
  • A rede converge, mas demora tempo demais e o cliente percebe.
  • Existe loop, assimetria de rota ou MTU quebrada em algum ponto do caminho.
  • O problema foi contornado três vezes e voltou três vezes, porque a causa nunca foi encontrada.

Se pelo menos dois desses itens descrevem a sua rede hoje, o diagnóstico costuma pagar o próprio custo já na primeira correção.

Como o diagnóstico é feito

Captura e leitura de pacote

tcpdump e Wireshark no ponto certo da rede. Retransmissão, MTU, handshake e latência lidos no pacote, não no achismo.

Análise de convergência

Timers de IGP e BGP, BFD, flapping de sessão e o tempo real que a rede leva para se recuperar de cada tipo de falha.

Caminho fim a fim

MTR, traceroute com controle de origem, verificação de assimetria e comparação entre o caminho de ida e o de volta.

Correlação com log e telemetria

Syslog, contadores de interface, NetFlow e SNMP cruzados com a janela exata da reclamação.

Laudo com evidência

Relatório com a causa, a evidência que sustenta a conclusão e a correção recomendada. Sem "reinicie o equipamento e veja se melhora".

Trabalho com
  • Huawei
  • Cisco
  • Juniper
  • Mikrotik
  • Linux

Como o trabalho é conduzido

  1. 1

    Contexto do incidente

    Quando começa, quem sente, o que mudou antes. Boa parte dos casos já estreita aqui.

  2. 2

    Coleta dirigida

    Instrumentação nos pontos que importam, com captura ativa durante a janela do problema.

  3. 3

    Causa raiz

    Hipótese testada contra evidência. Só vira conclusão o que o dado sustenta.

  4. 4

    Correção e prevenção

    Aplicação da correção e ajuste do monitoramento para que o mesmo sintoma seja detectado antes do cliente ligar.

Perguntas frequentes sobre Suporte Nível 3

Atendem incidente pontual ou só contrato mensal?

Os dois. Incidente pontual é cobrado por escopo fechado; quem tem rede grande costuma preferir horas mensais de retaguarda.

Precisam de acesso às configurações da rede?

Para diagnóstico preciso, sim. O acesso pode ser somente leitura em boa parte dos casos, e o escopo do que será acessado fica registrado antes de começar.

Quanto tempo leva um diagnóstico?

Depende da frequência do sintoma. Problema constante costuma fechar em um a dois dias. Problema que aparece uma vez por semana exige instrumentação e espera pela janela.

E se não encontrarem a causa?

O relatório entrega o que foi descartado com evidência, o que restou como hipótese e qual instrumentação falta. Descartar caminho errado também é resultado.

Serviços relacionados

Monitoramento e Observabilidade

Zabbix, SNMP, syslog, NetFlow e Grafana configurados para avisar antes do cliente ligar e apontar onde está o problema.

Operação

BGP e Peering

ASN próprio, peering no IX.br, multi-homing com failover que funciona de verdade e filtros de prefixo com RPKI.

Roteamento

Looking Glass e Diagnóstico

Consulta pública de BGP, ping e traceroute a partir da sua borda, sem expor o roteador e com página de informações do AS.

Diagnóstico

Descreva o cenário de Suporte Nível 3

Conte o que está acontecendo na sua rede hoje. Eu respondo com as perguntas técnicas que faltam e, quando o caso está claro, com uma proposta de escopo fechado.

Respondo em até 1 dia útil. Segunda a sexta, das 9h às 18h (horário de Brasília).