Entrar ou criar conta

Upnetix Labs · protocolo de experimento

Protocolo: Qual o impacto da redundância de fontes de energia no tempo de recuperação de servidores em um data center?

Este protocolo avalia quanto tempo um servidor leva para voltar ao ar após uma queda de energia, comparando cenários com e sem redundância de fontes. A pessoa vai medir o tempo de recuperação usando ferramentas livres de monitoramento e logs do sistema.

Data center do zero: projeto físico, energia, refrigeração e operação
Ligado ao treinamento Data center do zero: projeto físico, energia, refrigeração e operação
Protocolo, não resultado. Esta página descreve como medir. Os números que valem são os que você obtém na sua bancada, seguindo o método abaixo. Nenhum valor aqui é resultado de medição da Upnetix.
Pergunta

A redundância de fontes de energia reduz o tempo de recuperação dos servidores após uma interrupção?

Hipótese

Servidores conectados a fontes de energia redundantes apresentam menor tempo de recuperação após falha de energia em relação a servidores sem redundância.

Variáveis

Independentes (o que varia)presença de redundância de energia (sim/não)
Dependentes (o que se mede)tempo de recuperação do servidor (segundos)
Controladas (o que fica fixo)modelo do servidor; carga de trabalho (idle); temperatura ambiente; versão do sistema operacional; configuração elétrica

Ambiente

Dois servidores idênticos, um conectado a uma única fonte de energia e outro a duas fontes independentes (UPS distintas). Monitoramento por Zabbix (zabbix-agent instalado em ambos). Registro de eventos de desligamento e inicialização via logs do sistema (journalctl ou syslog).

Procedimento

  1. Preparação

    Verifique que ambos os servidores estão operando normalmente e registrados no Zabbix.

  2. Simulação de falha

    Desligue a energia da fonte principal de ambos os servidores simultaneamente. No servidor redundante, a segunda fonte deve assumir automaticamente.

    Desligamento físico (acionamento do disjuntor ou retirada do cabo)
  3. Registro de eventos

    Anote o horário exato em que cada servidor fica indisponível no Zabbix e nos logs.

  4. Restauração da energia

    Restabeleça a energia após 30 segundos.

  5. Medição do tempo de recuperação

    Registre o tempo até cada servidor voltar a responder no Zabbix e nos logs.

  6. Repetição

    Repita o experimento cinco vezes para cada cenário (com e sem redundância).

Planilha de coleta

cenario (sim/não)repeticao (número)tempo_recuperacao_servidor (segundos)timestamp_falha (ISO8601)timestamp_recuperacao (ISO8601)
EXEMPLO: sim,1,12,2024-06-01T14:00:00Z,2024-06-01T14:00:12Z

Repetições recomendadas: 5. Baixe a planilha vazia em CSV: colunas prontas.

Análise

Calcule a média, mediana e desvio padrão do tempo de recuperação para cada cenário. Compare os resultados entre servidores com e sem redundância. Analise se a diferença é consistente e significativa.

Critérios de decisão

  • A redundância é considerada eficaz se o tempo médio de recuperação for ao menos 30% menor no cenário redundante.
  • Resultados inconsistentes ou diferenças inferiores a 10% indicam necessidade de revisão do ambiente ou metodologia.

Fontes de erro e mitigação

  • Variações na resposta do Zabbix devido a polling interval; mitigue configurando o mesmo intervalo para ambos.
  • Diferenças no tempo de boot do sistema operacional; use imagens idênticas e atualizadas.
  • Interferência de outros processos; execute o teste em horários de baixa demanda.