Upnetix Labs · protocolo de experimento
Protocolo: Qual o impacto da redundância de fontes de energia no tempo de recuperação de servidores em um data center?
Este protocolo avalia quanto tempo um servidor leva para voltar ao ar após uma queda de energia, comparando cenários com e sem redundância de fontes. A pessoa vai medir o tempo de recuperação usando ferramentas livres de monitoramento e logs do sistema.

A redundância de fontes de energia reduz o tempo de recuperação dos servidores após uma interrupção?
Hipótese
Servidores conectados a fontes de energia redundantes apresentam menor tempo de recuperação após falha de energia em relação a servidores sem redundância.
Variáveis
| Independentes (o que varia) | presença de redundância de energia (sim/não) |
|---|---|
| Dependentes (o que se mede) | tempo de recuperação do servidor (segundos) |
| Controladas (o que fica fixo) | modelo do servidor; carga de trabalho (idle); temperatura ambiente; versão do sistema operacional; configuração elétrica |
Ambiente
Dois servidores idênticos, um conectado a uma única fonte de energia e outro a duas fontes independentes (UPS distintas). Monitoramento por Zabbix (zabbix-agent instalado em ambos). Registro de eventos de desligamento e inicialização via logs do sistema (journalctl ou syslog).
Procedimento
- Preparação
Verifique que ambos os servidores estão operando normalmente e registrados no Zabbix.
- Simulação de falha
Desligue a energia da fonte principal de ambos os servidores simultaneamente. No servidor redundante, a segunda fonte deve assumir automaticamente.
Desligamento físico (acionamento do disjuntor ou retirada do cabo) - Registro de eventos
Anote o horário exato em que cada servidor fica indisponível no Zabbix e nos logs.
- Restauração da energia
Restabeleça a energia após 30 segundos.
- Medição do tempo de recuperação
Registre o tempo até cada servidor voltar a responder no Zabbix e nos logs.
- Repetição
Repita o experimento cinco vezes para cada cenário (com e sem redundância).
Planilha de coleta
| cenario (sim/não) | repeticao (número) | tempo_recuperacao_servidor (segundos) | timestamp_falha (ISO8601) | timestamp_recuperacao (ISO8601) |
|---|---|---|---|---|
| EXEMPLO: sim,1,12,2024-06-01T14:00:00Z,2024-06-01T14:00:12Z | ||||
Repetições recomendadas: 5. Baixe a planilha vazia em CSV: colunas prontas.
Análise
Calcule a média, mediana e desvio padrão do tempo de recuperação para cada cenário. Compare os resultados entre servidores com e sem redundância. Analise se a diferença é consistente e significativa.
Critérios de decisão
- A redundância é considerada eficaz se o tempo médio de recuperação for ao menos 30% menor no cenário redundante.
- Resultados inconsistentes ou diferenças inferiores a 10% indicam necessidade de revisão do ambiente ou metodologia.
Fontes de erro e mitigação
- Variações na resposta do Zabbix devido a polling interval; mitigue configurando o mesmo intervalo para ambos.
- Diferenças no tempo de boot do sistema operacional; use imagens idênticas e atualizadas.
- Interferência de outros processos; execute o teste em horários de baixa demanda.
