Upnetix Labs · protocolo de experimento
Protocolo: Qual o impacto do intervalo de scraping do Prometheus na latência de coleta de métricas e uso de CPU do servidor monitorado?
Este protocolo avalia como diferentes intervalos de scraping do Prometheus afetam a latência de coleta de métricas e o consumo de CPU do servidor alvo. O objetivo é mensurar o equilíbrio entre frequência de coleta e sobrecarga no ambiente.

Como o ajuste do intervalo de scraping do Prometheus influencia a latência de coleta de métricas e o consumo de CPU do servidor monitorado?
Hipótese
Intervalos de scraping menores aumentam a latência de coleta e o uso de CPU no servidor monitorado.
Variáveis
| Independentes (o que varia) | intervalo_de_scraping (ex: 5s, 15s, 30s, 60s) |
|---|---|
| Dependentes (o que se mede) | latencia_coleta (ms); cpu_servidor_monitorado (%) |
| Controladas (o que fica fixo) | versao_prometheus; hardware_servidor; exporter_utilizado (node_exporter); carga_aplicada (idle); rede (mesma sub-rede) |
Ambiente
Servidor Linux dedicado rodando node_exporter. Prometheus instalado em máquina separada na mesma sub-rede. Ferramentas: Prometheus (para scraping), node_exporter (para métricas), PromQL (para medir latência), utilitário top ou pidstat (para CPU).
Procedimento
- Configurar node_exporter no servidor alvo
Instale e inicie o node_exporter.
consulte a documentação oficial do node_exporter - Configurar Prometheus para coletar métricas do node_exporter
Adicione o job do node_exporter no prometheus.yml.
consulte a documentação oficial do Prometheus - Definir intervalo de scraping
Ajuste o parâmetro scrape_interval no job do node_exporter para o valor desejado.
scrape_interval: 5s (exemplo) - Reiniciar Prometheus para aplicar configuração
Reinicie o serviço Prometheus.
systemctl restart prometheus - Aguardar estabilização
Espere 5 minutos após cada alteração para estabilizar a coleta.
- Medir latência de coleta
Utilize PromQL para medir o tempo entre o timestamp da métrica e o horário de coleta.
consulte a documentação de PromQL - Medir uso de CPU do node_exporter
Monitore o processo node_exporter usando top ou pidstat durante 10 minutos.
- Repetir para cada intervalo de scraping
Repita o procedimento para cada valor de scrape_interval definido.
Planilha de coleta
| intervalo_de_scraping (segundos) | latencia_coleta_media (milissegundos) | latencia_coleta_p95 (milissegundos) | cpu_media_node_exporter (porcentagem) |
|---|---|---|---|
| EXEMPLO: 15, 120, 200, 1.5 | |||
Repetições recomendadas: 5. Baixe a planilha vazia em CSV: colunas prontas.
Análise
Calcule a média e o percentil 95 das latências de coleta para cada intervalo. Compare o uso médio de CPU do node_exporter entre os intervalos. Interprete se há aumento significativo de latência ou CPU em intervalos menores.
Critérios de decisão
- Latência de coleta deve permanecer abaixo de 500ms para uso recomendado.
- Uso de CPU do node_exporter não deve ultrapassar 5% em idle.
Fontes de erro e mitigação
- Variações de rede podem afetar a latência; execute em rede local dedicada.
- Picos de CPU por outros processos podem distorcer resultados; mantenha o servidor idle.
- Sincronize relógios dos servidores para precisão dos timestamps.
