# Protocolo: Qual o impacto do número de réplicas de um modelo KServe na latência de inferência sob carga?

Este protocolo mede como a latência de inferência de um modelo servido pelo KServe varia conforme o número de réplicas é alterado em um cluster Kubernetes. O objetivo é identificar o ponto de saturação e o ganho real de escalabilidade horizontal.

Pergunta: Como a latência de inferência de um modelo KServe varia com o aumento do número de réplicas sob carga constante?

Hipótese: Aumentar o número de réplicas de um modelo KServe reduz a latência média de inferência sob carga até um limite, após o qual o ganho se estabiliza ou desaparece.

- KServe Official Docs https://kserve.github.io/website
- Kubernetes Docs https://kubernetes.io/docs
- Prometheus Docs https://prometheus.io/docs

Fonte: https://ulc.upnetix.com.br/labs/protocolo-qual-o-impacto-do-numero-de-replicas-de-um-modelo-kserve-na-latencia-de-inferencia-sob-carga/ · Upnetix Learning Center · uso com citação obrigatória.
