Protocolo: Qual a latência média de resposta da API Claude Messages em diferentes tamanhos de prompt?
Este protocolo responde qual o impacto do tamanho do prompt na latência de resposta da API Claude Messages. A pessoa vai medir o tempo de resposta da API variando o tamanho do prompt de entrada.

Roteiro para estudo em ambiente de laboratório ou de teste. Execute apenas em equipamentos, redes e contas que você tenha autorização para usar, com backup e homologação próprios. Comandos podem causar indisponibilidade ou perda de dados. Software e marcas citados pertencem aos seus titulares. Termos de Uso.
Como o tempo de resposta da API Claude Messages varia com o aumento do tamanho do prompt de entrada?
Hipótese
A latência de resposta da API Claude Messages aumenta conforme o tamanho do prompt de entrada cresce.
Variáveis
| Independentes (o que varia) | Tamanho do prompt de entrada (em tokens) |
|---|---|
| Dependentes (o que se mede) | Latência de resposta da API (em milissegundos) |
| Controladas (o que fica fixo) | Modelo Claude utilizado; Tipo de conteúdo (apenas texto); Rede de acesso; Chave de API; Endpoint da API; Parâmetros do request |
Ambiente
Rede estável (preferencialmente cabeada ou fibra dedicada como a da Upnetix), máquina Linux ou Windows com Python 3.10+, SDK oficial Claude Python instalado, ferramenta de medição de tempo (time/perf_counter do Python), prompts gerados com tamanhos controlados. Não usar proxies ou VPNs.
Procedimento
- Gerar prompts
Criar arquivos de texto com diferentes tamanhos de prompt: 100, 1.000, 10.000, 50.000 e 100.000 tokens (usar texto repetido para padronizar).
- Configurar script
Escrever script Python usando o SDK Claude para enviar o prompt ao endpoint /v1/messages, medindo o tempo de resposta com time.perf_counter().
- Executar requisições
Para cada tamanho de prompt, enviar 5 requisições em sequência, registrando o tempo de resposta individual.
python medir_latencia_claude.py --prompt arquivo.txt --repeticoes 5 - Registrar resultados
Preencher planilha com tamanho do prompt, tempo de resposta e horário de cada requisição.
Planilha de coleta
| tamanho_prompt_tokens (tokens) | latencia_ms (milissegundos) | horario_envio (ISO 8601) | modelo (string) | EXEMPLO (1000, 850, 2024-06-20T14:00:00Z, claude-sonnet-5, EXEMPLO) |
|---|---|---|---|---|
| 10000, 850, 2024-06-20T14:00:00Z, claude-sonnet-5, EXEMPLO | ||||
Repetições recomendadas: 5. Baixe a planilha vazia em CSV: colunas prontas.
Análise
Calcular média, mediana e desvio padrão da latência para cada tamanho de prompt. Plotar gráfico de latência versus tamanho do prompt. Comparar os resultados para identificar tendências.
Critérios de decisão
- Latência média deve ser inferior a 5.000 ms para prompts de até 10.000 tokens.
- Latência não deve variar mais de 20% entre repetições para o mesmo tamanho de prompt.
- Se houver falha de resposta, repetir a medição.
Fontes de erro e mitigação
- Variação de rede: executar testes em horários diferentes e descartar outliers extremos.
- Limite de uso da API: garantir que o rate limit não foi atingido.
- Cache de prompt: usar prompts diferentes ou desabilitar cache se possível.
Referências
- Claude API Docs · Platform.claude (platform.claude.com)
- Python time/perf_counter · Python Software Foundation (docs.python.org)
- Publicado
- 13/09/2026
- Última revisão
- 13/09/2026
- Versão do conteúdo
- 1.0
- Referências
- 2 oficiais
- Revisão técnica
- redação e revisão por IA, URLs conferidas na publicação
- Status
- Atual
