guides

Como estimar o custo de uma API de LLM antes de construir

Transforme preços por token, volume de requisições, tamanho das respostas e cache em um orçamento mensal testável.

ai-cost pricing planning
Volumes de tokens divididos em vários cenários de orçamento ao lado de uma calculadora

Resposta curta: estime a fatura de uma API de LLM com quatro dados medidos: requisições por dia, tokens por requisição, proporção de input e output e preço atual do provedor por milhão de tokens. Calcule um mês de referência e teste, separadamente, mais tráfego, respostas maiores e menor reaproveitamento de cache.

Fórmula do custo mensal de uma API de LLM

Para um modelo com preços distintos de input e output, use:

Custo mensal = (tokens mensais de input ÷ 1.000.000 × preço de input) + (tokens mensais de output ÷ 1.000.000 × preço de output).

O total mensal vem de requisições por dia × tokens por requisição × dias de cobrança. Depois, a proporção divide esse volume entre input e output. O cálculo é mais confiável do que usar um “preço médio por token”, pois as duas tarifas podem ser bem diferentes.

Exemplo reproduzível

Imagine um serviço hipotético com 1.000 requisições por dia, média de 2.000 tokens totais por requisição e funcionamento durante 30 dias. O resultado é 60 milhões de tokens. Se os registros indicarem 70% de input e 30% de output, o mês terá 42 milhões de tokens de input e 18 milhões de output.

Com preços hipotéticos de US$ 2 por milhão de tokens de input e US$ 10 por milhão de tokens de output:

  • Input: 42 × US$ 2 = US$ 84
  • Output: 18 × US$ 10 = US$ 180
  • Mês de referência: US$ 264
  • Teste com dez vezes mais tráfego: US$ 2.640

O exemplo é propositalmente hipotético. Troque as duas tarifas pelos valores atuais da fonte oficial. A tabela de preços de modelos de IA aplica a mesma referência 70/30 ao catálogo, enquanto cada página permite informar a sua proporção real.

Meça a carga antes de escolher o modelo

  1. Separe prompts e respostas reais. Amostras do fluxo pretendido são mais úteis do que uma contagem genérica de palavras.
  2. Conte todo token repetido. Instruções de sistema, histórico da conversa, trechos recuperados, resultados de ferramentas e saídas estruturadas entram na requisição.
  3. Divida input e output. Chat, extração e geração longa raramente têm a mesma proporção.
  4. Use mais de uma faixa de tráfego. Calcule o mês esperado, um mês fraco e um pico.
  5. Registre fonte e data. OpenAI, Anthropic e Google mantêm páginas oficiais próprias, e preços ou modos de cobrança podem mudar.

O que a fórmula simples não inclui

Tokens são apenas uma parte do orçamento de produção. Some armazenamento, recuperação de dados, reranking, busca na web, processamento de imagem ou áudio, observabilidade, novas tentativas e rede quando a arquitetura usar esses recursos. Verifique também cache, processamento em lote, prioridade, contexto longo, região e modelos ajustados.

Fontes oficiais: preços da API OpenAI, preços do Claude e preços da API Gemini.

Checklist para fechar o orçamento

  • Use amostras parecidas com a produção, não um único prompt curto.
  • Calcule input e output separadamente.
  • Inclua novas tentativas e chamadas com falha.
  • Aplique economia de cache apenas ao tráfego elegível.
  • Reserve margem para crescimento de tráfego e respostas.
  • Confira a fonte pública antes de aprovar o gasto.

Próximo passo

Comece por um fluxo medido e um único mês, não pelo produto inteiro. Informe requisições, tokens e proporção de input e output na calculadora correspondente. Quando a referência estiver confiável, compare modelos alternativos com a mesma carga e repita o cálculo sempre que o preço ou o comportamento do produto mudar.