guides
Cómo estimar el costo de una API de LLM antes de construir
Convierta precios por token, volumen de solicitudes, longitud de respuestas y caché en un presupuesto mensual comprobable.
Respuesta breve: estime la factura de una API de LLM con cuatro datos medidos: solicitudes por día, tokens por solicitud, proporción de input y output y precio actual del proveedor por millón de tokens. Calcule un mes de referencia y pruebe por separado más tráfico, respuestas largas y menor reutilización de caché.
Fórmula del costo mensual de una API de LLM
Para un modelo con precios distintos de input y output, use:
Costo mensual = (tokens mensuales de input ÷ 1.000.000 × precio de input) + (tokens mensuales de output ÷ 1.000.000 × precio de output).
El total mensual proviene de solicitudes por día × tokens por solicitud × días de cobro. Después, la proporción divide ese volumen entre input y output. Este cálculo es más fiable que un “precio medio por token”, ya que ambas tarifas pueden ser muy diferentes.
Ejemplo reproducible
Imagine un servicio hipotético con 1.000 solicitudes diarias, una media de 2.000 tokens totales por solicitud y funcionamiento durante 30 días. El resultado es 60 millones de tokens. Si los registros indican 70% de input y 30% de output, el mes tendrá 42 millones de tokens de input y 18 millones de output.
Con precios hipotéticos de 2 US$ por millón de tokens de input y 10 US$ por millón de tokens de output:
- Input: 42 × 2 US$ = 84 US$
- Output: 18 × 10 US$ = 180 US$
- Mes de referencia: 264 US$
- Prueba con diez veces más tráfico: 2.640 US$
El ejemplo es deliberadamente hipotético. Sustituya ambas tarifas por los valores actuales de la fuente oficial. La tabla de precios de modelos de IA aplica la misma referencia 70/30 al catálogo, mientras que cada página permite introducir su proporción real.
Mida la carga antes de elegir el modelo
- Separe prompts y respuestas reales. Las muestras del flujo previsto son más útiles que un conteo genérico de palabras.
- Cuente cada token repetido. Instrucciones de sistema, historial, fragmentos recuperados, resultados de herramientas y salidas estructuradas forman parte de la solicitud.
- Divida input y output. Chat, extracción y generación larga no suelen compartir la misma proporción.
- Use varias bandas de tráfico. Calcule el mes esperado, un mes tranquilo y un pico.
- Registre fuente y fecha. OpenAI, Anthropic y Google mantienen páginas oficiales propias, y los precios o modos de cobro pueden cambiar.
Qué no incluye la fórmula simple
Los tokens son solo una parte del presupuesto de producción. Añada almacenamiento, recuperación de datos, reranking, búsqueda web, procesamiento de imagen o audio, observabilidad, reintentos y red cuando la arquitectura los utilice. Compruebe también caché, procesamiento por lotes, prioridad, contexto largo, región y modelos ajustados.
Fuentes oficiales: precios de la API de OpenAI, precios de Claude y precios de la API de Gemini.
Lista para cerrar el presupuesto
- Use muestras similares a producción, no un solo prompt corto.
- Calcule input y output por separado.
- Incluya reintentos y llamadas fallidas.
- Aplique el ahorro de caché solo al tráfico elegible.
- Reserve margen para cambios de tráfico y longitud de respuesta.
- Compruebe la fuente pública antes de aprobar el gasto.
Siguiente paso
Empiece con un flujo medido y un solo mes, no con todo el producto. Introduzca solicitudes, tokens y proporción de input y output en la calculadora correspondiente. Cuando la referencia sea fiable, compare modelos alternativos con la misma carga y repita el cálculo cuando cambie el precio o el comportamiento del producto.