guides

Precio de tokens de input y output: qué cambia la factura

Vea cómo la proporción de input y output cambia el costo, por qué los promedios ocultan riesgo y qué controles importan.

ai-cost pricing planning
Una balanza con una pila azul pequeña de input y una pila coral mayor de output

Los tokens de input son las instrucciones y el contexto enviados al modelo. Los tokens de output forman la respuesta generada. Los proveedores suelen publicar precios separados, por lo que dos aplicaciones con el mismo total de tokens pueden recibir facturas distintas cuando cambia la proporción.

Por qué un precio medio por token puede engañar

Imagine un modelo hipotético con un precio de 2 US$ por millón de tokens de input y 10 US$ por millón de tokens de output. Con 10 millones de tokens totales, el costo cambia según la parte de la respuesta:

Porcentaje de outputTokens de inputTokens de outputTotal
10%9M × 2 US$ = 18 US$1M × 10 US$ = 10 US$28 US$
30%7M × 2 US$ = 14 US$3M × 10 US$ = 30 US$44 US$
50%5M × 2 US$ = 10 US$5M × 10 US$ = 50 US$60 US$

El modelo y el volumen no cambiaron; solo cambió la proporción. Por eso CostUse mantiene input, output y una referencia mixta de 70/30 en columnas separadas.

Qué aumenta el volumen de input

  • Instrucciones de sistema largas enviadas en cada solicitud
  • Historial de conversación reenviado al modelo
  • Documentos recuperados, resultados de búsqueda y respuestas de herramientas
  • Esquemas, ejemplos y reglas de formato extensos
  • Contexto repetido que no cumple las reglas de caché

Reducir input no significa solo acortar el prompt. Revise lo que la aplicación reenvía automáticamente. Un mensaje breve todavía puede formar una solicitud grande cuando transporta historial y contexto recuperado.

Qué aumenta el volumen de output

  • Límites máximos de respuesta demasiado altos
  • Solicitudes de explicaciones largas o varias alternativas
  • Campos estructurados verbosos y texto repetido
  • Ciclos de herramientas que agregan otra respuesta
  • Reintentos que generan todo de nuevo

Defina el límite de respuesta por flujo. Una clasificación, una respuesta de soporte y un informe largo no deben compartir el mismo techo. El límite correcto es el menor que todavía cumple la necesidad del producto.

Dónde encajan la caché y el procesamiento por lotes

Algunos proveedores publican un precio menor para input en caché o procesamiento por lotes. El ahorro depende de condiciones. Compruebe qué tokens son elegibles, la validez de la caché, el volumen mínimo y el plazo de procesamiento. Use el precio estándar como referencia conservadora hasta comprobar la elegibilidad.

Consulte la documentación actual: precios de OpenAI, precios de Claude y precios de Gemini.

Cómo comparar modelos de forma justa

  1. Mida input y output en una muestra de tareas reales.
  2. Use la misma muestra y exigencia de calidad en todos los modelos.
  3. Calcule la proporción esperada y un escenario con mucho output.
  4. Incluya reintentos, caché y servicios que no cobran por token.
  5. Abra la tabla completa de precios y aplique los mismos supuestos a la lista corta.

Conclusión

El total de tokens no explica por sí solo una factura de LLM. Registre en qué lado de la solicitud aparecieron. Con input y output medidos por separado, los controles se vuelven concretos: reducir contexto repetido, limitar respuestas por tarea, evitar reintentos innecesarios y aplicar descuentos solo cuando las condiciones coinciden con producción.