Precios de IA · Eficiencia de agentes

¿Qué son los tokens de IA? Precios de 2026, ejemplos de costo y cómo QZX puede reducir el consumo de los agentes

Los tokens de IA son las unidades que usan los modelos de lenguaje para procesar y generar texto. En un agente de programación, los prompts, las definiciones de herramientas, los resultados de terminal, los reintentos, el razonamiento y un historial creciente pueden convertir una tarea pequeña en decenas o cientos de miles de tokens.

Por Alejandro Sánchez, creador de QZX 15 min de lectura
Tokens de entrada y salida de IA atraviesan un ciclo de herramientas de agente optimizado con QZX.
QZX no cambia el precio de los tokens del proveedor. Puede ayudar a que un agente obtenga contexto útil mediante menos llamadas predecibles y multiplataforma.

En un chat individual, el costo puede ser minúsculo. En un agente de programación que inspecciona archivos, ejecuta comandos, lee resultados, corrige errores y vuelve a enviar un historial de conversación cada vez mayor, la misma tarea puede consumir decenas o cientos de miles de tokens.

QZX no cambia los precios de un proveedor de IA, no comprime prompts ni abarata los modelos por sí mismo. Su posible ventaja es otra: puede entregar a los agentes información más rica y predecible mediante menos llamadas de herramientas multiplataforma, reduciendo rondas de exploración innecesarias.

¿Qué es un token de IA?

Un token es un fragmento de texto reconocido por el tokenizador de un modelo. Puede ser:

  • Una palabra completa.
  • Parte de una palabra.
  • Un signo de puntuación.
  • Un espacio.
  • Un número.
  • Un fragmento de código fuente.

La cantidad exacta depende del modelo, el idioma, el formato y el contenido. La prosa en inglés suele requerir menos tokens que un texto con palabras poco frecuentes, identificadores, datos codificados o código fuente.

Como cálculo aproximado para el inglés, un token equivale a unos cuatro caracteres o tres cuartos de una palabra. Google documenta un rango parecido de entre 60 y 80 palabras inglesas por cada 100 tokens. Son estimaciones para planificar, no conversiones garantizadas. Consulta las guías oficiales de tokens de OpenAI y Google.

¿Cuántas palabras son 1.000 tokens?

Tokens Palabras aproximadas en inglés
10075
1.000750
10.0007.500
100.00075.000
1.000.000750.000

El código, JSON, las tablas, las rutas de archivos, los logs y los idiomas distintos del inglés pueden producir proporciones muy diferentes.

Tokens de entrada, salida, caché y razonamiento

Una solicitud a un modelo puede contener varias categorías facturables.

Tokens de entrada

Los tokens de entrada incluyen la información enviada al modelo:

  • La petición del usuario.
  • Las instrucciones del sistema y del desarrollador.
  • El historial de la conversación.
  • El código fuente.
  • Las descripciones y los esquemas de herramientas.
  • Los resultados de llamadas anteriores.
  • Los archivos o documentos recuperados.

En un flujo de agente, la entrada puede crecer después de cada paso porque el modelo recibe mensajes y resultados nuevos.

Tokens de salida

Los tokens de salida son generados por el modelo. Pueden incluir:

  • La respuesta final.
  • Código fuente.
  • Argumentos de llamadas a herramientas.
  • JSON estructurado.
  • Mensajes intermedios del agente.
  • Explicaciones o resúmenes.

Los proveedores suelen cobrar más por los tokens de salida que por los de entrada.

Tokens de entrada en caché

Algunos proveedores ofrecen descuentos para prefijos estables que ya fueron procesados. La caché puede reducir el costo de enviar repetidamente:

  • Instrucciones de sistema extensas.
  • Definiciones de herramientas.
  • Documentación de un repositorio.
  • Prefijos reutilizados de una conversación.
  • Documentos de referencia grandes.

La caché no hace gratuito todo el contexto repetido. La elegibilidad, caducidad, escritura de caché y los descuentos cambian según el proveedor.

Tokens de razonamiento o pensamiento

Algunos modelos usan tokens internos adicionales mientras resuelven una tarea. Según el proveedor y el modelo, pueden aparecer por separado o formar parte de la facturación de salida.

Consumo relacionado con herramientas

La búsqueda alojada, la ejecución de código, la recuperación de documentos y otras herramientas gestionadas por el proveedor pueden tener tarifas propias. Aunque un comando local de terminal no tenga una tarifa del proveedor, los mensajes que rodean ese comando sí consumen tokens.

OpenAI distingue categorías como entrada, entrada en caché, salida y razonamiento. Google también documenta tokens de prompt, respuesta, pensamiento, contenido en caché y uso de herramientas.

Cómo calcular el costo de los tokens de IA

Un cálculo simplificado es:

costo de entrada =
    tokens de entrada ÷ 1.000.000 × precio de entrada

costo de salida =
    tokens de salida ÷ 1.000.000 × precio de salida

costo estimado de la solicitud =
    costo de entrada
    + costo de salida
    + costos de caché
    + costos de razonamiento
    + tarifas de herramientas

Por ejemplo, supón que una solicitud utiliza:

  • 100.000 tokens de entrada.
  • 10.000 tokens de salida.
  • Una tarifa de entrada de $2,50 por millón de tokens.
  • Una tarifa de salida de $15 por millón de tokens.

El cálculo es:

Entrada: 100.000 ÷ 1.000.000 × $2,50 = $0,25
Salida:   10.000 ÷ 1.000.000 × $15,00 = $0,15

Total: $0,40

La métrica más útil en producción es:

costo por tarea completada correctamente =
    costo total de intentos, reintentos y rondas
    ÷ cantidad de tareas completadas correctamente

Un modelo con un precio anunciado más bajo puede terminar siendo más caro si exige más reintentos, prompts más extensos, supervisión adicional o más llamadas a herramientas.

Precios de tokens de IA en 2026

La siguiente tabla muestra precios estándar seleccionados disponibles el 25 de julio de 2026. Los valores están expresados en dólares estadounidenses por cada millón de tokens.

La columna de ejemplo representa una carga de 100.000 tokens de entrada y 10.000 tokens de salida, sin caché, tarifas de herramientas, recargos por contexto largo ni descuentos por lotes.

Proveedor y modelo Entrada por 1 M Salida por 1 M Carga de ejemplo
OpenAI GPT-5.6 Sol$5,00$30,00$0,80
OpenAI GPT-5.6 Terra$2,50$15,00$0,40
OpenAI GPT-5.6 Luna$1,00$6,00$0,16
Anthropic Claude Fable 5$10,00$50,00$1,50
Anthropic Claude Opus 5$5,00$25,00$0,75
Anthropic Claude Sonnet 5, tarifa promocional$2,00$10,00$0,30
Anthropic Claude Haiku 4.5$1,00$5,00$0,15
Google Gemini 3.6 Flash$1,50$7,50$0,225
Google Gemini 3.5 Flash-Lite$0,30$2,50$0,055

Las cifras de OpenAI son tarifas estándar de contexto corto; el contexto largo y los modos Batch, Flex y Priority pueden tener otros precios. La tarifa promocional de Claude Sonnet 5 está programada hasta el 31 de agosto de 2026; después, el precio publicado pasa a $3 por millón de tokens de entrada y $15 por millón de salida. En Gemini, el precio de salida incluye los tokens de pensamiento cuando corresponde.

Los precios pueden cambiar. Comprueba siempre las páginas oficiales vigentes de OpenAI, Anthropic y Google antes de tomar decisiones de compra o arquitectura.

Por qué los agentes de IA pueden consumir tantos tokens

Un chatbot normal puede responder con una sola solicitud al modelo. Un agente autónomo suele operar en un ciclo:

  1. Lee la petición y el contexto disponible.
  2. Decide qué herramienta o comando utilizar.
  3. Genera la llamada de herramienta.
  4. Recibe el resultado.
  5. Procesa de nuevo la conversación.
  6. Decide la siguiente acción.
  7. Repite el proceso hasta completar la tarea.

Un agente de programación podría empezar preguntando:

¿Dónde estoy?
¿Qué archivos hay aquí?
¿Qué tamaño tiene el repositorio?
¿Qué archivos se modificaron recientemente?
¿Qué directorios debo ignorar?
¿Dónde están los archivos de Python?

Cada respuesta puede ser pequeña, pero cada nueva ronda puede exigir que el modelo vuelva a procesar parte o todo lo siguiente:

  • La tarea original.
  • Las instrucciones del sistema.
  • Las definiciones de herramientas.
  • Los mensajes anteriores.
  • La salida previa de terminal.
  • Las reglas del repositorio.
  • La información recién descubierta.

El SDK de agentes de OpenAI, por ejemplo, agrega el consumo de llamadas al modelo, herramientas y transferencias entre agentes. El historial de una sesión también puede volver a enviarse como entrada en solicitudes posteriores.

Este descubrimiento repetido tiene un costo que va más allá del comando de terminal.

El impuesto de descubrimiento en terminal

Los comandos tradicionales de shell son excelentes para personas que ya conocen:

  • El sistema operativo.
  • El shell.
  • La sintaxis del comando.
  • La estructura del directorio actual.
  • Qué combinación de utilidades producirá el resultado deseado.

Un agente de IA puede tener que descubrir esos detalles poco a poco.

Una secuencia típica de exploración podría usar comandos equivalentes a:

pwd
ls
find
du
stat
sort
head

El agente también puede necesitar sintaxis diferente para Windows, Linux, macOS, PowerShell, Bash u otros entornos.

La ejecución directa del comando puede ser rápida y gratuita. La parte costosa puede estar en el ciclo que lo rodea:

  • Seleccionar el comando.
  • Escapar sus argumentos.
  • Corregir sintaxis incompatible.
  • Interpretar una salida sin estructura.
  • Recibir resultados excesivos.
  • Ejecutar otro comando para conseguir el contexto que falta.
  • Volver a enviar el historial al modelo.

QZX está diseñado para ofrecer una interfaz de comandos consistente para operaciones comunes del sistema y los archivos en las plataformas compatibles.

Cómo QZX puede reducir el consumo de tokens de un agente

Considera este comando de QZX:

qzx currentDir --details --limit 10 --json

En lugar de devolver únicamente la ruta actual, el modo detallado puede ofrecer una vista más amplia que incluya información como:

  • El directorio actual.
  • Una vista previa inmediata del directorio.
  • Análisis recursivo.
  • Resúmenes por extensión.
  • Archivos grandes.
  • Archivos modificados recientemente.
  • Información de permisos.
  • Información de capacidad.

La opción --limit restringe el resultado, mientras que --json entrega al agente una salida estructurada y predecible. Consulta la referencia completa de currentDir.

Para la tarea adecuada, una sola llamada puede reemplazar varias rondas de inspección.

Eso no significa que siempre deba utilizarse el modo detallado. Si el agente solo necesita la ruta actual, conviene el comando más pequeño:

qzx currentDir --json

El objetivo no es devolver la mayor cantidad posible de información. Es entregar el resultado suficiente más pequeño para la tarea.

Encontrar archivos sin una larga secuencia de exploración

Un agente que necesita archivos de Python puede usar:

qzx findFiles . "*.py" -r --json

Un agente que busca marcadores de trabajo pendiente puede usar:

qzx findText "TODO" src -r --json

Los comandos de búsqueda de QZX admiten filtros para restringir resultados por patrón, profundidad, tipo, tamaño, fecha, contenido, exclusiones, orden y límite. Filtrar antes de devolver la salida suele ser mejor que enviar miles de rutas al modelo y pedirle que las filtre después. Consulta las referencias de findFiles y findText.

Por qué puede importar una salida predecible

La salida del shell suele variar según:

  • El sistema operativo.
  • El shell.
  • La configuración regional.
  • La versión de la utilidad instalada.
  • El ancho de la terminal.
  • La configuración del usuario.
  • Los permisos.
  • Los aliases y las opciones de formato.

Un agente puede necesitar razonamiento adicional o rutas alternativas para interpretar esas variaciones.

QZX utiliza una presentación legible para humanos de manera predeterminada y puede devolver objetos JSON completos para consumidores programáticos. Sus respuestas estructuradas incluyen campos como success y message, lo que ofrece a los agentes un contrato más estable que un texto arbitrario de terminal.

El JSON estructurado no es automáticamente más pequeño que una salida humana. Su valor está en la previsibilidad.

La previsibilidad puede reducir:

  • Errores de interpretación.
  • Ramas específicas de cada plataforma.
  • Llamadas posteriores de aclaración.
  • Comandos ejecutados solo para confirmar un resultado anterior.
  • Intentos de recuperación después de una sintaxis mal formada.

Un ejemplo hipotético de ahorro de tokens

Supón que un agente procesa aproximadamente 8.000 tokens de entrada durante cada ronda de decisión porque la solicitud incluye instrucciones, definiciones de herramientas, historial reciente y contexto del repositorio.

Flujo A: cinco rondas de descubrimiento

5 rondas × 8.000 tokens de entrada = 40.000 tokens de entrada

Flujo B: dos rondas ricas en información

2 rondas × 8.000 tokens de entrada = 16.000 tokens de entrada

Diferencia

40.000 − 16.000 = 24.000 tokens de entrada menos

Con un precio de entrada de $2,50 por millón de tokens:

24.000 ÷ 1.000.000 × $2,50 = $0,06 ahorrados por tarea

A escala:

Tareas completadas Diferencia ilustrativa de costo de entrada
1.000$60
10.000$600
100.000$6.000

Es una ilustración, no un benchmark de QZX ni una garantía de ahorro. El resultado real depende del tamaño del contexto, la caché, el modelo, la longitud de salida, los reintentos, el comportamiento del comando y si QZX reduce de verdad la cantidad de rondas para la tarea medida.

Cuándo QZX puede no ahorrar tokens

QZX no abarata todas las solicitudes ni es automáticamente más eficiente en todas las situaciones.

Un comando nativo mínimo puede ser más eficiente cuando:

  • El agente ya conoce la plataforma y la sintaxis exactas.
  • Solo necesita un valor pequeño.
  • El resultado nativo ya es predecible.
  • No hace falta interpretarlo después.
  • QZX devolvería información que el agente no necesita.

Por ejemplo, solicitar un análisis detallado del directorio cuando solo hace falta la ruta actual produciría una salida innecesaria.

El JSON también puede consumir más tokens que una respuesta humana breve porque contiene nombres de campos, puntuación y estructura repetida.

Utiliza el comando y las opciones más acotadas que respondan la pregunta real.

Nueve formas prácticas de reducir el costo de tokens de un agente

1. Mide tareas completas, no prompts aislados

Registra cada solicitud, reintento, corrección, llamada y fallo necesarios para terminar el trabajo.

2. Reduce rondas innecesarias entre modelo y herramienta

Prefiere un comando con el alcance adecuado a varios comandos que revelen el contexto poco a poco.

3. Limita la salida de los comandos

Usa filtros, límites de profundidad, exclusiones y topes de resultados. No envíes miles de rutas o líneas de log irrelevantes al modelo.

4. Pide salida estructurada cuando evite reintentos

JSON es valioso cuando hace confiable la interpretación, no simplemente porque esté disponible.

5. Evita solicitar detalles demasiado pronto

Empieza con el resultado suficiente más pequeño. Añade detalles solo cuando la siguiente decisión los necesite.

6. Reutiliza contexto estable mediante la caché del proveedor

Las instrucciones, definiciones de herramientas y documentación estable pueden ser adecuadas para la caché cuando el proveedor la admita.

7. Retira resultados obsoletos del contexto activo

Una lista de archivos que ya cumplió su propósito no tiene que permanecer necesariamente en cada solicitud posterior.

8. Envía las decisiones sencillas a modelos menos costosos

Un modelo potente puede ser adecuado para arquitectura o depuración difícil; uno más pequeño puede bastar para clasificación, extracción o validación rutinaria.

9. Optimiza para completar correctamente

Un modelo barato que falla varias veces puede costar más que uno caro que termina bien en menos rondas.

Cómo evaluar QZX de manera justa

Un benchmark útil debe comparar ejecuciones completas del agente bajo las mismas condiciones.

Mantén constantes:

  • El modelo y su configuración.
  • Las instrucciones del sistema.
  • El contexto inicial de la conversación.
  • El repositorio o entorno de prueba.
  • La definición de la tarea.
  • Los criterios de éxito.
  • La cantidad y el tipo de herramientas disponibles.

Compara un flujo con comandos nativos y otro con QZX, y registra:

  • Cantidad de solicitudes al modelo.
  • Tokens de entrada.
  • Tokens de entrada en caché.
  • Tokens de salida.
  • Tokens de razonamiento o pensamiento.
  • Llamadas a herramientas.
  • Comandos fallidos.
  • Reintentos.
  • Latencia total.
  • Tasa de finalización correcta.
  • Costo total.
  • Costo por tarea completada correctamente.

Ejecuta la misma tarea varias veces. El comportamiento del agente puede cambiar entre ejecuciones, por lo que una sola prueba no es evidencia confiable.

El resultado más sólido no es:

La salida del comando QZX usó menos tokens.

Es:

El flujo con QZX completó correctamente la misma tarea
con menos tokens totales, menos reintentos o menor costo.

QZX es una interfaz de comandos, no un sandbox

Los comandos QZX se ejecutan localmente con los permisos del usuario actual. Una salida estructurada no convierte un comando en seguro, y la consistencia multiplataforma no reemplaza los controles de autorización.

Los agentes todavía deben operar con:

  • Cuentas restringidas del sistema operativo.
  • Políticas explícitas de comandos.
  • Límites del sistema de archivos.
  • Aprobaciones para acciones destructivas.
  • Registros y trazabilidad.
  • Sandboxing externo cuando se ejecute contenido no confiable.

QZX apunta a Windows, Linux y macOS, pero la evidencia y el comportamiento pueden variar por plataforma. Revisa los comandos que planeas utilizar en la página de compatibilidad de QZX y verifícalos en tu entorno de producción.

Prueba QZX

Instala el paquete publicado actual:

python -m pip install qzx

Empieza con una salida legible para personas:

qzx currentDir

Solicita salida estructurada para un agente:

qzx currentDir --json

Solicita una vista limitada y rica en información:

qzx currentDir --details --limit 10 --json

Después ejecuta la misma tarea real con QZX y sin él. Mide solicitudes al modelo, llamadas, tokens, errores y costo por finalización correcta en lugar de asumir que uno de los dos flujos será mejor.

Explora el catálogo de comandos de QZX y mira la salida de QZX en acción. QZX se distribuye como un paquete de línea de comandos Python de código abierto en PyPI.

Preguntas frecuentes

¿Qué es un token en inteligencia artificial?

Un token es una unidad de texto que procesa un modelo de lenguaje. Puede representar una palabra, parte de una palabra, puntuación, espacios, un número o un fragmento de código.

¿Cuántas palabras son 1.000 tokens?

Una aproximación frecuente para la prosa en inglés es de unas 750 palabras. La cantidad real cambia según el modelo, el idioma, el formato y el contenido.

¿Cuánto cuesta un millón de tokens de IA?

No existe un precio universal. Cada proveedor cobra según el modelo, la categoría de entrada o salida, el tamaño del contexto, la caché, el nivel de procesamiento y las herramientas utilizadas.

¿Los tokens de entrada y salida cuestan lo mismo?

Normalmente no. En muchas API actuales, los tokens de salida cuestan considerablemente más que los de entrada.

¿Por qué los agentes de IA usan más tokens que un chat normal?

Los agentes suelen realizar varios ciclos modelo-herramienta-modelo. Cada ronda puede incluir las instrucciones originales, las definiciones de herramientas, el historial y los resultados anteriores.

¿QZX reduce el precio por token del proveedor?

No. QZX no modifica los precios de OpenAI, Anthropic, Google ni de otros proveedores. Solo puede reducir el consumo total cuando ayuda al agente a completar la misma tarea con menos pasos o con pasos más confiables.

¿JSON siempre reduce el consumo de tokens?

No. JSON puede ser más largo que un texto breve. Es útil cuando su estructura predecible evita errores de interpretación, reintentos o llamadas adicionales.

¿QZX reemplaza Bash, PowerShell o los comandos nativos?

No. Los comandos nativos pueden ser la opción más pequeña y rápida para muchas tareas. QZX ofrece una interfaz consistente y estructurada que puede ser útil para agentes y automatización multiplataforma.

¿QZX garantiza un menor costo para los agentes de IA?

No. El ahorro debe medirse para cada carga de trabajo. Algunas tareas se benefician de comandos QZX ricos en información; otras ya son óptimas con un solo comando nativo.

¿QZX es un sandbox de seguridad para agentes autónomos?

No. QZX se ejecuta con los permisos del usuario actual. El sandboxing, la autorización, el aislamiento y las políticas de aprobación deben implementarse por separado.

Fuentes primarias y lecturas adicionales