Costos de Tokens en Agentes de IA: Lo Que Realmente Pagas
Medido en 157.670 turnos reales de Claude Code, la salida visible es el 12% de la factura, las lecturas de caché son el 48%, y la mayoría de los tokens que pagas nunca se te muestran.

Todo el mundo optimiza cuánto escribe el modelo. Escribir es cerca de un octavo de la factura.
La respuesta corta
El dinero está en el contexto que reenvías en cada turno, y en el razonamiento por el que se te cobra pero nunca ves. Instrumentamos una estación de trabajo y registramos el objeto usage en 157.670 respuestas deduplicadas de la API de Claude Code entre el 26 de abril y el 26 de julio de 2026, congeladas a las 08:25 UTC del último día. Registrado, no estimado.
En ese corpus, la salida visible representa el 12,1% del gasto en Opus 4.8. Las lecturas de caché se llevan el 48%. Las escrituras de caché se llevan el 39%, y la entrada genuinamente sin caché es el margen de error, por debajo del 1%.
Eso es una estación de trabajo ejecutando un tipo de trabajo, así que trata las proporciones como una forma más que como una constante universal. Lo que importa es la forma, y esa forma no es lo que a la mayoría le dicen que debe optimizar.

Por lo que realmente se te cobra
Un turno de agente no es un mensaje de chat. Cada turno reenvía todo el contexto de trabajo, el prompt del sistema, las definiciones de herramientas, los archivos ya leídos, y toda la transcripción previa. Si ese mecanismo es nuevo para ti, lo explicamos en cómo funciona realmente la ventana de contexto.
La documentación de prompt caching de Anthropic, verificada el 26 de julio de 2026, tarifica esos reenvíos en tres niveles distintos. Una escritura de caché con TTL de 5 minutos cuesta 1,25 veces la tarifa base de entrada, una escritura con TTL de 1 hora cuesta 2 veces, y una lectura de caché cuesta 0,1 veces. Establecer un breakpoint es gratis, según la misma documentación, así que solo se te cobra por los tokens realmente escritos o leídos.
Aquí está la anatomía de una factura real, usando nuestras proporciones medidas.
| Tipo de token | Proporción de la factura medida | Tarifa vs. entrada base | Qué es realmente |
|---|---|---|---|
| Lecturas de caché | 48% | 0,1x | contexto reenviado y encontrado en un turno posterior |
| Escrituras de caché | 39% | 1,25x a 5 min, 2x a 1 hora | contexto almacenado para que el siguiente turno lo lea barato |
| Salida | 12,1% | 5x en Opus 5 | texto visible más razonamiento facturado |
| Entrada sin caché | menos del 1% | 1x | el raro fallo en frío |
Lee esa tabla dos veces. El ítem más barato por token es la línea más grande de la factura, porque el volumen le gana a la tarifa.

La mayoría de tus tokens de salida son invisibles

Los tokens de razonamiento se facturan como salida a la tarifa estándar de salida. La documentación de extended thinking de Anthropic afirma claramente que se te cobra por la totalidad de los tokens de pensamiento mientras la API devuelve un resumen condensado, así que el número que pagas y el número que puedes leer son números distintos.
El corolario importante, según la documentación de adaptive thinking de Anthropic, es que el pensamiento facturado no cambia con la configuración display. Apagar el panel de razonamiento hace tu terminal más silenciosa y tu factura idéntica.
Podemos ver la brecha desde afuera. En turnos de solo prosa, nuestro corpus registra 2,7 caracteres visibles por token de salida facturado en Opus 5, frente a aproximadamente 4,0 caracteres por token en texto plano en inglés. Cerca de un tercio de lo que pagaste como salida nunca llegó a tu pantalla.
Eso no es un escándalo. Es el producto funcionando tal como fue diseñado, y la profundidad del razonamiento es un dial que controlas mediante los niveles de esfuerzo y no mediante las opciones de visualización.
Las lecturas de caché son la factura real

Una lectura de caché es barata y constante. El contexto que se lee crece durante toda la sesión, y se vuelve a leer en cada turno, así que lo barato se acumula hasta convertirse en lo dominante.
Esto también explica por qué el tiempo inactivo cuesta dinero. La documentación de prompt caching de Anthropic, verificada el 26 de julio de 2026, fija la vida útil por defecto de la caché en cinco minutos, renovada cada vez que se usa el contenido cacheado. Deja que una sesión repose más tiempo que eso y el siguiente turno pagará una escritura nueva a 1,25 veces la tarifa de entrada en lugar de una lectura a 0,1 veces. Un descanso para el café es un evento facturable en un flujo de trabajo de agentes.
La propia documentación de costos de Claude Code de Anthropic sitúa el uso empresarial en alrededor de $13 por desarrollador por día activo y entre $150 y $250 por desarrollador al mes, con el 90% de los usuarios por debajo de $30 por día activo. Nuestro corpus se ubica en ese rango, en $0,25 por turno en Opus 4.8. La variable es la cantidad de turnos multiplicada por el tamaño del contexto, no la verbosidad.
Opus 5 escribe más y cuesta casi lo mismo
Claude Opus 5 es notablemente más hablador que Opus 4.8. En turnos equiparados de nuestro corpus, Opus 5 promedia 3.882 tokens de salida frente a 2.582 de Opus 4.8, un aumento del 50%, con intervalos bootstrap del 95% que no se superponen. Esa es una diferencia de comportamiento real, no ruido de muestreo.
Ahora la parte que la gente entiende mal. La tabla de precios publicada por Anthropic, verificada el 26 de julio de 2026, le da a Opus 5 y Opus 4.8 la misma tarjeta de precios, $5 por millón de tokens de entrada y $25 por millón de tokens de salida, con niveles de caché idénticos. Si la salida es solo el 12,1% de la factura, un salto del 50% en la salida mueve el total en aproximadamente un 6%.
Volvimos a tarificar toda la carga de trabajo de dos meses con las tarifas de cada modelo. Opus 5 queda alrededor de un 5% por encima de Opus 4.8. Si te gustaba la economía del modelo anterior, como planteamos en nuestras notas de campo sobre Opus 4.8, el nuevo modelo no es el evento presupuestario que parece.
| Modelo | Entrada por MTok | Escritura de caché 5 min | Escritura de caché 1 hora | Lectura de caché | Salida por MTok |
|---|---|---|---|---|---|
| Claude Opus 5 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Opus 4.8 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Fable 5 | $10.00 | n/d | n/d | n/d | $50.00 |
| Claude Sonnet 5, introductorio hasta el 31 de agosto de 2026 | $2.00 | n/d | n/d | n/d | $10.00 |
| Claude Sonnet 5, desde el 1 de septiembre de 2026 | $3.00 | n/d | n/d | n/d | $15.00 |
| Claude Haiku 4.5 | $1.00 | n/d | n/d | n/d | $5.00 |
Los multiplicadores de caché son estructurales, así que puedes derivar cada fila a partir de su tarifa base de entrada. La documentación de Anthropic recoge la tarifa introductoria de Sonnet 5 y los $3 y $15 que la reemplazan el 1 de septiembre de 2026.
El modelo caro es el que tiene la tarifa de entrada alta
Ver la tabla de precios en platform.claude.com
Dado que la entrada domina, el modelo que duele es el que tiene la tarifa de entrada alta, no el que tiene el número de salida más grande. Claude Fable 5 cuesta $10 por millón de entrada frente a los $5 de Opus 5, según la tabla de precios de Anthropic, y esa tarifa de entrada duplicada recae sobre el 87% de tu factura que es tráfico de caché.
Recalculado con la misma carga de trabajo de dos meses, Fable 5 resulta en aproximadamente 1,9 veces el costo de Opus 5. Casi exactamente su multiplicador de entrada, que es justamente el punto. Cubrimos dónde vale la pena pagar por esa capacidad en nuestra evaluación de Fable 5.
Hacia abajo, la lógica se invierte perfectamente. A $2 por millón de entrada con el precio introductorio, Sonnet 5 recorta el ítem dominante en un 60% frente al nivel Opus, y nuestros datos de turnos equiparados muestran que escribe ligeramente menos por turno que Opus 4.8, en lugar de más.
Dos palancas que funcionan, una que no

La palanca que no funciona es pedir respuestas más cortas. Estás optimizando el 12% de la factura mientras degradas lo que realmente estás comprando, que es la razón por la que señalamos este patrón en la trampa de la dieta de tokens de IA.
Las dos que sí funcionan:
- Recorta lo que se reenvía. Menos archivos en el contexto, lecturas más acotadas, compacta antes de que la transcripción se infle, y termina una sesión en lugar de dejarla inactiva más allá del TTL
- Ajusta el modelo a la tarifa de entrada. Dirige los turnos de agente rutinarios a un nivel de entrada más barato y reserva el nivel caro para los turnos donde la precisión vale la pena
Ambas son disciplina de contexto, no disciplina de prompt. La mecánica práctica está en nuestra guía de gestión de contexto de Claude Code.
Cómo medir tu propio gasto
Ver la referencia de la API en platform.claude.com
No confíes en las proporciones de nadie, ni siquiera en las nuestras. Cada respuesta de la API lleva un objeto usage, y esa es la verdad fundamental para tu propia carga de trabajo.
- Registra
usageen cada respuesta, no en una muestra, y deduplica por id de respuesta antes de agregar - Divide la entrada en cuatro categorías, lectura de caché, escritura de 5 minutos, escritura de 1 hora, y sin caché, porque se tarifican de forma diferente
- Multiplica cada categoría por su propia tarifa en lugar de reportar el conteo bruto de tokens, ya que los conteos ocultan la diferencia de 50x entre una lectura de caché y un token de salida
- Compara los caracteres visibles con los tokens de salida facturados para ver cuánto razonamiento estás financiando
Dos tardes de instrumentación te dirán más que todos los blogs de precios de internet, incluido este.
Preguntas frecuentes
¿Ocultar la salida del pensamiento baja mi factura?
No. La documentación de adaptive thinking de Anthropic afirma que los tokens de pensamiento facturados no cambian con la configuración de visualización, solo cambia lo que se te devuelve.
¿Es Claude Opus 5 más caro que Opus 4.8?
Apenas. Comparte tarjeta de precios con Opus 4.8 a $5 y $25 por millón de tokens según la tabla de precios de Anthropic, y aunque nuestro corpus muestra que escribe un 50% más por turno, al recalcular la misma carga de trabajo queda alrededor de un 5% más caro en total.
¿Debería cambiar a Sonnet 5 para ahorrar dinero?
Para turnos de agente rutinarios, probablemente. La tabla de precios de Anthropic lista tarifas introductorias de $2 por millón de entrada hasta el 31 de agosto de 2026, lo que ataca la línea más grande de tu factura en lugar de la más pequeña.
¿Pedir respuestas más cortas ahorra dinero?
Casi nada. La salida fue el 12,1% de nuestra factura medida, así que reducirla a la mitad mueve el total en alrededor de un seis por ciento mientras empeora el trabajo.
¿Por qué mi factura se disparó un día que apenas trabajé?
Largos períodos de inactividad. La documentación de Anthropic fija la vida útil por defecto de la caché en cinco minutos, así que una vez que expira, el siguiente turno reescribe todo el contexto a 1,25 veces la tarifa de entrada en lugar de leerlo a 0,1 veces.
¿Cuál es un gasto mensual normal?
La documentación de costos de Claude Code de Anthropic cita alrededor de $13 por desarrollador por día activo y entre $150 y $250 al mes, con el 90% de los usuarios por debajo de $30 por día activo. El uso intensivo de agentes se ubica bastante por encima de eso.
La factura es un problema de contexto
Tu factura no es una medida de cuánto dijo el modelo. Es una medida de cuántas veces lo hiciste releer tu proyecto.
Todo lo aquí presentado fue medido en una estación de trabajo durante tres meses, a través de 157.670 respuestas de la API desde el 26 de abril hasta el 26 de julio de 2026. Esto no establece un estándar de la industria, ni es una proyección de un proveedor. Establece hacia dónde fue el dinero en nuestro caso, con suficiente detalle para que puedas verificar si lo mismo es cierto para ti.
Entonces cotiza tu trabajo en consecuencia, porque el costo de herramientas por turno ahora es una línea real en un proyecto de diseño, no un margen de error. Cubrimos cómo manejar eso en cómo cotizar trabajo de diseño potenciado por IA.
Want the working version of this, every week? Join the Brainy creator list.
Get Started




