Custos de Tokens de Agentes de IA: Pelo Que Você Realmente Paga
Medido em 157.670 turnos reais do Claude Code, a saída visível é 12% da conta, as leituras de cache são 48%, e a maioria dos tokens que você paga nunca é exibida para você.

Todo mundo otimiza o quanto o modelo escreve. A escrita é cerca de um oitavo da conta.
A resposta curta
O dinheiro está no contexto que você reenvia a cada turno, e no raciocínio pelo qual você é cobrado mas nunca vê. Instrumentamos uma estação de trabalho e registramos o objeto usage em 157.670 respostas deduplicadas da API do Claude Code entre 26 de abril e 26 de julho de 2026, congeladas às 08h25 UTC no último dia. Registrado, não estimado.
Nesse corpus, a saída visível representa 12,1% do gasto com o Opus 4.8. As leituras de cache tomam 48%. As escritas de cache tomam 39%, e a entrada genuinamente sem cache é o erro de arredondamento, abaixo de 1%.
Isso é uma estação de trabalho rodando um tipo de trabalho, então trate essas proporções como um formato, não como uma constante universal. O formato é o que importa, e não é isso que a maioria das pessoas é orientada a otimizar.

Pelo que você realmente é cobrado
Um turno de agente não é uma mensagem de chat. Cada turno reenvia todo o contexto de trabalho, o prompt de sistema, as definições de ferramentas, os arquivos já lidos, e toda a transcrição anterior. Se esse mecanismo é novo para você, explicamos em como a janela de contexto realmente funciona.
A documentação de prompt caching da Anthropic, verificada em 26 de julho de 2026, precifica esses reenvios em três níveis separados. Uma escrita de cache no TTL de 5 minutos custa 1,25 vezes a taxa base de entrada, uma escrita no TTL de 1 hora custa 2 vezes, e uma leitura de cache custa 0,1 vezes. Definir um breakpoint é gratuito, segundo a mesma documentação, então você só é cobrado pelos tokens realmente escritos ou lidos.
Aqui está a anatomia de uma conta real, usando nossas proporções medidas.
| Tipo de token | Proporção da conta medida | Taxa vs entrada base | O que realmente é |
|---|---|---|---|
| Leituras de cache | 48% | 0,1x | contexto reenviado e correspondido em um turno posterior |
| Escritas de cache | 39% | 1,25x em 5 min, 2x em 1 hora | contexto armazenado para que o próximo turno possa lê-lo barato |
| Saída | 12,1% | 5x no Opus 5 | texto visível mais raciocínio cobrado |
| Entrada sem cache | abaixo de 1% | 1x | o raro cache miss |
Leia essa tabela duas vezes. O item mais barato por token é a maior linha da fatura, porque volume vence taxa.

A maioria dos seus tokens de saída é invisível

Tokens de raciocínio são cobrados como saída, na taxa padrão de saída. A documentação de extended thinking da Anthropic afirma claramente que você é cobrado pelos tokens de pensamento completos enquanto a API retorna um resumo condensado, então o número pelo qual você paga e o número que você consegue ler são números diferentes.
O corolário importante, vindo da documentação de adaptive thinking da Anthropic, é que o pensamento cobrado não muda com a configuração display. Desligar o painel de raciocínio deixa seu terminal mais quieto e sua fatura idêntica.
Podemos ver a lacuna de fora. Em turnos apenas de prosa, nosso corpus registra 2,7 caracteres visíveis por token de saída cobrado no Opus 5, contra aproximadamente 4,0 caracteres por token em texto comum em inglês. Cerca de um terço do que você pagou como saída nunca chegou à sua tela.
Isso não é um escândalo. É o produto funcionando como projetado, e a profundidade do raciocínio é um controle que você ajusta através de níveis de esforço, não através de flags de exibição.
As leituras de cache são a conta de verdade

Uma leitura de cache é barata e constante. O contexto sendo lido cresce durante toda a sessão, e é lido novamente a cada turno, então a coisa barata se acumula até virar a coisa dominante.
É por isso também que o tempo ocioso custa dinheiro. A documentação de prompt caching da Anthropic, verificada em 26 de julho de 2026, define o tempo de vida padrão do cache em cinco minutos, renovado a cada uso do conteúdo em cache. Deixe uma sessão parada por mais tempo que isso e o próximo turno paga uma escrita nova a 1,25 vezes a taxa de entrada em vez de uma leitura a 0,1 vezes. Uma pausa para o café é um evento cobrável em um fluxo de trabalho de agente.
A própria documentação de custos do Claude Code da Anthropic coloca o uso empresarial em cerca de $13 por desenvolvedor por dia ativo e de $150 a $250 por desenvolvedor por mês, com 90% dos usuários ficando abaixo de $30 por dia ativo. Nosso corpus está nessa faixa, em $0,25 por turno no Opus 4.8. A variável é o número de turnos multiplicado pelo tamanho do contexto, não a verbosidade.
O Opus 5 escreve mais e custa quase o mesmo
O Claude Opus 5 é perceptivelmente mais falante que o Opus 4.8. Em turnos equivalentes no nosso corpus, o Opus 5 tem em média 3.882 tokens de saída contra 2.582 do Opus 4.8, um aumento de 50%, com intervalos de bootstrap de 95% que não se sobrepõem. Essa é uma diferença comportamental real, não ruído amostral.
Agora a parte que as pessoas erram. A tabela de preços publicada pela Anthropic, verificada em 26 de julho de 2026, dá ao Opus 5 e ao Opus 4.8 uma tabela de preços idêntica, $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída, com níveis de cache equivalentes. Se a saída é apenas 12,1% da conta, um salto de 50% na saída move o total em cerca de 6%.
Reprecificamos toda a carga de trabalho de dois meses sob as taxas de cada modelo. O Opus 5 fica cerca de 5% acima do Opus 4.8. Se você gostava da economia do modelo mais antigo, como argumentamos em nossas notas de campo sobre o Opus 4.8, o novo modelo não é o estouro de orçamento que parece ser.
| Modelo | Entrada por MTok | Escrita de cache 5 min | Escrita de cache 1 hora | Leitura de cache | Saída por MTok |
|---|---|---|---|---|---|
| Claude Opus 5 | $5,00 | $6,25 | $10,00 | $0,50 | $25,00 |
| Claude Opus 4.8 | $5,00 | $6,25 | $10,00 | $0,50 | $25,00 |
| Claude Fable 5 | $10,00 | n/d | n/d | n/d | $50,00 |
| Claude Sonnet 5, introdutório até 31 ago 2026 | $2,00 | n/d | n/d | n/d | $10,00 |
| Claude Sonnet 5, a partir de 1 set 2026 | $3,00 | n/d | n/d | n/d | $15,00 |
| Claude Haiku 4.5 | $1,00 | n/d | n/d | n/d | $5,00 |
Os multiplicadores de cache são estruturais, então dá para derivar cada linha a partir da sua taxa base de entrada. A documentação da Anthropic traz a taxa introdutória do Sonnet 5 e os valores de $3 e $15 que a substituem em 1º de setembro de 2026.
O modelo caro é o que tem a taxa de entrada alta
Veja a tabela de preços em platform.claude.com
Como a entrada domina, o modelo que dói é o que tem a taxa de entrada alta, não o que tem o maior número de saída. O Claude Fable 5 custa $10 por milhão de entrada contra os $5 do Opus 5, segundo a tabela de preços da Anthropic, e essa taxa de entrada dobrada recai sobre os 87% da sua conta que são tráfego de cache.
Reprecificado contra a mesma carga de trabalho de dois meses, o Fable 5 sai cerca de 1,9 vezes o custo do Opus 5. Quase exatamente seu multiplicador de entrada, que é exatamente o ponto. Cobrimos onde essa capacidade vale a pena pagar em nossa avaliação do Fable 5.
Na direção contrária, a lógica se inverte perfeitamente. A $2 por milhão de entrada no preço introdutório, o Sonnet 5 corta o item dominante em 60% em relação ao nível Opus, e nossos dados de turnos equivalentes mostram que ele escreve um pouco menos por turno que o Opus 4.8, em vez de mais.
Duas alavancas que funcionam, uma que não funciona

A alavanca que não funciona é pedir respostas mais curtas. Você está otimizando 12% da conta enquanto degrada a coisa que você realmente está comprando, e é por isso que apontamos esse padrão em a armadilha da dieta de tokens de IA.
As duas que funcionam:
- Corte o que é reenviado. Menos arquivos no contexto, leituras mais restritas, compacte antes que a transcrição infle, e encerre uma sessão em vez de deixá-la ociosa além do TTL
- Combine o modelo com a taxa de entrada. Direcione turnos rotineiros de agente para um nível de entrada mais barato e reserve o nível caro para os turnos onde a precisão compensa
As duas são disciplina de contexto, não disciplina de prompt. A mecânica prática está em nosso guia de gestão de contexto do Claude Code.
Como medir o seu próprio gasto
Veja a referência da API em platform.claude.com
Não confie nas proporções de ninguém, incluindo as nossas. Toda resposta da API carrega um objeto usage, e ele é a verdade fundamental para a sua própria carga de trabalho.
- Registre o
usageem cada resposta, não em uma amostra, e deduplique pelo id da resposta antes de agregar - Divida a entrada em quatro categorias, leitura de cache, escrita de 5 minutos, escrita de 1 hora, e sem cache, porque elas são precificadas de forma diferente
- Multiplique cada categoria pela sua própria taxa em vez de reportar contagens brutas de tokens, já que as contagens escondem a diferença de 50x entre uma leitura de cache e um token de saída
- Compare caracteres visíveis com tokens de saída cobrados para ver quanto raciocínio você está financiando
Duas tardes de instrumentação vão te dizer mais do que qualquer blog de preços na internet, incluindo este aqui.
Perguntas frequentes
Esconder a saída de pensamento reduz a minha conta?
Não. A documentação de adaptive thinking da Anthropic afirma que os tokens de pensamento cobrados não mudam com a configuração de exibição, apenas o que é retornado para você muda.
O Claude Opus 5 é mais caro que o Opus 4.8?
Quase nada. Ele compartilha a mesma tabela de preços do Opus 4.8, a $5 e $25 por milhão de tokens segundo a tabela de preços da Anthropic, e embora nosso corpus mostre que ele escreve 50% mais por turno, a reprecificação da mesma carga de trabalho o coloca cerca de 5% mais alto no total.
Devo trocar para o Sonnet 5 para economizar dinheiro?
Para turnos rotineiros de agente, provavelmente. A tabela de preços da Anthropic lista taxas introdutórias de $2 por milhão de entrada até 31 de agosto de 2026, o que ataca a maior linha da sua fatura, não a menor.
Pedir respostas mais curtas economiza dinheiro?
Quase nada. A saída foi 12,1% da nossa conta medida, então reduzi-la pela metade move o total em cerca de seis por cento, enquanto piora o trabalho.
Por que minha conta disparou em um dia que eu quase não trabalhei?
Lacunas longas de ociosidade. A documentação da Anthropic define o tempo de vida padrão do cache em cinco minutos, então assim que ele expira, o próximo turno reescreve todo o contexto a 1,25 vezes a taxa de entrada em vez de lê-lo a 0,1 vezes.
Qual é um gasto mensal normal?
A documentação de custos do Claude Code da Anthropic cita cerca de $13 por desenvolvedor por dia ativo e de $150 a $250 por mês, com 90% dos usuários abaixo de $30 por dia ativo. Uso intenso de agentes fica bem acima disso.
A conta é um problema de contexto
Sua fatura não é uma medida de quanto o modelo falou. É uma medida de quantas vezes você o fez reler o seu projeto.
Tudo aqui foi medido em uma estação de trabalho ao longo de três meses, em 157.670 respostas de API de 26 de abril a 26 de julho de 2026. Isso não estabelece um benchmark de indústria, e não é uma previsão de fornecedor. Estabelece para onde foi o dinheiro no nosso caso, com detalhe suficiente para você verificar se o mesmo vale para você.
Então precifique o seu trabalho de acordo, porque o custo de ferramentas por turno agora é uma linha real em um projeto de design, não um erro de arredondamento. Cobrimos como lidar com isso em precificando trabalho de design potencializado por IA.
Want the working version of this, every week? Join the Brainy creator list.
Get Started




