Стоимость токенов AI-агентов: за что вы платите на самом деле
На основе замеров 157 670 реальных ходов Claude Code: видимый вывод составляет 12% счёта, чтение кеша 48%, а большинство токенов, за которые вы платите, вы никогда не видите.

Все оптимизируют объём того, что пишет модель. На письмо приходится примерно восьмая часть счёта.
Короткий ответ
Деньги уходят на контекст, который вы заново пересылаете на каждом ходу, и на рассуждения, за которые вы платите, но никогда не видите. Мы инструментировали одну рабочую станцию и записали объект usage для 157 670 дедуплицированных ответов Claude Code API за период с 26 апреля по 26 июля 2026 года, зафиксировав данные на 08:25 UTC последнего дня. Это записанные данные, а не оценка.
В этом корпусе видимый вывод составляет 12,1% расходов на Opus 4.8. Чтение кеша забирает 48%. Запись в кеш забирает 39%, а по-настоящему некешированный ввод настолько мал, что это статистическая погрешность: менее 1%.
Это одна рабочая станция, выполняющая один тип работы, поэтому относитесь к этим долям как к общей картине, а не как к универсальной константе. Важна именно картина, а её обычно и не советуют оптимизировать.

За что вы на самом деле платите
Ход агента не является сообщением в чате. Каждый ход заново пересылает весь рабочий контекст: системный промпт, определения инструментов, уже прочитанные файлы и всю предыдущую стенограмму. Если этот механизм для вас в новинку, мы разобрали его в статье как на самом деле работает контекстное окно.
Документация Anthropic по кешированию промптов, проверенная 26 июля 2026 года, оценивает эти пересылки по трём отдельным тарифам. Запись в кеш с TTL 5 минут стоит 1,25 базовой ставки на ввод, запись с TTL 1 час стоит 2 ставки, а чтение кеша стоит 0,1 ставки. Установка точки останова бесплатна, согласно той же документации, так что вы платите только за токены, которые реально записаны или прочитаны.
Вот анатомия реального счёта на основе измеренных нами долей.
| Тип токенов | Доля в измеренном счёте | Ставка относительно базового ввода | Что это на самом деле |
|---|---|---|---|
| Чтение кеша | 48% | 0,1x | контекст, пересланный повторно и совпавший на более позднем ходу |
| Запись в кеш | 39% | 1,25x при 5 мин, 2x при 1 часе | контекст, сохранённый, чтобы следующий ход мог прочитать его дёшево |
| Вывод | 12,1% | 5x на Opus 5 | видимый текст плюс оплачиваемые рассуждения |
| Некешированный ввод | менее 1% | 1x | редкий холодный промах |
Прочитайте эту таблицу дважды. Самая дешёвая позиция за токен оказывается самой крупной строкой в счёте, потому что объём побеждает ставку.

Большая часть ваших токенов вывода невидима

Токены рассуждений оплачиваются как вывод по стандартной ставке на вывод. Документация Anthropic по расширенному мышлению прямо говорит, что вы платите за полный объём токенов мышления, а API возвращает сжатую сводку, так что число, за которое вы платите, и число, которое вы можете прочитать, это разные числа.
Важное следствие из документации Anthropic по адаптивному мышлению в том, что оплачиваемое мышление не меняется в зависимости от настройки display. Отключение панели рассуждений делает ваш терминал тише, а счёт остаётся таким же.
Этот разрыв виден снаружи. На ходах, состоящих только из прозы, наш корпус фиксирует 2,7 видимых символа на оплачиваемый токен вывода в Opus 5, против примерно 4,0 символов на токен для обычного английского текста. Примерно треть того, за что вы заплатили как за вывод, так и не попала на экран.
Это не скандал. Продукт работает так, как задуман, а глубину рассуждений вы регулируете через уровни усилий, а не через флаги отображения.
Чтение кеша и есть настоящий счёт

Чтение кеша дёшево и постоянно. Читаемый контекст растёт всю сессию и заново читается на каждом ходу, поэтому дешёвая вещь со временем становится доминирующей.
Именно поэтому время простоя стоит денег. Документация Anthropic по кешированию промптов, проверенная 26 июля 2026 года, устанавливает время жизни кеша по умолчанию в пять минут, которое обновляется при каждом использовании закешированного содержимого. Если оставить сессию простаивать дольше, следующий ход оплатит новую запись по ставке 1,25 вместо чтения по ставке 0,1. Перерыв на кофе в рабочем процессе агента становится событием, за которое вы платите.
Собственная документация Anthropic по стоимости Claude Code оценивает корпоративное использование примерно в $13 на разработчика за активный день и от $150 до $250 на разработчика в месяц, при этом 90% пользователей укладываются в менее $30 за активный день. Наш корпус находится в этом диапазоне: $0.25 за ход на Opus 4.8. Переменная здесь, это количество ходов, умноженное на размер контекста, а не многословность.
Opus 5 пишет больше, но стоит почти столько же
Claude Opus 5 заметно многословнее Opus 4.8. На сопоставимых ходах в нашем корпусе Opus 5 в среднем выдаёт 3882 токена вывода против 2582 у Opus 4.8, рост на 50%, с непересекающимися бутстрап-интервалами 95%. Это реальное поведенческое различие, а не шум выборки.
А вот здесь люди обычно ошибаются. Опубликованная таблица цен Anthropic, проверенная 26 июля 2026 года, даёт Opus 5 и Opus 4.8 одинаковую тарифную карту: $5 за миллион входных токенов и $25 за миллион выходных, с одинаковыми уровнями кеша. Если вывод, это всего 12,1% счёта, то скачок вывода на 50% сдвигает итог примерно на 6%.
Мы пересчитали всю двухмесячную нагрузку по ставкам каждой модели. Opus 5 оказывается примерно на 5% дороже Opus 4.8. Если вам нравилась экономика старой модели, о чём мы говорили в наших полевых заметках по Opus 4.8, новая модель вовсе не такое бюджетное событие, каким кажется.
| Модель | Ввод за MTok | Запись в кеш 5 мин | Запись в кеш 1 час | Чтение кеша | Вывод за MTok |
|---|---|---|---|---|---|
| Claude Opus 5 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Opus 4.8 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Fable 5 | $10.00 | н/д | н/д | н/д | $50.00 |
| Claude Sonnet 5, вводная цена до 31 авг. 2026 | $2.00 | н/д | н/д | н/д | $10.00 |
| Claude Sonnet 5, с 1 сент. 2026 | $3.00 | н/д | н/д | н/д | $15.00 |
| Claude Haiku 4.5 | $1.00 | н/д | н/д | н/д | $5.00 |
Множители кеша структурны, поэтому каждую строку можно вывести из базовой ставки на ввод. В документации Anthropic указана вводная ставка Sonnet 5, а также цены $3 и $15, которые заменят её с 1 сентября 2026 года.
Дороже всего обходится модель с высокой ставкой на ввод
Смотреть таблицу цен на platform.claude.com
Поскольку ввод доминирует, больнее всего бьёт модель с высокой ставкой на ввод, а не та, у которой самое большое число по выводу. Claude Fable 5 стоит $10 за миллион входных токенов против $5 у Opus 5, согласно таблице цен Anthropic, и эта удвоенная ставка на ввод приходится как раз на те 87% счёта, что составляет кеш-трафик.
Пересчитанная на ту же двухмесячную нагрузку, Fable 5 обходится примерно в 1,9 раза дороже Opus 5. Почти точно её множитель по вводу, в этом и весь смысл. Мы разобрали, где эти возможности стоят своих денег, в нашей оценке Fable 5.
В обратную сторону логика работает так же аккуратно. При $2 за миллион входных токенов по вводной цене Sonnet 5 сокращает доминирующую статью расходов на 60% относительно уровня Opus, а наши данные по сопоставимым ходам показывают, что она пишет за ход чуть меньше, чем Opus 4.8, а не больше.
Два рычага, которые работают, и один, который нет

Рычаг, который не работает, это просьба давать более короткие ответы. Вы оптимизируете 12% счёта, одновременно ухудшая то, за что на самом деле платите, и именно поэтому мы разобрали эту ловушку в статье диета на AI-токенах как ловушка.
Два рычага, которые работают:
- Сократите то, что пересылается заново. Меньше файлов в контексте, более узкие чтения, сжатие (compact) до того, как стенограмма разрастётся, и завершение сессии вместо того, чтобы дать ей простаивать дольше TTL
- Подбирайте модель под ставку на ввод. Направляйте рутинные ходы агента на более дешёвый уровень ввода и оставляйте дорогой уровень для тех ходов, где точность окупается
Оба рычага, это дисциплина контекста, а не дисциплина промптов. Практические механики описаны в нашем руководстве по управлению контекстом в Claude Code.
Как измерить собственные расходы
Смотреть справочник API на platform.claude.com
Не доверяйте чужим пропорциям, включая наши. Каждый ответ API содержит объект usage, и это единственная объективная истина для вашей собственной нагрузки.
- Логируйте
usageдля каждого ответа, а не выборки, и дедуплицируйте по id ответа перед агрегацией - Разделите ввод на четыре корзины: чтение кеша, запись на 5 минут, запись на 1 час и некешированный ввод, потому что они оцениваются по-разному
- Умножайте каждую корзину на её собственную ставку, а не просто указывайте сырые количества токенов, поскольку количества скрывают 50-кратный разрыв между чтением кеша и токеном вывода
- Сравнивайте видимые символы с оплачиваемыми токенами вывода, чтобы понять, сколько рассуждений вы финансируете
Два дня инструментирования расскажут вам больше, чем все блоги о ценах в интернете вместе взятые, включая этот.
Часто задаваемые вопросы
Снижает ли скрытие вывода мышления мой счёт?
Нет. Документация Anthropic по адаптивному мышлению утверждает, что оплачиваемые токены мышления не меняются в зависимости от настройки отображения, меняется только то, что возвращается вам.
Дороже ли Claude Opus 5, чем Opus 4.8?
Едва ли. У неё та же тарифная карта, что и у Opus 4.8: $5 и $25 за миллион токенов по таблице цен Anthropic, и хотя наш корпус показывает, что она пишет на 50% больше за ход, пересчёт той же нагрузки даёт итоговое удорожание примерно на 5%.
Стоит ли переходить на Sonnet 5, чтобы сэкономить?
Для рутинных ходов агента, вероятно, да. В таблице цен Anthropic указаны вводные ставки в $2 за миллион входных токенов до 31 августа 2026 года, а это бьёт по самой крупной строке счёта, а не по самой мелкой.
Экономит ли деньги просьба давать более короткие ответы?
Почти нет. Вывод составил 12,1% измеренного счёта, так что сокращение его вдвое сдвигает итог примерно на шесть процентов, при этом ухудшая качество работы.
Почему мой счёт резко вырос в день, когда я почти не работал?
Долгие простои. Документация Anthropic устанавливает время жизни кеша по умолчанию в пять минут, так что после его истечения следующий ход заново записывает весь контекст по ставке 1,25 вместо чтения по ставке 0,1.
Какие расходы в месяц можно считать нормальными?
Документация Anthropic по стоимости Claude Code приводит цифры около $13 на разработчика за активный день и от $150 до $250 в месяц, при этом 90% пользователей укладываются в менее $30 за активный день. Интенсивное агентное использование выходит далеко за эти рамки.
Счёт отражает проблему контекста
Ваш счёт не отражает, сколько сказала модель. Он отражает, сколько раз вы заставили её заново перечитать ваш проект.
Всё изложенное здесь измерено на одной рабочей станции за три месяца, на основе 157 670 ответов API с 26 апреля по 26 июля 2026 года. Это не отраслевой эталон и не прогноз вендора. Это фиксация того, куда ушли деньги у нас, причём с достаточной детализацией, чтобы вы могли проверить, верно ли то же самое для вас.
Затем оценивайте свою работу соответственно, потому что стоимость инструментов за ход теперь реальная статья расходов в дизайн-проекте, а не статистическая погрешность. Мы разобрали, как с этим работать, в статье ценообразование для дизайн-работы с AI.
Want the working version of this, every week? Join the Brainy creator list.
Get Started




