هزینه توکن ایجنتهای هوش مصنوعی: واقعاً بابت چه چیزی پول میدهید
با اندازهگیری روی 157,670 نوبت واقعی Claude Code، خروجی قابلمشاهده تنها 12% از صورتحساب است، خواندن کش 48% را تشکیل میدهد و بیشتر توکنهایی که بابتشان پول میدهید هرگز به شما نشان داده نمیشوند.

همه روی این تمرکز میکنند که مدل چقدر بنویسد. اما نوشتن حدود یکهشتم صورتحساب است.
پاسخ کوتاه
پول اصلی در آن contextای است که در هر نوبت دوباره ارسال میکنید، و در آن reasoningای که بابتش صورتحساب میشوید اما هرگز نمیبینید. ما یک ایستگاهکاری را ابزارمند کردیم و شیء usage را روی 157,670 پاسخ یکتاشدهٔ API مربوط به Claude Code، بین 26 آوریل تا 26 ژوئیه 2026، ثبت کردیم؛ داده در ساعت 08:25 UTC روز آخر منجمد شد. این عدد ثبتشده است، نه تخمینی.
در این مجموعهداده، خروجی قابلمشاهده 12.1% از هزینهٔ Opus 4.8 را تشکیل میدهد. خواندن کش 48% را میگیرد. نوشتن کش 39% است، و ورودی واقعاً بدون کش، خطای گرد کردن است؛ زیر 1%.
این فقط یک ایستگاهکاری با یک نوع کار خاص است، پس این نسبتها را یک الگو در نظر بگیرید نه یک ثابت جهانی. چیزی که اهمیت دارد همان الگوست، و این الگو چیزی نیست که معمولاً به مردم گفته میشود روی آن تمرکز کنند.

بابت چه چیزی واقعاً صورتحساب میشوید
یک نوبت ایجنت یک پیام چت نیست. هر نوبت کل context کاری، system prompt، تعریف ابزارها، فایلهای از قبل خواندهشده و تمام رونوشت قبلی را دوباره ارسال میکند. اگر این مکانیزم برایتان تازه است، در مقالهٔ نحوهٔ واقعی کارکرد پنجرهٔ context آن را باز کردهایم.
مستندات prompt caching شرکت Anthropic، که در 26 ژوئیه 2026 تأیید شده، این ارسالهای مجدد را در سه ردهٔ جداگانه قیمتگذاری میکند. نوشتن کش با TTL پنجدقیقهای 1.25 برابر نرخ پایهٔ ورودی هزینه دارد، نوشتن با TTL یکساعته 2 برابر است، و خواندن کش 0.1 برابر است. طبق همین مستندات، تنظیم یک breakpoint رایگان است، پس فقط بابت توکنهایی که واقعاً نوشته یا خوانده میشوند هزینه پرداخت میکنید.
این هم آناتومی یک صورتحساب واقعی، بر اساس سهمهای اندازهگیریشدهٔ ما.
| نوع توکن | سهم از صورتحساب اندازهگیریشده | نرخ نسبت به ورودی پایه | واقعاً چیست |
|---|---|---|---|
| خواندن کش | 48% | 0.1x | contextای که دوباره ارسال شده و در نوبت بعدی با آن تطبیق داده میشود |
| نوشتن کش | 39% | 1.25x در TTL پنجدقیقهای، 2x در TTL یکساعته | contextای که ذخیره میشود تا نوبت بعدی ارزان خوانده شود |
| خروجی | 12.1% | 5x در Opus 5 | متن قابلمشاهده بهعلاوهٔ reasoning صورتحسابشده |
| ورودی بدون کش | زیر 1% | 1x | همان cold miss نادر |
این جدول را دوبار بخوانید. ارزانترین ردیف به ازای هر توکن، بزرگترین ردیف در فاکتور است، چون حجم بر نرخ غلبه میکند.

بیشتر توکنهای خروجی شما نامرئی هستند

آن را در platform.claude.com بخوانید
توکنهای reasoning بهعنوان خروجی و با نرخ استاندارد خروجی صورتحساب میشوند. مستندات extended thinking شرکت Anthropic بهروشنی بیان میکند که شما بابت کل توکنهای thinking صورتحساب میشوید، در حالی که API فقط یک خلاصهٔ فشرده برمیگرداند؛ پس عددی که پول آن را میدهید با عددی که میتوانید بخوانید یکی نیستند.
نتیجهٔ مهمی که از مستندات adaptive thinking شرکت Anthropic برمیآید این است که thinking صورتحسابشده با تنظیم display تغییر نمیکند. خاموش کردن پنل reasoning فقط ترمینال شما را ساکتتر میکند، نه فاکتورتان را.
این شکاف را از بیرون هم میشود دید. در نوبتهای صرفاً نثری، مجموعهدادهٔ ما 2.7 کاراکتر قابلمشاهده به ازای هر توکن خروجی صورتحسابشده روی Opus 5 ثبت میکند، در برابر تقریباً 4.0 کاراکتر به ازای هر توکن برای متن انگلیسی معمولی. حدود یکسوم چیزی که بهعنوان خروجی بابتش پول دادهاید، هرگز به صفحهتان نرسیده است.
این رسوایی نیست. این همان چیزی است که محصول برای آن طراحی شده، و عمق reasoning یک دکمهٔ تنظیم است که از طریق effort levels کنترلش میکنید، نه از طریق فلگهای display.
خواندن کش، صورتحساب واقعی است

آن را در platform.claude.com بخوانید
خواندن کش ارزان و ثابت است. contextای که خوانده میشود در طول کل session بزرگتر میشود، و در هر نوبت دوباره خوانده میشود، پس چیز ارزان بهمرور به چیز غالب تبدیل میشود.
به همین دلیل زمان بیکاری هم هزینه دارد. مستندات prompt caching شرکت Anthropic، تأییدشده در 26 ژوئیه 2026، عمر پیشفرض کش را پنج دقیقه تعیین میکند که هر بار محتوای کششده استفاده شود، تازه میشود. اگر یک session بیش از این مدت بیکار بماند، نوبت بعدی بهجای خواندنی با نرخ 0.1 برابر، نوشتنی تازه با نرخ 1.25 برابر ورودی پرداخت میکند. یک استراحت قهوه، در یک گردشکار ایجنتی، یک رویداد صورتحسابپذیر است.
مستندات هزینهٔ Claude Code خود Anthropic، استفادهٔ سازمانی را حدود $13 به ازای هر توسعهدهنده در هر روز فعال و $150 تا $250 به ازای هر توسعهدهنده در ماه اعلام میکند، در حالی که 90% کاربران زیر $30 در روز فعال باقی میمانند. مجموعهدادهٔ ما هم در همین بازه، با $0.25 به ازای هر نوبت روی Opus 4.8 قرار دارد. متغیر اصلی، تعداد نوبتها ضرب در اندازهٔ context است، نه پرحرفی.
Opus 5 بیشتر مینویسد و تقریباً همان هزینه را دارد
Claude Opus 5 بهطرز محسوسی پرحرفتر از Opus 4.8 است. در نوبتهای تطبیقدادهشدهٔ مجموعهدادهٔ ما، Opus 5 بهطور میانگین 3,882 توکن خروجی دارد در برابر 2,582 توکن برای Opus 4.8؛ یعنی افزایش 50%، با بازههای bootstrap 95% غیرهمپوشان. این یک تفاوت رفتاری واقعی است، نه نویز نمونهگیری.
حالا برسیم به جایی که بیشتر مردم اشتباه میکنند. جدول قیمت منتشرشدهٔ Anthropic، تأییدشده در 26 ژوئیه 2026، به Opus 5 و Opus 4.8 دقیقاً همان کارت قیمت را میدهد: $5 به ازای هر میلیون توکن ورودی و $25 به ازای هر میلیون توکن خروجی، با ردههای کش یکسان. اگر خروجی فقط 12.1% صورتحساب باشد، یک جهش 50 درصدی در خروجی، کل هزینه را فقط حدود 6% تغییر میدهد.
ما کل بار کاری دوماهه را با نرخ هر مدل دوباره قیمتگذاری کردیم. Opus 5 حدود 5% بالاتر از Opus 4.8 قرار میگیرد. اگر اقتصاد مدل قدیمیتر را دوست داشتید، همانطور که در یادداشتهای میدانی ما دربارهٔ Opus 4.8 استدلال کردیم، مدل جدید آن رویداد بودجهشکنی که به نظر میرسد نیست.
| مدل | ورودی به ازای هر MTok | نوشتن کش 5 دقیقهای | نوشتن کش 1 ساعته | خواندن کش | خروجی به ازای هر MTok |
|---|---|---|---|---|---|
| Claude Opus 5 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Opus 4.8 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Fable 5 | $10.00 | n/a | n/a | n/a | $50.00 |
| Claude Sonnet 5، از معرفی تا 31 آگوست 2026 | $2.00 | n/a | n/a | n/a | $10.00 |
| Claude Sonnet 5، از 1 سپتامبر 2026 | $3.00 | n/a | n/a | n/a | $15.00 |
| Claude Haiku 4.5 | $1.00 | n/a | n/a | n/a | $5.00 |
ضرایب کش ساختاری هستند، پس میتوانید هر ردیف را از نرخ پایهٔ ورودیاش استخراج کنید. مستندات Anthropic هم نرخ معرفیِ Sonnet 5 و هم $3 و $15ای که در 1 سپتامبر 2026 جایگزینش میشوند را ثبت کردهاند.
مدل گران، مدلی است که نرخ ورودی بالایی دارد
جدول قیمت را در platform.claude.com ببینید
چون ورودی غالب است، مدلی که به هزینه آسیب میزند، مدلی است با نرخ ورودی بالا، نه مدلی با بزرگترین عدد خروجی. طبق جدول قیمت Anthropic، Claude Fable 5 با $10 به ازای هر میلیون ورودی در برابر $5 برای Opus 5 قرار دارد، و این نرخ ورودی دوبرابرشده دقیقاً روی همان 87% صورتحساب شما که ترافیک کش است مینشیند.
وقتی با همان بار کاری دوماهه دوباره قیمتگذاری شود، Fable 5 حدود 1.9 برابر هزینهٔ Opus 5 درمیآید؛ تقریباً دقیقاً همان ضریب ورودیاش، که خودِ نکتهٔ اصلی همین است. اینکه کجا ارزش پرداخت برای آن قابلیت را دارد را در ارزیابی ما از Fable 5 پوشش دادهایم.
در جهت پایین، این منطق زیبا برعکس میشود. با $2 به ازای هر میلیون ورودی در قیمتگذاری معرفی، Sonnet 5 بزرگترین ردیف هزینه را نسبت به ردهٔ Opus، 60% کاهش میدهد، و دادهٔ نوبتهای تطبیقدادهشدهٔ ما نشان میدهد که در هر نوبت کمی کمتر از Opus 4.8 مینویسد، نه بیشتر.
دو اهرمی که کار میکنند، یکی که کار نمیکند

آن را در platform.claude.com بخوانید
اهرمی که کار نمیکند، درخواست پاسخهای کوتاهتر است. شما دارید فقط 12% صورتحساب را بهینه میکنید در حالی که همان چیزی را که واقعاً خریدهاید تنزل میدهید؛ به همین دلیل بود که این الگو را در تلهٔ رژیم توکن هوش مصنوعی بهصراحت مطرح کردیم.
دو اهرمی که کار میکنند:
- چیزی که دوباره ارسال میشود را کم کنید. فایلهای کمتر در context، خواندنهای محدودتر، فشردهسازی پیش از اینکه رونوشت متورم شود، و بهجای اینکه session را بیش از TTL بیکار بگذارید، آن را ببندید
- مدل را با نرخ ورودی تطبیق دهید. نوبتهای روتین ایجنت را به یک ردهٔ ورودی ارزانتر هدایت کنید و ردهٔ گران را برای نوبتهایی نگه دارید که دقت در آنها بهصرفه است
هر دو نظم context هستند، نه نظم prompt. جزئیات عملی آن در راهنمای ما دربارهٔ مدیریت context در Claude Code آمده است.
چطور هزینهٔ خودتان را اندازه بگیرید
مرجع API را در platform.claude.com ببینید
به نسبتهای هیچکس، حتی نسبتهای ما، اعتماد نکنید. هر پاسخ API یک شیء usage همراه دارد، و همان حقیقتِ زمینی برای بار کاری خودتان است.
usageرا روی هر پاسخ ثبت کنید، نه فقط یک نمونه، و پیش از تجمیع، بر اساس response id یکتاسازی کنید- ورودی را به چهار سطل تقسیم کنید: خواندن کش، نوشتن 5 دقیقهای، نوشتن 1 ساعته و بدون کش، چون قیمتگذاریشان متفاوت است
- هر سطل را در نرخ خودش ضرب کنید، بهجای اینکه فقط شمار خام توکنها را گزارش دهید، چون شمارش خام اختلاف 50 برابری بین یک خواندن کش و یک توکن خروجی را پنهان میکند
- کاراکترهای قابلمشاهده را با توکنهای خروجی صورتحسابشده مقایسه کنید تا ببینید چقدر reasoning را تأمین مالی میکنید
دو بعدازظهر ابزارمندسازی، بیشتر از هر وبلاگ قیمتگذاری روی اینترنت به شما میگوید، از جمله همین یکی.
سوالات متداول
آیا پنهان کردن خروجی thinking صورتحسابم را پایین میآورد؟
خیر. مستندات adaptive thinking شرکت Anthropic میگویند توکنهای thinking صورتحسابشده با تنظیم display تغییر نمیکنند؛ فقط چیزی که به شما برگردانده میشود تغییر میکند.
آیا Claude Opus 5 از Opus 4.8 گرانتر است؟
بهسختی. طبق جدول قیمت Anthropic، همان کارت قیمت Opus 4.8 را دارد: $5 و $25 به ازای هر میلیون توکن، و اگرچه مجموعهدادهٔ ما نشان میدهد که در هر نوبت 50% بیشتر مینویسد، قیمتگذاری دوبارهٔ همان بار کاری، آن را در مجموع فقط حدود 5% بالاتر نشان میدهد.
آیا باید برای صرفهجویی در هزینه به Sonnet 5 مهاجرت کنم؟
برای نوبتهای روتین ایجنت، احتمالاً بله. جدول قیمت Anthropic نرخهای معرفیِ $2 به ازای هر میلیون ورودی را تا 31 آگوست 2026 فهرست کرده که بزرگترین ردیف فاکتور شما را هدف میگیرد، نه کوچکترینش را.
آیا درخواست پاسخهای کوتاهتر در هزینه صرفهجویی میکند؟
تقریباً هیچ. خروجی 12.1% از صورتحساب اندازهگیریشدهٔ ما بود، پس نصف کردن آن کل هزینه را فقط حدود شش درصد تغییر میدهد، در حالی که کیفیت کار را بدتر میکند.
چرا در روزی که بهزحمت کار کردم، صورتحسابم جهش کرد؟
فاصلههای طولانی بیکاری. مستندات Anthropic عمر پیشفرض کش را پنج دقیقه تعیین میکنند، پس همینکه منقضی شود، نوبت بعدی کل context را با نرخ 1.25 برابر ورودی دوباره مینویسد، بهجای اینکه با نرخ 0.1 برابر آن را بخواند.
هزینهٔ ماهانهٔ معمول چقدر است؟
مستندات هزینهٔ Claude Code شرکت Anthropic حدود $13 به ازای هر توسعهدهنده در هر روز فعال و $150 تا $250 در ماه را ذکر میکند، با 90% کاربران زیر $30 در روز فعال. استفادهٔ سنگین ایجنتی بهوضوح بالاتر از این اعداد میرود.
صورتحساب یک مسئلهٔ context است
فاکتور شما معیاری از این نیست که مدل چقدر حرف زده. معیاری است از اینکه چند بار مجبورش کردهاید پروژهتان را دوباره بخواند.
هر آنچه اینجا آمد، روی یک ایستگاهکاری در طول سه ماه و در قالب 157,670 پاسخ API از 26 آوریل تا 26 ژوئیه 2026 اندازهگیری شده است. این یک معیار صنعتی تعیین نمیکند و پیشبینی هیچ فروشندهای نیست. فقط نشان میدهد پول ما کجا رفت، آنهم با جزئیات کافی برای اینکه بررسی کنید همین موضوع برای شما هم صادق است یا نه.
پس کارتان را بر همین اساس قیمتگذاری کنید، چون هزینهٔ ابزار به ازای هر نوبت اکنون یک ردیف واقعی در یک قرارداد طراحی است، نه خطای گرد کردن. نحوهٔ برخورد با این موضوع را در قیمتگذاری کار طراحی تقویتشده با هوش مصنوعی پوشش دادهایم.
Want the working version of this, every week? Join the Brainy creator list.
Get Started




