ai for designersJuly 26, 20269 min read

هزینه توکن ایجنت‌های هوش مصنوعی: واقعاً بابت چه چیزی پول می‌دهید

با اندازه‌گیری روی 157,670 نوبت واقعی Claude Code، خروجی قابل‌مشاهده تنها 12% از صورت‌حساب است، خواندن کش 48% را تشکیل می‌دهد و بیشتر توکن‌هایی که بابتشان پول می‌دهید هرگز به شما نشان داده نمی‌شوند.

By Boone
XLinkedIn
ai agent token costs

همه روی این تمرکز می‌کنند که مدل چقدر بنویسد. اما نوشتن حدود یک‌هشتم صورت‌حساب است.

پاسخ کوتاه

پول اصلی در آن contextای است که در هر نوبت دوباره ارسال می‌کنید، و در آن reasoningای که بابتش صورت‌حساب می‌شوید اما هرگز نمی‌بینید. ما یک ایستگاه‌کاری را ابزارمند کردیم و شیء usage را روی 157,670 پاسخ یکتاشدهٔ API مربوط به Claude Code، بین 26 آوریل تا 26 ژوئیه 2026، ثبت کردیم؛ داده در ساعت 08:25 UTC روز آخر منجمد شد. این عدد ثبت‌شده است، نه تخمینی.

در این مجموعه‌داده، خروجی قابل‌مشاهده 12.1% از هزینهٔ Opus 4.8 را تشکیل می‌دهد. خواندن کش 48% را می‌گیرد. نوشتن کش 39% است، و ورودی واقعاً بدون کش، خطای گرد کردن است؛ زیر 1%.

این فقط یک ایستگاه‌کاری با یک نوع کار خاص است، پس این نسبت‌ها را یک الگو در نظر بگیرید نه یک ثابت جهانی. چیزی که اهمیت دارد همان الگوست، و این الگو چیزی نیست که معمولاً به مردم گفته می‌شود روی آن تمرکز کنند.

تصویرسازی voxel از یک کوه‌یخ صورت‌حساب، نوک کوچک قابل‌مشاهده بالای یک پایهٔ عظیم پنهان.
تصویرسازی voxel از یک کوه‌یخ صورت‌حساب، نوک کوچک قابل‌مشاهده بالای یک پایهٔ عظیم پنهان.

بابت چه چیزی واقعاً صورت‌حساب می‌شوید

یک نوبت ایجنت یک پیام چت نیست. هر نوبت کل context کاری، system prompt، تعریف ابزارها، فایل‌های از قبل خوانده‌شده و تمام رونوشت قبلی را دوباره ارسال می‌کند. اگر این مکانیزم برایتان تازه است، در مقالهٔ نحوهٔ واقعی کارکرد پنجرهٔ context آن را باز کرده‌ایم.

مستندات prompt caching شرکت Anthropic، که در 26 ژوئیه 2026 تأیید شده، این ارسال‌های مجدد را در سه ردهٔ جداگانه قیمت‌گذاری می‌کند. نوشتن کش با TTL پنج‌دقیقه‌ای 1.25 برابر نرخ پایهٔ ورودی هزینه دارد، نوشتن با TTL یک‌ساعته 2 برابر است، و خواندن کش 0.1 برابر است. طبق همین مستندات، تنظیم یک breakpoint رایگان است، پس فقط بابت توکن‌هایی که واقعاً نوشته یا خوانده می‌شوند هزینه پرداخت می‌کنید.

این هم آناتومی یک صورت‌حساب واقعی، بر اساس سهم‌های اندازه‌گیری‌شدهٔ ما.

نوع توکنسهم از صورت‌حساب اندازه‌گیری‌شدهنرخ نسبت به ورودی پایهواقعاً چیست
خواندن کش48%0.1xcontextای که دوباره ارسال شده و در نوبت بعدی با آن تطبیق داده می‌شود
نوشتن کش39%1.25x در TTL پنج‌دقیقه‌ای، 2x در TTL یک‌ساعتهcontextای که ذخیره می‌شود تا نوبت بعدی ارزان خوانده شود
خروجی12.1%5x در Opus 5متن قابل‌مشاهده به‌علاوهٔ reasoning صورت‌حساب‌شده
ورودی بدون کشزیر 1%1xهمان cold miss نادر

این جدول را دوبار بخوانید. ارزان‌ترین ردیف به ازای هر توکن، بزرگ‌ترین ردیف در فاکتور است، چون حجم بر نرخ غلبه می‌کند.

تصویرسازی voxel از یک ایجنت هوش مصنوعی که در هر نوبت کل پشتهٔ context خود را دوباره ارسال می‌کند.
تصویرسازی voxel از یک ایجنت هوش مصنوعی که در هر نوبت کل پشتهٔ context خود را دوباره ارسال می‌کند.

بیشتر توکن‌های خروجی شما نامرئی هستند

مستندات extended thinking شرکت Anthropic که تفاوت توکن‌های reasoning صورت‌حساب‌شده و قابل‌مشاهده را توضیح می‌دهد.
مستندات extended thinking شرکت Anthropic که تفاوت توکن‌های reasoning صورت‌حساب‌شده و قابل‌مشاهده را توضیح می‌دهد.

آن را در platform.claude.com بخوانید

توکن‌های reasoning به‌عنوان خروجی و با نرخ استاندارد خروجی صورت‌حساب می‌شوند. مستندات extended thinking شرکت Anthropic به‌روشنی بیان می‌کند که شما بابت کل توکن‌های thinking صورت‌حساب می‌شوید، در حالی که API فقط یک خلاصهٔ فشرده برمی‌گرداند؛ پس عددی که پول آن را می‌دهید با عددی که می‌توانید بخوانید یکی نیستند.

نتیجهٔ مهمی که از مستندات adaptive thinking شرکت Anthropic برمی‌آید این است که thinking صورت‌حساب‌شده با تنظیم display تغییر نمی‌کند. خاموش کردن پنل reasoning فقط ترمینال شما را ساکت‌تر می‌کند، نه فاکتورتان را.

این شکاف را از بیرون هم می‌شود دید. در نوبت‌های صرفاً نثری، مجموعه‌دادهٔ ما 2.7 کاراکتر قابل‌مشاهده به ازای هر توکن خروجی صورت‌حساب‌شده روی Opus 5 ثبت می‌کند، در برابر تقریباً 4.0 کاراکتر به ازای هر توکن برای متن انگلیسی معمولی. حدود یک‌سوم چیزی که به‌عنوان خروجی بابتش پول داده‌اید، هرگز به صفحه‌تان نرسیده است.

این رسوایی نیست. این همان چیزی است که محصول برای آن طراحی شده، و عمق reasoning یک دکمهٔ تنظیم است که از طریق effort levels کنترلش می‌کنید، نه از طریق فلگ‌های display.

خواندن کش، صورت‌حساب واقعی است

مستندات prompt caching شرکت Anthropic که عمر پنج‌دقیقه‌ای کش و قانون تازه‌سازی آن را نشان می‌دهد.
مستندات prompt caching شرکت Anthropic که عمر پنج‌دقیقه‌ای کش و قانون تازه‌سازی آن را نشان می‌دهد.

آن را در platform.claude.com بخوانید

خواندن کش ارزان و ثابت است. contextای که خوانده می‌شود در طول کل session بزرگ‌تر می‌شود، و در هر نوبت دوباره خوانده می‌شود، پس چیز ارزان به‌مرور به چیز غالب تبدیل می‌شود.

به همین دلیل زمان بی‌کاری هم هزینه دارد. مستندات prompt caching شرکت Anthropic، تأییدشده در 26 ژوئیه 2026، عمر پیش‌فرض کش را پنج دقیقه تعیین می‌کند که هر بار محتوای کش‌شده استفاده شود، تازه می‌شود. اگر یک session بیش از این مدت بی‌کار بماند، نوبت بعدی به‌جای خواندنی با نرخ 0.1 برابر، نوشتنی تازه با نرخ 1.25 برابر ورودی پرداخت می‌کند. یک استراحت قهوه، در یک گردش‌کار ایجنتی، یک رویداد صورت‌حساب‌پذیر است.

مستندات هزینهٔ Claude Code خود Anthropic، استفادهٔ سازمانی را حدود $13 به ازای هر توسعه‌دهنده در هر روز فعال و $150 تا $250 به ازای هر توسعه‌دهنده در ماه اعلام می‌کند، در حالی که 90% کاربران زیر $30 در روز فعال باقی می‌مانند. مجموعه‌دادهٔ ما هم در همین بازه، با $0.25 به ازای هر نوبت روی Opus 4.8 قرار دارد. متغیر اصلی، تعداد نوبت‌ها ضرب در اندازهٔ context است، نه پرحرفی.

Opus 5 بیشتر می‌نویسد و تقریباً همان هزینه را دارد

Claude Opus 5 به‌طرز محسوسی پرحرف‌تر از Opus 4.8 است. در نوبت‌های تطبیق‌داده‌شدهٔ مجموعه‌دادهٔ ما، Opus 5 به‌طور میانگین 3,882 توکن خروجی دارد در برابر 2,582 توکن برای Opus 4.8؛ یعنی افزایش 50%، با بازه‌های bootstrap 95% غیرهم‌پوشان. این یک تفاوت رفتاری واقعی است، نه نویز نمونه‌گیری.

حالا برسیم به جایی که بیشتر مردم اشتباه می‌کنند. جدول قیمت منتشرشدهٔ Anthropic، تأییدشده در 26 ژوئیه 2026، به Opus 5 و Opus 4.8 دقیقاً همان کارت قیمت را می‌دهد: $5 به ازای هر میلیون توکن ورودی و $25 به ازای هر میلیون توکن خروجی، با رده‌های کش یکسان. اگر خروجی فقط 12.1% صورت‌حساب باشد، یک جهش 50 درصدی در خروجی، کل هزینه را فقط حدود 6% تغییر می‌دهد.

ما کل بار کاری دو‌ماهه را با نرخ هر مدل دوباره قیمت‌گذاری کردیم. Opus 5 حدود 5% بالاتر از Opus 4.8 قرار می‌گیرد. اگر اقتصاد مدل قدیمی‌تر را دوست داشتید، همان‌طور که در یادداشت‌های میدانی ما دربارهٔ Opus 4.8 استدلال کردیم، مدل جدید آن رویداد بودجه‌شکنی که به نظر می‌رسد نیست.

مدلورودی به ازای هر MTokنوشتن کش 5 دقیقه‌اینوشتن کش 1 ساعتهخواندن کشخروجی به ازای هر MTok
Claude Opus 5$5.00$6.25$10.00$0.50$25.00
Claude Opus 4.8$5.00$6.25$10.00$0.50$25.00
Claude Fable 5$10.00n/an/an/a$50.00
Claude Sonnet 5، از معرفی تا 31 آگوست 2026$2.00n/an/an/a$10.00
Claude Sonnet 5، از 1 سپتامبر 2026$3.00n/an/an/a$15.00
Claude Haiku 4.5$1.00n/an/an/a$5.00

ضرایب کش ساختاری هستند، پس می‌توانید هر ردیف را از نرخ پایهٔ ورودی‌اش استخراج کنید. مستندات Anthropic هم نرخ معرفیِ Sonnet 5 و هم $3 و $15ای که در 1 سپتامبر 2026 جایگزینش می‌شوند را ثبت کرده‌اند.

مدل گران، مدلی است که نرخ ورودی بالایی دارد

جدول قیمت را در platform.claude.com ببینید

چون ورودی غالب است، مدلی که به هزینه آسیب می‌زند، مدلی است با نرخ ورودی بالا، نه مدلی با بزرگ‌ترین عدد خروجی. طبق جدول قیمت Anthropic، Claude Fable 5 با $10 به ازای هر میلیون ورودی در برابر $5 برای Opus 5 قرار دارد، و این نرخ ورودی دوبرابرشده دقیقاً روی همان 87% صورت‌حساب شما که ترافیک کش است می‌نشیند.

وقتی با همان بار کاری دو‌ماهه دوباره قیمت‌گذاری شود، Fable 5 حدود 1.9 برابر هزینهٔ Opus 5 درمی‌آید؛ تقریباً دقیقاً همان ضریب ورودی‌اش، که خودِ نکتهٔ اصلی همین است. اینکه کجا ارزش پرداخت برای آن قابلیت را دارد را در ارزیابی ما از Fable 5 پوشش داده‌ایم.

در جهت پایین، این منطق زیبا برعکس می‌شود. با $2 به ازای هر میلیون ورودی در قیمت‌گذاری معرفی، Sonnet 5 بزرگ‌ترین ردیف هزینه را نسبت به ردهٔ Opus، 60% کاهش می‌دهد، و دادهٔ نوبت‌های تطبیق‌داده‌شدهٔ ما نشان می‌دهد که در هر نوبت کمی کمتر از Opus 4.8 می‌نویسد، نه بیشتر.

دو اهرمی که کار می‌کنند، یکی که کار نمی‌کند

مستندات adaptive thinking شرکت Anthropic که تأیید می‌کند توکن‌های صورت‌حساب‌شده، صرف‌نظر از تنظیم display، ثابت می‌مانند.
مستندات adaptive thinking شرکت Anthropic که تأیید می‌کند توکن‌های صورت‌حساب‌شده، صرف‌نظر از تنظیم display، ثابت می‌مانند.

آن را در platform.claude.com بخوانید

اهرمی که کار نمی‌کند، درخواست پاسخ‌های کوتاه‌تر است. شما دارید فقط 12% صورت‌حساب را بهینه می‌کنید در حالی که همان چیزی را که واقعاً خریده‌اید تنزل می‌دهید؛ به همین دلیل بود که این الگو را در تلهٔ رژیم توکن هوش مصنوعی به‌صراحت مطرح کردیم.

دو اهرمی که کار می‌کنند:

  • چیزی که دوباره ارسال می‌شود را کم کنید. فایل‌های کمتر در context، خواندن‌های محدودتر، فشرده‌سازی پیش از اینکه رونوشت متورم شود، و به‌جای اینکه session را بیش از TTL بی‌کار بگذارید، آن را ببندید
  • مدل را با نرخ ورودی تطبیق دهید. نوبت‌های روتین ایجنت را به یک ردهٔ ورودی ارزان‌تر هدایت کنید و ردهٔ گران را برای نوبت‌هایی نگه دارید که دقت در آن‌ها به‌صرفه است

هر دو نظم context هستند، نه نظم prompt. جزئیات عملی آن در راهنمای ما دربارهٔ مدیریت context در Claude Code آمده است.

چطور هزینهٔ خودتان را اندازه بگیرید

مرجع API را در platform.claude.com ببینید

به نسبت‌های هیچ‌کس، حتی نسبت‌های ما، اعتماد نکنید. هر پاسخ API یک شیء usage همراه دارد، و همان حقیقتِ زمینی برای بار کاری خودتان است.

  • usage را روی هر پاسخ ثبت کنید، نه فقط یک نمونه، و پیش از تجمیع، بر اساس response id یکتاسازی کنید
  • ورودی را به چهار سطل تقسیم کنید: خواندن کش، نوشتن 5 دقیقه‌ای، نوشتن 1 ساعته و بدون کش، چون قیمت‌گذاری‌شان متفاوت است
  • هر سطل را در نرخ خودش ضرب کنید، به‌جای اینکه فقط شمار خام توکن‌ها را گزارش دهید، چون شمارش خام اختلاف 50 برابری بین یک خواندن کش و یک توکن خروجی را پنهان می‌کند
  • کاراکترهای قابل‌مشاهده را با توکن‌های خروجی صورت‌حساب‌شده مقایسه کنید تا ببینید چقدر reasoning را تأمین مالی می‌کنید

دو بعدازظهر ابزارمندسازی، بیشتر از هر وبلاگ قیمت‌گذاری روی اینترنت به شما می‌گوید، از جمله همین یکی.

سوالات متداول

آیا پنهان کردن خروجی thinking صورت‌حسابم را پایین می‌آورد؟

خیر. مستندات adaptive thinking شرکت Anthropic می‌گویند توکن‌های thinking صورت‌حساب‌شده با تنظیم display تغییر نمی‌کنند؛ فقط چیزی که به شما برگردانده می‌شود تغییر می‌کند.

آیا Claude Opus 5 از Opus 4.8 گران‌تر است؟

به‌سختی. طبق جدول قیمت Anthropic، همان کارت قیمت Opus 4.8 را دارد: $5 و $25 به ازای هر میلیون توکن، و اگرچه مجموعه‌دادهٔ ما نشان می‌دهد که در هر نوبت 50% بیشتر می‌نویسد، قیمت‌گذاری دوبارهٔ همان بار کاری، آن را در مجموع فقط حدود 5% بالاتر نشان می‌دهد.

آیا باید برای صرفه‌جویی در هزینه به Sonnet 5 مهاجرت کنم؟

برای نوبت‌های روتین ایجنت، احتمالاً بله. جدول قیمت Anthropic نرخ‌های معرفیِ $2 به ازای هر میلیون ورودی را تا 31 آگوست 2026 فهرست کرده که بزرگ‌ترین ردیف فاکتور شما را هدف می‌گیرد، نه کوچک‌ترینش را.

آیا درخواست پاسخ‌های کوتاه‌تر در هزینه صرفه‌جویی می‌کند؟

تقریباً هیچ. خروجی 12.1% از صورت‌حساب اندازه‌گیری‌شدهٔ ما بود، پس نصف کردن آن کل هزینه را فقط حدود شش درصد تغییر می‌دهد، در حالی که کیفیت کار را بدتر می‌کند.

چرا در روزی که به‌زحمت کار کردم، صورت‌حسابم جهش کرد؟

فاصله‌های طولانی بی‌کاری. مستندات Anthropic عمر پیش‌فرض کش را پنج دقیقه تعیین می‌کنند، پس همین‌که منقضی شود، نوبت بعدی کل context را با نرخ 1.25 برابر ورودی دوباره می‌نویسد، به‌جای اینکه با نرخ 0.1 برابر آن را بخواند.

هزینهٔ ماهانهٔ معمول چقدر است؟

مستندات هزینهٔ Claude Code شرکت Anthropic حدود $13 به ازای هر توسعه‌دهنده در هر روز فعال و $150 تا $250 در ماه را ذکر می‌کند، با 90% کاربران زیر $30 در روز فعال. استفادهٔ سنگین ایجنتی به‌وضوح بالاتر از این اعداد می‌رود.

صورت‌حساب یک مسئلهٔ context است

فاکتور شما معیاری از این نیست که مدل چقدر حرف زده. معیاری است از اینکه چند بار مجبورش کرده‌اید پروژه‌تان را دوباره بخواند.

هر آنچه اینجا آمد، روی یک ایستگاه‌کاری در طول سه ماه و در قالب 157,670 پاسخ API از 26 آوریل تا 26 ژوئیه 2026 اندازه‌گیری شده است. این یک معیار صنعتی تعیین نمی‌کند و پیش‌بینی هیچ فروشنده‌ای نیست. فقط نشان می‌دهد پول ما کجا رفت، آن‌هم با جزئیات کافی برای اینکه بررسی کنید همین موضوع برای شما هم صادق است یا نه.

پس کارتان را بر همین اساس قیمت‌گذاری کنید، چون هزینهٔ ابزار به ازای هر نوبت اکنون یک ردیف واقعی در یک قرارداد طراحی است، نه خطای گرد کردن. نحوهٔ برخورد با این موضوع را در قیمت‌گذاری کار طراحی تقویت‌شده با هوش مصنوعی پوشش داده‌ایم.

Want the working version of this, every week? Join the Brainy creator list.

Get Started

More from Brainy Papers

Keep reading