ai for designersJuly 26, 20269 min read

تكاليف Token في وكلاء الذكاء الاصطناعي: على ماذا تدفع فعليًا

بقياس 157,670 دورة حقيقية من Claude Code، الناتج المرئي يمثل 12% من الفاتورة، وقراءات الذاكرة المؤقتة (cache) تمثل 48%، ومعظم الـ tokens التي تدفع مقابلها لا تُعرض عليك أبدًا.

By Boone
XLinkedIn
ai agent token costs

الجميع يحسّن مقدار ما يكتبه النموذج. لكن الكتابة تمثل نحو ثُمن الفاتورة فقط.

الإجابة المختصرة

المال يكمن في السياق (context) الذي تعيد إرساله في كل دورة (turn)، وفي الاستدلال (reasoning) الذي تُحاسَب عليه دون أن تراه أبدًا. قمنا برصد جهاز عمل واحد وسجّلنا كائن usage عبر 157,670 استجابة API من Claude Code بعد إزالة التكرار، بين 26 أبريل و26 يوليو 2026، مجمّدة عند الساعة 08:25 بتوقيت UTC في اليوم الأخير. مُسجَّلة، وليست مقدَّرة.

في هذه المجموعة، يمثل الناتج المرئي 12.1% من إنفاق Opus 4.8. قراءات الذاكرة المؤقتة (cache reads) تستحوذ على 48%. كتابات الذاكرة المؤقتة (cache writes) تستحوذ على 39%، أما المدخلات غير المخزّنة مؤقتًا (uncached input) فعليًا فهي هامش خطأ لا يتجاوز 1%.

هذا جهاز عمل واحد ينفّذ نوعًا واحدًا من العمل، لذا تعامل مع هذه النسب باعتبارها نمطًا عامًا لا ثابتًا كونيًا. النمط هو ما يهم، وهذا النمط ليس ما يُقال لمعظم الناس أن يحسّنوه.

رسم توضيحي بأسلوب Voxel لجبل جليدي للفواتير، قمة صغيرة مرئية فوق قاعدة هائلة مخفية.
رسم توضيحي بأسلوب Voxel لجبل جليدي للفواتير، قمة صغيرة مرئية فوق قاعدة هائلة مخفية.

على ماذا تُحاسَب فعليًا

دورة الوكيل (agent turn) ليست رسالة محادثة عادية. كل دورة تعيد إرسال كامل سياق العمل، والـ system prompt، وتعريفات الأدوات (tools)، والملفات التي سبق قراءتها، والنص الكامل للمحادثة السابقة. إن كانت هذه الآلية جديدة عليك، فقد شرحناها في كيف تعمل نافذة السياق فعليًا.

وثائق Anthropic الخاصة بـ prompt caching، والمُتحقَّق منها بتاريخ 26 يوليو 2026، تسعّر عمليات إعادة الإرسال هذه على ثلاثة مستويات منفصلة. كتابة الذاكرة المؤقتة (cache write) بمدة TTL قدرها 5 دقائق تكلف 1.25 ضعف سعر المدخلات الأساسي، والكتابة بمدة TTL قدرها ساعة واحدة تكلف ضعفين، وقراءة الذاكرة المؤقتة (cache read) تكلف 0.1 ضعف. تحديد نقطة توقف (breakpoint) مجاني، وفق الوثائق ذاتها، لذا أنت لا تُحاسَب إلا على الـ tokens التي تُكتب أو تُقرأ فعليًا.

إليك تشريح فاتورة حقيقية، باستخدام النسب التي قِسناها.

نوع الـ Tokenنسبة من الفاتورة المقاسةالسعر مقارنة بالمدخلات الأساسيةما هو فعليًا
قراءات الذاكرة المؤقتة48%0.1xسياق أُعيد إرساله وتمت مطابقته في دورة لاحقة
كتابات الذاكرة المؤقتة39%1.25x عند 5 دقائق، 2x عند ساعة واحدةسياق مخزَّن ليتمكن الدور التالي من قراءته بتكلفة زهيدة
الناتج (Output)12.1%5x على Opus 5نص مرئي إضافة إلى استدلال محاسَب عليه
مدخلات غير مخزَّنة مؤقتًاأقل من 1%1xالحالة النادرة لعدم المطابقة الباردة (cold miss)

اقرأ هذا الجدول مرتين. البند الأرخص لكل token هو أكبر بند في الفاتورة، لأن الحجم يتغلب على السعر.

رسم توضيحي بأسلوب Voxel لوكيل ذكاء اصطناعي يعيد إرسال كامل حزمة السياق في كل دورة.
رسم توضيحي بأسلوب Voxel لوكيل ذكاء اصطناعي يعيد إرسال كامل حزمة السياق في كل دورة.

معظم tokens الناتج لديك غير مرئية

وثائق Anthropic الخاصة بـ extended thinking توضح الفرق بين tokens الاستدلال المحاسَب عليها والمرئية.
وثائق Anthropic الخاصة بـ extended thinking توضح الفرق بين tokens الاستدلال المحاسَب عليها والمرئية.

اقرأها على platform.claude.com

tokens الاستدلال (reasoning) تُحاسَب كناتج (output) بالسعر القياسي للناتج. توضح وثائق Anthropic الخاصة بـ extended thinking بشكل صريح أنك تُحاسَب على كامل tokens التفكير بينما يعيد الـ API ملخصًا مختصرًا فقط، لذا الرقم الذي تدفع مقابله والرقم الذي يمكنك قراءته رقمان مختلفان.

النتيجة المهمة المترتبة على ذلك، وفق وثائق Anthropic الخاصة بـ adaptive thinking، هي أن التفكير المحاسَب عليه لا يتغير مع إعداد display. إيقاف لوحة الاستدلال يجعل الطرفية (terminal) لديك أكثر هدوءًا لكن فاتورتك تبقى كما هي تمامًا.

يمكننا رؤية هذه الفجوة من الخارج. في الدورات النصية البحتة، تسجل مجموعتنا 2.7 حرف مرئي لكل token ناتج محاسَب عليه على Opus 5، مقابل نحو 4.0 أحرف لكل token في النص الإنجليزي العادي. نحو ثلث ما دفعته كناتج لم يصل إلى شاشتك أبدًا.

هذا ليس فضيحة. إنه المنتج يعمل كما صُمم، وعمق الاستدلال هو مقياس تتحكم فيه عبر effort levels وليس عبر خيارات العرض (display).

قراءات الذاكرة المؤقتة هي الفاتورة الحقيقية

وثائق Anthropic الخاصة بـ prompt caching توضح مدة صلاحية الذاكرة المؤقتة البالغة خمس دقائق وقاعدة التجديد.
وثائق Anthropic الخاصة بـ prompt caching توضح مدة صلاحية الذاكرة المؤقتة البالغة خمس دقائق وقاعدة التجديد.

اقرأها على platform.claude.com

قراءة الذاكرة المؤقتة رخيصة وثابتة. السياق الذي تتم قراءته ينمو طوال الجلسة، ويُعاد قراءته في كل دورة على حدة، لذا الشيء الرخيص يتراكم ليصبح الشيء المهيمن.

هذا أيضًا سبب أن وقت الخمول يكلّف مالًا. وثائق Anthropic الخاصة بـ prompt caching، والمُتحقَّق منها بتاريخ 26 يوليو 2026، تحدد مدة الصلاحية الافتراضية للذاكرة المؤقتة بخمس دقائق، تُجدَّد في كل مرة يُستخدم فيها المحتوى المخزَّن. اترك الجلسة راكدة أطول من ذلك وستدفع في الدورة التالية كتابة جديدة (fresh write) بمعدل 1.25 ضعف سعر المدخلات بدلًا من قراءة بمعدل 0.1 ضعف. استراحة القهوة حدث محاسَب عليه في سير عمل الوكيل.

وثائق Anthropic الخاصة بتكلفة Claude Code تضع استخدام الشركات عند نحو 13 دولارًا لكل مطوّر في اليوم النشط، وبين 150 و250 دولارًا لكل مطوّر شهريًا، مع بقاء 90% من المستخدمين دون 30 دولارًا في اليوم النشط. مجموعتنا تقع ضمن هذا النطاق عند 0.25 دولار لكل دورة على Opus 4.8. المتغيّر هو عدد الدورات مضروبًا في حجم السياق، وليس الإسهاب.

Opus 5 يكتب أكثر لكن بتكلفة مماثلة تقريبًا

Claude Opus 5 أكثر ثرثرة بشكل ملحوظ من Opus 4.8. في الدورات المتطابقة ضمن مجموعتنا، يبلغ متوسط tokens الناتج لدى Opus 5 نحو 3,882 مقابل 2,582 لـ Opus 4.8، بزيادة قدرها 50%، مع فواصل ثقة bootstrap بنسبة 95% لا تتداخل. هذا فرق سلوكي حقيقي، وليس ضجيجًا إحصائيًا (sampling noise).

والآن الجزء الذي يخطئ فيه الناس. جدول تسعير Anthropic المنشور، والمُتحقَّق منه بتاريخ 26 يوليو 2026، يمنح Opus 5 وOpus 4.8 بطاقة سعر مطابقة تمامًا: 5 دولارات لكل مليون token من المدخلات و25 دولارًا لكل مليون token من الناتج، مع مستويات ذاكرة مؤقتة متطابقة. إذا كان الناتج يمثل 12.1% فقط من الفاتورة، فإن قفزة بنسبة 50% في الناتج تحرك الإجمالي بنحو 6% فقط.

أعدنا تسعير حِمل العمل الكامل لمدة الشهرين بأسعار كل نموذج. Opus 5 يستقر عند نحو 5% أعلى من Opus 4.8. إذا كنت معجبًا باقتصاديات النموذج الأقدم، كما جادلنا في ملاحظاتنا الميدانية عن Opus 4.8، فإن النموذج الجديد ليس الحدث المكلف الذي يبدو عليه.

النموذجالمدخلات لكل MTokكتابة ذاكرة مؤقتة 5 دقائقكتابة ذاكرة مؤقتة ساعة واحدةقراءة الذاكرة المؤقتةالناتج لكل MTok
Claude Opus 5$5.00$6.25$10.00$0.50$25.00
Claude Opus 4.8$5.00$6.25$10.00$0.50$25.00
Claude Fable 5$10.00n/an/an/a$50.00
Claude Sonnet 5، السعر التمهيدي حتى 31 أغسطس 2026$2.00n/an/an/a$10.00
Claude Sonnet 5، اعتبارًا من 1 سبتمبر 2026$3.00n/an/an/a$15.00
Claude Haiku 4.5$1.00n/an/an/a$5.00

مضاعفات الذاكرة المؤقتة (cache) بنيوية، لذا يمكنك اشتقاق كل صف من سعر المدخلات الأساسي الخاص به. وثائق Anthropic تحمل السعر التمهيدي لـ Sonnet 5 والقيمتين 3 دولارات و15 دولارًا اللتين تحلان محله في 1 سبتمبر 2026.

النموذج المكلف هو الذي يملك سعر مدخلات مرتفعًا

اطّلع على جدول الأسعار على platform.claude.com

بما أن المدخلات هي المهيمنة، فإن النموذج الذي يؤلم محفظتك هو الذي يملك سعر مدخلات مرتفعًا، وليس الذي يملك أكبر رقم ناتج. Claude Fable 5 سعره 10 دولارات لكل مليون مدخل مقابل 5 دولارات لـ Opus 5، وفق جدول تسعير Anthropic، وهذا السعر المضاعف للمدخلات يصيب الـ 87% من فاتورتك التي هي حركة مرور الذاكرة المؤقتة (cache).

بإعادة التسعير على نفس حِمل العمل لمدة الشهرين، يظهر Fable 5 بتكلفة تبلغ نحو 1.9 ضعف تكلفة Opus 5. وهو تقريبًا مضاعف سعر مدخلاته بالضبط، وهذا بيت القصيد. تناولنا أين تستحق تلك القدرة أن تُدفع مقابلها في تقييمنا لـ Fable 5.

في الاتجاه المعاكس، ينعكس المنطق بشكل جميل. بسعر 2 دولار لكل مليون مدخل ضمن التسعير التمهيدي، يخفّض Sonnet 5 البند المهيمن بنسبة 60% مقارنة بمستوى Opus، وبيانات الدورات المتطابقة لدينا تُظهر أنه يكتب أقل قليلًا لكل دورة مقارنة بـ Opus 4.8 بدلًا من أن يكتب أكثر.

رافعتان فعّالتان، وواحدة غير فعّالة

وثائق Anthropic الخاصة بـ adaptive thinking تؤكد أن tokens المحاسَب عليها تبقى ثابتة بغض النظر عن إعداد العرض (display).
وثائق Anthropic الخاصة بـ adaptive thinking تؤكد أن tokens المحاسَب عليها تبقى ثابتة بغض النظر عن إعداد العرض (display).

اقرأها على platform.claude.com

الرافعة غير الفعّالة هي طلب إجابات أقصر. أنت تحسّن 12% من الفاتورة بينما تُضعف الشيء الذي تشتريه فعليًا، وهذا هو سبب تسليطنا الضوء على هذا النمط في فخ حِمية الـ token في الذكاء الاصطناعي.

الرافعتان الفعّالتان:

  • قلّل ما يُعاد إرساله. ملفات أقل في السياق، قراءات أضيق، ضغط (compact) قبل أن ينتفخ النص الكامل للمحادثة، وأنهِ الجلسة بدلًا من تركها راكدة بعد انتهاء TTL
  • طابِق النموذج مع سعر المدخلات. وجّه دورات الوكيل الروتينية إلى مستوى مدخلات أرخص، واحتفظ بالمستوى الأغلى للدورات التي تستحق فيها الدقة ثمنها

كلتاهما انضباط في السياق، وليس انضباطًا في الـ prompt. الآليات العملية موجودة في دليلنا لإدارة السياق في Claude Code.

كيف تقيس إنفاقك الخاص

اطّلع على مرجع الـ API على platform.claude.com

لا تثق بنسب أي أحد، بما في ذلك نسبنا. كل استجابة API تحمل كائن usage، وهو الحقيقة الأساسية بالنسبة لحِمل عملك الخاص.

  • سجّل usage في كل استجابة، وليس عينة منها، وأزل التكرار حسب معرّف الاستجابة (response id) قبل التجميع
  • قسّم المدخلات إلى أربع فئات: قراءة ذاكرة مؤقتة، كتابة 5 دقائق، كتابة ساعة واحدة، وغير مخزَّن مؤقتًا، لأن أسعارها مختلفة
  • اضرب كل فئة بسعرها الخاص بدلًا من الإبلاغ عن أعداد tokens الخام، لأن الأعداد تخفي الفارق البالغ 50 ضعفًا بين قراءة ذاكرة مؤقتة وtoken ناتج
  • قارن الأحرف المرئية مقابل tokens الناتج المحاسَب عليها لترى كم من الاستدلال تموّله فعليًا

بعد ظهرين من الرصد سيخبرانك أكثر مما تخبرك به كل مدونة تسعير على الإنترنت، بما فيها هذه.

الأسئلة الشائعة

هل يخفّض إخفاء ناتج التفكير فاتورتي؟

لا. تنص وثائق Anthropic الخاصة بـ adaptive thinking على أن tokens التفكير المحاسَب عليها لا تتغير مع إعداد العرض، فقط ما يُعاد إليك هو ما يتغير.

هل Claude Opus 5 أغلى من Opus 4.8؟

بالكاد. فهو يشارك بطاقة السعر ذاتها مع Opus 4.8 بمعدل 5 دولارات و25 دولارًا لكل مليون token وفق جدول تسعير Anthropic، ورغم أن مجموعتنا تُظهر أنه يكتب أكثر بنسبة 50% لكل دورة، فإن إعادة تسعير نفس حِمل العمل يضعه أعلى بنحو 5% فقط إجمالًا.

هل يجب أن أنتقل إلى Sonnet 5 لتوفير المال؟

بالنسبة للدورات الروتينية للوكيل، غالبًا نعم. يسرد جدول تسعير Anthropic أسعارًا تمهيدية قدرها 2 دولار لكل مليون مدخل حتى 31 أغسطس 2026، وهو ما يستهدف أكبر بند في فاتورتك بدلًا من أصغره.

هل يوفّر طلب إجابات أقصر المال؟

تقريبًا لا شيء. كان الناتج يمثل 12.1% من فاتورتنا المقاسة، لذا فإن تنصيفه يحرك الإجمالي بنحو ستة بالمئة فقط بينما يجعل العمل أسوأ.

لماذا ارتفعت فاتورتي في يوم لم أعمل فيه إلا قليلًا؟

فترات الخمول الطويلة. تضع وثائق Anthropic مدة الصلاحية الافتراضية للذاكرة المؤقتة عند خمس دقائق، لذا بمجرد انتهائها تُعيد الدورة التالية كتابة السياق بأكمله بمعدل 1.25 ضعف سعر المدخلات بدلًا من قراءته بمعدل 0.1 ضعف.

ما هو الإنفاق الشهري الطبيعي؟

تشير وثائق تكلفة Claude Code من Anthropic إلى نحو 13 دولارًا لكل مطوّر في اليوم النشط، وبين 150 و250 دولارًا شهريًا، مع بقاء 90% من المستخدمين دون 30 دولارًا في اليوم النشط. الاستخدام المكثف للوكلاء (agentic) يتجاوز ذلك بكثير.

الفاتورة هي مشكلة سياق

فاتورتك ليست مقياسًا لمقدار ما قاله النموذج. إنها مقياس لعدد المرات التي جعلته فيها يعيد قراءة مشروعك.

كل ما ورد هنا قِيس على جهاز عمل واحد على مدى ثلاثة أشهر، عبر 157,670 استجابة API من 26 أبريل إلى 26 يوليو 2026. هذا لا يُرسي معيارًا صناعيًا، وليس توقعًا من مزوّد الخدمة. إنه يُثبت أين ذهب المال بالنسبة لنا، بتفصيل كافٍ يتيح لك التحقق مما إذا كان الأمر نفسه ينطبق عليك.

بعد ذلك، سعّر عملك تبعًا لذلك، لأن تكلفة الأدوات لكل دورة أصبحت الآن بندًا حقيقيًا في أي مشروع تصميم، وليست هامش خطأ. تناولنا كيفية التعامل مع ذلك في تسعير أعمال التصميم المعزّزة بالذكاء الاصطناعي.

Want the working version of this, every week? Join the Brainy creator list.

Get Started

More from Brainy Papers

Keep reading