ai for designersJuly 26, 20269 min read

AI एजेंट टोकन लागत: आप असल में किस चीज़ के लिए पैसे देते हैं

157,670 असली Claude Code turns पर मापा गया, विज़िबल आउटपुट बिल का 12% है, cache reads 48% हैं, और जिन ज़्यादातर tokens के पैसे आप देते हैं वो आपको कभी दिखाए ही नहीं जाते।

By Boone
XLinkedIn
ai agent token costs

हर कोई यह ऑप्टिमाइज़ करता है कि मॉडल कितना लिखता है। लिखना बिल का लगभग आठवां हिस्सा है।

छोटा जवाब

असली पैसा उस context में है जो आप हर turn पर दोबारा भेजते हैं, और उस reasoning में है जिसका बिल आपको भरना पड़ता है लेकिन जो आप कभी देख नहीं पाते। हमने एक workstation को इंस्ट्रूमेंट किया और 26 अप्रैल से 26 जुलाई 2026 के बीच, आखिरी दिन 08:25 UTC पर फ्रीज़ किए गए, 157,670 डीड्युप्लिकेटेड Claude Code API responses पर usage ऑब्जेक्ट रिकॉर्ड किया। रिकॉर्ड किया गया, अनुमान नहीं लगाया गया।

उस corpus में, विज़िबल आउटपुट Opus 4.8 के खर्च का 12.1% है। Cache reads 48% लेते हैं। Cache writes 39% लेते हैं, और असल में uncached input 1% से कम, यानी राउंडिंग एरर जितना है।

यह एक workstation है जो एक ही तरह का काम कर रही है, इसलिए इन अनुपातों को एक यूनिवर्सल कॉन्स्टेंट नहीं बल्कि एक शेप की तरह देखें। जो मायने रखता है वो यह शेप है, और यह शेप वो नहीं है जिसे ऑप्टिमाइज़ करने के लिए ज़्यादातर लोगों से कहा जाता है।

एक बिलिंग आइसबर्ग का voxel इलस्ट्रेशन, एक विशाल छिपे हुए आधार के ऊपर छोटा दिखने वाला सिरा।
एक बिलिंग आइसबर्ग का voxel इलस्ट्रेशन, एक विशाल छिपे हुए आधार के ऊपर छोटा दिखने वाला सिरा।

आपसे असल में किस चीज़ का बिल लिया जाता है

एक एजेंट turn कोई चैट मैसेज नहीं है। हर turn पूरे working context को, system prompt को, tool definitions को, पहले से पढ़ी गई फ़ाइलों को, और पूरी पिछली transcript को दोबारा भेजता है। अगर यह मैकेनिज़्म आपके लिए नया है, तो हमने इसे context window असल में कैसे काम करता है में विस्तार से समझाया है।

Anthropic के prompt caching docs, जिन्हें 26 जुलाई 2026 को वेरीफाई किया गया, इन resends की कीमत तीन अलग-अलग tiers पर तय करते हैं। 5 मिनट के TTL पर एक cache write, base input rate का 1.25 गुना लेता है, 1 घंटे के TTL पर एक write 2 गुना लेता है, और एक cache read 0.1 गुना लेता है। उन्हीं docs के अनुसार, breakpoint सेट करना मुफ़्त है, इसलिए आपसे सिर्फ़ असल में written या read हुए tokens का ही चार्ज लिया जाता है।

हमारे मापे गए शेयर्स का इस्तेमाल करते हुए, यह रहा एक असली बिल का ढांचा।

Token का प्रकारमापे गए बिल का हिस्साbase input की तुलना में rateयह असल में क्या है
Cache reads48%0.1xcontext जो दोबारा भेजा गया और बाद के turn में मैच हुआ
Cache writes39%5 मिनट पर 1.25x, 1 घंटे पर 2xवो context जो स्टोर किया गया ताकि अगला turn उसे सस्ते में पढ़ सके
Output12.1%Opus 5 पर 5xविज़िबल टेक्स्ट के साथ बिल्ड होने वाला reasoning
Uncached input1% से कम1xदुर्लभ cold miss

उस टेबल को दो बार पढ़ें। सबसे सस्ता per-token लाइन आइटम इनवॉइस की सबसे बड़ी लाइन है, क्योंकि volume, rate पर भारी पड़ता है।

एक AI एजेंट का voxel इलस्ट्रेशन जो हर turn पर अपना पूरा context stack दोबारा भेज रहा है।
एक AI एजेंट का voxel इलस्ट्रेशन जो हर turn पर अपना पूरा context stack दोबारा भेज रहा है।

आपके ज़्यादातर आउटपुट tokens अदृश्य हैं

Anthropic का extended thinking डॉक्यूमेंटेशन जो billed और विज़िबल reasoning tokens के बीच का फ़र्क़ समझा रहा है।
Anthropic का extended thinking डॉक्यूमेंटेशन जो billed और विज़िबल reasoning tokens के बीच का फ़र्क़ समझा रहा है।

इसे platform.claude.com पर पढ़ें

Reasoning tokens का बिल स्टैंडर्ड आउटपुट rate पर आउटपुट के तौर पर लिया जाता है। Anthropic का extended thinking डॉक्यूमेंटेशन साफ़ तौर पर कहता है कि आपसे पूरे thinking tokens का बिल लिया जाता है जबकि API एक संक्षिप्त सारांश लौटाता है, इसलिए जो नंबर आप pay करते हैं और जो नंबर आप पढ़ पाते हैं, वो दो अलग नंबर हैं।

Anthropic के adaptive thinking docs से मिलने वाला अहम निष्कर्ष यह है कि billed thinking display सेटिंग के साथ नहीं बदलती। reasoning पैनल बंद करने से आपका टर्मिनल शांत हो जाता है, लेकिन आपका इनवॉइस बिल्कुल वही रहता है।

यह अंतर हम बाहर से भी देख सकते हैं। सिर्फ़-prose turns पर, हमारा corpus Opus 5 पर प्रति billed आउटपुट token 2.7 विज़िबल characters दर्ज करता है, जबकि सामान्य English टेक्स्ट के लिए यह लगभग 4.0 characters प्रति token होता है। आपने आउटपुट के तौर पर जितना pay किया, उसका करीब एक तिहाई हिस्सा आपकी स्क्रीन तक पहुँचा ही नहीं।

यह कोई घोटाला नहीं है। यह प्रोडक्ट जैसा डिज़ाइन किया गया है वैसे ही काम कर रहा है, और reasoning की गहराई एक ऐसा डायल है जिसे आप display flags के बजाय effort levels के ज़रिए कंट्रोल करते हैं।

Cache reads ही असली बिल हैं

Anthropic के prompt caching docs जो पांच मिनट की cache lifetime और refresh रूल दिखा रहे हैं।
Anthropic के prompt caching docs जो पांच मिनट की cache lifetime और refresh रूल दिखा रहे हैं।

इसे platform.claude.com पर पढ़ें

एक cache read सस्ता और स्थिर होता है। जो context पढ़ा जा रहा है वो पूरे session भर बढ़ता रहता है, और हर एक turn पर उसे दोबारा पढ़ा जाता है, इसलिए यह सस्ती चीज़ बढ़ते-बढ़ते सबसे बड़ी चीज़ बन जाती है।

यही वजह है कि idle time भी पैसे खर्च करता है। Anthropic के prompt caching docs, जिन्हें 26 जुलाई 2026 को वेरीफाई किया गया, डिफ़ॉल्ट cache lifetime को पांच मिनट पर रखते हैं, जो हर बार cached content इस्तेमाल होने पर रीफ्रेश हो जाती है। अगर सेशन उससे ज़्यादा देर बैठा रहे, तो अगला turn 0.1 गुना पर read करने की बजाय input rate का 1.25 गुना देकर एक फ्रेश write का पेमेंट करता है। एक एजेंट वर्कफ़्लो में कॉफ़ी ब्रेक भी एक billable इवेंट है।

Anthropic के अपने Claude Code cost डॉक्यूमेंटेशन के अनुसार, enterprise usage लगभग $13 प्रति डेवलपर प्रति एक्टिव दिन और $150 से $250 प्रति डेवलपर प्रति महीना है, और 90% यूज़र्स प्रति एक्टिव दिन $30 से कम पर रहते हैं। हमारा corpus उसी रेंज में, Opus 4.8 पर $0.25 प्रति turn पर बैठता है। यहाँ वेरिएबल verbosity नहीं बल्कि turn count गुणा context size है।

Opus 5 ज़्यादा लिखता है और लगभग उतनी ही कीमत लेता है

Claude Opus 5, Opus 4.8 से साफ़ तौर पर ज़्यादा बातूनी है। हमारे corpus में matched turns पर, Opus 5 का औसत 3,882 आउटपुट tokens है जबकि Opus 4.8 का 2,582, यानी 50% की बढ़ोतरी, और non-overlapping bootstrap 95% इंटरवल्स के साथ। यह एक असली व्यवहारिक अंतर है, sampling noise नहीं।

अब वो हिस्सा जिसे लोग ग़लत समझते हैं। Anthropic की प्रकाशित pricing table, जिसे 26 जुलाई 2026 को वेरीफाई किया गया, Opus 5 और Opus 4.8 को एक जैसा price card देती है, $5 प्रति मिलियन input tokens और $25 प्रति मिलियन output tokens, matching cache tiers के साथ। अगर आउटपुट बिल का सिर्फ़ 12.1% है, तो आउटपुट में 50% की बढ़ोतरी टोटल को लगभग 6% ही बदलती है।

हमने पूरे दो महीने के workload को हर मॉडल की rates के हिसाब से दोबारा प्राइस किया। Opus 5, Opus 4.8 से लगभग 5% ऊपर बैठता है। अगर आपको पुराने मॉडल की economics पसंद थी, जैसा हमने अपने Opus 4.8 फ़ील्ड नोट्स में बताया था, तो नया मॉडल उतना बजट-वाला इवेंट नहीं है जितना दिखता है।

मॉडलप्रति MTok input5 मिनट cache write1 घंटा cache writeCache readप्रति MTok output
Claude Opus 5$5.00$6.25$10.00$0.50$25.00
Claude Opus 4.8$5.00$6.25$10.00$0.50$25.00
Claude Fable 5$10.00n/an/an/a$50.00
Claude Sonnet 5, 31 अगस्त 2026 तक इंट्रो रेट$2.00n/an/an/a$10.00
Claude Sonnet 5, 1 सितंबर 2026 से$3.00n/an/an/a$15.00
Claude Haiku 4.5$1.00n/an/an/a$5.00

cache multipliers स्ट्रक्चरल हैं, इसलिए आप हर row को उसके base input rate से निकाल सकते हैं। Anthropic के docs में Sonnet 5 का इंट्रोडक्ट्री rate और वो $3 और $15 दोनों मौजूद हैं जो 1 सितंबर 2026 को इसकी जगह लेंगे।

महंगा मॉडल वही है जिसका input rate ज़्यादा है

price table platform.claude.com पर देखें

चूंकि input ही हावी रहता है, इसलिए जो मॉडल नुकसान पहुंचाता है वो वही है जिसका input rate ज़्यादा है, न कि वो जिसका आउटपुट नंबर सबसे बड़ा है। Anthropic की pricing table के अनुसार, Claude Fable 5 का rate $10 प्रति मिलियन input है जबकि Opus 5 का $5, और यह दोगुना input rate आपके बिल के उस 87% हिस्से पर पड़ता है जो cache traffic है।

हमारे उसी दो महीने के workload पर दोबारा प्राइस करने पर, Fable 5 की लागत Opus 5 से लगभग 1.9 गुना निकलती है। यह लगभग बिल्कुल उसके input multiplier जितना ही है, और यही पूरी बात है। हमने अपने Fable 5 असेसमेंट में बताया है कि कहाँ उस क्षमता के लिए पैसे देना सही है।

नीचे की तरफ़, यही लॉजिक अच्छे से पलट जाता है। इंट्रोडक्ट्री प्राइसिंग पर $2 प्रति मिलियन input के साथ, Sonnet 5, Opus tier की तुलना में सबसे बड़े लाइन आइटम को 60% तक घटा देता है, और हमारा matched-turn डेटा दिखाता है कि यह Opus 4.8 से प्रति turn ज़्यादा नहीं बल्कि थोड़ा कम लिखता है।

दो लीवर जो काम करते हैं, एक जो नहीं करता

Anthropic के adaptive thinking docs जो पुष्टि करते हैं कि display सेटिंग चाहे जो भी हो, billed tokens स्थिर रहते हैं।
Anthropic के adaptive thinking docs जो पुष्टि करते हैं कि display सेटिंग चाहे जो भी हो, billed tokens स्थिर रहते हैं।

इसे platform.claude.com पर पढ़ें

जो लीवर काम नहीं करता वो है छोटे जवाब मांगना। आप बिल के 12% को ऑप्टिमाइज़ कर रहे होते हैं जबकि उस चीज़ की क्वालिटी गिरा रहे होते हैं जो आप असल में खरीद रहे हैं, और यही वजह है कि हमने इस पैटर्न को AI token diet trap में उजागर किया।

जो दो काम करते हैं:

  • जो दोबारा भेजा जाता है उसे कम करें। context में कम फ़ाइलें, संकरे reads, transcript फूलने से पहले compact करें, और सेशन को TTL के आगे idle छोड़ने की बजाय उसे खत्म करें
  • मॉडल को input rate के हिसाब से मैच करें। रूटीन एजेंट turns को एक सस्ते input tier पर रूट करें और महंगे tier को उन turns के लिए रखें जहां accuracy का फ़ायदा हो

ये दोनों context discipline हैं, prompt discipline नहीं। इनकी व्यावहारिक जानकारी हमारी Claude Code context management गाइड में है।

अपना खुद का खर्च कैसे मापें

API reference platform.claude.com पर देखें

किसी के भी अनुपातों पर भरोसा न करें, हमारे भी नहीं। हर API response एक usage ऑब्जेक्ट लेकर आता है, और आपके अपने workload के लिए वही ग्राउंड ट्रुथ है।

  • हर response पर usage को लॉग करें, सैंपल पर नहीं, और aggregate करने से पहले response id से डीड्युप्लिकेट करें
  • input को चार buckets में बांटें, cache read, 5 मिनट write, 1 घंटा write, और uncached, क्योंकि इनकी कीमत अलग-अलग होती है
  • raw token counts रिपोर्ट करने की बजाय हर bucket को उसकी अपनी rate से गुणा करें, क्योंकि counts एक cache read और एक output token के बीच के 50x स्प्रेड को छुपा देते हैं
  • यह देखने के लिए कि आप कितना reasoning फ़ंड कर रहे हैं, विज़िबल characters की तुलना billed आउटपुट tokens से करें

इंस्ट्रूमेंटेशन के दो दोपहर आपको इंटरनेट के हर pricing ब्लॉग से ज़्यादा बता देंगे, यह वाला भी शामिल है।

अक्सर पूछे जाने वाले सवाल

क्या thinking आउटपुट छिपाने से मेरा बिल कम होता है?

नहीं। Anthropic के adaptive thinking docs कहते हैं कि billed thinking tokens display सेटिंग के साथ नहीं बदलते, सिर्फ़ जो आपको लौटाया जाता है वो बदलता है।

क्या Claude Opus 5, Opus 4.8 से ज़्यादा महंगा है?

मुश्किल से। Anthropic की pricing table के अनुसार यह Opus 4.8 के साथ $5 और $25 प्रति मिलियन tokens का price card शेयर करता है, और भले ही हमारा corpus दिखाता है कि यह प्रति turn 50% ज़्यादा लिखता है, वही workload दोबारा प्राइस करने पर यह कुल मिलाकर लगभग 5% ज़्यादा बैठता है।

क्या पैसे बचाने के लिए मुझे Sonnet 5 पर स्विच करना चाहिए?

रूटीन एजेंट turns के लिए, शायद हां। Anthropic की pricing table 31 अगस्त 2026 तक $2 प्रति मिलियन input की इंट्रोडक्ट्री rates लिस्ट करती है, जो आपके इनवॉइस की सबसे छोटी नहीं बल्कि सबसे बड़ी लाइन पर वार करती है।

क्या छोटे जवाब मांगने से पैसे बचते हैं?

लगभग कुछ भी नहीं। हमारे मापे गए बिल में आउटपुट 12.1% था, इसलिए इसे आधा करने से टोटल लगभग छह प्रतिशत बदलता है, वो भी काम की क्वालिटी खराब करते हुए।

जिस दिन मैंने मुश्किल से काम किया, उस दिन मेरा बिल क्यों बढ़ गया?

लंबे idle गैप्स। Anthropic के docs डिफ़ॉल्ट cache lifetime को पांच मिनट पर रखते हैं, इसलिए एक बार यह एक्सपायर हो जाए तो अगला turn पूरे context को 0.1 गुना पर पढ़ने की बजाय input rate के 1.25 गुना पर दोबारा लिखता है।

एक सामान्य मासिक खर्च क्या है?

Anthropic के Claude Code cost docs लगभग $13 प्रति डेवलपर प्रति एक्टिव दिन और $150 से $250 प्रति महीना बताते हैं, और 90% यूज़र्स प्रति एक्टिव दिन $30 से कम पर रहते हैं। भारी agentic इस्तेमाल इससे कहीं ज़्यादा जाता है।

बिल एक context समस्या है

आपका इनवॉइस इस बात का माप नहीं है कि मॉडल ने कितना कहा। यह इस बात का माप है कि आपने उससे अपने प्रोजेक्ट को कितनी बार दोबारा पढ़वाया।

यहाँ जो कुछ भी बताया गया है वो एक workstation पर तीन महीनों में, 26 अप्रैल से 26 जुलाई 2026 तक के 157,670 API responses पर मापा गया है। यह कोई इंडस्ट्री बेंचमार्क स्थापित नहीं करता, और न ही यह कोई vendor फ़ोरकास्ट है। यह इतना बताता है कि हमारा पैसा कहाँ गया, और इतनी डिटेल में कि आप चेक कर सकें कि आपके लिए भी यही सच है या नहीं।

फिर उसी हिसाब से अपने काम की कीमत तय करें, क्योंकि per-turn tooling कॉस्ट अब एक design engagement में एक असली लाइन है, राउंडिंग एरर नहीं। हमने बताया है कि इसे कैसे संभालें AI-augmented design work की प्राइसिंग में।

Want the working version of this, every week? Join the Brainy creator list.

Get Started

More from Brainy Papers

Keep reading