AI एजेंट टोकन लागत: आप असल में किस चीज़ के लिए पैसे देते हैं
157,670 असली Claude Code turns पर मापा गया, विज़िबल आउटपुट बिल का 12% है, cache reads 48% हैं, और जिन ज़्यादातर tokens के पैसे आप देते हैं वो आपको कभी दिखाए ही नहीं जाते।

हर कोई यह ऑप्टिमाइज़ करता है कि मॉडल कितना लिखता है। लिखना बिल का लगभग आठवां हिस्सा है।
छोटा जवाब
असली पैसा उस context में है जो आप हर turn पर दोबारा भेजते हैं, और उस reasoning में है जिसका बिल आपको भरना पड़ता है लेकिन जो आप कभी देख नहीं पाते। हमने एक workstation को इंस्ट्रूमेंट किया और 26 अप्रैल से 26 जुलाई 2026 के बीच, आखिरी दिन 08:25 UTC पर फ्रीज़ किए गए, 157,670 डीड्युप्लिकेटेड Claude Code API responses पर usage ऑब्जेक्ट रिकॉर्ड किया। रिकॉर्ड किया गया, अनुमान नहीं लगाया गया।
उस corpus में, विज़िबल आउटपुट Opus 4.8 के खर्च का 12.1% है। Cache reads 48% लेते हैं। Cache writes 39% लेते हैं, और असल में uncached input 1% से कम, यानी राउंडिंग एरर जितना है।
यह एक workstation है जो एक ही तरह का काम कर रही है, इसलिए इन अनुपातों को एक यूनिवर्सल कॉन्स्टेंट नहीं बल्कि एक शेप की तरह देखें। जो मायने रखता है वो यह शेप है, और यह शेप वो नहीं है जिसे ऑप्टिमाइज़ करने के लिए ज़्यादातर लोगों से कहा जाता है।

आपसे असल में किस चीज़ का बिल लिया जाता है
एक एजेंट turn कोई चैट मैसेज नहीं है। हर turn पूरे working context को, system prompt को, tool definitions को, पहले से पढ़ी गई फ़ाइलों को, और पूरी पिछली transcript को दोबारा भेजता है। अगर यह मैकेनिज़्म आपके लिए नया है, तो हमने इसे context window असल में कैसे काम करता है में विस्तार से समझाया है।
Anthropic के prompt caching docs, जिन्हें 26 जुलाई 2026 को वेरीफाई किया गया, इन resends की कीमत तीन अलग-अलग tiers पर तय करते हैं। 5 मिनट के TTL पर एक cache write, base input rate का 1.25 गुना लेता है, 1 घंटे के TTL पर एक write 2 गुना लेता है, और एक cache read 0.1 गुना लेता है। उन्हीं docs के अनुसार, breakpoint सेट करना मुफ़्त है, इसलिए आपसे सिर्फ़ असल में written या read हुए tokens का ही चार्ज लिया जाता है।
हमारे मापे गए शेयर्स का इस्तेमाल करते हुए, यह रहा एक असली बिल का ढांचा।
| Token का प्रकार | मापे गए बिल का हिस्सा | base input की तुलना में rate | यह असल में क्या है |
|---|---|---|---|
| Cache reads | 48% | 0.1x | context जो दोबारा भेजा गया और बाद के turn में मैच हुआ |
| Cache writes | 39% | 5 मिनट पर 1.25x, 1 घंटे पर 2x | वो context जो स्टोर किया गया ताकि अगला turn उसे सस्ते में पढ़ सके |
| Output | 12.1% | Opus 5 पर 5x | विज़िबल टेक्स्ट के साथ बिल्ड होने वाला reasoning |
| Uncached input | 1% से कम | 1x | दुर्लभ cold miss |
उस टेबल को दो बार पढ़ें। सबसे सस्ता per-token लाइन आइटम इनवॉइस की सबसे बड़ी लाइन है, क्योंकि volume, rate पर भारी पड़ता है।

आपके ज़्यादातर आउटपुट tokens अदृश्य हैं

इसे platform.claude.com पर पढ़ें
Reasoning tokens का बिल स्टैंडर्ड आउटपुट rate पर आउटपुट के तौर पर लिया जाता है। Anthropic का extended thinking डॉक्यूमेंटेशन साफ़ तौर पर कहता है कि आपसे पूरे thinking tokens का बिल लिया जाता है जबकि API एक संक्षिप्त सारांश लौटाता है, इसलिए जो नंबर आप pay करते हैं और जो नंबर आप पढ़ पाते हैं, वो दो अलग नंबर हैं।
Anthropic के adaptive thinking docs से मिलने वाला अहम निष्कर्ष यह है कि billed thinking display सेटिंग के साथ नहीं बदलती। reasoning पैनल बंद करने से आपका टर्मिनल शांत हो जाता है, लेकिन आपका इनवॉइस बिल्कुल वही रहता है।
यह अंतर हम बाहर से भी देख सकते हैं। सिर्फ़-prose turns पर, हमारा corpus Opus 5 पर प्रति billed आउटपुट token 2.7 विज़िबल characters दर्ज करता है, जबकि सामान्य English टेक्स्ट के लिए यह लगभग 4.0 characters प्रति token होता है। आपने आउटपुट के तौर पर जितना pay किया, उसका करीब एक तिहाई हिस्सा आपकी स्क्रीन तक पहुँचा ही नहीं।
यह कोई घोटाला नहीं है। यह प्रोडक्ट जैसा डिज़ाइन किया गया है वैसे ही काम कर रहा है, और reasoning की गहराई एक ऐसा डायल है जिसे आप display flags के बजाय effort levels के ज़रिए कंट्रोल करते हैं।
Cache reads ही असली बिल हैं

इसे platform.claude.com पर पढ़ें
एक cache read सस्ता और स्थिर होता है। जो context पढ़ा जा रहा है वो पूरे session भर बढ़ता रहता है, और हर एक turn पर उसे दोबारा पढ़ा जाता है, इसलिए यह सस्ती चीज़ बढ़ते-बढ़ते सबसे बड़ी चीज़ बन जाती है।
यही वजह है कि idle time भी पैसे खर्च करता है। Anthropic के prompt caching docs, जिन्हें 26 जुलाई 2026 को वेरीफाई किया गया, डिफ़ॉल्ट cache lifetime को पांच मिनट पर रखते हैं, जो हर बार cached content इस्तेमाल होने पर रीफ्रेश हो जाती है। अगर सेशन उससे ज़्यादा देर बैठा रहे, तो अगला turn 0.1 गुना पर read करने की बजाय input rate का 1.25 गुना देकर एक फ्रेश write का पेमेंट करता है। एक एजेंट वर्कफ़्लो में कॉफ़ी ब्रेक भी एक billable इवेंट है।
Anthropic के अपने Claude Code cost डॉक्यूमेंटेशन के अनुसार, enterprise usage लगभग $13 प्रति डेवलपर प्रति एक्टिव दिन और $150 से $250 प्रति डेवलपर प्रति महीना है, और 90% यूज़र्स प्रति एक्टिव दिन $30 से कम पर रहते हैं। हमारा corpus उसी रेंज में, Opus 4.8 पर $0.25 प्रति turn पर बैठता है। यहाँ वेरिएबल verbosity नहीं बल्कि turn count गुणा context size है।
Opus 5 ज़्यादा लिखता है और लगभग उतनी ही कीमत लेता है
Claude Opus 5, Opus 4.8 से साफ़ तौर पर ज़्यादा बातूनी है। हमारे corpus में matched turns पर, Opus 5 का औसत 3,882 आउटपुट tokens है जबकि Opus 4.8 का 2,582, यानी 50% की बढ़ोतरी, और non-overlapping bootstrap 95% इंटरवल्स के साथ। यह एक असली व्यवहारिक अंतर है, sampling noise नहीं।
अब वो हिस्सा जिसे लोग ग़लत समझते हैं। Anthropic की प्रकाशित pricing table, जिसे 26 जुलाई 2026 को वेरीफाई किया गया, Opus 5 और Opus 4.8 को एक जैसा price card देती है, $5 प्रति मिलियन input tokens और $25 प्रति मिलियन output tokens, matching cache tiers के साथ। अगर आउटपुट बिल का सिर्फ़ 12.1% है, तो आउटपुट में 50% की बढ़ोतरी टोटल को लगभग 6% ही बदलती है।
हमने पूरे दो महीने के workload को हर मॉडल की rates के हिसाब से दोबारा प्राइस किया। Opus 5, Opus 4.8 से लगभग 5% ऊपर बैठता है। अगर आपको पुराने मॉडल की economics पसंद थी, जैसा हमने अपने Opus 4.8 फ़ील्ड नोट्स में बताया था, तो नया मॉडल उतना बजट-वाला इवेंट नहीं है जितना दिखता है।
| मॉडल | प्रति MTok input | 5 मिनट cache write | 1 घंटा cache write | Cache read | प्रति MTok output |
|---|---|---|---|---|---|
| Claude Opus 5 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Opus 4.8 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Fable 5 | $10.00 | n/a | n/a | n/a | $50.00 |
| Claude Sonnet 5, 31 अगस्त 2026 तक इंट्रो रेट | $2.00 | n/a | n/a | n/a | $10.00 |
| Claude Sonnet 5, 1 सितंबर 2026 से | $3.00 | n/a | n/a | n/a | $15.00 |
| Claude Haiku 4.5 | $1.00 | n/a | n/a | n/a | $5.00 |
cache multipliers स्ट्रक्चरल हैं, इसलिए आप हर row को उसके base input rate से निकाल सकते हैं। Anthropic के docs में Sonnet 5 का इंट्रोडक्ट्री rate और वो $3 और $15 दोनों मौजूद हैं जो 1 सितंबर 2026 को इसकी जगह लेंगे।
महंगा मॉडल वही है जिसका input rate ज़्यादा है
price table platform.claude.com पर देखें
चूंकि input ही हावी रहता है, इसलिए जो मॉडल नुकसान पहुंचाता है वो वही है जिसका input rate ज़्यादा है, न कि वो जिसका आउटपुट नंबर सबसे बड़ा है। Anthropic की pricing table के अनुसार, Claude Fable 5 का rate $10 प्रति मिलियन input है जबकि Opus 5 का $5, और यह दोगुना input rate आपके बिल के उस 87% हिस्से पर पड़ता है जो cache traffic है।
हमारे उसी दो महीने के workload पर दोबारा प्राइस करने पर, Fable 5 की लागत Opus 5 से लगभग 1.9 गुना निकलती है। यह लगभग बिल्कुल उसके input multiplier जितना ही है, और यही पूरी बात है। हमने अपने Fable 5 असेसमेंट में बताया है कि कहाँ उस क्षमता के लिए पैसे देना सही है।
नीचे की तरफ़, यही लॉजिक अच्छे से पलट जाता है। इंट्रोडक्ट्री प्राइसिंग पर $2 प्रति मिलियन input के साथ, Sonnet 5, Opus tier की तुलना में सबसे बड़े लाइन आइटम को 60% तक घटा देता है, और हमारा matched-turn डेटा दिखाता है कि यह Opus 4.8 से प्रति turn ज़्यादा नहीं बल्कि थोड़ा कम लिखता है।
दो लीवर जो काम करते हैं, एक जो नहीं करता

इसे platform.claude.com पर पढ़ें
जो लीवर काम नहीं करता वो है छोटे जवाब मांगना। आप बिल के 12% को ऑप्टिमाइज़ कर रहे होते हैं जबकि उस चीज़ की क्वालिटी गिरा रहे होते हैं जो आप असल में खरीद रहे हैं, और यही वजह है कि हमने इस पैटर्न को AI token diet trap में उजागर किया।
जो दो काम करते हैं:
- जो दोबारा भेजा जाता है उसे कम करें। context में कम फ़ाइलें, संकरे reads, transcript फूलने से पहले compact करें, और सेशन को TTL के आगे idle छोड़ने की बजाय उसे खत्म करें
- मॉडल को input rate के हिसाब से मैच करें। रूटीन एजेंट turns को एक सस्ते input tier पर रूट करें और महंगे tier को उन turns के लिए रखें जहां accuracy का फ़ायदा हो
ये दोनों context discipline हैं, prompt discipline नहीं। इनकी व्यावहारिक जानकारी हमारी Claude Code context management गाइड में है।
अपना खुद का खर्च कैसे मापें
API reference platform.claude.com पर देखें
किसी के भी अनुपातों पर भरोसा न करें, हमारे भी नहीं। हर API response एक usage ऑब्जेक्ट लेकर आता है, और आपके अपने workload के लिए वही ग्राउंड ट्रुथ है।
- हर response पर
usageको लॉग करें, सैंपल पर नहीं, और aggregate करने से पहले response id से डीड्युप्लिकेट करें - input को चार buckets में बांटें, cache read, 5 मिनट write, 1 घंटा write, और uncached, क्योंकि इनकी कीमत अलग-अलग होती है
- raw token counts रिपोर्ट करने की बजाय हर bucket को उसकी अपनी rate से गुणा करें, क्योंकि counts एक cache read और एक output token के बीच के 50x स्प्रेड को छुपा देते हैं
- यह देखने के लिए कि आप कितना reasoning फ़ंड कर रहे हैं, विज़िबल characters की तुलना billed आउटपुट tokens से करें
इंस्ट्रूमेंटेशन के दो दोपहर आपको इंटरनेट के हर pricing ब्लॉग से ज़्यादा बता देंगे, यह वाला भी शामिल है।
अक्सर पूछे जाने वाले सवाल
क्या thinking आउटपुट छिपाने से मेरा बिल कम होता है?
नहीं। Anthropic के adaptive thinking docs कहते हैं कि billed thinking tokens display सेटिंग के साथ नहीं बदलते, सिर्फ़ जो आपको लौटाया जाता है वो बदलता है।
क्या Claude Opus 5, Opus 4.8 से ज़्यादा महंगा है?
मुश्किल से। Anthropic की pricing table के अनुसार यह Opus 4.8 के साथ $5 और $25 प्रति मिलियन tokens का price card शेयर करता है, और भले ही हमारा corpus दिखाता है कि यह प्रति turn 50% ज़्यादा लिखता है, वही workload दोबारा प्राइस करने पर यह कुल मिलाकर लगभग 5% ज़्यादा बैठता है।
क्या पैसे बचाने के लिए मुझे Sonnet 5 पर स्विच करना चाहिए?
रूटीन एजेंट turns के लिए, शायद हां। Anthropic की pricing table 31 अगस्त 2026 तक $2 प्रति मिलियन input की इंट्रोडक्ट्री rates लिस्ट करती है, जो आपके इनवॉइस की सबसे छोटी नहीं बल्कि सबसे बड़ी लाइन पर वार करती है।
क्या छोटे जवाब मांगने से पैसे बचते हैं?
लगभग कुछ भी नहीं। हमारे मापे गए बिल में आउटपुट 12.1% था, इसलिए इसे आधा करने से टोटल लगभग छह प्रतिशत बदलता है, वो भी काम की क्वालिटी खराब करते हुए।
जिस दिन मैंने मुश्किल से काम किया, उस दिन मेरा बिल क्यों बढ़ गया?
लंबे idle गैप्स। Anthropic के docs डिफ़ॉल्ट cache lifetime को पांच मिनट पर रखते हैं, इसलिए एक बार यह एक्सपायर हो जाए तो अगला turn पूरे context को 0.1 गुना पर पढ़ने की बजाय input rate के 1.25 गुना पर दोबारा लिखता है।
एक सामान्य मासिक खर्च क्या है?
Anthropic के Claude Code cost docs लगभग $13 प्रति डेवलपर प्रति एक्टिव दिन और $150 से $250 प्रति महीना बताते हैं, और 90% यूज़र्स प्रति एक्टिव दिन $30 से कम पर रहते हैं। भारी agentic इस्तेमाल इससे कहीं ज़्यादा जाता है।
बिल एक context समस्या है
आपका इनवॉइस इस बात का माप नहीं है कि मॉडल ने कितना कहा। यह इस बात का माप है कि आपने उससे अपने प्रोजेक्ट को कितनी बार दोबारा पढ़वाया।
यहाँ जो कुछ भी बताया गया है वो एक workstation पर तीन महीनों में, 26 अप्रैल से 26 जुलाई 2026 तक के 157,670 API responses पर मापा गया है। यह कोई इंडस्ट्री बेंचमार्क स्थापित नहीं करता, और न ही यह कोई vendor फ़ोरकास्ट है। यह इतना बताता है कि हमारा पैसा कहाँ गया, और इतनी डिटेल में कि आप चेक कर सकें कि आपके लिए भी यही सच है या नहीं।
फिर उसी हिसाब से अपने काम की कीमत तय करें, क्योंकि per-turn tooling कॉस्ट अब एक design engagement में एक असली लाइन है, राउंडिंग एरर नहीं। हमने बताया है कि इसे कैसे संभालें AI-augmented design work की प्राइसिंग में।
Want the working version of this, every week? Join the Brainy creator list.
Get Started




