AI API का बजट बनाएँ—सिर्फ प्रति दस लाख टोकन की दर न देखें

AI API का मासिक बजट केवल मॉडल की प्रति दस लाख टोकन दर से नहीं निकलता। सफल और दोबारा किए गए प्रयासों के इनपुट, कैश किए गए इनपुट तथा पूरे बिल योग्य आउटपुट की लागत अलग निकालें; फिर खोज, कैश भंडारण, अन्य उपकरण, USD से INR रूपांतरण, भुगतान अधिभार और लागू कर जोड़ें।
हाथ से गणना के लिए पहले मासिक अनुरोध संख्या और प्रति प्रयास औसत उपयोग मापें। टोकन लागत, उपकरण शुल्क और भुगतान लागत को अलग पंक्तियों में रखने से संस्थापक देख सकता है कि MVP का खर्च किस धारणा से बदल रहा है और वास्तविक उपयोग मिलने पर अनुमान कहाँ सुधारना है।
बिल योग्य टोकन को सही श्रेणी में रखें
हर प्रयास के लिए बिना कैश वाला इनपुट, कैश किया इनपुट और आउटपुट अलग दर्ज करें। OpenAI का टोकन विवरण स्पष्ट करता है कि कैश इनपुट की दर सामान्य इनपुट से अलग हो सकती है और तर्क टोकन दिखाई देने वाले उत्तर में नहीं दिखते, फिर भी आउटपुट उपयोग में गिने तथा आउटपुट की तरह बिल किए जाते हैं। इसलिए तर्क टोकन को दर्ज करें, लेकिन यदि प्रदाता उन्हें कुल आउटपुट में पहले ही शामिल करता है तो दोबारा न जोड़ें।
शब्द या अक्षर गिनकर बनाया अनुमान केवल शुरुआती संकेत है, क्योंकि टोकन विभाजन मॉडल, भाषा और एन्कोडिंग के अनुसार बदल सकता है। MVP के प्रतिनिधि अनुरोध चलाकर उपयोग आँकड़ों से औसत निकालें; नमूने में छोटे, सामान्य और लंबे अनुरोध तथा उपकरण वाले कार्य शामिल हों।
मासिक आधार लागत का सूत्र

मासिक सफल अनुरोध निकालने के लिए सक्रिय दिनों को प्रतिदिन सफल अनुरोधों से गुणा करें। इसके बाद प्रत्येक टोकन श्रेणी की मासिक मात्रा को उसकी प्रति दस लाख टोकन दर से गुणा करें:
आधार लागत (USD) = मासिक सफल अनुरोध × ((औसत बिना कैश इनपुट × इनपुट दर + औसत कैश इनपुट × कैश दर + औसत बिल योग्य आउटपुट × आउटपुट दर) ÷ 1,000,000)
यह सूत्र केवल मॉडल टोकन का उप-योग देता है। OpenAI की API मूल्य-सूची दिखाती है कि वेब खोज की कॉल और खोज-सामग्री टोकन, फ़ाइल खोज की कॉल तथा उसका भंडारण अलग बिलिंग इकाइयाँ हो सकती हैं। चुने हुए प्रदाता, मॉडल और उपकरण की वर्तमान इकाई देखकर हर अतिरिक्त शुल्क की अलग पंक्ति बनाएँ।
हाथ से गणना करने योग्य उदाहरण
यह काल्पनिक उदाहरण है, किसी MVP के खर्च का वादा नहीं। मान लें कि सेवा महीने में 30 दिन चलती है और प्रतिदिन 2,000 सफल अनुरोध संभालती है। हर सफल अनुरोध में औसतन 700 बिना कैश इनपुट, 300 कैश इनपुट और 250 बिल योग्य आउटपुट टोकन हैं।
दरें समझाने के लिए Gemini 3.1 Flash-Lite का मानक भुगतान स्तर लिया गया है। Gemini Developer API की मूल्य-सूची में पाठ, चित्र और वीडियो के लिए इनपुट $0.25, संदर्भ कैश $0.025 और सोच टोकन सहित आउटपुट $1.50 प्रति दस लाख टोकन है; कैश भंडारण $1 प्रति दस लाख टोकन-घंटा है। उसी तालिका में Gemini 3.x मॉडल के बीच साझा 5,000 मासिक Google Search अनुरोधों के बाद $14 प्रति 1,000 खोज अनुरोध का शुल्क दिया गया है।
- मासिक सफल अनुरोध: 30 × 2,000 = 60,000
- बिना कैश इनपुट: 60,000 × 700 = 42 मिलियन टोकन; लागत $10.50
- कैश इनपुट: 60,000 × 300 = 18 मिलियन टोकन; लागत $0.45
- बिल योग्य आउटपुट: 60,000 × 250 = 15 मिलियन टोकन; लागत $22.50
- आधार मॉडल लागत: $33.45
इस परिणाम में सोच टोकन के लिए अलग शुल्क नहीं जोड़ा गया, क्योंकि उदाहरण की आउटपुट दर और 250 टोकन का औसत उन्हें पहले ही शामिल करते हैं। यदि उपयोग आँकड़ों में 250 केवल दिखाई देने वाला पाठ है, तो पहले उसमें औसत सोच टोकन मिलाकर बिल योग्य आउटपुट ठीक करना होगा।
खोज, कैश भंडारण और दोबारा प्रयास जोड़ें

एक उपयोगकर्ता अनुरोध और एक बिल योग्य खोज अनुरोध हमेशा समान नहीं होते: Gemini की मूल्य-सूची के अनुसार ग्राहक का एक अनुरोध Google Search में एक या अधिक खोज प्रश्न चला सकता है और शुल्क हर खोज प्रश्न पर लग सकता है। इसलिए खोज लागत को सफल API अनुरोधों से नहीं, प्रदाता द्वारा दर्ज वास्तविक खोज संख्या से निकालें।
काल्पनिक उदाहरण में पूरे महीने 12,000 खोज अनुरोध मानें। साझा मुफ्त सीमा में पहले 5,000 आने पर 7,000 बिल योग्य अनुरोधों की लागत $98 होगी। यदि 10,000 टोकन का स्पष्ट कैश 720 घंटे रखा जाए, तो $1 प्रति दस लाख टोकन-घंटा की उदाहरण दर पर भंडारण लागत $7.20 बनेगी।
अब अतिरिक्त प्रयास जोड़ें। मान लें कि सफल अनुरोधों के अलावा 2% प्रयास अनुप्रयोग द्वारा दोबारा किए जाते हैं और उनका औसत टोकन मिश्रण सफल प्रयास जैसा ही है; मॉडल लागत में $33.45 × 0.02 = $0.669 जुड़ेगा। यह केवल सरल धारणा है: यदि विफल प्रयास जल्दी रुकते हैं तो उनके वास्तविक टोकन लें, और यदि दोबारा प्रयास खोज भी चलाता है तो उसकी खोज अलग गिनें। इस उदाहरण का API उप-योग $33.45 + $98 + $7.20 + $0.669 = $139.319 है।
USD उप-योग को INR बजट में बदलें

भारतीय नकदी बजट के लिए भुगतान के समय लागू कार्ड या बैंक विनिमय दर रखें, न कि केवल सार्वजनिक मध्य-बाजार दर। विदेशी मुद्रा अधिभार और इनवॉइस पर लागू लेकिन API उप-योग में शामिल न किया गया कर अलग दर्ज करें:
अंतिम INR बजट = API उप-योग × भुगतान विनिमय दर × (1 + अधिभार दर) × (1 + लागू कर दर)
सिर्फ गणना दिखाने के लिए ₹87 प्रति USD, 2% अधिभार और 18% कर की काल्पनिक धारणाएँ लगाने पर $139.319 का परिणाम लगभग ₹14,589 बनता है। ये दरें वास्तविक देनदारी नहीं बतातीं; अपने भुगतान विवरण और कर चालान की वास्तविक संख्याएँ रखें तथा कर उपचार की पुष्टि योग्य कर सलाहकार से करें।
अनुमान को वास्तविक उपयोग से मिलाएँ
लॉन्च के बाद अनुमानित औसत को वास्तविक उपयोग से बदलें। OpenAI की उपयोग-जाँच प्रक्रिया के अनुसार Usage Dashboard में अवधि और परियोजना के आधार पर गतिविधि देखी जा सकती है, जबकि API उत्तर का usage क्षेत्र व्यक्तिगत अनुरोध के इनपुट, आउटपुट और कुल टोकन देता है; मॉडल और समापन बिंदु के अनुसार कैश तथा तर्क का विवरण भी मिल सकता है। बाधित स्ट्रीम में अंतिम उपयोग खंड न मिलना शून्य टोकन उपयोग का प्रमाण नहीं है।
- हर प्रयास के साथ स्थिति, मॉडल, इनपुट, कैश इनपुट, आउटपुट, तर्क और उपकरण कॉल दर्ज करें। इसके लिए संवेदनशील अनुरोध-पाठ रखना आवश्यक नहीं है।
- सफल, विफल और दोबारा किए गए प्रयास अलग गिनें। खोज प्रश्नों और कैश के टोकन-घंटों को भी उनकी अपनी इकाइयों में रखें।
- प्रदाता के उपयोग आँकड़ों को अनुप्रयोग लॉग से मिलाएँ। अंतर होने पर समय क्षेत्र, परियोजना चयन, बाधित स्ट्रीम और उपकरण की अतिरिक्त कॉल जाँचें।
- कम, अपेक्षित और अधिक उपयोग के परिदृश्य बनाएँ। अधिक उपयोग वाले परिदृश्य में अनुरोध संख्या के साथ आउटपुट लंबाई, खोज मात्रा और दोबारा प्रयास की दर भी बदलें।
इस तरह बजट एक अकेली टोकन दर नहीं, बल्कि जाँच योग्य लागत मॉडल बनता है। मॉडल बदलने, कैश बढ़ाने या खोज घटाने पर किस पंक्ति में कितना असर पड़ेगा, यह अलग से दिखाई देता है।
यह भी पढ़ें:
हमारे न्यूज़लेटर की सदस्यता लें
Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।