Quasa
QUASA ऐप का उपयोग करें
आज ही Web3 क्रिप्टो फ्रीलांसिंग के अग्रणी मंच से जुड़ें!
खोलें
प्रौद्योगिकी

Cohere Parse का स्कोर 79.2—पर दो बेंचमार्क आयाम गिनती से बाहर

|लेखक: QUASA संपादकीय टीम|5 मिनट पढ़ने का समय
Cohere Parse का स्कोर 79.2—पर दो बेंचमार्क आयाम गिनती से बाहर

Cohere ने 27 अगस्त 2026 को Parse को सामान्य उपलब्धता में जारी किया। Cohere के आधिकारिक विवरण में API मूल्य 1.50 USD प्रति 1,000 पृष्ठ और ParseBench औसत 79.2 बताया गया है; यह औसत पांच में से केवल तीन मूल्यांकन आयामों को समेटता है।

यह दस्तावेज़ प्रसंस्करण प्रणाली PDF, PPT और JPEG पृष्ठों को पढ़ने के क्रम सहित संरचित Markdown में बदलती है। MarkTechPost की तकनीकी रिपोर्ट में 2.3 अरब मापदंड, नौ स्थिर भाषाएं और उपलब्ध तैनाती विकल्प दर्ज हैं; हिंदी स्थिर समर्थन वाली सूची में शामिल नहीं है।

कीमत, फाइलें, भाषाएं और तैनाती

Cohere Parse में PDF, PPT और JPEG से संरचित Markdown तथा प्रति 1,000 पृष्ठ 1.50 USD की API दर

प्रकाशित API मूल्य के हिसाब से एक पृष्ठ की अंकगणितीय लागत 0.0015 USD और 10,000 पृष्ठों की लागत 15 USD बैठती है। ये गणनाएं केवल घोषित पृष्ठ-दर पर आधारित हैं; इनमें भंडारण, संजाल, पूर्व-प्रसंस्करण, आरक्षित क्षमता या निजी तैनाती का खर्च शामिल नहीं है।

  • API मूल्य: 1.50 USD प्रति 1,000 पृष्ठ
  • प्रत्यक्ष इनपुट: PDF, PPT और JPEG पृष्ठ; अनुरोध में Base64-कूटबद्ध सामग्री भेजी जा सकती है
  • मुख्य आउटपुट: पढ़ने के क्रम वाला संरचित Markdown
  • निकाली जाने वाली सामग्री: पाठ, सूचियां, प्रपत्रों के कुंजी-मूल्य युग्म, तालिकाएं, चित्र-विवरण और उपलब्ध स्थान-सूचना
  • स्थिर भाषाएं: अरबी, अंग्रेजी, फ्रेंच, जर्मन, इतालवी, जापानी, कोरियाई, पुर्तगाली और स्पेनी
  • तैनाती विकल्प: Cohere API, मॉडल वॉल्ट, Microsoft Foundry और AWS SageMaker

मॉडल वॉल्ट साझा API से अलग एकल-किरायेदार प्रबंधित तैनाती है। निजी क्लाउड और स्थानीय अवसंरचना के विकल्प भी उपलब्धता के दायरे में रखे गए हैं, इसलिए सार्वजनिक पृष्ठ-दर को हर तैनाती व्यवस्था की कुल कीमत नहीं माना जा सकता।

भारत के लिए भाषा-सूची एक अहम सीमा तय करती है। अंग्रेजी स्थिर भाषाओं में है, लेकिन हिंदी नहीं; इसलिए अंग्रेजी और हिंदी वाले एक ही दस्तावेज़ पर समान स्थिर गुणवत्ता का दावा उपलब्ध जानकारी से स्थापित नहीं होता।

संरचित Markdown में क्या मिलता है

Cohere Parse द्वारा व्यावसायिक दस्तावेज़ से पाठ, तालिका, सूची और कुंजी-मूल्य सामग्री निकालने का परिणाम

Parse केवल अक्षर पहचान तक सीमित नहीं है। इसका घोषित काम दस्तावेज़ का पढ़ने का क्रम और अर्थपूर्ण संरचना बचाते हुए पाठ, सूचियां, प्रपत्र, तालिकाएं तथा चित्रों के विवरण निकालना है। इससे परिणाम को दस्तावेज़ अनुक्रमण, खोज और पुनर्प्राप्ति-संवर्धित AI प्रणालियों में आगे संसाधित किया जा सकता है।

मुख्य परिणाम Markdown है, हर प्रणाली के लिए पहले से तैयार सामान्य JSON नहीं। तालिकाएं Markdown के भीतर HTML संरचना में आ सकती हैं, जबकि वैकल्पिक खंड-आधारित परिणाम सामग्री के प्रकार और उपलब्ध स्थान-सूचना को अलग रख सकता है। एकीकरण तैयार करते समय उपभोक्ता प्रणाली को इन दोनों परिणाम रूपों में से उपयुक्त रूप संभालना होगा।

प्रत्यक्ष इनपुट और Cohere Compass की व्यापक दस्तावेज़-ग्रहण क्षमता एक ही बात नहीं हैं। Compass के माध्यम से DOCX, XLSX और HTML जैसी अतिरिक्त फाइलें ग्रहण की जा सकती हैं, लेकिन इससे वे Parse के घोषित प्रत्यक्ष इनपुट प्रारूप नहीं बन जातीं। अतिरिक्त प्रारूपों वाले कार्यप्रवाह में अलग ग्रहण और रूपांतरण परत की जरूरत पड़ सकती है।

संरचना सुरक्षित रहना तथ्यात्मक शुद्धता की गारंटी भी नहीं है। कमजोर स्कैन, जटिल बहु-पंक्ति तालिकाओं या अस्पष्ट पृष्ठ-विन्यास वाले दस्तावेज़ों में निकाली गई सामग्री की समीक्षा की जरूरत उपयोग के जोखिम पर निर्भर करेगी, विशेषकर जब परिणाम भुगतान, अनुपालन या नियामकीय निर्णय में जाए।

79.2 में तीन आयाम शामिल, दो बाहर

Cohere Parse के 79.2 औसत में तीन ParseBench आयाम शामिल और दो आयाम बाहर

प्रचारित 79.2 औसत तालिका निष्कर्षण, सामग्री-निष्ठा और अर्थपूर्ण प्रारूपण के परिणामों से बनता है। इन तीन आयामों के अंक क्रमशः 87.0, 86.6 और 64.0 हैं। तालिका परीक्षण कोशिकाओं तथा संरचना की शुद्धता देखता है, सामग्री-निष्ठा छूटे या गढ़े गए पाठ और बिगड़े पढ़ने के क्रम को मापती है, जबकि अर्थपूर्ण प्रारूपण उन संरचनात्मक संकेतों को जांचता है जिनसे सामग्री का आशय बदल सकता है।

मूल ParseBench शोध-पत्र बेंचमार्क को लगभग 2,000 मानव-सत्यापित व्यावसायिक दस्तावेज़ पृष्ठों तथा पांच आयामों—तालिकाएं, चार्ट, सामग्री-निष्ठा, अर्थपूर्ण प्रारूपण और दृश्य आधार-निर्धारण—पर परिभाषित करता है। Cohere के प्रकाशित औसत में चार्ट और दृश्य आधार-निर्धारण शामिल नहीं हैं। इसलिए 79.2 को पूरे पांच-आयामी ParseBench का संयुक्त परिणाम या उसकी सार्वजनिक क्रम-सूची में स्थान कहना सटीक नहीं होगा।

चार्ट आयाम का बाहर रहना खास तौर पर उन दस्तावेज़ों के लिए मायने रखता है जिनमें संख्यात्मक जानकारी मुख्यतः आलेखों में बंद है। प्रणाली किसी आलेख को वर्णन योग्य दृश्य तत्व की तरह संभाल सकती है, लेकिन उसकी संख्यात्मक शृंखलाओं को संरचित तालिका में बदलने की क्षमता इस प्रचारित औसत से प्रमाणित नहीं होती।

दूसरा बाहर रखा गया आयाम दृश्य आधार-निर्धारण है, जो निकाली गई सामग्री को पृष्ठ पर उसके स्थान से जोड़ने की क्षमता देखता है। Parse का केंद्र पढ़ने के क्रम वाला Markdown है; तालिकाओं या चित्रों के लिए कुछ स्थान-सूचना मिल सकती है, पर प्रत्येक पाठ तत्व के लिए श्रेणी सहित निर्देशांक देने का दावा नहीं किया गया है।

हिंदी समर्थन और दावे की शेष सीमाएं

हिंदी नौ स्थिर समर्थित भाषाओं में नहीं है। Cohere अनुशंसित सूची से बाहर की भाषाओं में भी प्रसंस्करण संभव बताता है, लेकिन वहां शुद्धता कम हो सकती है। देवनागरी सामग्री स्वीकार हो जाना हिंदी के लिए स्थिर उत्पादन-स्तरीय गुणवत्ता का प्रमाण नहीं माना जा सकता।

भारतीय उपयोग में अंग्रेजी-हिंदी द्विभाषी पृष्ठ, कमजोर स्कैन, सरकारी प्रपत्र, भारतीय अंक-लेखन और बहु-पंक्ति तालिकाएं अलग कठिनाइयां पैदा कर सकती हैं। अभी हिंदी के लिए अलग शुद्धता अंक, ParseBench उपसमूह या स्थिर समर्थन की समयसीमा प्रकाशित नहीं हुई है।

मौजूदा जानकारी कीमत, प्रत्यक्ष इनपुट, Markdown परिणाम, नौ स्थिर भाषाओं और तैनाती के रास्तों को स्पष्ट करती है। जो अभी उपलब्ध नहीं है, वह पूरे पांच-आयामी बेंचमार्क का तुलनीय परिणाम और हिंदी-केंद्रित सार्वजनिक मूल्यांकन है; इन्हीं के बिना 79.2 को हर दस्तावेज़ प्रकार और भारतीय भाषा-कार्यप्रवाह के लिए व्यापक गुणवत्ता अंक नहीं माना जा सकता।

साझा करें:

हमारे न्यूज़लेटर की सदस्यता लें

Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।

0