
Claude Sonnet 5.5 به Opus نزدیک شد؛ با نصف قیمت توکنی

بر پایهٔ مشخصات رسمی Claude Platform، Anthropic مدل Claude Sonnet 5.5 را در ۲۸ سپتامبر ۲۰۲۶ عرضه کرد؛ نرخ استاندارد هر میلیون توکن ورودی و خروجی آن ۲ و ۱۰ دلار است، در برابر ۴ و ۲۰ دلار برای Opus 5.5. وضعیت Sonnet در فهرست مدلها «فعال» است. این نصفشدن نرخ توکن، دربارهٔ تعرفهٔ API است و بهتنهایی هزینهٔ نهایی انجام هر کار را مشخص نمیکند.
گزارش Tom’s Guide پس از عرضهٔ ۲۸ سپتامبر از امتیاز ۱۸۴۴ برای Sonnet 5.5 در برابر ۱۸۴۶ برای Opus 5.5 در سنجهٔ وظایف شغلی خبر میدهد؛ این رسانه نتیجهٔ منتشرشده را گزارش کرده و مجری آزمون نبوده است. فاصلهٔ اندک در آن سنجه، همراه با قیمت پایینتر، Sonnet را برای کارهای مشخص و پرتکرار جدیتر میکند. اما سنجش مستقل Vals و جزئیات آزمون امنیتی نشان میدهند که برابری تقریبی یک امتیاز به معنی جایگزینی خودکار Opus در همهٔ کارها نیست.
تعرفهٔ API و دسترسی به مدل
نرخهای اعلامشده برای هر یک میلیون توکن، بسته به جهت مصرف، چنین است:
- Claude Sonnet 5.5: ورودی ۲ دلار و خروجی ۱۰ دلار.
- Claude Opus 5.5: ورودی ۴ دلار و خروجی ۲۰ دلار.
برای یک درخواست با ورودی و خروجی یکسان، هزینهٔ پایهٔ توکن Sonnet نصف میشود. اما درخواستها الزاماً با هر دو مدل به تعداد یکسانی توکن، فراخوانی ابزار یا تلاش برای رسیدن به پاسخ نیاز ندارند. صورتحساب واقعی همچنین میتواند با خواندن یا نوشتن کش و پردازش دستهای فرق کند؛ بنابراین نسبت تعرفه را نباید بیواسطه به نسبت هزینهٔ یک پروژه تبدیل کرد.
هر دو مدل پنجرهٔ زمینهٔ یک میلیون توکن و سقف خروجی معمول ۱۲۸ هزار توکن دارند. این همسانی برای برنامهای که متن بلند یا سابقهٔ گفتوگوی طولانی میفرستد مهم است: جابهجایی از Opus به Sonnet در مشخصات اعلامشده، ظرفیت اسمی زمینه را کم نمیکند. بااینحال اندازهٔ پنجرهٔ زمینه، معیاری برای کیفیت بازیابی جزئیات یا استدلال روی همهٔ بخشهای آن نیست؛ آن توانایی به مسئله و شیوهٔ استفاده بستگی دارد.
شناسهٔ مدل در Claude API برابر claude-sonnet-5-5 است و فهرست پلتفرمهای پشتیبانیشده، Amazon Bedrock، Google Cloud، Microsoft Foundry و Claude Platform on AWS را نیز دربرمیگیرد. برای یک مثال صرفاً حسابی، مصرف ۱۰۰ هزار توکن ورودی و ۱۰ هزار توکن خروجی با نرخ پایه، ۰٫۳۰ دلار برای Sonnet و ۰٫۶۰ دلار برای Opus هزینه دارد. این محاسبه فرض میکند هر دو مدل دقیقاً همان حجم توکن را مصرف کنند و تخفیف یا هزینهٔ کش در کار نباشد.
نزدیکی امتیازها در آزمون مستقل چقدر است؟
ارزیابی مستقل Vals در یادداشت روز عرضه، برای Sonnet 5.5 امتیاز ۶۹٫۲۲٪ و برای Opus 5.5 امتیاز ۶۹٫۶۹٪ در Vals Index ثبت کرد؛ فاصله فقط ۰٫۴۷ واحد درصد بود. هزینهٔ هر آزمون در همان مجموعه بهترتیب ۲۰٫۸۰ و ۳۲٫۷۷ دلار ثبت شد. بنابراین Sonnet در این اندازهگیری مشخص، نزدیک به رقیب گرانتر امتیاز گرفت و هزینهٔ اجرای آزمونش حدود ۳۶٫۵٪ کمتر بود. نمای زندهٔ صفحه هنگام بررسی در ۶ اکتبر، امتیاز ۶۷٫۰۴٪ و رتبهٔ دوم از میان ۴۳ مدل را برای Sonnet نشان میدهد؛ این عدد به مجموعهٔ مقایسهٔ روز عرضه با ۶۶ مدل تعلق ندارد.
این دو نوع قیمت، دو چیز متفاوت را اندازه میگیرند. تعرفهٔ رسمی، مبلغی است که برای حجم مشخصی از توکن ورودی یا خروجی تعیین شده؛ هزینهٔ هر آزمون، حاصل مصرف واقعی و مسیر اجرای همان آزمون است. فاصلهٔ هزینهٔ مشاهدهشده کمتر از نصف است، زیرا تعداد توکنها و رفتار مدلها در اجرای کار لزوماً یکسان نیست. برای مقایسهٔ اقتصادی یک کاربرد، باید هزینه را کنار نرخ موفقیت و میزان بازکاری همان کاربرد گذاشت؛ صرف ارزانتر بودن هر توکن پاسخ کافی نمیدهد.
رقم نزدیک در آزمون وظایف شغلی نیز ماهیت همان وظایف را بازتاب میدهد. کارهای آن سنجه از حرفههای مختلف میآیند و خروجی معینی برای ارزیابی دارند؛ این ویژگی با یک پروژهٔ مهندسی باز، گفتوگوی طولانی یا تصمیمی که چند فرض مبهم دارد فرق میکند. در نتیجه، نزدیکی دو امتیاز برای کارهای مشابه آن سنجه نشانهٔ معناداری است، اما به همهٔ شکلهای کدنویسی یا استدلال تعمیم مستقیم ندارد.
کدنویسی و امنیت، دو تصویر متفاوت
تفکیک نتایج مستقل در کدنویسی به نفع Sonnet است. در Code Migration امتیاز آن ۶۹٫۸۳٪ و رتبهاش نخست از میان ۷۳ مدل است؛ در Vibe Code Bench v1.1 نیز با ۹۲٫۳۹٪ نخست از میان ۱۰۸ مدل قرار دارد. این نتیجه برای انتقال کد و ساخت خروجی برنامهنویسی با معیار روشن، دلیل مشخصتری از امتیاز کلی فراهم میکند. البته رتبهٔ یک آزمون، موفقیت در هر مخزن یا هر ترکیب ابزار و دستور را تضمین نمیکند.
در CyberBench v1.1 تصویر متفاوت است: امتیاز ثبتشده ۵۹٫۵۸٪ و رتبهٔ مدل ۳۳ از میان ۴۴ است. در اجرای این ارزیابی، هنگام بعضی امتناعها Claude Sonnet 5 بهعنوان جایگزین سمت سرور وارد مسیر پاسخ شده است. اگر وظایف بهرهمند از آن جایگزینی به حساب شکست Sonnet 5.5 گذاشته شوند، امتیاز CyberBench به ۴۱٫۹۷٪ میرسد. بنابراین حتی عدد بالاتر را باید نتیجهٔ پیکربندی آزمون دانست، نه عملکرد خالص مدل اصلی در همهٔ وظایف امنیتی.
تفاوت امنیتی فقط اختلاف رتبه نیست؛ به این مربوط است که در بخشی از درخواستها کدام مدل واقعاً پاسخ داده و امتناع چگونه امتیازدهی شده است. این جزئیات برای تیمی که ابزار دفاعی یا بررسی آسیبپذیری میسازد، از نزدیکی امتیاز کلی مهمتر است. نتیجهٔ Code Migration هم جای نتیجهٔ CyberBench را نمیگیرد، چون مسئله، قواعد اجرا و معیار موفقیت آنها یکسان نیست.
Sonnet کجا جای Opus مینشیند؟
برای کار روزمرهای که ورودی و خروجی روشن و امکان بازبینی دارد، Sonnet 5.5 گزینهٔ اقتصادی معقولی است. نزدیکی در وظایف شغلی و نرخ توکن پایینتر این انتخاب را پشتیبانی میکنند، بهویژه وقتی تعداد درخواستها زیاد باشد. در چنین کاری ممکن است پاسخ کوتاهتر یا سریعتر ارزش عملی داشته باشد، اما عدد بنچمارک بهتنهایی کیفیت خروجی همان محصول را تعیین نمیکند.
برای مهاجرت کد، نتیجهٔ اختصاصی آزمون کدنویسی وزن بیشتری دارد. اگر معیار پذیرش، عبور از آزمونهای پروژه و پرهیز از تغییرات خارج از محدوده باشد، Sonnet را میتوان برای وظایف محدودتر در نظر گرفت و خروجی را با همان معیار سنجید. در پروژههای چندمرحلهای که معماری، وابستگیهای گسترده و تصمیمگیری مبهم درهمتنیدهاند، Opus همچنان گزینهٔ محتاطانهتری میماند؛ هزینهٔ بازکاری در اینجا میتواند صرفهجویی اولیهٔ توکن را از بین ببرد.
برای وظایف امنیتی، تفاوت میان امتیاز با جایگزین سمت سرور و امتیاز بدون کمک آن مانع از یک حکم ساده است. تیمی که تصمیم به مسیریابی درخواستها میگیرد باید بداند درخواست امنیتی در چه شرایطی با امتناع یا تغییر مسیر روبهرو میشود و نتیجهٔ کدام مدل را دریافت میکند. پیام این دادهها برای هزینهٔ API روشن است: نقطهٔ شروع ارزانتر برای کارهای معین قابل دفاع است، اما تصمیم دربارهٔ کارهای دشوار به هزینهٔ رسیدن به پاسخ پذیرفتنی بستگی دارد.
بیشتر بخوانید:
مقالات مرتبط


Scrum یا Kanban؛ نصفشدن زمان تحویل هنوز حکم عمومی نیست

GPT-6 Sol و Luna آمدند؛ اختلاف قیمت ۲۰ برابری برای دو نوع کار

ChatGPT Plus یا Claude Pro؛ قیمت برابر، سقف ابزارها متفاوت است

Codex یا Claude Code؛ سرعت بیشتر در برابر کنترل مجوزها

GitHub Copilot یا Cursor؛ نوع کار مهمتر از قیمت ماهانه است
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.