Claude Sonnet 5.5 به Opus نزدیک شد؛ با نصف قیمت توکنی

|نویسنده: تیم تحریریه QUASA|6 دقیقه مطالعه| 1
Claude Sonnet 5.5 به Opus نزدیک شد؛ با نصف قیمت توکنی

بر پایهٔ مشخصات رسمی Claude Platform، Anthropic مدل Claude Sonnet 5.5 را در ۲۸ سپتامبر ۲۰۲۶ عرضه کرد؛ نرخ استاندارد هر میلیون توکن ورودی و خروجی آن ۲ و ۱۰ دلار است، در برابر ۴ و ۲۰ دلار برای Opus 5.5. وضعیت Sonnet در فهرست مدل‌ها «فعال» است. این نصف‌شدن نرخ توکن، دربارهٔ تعرفهٔ API است و به‌تنهایی هزینهٔ نهایی انجام هر کار را مشخص نمی‌کند.

گزارش Tom’s Guide پس از عرضهٔ ۲۸ سپتامبر از امتیاز ۱۸۴۴ برای Sonnet 5.5 در برابر ۱۸۴۶ برای Opus 5.5 در سنجهٔ وظایف شغلی خبر می‌دهد؛ این رسانه نتیجهٔ منتشرشده را گزارش کرده و مجری آزمون نبوده است. فاصلهٔ اندک در آن سنجه، همراه با قیمت پایین‌تر، Sonnet را برای کارهای مشخص و پرتکرار جدی‌تر می‌کند. اما سنجش مستقل Vals و جزئیات آزمون امنیتی نشان می‌دهند که برابری تقریبی یک امتیاز به معنی جایگزینی خودکار Opus در همهٔ کارها نیست.

تعرفهٔ API و دسترسی به مدل

نرخ‌های اعلام‌شده برای هر یک میلیون توکن، بسته به جهت مصرف، چنین است:

  • Claude Sonnet 5.5: ورودی ۲ دلار و خروجی ۱۰ دلار.
  • Claude Opus 5.5: ورودی ۴ دلار و خروجی ۲۰ دلار.

برای یک درخواست با ورودی و خروجی یکسان، هزینهٔ پایهٔ توکن Sonnet نصف می‌شود. اما درخواست‌ها الزاماً با هر دو مدل به تعداد یکسانی توکن، فراخوانی ابزار یا تلاش برای رسیدن به پاسخ نیاز ندارند. صورت‌حساب واقعی همچنین می‌تواند با خواندن یا نوشتن کش و پردازش دسته‌ای فرق کند؛ بنابراین نسبت تعرفه را نباید بی‌واسطه به نسبت هزینهٔ یک پروژه تبدیل کرد.

هر دو مدل پنجرهٔ زمینهٔ یک میلیون توکن و سقف خروجی معمول ۱۲۸ هزار توکن دارند. این همسانی برای برنامه‌ای که متن بلند یا سابقهٔ گفت‌وگوی طولانی می‌فرستد مهم است: جابه‌جایی از Opus به Sonnet در مشخصات اعلام‌شده، ظرفیت اسمی زمینه را کم نمی‌کند. بااین‌حال اندازهٔ پنجرهٔ زمینه، معیاری برای کیفیت بازیابی جزئیات یا استدلال روی همهٔ بخش‌های آن نیست؛ آن توانایی به مسئله و شیوهٔ استفاده بستگی دارد.

شناسهٔ مدل در Claude API برابر claude-sonnet-5-5 است و فهرست پلتفرم‌های پشتیبانی‌شده، Amazon Bedrock، Google Cloud، Microsoft Foundry و Claude Platform on AWS را نیز دربرمی‌گیرد. برای یک مثال صرفاً حسابی، مصرف ۱۰۰ هزار توکن ورودی و ۱۰ هزار توکن خروجی با نرخ پایه، ۰٫۳۰ دلار برای Sonnet و ۰٫۶۰ دلار برای Opus هزینه دارد. این محاسبه فرض می‌کند هر دو مدل دقیقاً همان حجم توکن را مصرف کنند و تخفیف یا هزینهٔ کش در کار نباشد.

نزدیکی امتیازها در آزمون مستقل چقدر است؟

ارزیابی مستقل Vals در یادداشت روز عرضه، برای Sonnet 5.5 امتیاز ۶۹٫۲۲٪ و برای Opus 5.5 امتیاز ۶۹٫۶۹٪ در Vals Index ثبت کرد؛ فاصله فقط ۰٫۴۷ واحد درصد بود. هزینهٔ هر آزمون در همان مجموعه به‌ترتیب ۲۰٫۸۰ و ۳۲٫۷۷ دلار ثبت شد. بنابراین Sonnet در این اندازه‌گیری مشخص، نزدیک به رقیب گران‌تر امتیاز گرفت و هزینهٔ اجرای آزمونش حدود ۳۶٫۵٪ کمتر بود. نمای زندهٔ صفحه هنگام بررسی در ۶ اکتبر، امتیاز ۶۷٫۰۴٪ و رتبهٔ دوم از میان ۴۳ مدل را برای Sonnet نشان می‌دهد؛ این عدد به مجموعهٔ مقایسهٔ روز عرضه با ۶۶ مدل تعلق ندارد.

این دو نوع قیمت، دو چیز متفاوت را اندازه می‌گیرند. تعرفهٔ رسمی، مبلغی است که برای حجم مشخصی از توکن ورودی یا خروجی تعیین شده؛ هزینهٔ هر آزمون، حاصل مصرف واقعی و مسیر اجرای همان آزمون است. فاصلهٔ هزینهٔ مشاهده‌شده کمتر از نصف است، زیرا تعداد توکن‌ها و رفتار مدل‌ها در اجرای کار لزوماً یکسان نیست. برای مقایسهٔ اقتصادی یک کاربرد، باید هزینه را کنار نرخ موفقیت و میزان بازکاری همان کاربرد گذاشت؛ صرف ارزان‌تر بودن هر توکن پاسخ کافی نمی‌دهد.

رقم نزدیک در آزمون وظایف شغلی نیز ماهیت همان وظایف را بازتاب می‌دهد. کارهای آن سنجه از حرفه‌های مختلف می‌آیند و خروجی معینی برای ارزیابی دارند؛ این ویژگی با یک پروژهٔ مهندسی باز، گفت‌وگوی طولانی یا تصمیمی که چند فرض مبهم دارد فرق می‌کند. در نتیجه، نزدیکی دو امتیاز برای کارهای مشابه آن سنجه نشانهٔ معناداری است، اما به همهٔ شکل‌های کدنویسی یا استدلال تعمیم مستقیم ندارد.

کدنویسی و امنیت، دو تصویر متفاوت

تفکیک نتایج مستقل در کدنویسی به نفع Sonnet است. در Code Migration امتیاز آن ۶۹٫۸۳٪ و رتبه‌اش نخست از میان ۷۳ مدل است؛ در Vibe Code Bench v1.1 نیز با ۹۲٫۳۹٪ نخست از میان ۱۰۸ مدل قرار دارد. این نتیجه برای انتقال کد و ساخت خروجی برنامه‌نویسی با معیار روشن، دلیل مشخص‌تری از امتیاز کلی فراهم می‌کند. البته رتبهٔ یک آزمون، موفقیت در هر مخزن یا هر ترکیب ابزار و دستور را تضمین نمی‌کند.

در CyberBench v1.1 تصویر متفاوت است: امتیاز ثبت‌شده ۵۹٫۵۸٪ و رتبهٔ مدل ۳۳ از میان ۴۴ است. در اجرای این ارزیابی، هنگام بعضی امتناع‌ها Claude Sonnet 5 به‌عنوان جایگزین سمت سرور وارد مسیر پاسخ شده است. اگر وظایف بهره‌مند از آن جایگزینی به حساب شکست Sonnet 5.5 گذاشته شوند، امتیاز CyberBench به ۴۱٫۹۷٪ می‌رسد. بنابراین حتی عدد بالاتر را باید نتیجهٔ پیکربندی آزمون دانست، نه عملکرد خالص مدل اصلی در همهٔ وظایف امنیتی.

تفاوت امنیتی فقط اختلاف رتبه نیست؛ به این مربوط است که در بخشی از درخواست‌ها کدام مدل واقعاً پاسخ داده و امتناع چگونه امتیازدهی شده است. این جزئیات برای تیمی که ابزار دفاعی یا بررسی آسیب‌پذیری می‌سازد، از نزدیکی امتیاز کلی مهم‌تر است. نتیجهٔ Code Migration هم جای نتیجهٔ CyberBench را نمی‌گیرد، چون مسئله، قواعد اجرا و معیار موفقیت آن‌ها یکسان نیست.

Sonnet کجا جای Opus می‌نشیند؟

برای کار روزمره‌ای که ورودی و خروجی روشن و امکان بازبینی دارد، Sonnet 5.5 گزینهٔ اقتصادی معقولی است. نزدیکی در وظایف شغلی و نرخ توکن پایین‌تر این انتخاب را پشتیبانی می‌کنند، به‌ویژه وقتی تعداد درخواست‌ها زیاد باشد. در چنین کاری ممکن است پاسخ کوتاه‌تر یا سریع‌تر ارزش عملی داشته باشد، اما عدد بنچمارک به‌تنهایی کیفیت خروجی همان محصول را تعیین نمی‌کند.

برای مهاجرت کد، نتیجهٔ اختصاصی آزمون کدنویسی وزن بیشتری دارد. اگر معیار پذیرش، عبور از آزمون‌های پروژه و پرهیز از تغییرات خارج از محدوده باشد، Sonnet را می‌توان برای وظایف محدودتر در نظر گرفت و خروجی را با همان معیار سنجید. در پروژه‌های چندمرحله‌ای که معماری، وابستگی‌های گسترده و تصمیم‌گیری مبهم درهم‌تنیده‌اند، Opus همچنان گزینهٔ محتاطانه‌تری می‌ماند؛ هزینهٔ بازکاری در اینجا می‌تواند صرفه‌جویی اولیهٔ توکن را از بین ببرد.

برای وظایف امنیتی، تفاوت میان امتیاز با جایگزین سمت سرور و امتیاز بدون کمک آن مانع از یک حکم ساده است. تیمی که تصمیم به مسیریابی درخواست‌ها می‌گیرد باید بداند درخواست امنیتی در چه شرایطی با امتناع یا تغییر مسیر روبه‌رو می‌شود و نتیجهٔ کدام مدل را دریافت می‌کند. پیام این داده‌ها برای هزینهٔ API روشن است: نقطهٔ شروع ارزان‌تر برای کارهای معین قابل دفاع است، اما تصمیم دربارهٔ کارهای دشوار به هزینهٔ رسیدن به پاسخ پذیرفتنی بستگی دارد.

بیشتر بخوانید:

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0