Hugging Face یا Replicate؛ ترافیک پراکنده هزینه را برعکس می‌کند

|نویسنده: تیم تحریریه QUASA|6 دقیقه مطالعه
Hugging Face یا Replicate؛ ترافیک پراکنده هزینه را برعکس می‌کند

برای مدل عمومی با درخواست‌های پراکنده، Replicate اغلب گزینهٔ کم‌هزینه‌تری است، چون طبق تعرفهٔ Replicate بیشتر مدل‌های عمومیِ زمان‌محور فقط هنگام پردازش درخواست هزینه دارند؛ نرخ سخت‌افزار T4 آن ۰٫۸۱ دلار در ساعت است. در مقابل، تعرفهٔ Hugging Face Inference Endpoints برای یک T4 روی AWS نرخ ۰٫۵۰ دلار در ساعت را نشان می‌دهد، اما زمان راه‌اندازی و روشن بودن نمونه نیز قابل پرداخت است و هزینه از روی دقیقه محاسبه می‌شود.

پس نرخ ساعتی پایین‌تر به‌تنهایی برنده را تعیین نمی‌کند. اگر نمونهٔ Hugging Face تمام ماه آمادهٔ پاسخ بماند و میان درخواست‌ها فاصلهٔ زیادی باشد، زمان بیکار هزینهٔ آن را بالا می‌برد؛ اگر بار پیوسته شود، نرخ پایین‌تر T4 می‌تواند ورق را برگرداند. این مزیت Replicate برای مدل عمومی را نباید به مدل خصوصی تعمیم داد: قواعد صورت‌حساب Replicate می‌گویند بیشتر مدل‌های خصوصی و استقرارهای اختصاصی برای راه‌اندازی، انتظار و پردازش هزینه دارند، هرچند مدل‌های تنظیم‌دقیق‌شده با راه‌اندازی سریع استثنا هستند.

واحد پرداخت با نوع استقرار عوض می‌شود

Inference Endpoints یک نمونهٔ اختصاصی از سخت‌افزار انتخاب‌شده را برای مدل نگه می‌دارد. وقتی حداقل یک نسخه باید همیشه روشن باشد، فاصلهٔ میان دو درخواست نیز بخشی از زمان قابل پرداخت است. اگر اوج ترافیک نسخه‌های بیشتری لازم داشته باشد، ساعت‌های روشن بودن آن‌ها به هزینهٔ نسخهٔ اصلی اضافه می‌شود. مزیت این شیوه، امکان انتخاب نوع نمونه و تعیین ظرفیت آمادهٔ پاسخ است؛ قیمت ماهانهٔ آن به مدت روشن بودن هر نسخه وابسته می‌ماند.

در Replicate، اجرای یک مدل عمومیِ زمان‌محور از ظرفیت مشترک استفاده می‌کند و هزینه به زمان پردازش درخواست مربوط است. همهٔ مدل‌های عمومی چنین تعرفه‌ای ندارند: بعضی بر اساس ورودی یا خروجی قیمت‌گذاری می‌شوند و نمی‌توان هزینه‌شان را با ضرب نرخ T4 در ساعت پردازش به دست آورد. استقرار اختصاصی Replicate کنترل بیشتری بر سخت‌افزار، ظرفیت و صف درخواست می‌دهد، ولی زمان آنلاین نمونه در آن قابل پرداخت است. بنابراین پیش از مقایسهٔ نرخ‌ها، باید معلوم باشد همان مدل در هر مسیر چگونه قیمت‌گذاری و اجرا می‌شود.

سه الگوی استفاده در یک ماه فرضی

محاسبه‌های این بخش مثال‌های فرضی برای یک T4 و ماهی ۷۳۰ ساعت‌اند. فرض می‌کنیم مدل عمومی Replicate واقعاً بر اساس زمان اجرای T4 قیمت دارد و یک نمونه در هر طرف برای بار موردنظر کافی است. «ساعت پردازش» مجموع زمان اجرای درخواست‌هاست؛ «ساعت آنلاین» زمان راه‌اندازی، پردازش و انتظار پیش از خاموش شدن را نیز دربر می‌گیرد. این حساب هزینهٔ پایهٔ سخت‌افزار را نشان می‌دهد، نه تأخیر یا ظرفیت اندازه‌گیری‌شدهٔ یک مدل مشخص.

ترافیک جهشی با مدل عمومی: فرض کنید درخواست‌ها در مجموع ۱۰۰ ساعت پردازش ایجاد کنند، اما لازم باشد Endpoint اختصاصی در تمام ماه آماده بماند. هزینهٔ زمان‌محور Replicate برابر ۱۰۰ × ۰٫۸۱، یعنی ۸۱ دلار می‌شود. برای Hugging Face، ۷۳۰ × ۰٫۵۰ برابر ۳۶۵ دلار است. با وجود نرخ ساعتی بالاتر Replicate، صورت‌حساب آن در این فرض پایین‌تر می‌افتد، چون ۶۳۰ ساعت باقی‌مانده در مدل عمومیِ زمان‌محور هزینهٔ پردازش ندارد.

ترافیک پیوسته با مدل عمومی: اگر مجموع پردازش به ۶۰۰ ساعت در همان ماه برسد، هزینهٔ فرضی Replicate برابر ۴۸۶ دلار می‌شود؛ Endpoint تک‌نسخه‌ایِ همیشه‌روشن Hugging Face همچنان ۳۶۵ دلار هزینه دارد. این نتیجه تنها وقتی برای انتخاب میزبان کاربرد دارد که همان یک نمونه بتواند بار و تأخیر موردنیاز را پاسخ دهد. درخواستی که هم‌زمان با درخواست‌های دیگر می‌رسد ممکن است به ظرفیت بیشتر یا صف نیاز داشته باشد؛ در آن صورت ساعت‌های نسخهٔ اضافی باید به برآورد اختصاصی افزوده شود.

مدل خصوصیِ همیشه آماده: حال فرض کنید پردازش واقعی فقط ۱۰۰ ساعت است، ولی مدل خصوصی باید در هر دو سرویس تمام ۷۳۰ ساعت آمادهٔ پاسخ بماند. اگر یک T4 در هر طرف کافی باشد، هزینهٔ Replicate برابر ۷۳۰ × ۰٫۸۱، یعنی ۵۹۱٫۳۰ دلار، و هزینهٔ Hugging Face برابر ۳۶۵ دلار خواهد بود. اختلاف با مثال جهشی از تغییر قاعدهٔ پرداخت می‌آید: برای بیشتر مدل‌های خصوصی Replicate، زمان انتظار نمونه هم در صورت‌حساب قرار می‌گیرد. اگر نمونه‌ها بخشی از ماه خاموش شوند، باید مدت آنلاین واقعی را جایگزین ۷۳۰ ساعت کرد.

مرز سربه‌سر T4 و استثنای H100

با فرض Endpoint همیشه‌روشن، مدل عمومیِ زمان‌محور و توان عملی قابل مقایسه روی T4، نسبت ۰٫۵۰ به ۰٫۸۱ حدود ۶۱٫۷ درصد است. یعنی اگر ساعت‌های پردازش Replicate کمتر از حدود ۶۱٫۷ درصد ساعت‌های آنلاین Endpoint باشد، فرمول ساده به سود Replicate است؛ بالاتر از این مرز، Hugging Face ارزان‌تر می‌شود. این مرز، نتیجهٔ حساب نرخ‌هاست و دربارهٔ سرعت یا تعداد پاسخ‌های قابل ارائه در یک ساعت چیزی نمی‌گوید. تغییر اندازهٔ مدل، هم‌زمانی درخواست‌ها یا تعداد نسخه‌های لازم می‌تواند مقایسهٔ هزینهٔ هر پاسخ را تغییر دهد.

مقایسهٔ مهندسی Markaicode نیز مرز تقریبی T4 را از نرخ‌های منتشرشده محاسبه کرده است، نه از آزمون زندهٔ تأخیر یا توان عملی. همان مقایسه برای H100 جهت متفاوتی را نشان می‌دهد: نرخ Replicate برابر ۵٫۴۹ دلار در ساعت و نرخ گزینهٔ GCP در Hugging Face برابر ۱۰ دلار در ساعت است. این دو قیمت به گزینه‌های سخت‌افزاری و ابری مشخص تعلق دارند؛ نتیجهٔ T4 را نمی‌توان بدون محاسبهٔ دوباره به GPU دیگر منتقل کرد.

خاموش شدن خودکار چه چیزی را تغییر می‌دهد؟

Hugging Face امکان کاهش تعداد نسخه‌های Endpoint به صفر را پس از دوره‌ای بدون درخواست فراهم می‌کند. راهنمای مقیاس‌دهی Hugging Face توضیح می‌دهد که درخواست بعدی با راه‌اندازی سرد روبه‌رو می‌شود؛ هنگام آماده شدن نسخه، پاسخ ۵۰۲ ممکن است برگردد و برای درخواست‌های ورودی در آن مرحله صف داخلی وجود ندارد. بنابراین کاهش هزینهٔ زمان بیکار با تغییر رفتار نخستین درخواست پس از خاموشی همراه است. طول راه‌اندازی نیز به مدل وابسته است.

برای دیدن اثر مالی، همان مثال فرضیِ ۱۰۰ ساعت پردازش را در نظر بگیرید. اگر Endpoint به‌جای تمام ماه فقط ۱۲۰ ساعت آنلاین بماند، هزینهٔ پایهٔ آن ۱۲۰ × ۰٫۵۰، یعنی ۶۰ دلار می‌شود؛ کمتر از ۸۱ دلار Replicate در مثال مدل عمومی. آن ۲۰ ساعت اضافه، فرضی برای راه‌اندازی و انتظار پیش از خاموشی است، نه پیش‌بینی رفتار سرویس. جهش‌های کوتاه و پرتعداد می‌توانند این زمان را بیشتر کنند، در حالی که فاصله‌های طولانی میان درخواست‌ها فرصت بیشتری برای خاموش ماندن نمونه می‌دهند.

انتخاب میزبان به مدل و پاسخ موردنیاز بستگی دارد

برای نمونهٔ اولیه‌ای که از مدل عمومیِ موجود استفاده می‌کند و درخواست‌هایش نامنظم است، پرداخت زمان پردازش در Replicate می‌تواند هزینهٔ اولیه را پایین نگه دارد. در ظرفیت مشترک، درخواست ممکن است با صف، راه‌اندازی سرد یا محدودیت مقیاس روبه‌رو شود. اگر مدل موردنظر تعرفهٔ ورودی یا خروجی دارد، یا باید نسخهٔ اختصاصی از آن اجرا شود، حساب ۰٫۸۱ دلار برای هر ساعت پردازش دیگر نمایندهٔ هزینهٔ آن نیست.

برای سرویس تولیدی با مدل مشخص و بار نسبتاً پیوسته، یک Endpoint اختصاصی روی T4 می‌تواند از نرخ ساعتی پایین‌تر Hugging Face بهره ببرد و انتخاب سخت‌افزار را در اختیار تیم بگذارد. برای مدل خصوصیِ کم‌ترافیک، پرسش تعیین‌کننده این است که نمونه چند ساعت باید بی‌وقفه آماده باشد و خاموش شدن خودکار چه اثری بر نخستین پاسخ می‌گذارد. بودجهٔ قابل اتکا باید زمان آنلاین همهٔ نسخه‌ها را در کنار ظرفیت و تأخیر همان مدل بسنجد؛ نرخ یک GPU به‌تنهایی هزینهٔ خدمت‌رسانی را تعیین نمی‌کند.

بیشتر بخوانید:

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0