
Hugging Face یا Replicate؛ ترافیک پراکنده هزینه را برعکس میکند

برای مدل عمومی با درخواستهای پراکنده، Replicate اغلب گزینهٔ کمهزینهتری است، چون طبق تعرفهٔ Replicate بیشتر مدلهای عمومیِ زمانمحور فقط هنگام پردازش درخواست هزینه دارند؛ نرخ سختافزار T4 آن ۰٫۸۱ دلار در ساعت است. در مقابل، تعرفهٔ Hugging Face Inference Endpoints برای یک T4 روی AWS نرخ ۰٫۵۰ دلار در ساعت را نشان میدهد، اما زمان راهاندازی و روشن بودن نمونه نیز قابل پرداخت است و هزینه از روی دقیقه محاسبه میشود.
پس نرخ ساعتی پایینتر بهتنهایی برنده را تعیین نمیکند. اگر نمونهٔ Hugging Face تمام ماه آمادهٔ پاسخ بماند و میان درخواستها فاصلهٔ زیادی باشد، زمان بیکار هزینهٔ آن را بالا میبرد؛ اگر بار پیوسته شود، نرخ پایینتر T4 میتواند ورق را برگرداند. این مزیت Replicate برای مدل عمومی را نباید به مدل خصوصی تعمیم داد: قواعد صورتحساب Replicate میگویند بیشتر مدلهای خصوصی و استقرارهای اختصاصی برای راهاندازی، انتظار و پردازش هزینه دارند، هرچند مدلهای تنظیمدقیقشده با راهاندازی سریع استثنا هستند.
واحد پرداخت با نوع استقرار عوض میشود
Inference Endpoints یک نمونهٔ اختصاصی از سختافزار انتخابشده را برای مدل نگه میدارد. وقتی حداقل یک نسخه باید همیشه روشن باشد، فاصلهٔ میان دو درخواست نیز بخشی از زمان قابل پرداخت است. اگر اوج ترافیک نسخههای بیشتری لازم داشته باشد، ساعتهای روشن بودن آنها به هزینهٔ نسخهٔ اصلی اضافه میشود. مزیت این شیوه، امکان انتخاب نوع نمونه و تعیین ظرفیت آمادهٔ پاسخ است؛ قیمت ماهانهٔ آن به مدت روشن بودن هر نسخه وابسته میماند.
در Replicate، اجرای یک مدل عمومیِ زمانمحور از ظرفیت مشترک استفاده میکند و هزینه به زمان پردازش درخواست مربوط است. همهٔ مدلهای عمومی چنین تعرفهای ندارند: بعضی بر اساس ورودی یا خروجی قیمتگذاری میشوند و نمیتوان هزینهشان را با ضرب نرخ T4 در ساعت پردازش به دست آورد. استقرار اختصاصی Replicate کنترل بیشتری بر سختافزار، ظرفیت و صف درخواست میدهد، ولی زمان آنلاین نمونه در آن قابل پرداخت است. بنابراین پیش از مقایسهٔ نرخها، باید معلوم باشد همان مدل در هر مسیر چگونه قیمتگذاری و اجرا میشود.
سه الگوی استفاده در یک ماه فرضی
محاسبههای این بخش مثالهای فرضی برای یک T4 و ماهی ۷۳۰ ساعتاند. فرض میکنیم مدل عمومی Replicate واقعاً بر اساس زمان اجرای T4 قیمت دارد و یک نمونه در هر طرف برای بار موردنظر کافی است. «ساعت پردازش» مجموع زمان اجرای درخواستهاست؛ «ساعت آنلاین» زمان راهاندازی، پردازش و انتظار پیش از خاموش شدن را نیز دربر میگیرد. این حساب هزینهٔ پایهٔ سختافزار را نشان میدهد، نه تأخیر یا ظرفیت اندازهگیریشدهٔ یک مدل مشخص.
ترافیک جهشی با مدل عمومی: فرض کنید درخواستها در مجموع ۱۰۰ ساعت پردازش ایجاد کنند، اما لازم باشد Endpoint اختصاصی در تمام ماه آماده بماند. هزینهٔ زمانمحور Replicate برابر ۱۰۰ × ۰٫۸۱، یعنی ۸۱ دلار میشود. برای Hugging Face، ۷۳۰ × ۰٫۵۰ برابر ۳۶۵ دلار است. با وجود نرخ ساعتی بالاتر Replicate، صورتحساب آن در این فرض پایینتر میافتد، چون ۶۳۰ ساعت باقیمانده در مدل عمومیِ زمانمحور هزینهٔ پردازش ندارد.
ترافیک پیوسته با مدل عمومی: اگر مجموع پردازش به ۶۰۰ ساعت در همان ماه برسد، هزینهٔ فرضی Replicate برابر ۴۸۶ دلار میشود؛ Endpoint تکنسخهایِ همیشهروشن Hugging Face همچنان ۳۶۵ دلار هزینه دارد. این نتیجه تنها وقتی برای انتخاب میزبان کاربرد دارد که همان یک نمونه بتواند بار و تأخیر موردنیاز را پاسخ دهد. درخواستی که همزمان با درخواستهای دیگر میرسد ممکن است به ظرفیت بیشتر یا صف نیاز داشته باشد؛ در آن صورت ساعتهای نسخهٔ اضافی باید به برآورد اختصاصی افزوده شود.
مدل خصوصیِ همیشه آماده: حال فرض کنید پردازش واقعی فقط ۱۰۰ ساعت است، ولی مدل خصوصی باید در هر دو سرویس تمام ۷۳۰ ساعت آمادهٔ پاسخ بماند. اگر یک T4 در هر طرف کافی باشد، هزینهٔ Replicate برابر ۷۳۰ × ۰٫۸۱، یعنی ۵۹۱٫۳۰ دلار، و هزینهٔ Hugging Face برابر ۳۶۵ دلار خواهد بود. اختلاف با مثال جهشی از تغییر قاعدهٔ پرداخت میآید: برای بیشتر مدلهای خصوصی Replicate، زمان انتظار نمونه هم در صورتحساب قرار میگیرد. اگر نمونهها بخشی از ماه خاموش شوند، باید مدت آنلاین واقعی را جایگزین ۷۳۰ ساعت کرد.
مرز سربهسر T4 و استثنای H100
با فرض Endpoint همیشهروشن، مدل عمومیِ زمانمحور و توان عملی قابل مقایسه روی T4، نسبت ۰٫۵۰ به ۰٫۸۱ حدود ۶۱٫۷ درصد است. یعنی اگر ساعتهای پردازش Replicate کمتر از حدود ۶۱٫۷ درصد ساعتهای آنلاین Endpoint باشد، فرمول ساده به سود Replicate است؛ بالاتر از این مرز، Hugging Face ارزانتر میشود. این مرز، نتیجهٔ حساب نرخهاست و دربارهٔ سرعت یا تعداد پاسخهای قابل ارائه در یک ساعت چیزی نمیگوید. تغییر اندازهٔ مدل، همزمانی درخواستها یا تعداد نسخههای لازم میتواند مقایسهٔ هزینهٔ هر پاسخ را تغییر دهد.
مقایسهٔ مهندسی Markaicode نیز مرز تقریبی T4 را از نرخهای منتشرشده محاسبه کرده است، نه از آزمون زندهٔ تأخیر یا توان عملی. همان مقایسه برای H100 جهت متفاوتی را نشان میدهد: نرخ Replicate برابر ۵٫۴۹ دلار در ساعت و نرخ گزینهٔ GCP در Hugging Face برابر ۱۰ دلار در ساعت است. این دو قیمت به گزینههای سختافزاری و ابری مشخص تعلق دارند؛ نتیجهٔ T4 را نمیتوان بدون محاسبهٔ دوباره به GPU دیگر منتقل کرد.
خاموش شدن خودکار چه چیزی را تغییر میدهد؟
Hugging Face امکان کاهش تعداد نسخههای Endpoint به صفر را پس از دورهای بدون درخواست فراهم میکند. راهنمای مقیاسدهی Hugging Face توضیح میدهد که درخواست بعدی با راهاندازی سرد روبهرو میشود؛ هنگام آماده شدن نسخه، پاسخ ۵۰۲ ممکن است برگردد و برای درخواستهای ورودی در آن مرحله صف داخلی وجود ندارد. بنابراین کاهش هزینهٔ زمان بیکار با تغییر رفتار نخستین درخواست پس از خاموشی همراه است. طول راهاندازی نیز به مدل وابسته است.
برای دیدن اثر مالی، همان مثال فرضیِ ۱۰۰ ساعت پردازش را در نظر بگیرید. اگر Endpoint بهجای تمام ماه فقط ۱۲۰ ساعت آنلاین بماند، هزینهٔ پایهٔ آن ۱۲۰ × ۰٫۵۰، یعنی ۶۰ دلار میشود؛ کمتر از ۸۱ دلار Replicate در مثال مدل عمومی. آن ۲۰ ساعت اضافه، فرضی برای راهاندازی و انتظار پیش از خاموشی است، نه پیشبینی رفتار سرویس. جهشهای کوتاه و پرتعداد میتوانند این زمان را بیشتر کنند، در حالی که فاصلههای طولانی میان درخواستها فرصت بیشتری برای خاموش ماندن نمونه میدهند.
انتخاب میزبان به مدل و پاسخ موردنیاز بستگی دارد
برای نمونهٔ اولیهای که از مدل عمومیِ موجود استفاده میکند و درخواستهایش نامنظم است، پرداخت زمان پردازش در Replicate میتواند هزینهٔ اولیه را پایین نگه دارد. در ظرفیت مشترک، درخواست ممکن است با صف، راهاندازی سرد یا محدودیت مقیاس روبهرو شود. اگر مدل موردنظر تعرفهٔ ورودی یا خروجی دارد، یا باید نسخهٔ اختصاصی از آن اجرا شود، حساب ۰٫۸۱ دلار برای هر ساعت پردازش دیگر نمایندهٔ هزینهٔ آن نیست.
برای سرویس تولیدی با مدل مشخص و بار نسبتاً پیوسته، یک Endpoint اختصاصی روی T4 میتواند از نرخ ساعتی پایینتر Hugging Face بهره ببرد و انتخاب سختافزار را در اختیار تیم بگذارد. برای مدل خصوصیِ کمترافیک، پرسش تعیینکننده این است که نمونه چند ساعت باید بیوقفه آماده باشد و خاموش شدن خودکار چه اثری بر نخستین پاسخ میگذارد. بودجهٔ قابل اتکا باید زمان آنلاین همهٔ نسخهها را در کنار ظرفیت و تأخیر همان مدل بسنجد؛ نرخ یک GPU بهتنهایی هزینهٔ خدمترسانی را تعیین نمیکند.
بیشتر بخوانید:
مقالات مرتبط


Clef تصمیم میگیرد، متن نمینویسد؛ ادعای سرعت Cloudflare زیر سؤال رفت

GitHub Codespaces یا Ona؛ ساعت ارزان همیشه صورتحساب ارزان نمیسازد

آموزش AI دو برابر شد؛ ۵۶٪ کارکنان هنوز وقت یادگیری ندارند

رزومهٔ زمانی یا مهارتمحور؛ سابقهٔ پیوسته انتخاب را عوض میکند

Cloudflare Pages یا Netlify؛ یک جهش مصرف میتواند همهٔ پروژهها را متوقف کند
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.