Clef تصمیم می‌گیرد، متن نمی‌نویسد؛ ادعای سرعت Cloudflare زیر سؤال رفت

|نویسنده: تیم تحریریه QUASA|6 دقیقه مطالعه| 2
Clef تصمیم می‌گیرد، متن نمی‌نویسد؛ ادعای سرعت Cloudflare زیر سؤال رفت

Cloudflare در معرفی رسمی Clef در ۱ اکتبر ۲۰۲۶، عرضهٔ Clef و Clef-flash روی Workers AI، انتشار وزن‌های آن‌ها با مجوز Apache 2.0 و سازگاری API با Jev را اعلام کرد. این مدل‌ها برای پاسخ‌های مجازِ یک پرسش احتمال برمی‌گردانند تا برنامه بر پایهٔ آن تصمیم بگیرد؛ کارشان نوشتن پاسخ آزاد مانند یک مدل زبانی عمومی نیست.

در آزمون مستقل Nicia روی ۸۵ مورد برچسب‌خورده، از شب ۱ تا بامداد ۲ اکتبر، میانهٔ رفت‌وبرگشت درخواست‌های پیاپی از API عمومی برای Clef برابر ۶۳۸ تا ۷۱۷ میلی‌ثانیه، برای Clef-flash برابر ۴۲۹ تا ۵۳۳ میلی‌ثانیه و برای Jev برابر ۹۸ تا ۱۶۷ میلی‌ثانیه بود. این نتیجه به همان کار و همان مسیر فراخوانی مربوط است، اما نشان می‌دهد سرعت محاسبهٔ مدل روی GPU به‌تنهایی زمان رسیدن تصمیم به برنامه را توصیف نمی‌کند.

Clef چه چیزی را به برنامه تحویل می‌دهد؟

ورودی این مدل یک وضعیت و مجموعه‌ای از پرسش‌های نوع‌دار است. هر پرسش محدودهٔ پاسخ خود را مشخص می‌کند و مدل به جای ساختن جمله، احتمال گزینه‌های مجاز را محاسبه می‌کند. در نمونهٔ پشتیبانی مشتری، وضعیت همان پیام دریافتی است و پرسش‌ها می‌توانند فوریت درخواست، تیم مسئول و شدت اثر مشکل را تعیین کنند. چنین خروجی‌ای برای مسیریابی یا ارجاع درخواست قابل استفاده است، زیرا برنامه از پیش می‌داند هر پاسخ به کدام مسیر مربوط می‌شود.

نمودار تصمیم در اینجا ساده است: وضعیت ورودی ← پرسش و گزینه‌های مجاز ← احتمال پاسخ‌ها ← قاعدهٔ برنامه برای اقدام یا ارجاع. بخش آخر را خود مدل تعیین نمی‌کند. اگر احتمال یک گزینه به آستانهٔ تعیین‌شده در برنامه برسد، برنامه می‌تواند آن مسیر را انتخاب کند؛ در غیر این صورت می‌تواند تصمیم را برای بررسی انسانی نگه دارد. بنابراین احتمال، اطلاعاتی برای تصمیم‌گیری است و به‌تنهایی دستور اجرای یک اقدام نیست.

این معماری برای پرسشی مناسب است که پاسخ‌های ممکن آن پیشاپیش تعریف شده‌اند: مثلاً آیا یک درخواست فوری است، به کدام گروه تعلق دارد یا آیا اقدامی باید به انسان ارجاع شود. وقتی وظیفه به توضیح آزاد برای کاربر، نگارش متن یا پیشنهاد گزینه‌ای خارج از فهرست نیاز دارد، خروجی محدود Clef آن بخش را انجام نمی‌دهد. در یک عامل هوش مصنوعی، مدل تصمیم‌گیر می‌تواند مسیر را انتخاب کند و بخش دیگری از سامانه پاسخ را بنویسد یا ابزار مناسب را اجرا کند.

مجوز باز و سازگاری API چه امکاناتی می‌دهند؟

انتشار وزن‌ها امکان بررسی و اجرای مدل‌ها بیرون از سرویس میزبانی‌شده را فراهم می‌کند. این موضوع برای تیمی که می‌خواهد محل اجرا و شرایط اندازه‌گیری را در اختیار داشته باشد مهم است، ولی اجرای شخصی همچنان به زیرساخت و تنظیمات متناسب با مدل نیاز دارد. در مقابل، مسیر Workers AI یک endpoint آماده در اختیار می‌گذارد و درخواست از سرویس میزبانی‌شده می‌گذرد. زمان ثبت‌شده در این دو شیوهٔ اجرا الزاماً یکسان نیست.

سازگاری API با Jev به ساختار درخواست و پاسخ تصمیم مربوط است: برنامه می‌تواند همان الگوی وضعیت، پرسش‌های نوع‌دار و احتمال پاسخ‌ها را به کار ببرد. با این حال، جابه‌جایی میان سرویس‌ها هنوز به تنظیم نشانی endpoint، نام مدل و شیوهٔ دسترسی در محیط اجرا نیاز دارد. سازگاری قالب نیز به معنای یکسان بودن احتمال‌های خروجی نیست؛ اگر قاعدهٔ برنامه به آستانه‌های مشخص وابسته باشد، تغییر مدل می‌تواند مسیر انتخاب‌شده برای یک ورودی را عوض کند.

Cloudflare هم‌زمان امکان تنظیم اختصاصی Clef را با همکاری مستقیم تیم خود مطرح کرده و سکوی سلف‌سرویس آن را برای مرحله‌ای بعدی توصیف کرده است. این دو وضعیت را نباید یکی دانست: مدل‌های عرضه‌شده اکنون قابل فراخوانی‌اند، اما مسیر تنظیم اختصاصیِ بدون همکاری مستقیم هنوز در همان وضعیت عرضهٔ عمومی مدل‌ها قرار ندارد. برای کاربردهای وابسته به قواعد داخلی یک سازمان، این تفاوت بر میزان کنترلی که تیم در آغاز کار دارد اثر می‌گذارد.

مقایسهٔ سرعت از کجا محل تردید می‌شود؟

تحلیل ModelSystem.One توضیح می‌دهد که ادعای حدود ۱۳ برابر سریع‌تر بودن Clef-flash از Jev، میانهٔ ۳۸٫۸ میلی‌ثانیه برای اجرای Clef-flash روی GPU را در برابر ۵۲۴٫۱ میلی‌ثانیه برای رفت‌وبرگشت API میزبانی‌شدهٔ Jev قرار می‌دهد؛ رقم منتشرشده برای Clef نیز ۲۰۹٫۳ میلی‌ثانیه است. این نسبت از دو سنجه با شرایط متفاوت ساخته شده است. در نتیجه نمی‌توان آن را مستقیماً به برتری سرعت endpoint میزبانی‌شده برای یک برنامه تعبیر کرد.

در اندازه‌گیری روی GPU، تمرکز بر مدت اجرای محاسبه است. در اندازه‌گیری از سمت برنامه، درخواست باید از شبکه به API برسد، در سرویس پذیرفته و زمان‌بندی شود و پاسخ دوباره از شبکه برگردد. صف پردازش، لایهٔ API، بار سرویس و فاصلهٔ جغرافیایی می‌توانند به زمان قابل مشاهده اضافه شوند. این توضیح به معنای کند بودن خودِ محاسبهٔ Clef نیست؛ نشان می‌دهد دو بخش متفاوت از مسیر پاسخ در اعداد تبلیغی کنار هم قرار گرفته‌اند.

تمایز برای عاملی که در میانهٔ پاسخ به کاربر تصمیم می‌گیرد عملی است. اگر تصمیم باید پیش از فراخوانی ابزار یا نمایش پاسخ گرفته شود، برنامه تا دریافت پاسخ endpoint منتظر می‌ماند، نه فقط تا پایان محاسبه روی GPU. سرعت معماریِ بدون تولید واژه‌به‌واژه می‌تواند مزیت داشته باشد، اما اندازهٔ آن مزیت در سرویس میزبانی‌شده از عدد اجرای محلی به دست نمی‌آید. به همین دلیل، آزمون API پرسش معتبری دربارهٔ دامنهٔ ادعای سرعت ایجاد کرده است.

آزمون API چه چیزی را دربارهٔ کاربرد مدل روشن می‌کند؟

کار آزمون، تصمیم دربارهٔ ثبت نوشتهٔ یک عامل در پایگاه دانش بود. نوشتهٔ تازه ممکن بود با دادهٔ پذیرفته‌شده ناسازگار باشد، همان اطلاعات را تکرار کند یا بدون تعارض ثبت شود. این سناریو به احتمال پاسخ‌ها وابسته است: برنامه باید میان پذیرش خودکار و ارجاع به انسان مرز بگذارد. در همان مجموعه، تغییر ترتیب رکوردهای ورودی بعضی تصمیم‌های Clef را تغییر داد؛ پس کیفیت تصمیم نیز در کنار زمان پاسخ برای چنین کاربردی اهمیت دارد.

دامنهٔ نتیجه مشخص است. موارد آزمون مصنوعی بودند، واژگان پرسش و آستانه‌های تصمیم برای Jev تنظیم شده بودند و فراخوانی از یک محل در غرب آمریکا به API عمومی انجام شد. اتصال داخلی Workers AI از داخل یک Worker در این آزمون اندازه‌گیری نشد. بنابراین نتیجه، رتبه‌بندی همهٔ مدل‌ها در همهٔ استقرارها نیست؛ تصویری از رفتار endpointهای عمومی در یک بار کاری تعریف‌شده و در زمان نزدیک به عرضه است.

برای سامانه‌ای که تصمیم را در مسیر زندهٔ پاسخ قرار می‌دهد، تفاوت میان این دو نوع اندازه‌گیری پیامد مستقیمی دارد: بودجهٔ زمانی برنامه با رفت‌وبرگشت کامل درخواست مصرف می‌شود. سازگاری API راه جابه‌جایی مدل را باز می‌کند، اما همان قالب درخواست نمی‌تواند زمان شبکه، صف سرویس یا رفتار احتمال‌ها را یکسان کند. دادهٔ تعیین‌کنندهٔ بعدی، اندازه‌گیری هم‌شرایط endpointها در بار کاری واقعی و با همان مسیر اجرایی است که برنامه از آن استفاده می‌کند.

بیشتر بخوانید:

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0