
Clef تصمیم میگیرد، متن نمینویسد؛ ادعای سرعت Cloudflare زیر سؤال رفت

Cloudflare در معرفی رسمی Clef در ۱ اکتبر ۲۰۲۶، عرضهٔ Clef و Clef-flash روی Workers AI، انتشار وزنهای آنها با مجوز Apache 2.0 و سازگاری API با Jev را اعلام کرد. این مدلها برای پاسخهای مجازِ یک پرسش احتمال برمیگردانند تا برنامه بر پایهٔ آن تصمیم بگیرد؛ کارشان نوشتن پاسخ آزاد مانند یک مدل زبانی عمومی نیست.
در آزمون مستقل Nicia روی ۸۵ مورد برچسبخورده، از شب ۱ تا بامداد ۲ اکتبر، میانهٔ رفتوبرگشت درخواستهای پیاپی از API عمومی برای Clef برابر ۶۳۸ تا ۷۱۷ میلیثانیه، برای Clef-flash برابر ۴۲۹ تا ۵۳۳ میلیثانیه و برای Jev برابر ۹۸ تا ۱۶۷ میلیثانیه بود. این نتیجه به همان کار و همان مسیر فراخوانی مربوط است، اما نشان میدهد سرعت محاسبهٔ مدل روی GPU بهتنهایی زمان رسیدن تصمیم به برنامه را توصیف نمیکند.
Clef چه چیزی را به برنامه تحویل میدهد؟
ورودی این مدل یک وضعیت و مجموعهای از پرسشهای نوعدار است. هر پرسش محدودهٔ پاسخ خود را مشخص میکند و مدل به جای ساختن جمله، احتمال گزینههای مجاز را محاسبه میکند. در نمونهٔ پشتیبانی مشتری، وضعیت همان پیام دریافتی است و پرسشها میتوانند فوریت درخواست، تیم مسئول و شدت اثر مشکل را تعیین کنند. چنین خروجیای برای مسیریابی یا ارجاع درخواست قابل استفاده است، زیرا برنامه از پیش میداند هر پاسخ به کدام مسیر مربوط میشود.
نمودار تصمیم در اینجا ساده است: وضعیت ورودی ← پرسش و گزینههای مجاز ← احتمال پاسخها ← قاعدهٔ برنامه برای اقدام یا ارجاع. بخش آخر را خود مدل تعیین نمیکند. اگر احتمال یک گزینه به آستانهٔ تعیینشده در برنامه برسد، برنامه میتواند آن مسیر را انتخاب کند؛ در غیر این صورت میتواند تصمیم را برای بررسی انسانی نگه دارد. بنابراین احتمال، اطلاعاتی برای تصمیمگیری است و بهتنهایی دستور اجرای یک اقدام نیست.
این معماری برای پرسشی مناسب است که پاسخهای ممکن آن پیشاپیش تعریف شدهاند: مثلاً آیا یک درخواست فوری است، به کدام گروه تعلق دارد یا آیا اقدامی باید به انسان ارجاع شود. وقتی وظیفه به توضیح آزاد برای کاربر، نگارش متن یا پیشنهاد گزینهای خارج از فهرست نیاز دارد، خروجی محدود Clef آن بخش را انجام نمیدهد. در یک عامل هوش مصنوعی، مدل تصمیمگیر میتواند مسیر را انتخاب کند و بخش دیگری از سامانه پاسخ را بنویسد یا ابزار مناسب را اجرا کند.
مجوز باز و سازگاری API چه امکاناتی میدهند؟
انتشار وزنها امکان بررسی و اجرای مدلها بیرون از سرویس میزبانیشده را فراهم میکند. این موضوع برای تیمی که میخواهد محل اجرا و شرایط اندازهگیری را در اختیار داشته باشد مهم است، ولی اجرای شخصی همچنان به زیرساخت و تنظیمات متناسب با مدل نیاز دارد. در مقابل، مسیر Workers AI یک endpoint آماده در اختیار میگذارد و درخواست از سرویس میزبانیشده میگذرد. زمان ثبتشده در این دو شیوهٔ اجرا الزاماً یکسان نیست.
سازگاری API با Jev به ساختار درخواست و پاسخ تصمیم مربوط است: برنامه میتواند همان الگوی وضعیت، پرسشهای نوعدار و احتمال پاسخها را به کار ببرد. با این حال، جابهجایی میان سرویسها هنوز به تنظیم نشانی endpoint، نام مدل و شیوهٔ دسترسی در محیط اجرا نیاز دارد. سازگاری قالب نیز به معنای یکسان بودن احتمالهای خروجی نیست؛ اگر قاعدهٔ برنامه به آستانههای مشخص وابسته باشد، تغییر مدل میتواند مسیر انتخابشده برای یک ورودی را عوض کند.
Cloudflare همزمان امکان تنظیم اختصاصی Clef را با همکاری مستقیم تیم خود مطرح کرده و سکوی سلفسرویس آن را برای مرحلهای بعدی توصیف کرده است. این دو وضعیت را نباید یکی دانست: مدلهای عرضهشده اکنون قابل فراخوانیاند، اما مسیر تنظیم اختصاصیِ بدون همکاری مستقیم هنوز در همان وضعیت عرضهٔ عمومی مدلها قرار ندارد. برای کاربردهای وابسته به قواعد داخلی یک سازمان، این تفاوت بر میزان کنترلی که تیم در آغاز کار دارد اثر میگذارد.
مقایسهٔ سرعت از کجا محل تردید میشود؟
تحلیل ModelSystem.One توضیح میدهد که ادعای حدود ۱۳ برابر سریعتر بودن Clef-flash از Jev، میانهٔ ۳۸٫۸ میلیثانیه برای اجرای Clef-flash روی GPU را در برابر ۵۲۴٫۱ میلیثانیه برای رفتوبرگشت API میزبانیشدهٔ Jev قرار میدهد؛ رقم منتشرشده برای Clef نیز ۲۰۹٫۳ میلیثانیه است. این نسبت از دو سنجه با شرایط متفاوت ساخته شده است. در نتیجه نمیتوان آن را مستقیماً به برتری سرعت endpoint میزبانیشده برای یک برنامه تعبیر کرد.
در اندازهگیری روی GPU، تمرکز بر مدت اجرای محاسبه است. در اندازهگیری از سمت برنامه، درخواست باید از شبکه به API برسد، در سرویس پذیرفته و زمانبندی شود و پاسخ دوباره از شبکه برگردد. صف پردازش، لایهٔ API، بار سرویس و فاصلهٔ جغرافیایی میتوانند به زمان قابل مشاهده اضافه شوند. این توضیح به معنای کند بودن خودِ محاسبهٔ Clef نیست؛ نشان میدهد دو بخش متفاوت از مسیر پاسخ در اعداد تبلیغی کنار هم قرار گرفتهاند.
تمایز برای عاملی که در میانهٔ پاسخ به کاربر تصمیم میگیرد عملی است. اگر تصمیم باید پیش از فراخوانی ابزار یا نمایش پاسخ گرفته شود، برنامه تا دریافت پاسخ endpoint منتظر میماند، نه فقط تا پایان محاسبه روی GPU. سرعت معماریِ بدون تولید واژهبهواژه میتواند مزیت داشته باشد، اما اندازهٔ آن مزیت در سرویس میزبانیشده از عدد اجرای محلی به دست نمیآید. به همین دلیل، آزمون API پرسش معتبری دربارهٔ دامنهٔ ادعای سرعت ایجاد کرده است.
آزمون API چه چیزی را دربارهٔ کاربرد مدل روشن میکند؟
کار آزمون، تصمیم دربارهٔ ثبت نوشتهٔ یک عامل در پایگاه دانش بود. نوشتهٔ تازه ممکن بود با دادهٔ پذیرفتهشده ناسازگار باشد، همان اطلاعات را تکرار کند یا بدون تعارض ثبت شود. این سناریو به احتمال پاسخها وابسته است: برنامه باید میان پذیرش خودکار و ارجاع به انسان مرز بگذارد. در همان مجموعه، تغییر ترتیب رکوردهای ورودی بعضی تصمیمهای Clef را تغییر داد؛ پس کیفیت تصمیم نیز در کنار زمان پاسخ برای چنین کاربردی اهمیت دارد.
دامنهٔ نتیجه مشخص است. موارد آزمون مصنوعی بودند، واژگان پرسش و آستانههای تصمیم برای Jev تنظیم شده بودند و فراخوانی از یک محل در غرب آمریکا به API عمومی انجام شد. اتصال داخلی Workers AI از داخل یک Worker در این آزمون اندازهگیری نشد. بنابراین نتیجه، رتبهبندی همهٔ مدلها در همهٔ استقرارها نیست؛ تصویری از رفتار endpointهای عمومی در یک بار کاری تعریفشده و در زمان نزدیک به عرضه است.
برای سامانهای که تصمیم را در مسیر زندهٔ پاسخ قرار میدهد، تفاوت میان این دو نوع اندازهگیری پیامد مستقیمی دارد: بودجهٔ زمانی برنامه با رفتوبرگشت کامل درخواست مصرف میشود. سازگاری API راه جابهجایی مدل را باز میکند، اما همان قالب درخواست نمیتواند زمان شبکه، صف سرویس یا رفتار احتمالها را یکسان کند. دادهٔ تعیینکنندهٔ بعدی، اندازهگیری همشرایط endpointها در بار کاری واقعی و با همان مسیر اجرایی است که برنامه از آن استفاده میکند.
بیشتر بخوانید:
مقالات مرتبط


Ollama یا LM Studio؛ سرعت تولید و پاسخ نخست یک برنده ندارند

Hugging Face یا Replicate؛ ترافیک پراکنده هزینه را برعکس میکند

Cloudflare Pages یا Netlify؛ یک جهش مصرف میتواند همهٔ پروژهها را متوقف کند

Docker یا Podman؛ سرعت تقریباً برابر است، مدل دسترسی تصمیم را عوض میکند

Redis یا Valkey؛ مجوز دوباره باز شد، اما مسیر دو پروژه یکی نیست
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.