
Beam נחשף עם 501 מיליארד פרמטרים — הביצועים טרם אומתו

ב־5 באוקטובר 2026 פרסמה Reflection את הודעת ההשקה של Beam: מודל תערובת מומחים דלילה עם 501 מיליארד פרמטרים בסך הכול ו־23 מיליארד פעילים לכל אסימון, שאומן מראש על 23.8 טריליון אסימונים ושבמהלך למידת החיזוק שלו נוצרו יותר מ־100 מיליון מסלולי פתרון; באותה הודעה נקבע כי המשקלים יפורסמו בהמשך אוקטובר תחת רישיון Apache 2.0, לצד דוח טכני, כרטיס מודל וכלים למפתחים. לעת עתה מדובר בתצוגה מוקדמת לקבוצה נבחרת, שאליה ניתן לבקש גישה באמצעות רשימת המתנה.
לפי TechCrunch, שסיקר את החשיפה באותו יום, Beam הוא מודל טקסט בעל חלון הקשר של מיליון אסימונים, Reflection מכנה אותו “workhorse model”, וטענות הביצועים שלה טרם אומתו באופן עצמאי. זו הבחנה מהותית למפתחים ולמנהלי תשתיות: מפרט האימון והטבלאות פורסמו, אולם משקלים ציבוריים שיאפשרו שחזור בדיקות והרצה עצמית עדיין לא יצאו.
למה רק חלק מהמודל פועל בכל אסימון
בארכיטקטורת תערובת מומחים, רכיב ניתוב מפנה את החישוב למבחר מומחים בהתאם לאסימון הנוכחי. כך אפשר להחזיק מאגר גדול של משקלים בלי להפעיל את כולו בכל צעד של יצירת טקסט. ההבחנה בין גודל המודל הכולל לבין החלק הפעיל חשובה יותר מהשוואה שטחית למודל צפוף, שבו כל המשקלים משתתפים בדרך כלל בכל צעד.
אלא שחיסכון בפעולות חישוב של צעד יחיד אינו מבטל את דרישות הפריסה. המשקלים של המומחים צריכים להימצא בזיכרון או להיות נגישים למאיצים, וניתוב בקשות ביניהם מוסיף תעבורת נתונים. בקלט ארוך מצטרפים לכך זיכרון מטמון הקשב והעבודה הדרושה לעיבוד ההנחיה לפני תחילת הפלט. לפיכך גודל החלק הפעיל יכול להסביר יתרון אפשרי ביצירת אסימונים, אך אינו קובע לבדו כמה שרתים יידרשו או מה תהיה ההשהיה בבקשה אמיתית.
הארכיטקטורה שפורסמה כוללת קשב מקומי וגלובלי לסירוגין, מומחים מנותבים ומנגנונים לאיזון העומס עליהם. תפקיד האיזון הוא למנוע מצב שבו מומחים מסוימים מקבלים כמעט את כל העבודה ואחרים נשארים בלתי מנוצלים. זו תכונה של תכנון ואימון המודל; השפעתה על קצב השירות תלויה גם במימוש שיפורסם ובהנדסת המערכת שתארח אותו.
מה אומר היקף האימון על יכולות Beam
כמות האסימונים באימון המוקדם מתארת את היקף החשיפה של המודל לחומר, אך אינה מונה מקורות ייחודיים ואינה מספקת לבדה מדד לאיכותם. תיאור תהליך האימון כולל קוד, הסברים טכניים, חומר מדעי ומקורות מורשים לצד תוכן מהרשת. התהליך כלל גם סינון של חומר גולמי וחזרה מכוונת על תוכן טכני כדי לחזק את יכולת התכנות; בלי פירוט מלא של התערובת, אי אפשר לגזור מן הנפח לבדו ביצועים בתחום מסוים.
בלמידת חיזוק, מסלול פתרון הוא ניסיון של המודל לבצע משימה ולקבל משוב, ולא הצלחה מאומתת אצל לקוח. תרגול משימות תוכנה, עבודה בטרמינל ושימוש בכלים עשוי לשפר רצפי פעולה ארוכים, אך שיעור ההצלחה תלוי בסביבת המבחן ובאופן שבו התשובות נבדקות. האימון כלל גם למידה מאינטראקציות שנוצרו בגרסאות קודמות של המודל, עניין המחייב לשמור על יציבות העדכון כאשר האימון והפקת הניסיונות מתנהלים במקביל.
חלון ההקשר הארוך מוצג כתוצאה של שלב אימון המשך על מאגרי קוד, מסמכים ארוכים ומשימות ממושכות. הוא מתאר יכולת של המודל לקשור מידע לאורך רצף גדול; מגבלת הקלט בשירות שייפתח למשתמשים ויכולת האחזור של פרט הנמצא עמוק ברצף הן שאלות נפרדות. מאחר ש־Beam מטפל בטקסט, עבודה עם תמונה או מידע אחר דורשת ייצוג טקסטואלי או כלי חיצוני, ולא הופכת אותו למודל רב־אופני.
מה באמת מראים מדדי ההשקה
בתוצאות שפורסמו יש משימות תכנות, טרמינל, חשיבה, חיפוש ושימוש בכלים. ההשוואות אינן מציבות את Beam בראש בכל מדד: בחלק מהמשימות הוא קרוב למודלים גדולים ממנו, ובאחרות הפער ניכר. עצם פרסום ציונים של מודלים מתחרים באותה טבלה אינו מלמד שכל התוצאות התקבלו באותה סביבת הרצה או באותן הגדרות מאמץ חשיבה.
במאמר של Help Net Security מפורטים ציוני Terminal Bench v2.1 מתוך טבלאות החברה: Beam קיבל 80.1, לעומת 81.0 ל־GLM 5.2, 88.3 ל־Kimi K3 ו־90.6 ל־DeepSeek V4.1 Flash. באותו ניתוח מופיעה גם תמונה שונה במבחן DeepSWE v1.1, שבו Beam נמצא מעט מעל GLM 5.2 אך מתחת למודלים מובילים אחרים. אלה ציונים שמקורם בפרסום ההשקה, לא תוצאה של בדיקה עצמאית שערך האתר.
לפער הזה יש משמעות מעשית משום שמשימות סוכן תלויות בסביבת העבודה: אילו כלים עומדים לרשות המודל, כמה ניסיונות מותרים, ואיך מוגדרת הצלחה. ציון גבוה בבדיקת טרמינל אינו שקול בהכרח ליכולת לתקן מאגר תוכנה מסוים או לשמור על דיוק לאורך שרשרת פעולות. עד שהמשקלים ומסמכי הבדיקה יהיו זמינים, טבלאות החברה הן תמונת מצב מועילה על ההצהרה שלה, אך אינן בסיס מוצק לדירוג תפעולי בלתי תלוי.
יעילות ההסקה היא אומדן חישובי
Beam מוצג בתרשימי ההשקה כמודל שמספק יכולת דומה לחלק מהחלופות בפחות מחשוב בזמן יצירת התשובה. החישוב שפורסם נשען על מספר הפרמטרים המופעלים ועל אורך הפלט הממוצע, כולל אסימוני החשיבה שהמודל מפיק בדרך לתשובה. הוא מודד בקירוב את העבודה במעבר קדימה של יצירת אסימונים, ולא חשבון ענן שנמדד אצל משתמשים.
האומדן אינו כולל את כל עלות עיבוד הקלט, פעולות קשב שתלויות באורך ההקשר או תקורה של מערכת השירות. שתי הרצות בעלות אותו ציון יכולות לצרוך מספר שונה של אסימוני חשיבה, והארכת הפלט עשויה למחוק חלק מן היתרון שנובע ממיעוט המשקלים הפעילים. גם מחיר השירות, קצב התשובות בעומס וצריכת הזיכרון תלויים בחומרה, במימוש הניתוב ובאופן חלוקת הבקשות בין מאיצים. לכן טענת היעילות מעניינת, אך אינה מחירון או מדידת השהיה.
פרסום המשקלים יפתח את הבדיקה החסרה
השלב הבא בלוח הזמנים שפורסם הוא שחרור המשקלים והמסמכים הנלווים במהלך החודש. הדוח הטכני וכרטיס המודל יוכלו להבהיר את הגדרות המדדים, את תנאי ההרצה ואת מגבלות המודל; פרסום הכלים יאפשר למפתחים להתנסות בפריסה ובהתאמה. עד אז, הגישה המצומצמת אינה מאפשרת לצוותים חיצוניים לשחזר את טבלאות ההשקה על אותה גרסה או להעריך את דרישות הזיכרון בסביבה שלהם.
לאחר שחרור הקבצים אפשר יהיה להפריד בין שלוש שאלות שנכרכות כעת יחד: האם Beam פותר את משימות הקוד והסוכן ברמת הדיוק שפורסמה, מהו החישוב הנדרש באותם תנאים, וכמה עולה להפעילו בשירות ממשי. מדידות בלתי תלויות על משימות זהות, עם תיעוד של הכלים, מגבלת ההקשר והחומרה, יקבעו אם היתרון התיאורטי מתורגם לתועלת בתשתית של ארגון. פרסום המשקלים הוא הרגע שבו ההשוואה הזאת תוכל להתחיל.
קראו גם:
כתבות קשורות


בדיקות לסוכן AI: תשובה נכונה לא מוכיחה שהתהליך עובד

Ollama או LM Studio: המהירות לא מכריעה בלי לבדוק את מנוע ההרצה

סוכני OpenAI פרסמו 53 תמונות משתמשים — ולא ניתן לזהות את הנפגעים

אסימון API של Cloudflare דלף? Roll משאיר את אותן ההרשאות

Cloudflare Basin זמינה לכולם — בלי שרתים ובלי דמי יציאה
הירשמו לניוזלטר שלנו
קבלו את החדשות האחרונות על Web3, AI וקריפטו ישירות לתיבת הדואר.