
Nebius רכשה את Inferize — המס על GPU בטל אמור להתכווץ

בהודעת Nebius מ־1 באוקטובר 2026 נמסר כי החברה רכשה את Inferize הישראלית וכי הצוות והטכנולוגיה שלה הצטרפו ל־Nebius Token Factory, פלטפורמת ההסקה המנוהלת שלה; Inferize נוסדה בינואר 2026 והציגה אבטיפוס עובד בתוך שלושה חודשים. הטכנולוגיה נועדה לקצר את זמן ההפעלה וההרחבה של מודלים גדולים כשהביקוש משתנה, וכך לצמצם את קיבולת ה־GPU שצריך להחזיק בהמתנה. Nebius לא פרסמה את תנאי העסקה.
CTech העריך את שווי הרכישה ב־100–150 מיליון דולר ודיווח כי ל־Inferize היו 17 עובדים בתל אביב, כי גייסה סבב סיד בהובלת TLV Partners וכי מייסדיה, המנכ״ל גיא בורטניקוב ומנהל הטכנולוגיה ליאור גורבונוס, היו בצוות ההקמה של Granulate. הטווח הוא הערכה עיתונאית, ולא מחיר עסקה שאישרו החברות. עבור Nebius, המטרה היא לשלב את יכולת ההפעלה המהירה בשירות הסקה שכבר מטפל בבקשות של לקוחות.
מה ידוע על מחיר הרכישה
ההערכות אינן זהות: לפי גלובס, שווי העסקה מוערך ב־100–130 מיליון דולר, ובאותו דיווח אמר בורטניקוב כי ״החזקת מעבדים גרפיים רזרביים בפעולה היא המחיר שמשלמים כדי להיות מוכנים לביקוש״. שתי ההערכות מתייחסות לאותה רכישה וחופפות ברובן, אך הגבול העליון שלהן שונה. בלי מחיר ותנאי תשלום רשמיים, אי אפשר לקבוע את שווי העסקה הסופי או את חלקם של רכיבי שימור עובדים, אם ישנם כאלה.
איפה נוצר ״המס״ על GPU בטל
מודל גדול אינו מתחיל להשיב ברגע שמוקצה לו GPU. תחילה יש לטעון את משקלי המודל לזיכרון ולהכין את סביבת ההסקה לטיפול בבקשות; פרק ההכנה הזה מכונה cold start. כל עוד ההפעלה נמשכת, הקיבולת שהוקצתה אינה מפיקה טוקנים, יחידות הטקסט שהמודל מעבד או מייצר. העיכוב מורגש במיוחד כשפותחים מופע נוסף בעקבות זינוק בתעבורה, והוא יכול לחזור גם כשהמשקלים מתעדכנים במהלך העבודה.
כדי לעמוד בזמני התגובה שהבטיחה, מפעילת שירות הסקה יכולה להשאיר מופעים נוספים פעילים ומוכנים מראש. כך היא מסוגלת לספוג קפיצה בביקוש, אך משלמת גם על שעות שבהן חלק מהמעבדים אינם מטפלים בבקשות. אם אפשר להכין מופע נוסף מהר יותר, ייתכן שאפשר להקטין את מרווח הקיבולת המוחזק בכוננות. גודל המרווח תלוי בדפוס התעבורה ובהתחייבויות השירות, ולא רק במשך טעינת המודל.
היכולת של Inferize מכוונת למעבר מהחלטה להוסיף קיבולת ועד לרגע שבו מופע חדש מסוגל להפיק תשובה. כשעומס הבקשות יורד, הפעלה מהירה של מופעים בעת הצורך עשויה לאפשר גם לצמצם מוקדם יותר את מספר המופעים הפעילים. המשמעות הכלכלית גדולה יותר בשירות שמתמודד עם שיאי ביקוש חדים מאשר בשירות שבו הבקשות מגיעות בקצב יציב. משום כך, את השפעת הטכנולוגיה על העלות צריך לבחון לפי דפוס העבודה של הפלטפורמה.
מפת העלות: מהכוננות ועד לטוקן
עלות הקיבולת מתפזרת על פני שלבים שונים בשרשרת ההסקה. ההפרדה ביניהם מסבירה כיצד קיצור זמן ההפעלה יכול לשפר את ניצול החומרה גם בלי לשנות את מחירה של שעת GPU, ומדוע ניצול טוב יותר אינו מבטיח ירידה זהה במחיר שמשלם הלקוח.
- קיבולת בכוננות: מעבדים שמוחזקים זמינים לעלייה פתאומית במספר הבקשות. ככל שהפעלת מופע חלופי אורכת יותר זמן, כך גדל התמריץ להחזיק יותר קיבולת מוכנה מראש, גם כשהיא אינה עסוקה.
- קיבולת בזמן טעינה: GPU שכבר שויך למופע, אך ממתין למשקלים ולרכיבי ההרצה לפני תחילת הטיפול בבקשות. קיצור ההמתנה מפנה חלק גדול יותר מזמן הפעולה של החומרה לעבודה.
- קיבולת שמפיקה טוקנים: המעבדים לאחר שהמופע מוכן ומטפל בבקשות. זו התפוקה שעליה מתחלקת הוצאת החומרה; פחות זמן בהמתנה ובהכנה עשוי לאפשר יותר טוקנים מאותה קיבולת.
לשם המחשה בלבד, אם ההוצאה על GPU בתקופה נתונה נשארת קבועה ומספר הטוקנים המופקים בה גדל, רכיב עלות החומרה לטוקן יורד. עלות הבקשה כולה מושפעת גם מרשת, אחסון, תפעול ותמהיל המודלים. החיסכון של Nebius יתממש אם זמני ההפעלה הקצרים יאפשרו לה להחזיק פחות קיבולת ממתינה או לשרת יותר ביקוש באמצעות הקיבולת הקיימת.
מה השילוב ב־Token Factory צריך להוכיח
היתרון האפשרי של הרכישה נמצא בשילוב היכולת בתוך פלטפורמה שמנהלת הסקה בייצור. כדי שזמן ההפעלה הקצר יתורגם לתפוקה, גם הקצאת המעבדים, ניהול המשקלים והזרמת הבקשות למופע החדש צריכים לפעול בתיאום. עיכוב באחד השלבים האלה יכול להגביל את התועלת משיפור במהירות הטעינה.
המבחן העסקי עבור Nebius הוא היחס בין הביקוש שטופל לבין שעות ה־GPU שהוקצו לשירות. שיפור ביחס הזה עשוי לאפשר טיפול ביותר בקשות באמצעות אותה תשתית, או הקטנת קיבולת עודפת בלי לפגוע בתגובה לעומס. השוואה כזאת דורשת עומסי עבודה דומים: שינוי בתמהיל הלקוחות או המודלים יכול לשנות את התפוקה גם בלי קשר לטכנולוגיה שנרכשה.
הנתונים שיבהירו את התוצאה הם זמן העלייה של מופע חדש, שיעור הקיבולת שממתינה ללא בקשות ומספר הטוקנים שמופקים מכל שעת GPU לפני השילוב ואחריו. בהודעת הרכישה לא פורסמו מדידות כאלה או שינוי במחיר השירות ללקוחות. ביצועים של Token Factory תחת עומסי ייצור יראו כמה מזמן ההמתנה שהטכנולוגיה מקצרת אכן הפך לקיבולת מנוצלת.
קראו גם:
כתבות קשורות


groundcover רכשה את Wand — התצפית ב־Kubernetes מתחילה לפעול

OpenAI API או Gemini API: החשבון משתנה לפי אורך הקלט, לא רק המודל

Google תבחן שבב AI במסלול — החום והרעד הם רק ההתחלה

שתי פרצות NetScaler כבר מנוצלות: גם תצורת ברירת המחדל חשופה

Alight קונה את Abett — נתוני ההטבות מתאחדים לפני שהעובד בוחר
הירשמו לניוזלטר שלנו
קבלו את החדשות האחרונות על Web3, AI וקריפטו ישירות לתיבת הדואר.