
Nebius-მა Inferize იყიდა — „უქმი GPU-ის გადასახადს“ ებრძვის

ამსტერდამში დაფუძნებულმა Nebius-მა, SEC-ში წარდგენილი 1 ოქტომბრის განცხადების თანახმად, 2026 წლის 1 ოქტომბერს Inferize შეიძინა; 2026 წლის იანვარში დაარსებულმა სტარტაპმა სამუშაო პროტოტიპი სამ თვეში შექმნა. Inferize-ის გუნდი და ტექნოლოგია Nebius Token Factory-ს, საწარმოო ინფერენსის მართულ პლატფორმას, შეუერთდა. გარიგების პირობები, მათ შორის გადახდილი ფასი, კომპანიას არ გაუმჟღავნებია.
Globes-ის ცნობით, დაახლოებით ათი თვის Inferize-ის თელ-ავივის გუნდში 17 ადამიანი მუშაობდა, ხოლო გამოცემის წყაროები გარიგებას 100–130 მილიონ დოლარად აფასებენ. CTech-ის ცნობით, თანადამფუძნებლები გაი ბორტნიკოვი და ლიორ გორბონოსი Granulate-ის დამფუძნებელი გუნდის ყოფილი წევრები არიან, გამოცემის შეფასება კი 100–150 მილიონი დოლარია; ბორტნიკოვის სიტყვებით, “Keeping spare GPUs running is the price of being ready for demand.” ორივე დიაპაზონი მედიის შეფასებაა: მათი ზედა ზღვარი განსხვავდება, ოფიციალური შესყიდვის ფასი კი ისევ უცნობია.
რას ამატებს Inferize Token Factory-ს
შენაძენის უშუალო ღირებულება მოდელის სწრაფად ამოქმედების ტექნოლოგიასა და მის შემქმნელ ინჟინრებშია. Token Factory უკვე ემსახურება AI-მოდელების საწარმოო გამოყენებას; Inferize-ის გადაწყვეტა გამოთვლითი სიმძლავრის დამატებასა და მოთხოვნებზე რეალურ პასუხს შორის მონაკვეთს ეხება. როდესაც პლატფორმა ახალ მოდელს რთავს ან დატვირთვის ზრდაზე რეაგირებს, გადამწყვეტია, რამდენ ხანში გადაიქცევა გამოყოფილი GPU მუშაობისთვის მზად რესურსად.
გუნდის პლატფორმაში გადასვლა დასრულებული ნაბიჯია, მაგრამ ტექნოლოგიის სრულად ამუშავება ინტეგრაციას მოითხოვს. Nebius-ის ინჟინრებთან მუშაობა სწორედ აქედან იწყება: Inferize-ის გადაწყვეტა მოდელების ჩატვირთვისა და სიმძლავრის განაწილების არსებულ სისტემაში უნდა ჩაჯდეს. შესყიდვის დასრულება თავისთავად არ ნიშნავს, რომ ახალი მექანიზმი პლატფორმის ყველა მომხმარებლის დატვირთვაზე უკვე მუშაობს.
სტარტაპის მოკლე ისტორია გარიგების მოტივსაც აჩვენებს. მყიდველს სჭირდება კონკრეტული ტექნიკური უნარი იმ პლატფორმისთვის, რომელიც უკვე არსებობს, და გუნდი, რომელმაც პრობლემაზე სამუშაო გადაწყვეტა შექმნა. გარიგების შესაძლო ღირებულება დიდწილად დამოკიდებულია იმაზე, რამდენ დროს დაზოგავს ეს გადაწყვეტა ახალი ინფერენსის სიმძლავრის ამოქმედებისას.
სად ჩნდება ცივი გაშვების ხარჯი

ცივი გაშვებისას ახალი GPU რესურსი უკვე გამოყოფილია, მაგრამ მოდელის პარამეტრები მის მეხსიერებაში ჯერ იტვირთება. სანამ ჩატვირთვა დასრულდება, ეს GPU ვერ ემსახურება მომხმარებლის მოთხოვნას და ტოკენებს ვერ აწარმოებს. პრობლემა ჩნდება ახალი ინსტანციის ამოქმედებისას, მოთხოვნის მოულოდნელი ზრდისას და მაშინაც, როდესაც მუშაობის პროცესში მოდელის პარამეტრები ახლდება.
პირობითად, AI-სერვისს საღამოს ერთბაშად მეტი შეკითხვა შემოსდის და პლატფორმა დამატებით GPU სიმძლავრეს გამოყოფს. ახალი რესურსი დასაწყისში დაკავებულია მოდელის ჩატვირთვით, ამიტომ მოთხოვნები მოდის მანამდე, სანამ ის პასუხისთვის მზად იქნება. ოპერატორს შეუძლია სათადარიგო სიმძლავრე მუდმივად ჩართული ჰქონდეს, რათა ასეთ პიკს შეხვდეს, მაგრამ მაშინ იხდის GPU-ში, რომელიც მშვიდ საათებში მოთხოვნებს არ ემსახურება. მზადყოფნის ფასად გადახდილი ეს უქმი დროა პრობლემა, რომელსაც Inferize-ის ტექნოლოგია უმიზნებს.
უფრო სწრაფი ჩატვირთვა პლატფორმას აძლევს საშუალებას, დამატებითი სიმძლავრე საჭირო მომენტთან უფრო ახლოს აამოქმედოს. ამის შედეგად შესაძლოა შემცირდეს დრო, როდესაც უკვე გამოყოფილი რესურსი ჯერ კიდევ ვერ პასუხობს მომხმარებელს, და ის რეზერვიც, რომლის მუდმივად შენახვა მომსახურების საიმედოობას სჭირდება. ეფექტი განსაკუთრებით შესამჩნევი შეიძლება იყოს ცვალებად დატვირთვაზე; მუდმივად დატვირთულ რესურსზე იგივე შეფერხებას სხვა წონა აქვს.
როგორ შეიძლება შემცირდეს ერთი ტოკენის ხარჯი
ინფერენსის ეკონომიკა მხოლოდ GPU-ის საათობრივ ფასზე არ არის დამოკიდებული. თუ იგივე სიმძლავრე ლოდინში ნაკლებ დროს გაატარებს და მეტ მოთხოვნას მოემსახურება, მისი ხარჯი მეტ დამუშავებულ ტოკენზე განაწილდება. ამ პირობებში ერთ ტოკენზე მოდის ნაკლები ინფრასტრუქტურული ხარჯი, თუნდაც თავად GPU-ის დაქირავების ფასი უცვლელი დარჩეს. სწორედ ამიტომ არის GPU-ის საათისა და გაშვების ფასი განსხვავებული საზომი.
სურათს ცვლის მოთხოვნის პროფილი: სერვისს, რომელსაც თითქმის ერთნაირი დატვირთვა აქვს, შეუძლია სიმძლავრე წინასწარ უფრო ზუსტად დაგეგმოს. მკვეთრი პიკების შემთხვევაში კი ოპერატორი არჩევანის წინაშე დგას — შეინახოს ძვირი სათადარიგო რესურსი ან ახალი სიმძლავრის ამოქმედებას დაელოდოს. ჩატვირთვის დროის შემცირებას სწორედ ამ არჩევანის შემსუბუქება შეუძლია, რადგან მზაობასა და რეალურ გამოყენებას შორის მანძილი მცირდება.
თუ პიკის დროს პლატფორმა მუდმივი რეზერვის ნაცვლად ახლად ამოქმედებულ რესურსს დაეყრდნობა, მომხმარებლის მოთხოვნის მომსახურების დაწყებამდე დაყოვნება შეიძლება შემცირდეს. თუმცა უფრო სწრაფი გაშვება თავისთავად არ ნიშნავს, რომ უკვე ჩატვირთული მოდელი თითოეულ ტოკენს უფრო სწრაფად გამოთვლის. აქ მოსალოდნელი ეკონომია უწინარესად იმ დროის შემცირებიდან მოდის, როდესაც GPU გამოყოფილია, მაგრამ სასარგებლო სამუშაოს ჯერ ვერ ასრულებს.
ეს მექანიზმი ფინანსური შედეგის გარანტია არ არის. გამოთავისუფლებული რესურსი შეიძლება მეტ მოთხოვნას მოემსახუროს, უსაფრთხოების რეზერვში დარჩეს ან ფასებში კონკურენციას მოხმარდეს. Nebius-ის მარჟაზე გავლენა იმაზეც იქნება დამოკიდებული, რამდენად ხშირად ხდება ცივი გაშვება, რა მოდელები იტვირთება და როგორი ტარიფით ყიდის კომპანია ინფერენსს. ამიტომ ტექნიკური მიზანი და რეალურად მიღებული დანაზოგი ცალ-ცალკე საკითხებია.
რა აჩვენებს გარიგების რეალურ შედეგს
ინვესტორისთვის ყველაზე სასარგებლო იქნება ერთსა და იმავე სამუშაო პირობებში გაზომილი ცივი გაშვების დრო, GPU-ის გამოყენების წილი და ერთ ტოკენზე დანახარჯი. პირველი მაჩვენებელი აღწერს, რამდენად მალე ხდება ახალი რესურსი მზად; მეორე აჩვენებს, რამდენ დროს ატარებს ის სასარგებლო მუშაობაში; მესამე კი აკავშირებს ტექნიკურ ცვლილებას ხარჯთან. ასეთი შედარების გარეშე შეძენის გავლენის გამოყოფა საერთო მოთხოვნის ზრდისგან რთულია.
გაზომვას ერთნაირი მოდელი, აპარატურა და მოთხოვნის პროფილი სჭირდება. უფრო მაღალი დატვირთვა თავისთავად ზრდის გამოყენების წილს, ხოლო სხვა მოდელს ჩატვირთვის განსხვავებული დრო შეიძლება ჰქონდეს Inferize-ის ტექნოლოგიის გარეშეც. ამჟამად საჯაროდ ხელმისაწვდომია ინტეგრაციის მიზანი, მაგრამ არა თანაბარ პირობებში მიღებული ეს შედეგები; მათი გამოქვეყნება აჩვენებდა, გადაიქცა თუ არა ნაკლები ლოდინი Nebius-ისთვის დაბალ ერთეულოვან ხარჯად.
ასევე წაიკითხეთ:
მსგავსი სტატიები


Midjourney თუ Leonardo AI: ხარისხს მიღმა არჩევანს კონფიდენციალურობა ცვლის

CrewAI თუ AutoGen: აგენტების როლები თუ საუბრის მოქნილი მარშრუტი

Kyndryl-ის AI ლაბორატორია 300 სამუშაო ადგილს გეგმავს — უნარებზე პარტნიორებიც მუშაობენ

Ramp თუ Brex: $3 სხვაობას პლატფორმის საფასური შეიძლება გადაფაროს

Stripe Atlas თუ Clerky: დაბალი საწყისი ფასი სრულ პაკეტს არ ნიშნავს
გამოიწერეთ ჩვენი ბიულეტენი
მიიღეთ უახლესი ამბები Web3-ის, AI-სა და კრიპტოს შესახებ პირდაპირ თქვენს ელფოსტაზე.