Nebius ซื้อ Inferize เดิมพันว่าลดเวลารอโมเดลจะลดต้นทุน AI ได้จริง

|ผู้เขียน: กองบรรณาธิการ QUASA|2 นาทีในการอ่าน
Nebius ซื้อ Inferize เดิมพันว่าลดเวลารอโมเดลจะลดต้นทุน AI ได้จริง

ใน เอกสาร Exhibit 99.1 ที่ยื่นต่อ SEC Nebius ระบุจากกรุงอัมสเตอร์ดัมเมื่อวันที่ 1 ตุลาคม 2569 ว่าบริษัทซื้อ Inferize แล้ว เพื่อนำเทคโนโลยีลดเวลารอเปิดและขยายโมเดล AI ขนาดใหญ่เข้าสู่ Nebius Token Factory พร้อมยกคำของ Guy Bortnikov ผู้ร่วมก่อตั้งและซีอีโอของ Inferize ว่า “Keeping spare GPUs running is the price of being ready for demand.” ทีมวิศวกรของ Inferize เข้าร่วมแพลตฟอร์มให้บริการโมเดลสำหรับงานจริงแล้ว โดยจะเริ่มจากการผสานเทคโนโลยีของตนเข้ากับระบบ Nebius ไม่เปิดเผยเงื่อนไขหรือมูลค่าธุรกรรม

ดีลนี้ซื้อความสามารถในการทำให้กำลังประมวลผลพร้อมรับคำขอเร็วขึ้น ไม่ใช่เพียงเพิ่มจำนวน GPU: Globes รายงานว่า Inferize มีพนักงาน 17 คนในสำนักงานเทลอาวีฟ มี Bortnikov เป็นซีอีโอและ Lior Gorbonos เป็นประธานเจ้าหน้าที่ฝ่ายเทคโนโลยี พร้อมอ้างแหล่งข่าวประเมินราคาซื้อกิจการไว้ที่ 100–130 ล้านดอลลาร์ ส่วน CTech ประเมินช่วงกว้างกว่าที่ 100–150 ล้านดอลลาร์ ตัวเลขทั้งสองเป็นประมาณการของสื่อซึ่งต่างกันที่เพดานบน ขณะที่ราคาที่บริษัทตกลงกันจริงยังไม่มีการเปิดเผย

Inferize เติมส่วนใดให้ Token Factory

จุดที่ Inferize เข้ามาแก้คือช่วงก่อนโมเดลจะเริ่มตอบคำขอ เมื่อระบบจัดสรร GPU ให้โมเดลแล้ว ยังต้องโหลดน้ำหนักโมเดลและเตรียมสภาพแวดล้อมสำหรับการประมวลผล ช่วงนี้เรียกว่า cold start: เครื่องถูกกันไว้สำหรับงานแล้ว แต่ยังไม่สร้างโทเคนให้ลูกค้า ความล่าช้าเกิดได้ทั้งในการเปิดโมเดลใหม่ การเพิ่มกำลังเมื่อคำขอพุ่งขึ้น และการปรับน้ำหนักโมเดลระหว่างการทำงาน

สำหรับบริการ inference ที่ต้องรับคำขอต่อเนื่อง ความต่างระหว่างการจัดสรรเครื่องกับการมีเครื่องที่พร้อมตอบเป็นเรื่องสำคัญ หากเปิดกำลังเพิ่มได้ช้า คำขอที่เข้ามาในช่วงเร่งด่วนอาจต้องรอคิว แม้ผู้ให้บริการจะมี GPU ที่กำลังเริ่มงานอยู่ก็ตาม การย่นช่วงรอนี้จึงมีคุณค่าต่างจากการเร่งความเร็วสร้างโทเคนหลังโมเดลพร้อมแล้ว: อย่างแรกช่วยให้กำลังใหม่เข้ารับงานได้เร็วขึ้น ส่วนอย่างหลังเพิ่มปริมาณงานของกำลังที่เปิดใช้อยู่

เทคโนโลยีของ Inferize จะเข้ามาอยู่ในแพลตฟอร์มที่ Nebius ใช้จัดการการให้บริการโมเดล ไม่ได้ถูกประกาศเป็นบริการแยกสำหรับลูกค้าโดยตรง งานเริ่มต้นของทีมคือการผสานระบบ ซึ่งทำให้สถานะของดีลชัดเจน: การซื้อกิจการและการเข้าร่วมของทีมเกิดขึ้นแล้ว ส่วนผลด้านต้นทุนเมื่อใช้ร่วมกับภาระงานของ Token Factory เป็นสิ่งที่ต้องวัดหลังการผสาน Nebius มีงานปรับประสิทธิภาพโมเดลและระบบจาก Eigen AI รวมถึงงานจัดการ inference และกำลังประมวลผลจากทีมและเทคโนโลยีของ Clarifai อยู่ก่อนแล้ว ความเร็วในการนำกำลังใหม่มารับงานเป็นอีกส่วนหนึ่งของกระบวนการเดียวกัน

เวลารอสร้างต้นทุนให้ GPU อย่างไร

GPU ที่จัดสรรให้บริการ inference ยังต้องรอโหลดโมเดล ขณะมีกำลังสำรองไว้รองรับคำขอ

ต้นทุนส่วนแรกคือเวลาของ GPU ที่จัดสรรแล้วแต่ยังผลิตโทเคนไม่ได้ หากการเปิดโมเดลหนึ่งครั้งต้องผ่านช่วงโหลดและเตรียมระบบ เครื่องที่รับหน้าที่นั้นจะยังไม่ตอบคำขอในระหว่างรอ การเปิดหลายชุดตามความต้องการที่เปลี่ยนไปทำให้เวลาลักษณะนี้สะสม ต้นทุนจึงไม่ได้เกิดเฉพาะตอนระบบขัดข้อง แต่เกิดขึ้นได้ระหว่างการขยายบริการตามปกติด้วย

ต้นทุนส่วนที่สองคือกำลังสำรอง ผู้ให้บริการที่มีข้อผูกพันเรื่องเวลาตอบสนองไม่อาจสมมติว่าคำขอจะเพิ่มขึ้นอย่างค่อยเป็นค่อยไป หากต้องรอโหลดโมเดลนานเมื่อความต้องการพุ่ง ก็มีเหตุผลที่จะคง GPU บางส่วนไว้ในสภาพพร้อมรับงานล่วงหน้า กำลังส่วนนี้ช่วยรักษาความพร้อมของบริการ แต่มีต้นทุนแม้ในช่วงที่ยังไม่มีคำขอมากพอให้ใช้งานเต็มที่ หากเปิดกำลังใหม่ได้เร็วขึ้น ผู้ให้บริการอาจลดขนาดกำลังสำรองได้โดยยังคงระดับการตอบสนองเดิม ทว่าปริมาณที่ลดได้ขึ้นอยู่กับรูปแบบความต้องการและข้อผูกพันกับลูกค้า

ส่วนที่สามคือการใช้ GPU โดยรวมได้ไม่เต็มประสิทธิภาพ เครื่องที่กำลังเริ่มงานและเครื่องที่เปิดรอคำขอต่างเพิ่มกำลังที่ต้องจัดหาและดูแล แต่ไม่เพิ่มจำนวนโทเคนในสัดส่วนเดียวกัน สามส่วนนี้เกี่ยวพันกัน จึงไม่ควรนำเวลารอ กำลังสำรอง และอัตราการใช้เครื่องมาบวกเป็นผลประหยัดสามก้อนแยกจากกัน สิ่งที่สะท้อนเศรษฐศาสตร์ของบริการได้ตรงกว่าคือจำนวนโทเคนที่ให้บริการได้เทียบกับต้นทุนกำลังประมวลผลทั้งหมดในช่วงเดียวกัน โดยเทียบภายใต้โมเดลและภาระงานที่ใกล้เคียงกัน

มุมของลูกค้าต่างจากมุมของผู้ให้บริการ ลูกค้าอาจไม่ได้เห็นชั่วโมง GPU ที่เสียไปโดยตรง แต่สัมผัสผลผ่านเวลารอคำตอบแรกหรือความสม่ำเสมอของบริการในช่วงที่คำขอหนาแน่น ส่วน Nebius ต้องรับภาระการจัดกำลังให้เพียงพอต่อความต้องการและรักษาระดับบริการ หากลดเวลารอได้จริง ผลอาจปรากฏทั้งในความพร้อมรับคำขอและต้นทุนต่อหน่วยของแพลตฟอร์ม โดยไม่จำเป็นต้องเกิดเป็นการลดราคาให้ลูกค้าทันที

ผังต้นทุนก่อนและหลังลด cold start

ความสัมพันธ์ทางต้นทุนของดีลอธิบายได้ด้วยลำดับเหตุการณ์เมื่อคำขอเพิ่มขึ้น ผังนี้เป็นแบบจำลองเชิงเหตุผล ไม่ใช่ผลทดสอบหรือจำนวนเงินที่ Nebius รายงานว่าได้ประหยัดแล้ว

  • ก่อนลดเวลารอ: คำขอเพิ่ม → ต้องเปิดกำลังและโหลดโมเดล → GPU ที่จัดสรรยังตอบคำขอไม่ได้ → ต้องพึ่งกำลังสำรองเพื่อรักษาเวลาตอบสนอง → ต้นทุนกำลังทั้งหมดถูกหารด้วยโทเคนที่ผลิตได้จริงในจำนวนที่น้อยกว่า
  • หลังลดเวลารอ หากการผสานทำงานได้ตามเป้า: คำขอเพิ่ม → โมเดลบนกำลังใหม่พร้อมรับงานเร็วขึ้น → GPU ใช้เวลาว่างระหว่างเริ่มงานน้อยลง → อาจถือกำลังสำรองลดลงโดยยังรักษาระดับบริการ → ต้นทุนต่อโทเคนอาจลดลงเมื่อภาระงานและเงื่อนไขอื่นเท่าเดิม

ผลของการเปลี่ยนแปลงนี้จะต่างกันตามรูปแบบการใช้งาน ถ้าคำขอคงที่และโมเดลที่เปิดอยู่รองรับงานได้ตลอด การเร่งเปิดกำลังใหม่อาจไม่เปลี่ยนต้นทุนมากนัก แต่ถ้าคำขอแกว่งจนต้องเพิ่มและลดกำลังบ่อย เวลาที่ประหยัดได้ในแต่ละครั้งย่อมมีน้ำหนักมากขึ้น โมเดลขนาดใหญ่ที่ต้องเตรียมกำลังหลายส่วนพร้อมกันอาจเผชิญข้อจำกัดต่างจากโมเดลขนาดเล็ก จึงใช้ผลจากงานประเภทหนึ่งแทนทุกภาระงานไม่ได้

ยังมีข้อแลกเปลี่ยนด้านความพร้อมของกำลังประมวลผลด้วย การลดเครื่องสำรองจะคุ้มค่าก็ต่อเมื่อกำลังที่ต้องการสามารถเข้ามารับงานทันช่วงความต้องการสูง และระบบยังรักษาเวลาตอบสนองที่ตกลงไว้ได้ หากลดสำรองเร็วเกินไป ต้นทุนเครื่องอาจต่ำลง แต่คำขออาจรอคิวนานขึ้น ภาพต้นทุนที่สมบูรณ์จึงต้องวางค่าใช้จ่ายของ GPU คู่กับความสามารถในการรับคำขอช่วงเร่งด่วน ไม่ใช่ดูอัตราการใช้เครื่องเพียงค่าเดียว

ต้นทุนโทเคนกับราคาที่ลูกค้าเห็น

การใช้ GPU ได้คุ้มขึ้นไม่ได้แปลว่าราคาโทเคนของ Token Factory จะลดลงในทันที ต้นทุนต่อโทเคนเป็นต้นทุนภายในของผู้ให้บริการ ขณะที่ราคาที่เรียกเก็บลูกค้าเป็นการตัดสินใจทางธุรกิจซึ่งขึ้นกับโมเดลที่ให้บริการ ความต้องการของตลาด และเงื่อนไขบริการ Nebius อาจใช้ประโยชน์จากต้นทุนที่ลดลงเพื่อรับคำขอเพิ่ม รักษาระดับบริการ หรือปรับราคาในภายหลังได้ แต่ยังไม่มีผลการใช้งานจริงหลังการผสานที่บอกว่าทางเลือกใดจะเกิดขึ้น

ข้อมูลที่จะทำให้เห็นผลของดีลชัดขึ้นคือเวลาตั้งแต่สั่งเพิ่มกำลังจนโมเดลพร้อมตอบคำขอ เวลารอจนได้โทเคนแรกในช่วงความต้องการสูง สัดส่วน GPU ที่ทำงานได้จริง และขนาดกำลังสำรองที่ต้องคงไว้ ตัวเลขเหล่านี้ต้องอ่านร่วมกันภายใต้ภาระงานที่เทียบกันได้: การลดเวลารอเปิดโมเดลเพียงค่าเดียวอาจดูดี แต่ยังบอกไม่ได้ว่าต้นทุนรวมลดลงหากต้องใช้กำลังสำรองเท่าเดิม

หลังการผสานเข้ากับ Token Factory ประเด็นที่จะมีผลต่อลูกค้ามากที่สุดคือ Nebius สามารถรับคำขอที่เพิ่มขึ้นโดยให้รอโทเคนแรกน้อยลง พร้อมใช้กำลังสำรองลดลงได้หรือไม่ เมื่อมีข้อมูลทั้งด้านเวลา ความพร้อมของบริการ และการใช้ GPU จากงานผลิตจริง จึงจะประเมินได้ว่าความเร็วที่ซื้อเข้ามาเปลี่ยนต้นทุนต่อโทเคนมากเพียงใด

แชร์:

สมัครรับจดหมายข่าวของเรา

รับข่าวสารล่าสุดเกี่ยวกับ Web3, AI และคริปโตส่งตรงถึงกล่องจดหมายของคุณ

0