Hugging Face ali Replicate: mirovanje modela lahko stane več kot izvajanje

|Avtor: Uredništvo QUASA|6 min branja| 1
Hugging Face ali Replicate: mirovanje modela lahko stane več kot izvajanje

Pri občasnih klicih javnega modela je Replicate lahko cenejši, če se izbrani model obračunava po času izvajanja. Po pravilih obračuna Replicate pri takem modelu plačate aktivno obdelavo, čas nastavljanja in mirovanja pa je brezplačen. Zahteva lahko vseeno čaka v skupni vrsti ali na hladen zagon.

Če model potrebuje stalno pripravljenost in je promet enakomeren, je lahko ugodnejši namenski Hugging Face Inference Endpoints. Cenik namenskih endpointov za eno instanco NVIDIA T4 pri AWS navaja 0,50 USD na uro; prikazano urno ceno obračunava po minutah, tudi ko delujoča instanca ne obdeluje zahtev. Pri redki uporabi lahko zato strošek njenega mirovanja preseže strošek aktivnega izvajanja.

Kaj mora zajeti primerjava cen

Za primer vzemimo pogojni mesec s 730 urami, eno stalno vključeno instanco T4 pri Hugging Face in javni model na Replicate, ki teče na T4 ter se obračunava po času strojne opreme. Replicatov cenik T4 navaja 0,000225 USD na sekundo oziroma 0,81 USD na uro. To je cena aktivnega časa v izbranem primeru, ne splošna cena vsakega javnega modela: nekateri modeli se obračunavajo glede na vhod ali izhod.

Primer vključuje dve različni obliki storitve. Pri Hugging Face je zmogljivost rezervirana skozi ves mesec, pri javnem modelu na Replicate pa računamo seštevek plačanih sekund obdelave. Obe ponudbi navajata GPU iz razreda T4, vendar imata objavljeni konfiguraciji različno navedeno količino pomnilnika GPU: instanca AWS pri Hugging Face 14 GB, Replicate pa 16 GB. Enako ime GPU-ja zato še ne zagotavlja, da bosta isti model izvajala enako hitro.

V izračunu predpostavimo, da ena instanca zmore predvideni promet in da je seštevek aktivnega časa pri obeh storitvah primerljiv. To je poenostavitev za pregled stroška, ne rezultat preizkusa zmogljivosti. Če se trajanje izvajanja, čakanje v vrsti ali potrebno število replik razlikuje, se spremeni tudi dejanski prag med ponudbama.

Trije vzorci prometa v enem mesecu

Stalno vključena instanca Hugging Face v tem pogojnem mesecu stane 730 × 0,50 USD, torej 365 USD. Za javni model na Replicate račun znaša 0,81 USD na skupno uro aktivne obdelave. Spodnji vzorci kažejo, kako ista mesečna dolžina in različna uporaba spremenita razmerje med računoma.

  • Redka uporaba: 100 aktivnih ur. Replicate bi stal 81 USD, stalna instanca Hugging Face pa 365 USD. Če njenih 730 ur razdelimo glede na delo modela, odpade 50 USD na 100 aktivnih ur in 315 USD na preostalih 630 ur brez izvajanja. Mirovanje bi bilo torej dražje od samega izvajanja.
  • Vmesna obremenitev: 400 aktivnih ur. Replicate bi stal 324 USD, stalna instanca Hugging Face pa 365 USD. Razlika znaša 41 USD; že sprememba dejanskega časa izvajanja ali dodatna replika lahko prevesi stroškovno izbiro.
  • Visoka obremenitev: 600 aktivnih ur. Replicate bi stal 486 USD, stalna instanca Hugging Face pa 365 USD. Pri predpostavki, da ena instanca obdela vse zahteve, je stalni endpoint cenejši za 121 USD.

Aktivne ure so seštevek obračunanega časa izvajanja, ne število ur, v katerih so uporabniki pošiljali zahteve. Več sočasnih klicev lahko poveča zahtevano zmogljivost, tudi če je promet omejen na kratek del dneva. Pri stalni instanci je zato poleg mesečnega seštevka pomembno, ali posamezna replika zmore vrhove brez nesprejemljivega čakanja.

Kdaj se račun obrne

Pri navedenih cenah se računa izenačita pri 365 ÷ 0,81, približno 451 aktivnih urah v pogojnem mesecu. To je približno 61,7 odstotka vseh 730 ur. Pod tem pragom je v našem primeru cenejše plačilo aktivnega izvajanja javnega modela na Replicate; nad njim je cenejša stalna instanca Hugging Face.

Prag velja za eno stalno delujočo instanco na eni strani ter javni model z obračunom po času T4 na drugi. Ne velja samodejno za model, ki ga Replicate ceni po številu izhodov ali žetonov, niti za primer, ko ena instanca ne zmore obremenitve. Če sta za vrh prometa potrebni dve repliki, je treba sešteti čas delovanja vsake posebej.

Razporeditev zahtev lahko strošek spremeni tudi pri enakem seštevku aktivnih ur. Dolgi sklopi obdelave pustijo manj premorov med zahtevami, kratki in pogosti sklopi pa lahko ohranjajo instanco prižgano tudi takrat, ko ne dela. Zato en sam odstotek izkoriščenosti ne opiše dobro stroška endpointa, ki se med premori izklaplja.

Skaliranje na nič: manj mirovanja, več čakanja

Hugging Face omogoča, da se endpoint po obdobju brez zahtev zmanjša na nič replik. Dokumentacija samodejnega skaliranja opozarja, da naslednja zahteva sproži hladen zagon: med pripravo replike strežnik vrača odgovor 502 in vhodnih zahtev ne postavlja v lastno čakalno vrsto. Aplikacija mora tak odziv obravnavati, čas do pripravljenosti pa je treba upoštevati pri zahtevah glede odzivnosti.

Vzemimo 100 aktivnih ur iz prvega scenarija in pogojnih 20 dodatnih plačljivih ur za čas, ko je instanca pripravljena, čeprav ne obdeluje zahtev, ter za zagon. Skalirani endpoint bi stal (100 + 20) × 0,50 USD = 60 USD. To je manj od 81 USD za javni model na Replicate in precej manj od 365 USD za stalno vključeno instanco.

Pri teh cenah je skalirani endpoint cenejši od plačila aktivnega časa na Replicate, dokler dodatni plačljivi čas ne preseže 62 odstotkov aktivnega časa. Pri 100 aktivnih urah je meja 62 dodatnih ur. Gre za stroškovni prag; če aplikacija potrebuje takojšen odziv na prvo zahtevo po premoru, je treba v odločitev vključiti tudi posledico hladnega zagona.

Lasten model, namenska postavitev in zasebna pot

Ko na Replicate poganjate večino zasebnih modelov ali uporabite namensko postavitev, plačilo zgolj aktivnega časa praviloma ne velja več. Obračun zajame tudi čas nastavljanja in mirovanja instance. Pogojna instanca T4, ki bi bila vključena vseh 730 ur, bi pri navedeni ceni stala 591,30 USD. Dejanski račun je odvisen od tega, koliko časa je vključena posamezna instanca in ali promet zahteva dodatne instance.

Zasebnost modela in omrežna pot zahtev sta ločeni odločitvi. Hugging Face v navodilih za AWS PrivateLink opisuje povezavo med uporabnikovim VPC in endpointom prek zasebnih naslovov znotraj iste regije AWS. Če je taka pot pogoj za produkcijo, mora primerjava vključiti ustrezno konfiguracijo in njene omrežne stroške, ne le cene GPU-ja.

Za lasten model z enakomernim prometom je smiselno primerjati čas delovanja namenskih instanc na obeh storitvah. Za javni model z redkimi zahtevami je odločilno, ali Replicate obračuna samo izvajanje in ali je občasno čakanje sprejemljivo. Pri prometu v sklopih lahko skaliranje na nič spremeni stroškovnega zmagovalca, vendar ga določa skupni plačljivi čas replik, ne zgolj število klicev.

Preberite tudi:

Deli:

Naročite se na naše e-novice

Najnovejše novice o Web3, UI in kriptovalutah neposredno v vaš e-poštni predal.

0