Reka Rho-1 združuje besedilo, video in dejanja v enem modelu

|Avtor: Uredništvo QUASA|4 min branja
Reka Rho-1 združuje besedilo, video in dejanja v enem modelu

Reka je 5. oktobra 2026 predstavila raziskovalni predogled modela Rho-1 z 19 milijardami parametrov. Model Reka Rho-1 v enem nevronskem omrežju razume in ustvarja besedilo, slike ter video, ob tem pa lahko izdaja robotska dejanja. V prikazanih nalogah ohranja skupni kontekst brez klica zunanjega orodja ali preusmeritve na drug model.

Za razvijalce je trenutno odločilen status predogleda. Pregled MarkTechPost navaja, da javni API, uteži modela in cenik še niso objavljeni. Zainteresirane ekipe lahko stopijo v neposreden stik z Reko, javno dostopnega modela za ponovitev prikazanih nalog pa za zdaj ni.

Isti prizor prehaja iz slike v video

Najbolj konkreten prikaz skupnega konteksta je zaporedje zahtev o svetilniku na skalnati obali. Rho-1 ustvari sliko, na njej označi svetilnik, prizor spremeni v video približevanja in nato vreme v posnetku spremeni v snežni metež. Na koncu z besedilom opiše razliko med prvotnim in spremenjenim videom. Naslednja naloga se vsakič naveže na rezultat prejšnje.

Pri označevanju svetilnika model izda koordinate okvira iz stanja ustvarjene slike. Za začetek videa uporabi predstavitev slike, ki je že v kontekstu, namesto da bi izvoženo sliko poslal drugemu generatorju. Zato trditev o enem modelu zadeva potek izvajanja: zaznavanje predmeta, ustvarjanje posnetka in odgovor o spremembi nastajajo znotraj istega omrežja in pogovora.

Prikaz pokaže uspešno zaporedje na izbranem prizoru. Ne pove pa, kako pogosto model enako dobro ohrani predmete in gibanje kamere pri drugih navodilih. V opisu omejitev je ciljno urejanje videa označeno kot nestabilno pri raznolikih zahtevah, zato svetilnik ponazarja zmožnost povezovanja nalog, ne izmerjene zanesljivosti urejanja.

Kako skupni kontekst povezuje različne izhode

Rho-1 različne vrste podatkov obravnava kot žetone v skupnem kontekstu. Diskretni žetoni predstavljajo besedilo, simbolno sklepanje in ukaze na višji ravni. Zvezni žetoni nosijo predstavitve slik, video kadrov, robotskih dejanj in podatkov o položaju telesa. Model lahko ustvarjeni rezultat spet uporabi kot del nadaljnjega konteksta, kar je pomembno pri pogovoru o prizoru, ki ga je sam ustvaril.

Omrežje ima kljub skupnemu kontekstu notranjo specializacijo. Tok za razumevanje obdeluje jezik in vizualne informacije, tok za ustvarjanje pa oblikuje slike in video iz zveznih predstavitev. Toka uporabljata skupno pozornost in isti predpomnilnik ključev in vrednosti, imenovan KV cache. Ko naloga zahteva vizualni izhod, notranji žeton sproži prehod na ustvarjanje, ki nadaljuje iz že zbranega stanja.

To pojasni pomen oznake »en model«: gre za skupno omrežje in stanje med izvajanjem, čeprav različni izhodi zahtevajo različna računska postopka. Besedilo nastaja z napovedovanjem naslednjih diskretnih žetonov, pri zveznih izhodih pa je uporabljen drugačen način učenja in ustvarjanja. Enotnost torej ni v tem, da bi bila slika zgolj besedilo v drugi obliki, temveč v tem, da oba toka delujeta nad istim kontekstom.

Video in robotska dejanja ostajajo prikazi raziskovalnega modela

Predstavitev vključuje tudi destilirano različico Rho-1 Flash, namenjeno hitrejšemu ustvarjanju in spreminjanju videa. Objavljene ocene hitrosti temeljijo na internih meritvah; neodvisne primerjave z enakimi pogoji niso predstavljene. Za presojo uporabnosti je pomembna še kakovost daljšega zaporedja: prostorska zgradba prizora se lahko sčasoma spremeni, četudi so posamezne podrobnosti prepričljive.

Pri robotiki je prikazana epizoda v simulacijskem okolju LIBERO, kjer model napoveduje pogled robotske kamere in izdaja krmilna dejanja. To je prikaz delovanja v simulaciji, ne rezultat preizkusa fizičnega robota. Pri pripravi učnih podatkov se lahko Rho-1 poveže z ločenim modelom, ki iz običajnega videa sklepa o krmilnih signalih. Opis izvajanja brez drugega modela se nanaša na predstavljene naloge Rho-1, ne na celoten postopek učenja.

Kaj je javno znano o dostopu

Objavljene zmožnosti je mogoče povzeti po tem, kaj model sprejema, kaj vrača in kaj je mogoče preveriti zunaj predstavitve:

  • Vhodi: besedilo, slike, video ter podatki o dejanjih in gibanju.
  • Izhodi: besedilo, slike, video, koordinate označenih predmetov in dejanja v prikazani robotski simulaciji.
  • Zgradba: skupno omrežje z diskretnimi in zveznimi žetoni, notranjima tokovoma za razumevanje in ustvarjanje ter skupnim predpomnilnikom KV.
  • Javna preverljivost: na voljo so opis in demonstracije raziskovalnega predogleda; javni API, uteži, cenik in neodvisni preizkusi delovanja Rho-1 niso objavljeni.

Na javnem seznamu modelov v Rekini dokumentaciji Rho-1 ni naveden; dokumentacija obenem opozarja, da se lahko nabor, viden posameznemu računu, razlikuje. Za razvijalca to pomeni, da prikazanega zaporedja trenutno ni mogoče preizkusiti prek javno dokumentiranega modela Rho-1. Naslednji konkreten podatek bo objava pogojev dostopa ali uteži, ki bi omogočila preizkus zunaj izbranih demonstracij.

Preberite tudi:

Deli:

Naročite se na naše e-novice

Najnovejše novice o Web3, UI in kriptovalutah neposredno v vaš e-poštni predal.

0