Tesseract antaa agentin leikata videon – ensimmäinen versio vaati korjauksia

|Kirjoittaja: QUASAn toimitus|4 min lukuaika| 1
Tesseract antaa agentin leikata videon – ensimmäinen versio vaati korjauksia

Mirage julkisti Tesseractin tekoälyagenteille rakennetuksi videoeditoriksi 22. syyskuuta 2026 julkistustiedotteessaan, jossa yhtiön toimitusjohtaja Gaurav Misra kuvasi ideaa sanoilla ”Think of Tesseract as Premiere and After Effects, rebuilt for agents”. Työkalu antaa agentille pääsyn muokattavan videoprojektin leikkauksiin, grafiikkaan ja ääneen. Tekijä voi antaa aineiston ja ohjeet, katsoa tuloksen sekä pyytää muutoksia samaan projektiin.

Syyskuun 21. päivänä 2026 julkaistussa, Miragen sponsoroimassa Aaron Makelkyn varhaiskokeilussa ensimmäinen agentin tekemä versio oli katsottavissa mutta vaati korjauksia ennen hyväksyntää. Tekstitykset olivat liian alhaalla, selittävät grafiikat jäivät toistaviksi, kahvikupin lähennys kaipasi äänitehostetta ja loppuun jäi tauko puhujan viimeisten sanojen jälkeen. Agenttina toimi Codex, ja tekijä hyväksyi myöhemmin korjatun version. Julkaistu työnkulku kertoo yhden tekijän kokemuksesta.

Agentti saa käyttöönsä muokattavan videoprojektin

Miragen Tesseract-tuotesivun mukaan agentti voi käsitellä videon kerroksia, sommitelmia, avainruutuja, ajoitusta ja ääntä suoraan sekä viedä valmiin videon 4K-tarkkuudella ja 60 kuvan sekuntinopeudella. Projekti säilyy muokattavana viennin jälkeen. Vientiasetukset eivät kuitenkaan lisää puuttuvaa tarkkuutta tai uusia liikeruutuja heikkolaatuiseen lähtöaineistoon.

Paikallinen moottori tekee esikatselun ja renderöinnin käyttäjän tietokoneella. Sitä voi käyttää tuetussa agenttiympäristössä ilman erillistä Captions-tiliä; agentin oma tilaus tai mallin käyttö voi silti maksaa. Käyttö on mahdollista myös tuetuissa etäympäristöissä, joten paikallinen tietokone ei ole tuotteen ainoa käyttöympäristö.

Agentin työ on tässä muutakin kuin yhden valmiin videotiedoston palauttaminen. Se voi sijoittaa kuvamateriaalia aikajanalle, ajoittaa tekstiä, animoida grafiikkaa ja säätää ääniraitojen tasoja. Jos tekijä pyytää muuttamaan vain lopetusta tai tekstityksen paikkaa, lähdeaineisto ja muut kerrokset voivat jäädä projektiin ennalleen. Muokattavuus mahdollistaa kohdennetun korjauskierroksen ilman koko videon rakentamista uudelleen.

Tekstitykset ja grafiikka kaipasivat tarkempaa ohjausta

Varhaiskokeilun tavoitteena oli näyttää kuvattu puheenvuoro sekä alkuperäisenä että editoituna rinnakkain. Agentti sai kameran aineiston lisäksi tekijän omat visuaaliset materiaalit. Puheessa toivottiin kaaviota työnkulusta, lähennystä kahvikuppiin ja hiljaista taustamusiikkia. Ensimmäinen vienti sisälsi jo tekstityksen ja grafiikkaa, joten ongelma oli niiden toteutuksessa.

Tekijän brändiaineisto löytyi GitHubista ja tehtävänanto Linearista. Ensimmäinen fontin tuonti vaati yhteensopivuuskorjauksen ennen kuin renderöity teksti käytti tarkoitettuja kirjaimia. Tämä toi työnkulkuun yhden korjattavan asian jo ennen tekstitysten sijoittelua: ohjeessa mainittu fontti ja lopullisessa videossa näkyvä kirjasin eivät olleet aluksi sama asia.

Alkuversion tekstitys näkyi taustallisessa laatikossa liian alhaalla. Seuraavaan versioon tekijä pyysi sanat puhujan vartalon kohdalle ilman laatikkoa ja puheen rytmiin sidottuina. Muutos koski sekä luettavuutta että sitä, miten teksti toimii kahden videokuvan rinnakkaisessa esityksessä. Täysikokoisessa pystyesikatselussa toimiva teksti voi jäädä liian pieneksi, kun sama kuva sijoitetaan vertailun puolikkaaseen.

Grafiikoissa ongelma oli myös sisällöllinen: paikallaan pysyvät laatikot toistivat jo lausuttuja asioita. Korjauspyynnön jälkeen elementit tulivat ja poistuivat puheen etenemisen mukana. Kameran, ChatGPT Workin ja Tesseractin välinen työnkulku esitettiin vaiheittain, jolloin katsoja saattoi seurata yhteyttä pelkkien nimilappujen sijasta. Agentti toteutti liikkeen, mutta päätös grafiikan tehtävästä syntyi tekijän palautteesta.

Äänitehoste ja lopetus korjattiin erikseen

Kahvikuppiin kohdistuva lähennys oli mukana varhaisessa versiossa, mutta pyydetty äänen painotus puuttui. Korjatussa videossa siihen lisättiin erottuva tehoste ja taustamusiikkia vaimennettiin hetkeksi. Muutos sitoi kuvan liikkeen ja äänen samaan hetkeen. Myöhemmässä versiossa tehosteita myös vaihdeltiin niiden tehtävän mukaan, jotta eri siirtymät eivät kuulostaneet samalta.

Lopun ongelma oli näkyvämpi: puhe päättyi, mutta video jatkui tallennuksen pysäyttämistä edeltävään taukoon. Tekijän palaute pyysi päättämään leikkauksen viimeiseen ajatukseen ja tukemaan sitä lähennyksellä. Korjattu vienti päättyi aiemmin, vaikka koko alkuperäinen otto säilyi muokattavassa projektissa. Teknisesti toimiva tiedosto ja julkaisua varten hyväksyttävä rytmi olivat tässä eri asioita.

Tekijä hyväksyi ensin korjatun vertailuvideon väliaikaisesti ja pyysi vielä tarkennuksia tekstitysten painotuksiin sekä äänten vaihteluun. Lopullisessa hyväksytyssä versiossa kuvatekstejä ryhmiteltiin luontevammiksi lausekkeiksi ja valittuja sanoja nostettiin esiin. Leikkaus parani, kun tekijä nimesi kuvassa ja äänessä havaitsemansa puutteet ja agentti toteutti täsmennetyt muutokset.

Puheentunnistus ja musiikki tulivat erillisistä työkaluista

Kokeilun tekstityksessä Tesseract vastasi muokattavasta tekstistä ja sen animaatiosta, mutta puhe litteroitiin erillisellä paikallisella puheentunnistuksella. Sanat tarkistettiin ennen niiden asettamista kuvaan. Tekstityksen lopputuloksessa oli siten kaksi erillistä laatukysymystä: vastasivatko sanat puhetta ja näkyivätkö ne oikein videolla. Tesseractilla agentti pystyi muuttamaan jälkimmäistä osaa palautteen perusteella.

Myös musiikin alkuperä rajaa sitä, mitä kokeilu osoittaa. Taustalla käytetty instrumentaaliraita tehtiin paikallisesti Pythonilla ja tuotiin Tesseract-projektiin. Lyhyisiin äänitehosteisiin käytettiin puolestaan paikallista apuvälinettä, jolla voitiin tuottaa esimerkiksi napsahduksia ja siirtymä-ääniä. Agentti kokosi nämä osat videon miksaukseen; Tesseract ei tässä työnkulussa luonut musiikkia.

Hyväksytyn videon jälkeen tekijä tallensi oman tekstitys-, grafiikka- ja äänityylinsä seuraavia editointeja varten. Hän lisäsi ohjeen myös hillitystä kameraliikkeestä pitkän puhejakson aikana, mutta tätä liikettä ei renderöity hyväksyttyyn videoon. Seuraava samalla ohjeistuksella tehty leikkaus näyttää, väheneekö ensimmäiseen versioon tarvittavan palautteen määrä.

Jaa:

Tilaa uutiskirjeemme

Saat tuoreimmat Web3-, tekoäly- ja kryptouutiset suoraan sähköpostiisi.

0