Griffin narrede 48 procent på ét minut – testen havde kun 54 deltagere

|Forfatter: QUASA's redaktion|5 min. læsning
Griffin narrede 48 procent på ét minut – testen havde kun 54 deltagere

I Tavus’ præsentation af Griffin den 1. oktober 2026 oplyste virksomheden, at 26 af 54 deltagere, svarende til 48 procent, efter ét minuts videosamtale troede, de havde talt med et menneske. Samtalepartneren var drevet af Griffin-Lite, som foreløbig kun er et forskningspreview for udvalgte testere. Tallet beskriver svarene i virksomhedens eget, korte forsøg.

Griffins særlige greb er at opfatte lyd og billede, føre samtalen og skabe stemme og video samtidig. CellCogs gennemgang af forsøget sætter resultatet op mod Tavus’ tidligere løsning med Phoenix-4.5, Sparrow-2 og Raven-1: Her tog 1 af 41 deltagere, eller 2,4 procent, samtalepartneren for et menneske. Forskellen er stor i de to grupper, men forsøget viser ikke, hvilken enkelt ændring i systemet der skabte den.

Et minut med en partner, der blev skabt under opkaldet

Deltagerne blev rekrutteret via en forskningsplatform og fik at vide, at de skulle tale med en anden deltager om, hvad de glædede sig til i år. I stedet mødte de en digital person, der dannede ansigt, stemme og svar løbende. Det åbne samtaleemne gav plads til spontan tale, men opkaldet var så kort, at modellen ikke behøvede at holde et komplekst sagsforløb sammen over tid.

Efter opkaldet skulle deltagerne gengive partnerens svar og vurdere blandt andet naturlighed, troværdighed, samtalens forløb og oplevelsen af at blive lyttet til. Først sidst i spørgeskemaet blev de spurgt, om tanken om en kunstig samtalepartner havde strejfet dem; derefter fik alle oplyst, at de havde talt med AI. Rækkefølgen betyder noget: De var blevet stillet en menneskelig partner i udsigt og gik ikke ind i samtalen med en opgave om at afsløre en model.

Andelen er beregnet ud fra deltagernes egne vurderinger efter netop dette møde. Ét ændret svar ville flytte den med knap to procentpoint, og sammenligningen med den tidligere løsning bruger en anden gruppe mennesker. Deltagernes forventning er derfor en del af målingen. Et længere opkald, en anden samtaleopgave eller deltagere, der på forhånd kendte muligheden for AI, kunne give et andet resultat; det er ikke målt i dette forsøg.

Sådan ændrer Griffin samtalens timing

Griffin er beskrevet som et samlet video-til-video-system med fuld dupleks: Det kan fortsætte med at lytte og se, mens det selv taler. En samtalemotor fortolker indgående lyd og video og beslutter løbende, om den skal tale, vente eller reagere på en afbrydelse. Generatorer inden for samme system omsætter beslutningerne til tale og bevægelige billeder. Det er en anden koordinering end en kæde, hvor tale først genkendes, derefter behandles og til sidst lægges på en talende figur.

Modellen bruger også blik, ansigtsudtryk og pauser som signaler om, hvor samtalen er på vej hen. Et lille nik, mens den anden taler, eller et stop midt i et svar kan få udvekslingen til at virke mindre mekanisk end et system, der altid venter på stilhed. Den fortolkning passer til designet, men forsøget adskiller ikke bidraget fra samtalemotor, stemme, ansigt og deltagernes forventninger. Det var den samlede digitale person, som blev bedømt.

Videodelen kan skabe hele billedet ud fra et referencebillede, også bevægelse uden for munden og ændringer i baggrunden. Det gør løsningen mere ambitiøs end en figur, hvis læber blot følger færdig tale. Samtidig stiller det større krav til sammenhængen mellem det sagte, kroppens reaktion og billedet: En forsinket gestus kan afsløre den kunstige samtalepartner, selv om ordene lyder naturlige. Forsøget fortæller, hvad deltagerne troede efter samtalen, men isolerer ikke disse visuelle faktorer.

Et benchmark stiller et andet spørgsmål

På NVIDIAs VideoFDB-resultatside får Griffin-Lite 3,73 på perceptionssporet mod menneskereferencens 4,20 og 3,83 på genereringssporet mod 3,92. Her bedømmes blandt andet, om systemet opfatter samtalens visuelle signaler og producerer passende svar og mimik. Griffin-Lite ligger øverst blandt de viste modeller på begge spor, mens menneskereferencen ligger højere. Det er en måling efter fastlagte bedømmelseskriterier, ikke et spørgsmål til seere om, hvem der er menneske.

De to forsøgsformer beskriver forskellige egenskaber ved samme previewmodel. Den tekniske evaluering giver et mere specificeret billede af, hvordan systemet reagerer på sociale signaler; den korte samtale måler deltagernes samlede indtryk. En stærk benchmarkplacering kan ikke omsættes direkte til en sandsynlighed for, at en kunde eller mødedeltager bliver narret. Den forskel er væsentlig, når resultatet fra et lille samtaleforsøg bruges til at beskrive et stort spring i naturtro video.

Previewadgangen gør mærkning til det næste spørgsmål

Den begrænsede adgang betyder, at resultatet endnu ikke beskriver et færdigt kundeværktøj i drift. Før en bredere version frigives, arbejder virksomheden med sikkerhedsprocedurer og funktioner, der skal gøre det tydeligt, når samtalepartneren er syntetisk. Der er ikke angivet en fast dato for almindelig kundeudrulning. Den snævre adgang hænger sammen med den risiko, forsøget illustrerer: Et naturtro ansigt kan blive taget for en person, hvis identiteten først afklares bagefter.

I kundeservice vil en syntetisk videorepræsentant kunne blive opfattet som en ansat, især hvis samtalen er kort og flydende. I videomøder er ansigt og stemme heller ikke tilstrækkelige til at fastslå, hvem der deltager, når modellen kan danne begge dele i realtid. Det er en risikovurdering ud fra modellens beskrevne funktion og testens resultat, ikke rapporterede hændelser med Griffin hos kunder. Tydelig oplysning i selve opkaldet ville give modparten en mulighed, som testdeltagerne først fik efter mødet.

Den næste udvidelse af adgangen bliver en prøve på, om oplysningen om den syntetiske samtalepartner kommer frem, før samtalen begynder. En uafhængig undersøgelse med længere opkald ville samtidig kunne vise, om menneskeindtrykket holder, når deltagerne kender muligheden for AI på forhånd.

Læs også:

Del:

Tilmeld dig vores nyhedsbrev

Få de seneste nyheder om Web3, AI og krypto direkte i din indbakke.

0