
ChatGPT eller Gemini Deep Research? Flere kilder er ikke mere præcise

Vælg Gemini Deep Research, når du skal kortlægge mange mulige kilder eller samle materiale fra Googles tjenester. Vælg ChatGPT Deep Research, når du vil styre, hvilke websites der indgår i researchen. I en offentlig måling havde rapporterne fra Gemini flere referencer, men lavere overensstemmelse mellem citerede udsagn og kilder end rapporterne fra OpenAI Deep Research.
Det gør hverken antallet af links eller én samlet rangliste til et sikkert valgkriterium. En god rapport skal både finde relevante kilder og bruge dem korrekt. Kildekvalitet, ventetid og adgang til egne dokumenter vejer forskelligt i en markedsanalyse, en litteraturgennemgang og et spørgsmål om interne filer.
Hvad måler sammenligningerne egentlig?
I ReportBenchs akademiske benchmark brugte Gemini Deep Research i gennemsnit 32,42 referencer pr. rapport og opnåede en citation match rate på 72,94 procent; OpenAI Deep Research brugte 9,89 referencer og opnåede 78,87 procent. Citation match rate handler om, hvorvidt et citeret udsagn stemmer overens med indholdet i den kilde, det henviser til. Flere referencer kan altså udvide en rapport uden at forbedre denne form for præcision.
Benchmarken bygger på opgaver afledt af videnskabelige oversigtsartikler. Dens kontrol af citerede udsagn bruger blandt andet automatisk semantisk sammenligning med kildetekster. Den måling er ikke det samme som en fagpersons vurdering af, om rapporten har valgt de vigtigste studier, eller om dens samlede konklusion holder. Benchmarkens separate præcisionsmål vedrører overlap med oversigtsartiklernes referencelister og må heller ikke forveksles med citation match rate.
I AI vs Tools manuelle litteraturtest understøttede 27 af 31 ChatGPT-citationer og 25 af 31 Gemini-citationer den tilknyttede påstand; de færdige rapporter tog henholdsvis 9 minutter og 40 sekunder og 5 minutter og 10 sekunder. Her blev henvisningerne åbnet og vurderet manuelt, men resultatet gælder én bestemt litteraturopgave på betalte konti. Sitet har affiliate-links, og forskellen på få citationer er ikke et løfte om samme resultat ved andre emner eller senere produktversioner.
Kildevalget begynder før rapporten
Googles vejledning til Gemini Deep Research angiver Google Search som standardkilde og beskriver valg af Gmail, Drive, uploadede filer og NotebookLM-notesbøger. Gmail og Drive kræver, at Google Workspace-appen er forbundet. Brugeren kan redigere den foreslåede researchplan og fravælge Google Search, hvis arbejdet skal begrænses til andre valgte kilder.
OpenAI’s vejledning til ChatGPT Deep Research beskriver ligeledes en plan, der kan ændres før start, samt adgang til offentlige websider, uploadede filer og understøttede tilknyttede apps. Websøgningen kan begrænses til bestemte websites eller prioritere dem og samtidig beholde adgang til resten af nettet. App-adgang afhænger blandt andet af abonnement, område, arbejdspladsens indstillinger og rettigheder i den tilknyttede tjeneste.
Den forskel er mere brugbar end en generel påstand om, at det ene værktøj altid søger bredere. Geminis valg passer til et spørgsmål, hvor oplysningerne er spredt mellem åben søgning og materiale i Googles tjenester. ChatGPTs valg af websites passer til et spørgsmål, hvor dokumentationen skal komme fra en på forhånd afgrænset kreds, eksempelvis myndigheder, tidsskrifter eller virksomheders egne udgivelser. Begge værktøjer kan arbejde med uploadede filer, så dokumenternes placering og de faktisk tilgængelige forbindelser bør afgøre valget.
Beslutningsmatrix: tre forskellige opgaver
- Markedsanalyse: Gemini er et godt udgangspunkt, hvis formålet er at opdage aktører, udmeldinger og mulige modstridende oplysninger på tværs af mange kilder. ChatGPT er mere oplagt, når analysen skal holde sig til en fast kreds af eksempelvis myndigheder, børsmeddelelser og selskabernes egne rapporter. En markedsstørrelse bør i begge tilfælde spores til den oprindelige opgørelse: Hvilken geografi, periode og definition af markedet bruger den?
- Akademisk research: Resultaterne om citationsmatch taler for at overveje ChatGPT, når kildeunderstøttelse vejer tungest, men de afgør ikke, hvilket værktøj der finder flest relevante studier om dit emne. Geminis bredere referencemængde i benchmarken kan være nyttig i en indledende kortlægning. Skeln efterfølgende mellem originalstudier, oversigtsartikler, preprints og omtale af forskning, og kontrollér om metode og undersøgte personer passer til rapportens påstand.
- Interne dokumenter: Begynd med adgangsvejen. Gemini passer til materiale i et forbundet Google-miljø, mens ChatGPT kan bruge uploadede filer og apps, der er understøttet og aktiveret for kontoen. Ved spørgsmål på tværs af dokumenter er det afgørende, om værktøjet faktisk har adgang til alle relevante filer og kan pege på det konkrete sted, hvor svaret står. Et svar kan lyde overbevisende, selv om et manglende bilag ville ændre konklusionen.
Hastighed omfatter også kontrollen bagefter
Den korteste ventetid giver ikke nødvendigvis den hurtigste vej til et svar, du kan bruge. En omfattende rapport kan kræve tid til at sortere gentagelser og finde originalkilder. En stram rapport kan til gengæld kræve en ekstra søgning, hvis en vigtig vinkel mangler. Den målte forskel i rapporttid fra litteraturtesten siger noget om netop dens arbejdsforløb, men ikke hvor længe efterkontrollen tager ved din opgave.
For en bred markedsafsøgning kan det være rationelt at acceptere flere henvisninger, fordi værdien ligger i at opdage mulige kilder. For en rapport, der skal dokumentere en konkret konklusion, er det vigtigere, hvor hurtigt de afgørende udsagn kan føres tilbage til brugbare originalkilder. Vurder derfor hastighed sammen med kvaliteten af de henvisninger, som rapporten faktisk bygger på.
En citationskontrol, der kan gentages
Hvis valget er vigtigt, kan en lille stikprøve vise, hvordan værktøjerne klarer din egen type opgave. Giv dem samme spørgsmål, tidsperiode, geografi og krav til kilder. Notér også hvilke filer og forbindelser hvert værktøj havde adgang til; ellers kan forskelle i resultatet skyldes forskelligt materiale.
- Vælg efter samme regel fem henvisninger fra hver rapport: to ved hovedkonklusioner, én ved et tal, én ved en ny oplysning og én tilfældigt valgt. Mangler en kategori, så notér, hvad der blev valgt i stedet.
- Åbn hver henvisning og find passagen bag den konkrete påstand. Sammenhold tal, periode, land, undersøgte personer og væsentlige forbehold. En fungerende URL viser kun, at siden findes.
- Registrér henvisningen som understøttet, delvist understøttet, ikke understøttet eller utilgængelig. Notér, om den peger på original dokumentation eller gengiver en anden kilde.
- Sammenlign både antallet af understøttede udsagn og fejl, der kunne ændre konklusionen. En lille stikprøve er en kontrol af de rapporter, du står med, ikke et mål for tjenesternes generelle nøjagtighed.
Læs også:
Relaterede artikler


ChatGPT, Claude eller Gemini til 20 dollar? Pakken afgør valget

Store PDF-samlinger i NotebookLM: Kilderne kan stadig falde ud

Elicit eller Consensus? Et hurtigt svar er ikke et litteraturreview

Claude Team eller ChatGPT Business? Fem sæder ændrer startprisen

OpenAI-agenter lækkede 53 brugerbilleder – gennemgangen tager måneder
Tilmeld dig vores nyhedsbrev
Få de seneste nyheder om Web3, AI og krypto direkte i din indbakke.