
ChatGPT vai Gemini izpētei: vairāk avotu vēl nenozīmē precīzāku atbildi

Ja izpētes atskaitē svarīgi ir citāti, kas tiešām pamato apgalvojumus, ChatGPT Deep Research ir pamatota sākuma izvēle. Vienādu uzdevumu praktiskajā pārbaudē tā atsauces atbalstīja 27 no 31 apgalvojuma, bet Gemini Deep Research — 25 no 31. Gemini tajā pašā literatūras apskata uzdevumā izmantoja 68 unikālus avotus pret ChatGPT 31 un atskaiti sagatavoja 5 minūtēs un 10 sekundēs pret 9 minūtēm un 40 sekundēm. Tātad šajā uzdevumā plašāks un ātrāks meklējums nedeva precīzākas atsauces.
Ja vispirms jāapzina iespējami plašs materiālu loks vai jāiesaista Google vidē glabāti dati, piemērotāks var būt Gemini. Izvēli nosaka tas, vai darbam vairāk vajadzīga avotu atlases kontrole, piekļuve konkrētiem failiem, ātrs sākotnējais pārskats vai citāti publicējamam secinājumam. Praktiskā pārbaude rāda konkrētu rezultātu vienam uzdevumam un tālaika rīku konfigurācijām; tā nenosaka pastāvīgu precizitātes reitingu.
Avotu atlase: kontrole pār vietnēm
ChatGPT stiprā puse ir iespēja skaidri noteikt tīmekļa avotu robežas. OpenAI instrukcija paredz divas atšķirīgas izvēles: ierobežot izpēti līdz norādītajām vietnēm vai piešķirt tām prioritāti, vienlaikus ļaujot meklēt arī pārējā tīmeklī. Pirms izpētes var pārskatīt piedāvāto plānu; gatavajā atskaitē ir atsauces vai avotu saites.
Stingrs ierobežojums noder, ja uzdevums jābalsta noteiktas iestādes dokumentos vai iepriekš atlasītā publikāciju kopumā. Prioritāte ir piemērotāka, ja šie avoti jāizceļ, bet vērtīgas ziņas var būt arī citur. Abos gadījumos kontrole attiecas uz meklēšanas vietu, nevis automātiski uz secinājuma pareizību: arī izvēlētā vietnē vajadzīgais pētījums var nebūt pieejams vai būt pārstāstīts nepilnīgi.
Savienotie dati: ko rīks var iekļaut izpētē
Gemini priekšrocība kļūst konkrēta, ja darba materiāli atrodas Gmail, Drive vai NotebookLM. Google instrukcija norāda, ka Deep Research pēc noklusējuma izmanto Google Search, bet avotu izvēlē var pievienot failus, NotebookLM piezīmju grāmatas, Gmail un Drive; pēdējiem diviem vajadzīgs Gemini Apps savienojums ar Google Workspace lietotni. Google Search var arī izslēgt, ja izpēte jābalsta tikai citos izvēlētajos avotos.
ChatGPT Deep Research arī pieņem augšupielādētus failus un var izmantot atbalstītas savienotās lietotnes. Tāpēc izvēli starp abiem rīkiem nevajadzētu reducēt uz jautājumu, kurš vispār spēj atvērt failu. Izšķiroši ir tas, vai konkrētajā kontā pieejams vajadzīgais savienojums, vai tam ir tiesības lasīt attiecīgo materiālu un vai gatavajā atskaitē iespējams atrast fragmentu, uz kuru balstīts secinājums. Pieejamība var atšķirties pēc plāna, konta un darbvietas iestatījumiem.
Avotu daudzums nav citātu atbilstība
Vienam un tam pašam pārskatam var būt daudz avotu un vienlaikus teikumi, kurus tiem pievienotās atsauces nepamato. Saite var atvērties, bet vest uz pētījuma pārstāstu, uz darbu par citu cilvēku grupu vai uz publikāciju, kurā nav minētā rezultāta. Saite, kas neatveras, un saite uz nepiemērotu saturu ir atšķirīgas kļūdas; abas liedz lasītājam pārbaudīt konkrēto apgalvojumu.
Praktiskajā pārbaudē avotu skaits raksturoja meklējuma plašumu, savukārt atbalstīto apgalvojumu skaits — citātu atbilstību. Šīs mērauklas atbild uz dažādiem jautājumiem. Plašums palīdz pamanīt jaunus pētījumus un atšķirīgus skatpunktus, taču katrs atrastais darbs vēl jāsaista ar pareizo apgalvojumu. Rīks, kas ātri savāc vairāk materiālu, var ietaupīt laiku izpētes sākumā un prasīt vairāk darba pirms secinājumu publicēšanas.
Ko rāda plašāki pētījumi
Līdzīgu atšķirību starp atsauču daudzumu un kvalitāti rāda ReportBench pētījums: akadēmisku pārskatu uzdevumos Gemini Deep Research atskaitēs vidēji bija 32,42 atsauces pret OpenAI Deep Research 9,89, bet citēto apgalvojumu atbilstība avotiem bija attiecīgi 72,94% un 78,87%. Šajā pētījumā atbilstība vērtēta automatizēti, tāpēc tās procentus nevar tieši salīdzināt ar cilvēka pārbaudīto citātu skaitu vienā praktiskā uzdevumā. Abi rezultāti tomēr nošķir avotu apjomu no tā, cik labi tie pamato tekstu.
Vēl citu jautājumu — vai rīks vispār atrod nozīmīgos darbus — aplūko Liu un līdzautoru priekšpublicējums. Tajā analizētas 720 vispārējo tērzēšanas modeļu atbildes uz medicīniskiem jautājumiem, salīdzinot atrastos pētījumus ar Cochrane pārskatos iekļautajiem darbiem. ChatGPT vidēji atrada 63,1% no tiem, Gemini — 17,3%. Tie ir medicīniskās literatūras atrašanas rezultāti par pārbaudē lietotajiem modeļiem, nevis abu Deep Research režīmu citātu precizitātes mērījums. Tie atgādina, ka precīzi citēta atskaite vēl var nepilnīgi aptvert svarīgo literatūru.
Izvēles matrica konkrētam uzdevumam
- Noteikts publisko avotu loks. ChatGPT ir piemērota sākuma izvēle, ja jāierobežo meklēšana līdz zināmām vietnēm vai šīm vietnēm jāpiešķir prioritāte. Vērtējiet, vai atrastie dokumenti satur vajadzīgo pierādījumu, ne tikai nāk no paredzētā domēna.
- Materiāli Google pakalpojumos. Gemini ir loģiska izvēle, ja izpētē jāiekļauj pieejami Gmail, Drive vai NotebookLM materiāli. Pirms plaša uzdevuma pārliecinieties, ka savienojums redz tieši vajadzīgo saturu.
- Ātrs sākotnējais pārskats. Vienā publicētajā pārbaudē Gemini atskaiti pabeidza ātrāk un aptvēra vairāk avotu. Darba kopējais ilgums būs atkarīgs arī no tā, cik daudz atrasto apgalvojumu vēl būs jāpārbauda.
- Secinājumi ar pārbaudāmām atsaucēm. ChatGPT ir pamatota sākuma izvēle, ja kļūdaina atsauce radītu lielas sekas darbā, ko iesniegsiet vai publicēsiet. Šī izvēle neatceļ citātu pārbaudi.
Minimālā pārbaude pirms atsauces izmantošanas
Galvenajiem secinājumiem atveriet katru piesaistīto darbu un atrodiet vietu, kas pamato tieši atskaitē rakstīto teikumu. Salīdziniet pētāmo grupu, periodu, izmantoto mērauklu un rezultāta virzienu. Ja atskaite atsaucas uz ziņu par pētījumu, bet darbam būtisks ir paša pētījuma rezultāts, pārbaudiet sākotnējo publikāciju.
Literatūras apskatā ar citātu pārbaudi vien nepietiek: salīdziniet atrasto darbu kopumu ar piemērotu pārskatu, datubāzes meklējumu vai iepriekš noteiktiem atlases kritērijiem. Tā atklājas cita veida kļūda — svarīgi darbi, kas atskaitē vispār nav nonākuši. Izvēles cena ir skaidra: plašāks meklējums palielina pārbaudāmo materiālu loku, bet šaurāks var atstāt ārpus tā nozīmīgus avotus.
Lasiet arī:
Saistītie raksti


Gemini Notebook vai Perplexity: avotu komplekts maina uzvarētāju

ECB grib testēt MI aģentus ar digitālo eiro — emisija vēl nav izlemta

Google Drive vai OneDrive: vairāk bezmaksas vietas vai ātrāka sinhronizācija

RAG vai modeļa pielāgošana: lielākai precizitātei ir sava cena

MI lietošana aug, bet spriestspēja atpaliek: IBM atklāj bīstamu plaisu
Abonējiet mūsu jaunumu vēstuli
Saņemiet jaunākās Web3, MI un kriptovalūtu ziņas tieši savā e-pastā.