ChatGPT ar Gemini „Deep Research“: šaltinių gausa dar nereiškia tikslumo

|Autorius: QUASA redakcija|5 min. skaitymo| 2
ChatGPT ar Gemini „Deep Research“: šaltinių gausa dar nereiškia tikslumo

Jei tyrimas turi remtis konkrečiomis viešomis svetainėmis, aiškesnį pasirinkimą suteikia ChatGPT svetainių ribojimas. Jei svarbiausia medžiaga yra „Gmail“, „Drive“ ar „NotebookLM“, patogesnė gali būti Gemini šaltinių atranka. Abu režimai rengia ataskaitas su nuorodomis, tačiau pasirinkimo patogumas ir ataskaitos teisingumas yra skirtingi klausimai.

Viename ekspertinių konsultavimo užduočių etalone iš 70 užduočių „o3-deep-research“ vidutinis griežtas sudėtinis balas buvo 61,4, o „Gemini 3.1 Pro deep-research“ – 52,6; griežtą priėmimo kriterijų atitiko atitinkamai 15,7 ir 12,9 proc. atsakymų. Porinis palyginimas statistiškai reikšmingo šių agentų skirtumo pagal minėtus rodiklius neparodė. Taigi etalonas padeda suprasti klaidų pobūdį, bet neišrenka universaliai patikimesnės šiandienos programėlės.

Ką parodo ekspertinių užduočių bandymas

Bandymo užduotys buvo panašios į konsultanto darbą: reikėjo susieti keliuose failuose esančius duomenis, atlikti skaičiavimus, paisyti leistinų šaltinių ribų ir pateikti panaudojamą rezultatą. Kai kuriuose pradiniuose dokumentuose buvo prieštaringų pastabų, nevienodų matavimo vienetų ar išlygų, keičiančių išvadą. Dėl to sklandus tekstas nebuvo pakankamas: vertinimas atskirai apėmė faktų ir nuorodų tikslumą, analizės pagrįstumą, atitiktį klausimui, vykdymo tikslumą bei pateikimą.

Sudėtinis balas ir griežtas priėmimas atsako į skirtingus klausimus. Pirmasis leidžia matyti dalinę pažangą net tada, kai rezultatas turi trūkumų; antrasis reikalauja, kad atsakymas kartu įveiktų faktinių patikrų ir ekspertinio vertinimo slenksčius. Todėl aukštesnis vidutinis balas dar nereiškia, kad to agento parengtą rekomendaciją dažniau galima priimti be taisymų. Vertinimas vyko per agentų programines sąsajas, o užduotys buvo iš vadybos konsultavimo srities. Šių rezultatų negalima tiesiogiai perkelti visoms „ChatGPT“ ir „Gemini“ programėlių versijoms ar, pavyzdžiui, žurnalistiniam tyrimui.

Viešų šaltinių valdymas: riboti ar teikti pirmenybę

ChatGPT leidžia įvesti konkrečias svetaines ar domenus ir pasirinkti vieną iš dviejų darbo būdų. Griežtas ribojimas nukreipia tyrimą tik į juos; pirmenybės nustatymas leidžia agentui ieškoti ir platesniame internete. Šis skirtumas svarbus, jei atsakymas turi būti pagrįstas, tarkime, pačių institucijų dokumentais: platesnė paieška gali rasti naudingą kontekstą, bet gali įtraukti ir išorinę santrauką, kuri neatitinka nustatytų ribų.

Prieš pradėdamas ChatGPT pateikia siūlomą tyrimo planą, kurį galima taisyti. Vykstant darbui galima jį nutraukti ir patikslinti užduotį ar prieinamus šaltinius; baigtoje ataskaitoje matomas panaudotų šaltinių sąrašas ir veiksmų istorija. Tai palengvina tyrimo kelio peržiūrą, tačiau domeno pasirinkimas pats savaime neapsaugo nuo neteisingai perskaityto laikotarpio, praleistos išnašos ar klaidingo skaičiavimo. Tikrinant išvadą svarbi konkreti šaltinio vieta, o ne vien tai, kad nuoroda veda į leistiną svetainę.

Asmeniniai dokumentai: prieiga lemia pasirinkimą

Gemini pagal numatytąją parinktį tyrimui naudoja „Google“ paiešką. Naudotojas gali pridėti įkeltus failus ir „NotebookLM“ užrašines, o „Gmail“ bei „Drive“ kaip šaltiniai pasiekiami prijungus „Google Workspace“ programą prie „Gemini Apps“. Prieš pradedant galima pasirinkti šaltinius, išjungti „Google“ paiešką ir pataisyti siūlomą planą. Tai leidžia atskirti tyrimą vien iš pasirinktos asmeninės medžiagos nuo darbo, kuriame ji derinama su viešu internetu.

ChatGPT taip pat priima įkeltus failus ir gali naudoti palaikomas prijungtas programas, įskaitant dokumentų saugyklas, jei tai leidžia paskyros, regiono, darbo aplinkos ir prieigos nustatymai. Tad vien failų turėjimas „Drive“ nesuteikia Gemini išskirtinės galimybės juos nagrinėti. Skirtumas atsiranda konkrečioje darbo aplinkoje: kuri programa jau prijungta, kuri paskyra turi teisę skaityti reikiamus laiškus ar dokumentus ir ar tie duomenys pasirinkti tyrimo šaltiniais. Jei šių sąlygų nėra, pranašumas lieka teorinis.

Kodėl citatų skaičius neparodo tikslumo

Konferencijoje publikuotame „DeepResearch Bench“ tyrime „Gemini 2.5 Pro Deep Research“ vidutiniškai pateikė 165,34 patvirtintas teiginio ir nuorodos poras vienai užduočiai, o „OpenAI Deep Research“ – 39,79; citatų tikslumas buvo atitinkamai 78,30 ir 75,01 proc. Šie duomenys gauti iš anksčiau surinktų atsakymų, todėl neapibūdina dabartinių režimų veikimo. Jie parodo esminį skirtumą tarp to, kiek pagrįstų teiginių ataskaita surenka, ir to, kokia visų tikrintų teiginio bei nuorodos porų dalis iš tiesų turi atramą šaltinyje.

Citatų tikslumas šiame bandyme vertintas pagal tai, ar nurodyto tinklalapio turinys pagrindžia prie jo priskirtą teiginį. Net ir veikianti nuoroda gali vesti į puslapį, kuriame aptariama ta pati tema, bet nėra reikiamos išvados; kartais skiriasi metai, teritorija arba matuojamas dydis. Gausesnė bibliografija tokią klaidą gali paslėpti, nes ataskaita atrodo išsamiai dokumentuota. Dėl to prasmingiau vertinti teiginio ir šaltinio ryšį nei skaičiuoti nuorodas ataskaitos gale.

Pasirinkimas pagal užduotį

  • Atvira interneto paieška. Abu režimai tinka plačiai šaltinių paieškai. Pasirinkimą labiau lemia tai, ar reikės jungti viešą medžiagą su savo failais ir kaip patogu koreguoti siūlomą tyrimo planą.
  • Nurodytų domenų tyrimas. ChatGPT turi aiškų griežto ribojimo pasirinkimą. Jei leistini tik konkrečių institucijų puslapiai, šis nustatymas tiksliau išreiškia užduoties ribą nei bendras prašymas remtis patikimais šaltiniais.
  • Asmeniniai dokumentai. Gemini patogus, kai reikalingi laiškai, „Drive“ failai ar „NotebookLM“ užrašinės jau pasiekiami prijungtoje paskyroje. Atskiriems įkeltiems failams tinka abu režimai; lemiamas klausimas yra reali prieiga prie visos būtinos medžiagos.
  • Citatų patikra. ChatGPT šaltinių sąrašas ir veiksmų istorija padeda atsekti tyrimo eigą. Abiejų režimų ataskaitose kiekvieną svarbų teiginį vis tiek reikia sutikrinti su jo nurodyta vieta originale.
  • Ekspertinis sprendimas. Jei ataskaita tampa rekomendacijos ar skaičiavimo pagrindu, etalono vidurkis neatsako už konkrečią išvadą. Didesnį svorį turi patikrinti pradiniai duomenys, aiškios prielaidos ir pakartojamas skaičiavimas.

Kaip patikrinti lemiamą išvadą

Pradėkite nuo teiginių, be kurių galutinė rekomendacija pasikeistų. Atverkite prie kiekvieno jų pridėtą originalų puslapį ar failą ir raskite vietą, kurioje nurodytas būtent tas faktas. Palyginkite subjektą, laikotarpį, teritoriją, matavimo vienetus ir išlygas. Jei nuoroda pagrindžia tik bendrą temą, tokio teiginio dar negalima laikyti patvirtintu, kad ir kiek kitų šaltinių būtų ataskaitoje.

Skaitinę išvadą perskaičiuokite iš pirminių reikšmių, ypač kai ji sujungia kelias lenteles ar dokumentus. Kai tyrime naudoti ir asmeniniai failai, ir interneto paieška, nustatykite, iš kurios aplinkos paimta kiekviena sprendimui svarbi prielaida. Taip pasirinkimas tarp ChatGPT ir Gemini lieka susietas su darbo pobūdžiu, o pasitikėjimas ataskaita – su jos konkrečių teiginių patikrinamumu.

Dalintis:

Prenumeruokite mūsų naujienlaiškį

Gaukite naujausias Web3, DI ir kriptovaliutų naujienas tiesiai į savo el. pašto dėžutę.

0