Ce modele stăpânesc gramatica română: 48% din explicații au erori

|Autor: Echipa editorială QUASA|5 min de citit| 1
Ce modele stăpânesc gramatica română: 48% din explicații au erori

În benchmarkul GRILE, Gemini 2.5 Pro Experimental a obținut 82,8% răspunsuri corecte la 1.151 de grile de gramatică română, dar 48% dintre cele 200 de explicații ale sale revizuite de un specialist au fost considerate problematice. Categoria include justificări incorecte, incomplete sau înșelătoare. Procentul privește eșantionul acelui model, nu explicațiile tuturor modelelor testate.

Gemini a condus proba principală în care modelele au fost instruite să își explice raționamentul. Modelele adaptate pentru română, evaluate și în configurații cu exemple, nu au depășit constant versiunile lor de bază. Pentru cine caută o măsură a competenței lor lingvistice, diferența decisivă este între alegerea literei din barem și formularea unei reguli pe care un elev o poate învăța în siguranță.

Ce măsoară întrebările din GRILE

Setul reunește grile din Evaluarea Națională, Bacalaureat și examene de admitere la facultate, inclusiv pentru drept și poliție. Fiecare întrebare are variante de răspuns și un barem, ceea ce permite calcularea proporției de alegeri corecte. Materialele de origine au inclus documente scanate, transformate în text prin recunoaștere optică și verificate manual prin sondaj. Proveniența din examene face întrebările relevante pentru pregătirea școlară, iar transcrierea și baremul devin, la rândul lor, părți importante ale evaluării.

O alegere corectă poate rezulta din identificarea formei cerute sau din eliminarea variantelor nepotrivite. Explicația are o cerință suplimentară: să numească precis fenomenul lingvistic și să aplice regula adecvată contextului. Dacă modelul bifează varianta bună, dar confundă funcția sintactică și categoria morfologică, scorul de acuratețe rămâne același, în timp ce valoarea pedagogică se schimbă. GRILE surprinde această diferență într-un cadru restrâns, alcătuit din întrebări cu variante, nu din redactări libere sau conversații.

Instrucțiunea schimbă scorul

Rezultatul depinde și de felul în care este cerut răspunsul. În tabelul comparativ al experimentului, DeepSeek V3-0324 trece de la 53,26% la 64,62% când i se solicită pașii raționamentului, în timp ce Mistral Small 24B scade de la 39,10% la 38,31%. Efectul nu este, așadar, uniform: aceeași instrucțiune poate ajuta un model și poate încurca altul. Gemini 2.5 Pro Experimental a fost evaluat în această comparație numai cu raționament explicit, fără un scor direct corespunzător pentru răspunsul scurt.

Într-o altă configurație, întrebarea era precedată de câteva exemple rezolvate. Câștigurile au fost în general mici și inconstante, iar adăugarea de exemple nu a îmbunătățit automat răspunsul. Un clasament care omite formularea cerinței amestecă astfel două lucruri: capacitatea modelului și efectul contextului oferit înaintea grilei. Această distincție contează mai ales când două rezultate par apropiate, dar au fost obținute prin instrucțiuni diferite.

De ce adaptarea pentru română nu a adus mereu un avantaj

În testele GRILE cu exemple, variantele RoLlama au rămas adesea aproape de modelele lor de bază. RoMistral a avut un avantaj modest în unele configurații, în vreme ce modelul de bază Gemma a depășit variantele RoGemma comparabile. Expunerea suplimentară la română poate îmbunătăți comportamentul unui model fără să îi ofere automat precizia necesară pentru o grilă care cere o distincție gramaticală fină. Datele arată rezultatul, dar nu izolează o singură cauză a diferenței dintre modele.

Adaptarea a avut rezultate mai bune pe alte probe. În raportul tehnic OpenLLM-Ro, RoMistral-7b-Instruct depășește Mistral-7B-Instruct-v0.2 la media evaluărilor românești prezentate acolo. Acea medie combină sarcini diferite, între care întrebări de cunoștințe, raționament și completare de text; ea nu reprezintă un scor de gramatică. Prin urmare, avantajul într-un set mai larg de probe poate coexista cu un câștig mic la grilele GRILE.

În evaluarea extinsă a modelelor românești, rezultatele diferă între analiza sentimentului, traducere, răspunsuri la întrebări și similaritate semantică, precum și între configurațiile cu exemple și cele cu ajustare suplimentară. La traducere, direcția dintre engleză și română schimbă și ea comparația. Această variație explică de ce eticheta „specializat pentru română” nu poate ține locul unui rezultat pe sarcina exactă care interesează cititorul.

Când varianta corectă vine cu o regulă greșită

Problemele din explicații nu au toate aceeași gravitate. În analiza calitativă a GRILE, 67 dintre cele 96 de explicații considerate problematice conțineau justificări gramaticale incorecte, iar celelalte 29 aveau imprecizii, pasaje irelevante sau formulări care slăbeau argumentul. Specialistul a întâlnit raționamente greșite chiar și lângă răspunsuri finale corecte. Acesta este riscul specific unui asistent educațional: elevul poate reține regula explicată, nu doar litera selectată.

Aplicarea normelor din DOOM 3 a fost un punct sensibil. Modelul a descris greșit unele forme admise și a formulat nesigur reguli privind abrevierile sau formele recomandate. Au existat și întrebări preluate din examene mai vechi ale căror variante nu mai corespundeau bine normei folosite la revizuire. Într-un asemenea caz, o explicație corectă pentru norma actuală și răspunsul așteptat de un barem vechi pot intra în tensiune. Calitatea întrebării influențează astfel interpretarea unei greșeli atribuite modelului.

Modelul a clasificat în mare parte corect domeniul lingvistic al întrebărilor, dar unele cazuri de graniță au amestecat lexicul, morfologia și sintaxa. Această observație ajută la înțelegerea erorilor din explicații: identificarea aproximativă a temei unei grile este mai ușoară decât precizarea fenomenului care decide varianta corectă. O justificare poate suna convingător și totuși să atribuie răspunsul unei reguli nepotrivite.

Ce valoare are scorul pentru educație

GRILE oferă o măsură utilă pentru rezolvarea grilelor românești de gramatică în condițiile descrise de cercetători. El arată atât diferențe între modele, cât și schimbări produse de instrucțiune. Pentru alegerea unui asistent care explică materia, procentul răspunsurilor corecte este doar o parte a informației: revizuirea de specialitate a găsit probleme pedagogice chiar la modelul aflat în fruntea probei principale.

În același timp, întrebările ambigue și baremele care nu mai corespund normei actuale pot afecta interpretarea unor rezultate individuale. Scorul agregat rămâne relevant pentru acest set de examene, în timp ce calitatea unei explicații cere judecarea regulii invocate și a formulării ei. Diferența dintre aceste două măsurători este tocmai motivul pentru care un rezultat bun la grile nu echivalează cu un profesor de gramatică sigur.

Distribuie:

Abonează-te la newsletter

Primește cele mai noi știri despre Web3, IA și cripto direct în inbox.

0