AI detector bilang ebidensiya? Maaaring estilo ang napagkakamalang AI

|May-akda: QUASA Editorial Team|6 minutong pagbasa
AI detector bilang ebidensiya? Maaaring estilo ang napagkakamalang AI

Hindi sapat ang AI detector score bilang patunay ng pandaraya. Maaaring ma-flag ang sulating gawa ng tao, at maaaring magbago ang score matapos itong i-edit kahit nananatili ang may-akda. Sa pag-aaral sa 135,389 pares ng orihinal at propesyonal na inedit na manuskrito gamit ang 13 detector, tumaas ang AI score sa ilang tool at bumaba naman sa iba matapos ang pag-edit.

Walang iisang bilang ng katumpakan na mailalapat sa bawat detector at uri ng sulatin. Mahalaga kung gawa ng tao o AI ang mga tekstong ginamit sa pagsubok, gaano kahaba ang mga ito, at saan itinakda ang hangganan para sa isang flag. Para sa guro, estudyante o editor, ang score ay maaaring magbukas ng tanong tungkol sa proseso ng pagsulat; hindi nito mag-isang masasagot kung may nilabag na tuntunin.

Bakit nagbabago ang score matapos ang pag-edit?

Kapaki-pakinabang ang paghahambing ng orihinal at inedit na bersiyon ng iisang manuskrito: nananatili ang may-akda at pangunahing nilalaman habang nagbabago ang pagkakasulat. Kung nag-iiba ang tugon ng detector sa dalawang bersiyon, sensitibo ito sa mga katangian ng wika bukod sa pinagmulan ng teksto. Kaya maaaring magmukhang mas malapit sa karaniwang AI output ang isang sulatin matapos lamang pakinisin ng tao ang mga pangungusap nito.

May paliwanag ang pagkakaiba ng direksiyon ng mga score. Ang mga pamamaraang sumusukat sa pagiging mahuhulaan ng mga salita ay maaaring magbigay ng mas mataas na AI score sa mas pinakinis at mas regular na wika. Ang classifier na sinanay sa mga halimbawang may label ay maaaring tumugon sa ibang padron at magbigay ng mas mababang score sa parehong pagbabago. Kaugnayan ito na nakita sa pagsubok, hindi patunay na isang partikular na salita o tuntunin sa grammar ang sanhi ng bawat flag.

Mahalaga ring paghiwalayin ang paggalaw ng score at ang pinal na pag-uuri. Maaaring magbago ang numero nang hindi tumatawid sa hangganang ginagamit ng tool para mag-flag; maaari ring sapat ang maliit na galaw kung malapit na rito ang teksto. Ang nasabing pag-aaral ay nakatuon sa mga akademikong manuskritong Ingles na isinulat ng tao at propesyonal na inedit. Gumamit ito ng magkakatulad na paraan ng pag-normalize at threshold para maihambing ang mga detector, at hindi nito direktang sinubok ang mga proprietary na komersiyal na serbisyo. Dahil dito, ang mga false-positive rate sa eksperimento ay hindi awtomatikong rate ng Turnitin o ng ibang produktong ginagamit sa paaralan.

Mas mataas ba ang panganib para sa nagsusulat sa Ingles bilang karagdagang wika?

May malinaw na babala mula sa pagsubok sa 91 TOEFL essay, 88 sanaysay ng mga mag-aaral sa US at pitong detector: 61.22% ang karaniwang false-positive rate ng mga detector sa TOEFL essay, samantalang mas tumpak nilang nakilala ang mga sanaysay ng kabilang pangkat bilang gawa ng tao. Ang porsiyentong iyon ay average sa mga sinubok na tool at sample, hindi tsansa na ma-flag ang sinumang indibidwal na manunulat.

Sa karagdagang eksperimento, nagbago ang pag-uuri nang baguhin ang pagpili ng mga salita sa mga sanaysay. Ipinahihiwatig nito na maaaring mapagkamalan ng detector ang mas limitadong pagkakaiba-iba ng bokabularyo bilang tanda ng AI. Mahalaga ang mekanismong ito sa mga nagsusulat ng akademikong Ingles sa Pilipinas, ngunit hindi sinukat ng eksperimento ang mga Pilipinong manunulat. Magkaiba rin ang pinagmulan at layunin ng dalawang pangkat ng sanaysay, kaya hindi dapat ilipat ang natuklasang rate sa isang klase, tanggapan o kasalukuyang bersiyon ng tool nang walang hiwalay na pagsusuri.

May praktikal na pagkakaiba ang tanong na “gaanong kadalas magkamali ang tool sa sample?” at ang tanong na “gaano katiyak na AI ang isang na-flag na akda?” Kahit alam ang unang rate, kailangan pa ring isaalang-alang kung gaano karami sa mga sinusuring akda ang talagang gumagamit ng AI nang labag sa tuntunin. Kapag maraming sulating gawa ng tao ang dumadaan sa pagsusuri, ang mga maling flag ay maaaring maging malaking bahagi ng mga kasong kailangang repasuhin.

Ano ang sinasabi ng haba at anyo ng teksto tungkol sa score?

May tiyak na saklaw ang bawat produkto. Ayon sa gabay ng Turnitin sa AI Writing Report, kailangan ng hindi bababa sa 300 salita ng tuluy-tuloy na prosa upang makabuo ng ulat. Hindi nito maaasahang suriin sa kaparehong paraan ang mga bullet point, talahanayan, code at iba pang sulating hindi karaniwang prosa. Ang minimum na iyon ay tuntunin ng Turnitin, hindi pangkalahatang pamantayan para sa lahat ng AI detector.

Ang porsiyento sa ulat ay tumutukoy sa bahagi ng kuwalipikadong teksto na minarkahan bilang malamang na ginawa o binago gamit ang AI. Hindi iyon porsiyentong posibilidad na nandaya ang may-akda, at hindi rin nito kailangang katawanin ang bawat bahagi ng dokumentong may halong prosa at iba pang anyo. Kapag isang maikling sipi lang ang inilagay sa ibang detector, maaaring kulang ang konteksto o lumihis ang input sa tekstong ginamit upang sukatin ang pagganap nito.

May isa pang dahilan kung bakit mahirap pagtabihin ang mga ipinapahayag na accuracy rate. Maaaring magkaiba ang haba, wika at paksa ng mga tekstong ginamit sa pagsubok, pati ang dami ng tekstong gawa ng tao at gawa ng AI. Nagbabago rin ang resulta kapag inilipat ang threshold: ang mas agresibong pag-flag ay maaaring makakita ng mas maraming AI text habang mas marami ring gawa ng tao ang nadadamay. Kailangang magkapareho ang kondisyong iyon bago maging makabuluhan ang paghahambing ng dalawang bilang.

Paano naaapektuhan ng humanizer ang kabilang uri ng pagkakamali?

Ang humanizer ay nagbabago ng pagkakasulat ng AI-generated na teksto upang mabawasan ang mga padron na hinahanap ng detector. Sa pag-aaral sa 19 humanizer at paraphrasing tool, maraming umiiral na detector ang hindi nakakilala ng tekstong dumaan sa ganitong pagbabago. Nagpakita rin ang mga mananaliksik ng pamamaraang mas matibay sa sarili nilang pagsubok, kaya hindi pare-pareho ang epekto ng humanizer sa lahat ng detector.

Ito ang false negative: tekstong ginawa ng AI ngunit hindi na-flag. Kabaligtaran nito ang false positive, kung saan sulating gawa ng tao ang minarkahang AI. Maaaring bumaba ang score ng AI text matapos itong baguhin, habang sa ibang sitwasyon ay tumataas ang score ng sulating gawa ng tao matapos ang lehitimong pag-edit. Dahil magkaiba ang pinagmulan ng dalawang teksto, hindi puwedeng gawing garantiya ng pagiging orihinal ang mababang score o patunay ng pandaraya ang mataas na score.

Anong ebidensiya ang kailangan bago magpasya?

Para sa paghusga sa isang takdang-aralin, mas matibay ang proseso kaysa sa nag-iisang flag. Ipinapayo ng gabay ng MSU Denver sa pagtatasa na linawin muna ang pinapayagang paggamit ng AI, humingi ng mga draft, tala o version history, at pakinggan ang paliwanag ng estudyante sa mahahalagang pasiya sa kaniyang akda. Hindi nito itinuturing na sapat na ebidensiya ng paglabag ang resulta ng detector lamang.

  • Suriin ang saklaw ng tool. Tingnan kung sapat ang haba at kung ang anyo at wika ng sulatin ay kasama sa sinusuportahang pagsusuri.
  • Magkaroon ng ikalawang pagsusuri. Ihambing ang flag sa panuto, mga sanggunian at paliwanag ng sumulat bago bumuo ng konklusyon.
  • Itabi ang mga bersiyon. Makakatulong ang mga draft at tala ng pagbabago upang makita kung paano nabuo at inedit ang akda.
  • Huwag magparusa batay lamang sa score. Kung nananatili ang seryosong pagdududa, gamitin ang itinakdang patakaran at higit sa isang uri ng ebidensiya.
I-share:

Mag-subscribe sa aming newsletter

Matanggap ang pinakabagong balita tungkol sa Web3, AI at crypto nang diretso sa iyong inbox.

0