May watermark na ang ChatGPT text—pero kayang pahinain ng salin

|May-akda: QUASA Editorial Team|6 minutong pagbasa
May watermark na ang ChatGPT text—pero kayang pahinain ng salin

Ayon sa ulat ng TechCrunch noong Oktubre 5, 2026, inanunsiyo ng OpenAI ang unti-unting paglalagay ng hindi nakikitang textGrain watermark sa kwalipikadong tekstong gagawin ng ChatGPT at Codex sa European Union. Aabutin ng mga susunod na linggo ang rollout sa EU; maaari nang piliin ng mga gumagamit ng API sa ibang bansa ang watermark para sa ilang modelo, ngunit naka-off ito bilang default. Hindi pa nangangahulugan ang anunsiyo na lahat ng sagot ng ChatGPT ay may marka na.

Ang detector ay naghahanap ng signal sa mismong mga salitang ginamit ng modelo. Ang positibong resulta ay ebidensiyang malamang na bumuo o nagproseso ang isang OpenAI system ng bahagi ng sinuring teksto; hindi nito tinutukoy kung sino ang may-akda ng buong akda. Hindi rin patunay ng taong may-akda ang negatibong resulta: maaaring masyadong maikli, inedit, o isinalin ang teksto upang mabasa pa ang marka.

Saan ilalagay ang textGrain

Binabago ng textGrain ang estadistikal na padron ng pagpili ng salita habang gumagawa ng sagot ang modelo. Walang nakikitang simbolo o dagdag na mensaheng hahanapin sa pahina. Dahil nakapaloob ang signal sa mga salita, maaaring manatili ito kapag kinopya ang teksto, ngunit maaaring humina kapag binago ang pagkakasulat.

Magkaiba ang saklaw ng ChatGPT at Codex rollout sa EU at ng opsiyon sa API. Saklaw ng unang plano ang kwalipikadong output sa EU sa lahat ng plano habang ipinapasok ang teknolohiya nang paunti-unti. Para sa API, kailangang piliin ng kostumer ang watermark sa mga modelong may suporta rito; hindi ito pandaigdigang default. Kaya walang batayan ang palagay na awtomatikong may textGrain ang sagot ng ChatGPT na ginawa sa Pilipinas, bagaman maaaring may markang tekstong likha sa pamamagitan ng API kung pinili ang opsiyon.

Binuksan din ang aplikasyon para sa access sa detector, ngunit sa mga aprubadong mananaliksik at ekspertong organisasyon muna ito ilalaan. Ang pagbubukas ng aplikasyon ay hindi pampublikong paglulunsad ng kasangkapan. Mahalaga ang pagkakaibang ito sa sinumang umaasang maaaring agad magpasuri ng isang artikulo, takdang-aralin, o salin.

Ang kaya at hindi kaya ng resulta

Sa paliwanag ng OpenAI, ang kawalan ng natukoy na watermark ay “does not prove human authorship.” Maaari ring walang mabasang signal kung nauna sa rollout ang teksto, hindi saklaw ang modelong ginamit, o nagmula ito sa sistema ng ibang kumpanya. Sa kabilang panig, ang positibong detection ay may posibilidad ding maging maling positibo; hindi ito pagkakakilanlan ng gumagamit, account, prompt, o usapan.

May hangganan din ang kahulugan ng positibong resulta para sa pinal na akda. Maaaring nakibahagi ang OpenAI system sa pagbuo o pagproseso ng isang bahagi nang hindi nasusukat ng detector ang ambag ng taong pumili, nag-ayos, o nagsulat ng iba pang bahagi. Wala ring sinasabi ang watermark tungkol sa pagmamay-ari, pananagutan, o katumpakan ng mga pahayag sa teksto.

Sa mga pagsusuri ng OpenAI sa mga sagot tungkol sa sikolohiya, natukoy ang watermark sa humigit-kumulang 80% ng mga siping may 200 token at 95% ng may 400 token, sa target na 1% false-positive rate. Mas mababa ang detection sa mga sagot tungkol sa matematika, kung saan mas limitado ang mapagpipiliang salita. Mga resulta ito sa itinakdang kondisyon ng pagsusuri, kaya hindi garantiya ng parehong antas ng detection sa bawat dokumentong isusumite sa detector.

Sa isa pang pagsusuri sa mga siping may 400 token, ang pagpapalit ng 10% ng mga salita ng kasingkahulugan ay nagpababa ng detection mula humigit-kumulang 92% tungo sa 66%. Nang palitan ang 25%, bumaba ito sa 17%. Mga sagot sa Ingles ang ginamit sa pagsubok na iyon: ipinapakita nito ang epekto ng pag-edit, ngunit hindi ito sukat ng magiging detection rate ng tekstong isinalin sa Filipino.

Bakit mahalaga ang anyo ng sipi

Nakasalalay ang nababasang signal sa haba, mga salitang maaaring piliin ng modelo, at mga pagbabagong dinaanan ng teksto. Ito ang pagkakaiba ng apat na karaniwang anyong maaaring humarap sa isang guro, employer, o publisher:

  • Maikling sipi: Kaunti ang pagpili ng salitang maaaring bumuo ng padron. Mas mahirap matukoy ang watermark, kaya limitado ang masasabi ng negatibong resulta.
  • Inedit na teksto: Napapalitan ang ilan sa mga salitang may dalang signal. Maaaring may natirang bahagi mula sa orihinal na output kahit hindi na ito makita ng detector.
  • Isinaling teksto: Nagbabago ang mismong mga salita kung saan nakapaloob ang padron. Kung isinalin sa Filipino ang tekstong unang ginawa sa EU, hindi sapat ang negatibong detection upang sabihing tao ang unang sumulat nito.
  • Code: Mas makitid ang mapagpipiliang anyo ng maraming pahayag kaysa sa malayang prosa. Magkahiwalay na tanong kung gumagana pa ang code at kung nababasa ang watermark nito.

Hindi rin sinusuri ng detector ang kasaysayan ng lahat ng draft kapag ang pinal na bersiyon lamang ang ipinasa. Ang resulta nito ay tungkol sa signal na nabasa sa sinuring sipi, hindi sa bawat yugto ng pagsulat. Para sa salin, lalong mahalaga ang hangganang iyon: maaaring nagbago ang mga salita nang lubusan kahit nanatili ang ideya at pagkakaayos mula sa naunang output.

Ang ipinakita ng hiwalay na pag-aaral sa code

Sa preprint sa arXiv nina Alexander Nemecek, Vipin Chaudhary, at Erman Ayday, sinuri ang bukas na implementasyon ng SynthID-Text sa dalawang open-weight na modelo. Sa kanilang mga pagsubok sa code, halos katumbas ng tsamba ang detection. Tatlong puntos ng correctness ang nasukat na epekto sa isang modelo, habang mas mababa sa kayang sukatin ang epekto sa isa pa.

Hinihiwalay ng resultang iyon ang kalidad ng output sa kakayahang makilala ang pinagmulan nito: maaaring maliit ang nasukat na pagbabago sa paggana ng code kahit mahina ang detection. SynthID-Text at ang mga modelong ginamit sa pag-aaral ang sinubok, hindi textGrain sa Codex; hindi maaaring ilipat ang kanilang detection rate sa bagong rollout ng OpenAI. Para sa textGrain, sinabi ng OpenAI na wala itong nakitang makabuluhang pagkakaiba sa performance ng modelong sinubok nito nang naka-on at naka-off ang watermark.

Habang nagpapatuloy ang paglalagay ng watermark sa EU, limitado pa rin sa mga aprubadong aplikante ang access sa detector. Para sa mga tekstong umaabot sa Pilipinas matapos i-edit o isalin, ang praktikal na bunga ay malinaw: ang kawalan ng natukoy na marka sa pinal na sipi ay hindi sertipiko ng pagiging gawa ng tao.

Basahin din:

I-share:

Mag-subscribe sa aming newsletter

Matanggap ang pinakabagong balita tungkol sa Web3, AI at crypto nang diretso sa iyong inbox.

0