Sariling language AI ng DOST: target ang 2027, hindi pa pampublikong chatbot

|May-akda: QUASA Editorial Team|5 minutong pagbasa| 3
Sariling language AI ng DOST: target ang 2027, hindi pa pampublikong chatbot

Sa ulat ng Journal News Online tungkol sa pagdinig ng Senado sa badyet ng Department of Science and Technology (DOST) noong Setyembre 16, aprubado ang programa para bumuo ng sariling malaking modelong pangwika sa ilalim ng National Artificial Intelligence Center for Research and Innovation (NAICRI), at target ng ahensiya ang pampublikong access sa 2027. Layon nitong saklawin ang malalaking wikang Pilipino at mga wika ng mas maliliit na komunidad, kasama ang kasaysayan at kulturang lokal. Napag-usapan ang programa matapos itanong ni Senador Bam Aquino kung paano makabubuo ang bansa ng AI na sumasalamin sa sariling mga wika at pananaw.

Sa pagsusuri ng Pinoy AI Works noong Setyembre 27, wala pang natukoy na pampublikong bersiyon ng bagong pambansang modelo, opisyal na paraan ng pag-access o tiyak na petsa ng paglulunsad; ang ₱30 milyong nakasaad sa panawagan sa pananaliksik ay pinakamataas na alokasyon sa bawat panukalang programa, hindi pondo ng buong pambansang modelo. Para sa gustong gumamit nito ngayon bilang chatbot, wala pang inilalabas na ganoong serbisyo. Magkaiba ang pag-apruba sa programa, pagpopondo sa pananaliksik at pagbubukas ng produkto sa publiko.

Aling mga wika ang saklaw ng pananaliksik?

Ang ipinahayag sa pagdinig ay malawak na saklaw ng mga wikang Pilipino, mula sa ginagamit ng maraming tao hanggang sa ginagamit ng mas maliliit na komunidad. Hindi pa iyon pinal na talaan ng mga wikang susuportahan ng modelong ilalabas. Wala ring ipinahayag na antas ng husay para sa bawat wika, kaya hindi pa maaaring ipagpalagay na magkakapantay ang kalidad ng magiging mga sagot nito sa Filipino, Cebuano o alinmang iba pang wika.

Mas tiyak ang gawain sa panawagang “Beyond Words: Advancing Large Language Models” ng DOST-PCIEERD. Kabilang dito ang pagbuo ng corpus at LLM platform para sa mga wikang tinutukoy ng Komisyon sa Wikang Filipino, pagpapahusay ng modelo para sa mga wikang kulang sa representasyon o nanganganib mawala, at kakayahang lumipat sa pagitan ng mga wika. Ang corpus ay koleksiyon ng mga halimbawa ng aktuwal na gamit ng wika na maaaring gamitin sa pagsasanay at pagsusuri ng modelo. Kailangan din ng mga taong nakaaalam ng bawat wika upang masukat kung nauunawaan ng sistema ang kahulugan at konteksto, hindi lamang ang baybay ng mga salita.

May mga posibleng gamit na nakatukoy sa panawagan, kabilang ang edukasyon at kalusugan. Mga larangan iyon para sa mga proyektong pananaliksik, hindi anunsiyo na mayroon nang serbisyo para sa guro, pasyente o iba pang gumagamit. Hinihingi rin sa mga panukala ang katuwang na institusyon at access sa angkop na datos, kaya bahagi ng gawain ang pagkuha ng mga halimbawang kumakatawan sa totoong gamit ng wika.

Nakalista sa opisyal na AI roadmap ng DOST-PCIEERD ang proyektong salin sa Filipino at Cebuano na natapos noong 2021, isang natapos na multilingual chatbot para sa pagsubaybay sa kalusugan ng mga batang nasa pampublikong paaralan, at nagpapatuloy na Meranaw speech corpus. Iba-ibang proyekto at katayuan ang mga iyon; hindi sila talaan ng mga wikang tiyak na susuportahan ng bagong pambansang modelo. Kabilang din sa mga gawaing kailangan pang palawakin ang LLM platforms para sa mga wikang Pilipino.

Ano ang papel ng NAICRI at iTANONG?

Ang NAICRI ang sentrong iniugnay sa aprubadong programa sa pagdinig. Ang papel nito ay pagbuo ng kapasidad para sa pananaliksik, advanced computing at mga modelo: mga kakayahang kailangan upang sanayin, patakbuhin at panatilihin ang mas malaking AI system. Kailangan pa rin ng natapos na modelo, pagsusuri sa mga wika, paraan ng pag-host at malinaw na tuntunin kung sino ang makaka-access bago ito maging serbisyong magagamit ng publiko.

May hiwalay nang teknolohiyang pangwika ang DOST-ASTI na tinatawag na iTANONG. Nakapokus ito sa pagtanggap ng tanong sa Filipino, English o Taglish at pagkuha ng sagot mula sa nakakonektang database o mga dokumento. Kung ang isang ahensiya ay may sariling talaan, maaaring dito kumuha ng sagot ang ganitong sistema; nakatali ang lawak ng sagot sa datos na ikinabit dito. Ibang gawain ito sa pagbuo ng pambansang LLM na inaasahang hahawak ng maraming wikang Pilipino at mas malawak na kontekstong lokal.

May praktikal na kahihinatnan ang pagkakaibang ito. Ang pagsuporta ng iTANONG sa Filipino o Taglish ay hindi katibayan na handa na ang bagong modelo para sa isang pampublikong usapan tungkol sa anumang paksa. Gayundin, ang pagkakaroon ng computing capacity sa NAICRI ay hindi nagsasabi kung aling wika ang unang maaabot, gaano kahusay ang magiging sagot, o kung magiging bukas ang modelo sa mga indibidwal at developer.

Magkakaibang katayuan ng mga bahagi ng proyekto

Mas malinaw ang kasalukuyang larawan kapag pinaghiwalay ang desisyon, datos, imprastraktura at serbisyong hinahanap ng publiko:

  • Aprubadong programa: May programa para sa sariling malaking modelong pangwika sa ilalim ng NAICRI. Nasa plano pa ang pampublikong access.
  • Pananaliksik sa mga wika: Nakatuon ang panawagan ng PCIEERD sa corpora, LLM platform at mga wikang kulang sa representasyon. Ang limitasyon sa pondo ay para sa panukalang programa.
  • Umiiral na kapasidad: May iTANONG para sa mga tanong sa nakakonektang datos; binubuo ng NAICRI ang kakayahan sa pananaliksik at computing. Magkaiba ang tungkulin ng mga ito.
  • Produktong para sa publiko: Wala pang inilalabas na bersiyon ng bagong pambansang modelo, pinal na listahan ng suportadong wika, paraan ng pag-access o eksaktong araw ng paglulunsad.

Hindi pa tinutukoy ng target na pampublikong access kung browser, app, API o ibang paraan ang ihahandog. Hindi rin nito nililinaw kung agad na bukas sa lahat ang serbisyo o magkakaroon muna ng limitadong pagsubok. Ang mga detalyeng iyon ang magtatakda kung ano ang tunay na magagawa ng isang gumagamit, bukod sa pagkakaroon ng pananaliksik na pinopondohan ng pamahalaan.

Ang susunod na kailangang linawin ng DOST

Ang mahalagang susunod na anunsiyo ay isang opisyal na plano ng paglabas: pangalan ng modelo, mga wikang unang susuportahan, paraan ng pag-access at iskedyul ng pagbubukas. Doon malalaman kung paano magiging konkretong serbisyo ang aprubadong programa at ang mga hiwalay na gawaing pangwika. Para sa mga naghihintay ng AI na magagamit sa sariling wika, ang mga detalyeng iyon ang magtatakda kung kailan at para kanino ito tunay na mabubuksan.

Basahin din:

I-share:

Mag-subscribe sa aming newsletter

Matanggap ang pinakabagong balita tungkol sa Web3, AI at crypto nang diretso sa iyong inbox.

0