Gemini 3.8 TTS nanguna sa boses, pero kapos pa sa voice cloning

|May-akda: QUASA Editorial Team|6 minutong pagbasa
Gemini 3.8 TTS nanguna sa boses, pero kapos pa sa voice cloning

Sa pagsusuri ng Hume noong Setyembre 24, 2026, nanguna ang Gemini 3.8 Flash TTS at pumangalawa ang Flash-Lite sa pinagsamang sukatan ng pagpapahayag at pagiging maaasahan; sa pagkakahawig sa orihinal na tagapagsalita, ika-11 sa 13 ang Flash at ika-7 ang Flash-Lite, habang umakyat ang marka sa extended long-form stability mula 1.22 ng naunang Gemini 3.1 Flash TTS sa 2.89 ng bagong Flash at 3.03 ng Flash-Lite. Maganda ang resulta para sa paglikha at pagpapanatili ng boses, ngunit mas limitado ang patunay para sa tumpak na paggaya sa isang tao.

Sa paglulunsad ng Google noong Setyembre 23, 2026, ipinakilala ang Gemini 3.8 Flash TTS at Flash-Lite TTS: kayang magdisenyo ng Flash ng boses sa mahigit 100 wika at diyalekto, at kayang gumaya ng boses mula sa 30 segundong sampol na may beripikasyon ng pahintulot. Sinimulan ang paglabas ng mga modelo sa Gemini API at Google AI Studio. Para sa salaysay, doblaj at voice agents, magkaiba ang halaga ng malawak na kontrol sa pagganap, matatag na boses sa mahabang audio at pagkakahawig sa isang tunay na tagapagsalita.

Malawak ang voice design, ngunit hindi pantay ang kontrol

Ang pinakamalinaw na lakas ng Flash ay ang paglikha ng boses para sa isang bagong karakter o tagapagsalaysay. Maaaring ilarawan ang papel, punto at katangian ng tinig sa karaniwang pananalita, pagkatapos ay idirekta ang emosyon at bilis ng bawat linya. Nagbibigay ito ng pagpipilian sa isang produksiyong nangangailangan ng magkakaibang boses, sa halip na umasa lamang sa nakahandang tinig.

Magkaiba ang diin ng dalawang modelo. Nakatutok ang Flash sa mas masusing pagdidirekta ng pagganap at disenyo ng karakter; nakatuon ang Flash-Lite sa mabilis at maramihang paggawa ng audio, kabilang ang doblaj at mga voice agent. Pareho silang may kontrol sa paraan ng pagbigkas, kaya maaaring baguhin ang dating ng isang linya nang hindi muling sinusulat ang mismong sasabihin.

May hangganan ang malawak na kontrol na iyon. Nanguna ang Flash sa hiwalay na pagsusuri ng voice design, lalo na sa paglikha ng hinihinging punto, ngunit mas mahina ang pagsunod nito sa ilang eksaktong katangian gaya ng edad ng tinig at lakas ng tunog. Sa isang kathang-isip na karakter, maaaring mas mahalaga ang kapani-paniwalang kabuuang pagganap; sa produksiyong may mahigpit na gabay sa bawat katangian, mahalaga rin ang mga hindi nasusunod na detalye.

Mas matatag ang tinig sa mahahabang salaysay

Malaki ang pagbuti ng parehong bagong modelo sa pagpapanatili ng pagkakakilanlan ng boses habang humahaba ang audio. Ang extended long-form stability ay tumitingin sa paglihis ng tinig sa mas mahabang pagbigkas. May magkahiwalay ding pagsusuri para sa karaniwang mahabang bahagi at sa pagsasalitang gumagamit ng maraming wika, kaya hindi iisang marka ang sumasagot sa lahat ng sitwasyon.

Mahalaga ito sa audiobook, podcast at iba pang salaysay na nagpapatuloy lampas sa maiikling linya. Kapag nag-iiba ang timbre ng isang tagapagsalita sa kalagitnaan, napuputol ang pakiramdam na iisang tao ang nagsasalita. Maaari ring maging mahalaga ang pagiging pare-pareho ng tinig sa voice agent na sumasagot nang paulit-ulit sa loob ng isang pag-uusap.

Kaya ring magdirekta ng mga modelo ng diyalogong may magkahiwalay na tagapagsalita, paghinto at mga tunog gaya ng pagtawa o pagbuntong-hininga. Ibang kakayahan ang pagsunod sa gayong pahiwatig at ang pananatiling pareho ng boses sa pag-usad ng eksena: maaaring mahusay ang pagganap ng isang linya ngunit lumihis ang tinig sa mga kasunod. Ipinapakita ng pagbuti sa stability ang pag-usad sa ikalawang suliraning iyon.

Natural ang tunog, ngunit hindi laging kahawig ang ginaya

Sa voice replication, magkaibang sukatan ang pagiging natural ng pagbigkas at ang pagkakahawig nito sa may-ari ng sampol. Mas mataas ang puwesto ng dalawang bagong modelo sa naturalness kaysa sa same-speaker similarity. Maaaring makalikha ang isang modelo ng boses na kapani-paniwalang pakinggan bilang tao, ngunit hindi sapat na kahawig ng partikular na taong nais gayahin.

Mas mahalaga ang pagkakaibang ito sa doblaj na gumagamit ng boses ng aktuwal na artista o sa proyektong kailangang makilala agad ang isang tagapagsalita. Para sa orihinal na karakter, ang mahusay na pagganap at pare-parehong tinig ay maaaring magsilbing pangunahing batayan. Para sa digital na kopya ng isang tao, nagiging pangunahing tanong kung mapapanatili ang makikilalang katangian ng kanyang boses.

Mga preview na bersiyon ng mga bagong modelo ang ginamit sa pagsusuri ng Hume. Mga human rater na hindi nakaaalam kung aling modelo ang gumawa ng audio ang nagbigay ng marka sa magkakaparehong uri ng gawain. Nagbibigay iyon ng kapaki-pakinabang na paghahambing, ngunit ang ranggo sa nasabing pagsusuri ay hindi kapalit ng hiwalay na pagtatasa ng pagkakahawig sa wikang at uri ng boses na gagamitin sa isang produksiyon.

Saklaw ang Filipino, Cebuano at Iloko

Sa listahan ng mga wikang sinusuportahan ng Gemini API, kabilang ang Filipino, Cebuano at Iloko sa Flash at Flash-Lite; mahigit 130 wika ang saklaw ng Flash at mahigit 100 ang sa Flash-Lite, samantalang sa Flash lamang nakalista ang Pangasinan. Awtomatikong kinikilala ng mga modelo ang wika ng tekstong ibinigay sa kanila. May saklaw samakatuwid para sa lokal na salaysay at doblaj, ngunit hindi pareho ang talaan ng dalawang modelo.

Ang pagkakalista ng isang wika ay nagsasaad na maaari itong gawing audio. Hindi nito ibinibigay ang hiwalay na marka para sa linaw ng pagbigkas, likas na punto o husay sa paghahatid ng damdamin sa Filipino, Cebuano o Iloko. Mahalaga ang kaibhang iyon sa diyalogong kailangang tumunog na angkop sa isang partikular na lugar, lalo na kung ang karakter ay may tiyak na paraan ng pagsasalita.

May magkaibang posibleng gamit para sa mga produksiyong Pilipino. Ang voice design ay maaaring magbigay ng orihinal na tagapagsalaysay na may itinakdang tono; ang mas matatag na tinig ay maaaring makatulong sa mahahabang kabanata o magkakasunod na tugon ng voice agent. Kung boses ng totoong tao ang kailangang ulitin, nananatiling hiwalay na usapin ang pagkakahawig at pahintulot, kahit suportado ang wika ng iskrip.

May beripikasyon ng pahintulot sa paggaya ng boses

Sa voice replication, kailangan ang pasalitang pahintulot ng may-ari ng boses na tumutugma sa tagapagsalita sa reference recording. Nilalagyan din ng SynthID watermark ang nabuong audio, at may C2PA credentials para sa paggaya ng boses. Mga pananggalang ang mga ito para sa pagkakakilanlan at pagtukoy sa ginawang audio; hiwalay pa rin sa kanila ang tanong kung gaano katumpak ang naging kopya.

Magkaiba rin ang yugto ng paglabas sa mga produkto. Sinimulan ang access ng mga developer sa Gemini API at Google AI Studio; inilaan ang Flash para sa Gemini Notebook at ang Flash-Lite para sa Google Vids, habang darating pa lamang ang access sa pamamagitan ng Gemini Enterprise API. Para sa mga gagawa ng audio sa mga wikang Pilipino, mayroon nang suportadong ruta sa pagbuo ng boses. Ang kalidad ng lokal na pagbigkas at ang pagkakahawig ng ginayang tagapagsalita ay mananatiling magkahiwalay na batayan ng paggamit nito.

I-share:

Mag-subscribe sa aming newsletter

Matanggap ang pinakabagong balita tungkol sa Web3, AI at crypto nang diretso sa iyong inbox.

0