
Gemini 3.8 Live สร้างอวตารสดได้ 97 ภาษา แต่ API ยังมีเงื่อนไข

Google Cloud ประกาศการเปิดใช้ Gemini 3.8 Live with Live Avatar อย่างเป็นทางการใน Gemini Enterprise เมื่อ 24 กันยายน 2026 โดยโมเดลเข้าใจและพูดได้ 97 ภาษา พร้อมสร้างภาพอวตารที่ขยับปากสอดคล้องกับเสียงสนทนา องค์กรสามารถลองความสามารถใน Gemini Enterprise และพัฒนาบริการผ่าน Gemini Live API บน Google Cloud ได้แล้ว แต่การสร้างอวตารจากภาพบุคคลที่เลือกเอง ยังต้องผ่านการอนุญาตและตรวจสอบเพิ่มเติม
สำหรับผู้พัฒนาไทย ความพร้อมใช้งานจึงขึ้นอยู่กับส่วนที่ต้องการนำไปใช้ เสียงสนทนาและอวตารสำเร็จรูปอยู่ในช่องทางองค์กรที่เปิดใช้แล้ว ส่วนใบหน้าเฉพาะบุคคลเป็นคุณสมบัติที่ต้องขอสิทธิแยก ตัวเลขภาษาที่โมเดลสนทนาได้ ยังต้องแยกจากรายการรหัสภาษาที่เอกสาร API เปิดให้ตั้งค่า ความต่างเหล่านี้มีผลต่อการเลือกช่องทางเชื่อมต่อ การออกแบบบทสนทนาภาษาไทย และกำหนดเวลาเปิดบริการที่ใช้อัตลักษณ์ของบุคคลจริง
อวตารสดเพิ่มอะไรให้การสนทนา
แกนของ Gemini 3.8 Live เป็นการรับและตอบเสียงแบบต่อเนื่อง ส่วน Live Avatar เพิ่มวิดีโอใบหน้าที่สร้างตามคำตอบในขณะนั้น ริมฝีปากเคลื่อนไหวสัมพันธ์กับเสียงพูด และสีหน้าปรับตามการโต้ตอบ ผู้ใช้จึงเห็นตัวแทนตอบสนองระหว่างสนทนา ไม่ใช่รอดูคลิปคำตอบที่เตรียมไว้ล่วงหน้า อย่างไรก็ตาม ใบหน้าที่ปรากฏไม่ได้ทำให้ตัวแทนรู้ข้อมูลลูกค้าด้วยตัวเอง สิ่งที่ตอบหรือดำเนินการได้ ยังขึ้นกับบริบทและระบบที่องค์กรเชื่อมเข้ามา
ระบบรับเสียงพร้อมภาพจากกล้องหรือการแชร์หน้าจอได้ในบทสนทนาเดียวกัน ภาพที่ผู้ใช้ส่งเข้ามา เป็นข้อมูลให้โมเดลเข้าใจสิ่งที่เห็น ขณะที่ภาพอวตารเป็นผลลัพธ์ที่โมเดลส่งกลับ สองทิศทางนี้อาจถูกเรียกรวมว่าเป็นวิดีโอสด แต่ทำหน้าที่ต่างกัน หากผู้ใช้เปิดกล้องให้เห็นสิ่งของหรือสถานการณ์ ตัวแทนสามารถนำภาพนั้นมาประกอบคำตอบได้ ในอีกด้านหนึ่ง ผู้ใช้เห็นใบหน้าตัวแทนพูดตอบพร้อมเสียงของระบบ
ความสามารถเรียกเครื่องมือแบบทำงานเบื้องหลัง ทำให้บทสนทนาเดินต่อระหว่างรอข้อมูลจากระบบอื่น เดโมเช็กอินโรงแรมแสดงอวตารพูดกับแขกต่อไป ขณะที่เรียกเครื่องมือจัดการขั้นตอนการเข้าพัก สิ่งที่เห็นคือรูปแบบการประสานบทสนทนากับงานหลังบ้าน การนำไปใช้จริงยังต้องมีระบบข้อมูล เครื่องมือ และสิทธิเข้าถึงที่องค์กรจัดเตรียมไว้ ตัวแทนจะทำรายการได้เพียงเท่าที่ระบบปลายทางอนุญาต ไม่ว่าภาพอวตารจะตอบสนองได้ลื่นไหลเพียงใด
อีกเดโมเป็นงานรับแจ้งสินไหมที่ผู้ใช้พูดพร้อมแสดงความเสียหายผ่านกล้อง ตัวแทนรับรายละเอียดจากเสียงและภาพ ขณะที่ระบบตัวแทนเบื้องหลังตรวจข้อมูลกรมธรรม์และกฎการรับเรื่อง ก่อนจัดข้อมูลส่งต่อผู้ประเมิน กรณีนี้แสดงความต่างระหว่างการมองเห็นภาพกับการดำเนินงาน: โมเดลใช้ภาพเพื่อเข้าใจคำบอกเล่า ส่วนการตรวจสิทธิและจัดเอกสารเกิดจากเครื่องมือที่ต่อเข้ากับระบบประกัน ตัวอย่างดังกล่าวเป็นการสาธิตกระบวนการ ไม่ใช่คำรับรองว่าทุกองค์กรมีการเชื่อมต่อแบบเดียวกัน
การพูดแทรกเป็นรายละเอียดที่ส่งผลต่อจังหวะสนทนา ผู้ใช้เปลี่ยนคำถามได้ระหว่างที่ตัวแทนกำลังตอบ และโมเดลปรับคำตอบตามบทสนทนาที่เกิดขึ้น วิดีโออวตารจึงต้องสอดคล้องกับทั้งช่วงพูด ช่วงฟัง และการเปลี่ยนผู้พูด ความสามารถนี้มีประโยชน์กับงานที่คำตอบเปลี่ยนตามข้อมูลระหว่างทาง เช่น การรับเรื่องหรือการอธิบายขั้นตอนเฉพาะกรณี โดยคุณภาพของงานปลายทางยังขึ้นกับข้อมูลที่องค์กรให้ตัวแทนใช้
Gemini Enterprise กับ Live API ใช้ต่างกันอย่างไร
Gemini Enterprise เป็นช่องทางให้ลูกค้าองค์กรเข้าถึงความสามารถที่เปิดตัว ส่วน Gemini Live API เป็นช่องทางนำโมเดลไปประกอบเป็นบริการขององค์กรเอง บริการนั้นอาจอยู่บนเว็บไซต์ แอปมือถือ หรือจุดบริการแบบโต้ตอบ การเรียก API ไม่ได้เชื่อมระบบจอง ระบบบัญชี หรือข้อมูลลูกค้าให้โดยอัตโนมัติ ผู้พัฒนาต้องกำหนดเครื่องมือและสิทธิของระบบปลายทาง ตามงานที่ต้องการให้ตัวแทนดำเนินการ รวมทั้งกำหนดสิ่งที่ควรตอบเมื่อเครื่องมือยังไม่ส่งผลกลับมา
จุดให้บริการที่ประกาศสำหรับเวอร์ชันองค์กรอยู่ในสหรัฐอเมริกาและสหภาพยุโรป สำหรับทีมในประเทศไทย นี่เป็นรายละเอียดของตำแหน่ง endpoint ที่ต้องนำไปพิจารณาในการออกแบบการเชื่อมต่อ ไม่ใช่ข้อสรุปว่าลูกค้าไทยถูกห้ามใช้งาน ตำแหน่ง endpoint เพียงอย่างเดียว ก็ไม่อธิบายเงื่อนไขการจัดการข้อมูลทั้งหมดของโครงการ องค์กรยังต้องพิจารณาการกำกับข้อมูลตามบริการและข้อตกลงที่ใช้อยู่
ในระดับการตั้งค่า การเรียกโมเดลเสียงกับการขอวิดีโออวตารเป็นการกำหนดผลลัพธ์ต่างกัน หากต้องการใบหน้าที่พูดตอบ การเชื่อมต่อจะต้องระบุผลลัพธ์วิดีโอ เลือกอวตาร และกำหนดเสียงที่ใช้คู่กัน การเลือกอวตารสำเร็จรูปจึงไม่ใช่การอัปโหลดภาพพนักงานหรือสร้างใบหน้าใหม่ ทีมที่มีตัวแทนเสียงอยู่ก่อน ต้องเพิ่มส่วนผลลัพธ์ภาพและการแสดงวิดีโอให้บริการของตน โดยยังรักษาการรับเสียงและการต่อเครื่องมือเดิมให้ทำงานร่วมกัน
ทางเลือกหลักแยกได้ตามสิ่งที่ผู้ใช้ส่งเข้าไปและสิ่งที่ระบบส่งกลับ:
- สนทนาด้วยเสียง: โมเดลฟัง พูด และรับบริบท โดยยังไม่จำเป็นต้องสร้างใบหน้าวิดีโอ
- อวตารสำเร็จรูป: Live Avatar เพิ่มใบหน้าที่เคลื่อนไหวตามคำพูด โดยเลือกจากคลังอวตารที่เตรียมไว้
- ภาพจากผู้ใช้: กล้องหรือการแชร์หน้าจอส่งข้อมูลภาพให้โมเดลเข้าใจ ซึ่งแยกจากวิดีโออวตารที่ส่งกลับ
- อวตารเฉพาะ: ภาพอ้างอิงใช้สร้างรูปลักษณ์ที่กำหนดเองได้ เมื่อองค์กรได้รับสิทธิของคุณสมบัตินั้น
- เครื่องมือหลังบ้าน: ตัวแทนค้นข้อมูลหรือทำรายการระหว่างคุยได้ ภายในขอบเขตที่องค์กรกำหนดให้ระบบปลายทาง
การแยกความสามารถเหล่านี้ช่วยป้องกันการประเมินช่องทางเข้าถึงผิด โครงการที่เรียก Gemini 3.8 Live เพื่อรับเสียงได้อยู่แล้ว ยังต้องกำหนดผลลัพธ์วิดีโอและตัวเลือกอวตารก่อนจะเห็นใบหน้าสนทนา ในทางกลับกัน อวตารสำเร็จรูปช่วยให้เริ่มใช้งานภาพใบหน้าโดยไม่ต้องส่งภาพบุคคลขององค์กรเป็นต้นแบบ จุดที่ต้องจัดการเพิ่มจึงเปลี่ยนไปตามชนิดอวตารและข้อมูลที่ตัวแทนจะใช้ ไม่ใช่ตามชื่อโมเดลเพียงอย่างเดียว
97 ภาษาของโมเดล กับภาษาไทยที่ตั้งค่าใน API
จำนวนภาษาที่ประกาศหมายถึงความสามารถในการเข้าใจและพูดของโมเดล รวมถึงการปรับการขยับปากเมื่อมีการเปลี่ยนภาษาระหว่างสนทนา แต่ เอกสารกำหนดภาษาและเสียงของ Gemini Live API แสดงรหัสภาษาสำหรับการตั้งค่า 24 รายการ โดยมีภาษาไทยเป็น th-TH และเสียงสำเร็จรูปให้เลือก 30 แบบ ตัวเลขเหล่านี้วัดคนละด้าน: ความสามารถสนทนาของโมเดล กับตัวเลือกที่ระบุไว้สำหรับการกำหนดค่า API จึงไม่ควรนำจำนวนภาษาที่โมเดลสนทนาได้ ไปแทนรายการรหัสภาษาที่ผู้พัฒนากำหนดได้
ภาษาไทยปรากฏในรายการตั้งค่าโดยตรง ทำให้บริการสำหรับผู้ใช้ไทยมีรหัสภาษาที่ระบุได้ชัดเจน ผู้พัฒนาสามารถกำหนดภาษาของเสียงตอบกลับ และใช้คำสั่งระบบกำกับภาษาเมื่อจำเป็น ขณะเดียวกัน โมเดลสามารถสลับภาษาไปตามบทสนทนาได้ การกำหนดภาษาเริ่มต้นกับการปล่อยให้บทสนทนาเปลี่ยนภาษาตามผู้ใช้ จึงเป็นการออกแบบพฤติกรรมคนละแบบ แม้จะเกิดขึ้นในเซสชันเดียวกัน
ตัวอย่างที่เห็นความต่างได้ชัด คือบทสนทนาที่ผู้ใช้พูดภาษาไทย แต่กล่าวชื่อผลิตภัณฑ์เป็นภาษาอังกฤษ ระบบตรวจจับภาษาอาจติดตามภาษาที่ใช้ระหว่างคุยได้ ส่วนคำสั่งระบบช่วยกำหนดว่าตัวแทนควรตอบเป็นภาษาใดและคงชื่อเฉพาะอย่างไร นี่เป็นตัวอย่างเชิงเงื่อนไขของการออกแบบบริการ ไม่ใช่ผลการทดสอบความถูกต้องของภาษาไทยในทุกสำเนียง ความพร้อมของรหัสภาษาไม่ได้รับประกันคุณภาพคำตอบเฉพาะธุรกิจหรือความถูกต้องของข้อมูลที่เชื่อมเข้ามา
เสียงสำเร็จรูปเป็นทางเลือกสำหรับกำหนดลักษณะเสียงโดยไม่ต้องใช้ไฟล์เสียงของบุคคล ส่วนการสร้างเสียงจากตัวอย่างเป็นคุณสมบัติสำหรับลูกค้าที่ได้รับสิทธิ และกำหนดค่าต่อเซสชัน ไม่ใช่การเลือกชื่อเสียงจากรายการปกติ ความต่างนี้มีผลเมื่อองค์กรต้องการให้ใบหน้าและน้ำเสียงสะท้อนบุคคลเดียวกัน สิทธิใช้ภาพใบหน้า กับสิทธิใช้เสียงต้นแบบต้องจัดการแยก แม้ผู้ใช้ปลายทางจะรับรู้เป็นตัวแทนเพียงคนเดียว
สำหรับบริการหลายภาษา รายการรหัสตั้งค่าบอกว่าผู้พัฒนาระบุภาษาใดในระบบได้ ขณะที่ความสามารถสลับภาษาบอกว่าโมเดลตอบสนองต่อภาษาที่ได้ยินระหว่างคุยอย่างไร สองเรื่องนี้ไม่ควรถูกใช้แทนกันในการอธิบายความพร้อมของบริการ โดยเฉพาะงานที่ต้องรักษาชื่อสินค้า คำเฉพาะ หรือขั้นตอนทางธุรกิจให้ตรงกันทุกภาษา ผู้พัฒนายังต้องกำหนดถ้อยคำและข้อมูลต้นทางที่ตัวแทนใช้ตอบ ไม่ว่าการเปลี่ยนภาษาของภาพอวตารจะต่อเนื่องเพียงใด
อวตารเฉพาะต้องผ่านการอนุญาต
คลังอวตารสำเร็จรูปเปิดทางให้องค์กรใช้ใบหน้าตัวแทนโดยไม่สร้างภาพบุคคลใหม่ ส่วนอวตารจากภาพอ้างอิง ต้องผ่านการอนุญาตและการตรวจสอบของ Google Cloud ภาพอ้างอิงช่วยรักษาลักษณะใบหน้า สไตล์แบรนด์ หรือรูปลักษณ์ตัวละครไว้ในวิดีโอที่ตอบสนองได้ ข้อกำหนดนี้ผูกกับการสร้างอวตารเฉพาะ ไม่ได้จำกัดการใช้ตัวเลือกสำเร็จรูปทั้งหมด องค์กรที่ต้องการใช้บุคลิกแบรนด์หรือบุคคลจริง จึงมีขั้นตอนมากกว่าการเลือกตัวแทนทั่วไป
เดโมการสร้างอวตารเฉพาะแสดงการกำหนดคำสั่งระบบ ใส่ภาพอ้างอิง และเพิ่มไฟล์ตัวอย่างเสียง ขั้นตอนนั้นทำให้เห็นว่าส่วนภาพกับส่วนเสียงประกอบกันอย่างไร แต่ไม่ได้เปลี่ยนเงื่อนไขการเข้าถึงคุณสมบัติ ภาพใบหน้าของพนักงาน นักแสดง หรือบุคคลอื่นเป็นข้อมูลต้นแบบที่เกี่ยวกับสิทธิของเจ้าของภาพ การนำเสียงบุคคลมาเป็นต้นแบบก็มีเงื่อนไขของเสียงนั้นเอง ก่อนส่งข้อมูลเข้าสู่บริการ องค์กรต้องจัดการสิทธิและความยินยอมที่เกี่ยวข้องกับการใช้งานจริง
การได้รับสิทธิใช้คุณสมบัติ กับการได้รับสิทธิใช้ใบหน้าเป็นเงื่อนไขคนละชั้น Google Cloud ควบคุมการเปิดให้สร้างอวตารเฉพาะ ขณะที่องค์กรรับผิดชอบต้นแบบที่นำมาใช้ การผ่านการอนุญาตทางเทคนิคจึงไม่ใช่การโอนสิทธิในตัวตนของบุคคล และการมีไฟล์ภาพพร้อมก็ไม่ได้หมายความว่านำใบหน้านั้นไปให้ตัวแทนพูดกับลูกค้าได้ทันที ประเด็นนี้สำคัญเป็นพิเศษเมื่ออวตารจะตอบคำถามอย่างต่อเนื่องในนามบุคคลหรือแบรนด์ที่ผู้ใช้จดจำได้
ภาพกับเสียงยังเลือกประกอบกันได้หลายแบบ องค์กรอาจใช้อวตารสำเร็จรูปคู่กับเสียงสำเร็จรูป โดยไม่ต้องใช้ต้นแบบของบุคคลเลย หรือใช้อวตารเฉพาะคู่กับเสียงที่มีสิทธิใช้อยู่แล้ว แต่ละแบบมีผลต่อขั้นตอนขอใช้บริการและการจัดการต้นแบบต่างกัน การตัดสินใจเลือกรูปลักษณ์จึงควรเกิดก่อนกำหนดวิธีเก็บและส่งไฟล์ภาพหรือเสียง เพราะข้อจำกัดของอวตารเฉพาะจะส่งผลต่อรูปแบบบริการตั้งแต่ต้น
SynthID ต้นทุน และผลต่อบริการจริง
เสียงและวิดีโอที่สร้างด้วย Live Avatar มีลายน้ำ SynthID แบบมองไม่เห็น เพื่อช่วยตรวจว่าเป็นเนื้อหาจาก AI ลายน้ำทำงานกับผลลัพธ์หลังสร้าง ส่วนการตรวจสอบสิทธิอวตารเฉพาะจัดการเรื่องตัวตนก่อนสร้าง สองมาตรการจึงทำหน้าที่ต่างกันในบริการเดียวกัน เมื่อองค์กรนำอวตารออกสู่ผู้ใช้ การอธิบายว่าผู้ใช้กำลังสนทนากับตัวแทน AI ยังเป็นเรื่องของการออกแบบประสบการณ์และความไว้วางใจ ลายน้ำในไฟล์ไม่ได้ทำหน้าที่เป็นคำอธิบายที่ผู้ใช้มองเห็นบนหน้าบริการ
รายงานของ ITmedia NEWS ระบุค่าวิดีโออวตารที่ 1 ดอลลาร์ต่อ 1 ล้านโทเคน โดยคิดค่าวิดีโอเฉพาะช่วงที่อวตารพูด ส่วนเสียงขาออกคิด 12 ดอลลาร์ต่อ 1 ล้านโทเคน และผลลัพธ์เมื่อใช้อวตารจำกัดที่ 24,000 โทเคน เทียบกับ 64,000 โทเคนเมื่อไม่มีอวตาร ตัวเลขเหล่านี้ทำให้ต้นทุนกับขนาดผลลัพธ์ของภาพและเสียงต้องประเมินแยกกัน โดยเฉพาะบริการที่มีทั้งช่วงฟัง ช่วงพูด และการเรียกเครื่องมือในบทสนทนาเดียว
ราคาวิดีโอที่คิดเฉพาะช่วงอวตารพูด ไม่ได้หมายความว่าช่วงอื่นของการสนทนาไม่มีต้นทุน บริการยังรับเสียงของผู้ใช้ ส่งเสียงตอบกลับ และอาจรับภาพจากกล้องหรือหน้าจอด้วย แต่ละส่วนมีการใช้งานข้อมูลต่างกัน หากตัวแทนต้องค้นฐานข้อมูลภายนอก ระบบหลังบ้านก็เป็นส่วนของบริการที่องค์กรต้องจัดการเอง การประเมินต้นทุนจากราคาวิดีโอเพียงรายการเดียว จึงไม่ครอบคลุมประสบการณ์ที่ผู้ใช้พูด แสดงภาพ และรอให้ตัวแทนดำเนินงาน
กรณีของ Cox Automotive ทำให้เห็นบทบาทของระบบหลังบ้าน บริษัทสร้างผู้ช่วยสำหรับ Autotrader ที่ใช้บทสนทนา การเน้นรายการบนหน้าจอ และการเรียกเครื่องมือ เพื่อช่วยผู้ซื้อค้นหาและเปรียบเทียบรถ ผลที่ผู้ใช้เห็นไม่ได้มาจากใบหน้าอวตารเพียงอย่างเดียว แต่เกิดจากการต่อข้อมูลสินค้ากับการโต้ตอบ ตัวอย่างนี้ชี้ว่าความพร้อมของโมเดลเป็นเพียงส่วนหนึ่งของบริการ องค์กรที่ต้องการคำตอบเฉพาะเรื่อง ยังต้องมีข้อมูลที่ตัวแทนเข้าถึงได้และกระบวนการที่ดำเนินงานต่อจากคำพูด
สำหรับบริการในประเทศไทย ความสามารถสนทนาภาษาไทยและอวตารสำเร็จรูปเปิดทางให้สร้างตัวแทนที่พูดตอบพร้อมภาพได้ภายใต้ช่องทางองค์กรที่ประกาศ หากต้องการให้ตัวแทนใช้ใบหน้าหรือเสียงของบุคคลเฉพาะ สิทธิของคุณสมบัติและสิทธิในต้นแบบต้องพร้อมก่อนเปิดบริการ ผลต่อผู้ใช้จึงขึ้นอยู่กับการตัดสินใจขององค์กรว่าจะใช้ตัวแทนทั่วไป หรือสร้างตัวแทนที่มีตัวตนเฉพาะพร้อมเงื่อนไขการอนุญาตที่ตามมา
บทความที่เกี่ยวข้อง


Google Workspace หรือ Microsoft 365: AI ที่แถมมาอาจไม่ใช่ตัวที่ทีมต้องใช้

LangChain หรือ LlamaIndex: งาน RAG ซับซ้อนกับงานค้นคืนเลือกคนละตัว

ส่งออกไทยพุ่ง 24.3% ตามกระแส AI แต่ยังขาดดุล 2.48 พันล้านดอลลาร์

Pinecone หรือ Qdrant: จ่ายค่าคลาวด์หรือรับภาระดูแลระบบเอง

Zapier หรือ Power Automate: ความง่ายแลกกับต้นทุนและระบบ Microsoft
สมัครรับจดหมายข่าวของเรา
รับข่าวสารล่าสุดเกี่ยวกับ Web3, AI และคริปโตส่งตรงถึงกล่องจดหมายของคุณ