
ElevenLabs หรือ Google Cloud TTS: เสียงไทยอาจต่างกันเกิน 3 เท่า

หากคิดต้นทุนตามอัตรา API หลังโควตาฟรี การสร้างเสียงไทยด้วย ElevenLabs v3 อาจแพงกว่า Google Cloud Neural2 ถึง 5 เท่า: ตารางราคา API ของ ElevenLabs ระบุ v3 ที่ 0.08 ดอลลาร์ และ v3 Conversational ที่ 0.04 ดอลลาร์ต่อ 1,000 อักขระ ส่วน ตารางราคา Google Cloud Text-to-Speech ระบุ Neural2 ที่ 16 ดอลลาร์, Chirp 3: HD ที่ 30 ดอลลาร์ และ Standard ที่ 4 ดอลลาร์ต่อหนึ่งล้านอักขระหลังโควตาฟรี เมื่อปรับ v3 เป็นหน่วยเดียวกันจะได้ 80 ดอลลาร์ต่อหนึ่งล้านอักขระ หรือสูงกว่า Neural2 5 เท่า และ Standard 20 เท่า
คำตอบสำหรับผู้เลือก API เสียงไทยจึงต้องแยกรุ่นเสียงออกจากชื่อผู้ให้บริการ Google Cloud มีเสียงภาษาไทยหลายระดับราคาและมีโควตาฟรีรายเดือน ขณะที่ ElevenLabs มีรุ่นที่รองรับภาษาไทยและออกแบบมาสำหรับงานแสดงอารมณ์หรือบทสนทนา ราคาที่สูงกว่าบอกต้นทุนได้ แต่ยังบอกไม่ได้ว่าเสียงใดอ่านภาษาไทยเป็นธรรมชาติกว่า เพราะหลักฐานการฟังที่นำสองบริการมาเทียบกันในแหล่งข้อมูลที่เปิดเผยใช้ภาษาอังกฤษแบบสหรัฐฯ
ต้นทุนที่ 100,000 และหนึ่งล้านอักขระ
เพื่อเทียบอัตราบนฐานเดียวกัน ให้ถือว่าอักขระทั้งหมดอยู่ในส่วนที่ต้องจ่ายเงินและยังไม่รวมภาษีหรือค่าใช้จ่ายบริการอื่น นี่เป็นการคำนวณต้นทุนตามอัตราต่อหน่วย ไม่ใช่ตัวอย่างใบเรียกเก็บเงินจริง ElevenLabs v3 จะเท่ากับ 8 ดอลลาร์สำหรับ 100,000 อักขระ และ 80 ดอลลาร์สำหรับหนึ่งล้านอักขระ ส่วน v3 Conversational เท่ากับ 4 และ 40 ดอลลาร์ตามลำดับ ความต่างระหว่างสองรุ่นของ ElevenLabs เองจึงมีผลต่อคำตอบก่อนจะเริ่มเทียบกับ Google
เมื่อใช้วิธีคำนวณเดียวกัน Google Cloud Chirp 3: HD เท่ากับ 3 และ 30 ดอลลาร์, Neural2 เท่ากับ 1.60 และ 16 ดอลลาร์, ส่วน Standard เท่ากับ 0.40 และ 4 ดอลลาร์ ที่ปริมาณ 100,000 และหนึ่งล้านอักขระตามลำดับ ElevenLabs v3 จึงสูงกว่า Chirp 3: HD ราว 2.7 เท่า ซึ่งไม่ถึง 3 เท่า แต่สูงกว่า Neural2 และ Standard เกิน 3 เท่า ส่วน v3 Conversational สูงกว่า Neural2 2.5 เท่า และสูงกว่า Standard 10 เท่า การพูดว่าบริการใดแพงกว่าโดยไม่ระบุคู่รุ่นจึงทำให้ผลเปรียบเทียบเปลี่ยนไปทันที
โควตาฟรีของ Google Cloud ทำให้ต้นทุนส่วนเพิ่มกับยอดจ่ายรายเดือนเป็นคนละเรื่องกัน Chirp 3: HD และ Neural2 มีช่วงใช้งานฟรีถึงหนึ่งล้านอักขระต่อเดือนสำหรับแต่ละประเภทเสียง ส่วน Standard มีช่วงใช้งานฟรีถึงสี่ล้านอักขระ หากบัญชียังไม่ได้ใช้โควตา ตัวอย่าง 100,000 อักขระอาจมีค่าบริการสังเคราะห์เสียงเป็นศูนย์ แม้อัตราหลังโควตาฟรีจะให้ตัวเลขบวกข้างต้น แต่ Google กำหนดให้เปิดใช้การเรียกเก็บเงิน และทรัพยากร Cloud อื่นที่ใช้ร่วมกันอาจคิดเงินแยกต่างหาก
ตัวอย่างแบบมีเงื่อนไขช่วยเห็นผลของโควตาชัดขึ้น หากเดือนหนึ่งส่งข้อความให้ Chirp 3: HD รวม 1.1 ล้านอักขระ และยังไม่ได้ใช้โควตาของเสียงประเภทนี้กับงานอื่น ส่วนที่เกินหนึ่งล้านคือ 100,000 อักขระ ค่าสังเคราะห์เสียงตามอัตราดังกล่าวจึงเป็น 3 ดอลลาร์ ไม่ใช่ 33 ดอลลาร์ ในทางกลับกัน การประเมินต้นทุนระยะยาวของงานที่ใช้ปริมาณมากควรดูอัตราของส่วนที่เกินโควตา ไม่ใช้ยอดเดือนแรกที่ยังอยู่ในช่วงฟรีแทนทุกเดือน
Google นับอักขระจากข้อความที่ส่งเข้า API รวมช่องว่างและการขึ้นบรรทัดใหม่ อีกทั้งนับแท็ก SSML ส่วนใหญ่ด้วย การแบ่งประโยคหรือเติมคำกำกับเพื่อแก้การอ่านจึงอาจเปลี่ยนจำนวนอักขระที่คิดเงิน สำหรับ ElevenLabs ราคาแบบจ่ายตามใช้กับสิทธิอักขระที่รวมอยู่ในแพ็กเกจสมัครสมาชิกก็เป็นคนละฐานเปรียบเทียบ หากองค์กรมีแพ็กเกจอยู่แล้ว ต้องแยกต้นทุนส่วนที่ใช้สิทธิเดิมออกจากต้นทุนส่วนที่ต้องซื้อเพิ่ม
รุ่นและเสียงภาษาไทยที่เลือกได้
รายการรุ่นและภาษาของ ElevenLabs ระบุภาษาไทยสำหรับ v3, v3 Conversational, v4 และ v4 Turbo ขณะที่รายการภาษาของ Multilingual v2 และ Flash v2.5 ไม่ปรากฏภาษาไทย ชื่อรุ่นที่มีคำว่า Multilingual จึงใช้แทนการตรวจรายการภาษาจริงไม่ได้ สำหรับงานพากย์หรือบทสนทนา ควรเลือกจากรุ่นที่ระบุภาษาไทยก่อน แล้วจึงพิจารณาความเร็ว รูปแบบเสียง และราคาในรุ่นนั้น
v3 เน้นการสร้างเสียงที่แสดงอารมณ์และรองรับบทสนทนาหลายผู้พูด ส่วน v3 Conversational ปรับมาสำหรับการตอบสนองแบบเรียลไทม์ ความแตกต่างนี้สำคัญกับระบบตอบกลับลูกค้า ซึ่งความหน่วงอาจมีน้ำหนักมากกว่าการแสดงน้ำเสียงในคลิปที่ผลิตล่วงหน้า สำหรับต้นฉบับยาว v3 มีขีดจำกัด 5,000 อักขระต่อคำขอ การแบ่งบทเป็นช่วงจึงเป็นส่วนหนึ่งของการเตรียมงาน และรอยต่อระหว่างช่วงควรอยู่ในชุดฟังทดสอบด้วย
ฝั่ง Google รายการเสียงภาษาไทยรหัส th-TH แสดงเสียง Chirp 3: HD หลายชื่อ รวมถึง th-TH-Neural2-C และ th-TH-Standard-A จึงมีทางเลือกมากกว่าการสลับระดับราคาเพียงอย่างเดียว รหัสเสียงบอกทั้งภาษา รุ่น และเสียงที่เลือก หากทดลอง Chirp 3: HD เสียงหนึ่งแล้วไม่เหมาะกับงาน ผลนั้นยังไม่ใช่คำตัดสินต่อเสียง th-TH ทั้งหมดในบริการเดียวกัน
ความสามารถควบคุมเสียงก็ไม่เรียงตามราคาในลักษณะเส้นตรง เอกสาร Google ระบุว่า Chirp 3: HD รองรับการสตรีมข้อความ แต่ไม่รับอินพุต SSML หรือพารามิเตอร์ปรับอัตราการพูดและระดับเสียงแบบที่บางระบบใช้อยู่ ขณะที่ Neural2 และ Standard มีการรองรับ SSML ตามประเภทเสียง หากงานเดิมกำหนดจังหวะหยุดหรือวิธีอ่านผ่าน SSML การย้ายไปยังเสียง Chirp 3: HD ต้องประเมินวิธีควบคุมเสียงใหม่ แม้จะเลือกบริการเดิมก็ตาม
การรองรับภาษาในรายการรุ่นหรือรายการเสียงหมายถึง API สามารถสร้างเสียงสำหรับภาษานั้น ไม่ได้รับรองว่าชื่อบุคคล คำย่อ ที่อยู่ หรือคำอังกฤษในประโยคไทยจะอ่านตรงกับที่ผู้ฟังต้องการ Google ระบุเสียงด้วยรหัส th-TH และชื่อเสียงเฉพาะ ส่วน ElevenLabs ระบุ Thai ในระดับรุ่น ความละเอียดของรายการต่างกัน จึงไม่ควรนำจำนวนชื่อเสียงที่แสดงของรายหนึ่งไปเทียบกับจำนวนรุ่นของอีกรายราวกับเป็นหน่วยเดียวกัน
หลักฐานการฟังบอกคุณภาพเสียงไทยได้แค่ไหน
การประเมินเสียงภาษาอังกฤษแบบสหรัฐฯ ของ Podonos มี ElevenLabs eleven_v3 และ Google Cloud Chirp3-HD อยู่ในชุดเปรียบเทียบ โดยให้ผู้ฟังประเมินความเป็นธรรมชาติและความชัดของเสียง ชุดที่เปิดเผยบนหน้านั้นระบุภาษาอังกฤษแบบสหรัฐฯ จึงใช้คะแนนหรืออันดับจากหน้านั้นตัดสินผู้ชนะด้านเสียงไทยไม่ได้ ต่อให้ทั้งสองรุ่นมีตัวเลือกสร้างเสียงภาษาไทย งานประเมินภาษาคนละชุดก็ยังตอบคำถามเรื่องการออกเสียงไทยโดยตรงไม่ได้
ความเป็นธรรมชาติของเสียงกับความถูกต้องของคำอ่านควรแยกกันพิจารณา เสียงหนึ่งอาจมีจังหวะพูดลื่นและน้ำเสียงเหมาะกับงานพากย์ แต่สะดุดกับชื่อเฉพาะหรืออ่านตัวเลขในบริบทผิด อีกเสียงอาจอ่านข้อมูลได้ชัดสม่ำเสมอ แต่มีจังหวะที่ไม่เหมาะกับบทสนทนา การให้คะแนนรวมเพียงค่าเดียวจะซ่อนข้อแตกต่างที่กระทบผู้ฟังจริง โดยเฉพาะเมื่อข้อความมีทั้งภาษาไทย คำทับศัพท์ และตัวเลขในประโยคเดียวกัน
ผลประเมินยังขึ้นกับเสียงย่อยที่เลือก ข้อความตั้งต้น และการจัดรูปประโยค งานเสียงไทยสำหรับคลิปเล่าเรื่อง ระบบโทรศัพท์ และผู้ช่วยสนทนามีจุดผิดพลาดที่ยอมรับได้ไม่เท่ากัน การฟังด้วยข้อความเดียวกันจึงให้คำตอบที่ตรงกับงานมากกว่าการหยิบผลภาษาอังกฤษมาแทนภาษาไทย และควรเก็บทั้งข้อผิดพลาดที่ระบุคำได้กับความเห็นเรื่องจังหวะและน้ำเสียงไว้แยกกัน
ชุดทดลองเสียงไทยที่ทำซ้ำได้
เริ่มจากข้อความไทยต้นฉบับชุดเดียวกันสำหรับทุกรุ่นที่ต้องการเปรียบเทียบ โดยคงคำสะกด ลำดับประโยค ตัวเลข และเครื่องหมายไว้ให้ตรงกัน บันทึกชื่อรุ่น รหัสเสียง และข้อความที่ส่งจริงคู่กับไฟล์ผลลัพธ์ หากต้องเปลี่ยนการสะกดเพื่อช่วยให้บริการใดอ่านคำยากได้ถูกต้อง ให้แยกเป็นการทดลองอีกชุด การปะปนไฟล์ที่ใช้ข้อความคนละแบบจะทำให้ระบุไม่ได้ว่าความต่างมาจากเสียงหรือการแก้ต้นฉบับ
- ชื่อไทยและสถานที่: ใช้ชื่อหลายพยางค์ เช่น “ศรีนครินทร์” และ “พญาไท” พร้อมชื่อเฉพาะที่งานของตนใช้จริง จดว่าระบบแบ่งพยางค์ ลงเสียง และอ่านวรรณยุกต์ตรงหรือไม่
- ตัวเลขในบริบท: ใส่จำนวนเงิน วันที่ เวลา หมายเลขโทรศัพท์ และเลขที่อยู่ เช่น “2,500 บาท” กับ “09.30 น.” เพราะรูปตัวเลขเดียวกันอาจต้องอ่านต่างกันตามหน้าที่ในประโยค
- คำย่อและการสลับภาษา: ทดลอง “กทม.” “ดร.” และชื่อผลิตภัณฑ์ภาษาอังกฤษในประโยคไทย ฟังทั้งการขยายคำย่อ สำเนียง และจังหวะก่อนกลับเข้าสู่ภาษาไทย
- ช่องว่างและเครื่องหมาย: ทำประโยคคู่ที่ต่างกันเฉพาะการเว้นวรรค เครื่องหมายจุลภาค หรือการขึ้นบรรทัดใหม่ แล้วตรวจว่าจุดหยุดหายใจและความหมายที่ผู้ฟังรับรู้เปลี่ยนหรือไม่
- รูปแบบงานจริง: รวมประโยคบอกข้อมูล ประโยคถาม และข้อความต่อเนื่องหลายประโยค เพื่อฟังความคงที่ของระดับเสียง จังหวะ และรอยต่อในกรณีที่ต้องแบ่งข้อความส่งเป็นหลายคำขอ
ให้ผู้ฟังที่ใช้ภาษาไทยประเมินไฟล์โดยไม่เห็นชื่อผู้ให้บริการ และใช้เครื่องเล่นกับระดับความดังใกล้เคียงกัน ควรแยกความเห็นเรื่องความเป็นธรรมชาติออกจากรายการคำที่อ่านผิด พร้อมจดตำแหน่งคำในต้นฉบับ วิธีนี้ทำให้เห็นว่าปัญหาอยู่ที่ชื่อเฉพาะ ตัวเลข หรือการเว้นวรรค และช่วยแยกกรณีที่ปรับข้อความแล้วดีขึ้นออกจากกรณีที่เสียงรุ่นนั้นยังไม่เหมาะกับงาน
หากใช้ระบบแบบสนทนา ให้เพิ่มช่วงที่ต้องตอบกลับต่อเนื่องและฟังว่าการหยุดวรรคเกิดตรงที่ผู้ใช้คาดหรือไม่ สำหรับงานพากย์ยาว ให้ฟังต้นและท้ายของแต่ละช่วง รวมถึงความสม่ำเสมอเมื่อนำเสียงมาต่อกัน การทดสอบสองลักษณะนี้ตอบคนละคำถาม: งานสนทนาต้องรักษาจังหวะโต้ตอบ ส่วนงานพากย์ต้องรักษาความต่อเนื่องของเสียงตลอดชิ้นงาน
เลือกตามต้นทุนและผลฟังจริง
หากเสียง Standard อ่านข้อความของงานได้ผ่านเกณฑ์ที่กำหนด Google Cloud ให้ต้นทุนต่ออักขระหลังโควตาฟรีต่ำที่สุดในกลุ่มรุ่นที่เทียบนี้ Neural2 และ Chirp 3: HD เพิ่มทางเลือกของเสียงพร้อมอัตราที่สูงขึ้นตามรุ่น ส่วน ElevenLabs v3 เหมาะจะอยู่ในรอบทดลองเมื่อความสามารถด้านการแสดงน้ำเสียงมีคุณค่าต่องานมากพอที่จะรับต้นทุนส่วนเพิ่มได้ คำตัดสินเรื่องคุณภาพควรมาจากไฟล์ภาษาไทยของข้อความที่ต้องใช้จริง
สำหรับระบบตอบกลับทันที อย่านำอัตราของ v3 ไปแทน v3 Conversational หรือเลือกรุ่นจากราคาต่ออักขระอย่างเดียว เพราะความหน่วงและวิธีควบคุมเสียงมีผลต่อประสบการณ์ใช้งานด้วย เมื่อตัดสินใจซื้อ ให้ดูยอดอักขระที่คาดว่าจะเกินโควตา คู่กับจำนวนคำอ่านผิดและความเห็นของผู้ฟังในชุดทดสอบเดียวกัน ตัวเลขต้นทุนตอบว่าแต่ละทางเลือกต้องจ่ายเท่าไร ส่วนผลฟังภาษาไทยตอบว่าเงินส่วนที่เพิ่มขึ้นให้ผลลัพธ์ที่งานต้องการหรือไม่
อ่านเพิ่มเติม:
บทความที่เกี่ยวข้อง


Otter กับ Fireflies: ประชุมภาษาไทยทำให้ผู้ชนะเปลี่ยนทันที

DeepL หรือ Google Translate: งานไทยเชิงวิชาการยังต้องตรวจทุกย่อหน้า

Supabase หรือ Firebase: งานอ่านกับงานเขียนให้คำตอบคนละแบบ

Cloudflare R2 หรือ Amazon S3: egress ฟรีแลกกับอัปโหลดที่ช้ากว่า

ปิดข้อมูลส่วนบุคคลก่อนส่งให้ LLM: redaction กับ tokenization ใช้แทนกันไม่ได้
สมัครรับจดหมายข่าวของเรา
รับข่าวสารล่าสุดเกี่ยวกับ Web3, AI และคริปโตส่งตรงถึงกล่องจดหมายของคุณ