
Gemini API หรือ Claude API: โมเดลถูกกว่าอาจไม่ถูกในงานเขียนโค้ด

Gemini API มีรุ่นที่เสียค่าโทเคนต่ำกว่า Claude API สำหรับงานตอบคำถามปริมาณมาก แต่ราคาต่อโทเคนยังตอบไม่ได้ว่าเอเจนต์เขียนโค้ดตัวใดคุ้มกว่า งานโค้ดต้องนับค่าใช้จ่ายทุกครั้งที่อ่านไฟล์ แก้แพตช์ และลองใหม่ แล้วหารด้วยจำนวนงานที่ผ่านเกณฑ์เดียวกัน โมเดลที่แพงกว่าต่อครั้งอาจถูกกว่าต่องานสำเร็จ หากใช้รอบน้อยลงมากพอ
สำหรับ chatbot ให้ดูสัดส่วนโทเคนขาเข้าและขาออกเป็นหลัก สำหรับ RAG ต้องเพิ่มอัตราการอ่าน cache และค่าเก็บข้อมูล ส่วน coding agent ต้องรวมประวัติการสนทนา ผลจากเครื่องมือ และการทดสอบซ้ำ ตัวอย่างต่อไปนี้ใช้ราคา API แบบจ่ายตามการใช้งานในหน่วยดอลลาร์สหรัฐ และกำหนดปริมาณงานสมมติให้เท่ากันเพื่อแยกผลของราคาออกจากคุณภาพ
ราคาใดอยู่ในสมการเดียวกัน
ตารางราคา Gemini Developer API ระบุอัตรา Standard ของ Gemini 3.1 Flash-Lite ที่ 0.25 ดอลลาร์ต่อโทเคนขาเข้าหนึ่งล้านหน่วย และ 1.50 ดอลลาร์ต่อโทเคนขาออกหนึ่งล้านหน่วย ขณะที่ Gemini 3.8 Flash คิด 0.75 และ 3.75 ดอลลาร์ตามลำดับจนถึงวันที่ 31 ธันวาคม 2026 ก่อนเพิ่มเป็น 1.50 และ 7.50 ดอลลาร์ตั้งแต่วันที่ 1 มกราคม 2027 อัตราขาออกนี้รวมโทเคนที่ใช้คิดด้วย จึงไม่ควรประมาณค่าใช้จ่ายจากความยาวข้อความคำตอบที่มองเห็นเพียงอย่างเดียว
ตารางราคา Claude API ระบุอัตราขาเข้าและขาออกต่อหนึ่งล้านโทเคนของ Claude Haiku 4.5 ที่ 1 และ 5 ดอลลาร์ ส่วน Claude Sonnet 5.5 อยู่ที่ 2 และ 10 ดอลลาร์ การเขียน cache อายุห้านาทีคิด 1.25 เท่าของราคาขาเข้า อายุหนึ่งชั่วโมงคิด 2 เท่า และการอ่าน cache ของสองรุ่นนี้คิด 0.1 เท่า เอกสารเดียวกันระบุว่า Claude รุ่น 4.7 เป็นต้นไปใช้ tokenizer ใหม่ ซึ่งอาจนับข้อความเดียวกันได้มากกว่ารุ่นก่อนประมาณ 30% โดยผลจริงขึ้นกับเนื้อหา
การเทียบ Flash-Lite กับ Haiku เหมาะกับคำถามเรื่องงานปริมาณสูง ส่วนตัวอย่างงานโค้ดด้านล่างจับ Gemini 3.8 Flash คู่กับ Sonnet 5.5 เพราะทั้งสองเป็นตัวเลือกที่เกี่ยวข้องกับงานซับซ้อนกว่า รุ่นที่ราคาใกล้กันไม่ได้รับประกันคุณภาพเท่ากัน และราคาช่วงแนะนำของ Flash ก็มีวันสิ้นสุด การนำอัตรา Batch ซึ่งใช้กับงานแบบไม่ต้องตอบทันที มาปนกับอัตรา Standard จะทำให้ตัวเลขของ chatbot หรือเอเจนต์ที่ต้องโต้ตอบทันทีคลาดเคลื่อน
สูตรต้นทุนต้องแยกโทเคนสี่ประเภท
ต้นทุน API = ค่าโทเคนขาเข้าใหม่ + ค่าเขียน cache + ค่าอ่าน cache + ค่าโทเคนขาออก + ค่าเก็บ cache และค่าเครื่องมือที่มีการเรียกเก็บ แต่ละส่วนคำนวณจากจำนวนโทเคนที่ถูกคิดเงินจริงคูณอัตราของส่วนนั้น แล้วหารด้วยหนึ่งล้าน สำหรับงานที่ต้องผ่านเกณฑ์ ให้หารยอดรวมอีกครั้งด้วยจำนวนคำตอบหรือแพตช์ที่ผ่าน แทนการหารด้วยจำนวนคำขอทั้งหมด
สูตรนี้ทำให้เห็นว่าพรอมป์สั้นไม่ได้แปลว่าคำขอจะถูกเสมอไป คำตอบยาวหรือโทเคนที่ใช้คิดอาจทำให้ฝั่งขาออกมีน้ำหนักมากกว่า ส่วนเอเจนต์ที่ส่งประวัติและผลเรียกเครื่องมือกลับเข้าบริบททุกครั้งจะมีขาเข้าเพิ่มตามรอบ แม้คำสั่งแรกจะสั้น ค่าเรียกเครื่องมือและค่าระบบภายนอกควรอยู่คนละช่องกับค่าโทเคนเพื่อมองเห็นว่าต้นทุนเพิ่มจากส่วนใด
เมื่อเทียบผู้ให้บริการ ให้ใช้จำนวนโทเคนที่แต่ละ API รายงานสำหรับข้อความชุดเดียวกัน ไม่ควรนำจำนวนโทเคนจากระบบหนึ่งไปคูณราคาของอีกระบบโดยตรง ตัวอย่างสมมติในส่วนถัดไปกำหนดจำนวนให้เท่ากันเพื่ออธิบายวิธีคิดเท่านั้น งานภาษาไทยจริงยังต้องผ่านเกณฑ์ด้านความถูกต้องและการใช้ภาษา ก่อนนำต้นทุนต่อคำตอบไปตัดสินใจ
Chatbot: รุ่นประหยัดได้เปรียบเมื่อคำตอบผ่านเกณฑ์ใกล้กัน
สมมติ chatbot ตอบหนึ่งพันครั้ง แต่ละครั้งใช้ขาเข้า 1,000 โทเคนและขาออก 250 โทเคน ไม่มี cache หรือเครื่องมือ รวมเป็นขาเข้าหนึ่งล้านและขาออก 250,000 โทเคน เมื่อนำไปคูณอัตราข้างต้น ค่าโมเดลจะเป็น 0.625 ดอลลาร์สำหรับ Gemini 3.1 Flash-Lite, 2.25 ดอลลาร์สำหรับ Claude Haiku 4.5 และ 4.50 ดอลลาร์สำหรับ Claude Sonnet 5.5 ตัวเลขนี้เป็นค่าของคำตอบที่สร้างทั้งหมด ไม่ใช่ค่าต่อคำตอบที่ถูกต้อง
ถ้าคำถามสั้นแต่คำตอบยาวขึ้น สัดส่วนค่าโทเคนขาออกจะสูงขึ้นทันที ผู้ให้บริการทั้งสองแยกราคาขาเข้าและขาออก จึงควรใช้รูปแบบบทสนทนาที่เกิดจริง เช่น ความยาวคำตอบภาษาไทย จำนวนข้อความก่อนหน้า และปริมาณข้อความกำกับ แทนการใช้ยอดโทเคนรวมเพียงค่าเดียว ในงานบริการลูกค้า คำตอบที่ต้องส่งให้เจ้าหน้าที่แก้ก่อนเผยแพร่ยังมีต้นทุนงานคน แม้ค่า API ต่อครั้งจะต่ำ
ข้อความกำกับที่ซ้ำกันอาจใช้ cache ได้ แต่คำถามใหม่และประวัติบางส่วนยังต้องคิดตามประเภทโทเคนที่ส่งจริง หากระบบตอบสั้นได้โดยไม่ลดความครบถ้วน การลดขาออกอาจช่วยมากกว่าการย่อข้อความกำกับเล็กน้อย ข้อได้เปรียบด้านราคาของ Flash-Lite ในตัวอย่างนี้จึงชัดที่สุดเมื่อรุ่นต่าง ๆ ตอบผ่านมาตรฐานเดียวกันในสัดส่วนใกล้เคียงกัน
RAG: cache ลดค่าอ่านบริบทซ้ำ แต่เพิ่มเงื่อนไขเรื่องเวลา
สมมติระบบค้นเอกสารแล้วตอบหนึ่งพันครั้ง แต่ละครั้งส่งบริบท 8,000 โทเคนและรับคำตอบ 500 โทเคน หากคิดทุกส่วนตามราคาปกติ จะมีขาเข้าแปดล้านและขาออกครึ่งล้านโทเคน ค่าโมเดลเท่ากับ 2.75 ดอลลาร์สำหรับ Flash-Lite และ 10.50 ดอลลาร์สำหรับ Haiku 4.5 ค่านี้ยังไม่รวมการทำดัชนี การค้นเอกสาร หรือฐานข้อมูลเวกเตอร์ ซึ่งเป็นต้นทุนของระบบ RAG แม้ไม่ได้อยู่ในบิลของโมเดล
สมมติต่อว่าบริบทแต่ละครั้งมีข้อความคงที่ 6,000 โทเคน และผลค้นเฉพาะคำถามอีก 2,000 โทเคน หากส่วนคงที่ถูกอ่านจาก cache ได้ในคำขอที่เหลือทั้งหมด ค่าโทเคนของ Flash-Lite จะอยู่ราว 1.40 ดอลลาร์ก่อนค่าเก็บ cache ส่วน Haiku ที่เขียน cache อายุห้านาทีจะอยู่ราว 5.11 ดอลลาร์ ตัวเลขทั้งคู่เป็นผลคำนวณจากเงื่อนไขสมมติเดียวกัน ไม่ใช่ผลวัดจากระบบจริง
ส่วนที่ทำให้ผลต่างจากตัวอย่างคืออัตรา cache hit และอายุของข้อมูล ถ้าเอกสารหรือข้อความกำกับเปลี่ยนบ่อย ต้องเขียน cache ใหม่และจ่ายค่าที่เกี่ยวข้องอีกครั้ง ฝั่ง Gemini มีค่าเก็บตามจำนวนโทเคนและเวลาที่เก็บ ส่วนฝั่ง Claude ค่าเขียน cache อายุหนึ่งชั่วโมงสูงกว่าแบบห้านาที แต่มีโอกาสลดการเขียนซ้ำเมื่อคำขอห่างกัน การเลือกอายุ cache จึงขึ้นกับช่วงเวลาที่คำขอเข้ามาจริง
ขนาดบริบทก็เปลี่ยนราคาของบางรุ่นด้วย อัตรา Standard ของ Gemini 3.1 Pro Preview เพิ่มจาก 2 เป็น 4 ดอลลาร์ต่อโทเคนขาเข้าหนึ่งล้านหน่วย และจาก 12 เป็น 18 ดอลลาร์ต่อโทเคนขาออกหนึ่งล้านหน่วย เมื่อพรอมป์เกิน 200,000 โทเคน ส่วนเอกสารราคา Claude ระบุว่ารุ่น 4.6 เป็นต้นไปใช้บริบทได้ถึงหนึ่งล้านโทเคนในอัตราต่อโทเคนมาตรฐาน งาน RAG ที่ต้องส่งเอกสารยาวจึงต้องดูทั้งรุ่น ขนาดพรอมป์ และส่วนที่นำกลับมาใช้ซ้ำได้ การตัดบริบทให้สั้นลงมีประโยชน์ก็ต่อเมื่อคำตอบยังอ้างอิงเอกสารได้ถูกต้อง
Coding agent: ราคาต่องานผ่านอาจกลับด้านจากราคาต่อครั้ง
สมมติให้งานแก้โค้ดหนึ่งร้อยงานใช้สิบรอบต่องาน แต่ละรอบมีขาเข้า 20,000 และขาออก 2,000 โทเคน เมื่อยังไม่คิด cache หรือเครื่องมือ ปริมาณรวมเป็นขาเข้า 20 ล้านและขาออกสองล้านโทเคน ค่าโมเดลจะเป็น 22.50 ดอลลาร์สำหรับ Gemini 3.8 Flash ตามราคาช่วงแนะนำ และ 60 ดอลลาร์สำหรับ Claude Sonnet 5.5 เมื่ออัตราของ Flash เพิ่มตามกำหนด ค่าในสถานการณ์เดิมจะเป็น 45 ดอลลาร์
ตัวอย่างนี้ยังสมมติว่าทั้งสองรุ่นใช้จำนวนรอบเท่ากัน หาก Sonnet ทำงานชุดเดิมได้เฉลี่ยสามรอบแทนสิบรอบ และใช้โทเคนต่อรอบเท่าที่กำหนด ค่าโมเดลจะเหลือ 18 ดอลลาร์ ต่ำกว่า 22.50 ดอลลาร์ของ Flash ในกรณีสิบรอบ นี่เป็นเพียงเงื่อนไขคำนวณที่แสดงจุดเปลี่ยนของต้นทุน ไม่ใช่ข้ออ้างว่า Sonnet ใช้สามรอบกับงานจริง
แม้จำนวนรอบใกล้กัน ผลสำเร็จก็ยังทำให้คำตอบเปลี่ยน ถ้าใช้เงินเท่าเดิมกับงานหนึ่งร้อยงาน แต่แพตช์ของรุ่นหนึ่งผ่านเกณฑ์น้อยกว่า ต้นทุนต่อแพตช์ที่ใช้ได้จะสูงกว่าอัตราที่เห็นในตารางราคา การนับงานผ่านควรใช้ชุดทดสอบ ข้อกำหนด และงบเวลาชุดเดียวกัน รวมถึงระบุว่างานที่ต้องให้มนุษย์แก้ต่อถือว่าผ่านหรือไม่
ค่าใช้จ่ายระหว่างทางมีผลเช่นกัน เอเจนต์อาจอ่านไฟล์เดิมหลายครั้ง ส่งผลการทดสอบกลับเข้าโมเดล หรือสร้างแพตช์ใหม่หลังการทดสอบล้มเหลว ข้อความเหล่านี้เพิ่มโทเคนขาเข้า ขณะที่การอธิบายเหตุผลและการสร้างโค้ดเพิ่มขาออก หากมีการใช้เครื่องมือที่คิดค่าบริการแยก หรือใช้เครื่องรันทดสอบเป็นเวลานาน ต้นทุนต่องานผ่านต้องรวมส่วนนั้นด้วย ราคาของโมเดลจึงเป็นเพียงส่วนหนึ่งของต้นทุนเอเจนต์
อันดับโค้ดบอกความสามารถของรุ่นที่ทดสอบ ไม่ใช่ต้นทุนของงานคุณ
ตารางเปรียบเทียบของ BenchLM ที่ระบุว่าตรวจข้อมูลเมื่อวันที่ 2 ตุลาคม 2026 จัด Claude Sonnet 5.5 เป็นอันดับหนึ่งหมวด coding ด้วยคะแนน 85.56 เทียบกับ Gemini 4 Argon อันดับห้าที่ 74 และจัด Claude Opus 5.5 เป็นอันดับหนึ่งหมวด agentic เทียบกับ Gemini 4 Argon อันดับสี่ นี่เป็นผลของรุ่นและหมวดที่ระบุ โดยอันดับ coding ไม่ได้เปรียบเทียบ Sonnet 5.5 กับ Gemini 3.8 Flash หรือ Flash-Lite ที่ใช้ในตัวอย่างต้นทุน
อันดับดังกล่าวช่วยเลือกว่าจะนำรุ่นใดมาลองกับงานโค้ด แต่ไม่บอกจำนวนรอบหรือค่าใช้จ่ายจนแพตช์ผ่านในชุดงานของแต่ละทีม คะแนนสูงกว่าอาจคุ้มกับงานที่ยากและแก้ซ้ำมาก ขณะที่รุ่นราคาต่ำกว่าอาจเหมาะกับงานปริมาณสูงที่ผ่านเกณฑ์ได้ใกล้กัน หากงานต้องสร้างคำอธิบายหรือข้อความถึงผู้ใช้เป็นภาษาไทย เกณฑ์ผ่านก็ควรรวมคุณภาพภาษาไทยด้วย เพราะอันดับ coding ไม่ได้วัดค่าใช้จ่ายของข้อกำหนดนั้นโดยตรง
ช่องทางที่ใช้ทดสอบต้องตรงกับช่องทางที่จะซื้อ งานวิจัยเปรียบเทียบ API กับหน้า chatbot ตรวจหลายระบบรวมถึง Claude และ Gemini แล้วพบว่าคะแนนความถูกต้องผ่าน API สูงกว่าหน้าใช้งานโดยเฉลี่ย 3.4 จุดเปอร์เซ็นต์ ผลจากการลองในเว็บแชตจึงใช้แทนผลของ API โดยตรงไม่ได้ สำหรับการเลือกบริการ API ตัวเลขที่ตอบคำถามเรื่องความคุ้มค่าคือค่าใช้จ่ายรวมต่อคำตอบหรือแพตช์ที่ผ่านเกณฑ์ในช่องทาง API เดียวกับที่จะใช้งานจริง
อ่านเพิ่มเติม:
บทความที่เกี่ยวข้อง


Prompt caching ลดค่า LLM ได้ แต่ต้นพรอมป์ที่เปลี่ยนอาจทำให้พลาดแคช

Nebius ซื้อ Inferize เดิมพันว่าลดเวลารอโมเดลจะลดต้นทุน AI ได้จริง

GPT-6.1 Sol ลดราคา AI งานซับซ้อน แต่โหมดเครื่องมือย้ายไป Responses API

Claude Code หรือ Gemini CLI: ตัวเก่งเปลี่ยนตามโมเดลและชุดทดสอบ

ช่องโหว่ GitLab AI Gateway ได้ 9.9—ผู้ใช้คลาวด์ไม่ต้องแก้เหมือนกัน
สมัครรับจดหมายข่าวของเรา
รับข่าวสารล่าสุดเกี่ยวกับ Web3, AI และคริปโตส่งตรงถึงกล่องจดหมายของคุณ