
OpenAI API או Gemini API: החשבון משתנה לפי אורך הקלט, לא רק המודל

בבחירה בין OpenAI API ל־Gemini API צריך לחשב את אורך הקלט בכל בקשה, ולא רק את סך הטוקנים בחודש. ב־תמחור GPT-6 Luna, מיליון טוקני קלט קצרים עולים 0.10 דולר ומיליון טוקני פלט עולים 0.50 דולר; בקשה עם יותר מ־272 אלף טוקני קלט עוברת לתעריף גבוה יותר על הבקשה כולה. לכן שני עומסים עם אותו נפח חודשי יכולים להפיק חשבון שונה אם באחד מהם הקלט מרוכז במסמכים ארוכים.
ב־מחירון Gemini 2.5 Flash-Lite, תעריף השימוש בתשלום הוא 0.10 דולר למיליון טוקני קלט של טקסט, תמונה או וידאו, ו־0.40 דולר למיליון טוקני פלט, כולל טוקני חשיבה. בשלושת העומסים המותנים שלהלן חיוב המודל של Gemini נמוך יותר. זו תשובה לשאלת המחיר בהנחות קבועות; איכות התשובה, מספר הטוקנים שכל מודל יצרוך וזמן קבלת התוצאה עשויים לשנות את הבחירה בפרויקט מסוים.
מה צריך להיכנס לחישוב
עלות המודל היא מספר טוקני הקלט חלקי מיליון כפול תעריף הקלט, בתוספת אותו חישוב לטוקני הפלט. את המכפלות מבצעים בנפרד לקלט רגיל, לקלט שנשלף ממטמון ולעיבוד אצווה, אם משתמשים בהם. הוראות מערכת, היסטוריית שיחה וקטעים שאוחזרו ממאגר הם חלק מן הקלט שנשלח. טוקני חשיבה עשויים להיכלל בחיוב הפלט גם כשהתשובה שהמשתמש רואה קצרה.
כל הדוגמאות מניחות שימוש בתשלום, אותו מספר טוקנים מדווח בשתי הפלטפורמות וללא קריאות כלי, אלא אם צוין אחרת. אלה תרחישים מותנים, לא תוצאות של הרצת שני המודלים. כדי להתאים אותם לעומס אמיתי יש להציב את ספירת הטוקנים שכל API מחזיר: אותו טקסט או PDF עשוי להיספר אחרת בשני השירותים. להמרה לשקלים מכפילים את העלות בדולרים בשער שמשמש את הארגון לתקצוב, ומטפלים בנפרד במסים ובעמלות שחלים עליו.
צ'אט תמיכה: גם תשובה קצרה מצטברת
נניח שירות שמטפל ב־100 אלף פניות בחודש, עם 1,000 טוקני קלט ו־200 טוקני פלט לחיוב בכל פנייה. הסך הוא 100 מיליון טוקני קלט ו־20 מיליון טוקני פלט. ללא מטמון וכלים, GPT-6 Luna עולה בתרחיש הזה 20 דולר: 10 דולר לקלט ו־10 דולר לפלט. Gemini 2.5 Flash-Lite עולה 18 דולר: 10 דולר לקלט ו־8 דולר לפלט. ההפרש נובע מתעריף הפלט, משום שתעריף הקלט הרגיל של שני המודלים שבחרנו זהה.
החשבון הזה רגיש במיוחד למה שנכלל ב־200 טוקני הפלט. אם מודל אחד מפיק תשובה ארוכה יותר, או משתמש ביותר טוקני חשיבה, שורת הפלט שלו תגדל גם כאשר מספר הפניות קבוע. שיחת תמיכה מרובת תורות מוסיפה עוד הבדל: ההיסטוריה שנשלחת שוב יכולה להגדיל את הקלט בכל תור. לפיכך מחיר של פנייה בודדת אינו תחליף לסכימת כל הקריאות בשיחה. בשער תקציבי מותנה של 3.70 שקלים לדולר, 20 דולר הם 74 שקלים ו־18 דולר הם 66.60 שקלים; השער בפועל תלוי באופן החיוב של הארגון.
מסמך ארוך: סף של בקשה בודדת
נניח כעת 1,000 בקשות לניתוח מסמכים, עם 300 אלף טוקני קלט ו־1,000 טוקני פלט לחיוב בכל בקשה. בהנחה שכל נפח הקלט נספר כך בשתי הפלטפורמות, מדובר ב־300 מיליון טוקני קלט ובמיליון טוקני פלט. כל בקשה חוצה את סף התמחור של GPT-6 Luna, ולכן תעריף הקלט שלה הוא 0.20 דולר ותעריף הפלט 0.75 דולר למיליון טוקנים. עלות המודל בתרחיש היא 60.75 דולר. באותו נפח מדווח, Gemini 2.5 Flash-Lite עולה 30.40 דולר.
הפער אינו נובע רק מכמות הטוקנים הכוללת. ב־GPT-6 Luna חציית הסף מייקרת את כל טוקני הבקשה, ולכן חלוקה של עבודה למסמכים קצרים יותר עשויה לשנות את מדרגת המחיר. חלוקה כזו עשויה גם לחייב חזרה על הוראות וקונטקסט או שלב נוסף לאיחוד התוצאות; שתי התוספות צורכות טוקנים. ב־Gemini, טוקנים של PDF שמדווחים במודאליות DOCUMENT מחויבים לפי תעריף טוקני תמונה. עבור Flash-Lite, תעריף התמונה והטקסט בקלט זהה, אך עדיין נדרשת ספירת הטוקנים המדווחת בפועל. מספר עמודים לבדו אינו נתון מספיק להצעת מחיר.
עיבוד אצווה: חיסכון שתלוי בזמן ההמתנה
לעבודה שאפשר להגיש לעיבוד אצווה, נניח מיליון קטעי טקסט, כל אחד עם 500 טוקני קלט ו־100 טוקני פלט. מתקבלים 500 מיליון טוקני קלט ו־100 מיליון טוקני פלט. בתעריף Batch של GPT-6 Luna עלות המודל היא 50 דולר: 25 דולר לכל צד של החישוב. בתעריף Batch של Gemini 2.5 Flash-Lite העלות היא 45 דולר: 25 דולר לקלט ו־20 דולר לפלט. בתעריף הרגיל, אותם נפחים היו עולים 100 ו־90 דולר בהתאמה.
המסלול הזה מתאים לסיווג, לחילוץ נתונים או לעבודה תקופתית כשהתוצאה אינה דרושה במהלך שיחה חיה. ההנחה בחישוב היא שכל הקטעים מעובדים פעם אחת ושפלט החיוב נשאר בגודל שהוגדר. אם העבודה מחייבת ניסיון חוזר, קריאות נוספות יגדילו את הנפח; אם נדרש פלט מפורט יותר, גם צד הפלט יעלה. לכן ההשוואה בין אצווה לקריאות רגילות צריכה לשמור קבועים את העבודה המבוקשת ואת הזמן שבו התוצאה נחוצה.
מטמון: שיעור פגיעה, כתיבה ואחסון
מטמון מוזיל קלט חוזר רק כאשר הקריאה עומדת בתנאי השימוש בו. הנחיות המטמון של OpenAI דורשות התאמה של קידומת הבקשה ומתארות אורך מינימלי של 1,024 טוקנים למודלים החדשים. לכן אין להחיל אוטומטית תעריף מטמון על פניות התמיכה בדוגמה הקודמת, שבהן כל הקלט הוגדר כ־1,000 טוקנים. גם קידומת שחוזרת לעיני המפתח אינה מבטיחה פגיעה אם נקודת השמירה או תוכן הבקשה משתנים.
כאשר יש קלט מתאים שחוזר, תעריף הקריאה מן המטמון בשני המודלים שנבחרו הוא 0.01 דולר למיליון טוקנים, לעומת 0.10 דולר לקלט רגיל. אולם מחיר הקריאה הוא רק רכיב אחד: ב־GPT-6 Luna כתיבה למטמון מחויבת בנפרד, וב־Gemini יש גם תעריף אחסון למטמון. כדי לחשב חיסכון יש להפריד בין טוקנים שנכתבו, טוקנים שבאמת נקראו מחדש, זמן האחסון והקלט שלא נמצא במטמון. עומס עם הוראות ארוכות וזהות בין קריאות יכול להיראות אחרת לגמרי מעומס של פניות קצרות שמשתנות בכל פעם.
חיפוש: חיוב הכלי יכול לגבור על פער המודל
כאשר תשובה דורשת מידע מהרשת, נוסף לחשבון רכיב שאינו נכלל במחיר הטוקנים הבסיסי. תמחור כלי החיפוש של OpenAI מציג 10 דולר לאלף קריאות Web search, לצד חיוב טוקני תוכן החיפוש לפי תעריף המודל. אם 10% מ־100 אלף פניות התמיכה המותנות מפעילות חיפוש אחד, מתקבלות 10,000 קריאות ועלות כלי של 100 דולר, לפני טוקני התוכן. בכך רכיב החיפוש גדול מן הפער שחושב בין שני המודלים עבור פניות התמיכה ללא כלים.
ל־Grounding with Google Search ב־Gemini 2.5 Flash-Lite יש בחשבון בתשלום מכסה של 1,500 בקשות מעוגנות ליום, המשותפת גם ל־Gemini 2.5 Flash; לאחריה התעריף הוא 35 דולר לאלף בקשות מעוגנות. פיזור יומי של אותן 10,000 הפעלות מותנות יכול אפוא להשפיע על חיוב הכלי, גם כשמספר ההפעלות החודשי אינו משתנה. יחידת החיוב של הכלי ותוכן החיפוש שמוחזר אינם זהים בהכרח בין הפלטפורמות, ולכן אי אפשר להשוות את שורת הכלים באמצעות תעריף למיליון טוקנים בלבד.
מה מכריע בין שתי החלופות
בשלושת העומסים שהוגדרו כאן, חיוב המודל של Gemini 2.5 Flash-Lite נמוך מזה של GPT-6 Luna: 18 מול 20 דולר בצ'אט, 30.40 מול 60.75 דולר במסמכים הארוכים, ו־45 מול 50 דולר באצווה. התוצאה הגדולה ביותר לטובת Gemini מופיעה כשהבקשות הבודדות חוצות את סף הקלט של GPT-6 Luna. אלה תוצאות אריתמטיות של נפחי קלט ופלט זהים; הן אינן מניחות ששני המודלים יפתרו כל משימה באותה רמת הצלחה או באותו מספר טוקנים.
מחקר על עלות מודלי חשיבה מצא שבמשימות שנבדקו בו, מחיר מחירון נמוך יותר לא הבטיח עלות כוללת נמוכה יותר: צריכת טוקני חשיבה ומספר סבבי העבודה השפיעו על התוצאה. המחקר לא בדק את שלושת העומסים המותנים כאן, אך הוא מחדד את גבול החישוב שלהם. עבור עומס מוצר נתון, העלות המשמעותית היא של משימה שהושלמה: כל קריאותיה, הקלט הרגיל והחוזר, הפלט לחיוב, הכלים שהופעלו והעבודה שנדרשה כדי לקבל תשובה שימושית.
כתבות קשורות


Gemini Notebook בעברית: כך בונים מחקר שמציג את המקור לכל תשובה

n8n באחסון עצמי: audit אחד חושף webhooks לא מוגנים

סוכני OpenAI פרסמו 53 תמונות משתמשים — ולא ניתן לזהות את הנפגעים

Prompt injection עקיף: מסמך תמים יכול להפעיל את סוכן ה־AI

סוכן OpenAI חדר למערכת ממשלתית — אוסטרליה בודקת מי אחראי
הירשמו לניוזלטר שלנו
קבלו את החדשות האחרונות על Web3, AI וקריפטו ישירות לתיבת הדואר.