LLM API-ის დაბალი ფასი შეიძლება მოჩვენებითი იყოს — გადამწყვეტია პასუხის სიგრძე

OpenAI API-ს, Claude API-სა და Gemini API-ს შორის არჩევისას ერთი მილიონი შემავალი ტოკენის ფასი საკმარისი საზომი არ არის. ერთი დასრულებული დავალების ხარჯში გამომავალი ტოკენებიც შედის: მოდელი, რომელიც მოკლე პასუხისთვის იაფია, გრძელი პასუხისას შეიძლება უფრო ძვირი აღმოჩნდეს. ინტერაქტიული დატვირთვისთვის ფასს უნდა დაემატოს პირველი ტოკენის დაყოვნება და მთელი პასუხის დასრულების დრო.
ქვემოთ GPT‑4.1 mini, Gemini 2.5 Flash და Claude Haiku 4.5 ერთი და იმავე პირობითი დატვირთვითაა შედარებული. მოკლე JSON-ის მაგალითში Gemini ოდნავ იაფია, ჩატსა და გრძელ გენერაციაში კი GPT‑4.1 mini-ის დაბალი გამომავალი ტარიფი უპირატესობას იღებს. Claude Haiku 4.5-ის უფრო მაღალი ფასი შეიძლება მისაღები იყოს მაშინ, როცა პირველი ტოკენის სწრაფი მიღება მნიშვნელოვანია. ეს ფასის გამოთვლაა და არა პასუხების ხარისხის ტესტი.
სამი მოდელის საწყისი ტარიფი
შედარება ეხება ფასიან, სტანდარტულ ტექსტურ მოთხოვნებს. OpenAI-ის GPT‑4.1 mini-ის ტარიფით, მილიონი შემავალი ტოკენი $0.40 ღირს, მილიონი გამომავალი — $1.60, ხოლო ქეშიდან წაკითხული შემავალი ტოკენები — $0.10. ძიების ან სხვა ცალკე ფასიანი ხელსაწყოს გამოყენება ამ გამოთვლებში არ შედის.
Google-ის Gemini-ის ფასების ცხრილში 2.5 Flash-ის სტანდარტული ტექსტური შესავალი მილიონ ტოკენზე $0.30 ღირს, გამომავალი — $2.50; გამომავალში მსჯელობის ტოკენებიც ითვლება. ქეშირებული ტექსტის წაკითხვის ტარიფია $0.03, ხოლო აშკარად შექმნილი ქეშის შენახვას დროის მიხედვით დამატებითი ფასი აქვს. Batch-სა და Flex-ში შესავალი $0.15 და გამომავალი $1.25 ღირს, Priority-ში კი, შესაბამისად, $0.54 და $4.50. ეს რეჟიმები ერთნაირ მომსახურებას არ ნიშნავს: დაბალი Batch ტარიფი მყისიერი ჩატის ფასად ვერ ჩაითვლება.
Anthropic-ის Claude-ის ფასების ცხრილში Haiku 4.5-ის მილიონი შემავალი ტოკენი $1 ღირს, გამომავალი — $5; ხუთწუთიან ქეშში ჩაწერა $1.25, ერთსაათიანში — $2, წაკითხვა კი $0.10. იმავე დოკუმენტში Amazon Bedrock-ისა და Google Cloud-ის რეგიონული ან მრავალრეგიონული endpoint-ებისთვის გლობალურ endpoint-თან შედარებით 10%-იანი დანამატია აღწერილი. ქვემოთ მოცემული თანხები პირდაპირი Claude API-ის საბაზისო ტარიფითაა დათვლილი; პარტნიორული მარშრუტის დანამატი მათში არ შედის.
ამ მოდელების არჩევას ერთი მიზეზი აქვს: სამივე შედის ქვემოთ განხილულ დაყოვნების შედარებაში. მათი ფასები მთელ ბაზარზე ყველაზე იაფი შეთავაზებების სია არ არის. გამოქვეყნებული ტარიფი შესაძლო ფასდაკლებას, განსხვავებულ ანგარიშსწორებას ან საქართველოში გადახდის საბოლოო საბუღალტრო პირობებსაც არ ასახავს.
მოკლე JSON, ჩატი და გრძელი პასუხი
საბაზისო ფორმულაა დავალების ფასი = შემავალი ტოკენები × შემავალი ტარიფი + გამომავალი ტოკენები × გამომავალი ტარიფი; ორივე ნამრავლი მილიონზე იყოფა. ყველა მაგალითში სამივე მოდელს ერთნაირი რაოდენობის შემავალი და გამომავალი ტოკენი აქვს, რათა მხოლოდ ტარიფის გავლენა გამოჩნდეს. ეს პირობითი მოცულობებია: ისინი არც რეალურად გაზომილ საშუალო პასუხს და არც სამივე მოდელის თანაბარ ხარისხს არ გულისხმობს.
პირობითი მოკლე JSON-ისთვის დავუშვათ 1 000 შემავალი და 100 გამომავალი ტოკენი თითო მოთხოვნაზე. ათასი დასრულებული მოთხოვნა GPT‑4.1 mini-ით $0.56 დაჯდება, Gemini 2.5 Flash-ით — $0.55, Claude Haiku 4.5-ით — $1.50. Gemini-ისა და GPT-ის სხვაობა აქ მხოლოდ ერთი ცენტია ათას მოთხოვნაზე. ამიტომ პასუხის სიგრძის მცირე ცვლილებასაც შეუძლია ამ ორ მოდელს შორის ფასით ლიდერი შეცვალოს.
პირობით ჩატში თითო პასუხისთვის 3 000 შემავალი და 600 გამომავალი ტოკენი ავიღოთ. ათასი პასუხის ღირებულება GPT‑4.1 mini-ისთვის $2.16, Gemini 2.5 Flash-ისთვის $2.40, Claude Haiku 4.5-ისთვის $6.00 გამოდის. საუბრის ისტორიის ხელახლა გაგზავნისას შემავალი მოცულობა ხშირად იზრდება; ეს მაგალითი უცვლელ მოცულობას გულისხმობს და მომდევნო შეტყობინებებით გაზრდილ ისტორიას ავტომატურად არ ითვლის.
პირობითი გრძელი გენერაცია 10 000 შემავალ და 4 000 გამომავალ ტოკენს იყენებს. ათასი ასეთი დავალება იმავე თანმიმდევრობით $10.40, $13.00 და $30.00 ღირს. თუ უცვლელი შესავლის პირობებში Gemini-ის პასუხი პირობითად 6 000 გამომავალ ტოკენამდე გაიზარდა, მისი ჯამი $18.00 გახდება. ეს ზრდა მოდელის ქცევის პროგნოზი არ არის; იგი აჩვენებს, რა ემართება ბიუჯეტს, როდესაც ფასიანი გამომავალი ტექსტი გრძელდება.
როდის იცვლება ფასით ლიდერი
Gemini 2.5 Flash-ის სტანდარტული შემავალი ტოკენი GPT‑4.1 mini-ისაზე იაფია, გამომავალი კი ძვირია. ამ ტარიფებიდან გამომდინარეობს ზღვარი: GPT იაფი ხდება, როცა გამომავალი ტოკენების რაოდენობა შემავალის დაახლოებით ერთ მეცხრედს გადააჭარბებს. 1 000 შემავალი ტოკენისას ეს დაახლოებით 111 გამომავალი ტოკენია. სწორედ ამიტომ 100-ტოკენიანი JSON Gemini-ს მცირე უპირატესობას უტოვებს, ხოლო 600-ტოკენიანი ჩატის პასუხი შედეგს აბრუნებს.
ეს ზღვარი მხოლოდ ანგარიშზე დარიცხულ ტოკენებს ადარებს. ერთსა და იმავე ტექსტს მოდელების ტოკენიზატორები შესაძლოა განსხვავებულ რაოდენობად დაითვლიდნენ; მსჯელობის ტოკენები, ხელსაწყოს გამოძახება ან გამოუსადეგარი პასუხის ხელახლა გენერაციაც საბოლოო ხარჯს შეცვლის. თუ ერთი მოდელი დასასრულებლად უფრო მოკლე პასუხს ქმნის, თანაბარი სიგრძის მაგალითიდან მიღებული ფასითი რიგი რეალურ დავალებაზე შეიძლება აღარ შენარჩუნდეს. ამიტომ სრული შედეგის ხარჯი ტოკენის ცალკეულ ფასზე უკეთესი საზომია.
პირველი ტოკენი და მთელი პასუხის დრო
Kunal Ganglani-ის დაყოვნების ტესტში საშუალო სიგრძის მოთხოვნაზე Gemini 2.5 Flash-ის პირველი ტოკენი დაახლოებით 450 მილიწამში მოვიდა, Claude Haiku 4.5-ის — 597 მილიწამში, GPT‑4.1 mini-ის — დაახლოებით 2 400 მილიწამში. მოთხოვნები ერთი ტორონტოს სერვერიდან, ერთ ქსელში და მცირე რაოდენობის გამეორებით გაიგზავნა; Gemini-ის მსჯელობის რეჟიმი გამორთული იყო. ეს შედეგები საქართველოდან გაგზავნილი მოთხოვნის დაყოვნებას პირდაპირ არ წინასწარმეტყველებს.
ცხრილში გამტარუნარიანობის მონაცემები სხვა გაზომვებიდანაა დამატებული და ადგილობრივად გაზომილ პირველ ტოკენთან ერთ ექსპერიმენტად არ უნდა გაერთიანდეს. ჩატში, რომელიც პასუხს ნაკადად აჩვენებს, პირველი ტოკენის დრო მომხმარებლისთვის შესამჩნევ დაწყებას აღწერს. დასრულებული JSON-ის ან გრძელი ტექსტისთვის კი მთელი დროა საჭირო: დაწყებას ემატება დანარჩენი გამომავალი ტოკენების გენერაცია. უფრო სწრაფად დაწყებული პასუხი შეიძლება გვიან დასრულდეს, თუ ის ბევრად გრძელია.
ტესტის ცხრილში Haiku 4.5-ის ფასი ზემოთ მოცემულ ოფიციალურ ტარიფზე დაბალია. აქედან გამომდინარე, დაყოვნების დაკვირვება ტესტს ეყრდნობა, ხოლო ყველა ფულადი სცენარი — პროვაიდერების ოფიციალურ ფასებს. პირველი ტოკენის უპირატესობა თავისთავად არც საბოლოო ღირებულებას და არც პასუხის გამოსადეგობას განსაზღვრავს.
ქეში და დამუშავების რეჟიმი
ქეში მაშინ ამცირებს შემავალი ტოკენების ფასს, როცა რამდენიმე მოთხოვნას უცვლელი დასაწყისი აქვს და მომდევნო მოთხოვნა შენახულ ნაწილს ნამდვილად პოულობს. Claude-ის ქეშირების წესში Haiku 4.5-ისთვის გასაქეშად საჭირო მინიმალური სიგრძე 4 096 ტოკენია; მოკლე, განმეორებადი ინსტრუქცია თავისთავად შეღავათს ვერ მიიღებს. ჩანაწერის შექმნას თავისი ფასი აქვს, ხოლო შემდგომი წაკითხვა დამოკიდებულია ქეშის მოქმედების ვადასა და უცვლელ პრეფიქსზე.
პირობითად, შემდეგ მოთხოვნებში 4 096 შემავალი ტოკენი უკვე ქეშიდან იკითხება, 1 000 ახალია და პასუხი 600 ტოკენს შეიცავს. მხოლოდ ქეშში მოხვედრილი ათასი მოთხოვნის ტოკენების ხარჯი GPT‑4.1 mini-ით დაახლოებით $1.77, Gemini 2.5 Flash-ით $1.92, Claude Haiku 4.5-ით $4.41 გამოდის. ეს რიცხვები ქეშში პირველი ჩაწერის ხარჯს არ შეიცავს; Gemini-ის აშკარად შექმნილი ქეშის შენახვის საფასურიც, თუ ასეთი ქეში გამოიყენება, ცალკე დასამატებელია.
ქეშის შეღავათი შემავალ ნაწილს ეხება და გრძელ გამომავალს ვერ აიაფებს. ამიტომ მოკლე, ხშირი პასუხებისას უცვლელი კონტექსტის ხელახლა გამოყენებამ შეიძლება ფასთა სხვაობა შეამციროს, ხოლო გრძელ გენერაციაში გამომავალი ტარიფი კვლავ გადამწყვეტი დარჩეს. არასასწრაფო მასობრივი დამუშავებისთვის Gemini-ის Batch ან Flex ცალკე ფასითი სცენარია; მომხმარებლის წინაშე მიმდინარე ჩატისთვის კი ფასს პირველი ტოკენისა და სრული პასუხის დრო უნდა შეუთავსდეს. საბოლოო არჩევანი იმ დატვირთვით განისაზღვრება, რომლის პასუხის სიგრძე და მისაღები დაყოვნება წინასწარ იცით.
გამოიწერეთ ჩვენი ბიულეტენი
მიიღეთ უახლესი ამბები Web3-ის, AI-სა და კრიპტოს შესახებ პირდაპირ თქვენს ელფოსტაზე.