
GPT-6.1 Sol: halos Astra ang performance sa ikapitong bahagi ng gastos

Sa anunsiyo ng OpenAI noong Setyembre 29, 2026, inilunsad ang GPT-6.1 Sol at iniulat na 2.1 percentage point lamang ang agwat nito sa GPT-6 Astra sa OSWorld 2.0, sa humigit-kumulang ikapitong bahagi ng gastos kada task. Sariling pagsusukat ito ng OpenAI sa mga gawaing gumagamit ng computer. Magagamit na ang modelo sa ChatGPT Work, Codex at API, ngunit wala pa ito sa karaniwang Chat.
Bahagi ang paglulunsad ng DevDay sa Fort Mason, San Francisco, noong Setyembre 29, 2026. Inilarawan ng ulat ng Axios sa DevDay ang Sol bilang mas murang bersiyon ng workhorse model ng OpenAI na lumalapit sa Astra sa coding at computer use. Para sa gagamit nito, mahalagang ihiwalay ang dalawang paghahambing: ikalimang bahagi ng presyo ng Astra ang karaniwang input at output token rate ng Sol, samantalang ang ikapitong bahagi ay gastos kada task sa isang partikular na benchmark.
Saan lumalapit ang Sol sa Astra
Sa DeepSWE v1.1, na sumusubok ng mahahabang software-engineering task sa tunay na codebase, kapantay ng Sol ang resulta ng Astra sa humigit-kumulang ikalimang bahagi ng gastos kada task. Lampas din ang Sol ng 6.4 percentage point sa pinakamahusay na resulta ng naunang GPT-6 Sol, kahit mas mababa ang reasoning effort at gastos nito sa paghahambing na iyon. Ang score ay tungkol sa pagkumpleto ng mga itinakdang coding task, hindi sa bawat uri ng programang maaaring ipagawa sa modelo.
Mas tiyak ang hangganan ng paghahambing sa computer use. Sa OSWorld 2.0 offline set, sinusubok ang mga agent sa mahahabang gawaing dumaraan sa mga computer application. Sa maximum reasoning effort, pitong percentage point ang lamang ng GPT-6.1 Sol sa GPT-6 Sol sa mas mababa sa kalahati ng gastos kada task. Sa kaparehong effort setting, 2.1 percentage point ang lamang ng Astra sa bagong Sol, ngunit humigit-kumulang pitong beses ang gastos nito kada task. Partial reward sa offline set ng v2026.08.08 release ang iniulat na resulta.
May iba pang palatandaan para sa trabahong lampas sa code at computer application. Sa GDP.pdf, na gumagamit ng masalimuot na PDF na may mga talahanayan at diagram, lumalapit ang Sol sa resulta ng Astra sa humigit-kumulang ikalimang bahagi ng gastos kada task. Sa AutomationBench, na sumusukat sa pagkumpleto ng mga workflow gamit ang maraming tool, umangat ito ng 4.8 percentage point mula sa GPT-6 Sol sa parehong medium reasoning setting. Magkaiba ang gawain at paraan ng pagmamarka sa mga pagsusulit na ito, kaya hindi maaaring ipalit ang isang score sa isa pa.
May paglalarawan din mula sa isang gumagamit ng modelo. Binanggit ni Jayesh Govindarajan, executive vice president of software engineering ng Salesforce, sa ulat ng The Next Web na natukoy ng Sol ang “important accessibility and language-support issues” sa kanilang pagsusuri ng application. Isang karanasan iyon sa coding, hindi hiwalay na pagsukat ng pangkalahatang performance laban sa Astra.
Magkano ang gastos kada task
Mas kapaki-pakinabang ang gastos kada task kaysa token rate lamang para sa mga agent na maaaring gumawa ng maraming hakbang bago matapos. Narito ang tatlong magkaibang paghahambing mula sa mga inilathalang benchmark. Mga average o relatibong gastos sa kondisyon ng bawat test ang mga ito; hindi sila nakapirming singil para sa anumang sariling gawain.
- Coding, DeepSWE v1.1: Kapantay ng Sol ang resulta ng Astra sa humigit-kumulang ikalimang bahagi ng gastos kada task.
- Computer use, OSWorld 2.0: Nasa loob ng 2.1 percentage point ng Astra ang Sol sa humigit-kumulang ikapitong bahagi ng gastos kada task, sa maximum reasoning effort.
- Scientific work, Terminal-Bench Science 0.1: Sa maximum effort, $5.47 ang average na gastos kada task ng Sol at $23.80 ng Astra. Mas mataas ang score ng Astra: 68.1% ang pinakamataas sa mga modelong sinubok.
Sa scientific test, higit sa doble ang score ng bagong Sol laban sa GPT-6 Sol sa maximum effort at mas mababa sa kalahati ang gastos kada task nito. Saklaw ng pagsusulit ang pagsusuri ng data, simulation at gawaing gumagamit ng code at terminal tools. Mas malaki rito ang natitirang kalamangan ng Astra sa resulta kaysa sa ipinahihiwatig ng coding comparison; para sa pinakamahirap na scientific task, may kapalit sa accuracy ang mas mababang gastos.
Ang mga resulta para sa mga modelo ng OpenAI ay sinukat sa research environment nito o sa API. Maaari silang magkaiba sa production ChatGPT dahil sa system prompt, magagamit na tool at reasoning effort; mula naman sa mga pampublikong ulat ang ilan sa mga resulta ng kakumpitensiyang modelo. Kaya ang mga ratio ng gastos ay tumutukoy sa partikular na mga test run, habang ang aktuwal na bayarin ay nakadepende sa mga token at hakbang na nagamit ng isang workflow.
Presyo at kasalukuyang access
Sa standard API rate, $2 ang GPT-6.1 Sol bawat milyong input token at $10 bawat milyong output token. $0.10 bawat milyong token ang cached input nito, na ginagamit kapag muling nagagamit ang naunang context. Para sa GPT-6 Astra, $10 ang input, $50 ang output at $1 ang cached input sa kaparehong bilang ng token. Ikalimang bahagi ang regular na input at output rate ng Sol; ikasampung bahagi naman ang cached input rate nito.
Magagamit ng mga developer ang modelo sa API bilang gpt-6.1-sol. Sa ChatGPT Work at Codex, kasama ito para sa mga user ng Plus, Pro, Business, Enterprise at Edu na plano. Hindi pa ito mapipili sa karaniwang Chat sa kasalukuyang paglulunsad. Ibig sabihin, maaaring gamitin ng may naaangkop na access ang Sol para sa isang coding o computer-use workflow, ngunit hindi pa nito binabago ang modelong nakikita ng taong sa regular na Chat lamang gumagamit ng ChatGPT.
Hindi rin awtomatikong katumbas ng mas murang token ang ikalimang bahagi ng kabuuang bayarin. Kung mas maraming output, tool call o pag-ulit ang kailangan upang matapos ang task, tataas ang gastos kahit pareho ang nakalistang presyo kada token. Dito nanggagaling ang halaga ng benchmark na gastos kada task: isinasama nito ang ginamit na compute sa pagtatangkang tapusin ang mismong gawain, sa halip na ihambing lamang ang rate card.
Ang praktikal na pagkakaiba ayon sa trabaho
Magkakaiba ang ipinapakitang kapalit ng mas mababang gastos. Sa coding, ang pinakamalakas na paghahambing ay ang pagkakapantay ng resulta sa DeepSWE. Sa computer use, maliit ngunit may sukat na agwat ang natitira sa OSWorld. Sa scientific work, mas malaki ang pagitan sa score kahit mas mura ang Sol kada task. Nagbibigay ito ng magkakaibang batayan sa pagpili ng modelo:
- Kung mahahabang pagbabago sa codebase ang trabaho, may direktang benchmark na nagpapakitang kayang pantayan ng Sol ang Astra sa mas mababang gastos. May dagdag na konteksto ang karanasan ng Salesforce, ngunit hindi nito pinapalitan ang score sa test.
- Kung sunod-sunod na paggamit ng computer application ang trabaho, malapit ang Sol sa Astra sa OSWorld offline set. Maaaring mahalaga pa rin ang natitirang agwat kung kailangang matapos ang bawat hakbang ng workflow.
- Kung mahirap na scientific workflow ang trabaho, mas mababa ang average na gastos ng Sol, ngunit Astra ang may pinakamataas na iniulat na score sa Terminal-Bench Science. Dito mas malinaw ang dahilan upang piliin ang mas mahal na modelo kapag mas mahalaga ang pagkumpleto ng mahirap na gawain kaysa pagtitipid sa bawat pagtatangka.
Ang pinakamalaking agarang pagbabago ay para sa mga gumagamit ng Work, Codex at API na maaaring pumili ng modelo ayon sa gawain at badyet. Para sa mga nasa karaniwang Chat, mananatiling wala sa model picker ang Sol hanggang palawakin ng OpenAI ang access nito roon.
Basahin din:
Kaugnay na artikulo


ChatGPT Plus o Claude Pro: pareho ang presyo, magkaiba ang lakas

May watermark na ang ChatGPT text—pero kayang pahinain ng salin

Gemini 4 Argon inilunsad, pero wala pang pampublikong API

GitHub Copilot o Cursor: mas murang plan laban sa mas mataas na PR acceptance

ChatGPT o Gemini sa Filipino: parehong mahusay, pero konteksto ang tunay na laban
Mag-subscribe sa aming newsletter
Matanggap ang pinakabagong balita tungkol sa Web3, AI at crypto nang diretso sa iyong inbox.