AI 및 자동화

GPT-5.6 Sol·Terra·Luna 선택법, 비싼 모델이 늘 정답은 아니다

|작성자: QUASA 편집팀|5 분 소요| 3
GPT-5.6 Sol·Terra·Luna 선택법, 비싼 모델이 늘 정답은 아니다

GPT-5.6 Sol·Terra·Luna는 단순한 성능 순서로 고를 모델이 아니다. 복잡한 추론과 코딩에는 Sol, 품질과 비용을 함께 관리하는 일반 작업에는 Terra, 결과를 자동 검증할 수 있는 대량·반복 작업에는 Luna를 우선 후보로 두는 것이 합리적이다.

가장 비싼 Sol을 모든 단계에 쓰면 성공률 차이가 작아도 처리 비용이 커질 수 있다. 반대로 Luna의 낮은 단가만 보고 결정하면 재시도, 사람의 검수, 잘못된 자동 실행을 복구하는 비용이 절감액을 넘어설 수 있다. 최종 기준은 모델 가격이 아니라 성공한 작업 한 건의 총비용과 실패의 파급력이다.

세 모델의 역할과 현재 API 조건

OpenAI의 GPT-5.6 출시 자료 는 Sol을 플래그십, Terra를 일상 작업용 균형 모델, Luna를 가장 빠르고 저렴한 모델로 구분하며 세 모델의 API 제공을 명시한다. 출시 뒤 Terra와 Luna 가격이 인하됐고 Sol에도 기간 한정 가격 조정이 적용됐으므로, 최초 발표 가격을 현재 단가로 사용해서는 안 된다.

공식 API 모델 카탈로그 에 표시된 텍스트 토큰 가격은 100만 토큰당 Sol 입력 4달러·출력 20달러, Terra 입력 2달러·출력 12달러, Luna 입력 0.20달러·출력 1.20달러다. 세 모델 모두 105만 토큰 컨텍스트 창과 최대 12만8000토큰 출력을 제공하며 reasoning effort는 none, low, medium, high, xhigh, max를 지원한다.

공통 한도가 같다고 긴 문맥 처리 능력이나 복합 도구 사용의 성공률까지 같다는 뜻은 아니다. 공식 카탈로그의 권장 역할에 따라 Sol은 복잡한 전문 작업과 코딩, Terra는 지능과 비용의 균형, Luna는 비용에 민감한 고처리량 작업의 출발점으로 보는 편이 정확하다.

  • Luna: 정형 추출, 태깅, 분류, 후보 선별처럼 성공 조건을 코드로 검사할 수 있는 반복 작업에 유리하다.
  • Terra: 검색 결과 합성, 일반적인 도구 사용, 범위가 정해진 코드 변경처럼 일정한 판단력이 필요하지만 Sol의 비용까지 부담하기 어려운 작업에 맞는다.
  • Sol: 요구사항이 모호한 설계, 복합 장애 분석, 여러 도구와 긴 문맥을 함께 조율하는 작업처럼 실패가 후속 단계 전체에 영향을 주는 경우에 우선 검토할 수 있다.

토큰 단가를 작업당 총비용으로 바꾸는 법

동일한 API 작업에서 Sol 0.60달러, Terra 0.32달러, Luna 0.032달러의 기본 토큰 비용을 비교한 결과

기본 텍스트 비용은 입력 토큰과 출력 토큰을 따로 계산해 더한다. 조건부 예로 한 작업에 입력 10만 토큰과 출력 1만 토큰이 필요하다면 Sol은 0.60달러, Terra는 0.32달러, Luna는 0.032달러다. 캐시, 도구 호출료, 우선 처리 요금과 재시도는 제외한 산술 결과다.

이 조건에서는 Sol이 Luna보다 18.75배 비싸다. 그러나 Luna의 최초 성공률이 낮아 여러 번 재호출하거나 사람이 결과를 수정해야 한다면 격차는 줄어든다. 반대로 JSON Schema, 필수 필드 검사, 테스트 코드처럼 오류를 즉시 차단할 장치가 있다면 Luna의 단가 차이가 처리량 절감으로 이어지기 쉽다.

비교표에는 최소한 다음 비용을 같은 단위로 넣어야 한다.

  • 최초 호출의 입력·출력 토큰 비용
  • 형식 오류와 도구 실패에 따른 재시도 비용
  • 사람이나 별도 모델이 수행하는 검수 비용
  • 오답이 다음 자동화 단계로 넘어갔을 때의 복구 비용
  • 응답 지연과 타임아웃으로 발생하는 운영 비용

출력 토큰은 세 모델 모두 입력 토큰보다 비싸다. 필요한 필드만 반환하게 하고 검색 원문이나 중간 결과를 불필요하게 재생성하지 않으면, 모델을 바꾸기 전에도 비용과 지연시간을 낮출 수 있다. 다만 27만2000토큰을 넘는 Luna 요청에는 공식 문서상 전체 요청에 별도 장문 입력 요율이 적용되므로, 매우 긴 작업은 단순 단가 계산을 그대로 대입하면 안 된다.

공개 사례가 보여주는 Luna의 경제성

OpenAI의 GPT-5.6 개발자 가이드 에 실린 Hypha 평가는 Luna가 GPT-5.5 추출 정확도의 98%를 18분의 1 비용으로 유지했다고 전한다. 같은 가이드에서 Browser Use는 어려운 브라우저 작업 106개 중 Luna가 78%를 약 14달러에 완료했고, 비교 대상 최고 성능 모델은 약 235달러로 80%를 완료했다고 밝혔다. PlayerZero는 특정 코드 탐색 작업에서 추론 비용 64%, 응답시간 90%를 줄이고 F1 점수를 5점 높였다고 설명했다.

BrowseComp 사례도 선택 기준이 성능 순위 하나가 아님을 보여준다. 가이드에 따르면 GPT-5.5 Extra High는 84.36%를 총 33.27달러에 기록했고, 출시 당시 GPT-5.6 Luna Extra High는 84.04%를 1.33달러에 기록했다. 점수 차이는 0.32%포인트였지만 당시 비용은 약 25배 차이였다.

이 수치는 OpenAI가 소개한 벤치마크와 파트너 평가이며 모든 프로덕션 환경에 그대로 적용되는 보장은 아니다. 특히 Browser Use 결과는 특정 작업 집합과 실행 환경의 성과이지 Luna 자체의 보편적 성공률이 아니다. 자체 입력, 도구 구성, 성공 판정 기준을 고정한 평가가 필요한 이유다.

추출·브라우저·코딩·복합 분석 선택표

문서 추출은 Luna, 적응형 브라우저 작업은 Terra, 복합 디버깅은 Sol로 배분한 작업 흐름

정형 추출과 대량 분류는 Luna에서 시작할 수 있다. 날짜·금액·식별자 추출, 문서 태깅, 검색 후보 축소처럼 출력 형식이 분명하고 원문 대조나 규칙 검사로 실패를 싸게 발견할 수 있는 작업이 해당한다. OCR 품질이나 문서 양식의 변동이 크다면 대표 표본에서 Terra와 누락률을 비교해야 한다.

브라우저 에이전트는 행동의 가역성과 계획 변경 빈도를 본다. 정해진 페이지에서 정보를 추출하거나 반복적인 폼을 채우는 작업은 Luna 후보이고, 출처의 신뢰성을 판단하거나 페이지 오류에 맞춰 계획을 수정해야 한다면 Terra부터 비교하는 편이 낫다. 결제, 게시, 삭제처럼 되돌리기 어려운 행동에는 모델 등급과 무관하게 사람의 승인이나 결정론적 정책이 필요하다.

코딩은 티켓의 불확실성이 경계선이다. 수정할 파일, 예상 동작, 통과해야 할 테스트가 분명한 변경은 Luna나 Terra로 시작해 테스트 실패 때 상향할 수 있다. 원인이 불명확한 운영 장애, 여러 서비스에 걸친 리팩터링, 보안 영향을 포함한 설계처럼 탐색 범위와 실패 비용이 크면 Sol이 더 적합한 출발점이다.

복합 분석은 오답의 파급 범위로 판단한다. 내부 아이디어 탐색이나 검토 가능한 초안은 Terra로 충분할 수 있지만, 상충하는 근거를 조정하고 긴 문서 묶음에서 결론을 도출해야 한다면 Sol을 우선 평가할 이유가 생긴다. 투자·법무·보안처럼 결과의 책임이 큰 분야에서는 모델 선택과 별개로 전문가 검토가 필요하다.

reasoning effort와 상향 라우팅을 분리한다

동일 작업의 reasoning effort별 성공 여부, 토큰 사용량, p95 지연시간을 비교해 최저 통과 설정을 고르는 과정

reasoning effort는 모델 등급과 별개의 조정값이다. effort를 높이면 어려운 문제를 더 검토할 여지가 생기지만 추론 토큰과 지연시간도 늘어날 수 있으므로, Luna max와 Sol low는 가격과 성능이 다른 두 구성으로 평가해야 한다. 공식 개발자 가이드에는 같은 실행 환경에서 GPT-5.6 Sol low가 GPT-5.5 high보다 Agents’ Last Exam 성과가 높았다는 사례도 있다.

초기 평가에서는 단순 변환·분류에 none 또는 low, 일반적인 도구 사용과 코드 수정에 medium, 복합 계획과 고난도 분석에 high 이상을 후보로 둘 수 있다. 이는 공식적인 성능 보장이 아니라 실험 범위를 줄이기 위한 운영 가설이다. 각 구성의 성공률, 작업당 비용, 재시도율, p50·p95 지연시간과 사람의 수정 시간을 같은 조건에서 기록해야 한다.

전사 기본 모델 하나를 정하기보다 상향 조건을 명시하는 편이 효율적이다. 검증 가능한 작업은 Luna로 실행하고 스키마 오류, 테스트 실패, 필수 근거 누락이 발생하면 Terra로 올린다. 요구사항이 모호하거나 여러 도구를 조율해야 하고 실패를 되돌리기 어렵다면 처음부터 Sol로 보내는 방식이다.

결정 원칙은 명확하다. 검증 가능한 반복 작업은 Luna, 품질과 비용을 함께 관리하는 기본 운영은 Terra, 불확실성과 실패 비용이 큰 작업은 Sol에서 평가를 시작한다. 가장 비싼 모델이 아니라 품질 기준을 통과한 구성 중 작업당 총비용이 가장 낮은 모델과 effort가 정답이다.

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0