Claude 모델 선택, 최고 등급보다 토큰 단가와 접근권이 먼저다

Claude 모델은 성능 순위부터 볼 일이 아니다. 입력·출력 토큰 비용, 필요한 컨텍스트와 출력 길이, 허용 지연, 계정의 실제 접근권을 먼저 확인한 뒤 품질 기준을 통과하는 후보 중 가장 경제적인 모델을 골라야 한다.
대량의 단순 처리에는 Haiku 4.5, 일상적인 코딩과 분석에는 Sonnet 5가 비용 중심의 출발점이 될 수 있다. 복잡한 에이전트 작업은 Opus 5로 올리고, Fable 5.1은 높은 effort의 Opus로도 평가 기준을 충족하지 못하는 장기 실행 작업에 검토하는 순서가 합리적이다. Mythos 5.1은 성능과 별개로 초대받은 Project Glasswing 참여자만 후보에 넣을 수 있다.
비용은 요청 횟수가 아니라 입력과 출력의 합으로 계산한다

Claude API의 기본 모델 비용은 처리한 입력 토큰과 생성한 출력 토큰에 각각 다른 요율을 곱해 계산한다. 시스템 지침, 대화 기록, 도구 정의, 첨부한 원문이 입력을 늘리고, 긴 답변은 더 비싼 출력 토큰을 늘린다. 모델 이름만 비교해서는 실제 작업비를 알 수 없는 이유다.
Claude Platform 공식 가격표 에서 백만 토큰당 기본 입력·출력 가격은 Fable 5.1과 Mythos 5.1이 10달러·50달러, Opus 5가 5달러·25달러, Sonnet 5가 2달러·10달러, Haiku 4.5가 1달러·5달러다. 같은 표는 Fable 5.1과 Mythos 5.1의 캐시 읽기를 백만 토큰당 0.25달러로 제시하며, Batch API에는 입력과 출력 모두 50% 할인된 요율을 적용한다.
조건부로 입력 10만 토큰과 출력 5천 토큰을 처리한다고 가정하면 기본 요율 기준 비용은 Fable 5.1이 1.25달러, Opus 5가 0.625달러, Sonnet 5가 0.25달러, Haiku 4.5가 0.125달러다. 같은 요청을 1만 번 처리하면 각각 1만2500달러, 6250달러, 2500달러, 1250달러가 된다. 이는 캐시, 배치, 데이터 레지던시, 서버 측 도구 비용을 제외한 단순 계산이므로 실제 예산에는 해당 항목과 재시도 비용을 더해야 한다.
반복되는 대규모 시스템 지침이나 동일 문서를 자주 보내는 서비스에서는 캐시 적중률이 선택을 바꿀 수 있다. 그러나 낮은 캐시 읽기 요율만 보고 Fable을 고르면 최초 캐시 쓰기와 출력, 적중 실패 비용을 놓치게 된다. 따라서 캐시 단가와 전체 작업비 를 구분해 요청 단위의 총비용을 계산해야 한다.
컨텍스트와 최대 출력은 별개의 제한이다

컨텍스트 윈도우는 한 요청에서 모델이 함께 다룰 수 있는 입력과 대화 기록 등의 범위다. 최대 출력은 그 요청에서 생성할 수 있는 결과의 상한이므로, 긴 원문을 넣을 수 있다고 해서 같은 길이의 결과를 받을 수 있다는 뜻은 아니다.
Fable 5.1 공식 모델 비교 는 Fable 5.1·Opus 5·Sonnet 5에 100만 토큰 컨텍스트와 12만8000토큰 최대 출력을, Haiku 4.5에는 20만 토큰 컨텍스트와 6만4000토큰 최대 출력을 제시한다. 비교 지연은 Fable이 ‘Slower’, Opus가 ‘Moderate’, Sonnet이 ‘Fast’, Haiku가 ‘Fastest’로 구분된다. 이는 절대 응답 시간을 보장하는 수치가 아니므로 실제 지연은 사용하는 프롬프트와 도구, 동시 요청 조건에서 따로 측정해야 한다.
20만 토큰 안에 들어오는 요약이나 추출이라면 Haiku의 작은 컨텍스트가 곧 결격 사유는 아니다. 반대로 여러 저장소의 코드나 대규모 문서 묶음을 한 요청에서 함께 참조해야 한다면 100만 토큰 모델이 후보가 된다. 다만 검색, 청킹, 중복 제거로 관련 입력만 보내면 넓은 컨텍스트가 필요했던 작업도 더 낮은 단가의 모델로 처리할 여지가 생긴다.
문서 요약과 대량 처리는 Haiku에서 먼저 검증한다
정형 필드 추출, 대량 분류, 짧거나 중간 길이의 문서 요약처럼 반복량이 많고 판정 규칙이 분명한 작업은 Haiku 4.5부터 평가할 만하다. 네 모델 중 기본 토큰 가격이 가장 낮고 공식 비교 지연도 가장 짧다. 입력이 20만 토큰 안에 들어오고 품질 기준을 통과한다면 상위 모델의 더 넓은 처리 범위를 구입할 이유가 적다.
여기서 품질 기준은 평균적인 샘플 몇 개가 아니라 실제 실패 비용을 반영해야 한다. 긴 문서, 표가 많은 자료, 모호한 분류 경계, 답변을 거부해야 하는 입력을 평가 세트에 포함하고 핵심 사실 누락률이나 필드 정확도를 측정한다. Haiku가 기준을 넘지 못한 요청만 Sonnet으로 재처리하는 계단식 라우팅은 가능하지만, 재호출 비용과 늘어난 지연까지 포함해야 처음부터 Sonnet을 쓰는 경우와 공정하게 비교할 수 있다.
야간 분류처럼 즉시 응답할 필요가 없는 작업은 배치 할인으로 단가를 더 낮출 수 있다. 반면 사용자가 화면에서 기다리는 요약 기능은 비용 차이보다 체감 지연이 중요할 수 있다. 같은 문서 작업이라도 처리량, 응답 시간, 재처리 가능성에 따라 선택이 달라진다.
코딩 에이전트와 대용량 분석은 실패 유형에 따라 올린다

Sonnet 5는 100만 토큰 컨텍스트와 12만8000토큰 최대 출력, ‘Fast’로 표시된 비교 지연을 Fable 5.1의 5분의 1인 기본 토큰 단가와 결합한다. 일상적인 코드 생성, 여러 파일의 수정안 작성, 장문 자료의 근거 종합에서는 먼저 Sonnet으로 성공률과 작업당 비용을 측정하는 편이 합리적이다.
복잡한 저장소 변경, 여러 시간 이어지는 자율 코딩, 다단계 도구 사용에서 Sonnet이 평가 기준을 반복적으로 놓친다면 Opus 5가 다음 후보다. Opus의 기본 입력·출력 단가는 Fable의 절반이므로, 전체 요청을 곧바로 최고 등급에 보내기보다 실패 비용이 큰 작업과 재시도 요청에 집중할 수 있다.
Fable 5.1은 까다로운 추론과 장기 실행 에이전트 작업을 겨냥한 모델이며, 공식 설명도 높은 effort의 Opus 5 평가가 부족할 때 사용하도록 안내한다. 보안 연구나 다단계 조사라는 업무 이름만으로 Fable이 필요하다고 단정할 수는 없다. 동일한 입력, 도구, 성공 기준으로 Opus와 비교하고 추가 성공률이 두 배의 토큰 단가와 더 느린 비교 지연을 상쇄할 때만 올리는 것이 타당하다.
Mythos는 성능표보다 초대 여부가 먼저다
Mythos 5.1은 모델 ID만 바꾸면 누구나 사용할 수 있는 일반 상위 옵션이 아니다. Mythos 5.1 공식 안내 는 이 모델을 Project Glasswing의 일부로 별도 제공되는 초대 전용 모델로 규정하고, Fable 5.1과 사양 및 가격이 같다고 설명한다. 접근하려면 Anthropic, AWS 또는 Google Cloud 계정팀에 문의해야 한다.
초대가 확인되지 않은 조직의 결정표에서는 Mythos를 ‘사용 불가’로 표시하는 편이 정확하다. 향후 접근 가능성만 전제로 제품 구조나 조달 일정을 정하면 불확실성이 커진다. 현재 호출할 수 있는 Haiku·Sonnet·Opus·Fable로 품질 기준과 대체 경로를 설계한 뒤, 접근권이 생겼을 때 Mythos를 별도 평가해야 한다.
작업별 결정표는 네 가지 문턱으로 완성된다
첫째, 입력과 필요한 출력이 모델 한도에 들어오는지 본다. 둘째, 사용하는 API나 클라우드 계정에서 실제로 호출할 수 있는지 확인한다. 셋째, 허용 지연 안에서 작업별 품질 기준을 통과하는지 측정한다. 넷째, 입력·출력·캐시·재시도·추가 도구를 포함한 월간 비용이 예산에 맞는지 계산한다.
- 문서 요약·분류: 입력이 20만 토큰 이내라면 Haiku 4.5부터 평가하고, 중요한 누락이나 분류 오류가 허용치를 넘을 때 Sonnet 5로 올린다.
- 일반 코딩 에이전트: Sonnet 5에서 시작하고, 복잡한 변경이나 반복 실패 요청만 Opus 5로 보낸다.
- 대용량 분석: 100만 토큰 컨텍스트가 실제로 필요하면 Sonnet 5와 Opus 5를 비교하되, 먼저 검색과 중복 제거로 입력을 줄인다.
- 장기 실행·고난도 연구: 높은 effort의 Opus 5가 평가 목표를 충족하지 못할 때 Fable 5.1의 추가 비용과 지연을 검증한다.
- Project Glasswing 업무: 초대와 계약상 접근권이 확인된 조직만 Mythos 5.1을 후보에 넣는다.
결국 모델 선택은 하나의 최고 모델을 정하는 일이 아니라 요청마다 통과해야 할 문턱을 설계하는 일이다. 가장 저렴한 모델이 품질 기준을 충족하면 그대로 사용하고, 실패가 확인된 작업만 상위 모델로 보내야 한다. 이 순서에서 최고 등급은 출발점이 아니라 비용과 접근권을 통과한 뒤 선택하는 예외가 된다.
함께 읽기:
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.