스타트업 및 비즈니스

Claude Fable 5.1 캐시는 75% 싸졌다…작업비는 반대일 수도 있다

|작성자: QUASA 편집팀|5 분 소요| 2
Claude Fable 5.1 캐시는 75% 싸졌다…작업비는 반대일 수도 있다

Anthropic의 공식 제품 안내 에 따르면 회사는 2026년 9월 1일 Claude Fable 5.1을 일반 출시하고, 기본 입력과 출력 가격을 각각 100만 토큰당 10달러와 50달러로 유지하면서 캐시 읽기 단가를 1달러에서 0.25달러로 75% 낮췄다. 모델은 Claude Platform과 주요 클라우드, Pro·Max·Team·Enterprise 요금제에서 제공된다.

직접적인 답은 명확하다. 75% 인하는 전체 API 청구액이 아니라 캐시에서 다시 읽은 토큰에만 적용되므로, 동일한 문맥을 많이 재사용하는 에이전트는 큰 혜택을 받지만 출력이 길거나 새 입력이 많은 작업에서는 총비용이 거의 줄지 않거나 Fable 5보다 높아질 수 있다.

가격표에서 달라진 것은 캐시 읽기다

Claude Fable 5.1 청구 내역에서 캐시 읽기만 인하되고 새 입력과 출력 단가는 유지된 구조

Fable 5.1의 새 입력과 생성 출력에는 구버전과 같은 단가가 적용된다. 가격이 낮아진 부분은 모델이 앞서 처리해 저장한 프롬프트 접두부, 코드 저장소 문맥, 대화 기록 등을 후속 호출에서 다시 불러오는 캐시 읽기다. 사용량이 같다는 전제에서 Fable 5와의 직접적인 차이는 캐시 읽기 100만 토큰마다 0.75달러다.

이 구조에서는 캐시 적중이 없는 단발성 호출의 비용이 가격표 변경만으로 낮아지지 않는다. 반대로 긴 시스템 지침과 같은 코드 문맥을 여러 차례 재사용하는 에이전트 작업에서는 매 호출마다 기존 문맥을 새 입력 가격으로 처리하지 않아도 되므로 할인 대상이 커진다. 캐시는 모델 이름만 선택한다고 자동으로 같은 비율의 절감을 보장하는 정액 할인이 아니다.

Anthropic이 제시한 전형적 워크로드의 예상 절감 폭은 약 25%, 에이전트성이 강한 워크로드는 최대 약 45%다. 이 수치는 회사가 가정한 사용 패턴에 따른 추산이며 개별 고객의 보장 할인율은 아니다. 실제 청구액에는 새 입력, 캐시 읽기, 캐시 생성, 출력이 각각 얼마나 포함됐는지와 반복 호출 사이에 재사용 가능한 접두부가 유지됐는지가 함께 반영된다.

캐시 비중별 총액 절감률은 이렇게 달라진다

동일한 Claude Fable 5.1 작업에서 캐시 재사용 비중이 높아질수록 총비용 절감 폭이 커지는 비교

단가 변화의 범위를 보기 위해 조건을 고정한 가상 계산을 할 수 있다. 한 작업이 읽기 입력 100만 토큰과 출력 2만 토큰을 사용하고, 캐시 생성 비용은 계산에서 제외한다고 가정하자. 출력 비용은 두 버전 모두 1달러지만 읽기 입력 중 캐시가 차지하는 비중에 따라 최종 절감률은 크게 달라진다.

  • 캐시 비중이 0%이면 새 입력 10달러와 출력 1달러를 합쳐 Fable 5와 Fable 5.1 모두 11달러다.
  • 캐시 비중이 50%이면 총비용은 6.50달러에서 6.125달러로 내려가 약 5.8% 절감된다.
  • 캐시 비중이 80%이면 3.80달러에서 3.20달러로 낮아져 절감률은 약 15.8%다.
  • 캐시 비중이 95%이면 2.45달러에서 1.7375달러로 줄어 약 29.1% 절감된다.

캐시가 입력의 95%인 마지막 조건에서도 총액은 75% 줄지 않는다. 할인되지 않는 새 입력과 출력 비용이 남아 있기 때문이다. 같은 캐시 비중이라도 생성 결과가 길어지면 100만 토큰당 50달러인 출력의 비중이 커지면서 전체 절감률은 더 낮아진다.

반대 방향도 성립한다. 출력은 짧지만 거대한 공통 문맥을 반복해서 읽는 작업은 전체 청구액에서 캐시 읽기가 차지하는 몫이 커져 새 가격의 효과가 두드러진다. 따라서 비용 비교에는 단순 캐시 적중률뿐 아니라 각 항목이 기존 청구액에서 차지했던 금액 비중이 필요하다.

최대 노력 평가에서는 오히려 20% 비쌌다

최대 노력 평가에서 Claude Fable 5.1의 긴 출력 비용이 캐시 절감액을 넘어선 결과

Artificial Analysis의 사전 평가 에서 최대 노력으로 실행한 Fable 5.1은 Intelligence Index 작업당 3.76달러를 사용해 Fable 5의 3.14달러보다 20% 비쌌으며, 약 1.7배 많은 출력 토큰을 생성한 것이 주된 원인으로 제시됐다. 이 평가에서 낮아진 캐시 단가는 작업당 약 1.40달러를 절약했지만, 출력 증가분이 그 효과를 상쇄했다.

캐시 인하가 작동하지 않은 결과는 아니다. 평가 측 계산상 이전 캐시 단가를 적용했다면 Fable 5.1의 작업당 비용은 약 5.16달러가 됐을 것으로 추산된다. 새 단가 덕분에 자체 비용은 낮아졌지만, 모델이 수행 과정에서 사용한 출력량까지 달라졌기 때문에 최종 금액은 구버전보다 높게 나타났다.

같은 평가에서 xhigh 노력 설정의 Fable 5.1은 작업당 2.72달러로 최대 노력보다 1.04달러 저렴했다. 다만 노력 설정에 따라 계산량과 평가 점수도 달라지므로 두 금액은 동일한 품질을 고정한 요금 비교가 아니다. 서버 측 안전 폴백도 전체 출력 토큰의 약 4%를 처리해 평가 구성의 일부로 작용했다.

캐시 중심 코딩 평가에서는 5.84달러가 2.68달러로 줄었다

Cognition의 FrontierCode 1.1 Extended 결과 에서는 중간 노력 설정의 Fable 5.1 작업당 비용이 Fable 5의 5.84달러에서 2.68달러로 54% 낮아졌고, 같은 표의 Opus 5 비용 3.51달러도 밑돌았다. Cognition은 Fable 5.1의 대표 작업 비용을 캐시 입력 3.08달러, 캐시되지 않은 입력 0.84달러, 출력 1.07달러로 나눠 제시한 뒤 캐시 읽기 단가 변경으로 캐시 부분이 0.77달러까지 낮아졌다고 계산했다.

이 환경에서는 작업이 저장된 코드와 이전 실행 문맥을 계속 다시 읽기 때문에 캐시 읽기가 비용의 중심이었다. 동일 작업에 이전 단가를 적용한 약 4.99달러가 새 단가에서는 2.68달러가 됐다는 계산도 이 차이를 보여준다. 기본 입력과 출력 가격이 그대로여도 과금 대상 토큰의 구성이 캐시 중심이면 전체 작업비가 크게 떨어질 수 있다.

두 외부 결과는 같은 실험의 상반된 재현 결과가 아니다. Artificial Analysis는 여러 능력 평가를 결합한 Intelligence Index와 최대 노력 설정을 사용했고, Cognition은 코드 변경의 병합 가능성을 평가하는 FrontierCode 환경과 Devin 실행 구성을 사용했다. 작업 종류, 노력 설정, 출력 길이, 캐시 비중, 에이전트 하네스가 모두 달라 서로 다른 비용 구조를 관찰한 것이다.

일반 출시 이후 확인해야 할 것은 실제 작업 구성이다

Fable 5.1은 일반 제공되지만 같은 시기에 소개된 Claude Mythos 5.1의 접근 범위는 다르다. Mythos 5.1은 사이버보안과 생명과학 같은 분야의 검증된 조직을 위한 신뢰 접근 프로그램에 제한돼 있다. Fable 5.1의 일반 출시를 Mythos 5.1까지 모든 이용자에게 개방됐다는 의미로 해석해서는 안 된다.

안전장치가 개입하는 작업에서는 실제 응답을 생성한 모델도 비용 비교 조건에 포함된다. 일부 Claude 제품은 사이버보안이나 생물학 관련 요청이 감지되면 Opus 계열 모델로 경로를 바꾸며, API 고객은 별도의 폴백 설정을 사용해야 한다. 폴백이 포함된 벤치마크와 단일 모델만 실행한 비용을 같은 조건으로 간주하기 어려운 이유다.

현재 확인된 결론은 캐시 읽기 단가의 75% 인하가 분명한 가격 변화인 동시에, 작업당 비용 인하를 보장하는 수치는 아니라는 것이다. 실제 운영 환경에서 절감 폭을 판단하려면 Fable 5와 Fable 5.1의 동일 작업을 기준으로 캐시 읽기 금액, 새 입력, 출력 토큰, 노력 설정을 함께 비교해야 한다. 출시 직후 나온 외부 평가는 비용이 내려갈 수 있는 조건과 반대로 오를 수 있는 조건을 각각 보여줬지만, 다양한 실제 서비스에서 어느 결과가 더 일반적인지는 아직 축적된 운영 데이터가 부족하다.

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0