Muse Spark 1.3은 도구 호출을 20% 줄였다…최대 추론은 아직

Meta는 2026년 9월 2일 Muse Spark 1.3을 Muse Code와 Meta Model API에 출시했다. Meta의 공식 발표 에 따르면 사내 엔지니어들의 코딩 작업 비교에서 이전 버전보다 도구 호출은 약 20%, 토큰은 약 25% 줄었다. 9월 5일 현재 같은 페이지는 최대 추론 버전도 두 경로에서 이용할 수 있다고 안내한다.
다만 출시 시점의 제공 범위는 달랐다. Axios의 9월 2일 보도 는 Muse Spark 1.3이 당일 Muse Code와 Meta API에 배포됐지만 최대 추론 버전은 추가 안전성 시험 뒤 나올 예정이라고 전했다. 따라서 제목의 ‘최대 추론은 아직’은 출시 당일의 상태를 가리키며, 최신 이용 가능 상태를 뜻하지는 않는다.
20% 감소는 Meta 내부 코딩 비교의 결과다

도구 호출과 토큰 감소는 Muse Spark 1.3의 효율 변화를 보여주는 핵심 수치지만, 모든 작업에서 재현된 독립 벤치마크 평균은 아니다. 비교 주체는 Meta 엔지니어들이고 대상은 Muse Spark 1.2와 1.3을 이용한 코딩 작업이다. Meta는 1.3이 불필요한 대화 차례를 줄이고 더 간결한 코드를 작성하면서 작업을 더 빠르고 효율적으로 수행했다고 설명했다.
여기서 도구 호출은 에이전트가 파일을 읽거나 검색하고, 명령을 실행하거나 테스트를 돌리는 등 외부 기능을 요청하는 횟수를 뜻한다. 동일한 결과에 도달하는 데 호출이 적게 필요하다면 각 호출의 대기 시간과 과금, 실패 또는 재시도 가능성을 낮출 여지가 있다. 토큰 감소도 긴 코딩 세션의 처리량과 비용에 영향을 줄 수 있다.
그러나 ‘약 20%’와 ‘약 25%’를 API 사용료의 동일한 비율 감소로 곧바로 환산할 수는 없다. 실제 비용은 입력과 출력 토큰의 구성, 캐시 사용량, 추론 강도, 도구별 요금과 재시도 횟수에 따라 달라진다. Meta가 공개한 것은 자사 코딩 비교의 사용량 변화이지, 모든 에이전트 환경의 최종 비용 절감률이 아니다.
1.3은 효율만 낮춘 모델로 소개되지 않았다. Meta는 장시간 작업에서 여러 흐름을 한 대화 안에 유지하고, 도구로 상충하는 자료를 확인하며, 계획에서 빠진 부분을 보완하도록 훈련했다고 밝혔다. 모호한 요청에는 확인 질문을 하고 중대한 행동에 앞서 사용자 승인을 구하도록 조정했다는 설명도 포함됐다.
이 변화는 단순히 호출 횟수를 제한하는 것과 구별해야 한다. 필요한 검증까지 생략하면 호출 수는 감소해도 결과의 정확성과 완결성이 떨어질 수 있다. Meta의 주장은 작업 수행 능력을 유지하거나 높이면서 불필요한 호출과 장황한 출력을 줄였다는 것이지만, 세부 작업 목록과 분산·오차 범위는 공개 발표에 제시되지 않았다.
기본 모델과 최대 추론은 다른 일정으로 배포됐다

9월 2일 즉시 제공된 것은 Muse Spark 1.3과 기존부터 지원하던 추론 설정이었다. 최대 추론은 더 많은 추론 연산을 사용하는 별도 설정으로, 추가 안전성 시험이 끝날 때까지 배포가 미뤄졌다. 모델 버전의 출시와 그 모델이 지원하는 모든 추론 설정의 출시는 같은 사건이 아니었던 셈이다.
이 구분은 발표 당시 성능표와 실제 API에서 선택할 수 있는 구성을 대조할 때 중요했다. 개발자는 Muse Spark 1.3이라는 모델 이름을 호출할 수 있었지만, 발표 자료의 일부 최고 결과에 사용된 최대 추론 설정을 곧바로 일반 환경에서 선택할 수는 없었다. 당시 이용 가능한 상위 설정은 xhigh였다.
현재는 공식 발표문 첫머리가 최대 추론 버전도 Muse Code와 Meta Model API에서 제공된다고 명시한다. 다만 페이지에는 해당 문구의 수정 시각이나 최대 추론이 실제로 추가된 날짜가 표시되지 않는다. 공개 자료로 확정할 수 있는 범위는 9월 2일에는 추가 시험 뒤 제공될 예정이었고, 9월 5일에는 공식 안내가 이용 가능으로 바뀌었다는 데까지다.
이 때문에 출시 당일 기사와 현재 제품 안내는 서로 다른 시점의 상태를 기록한다. 초기 보도가 틀렸다기보다 짧은 기간에 배포 단계가 변경된 것이다. 특정 날짜의 사용 가능성을 설명할 때는 모델명뿐 아니라 추론 설정과 확인 시점을 함께 적어야 혼동을 피할 수 있다.
최고 성능표는 당시 이용 가능한 설정과 달랐다

최대 추론의 보류가 주목받은 이유는 Meta가 공개한 일부 최고 성능 수치가 이 설정에서 나왔기 때문이다. VentureBeat의 설정별 분석 에 따르면 GDPval-AA v2에서 max는 1,754 Elo, xhigh는 1,709였고 OSWorld 2.0에서는 각각 66.9와 57.2를 기록했다. 보도 당시 max는 제한된 파트너 미리보기에서 평가됐으며 일반 API 제공자는 표시되지 않았다.
최대 추론이 모든 평가에서 더 높은 결과를 낸 것은 아니다. 같은 분석에서 DeepSearchQA는 두 설정이 89.4로 같았고, Terminal-Bench 2.1은 xhigh가 89.2로 max의 88.8을 소폭 앞섰다. ‘max’라는 이름만으로 모든 코딩·에이전트 작업에서 일관된 우위를 보장한다고 해석할 수 없는 결과다.
설정별 차이와 별개로 Meta의 공식 평가 방법에도 주의할 조건이 있다. 벤치마크에 따라 자사 API, 모델별 기본 코딩 도구, 제3자 하네스 또는 공통 내부 프레임워크가 사용됐다. 일부 결과는 Meta가 직접 실행했고 일부는 공식 리더보드나 다른 모델 제공자의 자체 보고에서 가져왔기 때문에, 하나의 통일된 환경에서 모든 모델을 대조한 순위로 보면 안 된다.
따라서 출시 직후의 성능을 기록할 때는 Muse Spark 1.3이라는 버전명과 xhigh 또는 max라는 추론 설정을 함께 밝혀야 한다. max 결과를 9월 2일 즉시 배포된 구성의 성능으로 소개하면 이용 가능 범위가 과장된다. 반대로 xhigh 결과만으로 최대 추론의 효과를 일반화하면 설정 간 차이를 놓치게 된다.
안전성 개선과 추가 시험은 공개 범위가 다르다
Meta는 Muse Spark 1.3이 적대적 입력과 프롬프트 주입에 대한 저항력을 높였다고 주장했다. 되돌릴 수 없는 행동을 더 잘 식별하고 그에 맞춰 처리하도록 조정했다는 설명도 내놨다. 외부 도구를 장시간 사용하는 에이전트에서는 중요한 변화지만, 발표문은 공격 성공률이나 1.2 대비 감소 폭처럼 독립적으로 비교할 수 있는 수치를 제공하지 않았다.
최대 추론에 추가 안전성 시험이 필요했던 구체적인 위험 항목과 통과 기준도 공개되지 않았다. 따라서 출시 보류를 특정 취약점의 발견으로 확대 해석할 근거는 없다. 반대로 현재 제공 전환만으로 모든 위험 검증이 끝났거나 모든 사용 환경에서 안전성이 보장됐다고 단정할 수도 없다.
확인된 사실은 Meta가 출시 순서를 나눴고, 최대 추론 제공 전에 추가 시험을 거쳤다는 것이다. Muse Spark 1.3의 일반 배포와 최대 추론 설정의 배포는 별도 단계였으며, 그 사이 공식 페이지의 안내도 변경됐다. 현재 Muse Code와 Meta Model API에서는 공식 안내상 최대 추론까지 이용할 수 있다.
아직 공개되지 않은 것은 내부 코딩 비교의 전체 과제 구성과 반복 횟수, 도구 호출·토큰 감소의 분포, 최대 추론 안전성 시험의 세부 결과다. 이 정보가 나오기 전까지 20%와 25%는 Meta가 제한된 비교 조건에서 제시한 효율 지표로 읽어야 한다. 이번 발표의 가장 정확한 요약은 기본 모델은 9월 2일 먼저 배포됐고, 당시 기다려야 했던 최대 추론은 이후 공식 제공 상태로 전환됐다는 것이다.
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.