AI 및 자동화

Gemini 3.8 Flash는 같은 가격에 더 깊게 생각한다…토큰은 늘 수 있다

|작성자: QUASA 편집팀|5 분 소요| 1
Gemini 3.8 Flash는 같은 가격에 더 깊게 생각한다…토큰은 늘 수 있다

구글이 2026년 9월 2일 Gemini 3.8 Flash를 출시했다. 구글의 출시 발표 는 유료 API 도입 단가를 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러로 제시했다. 이는 Gemini 3.7 Flash와 같은 수준이지만, 복잡한 작업과 높은 추론 강도에서는 추가 추론 단계와 반복적인 도구 호출로 토큰 사용량이 늘 수 있다고 구글은 설명했다.

따라서 이번 출시는 ‘단가 동결’과 ‘요청당 비용 동결’을 구분해서 봐야 하는 소식이다. Ars Technica의 9월 2일 보도 도 API 제공 개시와 연말까지 적용되는 같은 도입 단가를 확인했다. 한국 개발자가 3.7 Flash에서 전환할 때는 가격표뿐 아니라 실제 입력량, 출력·추론 토큰, 도구 호출 횟수와 응답 지연을 함께 비교해야 한다.

같은 가격은 2026년 말까지의 도입 단가다

Gemini 3.8 Flash의 2026년 도입 단가와 2027년 예정 표준 단가를 비교한 비용 검토

현재 가격은 영구적인 표준 단가가 아니다. Gemini 3.8 Flash에는 2026년 12월 31일까지 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러가 적용된다. 2027년 1월 1일부터 예정된 표준 단가는 각각 1.50달러와 7.50달러다.

도입 단가만 놓고 보면 3.7 Flash에서 3.8 Flash로 이동해도 토큰 한 개의 가격은 오르지 않는다. 그러나 청구액은 단가와 처리 토큰 수를 곱한 값이므로, 새 모델이 한 요청에서 더 많은 출력·추론 토큰을 사용하면 총비용은 커진다. 같은 가격이라는 표현이 보장하는 범위는 단위당 요금까지다.

조건부 계산으로 차이를 볼 수 있다. 한 요청이 입력 10만 토큰과 출력·추론 2만 토큰을 쓴다면 도입 단가 기준 비용은 입력 0.075달러와 출력 0.075달러를 합친 0.15달러다. 같은 입력에서 출력·추론 사용량이 4만 토큰으로 늘면 비용은 0.225달러가 된다. 단가는 같아도 요청당 총액은 50% 증가한다.

이 계산은 3.8 Flash가 모든 요청에서 두 배의 토큰을 쓴다는 뜻이 아니라, 사용량 변화가 비용에 미치는 영향을 보여주는 가정이다. 구글은 작업 종류별로 토큰이 얼마나 증가하는지에 관한 단일 비율을 공개하지 않았다. 실제 예산에는 평균값뿐 아니라 긴 작업이 몰렸을 때의 상한도 반영해야 한다.

‘더 깊게 생각한다’는 말은 실행 경로가 길어질 수 있다는 뜻이다

Gemini 3.8 Flash의 추론 강도별 토큰 사용량과 작업 성공 결과 비교

Gemini 3.8 Flash는 복잡한 다단계 목표에서 문제를 더 작은 추론 단계로 나누고, 도구를 반복 호출하며, 결과를 검증하도록 설계됐다. 최종 답변이 이전과 비슷한 길이여도 이 과정에 쓰이는 토큰과 처리 시간은 달라질 수 있다. 특히 high 추론 강도는 정확성과 도구 조율을 우선하는 대신 사용량과 지연 시간이 커질 가능성이 있다.

지원되는 추론 강도는 low, medium, high이며 기본값은 medium이다. low는 지연 시간과 토큰 사용을 줄이는 방향이고, high는 수학이나 복잡한 다단계 작업에서 추론과 도구 조율을 최대화하는 설정이다. minimal은 지원되지 않으며 전달하면 오류가 발생한다.

이 때문에 기존 코드에서 모델 ID만 바꾸는 방식은 비용과 동작을 그대로 유지한다고 볼 수 없다. 3.7 Flash 호출에서 추론 설정을 생략했다면 3.8 Flash에서는 기본 medium이 적용된다. 반대로 low를 명시하면 일상적인 작업의 토큰 소비를 줄일 수 있지만, 결과 품질과 성공률이 기존 기준을 충족하는지는 별도로 확인해야 한다.

더 많은 추론 토큰이 반드시 전체 시스템 비용 증가로 이어지는 것도 아니다. 첫 응답의 성공률이 높아져 재시도나 사람의 검수가 줄면 최종 비용이 낮아질 수 있다. 그러나 이는 구글의 가격표만으로 판단할 수 없는 서비스별 결과다. 동일한 대표 요청으로 토큰, 지연 시간, 성공 여부와 재시도 횟수를 함께 비교해야 비용 효과를 구분할 수 있다.

안정 모델이지만 기존 Flash 구성과 완전히 같지는 않다

Gemini 3.8 Flash 전환 과정에서 지원 입력·도구와 비지원 기능을 점검하는 API 호환성 검토

Gemini API 모델 사양 은 2026년 9월 2일 갱신됐으며, 안정 모델 ID를 gemini-3.8-flash로 명시한다. 입력 한도는 1,048,576토큰, 최대 출력은 65,536토큰이다. 텍스트·이미지·영상·오디오·PDF를 입력으로 받고 텍스트를 출력한다.

지원 기능에는 캐싱, 코드 실행, 파일 검색, 함수 호출, Google Maps 그라운딩, 검색 그라운딩, 구조화된 출력, URL 컨텍스트와 추론이 포함된다. 컴퓨터 사용은 프리뷰 상태다. 반면 오디오 생성, 이미지 생성과 Live API는 지원되지 않는다.

따라서 다중 모달 입력이나 함수 호출을 쓰는 기존 서비스는 이동할 수 있지만, 실시간 양방향 음성 세션이나 모델 자체의 미디어 생성에 의존하는 구성은 같은 모델 ID 교체만으로 유지되지 않는다. 컴퓨터 사용 기능도 안정 기능과 같은 전제로 운영 환경에 넣기 어렵다. 지원 여부와 제공 상태를 분리해 판단해야 한다.

마이그레이션 과정에서는 설정 형식도 확인할 필요가 있다. 추론 제어는 thinking_budget이 아니라 thinking_level을 사용하며, temperature·top_p·top_k 같은 샘플링 매개변수는 제거 대상이다. 여러 차례의 함수 호출을 사용하는 서비스라면 토큰 비용뿐 아니라 외부 API 요금과 호출 실패 처리도 총원가에 포함된다.

전환 판단의 핵심은 모델별 단가보다 요청별 분포다

비교 대상은 하나의 전체 평균보다 난이도가 다른 실제 요청 묶음이어야 한다. 짧은 분류와 요약, 일반 코드 생성, 여러 파일을 다루는 장기 코딩, 외부 도구가 필요한 에이전트 작업은 추론 경로가 다르다. 이들을 한 평균으로 합치면 일부 복잡한 요청에서 발생하는 토큰 급증을 놓칠 수 있다.

시험 배포에서는 같은 입력을 low, medium, high로 처리한 뒤 입력 토큰, 출력·추론 토큰, 도구 호출 수, 지연 시간, 성공 여부와 재시도 횟수를 요청별로 기록하는 편이 적절하다. 평균과 상위 사용량 구간을 함께 보면 트래픽이 몰리거나 어려운 요청이 이어질 때 비용 상한과 타임아웃이 어떻게 작동하는지 판단할 수 있다.

  • 가격 기간: 2026년 말까지의 도입 단가와 2027년부터 예정된 표준 단가를 분리해 계산한다.
  • 추론 강도: 기본 medium을 유지할지, 작업별로 low 또는 high를 명시할지 정한다.
  • 사용량 상한: 입력·출력·추론 토큰과 도구 호출 횟수에 각각 중단 조건을 둔다.
  • 기능 호환성: Live API와 미디어 생성의 비지원, 컴퓨터 사용의 프리뷰 상태를 현재 구성과 대조한다.
  • 성공 기준: 정답률만이 아니라 재시도율, 도구 호출 성공률, 지연 시간과 검수량을 함께 비교한다.

현재 확인된 상태는 Gemini 3.8 Flash가 안정 모델로 제공되고 3.7 Flash도 계속 지원된다는 것이다. 두 모델의 도입 단가는 같지만, 구글은 복잡한 작업에서 3.8 Flash가 더 많은 토큰을 사용할 수 있다는 경계를 분명히 했다. 아직 공개되지 않은 것은 작업 유형별 평균 증가율이므로, 실제 요청당 비용은 각 서비스의 추론 강도와 실행 기록으로 확인해야 한다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0