AI 및 자동화

Gemini가 필요한 장면만 다시 본다…영상 토큰을 최대 88% 줄인 방식

|작성자: QUASA 편집팀|5 분 소요| 3
Gemini가 필요한 장면만 다시 본다…영상 토큰을 최대 88% 줄인 방식

Google이 2026년 9월 1일 Gemini API에 에이전트형 영상 이해를 출시했다. Gemini 3.7 Flash·3.6 Flash·3.5 Flash-Lite가 질문에 필요한 영상 구간과 정보 형태를 동적으로 선택하는 기능으로, AI/TLDR의 출시 정리 도 이날 공개된 지원 모델과 입력 토큰 최대 88%, 분석 비용 최대 66% 절감 수치를 확인했다.

같은 날 Google은 업로드 영상과 YouTube 영상을 대상으로 Gemini API와 Gemini Enterprise Agent Platform에서 기능을 제공하기 시작했다. Google의 공식 발표 에 따르면 개발자는 영상 입력의 processing 값을 agentic으로 지정해 활성화하며, Gemini 앱 전체 사용자와 Ask YouTube 적용은 각각 추후 배포될 예정이다.

고정 1FPS 처리와 무엇이 달라졌나

같은 긴 영상을 전체 1FPS로 추출하는 정적 처리와 필요한 구간만 재검사하는 Gemini 에이전트형 처리 비교

정적 처리에서는 영상 전체에서 기본 초당 1프레임을 추출해 한 번에 컨텍스트에 넣는다. API에서 프레임 속도를 바꿀 수는 있지만, 개발자가 정한 속도가 처리 대상 구간에 일괄 적용된다. 답이 몇 초짜리 장면에만 있어도 영상 길이에 비례해 시각 정보가 늘어나는 구조다.

에이전트형 모드는 질문을 먼저 해석하고 타임라인에서 확인할 구간과 정보 형태를 결정한다. 모델은 필요에 따라 프레임, 음성 또는 자막을 불러오며, 단서가 충분하지 않으면 다른 구간을 탐색하거나 결정적인 부분을 다른 프레임 속도로 다시 살핀다.

요청 흐름을 단순화하면 차이는 다음과 같다.

  1. 정적 모드는 설정된 FPS로 영상 전체의 프레임을 추출한 뒤 질문에 답한다.
  2. 에이전트형 모드는 질문을 기준으로 자막·음성·영상에서 후보 구간을 찾고 필요한 부분만 불러온다.
  3. 확보한 정보가 부족하면 탐색과 재확인을 반복한 뒤 최종 답변을 생성한다.

핵심은 프레임 수를 일률적으로 낮추는 것이 아니다. 영상 전체를 같은 밀도로 처리하지 않으면서도 빠른 동작이나 미세한 변화가 있는 짧은 구간은 더 촘촘하게 검사할 수 있다는 데 있다. 개발자가 구간 검색과 재샘플링 규칙을 외부에서 일일이 구성하던 작업 일부가 모델의 목표 지향적 탐색 과정으로 이동한 셈이다.

지원 모델과 활성화 범위

출시 시점에 명시된 지원 모델은 Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite다. 정적 처리는 계속 기본값이므로 지원 모델을 선택하는 것만으로 에이전트형 탐색이 켜지지는 않는다.

개발자는 업로드한 영상의 URI나 지원되는 YouTube 주소, 자연어 질문과 함께 영상 입력 객체에 processing: agentic을 지정해야 한다. 예를 들어 긴 기조연설에서 주요 발표 세 가지를 찾는다면 모델 이름, 영상 URI, agentic 처리 설정과 질문이 하나의 요청에 들어간다.

처리가 실제로 실행됐는지는 응답의 steps 배열에서도 구분할 수 있다. 모델이 영상 일부를 요청한 processing_call과 해당 구간을 반환한 processing_result가 나타나면 동적 탐색이 사용된 것이다. 여러 영상을 한 요청에 넣을 때는 영상별로 정적 처리와 에이전트형 처리를 다르게 지정할 수도 있다.

API 출시와 소비자용 Gemini 앱 배포는 같은 상태가 아니다. 발표일에 사용할 수 있게 된 경로는 Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform이며, Gemini 앱의 Flash·Flash-Lite 적용은 ‘곧’, Ask YouTube 적용은 향후 수개월로 예고됐다.

88% 절감이 고정 할인율은 아닌 이유

질문 복잡도와 재탐색 깊이에 따라 불러온 영상 정보와 입력 토큰이 달라지는 Gemini API 과금 구조

‘최대 88%’는 모든 요청에 적용되는 보장값이 아니라 Google이 장편 영상 벤치마크에서 제시한 상한이다. Gemini Developer API 가격 안내 는 에이전트형 영상의 토큰 사용량이 전체 영상 길이가 아니라 모델이 실제로 불러온 콘텐츠에 따라 달라지며, 질문 복잡도와 동적 샘플링 깊이가 사용량을 좌우한다고 명시한다.

에이전트형 영상 이해에는 별도의 기능 이용료가 붙지 않고 선택한 Gemini 모델의 표준 토큰 요금이 적용된다. 절감은 정액 할인 때문에 생기는 것이 아니라 답변에 필요하지 않은 영상 정보를 입력에서 제외함으로써 성립한다. 최종 청구액에는 불러온 프레임·음성·자막뿐 아니라 출력과 탐색 과정에서 발생한 토큰도 영향을 준다.

입력 토큰 최대 88% 감소와 분석 비용 최대 66% 감소는 같은 비율로 환산되는 지표가 아니다. 입력량이 크게 줄어도 모델별 단가, 출력 토큰과 내부 탐색량이 남기 때문에 전체 비용 감소율은 다르게 나타날 수 있다. 정확도 최대 7% 향상 역시 절감률과 별도로 측정된 결과다.

따라서 영상 길이가 같아도 질문이 달라지면 사용 토큰이 달라질 수 있다. 한 장면의 위치를 묻는 요청은 좁은 후보 구간만 확인할 수 있지만, 영상 전체의 주장이나 동작을 빠짐없이 비교하는 요청은 더 많은 구간과 반복 탐색을 요구한다.

강의·이상 탐지·순간 검색의 절감 폭

긴 강의 검색, 짧은 이상 탐지, 순간 장면 검색에서 서로 다른 분량을 검사하는 에이전트형 영상 이해

긴 강의에서 특정 개념이 설명된 부분만 찾는 질문은 절감 여지가 크다. 자막이나 음성으로 후보 시점을 좁힌 뒤 주변 화면만 확인할 수 있기 때문이다. 반대로 강의 전체의 주장과 모든 화면 자료를 대조해야 한다면 타임라인의 넓은 범위를 불러와야 해 최대 절감률과 거리가 벌어진다.

이상 탐지는 넓은 시간대를 낮은 밀도로 탐색한 뒤 의심 구간을 높은 FPS로 다시 보는 방식과 맞는다. 정상 상태가 오래 이어지고 이상이 짧게 나타나는 영상이라면 대부분을 세밀하게 처리할 필요가 없다. 이상 징후가 모호하거나 여러 시점에 흩어져 있으면 후보 구간과 재탐색 횟수가 늘어난다.

찰나의 상태 변화를 찾는 순간 검색은 범위 축소와 정밀 검사를 함께 사용한다. 긴 영상 대부분은 후보를 찾는 데 활용하고, 변화가 의심되는 짧은 구간은 1FPS보다 높은 밀도로 다시 확인할 수 있다. 다만 목표 장면을 찾기 전에 여러 후보를 방문해야 한다면 답이 한순간에 있더라도 토큰 사용량은 커진다.

동작이나 물체를 전 구간에서 세는 요청은 또 다르다. 반복되는 사건을 놓치지 않으려면 타임라인 대부분을 확인해야 하므로 건너뛸 수 있는 분량이 줄어든다. 에이전트형 모드가 구간별 샘플링 밀도를 조절할 수는 있어도, 질문 자체가 전 구간 검사를 요구하면 선택적 처리의 이점은 제한된다.

출시 시점에 남은 변수

현재 확인된 범위는 세 Flash 계열 모델, agentic 처리 설정, 업로드 영상과 YouTube 영상 지원, 그리고 Google이 공개한 최대 토큰·비용·정확도 개선치다. 정적 모드는 기본값으로 남아 있어 개발자가 요청별로 에이전트형 처리를 명시해야 한다.

공개 자료만으로는 영상 유형별 평균 절감률이나 같은 질문을 반복했을 때의 사용량 편차를 판단하기 어렵다. 동적 탐색은 짧은 영상에서 첫 응답이 시작되기까지 내부 추론과 구간 호출 시간을 더할 수도 있어, 토큰 감소가 곧바로 모든 요청의 지연 시간 단축을 뜻하지도 않는다.

이번 변화는 영상 길이를 입력량으로 곧바로 환산하던 방식을 질문 중심의 가변 처리로 바꾼다. 실제 절감 폭은 모델이 답을 찾기 위해 몇 개 구간을 어떤 정보 형태와 샘플링 밀도로 불러오느냐에 달렸다. 앞으로 확인할 핵심은 Google이 영상 유형별 세부 벤치마크와 지연 시간 자료를 추가로 공개하는지, 예고한 Gemini 앱과 Ask YouTube 배포가 언제 완료되는지다.

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0