AI 및 자동화

표와 그림이 많은 PDF RAG, 기본 파서만 쓰면 정보가 사라진다

|작성자: QUASA 편집팀|5 분 소요
표와 그림이 많은 PDF RAG, 기본 파서만 쓰면 정보가 사라진다

Amazon Bedrock Knowledge Bases에 PDF를 적재할 때는 문서 형식부터 나눠야 한다. 본문 텍스트만 필요하면 기본 파서, 이미지로 저장된 문자와 표를 복원해야 하면 Amazon Textract 전처리, 그림·차트·표까지 검색 근거로 삼아야 하면 Amazon Bedrock Data Automation 또는 파운데이션 모델 파서가 맞다.

기본 파서는 PDF에서 텍스트만 출력한다. 원본 페이지에 보이는 셀의 행·열 관계나 차트의 축·범례처럼 배치와 시각 요소가 의미를 만드는 정보는 텍스트 출력만으로 보존된다고 장담할 수 없다. 모든 문서에 고급 파서를 적용하기보다 질문에 필요한 정보가 어디에 있는지 기준으로 데이터 소스와 처리 경로를 분리해야 정확도와 비용을 함께 관리할 수 있다.

PDF를 텍스트·스캔·복합 문서로 나눈다

텍스트 PDF, 스캔 PDF, 표·차트 중심 PDF를 적재 전에 구분하는 과정

첫 판단 기준은 텍스트 선택 가능 여부와 답변 근거의 위치다. 글자를 복사할 수 있더라도 핵심 수치가 복잡한 표에 있거나 설명이 차트와 캡션을 함께 봐야 완성된다면 텍스트 중심 문서로 분류하면 안 된다.

  • 텍스트 중심 PDF: 제목과 본문이 검색 대상이고 표나 그림을 제외해도 답의 의미가 달라지지 않는다. 별도 파싱 사용료가 없는 기본 파서를 우선 적용할 수 있다.
  • 스캔 PDF: 페이지가 이미지여서 텍스트 레이어가 없거나 문자 인식 결과와 표 구조를 직접 정제해야 한다. Textract로 먼저 추출한 결과를 지식 기반용 파일로 변환하는 경로가 적합하다.
  • 표·차트·그림 중심 PDF: 셀 간 관계, 도형 속 문자, 축과 범례 등 시각 요소가 질문의 근거다. Data Automation이나 파운데이션 모델 파서를 검토해야 한다.

Bedrock 공식 파싱 옵션 은 기본 파서가 텍스트만 출력하며 사용료를 별도로 부과하지 않는다고 설명한다. 그림·차트·표·이미지를 출력에 포함해야 할 때는 Data Automation 또는 파운데이션 모델을 권장한다. 고급 파서를 지정하면 해당 데이터 소스의 텍스트 전용 PDF에도 같은 방식이 적용되어 요금이 발생한다.

네 가지 경로의 역할과 경계를 구분한다

기본 파서는 디지털 텍스트로 작성된 규정집, 매뉴얼, 보고서 본문처럼 문장 자체가 검색 대상인 자료에 적합하다. 무료라는 것은 파싱 사용료가 없다는 뜻이며, 임베딩 모델과 벡터 저장소, 검색 이후의 생성 모델 비용까지 없어지는 것은 아니다.

Amazon Textract는 Knowledge Bases 설정에서 고르는 기본·고급 파서와 달리 적재 전에 호출하는 별도 문서 처리 서비스다. 단순 문자 인식 결과뿐 아니라 표를 구성하는 셀과 관계를 추출할 수 있으므로, 출력값을 제목·단락·표 머리글·행·열의 대응이 드러나는 텍스트 또는 구조화 파일로 변환한 뒤 데이터 소스에 넣을 수 있다. Textract가 만든 원시 응답을 그대로 임베딩하면 블록 식별자와 좌표 같은 검색에 불필요한 값이 섞일 수 있으므로 변환 규칙이 필요하다.

Amazon Bedrock Data Automation은 추가 추출 프롬프트 없이 멀티모달 문서를 처리하는 관리형 파서다. 비용은 처리한 문서 페이지 수 또는 이미지 수에 좌우되므로, 형식이 다양한 문서를 동일한 관리형 경로로 처리하려는 경우 예산을 페이지 단위로 계산할 수 있다.

파운데이션 모델 파서는 기본 추출 프롬프트를 업무와 문서 구조에 맞게 조정할 수 있다. 예컨대 표의 제목과 열 머리글을 유지하도록 지시하는 방식은 가능하지만, 실제 출력이 요구사항을 충족하는지는 샘플 문서로 검증해야 한다. 비용은 모델의 입력·출력 토큰 수에 따라 달라지며, 이 파서를 사용할 때는 전체 파일 합계가 100GB를 넘을 수 없다.

Textract 경로는 적재 전에 구조를 복원한다

S3 업로드부터 Lambda·Textract 처리와 정제 파일 동기화까지 이어지는 PDF 전처리 흐름

스캔 청구서나 반복 양식처럼 OCR 결과와 표 직렬화 규칙을 통제해야 한다면 S3 → Lambda → Textract → 정제 파일 → Knowledge Bases 동기화 흐름을 구성할 수 있다. 원본과 변환 결과를 분리하면 문자 오인식이나 표 머리글 누락을 임베딩 전에 검사하고, 문제가 생겼을 때 어느 단계에서 정보가 사라졌는지 추적하기 쉽다.

  1. 원본 PDF를 S3의 원본 전용 위치에 업로드한다.
  2. S3 이벤트로 Lambda를 호출하고 Textract 작업을 시작한다. 일반 스캔 본문은 텍스트 감지를, 표 관계가 필요한 문서는 문서 분석 기능을 선택한다.
  3. 비동기 작업이 끝나면 페이지, 문단, 표 제목, 머리글과 셀 관계를 지식 기반이 읽기 쉬운 형식으로 변환한다. 셀 값만 이어 붙이지 말고 각 값이 어느 열과 행에 속하는지 남긴다.
  4. 정제 파일을 별도 S3 위치에 저장하고 원본 파일 식별자와 페이지처럼 검색 결과를 역추적하는 데 필요한 메타데이터를 붙인다.
  5. 정제 파일 위치를 Knowledge Bases 데이터 소스로 연결해 동기화한다. 업로드 이벤트와 동기화 사이에는 Textract 완료와 변환 성공을 확인하는 상태 관리가 필요하다.

AWS의 Textract 연동 예제 에서는 원본 업로드가 첫 Lambda를 호출하고, Textract 처리 파일을 두 번째 Lambda가 TXT로 변환해 최종 폴더에 저장한 뒤 Knowledge Bases 데이터 소스를 동기화한다. 예제 배포에는 Lambda 두 개와 S3 버킷, OpenSearch Serverless, 지식 기반 등 여러 자원이 포함되므로 기존 환경에 적용할 때는 필요한 구성만 남기고 권한과 운영 책임을 따로 검토해야 한다.

비용은 문서 분리 단계에서 크게 갈린다

문서 유형별 파서 분리로 기본 파싱, Textract, 멀티모달 처리 비용을 구분한 구성

고급 처리가 필요한 PDF만 별도 데이터 소스로 분리하는 것이 최소 비용 경로의 출발점이다. Data Automation이나 파운데이션 모델 파서를 선택한 데이터 소스에서는 텍스트 전용 PDF도 고급 방식으로 처리되므로, 성격이 다른 문서를 한곳에 섞으면 불필요한 페이지 또는 토큰 비용이 생긴다.

  • 기본 파서 경로에는 파싱 사용료가 없지만 S3 저장, 임베딩, 벡터 저장소와 검색·생성 호출 비용이 남는다.
  • Data Automation은 처리할 페이지와 이미지 수를 중심으로 예상 비용을 계산한다.
  • 파운데이션 모델 파서는 입력 문서와 추출 출력의 토큰 수가 주요 비용 변수다. 문서가 길거나 출력 지시가 상세할수록 처리량을 별도로 측정해야 한다.
  • Textract 전처리에는 선택한 API 기능과 페이지 수에 따른 요금뿐 아니라 Lambda 실행, 중간·최종 S3 객체, 이후 임베딩과 벡터 저장 비용이 더해진다.

Textract 공식 요금표 는 Detect Document Text와 Analyze Document를 구분하며, Tables·Forms·Queries 등 선택한 분석 기능의 조합에 따라 페이지당 요금이 달라진다고 명시한다. Tables 분석에는 OCR 텍스트 추출도 포함되므로 동일 페이지에 단순 OCR과 표 분석을 중복 호출하지 않도록 설계하고, 실제 금액은 사용할 리전과 월간 처리량을 넣어 계산해야 한다.

대표 질의로 정보 보존을 비교한다

동기화 성공은 파싱 성공과 같지 않다. 각 문서 유형에서 대표 PDF를 골라 동일한 질문을 후보 경로에 적용하고, 답변 문장만이 아니라 검색된 청크가 올바른 원본 페이지와 구조를 근거로 삼는지 비교해야 한다.

  • 본문 질문에서는 특정 절의 조건과 예외가 함께 검색되는지 본다.
  • 표 질문에서는 셀 값이 정확한 행과 열 머리글에 연결되는지 확인한다.
  • 차트 질문에서는 축, 범례, 기간과 방향성이 검색 근거에 남는지 확인한다.
  • 스캔 질문에서는 숫자, 소수점, 단위와 날짜를 원문과 대조한다.
  • 출처 확인에서는 검색 결과를 원본 파일과 페이지까지 역추적할 수 있는지 본다.

기본 파서가 이 평가를 통과하면 고급 처리로 바꿀 이유가 없다. 스캔 인식과 표 구조를 규칙에 따라 후처리해야 하면 Textract 경로를, 복합 시각 자료를 별도 프롬프트 없이 처리하려면 Data Automation을, 추출 지시를 문서와 업무에 맞게 조정해야 하면 파운데이션 모델 파서를 선택한다. 문서 유형별 데이터 소스 분리는 정보 손실과 고급 파서 비용을 동시에 줄이는 핵심 설계다.

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0