ChatGPT 글에 보이지 않는 표식…짧은 문장은 20% 놓친다

|작성자: QUASA 편집팀|5 분 소요
ChatGPT 글에 보이지 않는 표식…짧은 문장은 20% 놓친다

OpenAI는 2026년 10월 5일 EU 대상 ChatGPT·Codex 텍스트 표식 도입 계획과 오탐률 1% 조건에서 200토큰 글 약 80%, 400토큰 글 약 95%를 찾아낸 자체 시험을 공개했는데, 200토큰 결과는 같은 조건의 글 약 20%를 놓쳤다는 뜻이다. 회사는 대상 출력에 보이지 않는 표식을 앞으로 몇 주에 걸쳐 적용할 계획이며, 전 세계 API 고객에게는 일부 모델에서 선택해 켜는 기능을 제공하기 시작했다.

한국을 포함한 EU 밖의 일반 ChatGPT 출력은 이번 기본 적용 계획에 들어 있지 않다. 같은 날 나온 TechCrunch의 출시 범위 보도도 EU 제품 적용은 예정된 단계로, API 선택 기능은 이미 시작된 단계로 구분했다. 일반 이용자가 임의의 글을 넣어 판별할 공개 텍스트 탐지기도 아직 제공되지 않는다. 시험에서 놓친 비율은 200토큰 길이의 특정 내용에 관한 값으로, 짧은 한 문장마다 같은 비율로 적용되는 수치는 아니다.

어떤 ChatGPT·Codex 글에 표식이 붙나

표식의 적용 여부는 모델 이름만으로 정해지지 않는다. 이용 지역, 글을 생성한 제품, 모델의 지원 여부와 API 설정이 함께 작용한다. 특히 EU에 적용될 ChatGPT·Codex 기능과 세계 각지에서 고객이 직접 켜는 API 기능은 출시 시점과 기본 설정이 다르다. 독자가 이미 받은 글의 겉모습만으로 어느 경로에서 만들어졌는지 알아낼 수도 없다.

  • EU의 대상 ChatGPT·Codex 텍스트: 모든 요금제의 대상 이용자에게 앞으로 몇 주에 걸쳐 도입할 계획이다. 발표가 곧 모든 대상 출력의 적용 완료를 뜻하지는 않는다.
  • EU 밖의 일반 ChatGPT 텍스트: 이번 발표에서 기본 표식 적용 대상으로 지정되지 않았다. 한국에서 접하는 모든 ChatGPT 답변에 표식이 붙는다고 볼 근거도 없다.
  • OpenAI API 텍스트: 세계 각지의 고객이 지원 모델에서 선택해 켤 수 있다. 기본값은 꺼져 있으므로 API로 만든 글이라는 사실만으로 표식 유무를 판단할 수 없다.
  • OpenAI의 텍스트 탐지기: 접근 신청은 받지만 초기 이용은 승인된 연구자와 전문 기관으로 제한된다. 일반 이용자에게 공개된 판별 창구는 없다.

이 구분은 같은 회사의 모델을 썼다는 설명만 들은 글을 판단할 때 중요하다. 지원하지 않는 모델의 출력이나 도입 전 생성된 글에는 이번 조치가 적용됐다고 전제할 수 없다. API를 쓰는 별도 서비스라면 고객의 선택 설정까지 알아야 한다. EU에서 만들어진 글이 다른 지역으로 전달될 수도 있지만, 복사된 문장 자체에는 생성 지역이나 적용 설정을 알려 주는 가시적 표시가 없다.

왜 짧은 글과 수학 답변에서 탐지가 어려운가

textGrain은 문서에 특수 문자나 눈에 띄는 기호를 덧붙이는 방식이 아니다. 모델이 단어와 단어 조각을 선택하는 과정에 통계적 신호를 남기고, 탐지기는 글에 그 신호가 충분히 쌓였는지 살핀다. 표현을 고를 기회가 적은 짧은 글에서는 판단할 재료도 줄어든다. 보이지 않는 표식이라는 말은 글자를 살펴 수작업으로 찾아낼 수 있다는 뜻이 아니다.

회사 시험의 두 길이별 탐지율은 심리학처럼 표현을 다양하게 고를 수 있는 내용에서 나온 결과다. 수학처럼 답변에 쓸 말이 제한되는 내용에서는 같은 길이라도 탐지율이 상당히 낮았다. 따라서 글의 길이만 늘리면 일정한 비율로 정확도가 높아진다고 일반화하기 어렵다. 한국어 문장의 글자 수를 이 시험의 토큰 수와 동일하게 취급하는 것도 맞지 않다.

오탐률은 표식이 없는 글을 있다고 잘못 판단하는 비율이고, 미탐률은 실제 표식이 있는데 놓치는 비율이다. 회사가 공개한 탐지 성능은 정해 둔 오탐 허용 수준에서 측정한 값이다. 어느 한쪽 오류를 줄이도록 판정 기준을 바꾸면 다른 쪽 결과도 달라질 수 있어, 탐지율만 떼어 독립적인 정확도 보증처럼 읽어서는 안 된다. 글의 종류와 길이까지 함께 봐야 수치의 적용 범위를 알 수 있다.

생성 뒤 편집도 신호를 약하게 만든다. OpenAI의 별도 시험에서는 동의어로 일부 단어를 바꾼 뒤 탐지율이 크게 낮아졌다. 번역이나 문장 재작성 역시 처음 생성됐을 때의 단어 선택을 바꾼다. 이런 변화는 표식을 없애려는 의도 없이 초안을 자연스럽게 다듬는 과정에서도 생길 수 있다. 복사해 붙여 넣은 글과 상당 부분 다시 쓴 글을 같은 조건으로 판단하기 어려운 이유다.

검출 결과로 알 수 있는 것과 알 수 없는 것

표식이 검출되면 OpenAI 시스템이 해당 글의 일부를 생성하거나 처리했을 가능성을 나타낸다. 그것만으로 글 전체를 AI가 작성했다고 확정할 수는 없다. 사람이 초안을 쓰고 모델이 일부를 고친 경우, 모델이 초안을 만들고 사람이 대폭 수정한 경우를 단일 탐지 결과로 구분하지 못한다. 검출 결과에는 사람의 판단이나 창작이 얼마나 들어갔는지도 나타나지 않는다.

표식이 검출되지 않은 글을 곧바로 사람이 쓴 글로 판정할 수도 없다. 분량이 짧거나 표현의 선택지가 적었을 수 있고, 작성 뒤 편집이나 번역을 거쳤을 수도 있다. 지원 대상이 아닌 모델이나 도입 이전의 출력도 가능한 설명이다. 탐지 대상이 OpenAI의 표식인 만큼 다른 회사의 AI가 관여했는지까지 판별하는 결과로 확대해서는 안 된다.

표식은 작성자의 신원이나 계정을 담은 꼬리표도 아니다. 검출되더라도 특정 사용자, 대화 또는 프롬프트를 지목하지 않는다. 글의 소유권과 작성 책임, 내용의 사실 여부 역시 별도로 판단할 문제다. 반대로 독자가 표식을 직접 볼 수 없다는 사실은 탐지 결과의 해석 문제와 구분해야 한다. 현 단계에서는 일반 이용자가 OpenAI의 텍스트 탐지기에 접근해 그 제한된 결과조차 확인할 수 없다.

독립 연구가 제기한 품질·안전성 문제

OpenAI는 자체 평가에서 textGrain을 켠 경우와 끈 경우의 주요 모델 성능에 의미 있는 차이를 보지 못했다고 밝혔다. 다만 평균 성능이 비슷하다는 사실만으로 개별 답변이나 도구 사용 결정까지 똑같다고 결론 낼 수는 없다. 워터마크는 모델이 다음 단어를 고르는 단계에 관여하므로, 출처 신호를 남기는 능력과 답변 행동의 안정성은 서로 다른 평가 대상이다.

별도의 Lasso의 SynthID-Text 실험에서는 시험한 일곱 모델 중 여섯 모델에서 도구 호출 정확도가 낮아졌고, 일부 모델은 유해한 요청을 거부할지에 대한 판단도 달라졌다. 프롬프트 주입을 결합한 조건에서는 몇몇 모델의 거부 판단 변화가 더 커졌다. 연구진은 같은 질문을 표식 적용 전후에 비교해, 전체 점수가 비슷해 보여도 개별 도구 선택이나 인수가 달라질 수 있음을 살폈다.

이 실험의 대상은 Google DeepMind가 공개한 SynthID-Text 구현이다. OpenAI의 textGrain이나 EU 출시 설정에서 동일한 성능 저하 또는 안전성 변화가 관찰됐다는 결과는 아니다. 다만 출처 표시 기술을 실제 모델에 적용할 때 탐지율과 일반적인 품질 점수뿐 아니라, 배포 설정에서 거부 판단과 도구 호출이 어떻게 달라지는지도 평가해야 한다는 문제를 남긴다.

앞으로 EU 대상 출력의 적용이 진행되고 제한적으로 개방되는 탐지기에서 실제 사용 자료가 쌓이면, 회사 시험에서 제시한 조건이 다양한 언어와 편집된 글에도 얼마나 들어맞는지 더 분명해질 것이다. 한국의 일반 이용자에게는 그 전까지 개별 ChatGPT 글의 표식 유무를 직접 확인할 공개 수단이 없으며, 향후 검출 결과가 나오더라도 그것은 작성자를 특정하는 정보가 아니라 모델 관여를 가리키는 제한된 신호다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0