
Detektor tekstu AI to nie dowód: fałszywy alarm może skrzywdzić autora

Wynik detektora tekstu AI może wskazać pracę wartą sprawdzenia, ale sam nie dowodzi, kto ją napisał. Aby uniknąć fałszywego oskarżenia, zestaw go z historią wersji, źródłami i wyjaśnieniem autora. Procent na ekranie nie rozstrzyga też, czy użycie AI naruszyło zasady zadania.
Najpierw ustal, jaka pomoc była dozwolona. Uczeń mógł użyć narzędzia do korekty językowej, kandydat do uporządkowania notatek, a autor publikacji do przygotowania konspektu. Ocena powinna dotyczyć obowiązujących zasad i faktycznego wkładu człowieka, a nie samego podobieństwa tekstu do odpowiedzi modelu.
Co oznacza wynik detektora
Wynik opisuje ocenę konkretnego narzędzia dla przesłanego tekstu. Sprawdź w opisie usługi, czy procent odnosi się do wskazanych fragmentów, całej pracy czy pewności klasyfikacji. Nie przeliczaj go automatycznie na prawdopodobieństwo, że konkretna osoba oszukiwała: narzędzie klasyfikuje tekst, nie zna przebiegu jego powstawania ani zasad, według których miał pracować autor.
Znaczenie mają również rodzaj tekstu i warunki testu. W badaniu Uniwersytetu Chicagowskiego porównano cztery detektory — Pangram, OriginalityAI, GPTZero i RoBERTa — a Pangram osiągnął bardzo niski poziom błędów w badanym zbiorze. To pokazuje, że nie należy przypisywać wszystkim obecnym narzędziom wyników starszych testów. Równie nieuprawnione byłoby przeniesienie dobrego wyniku jednego detektora na dowolną pracę po polsku.
Jeśli korzystasz z detektora, zachowaj nazwę narzędzia, datę sprawdzenia, analizowaną wersję pracy i dokładne brzmienie wyniku. Przed przesłaniem tekstu do zewnętrznej usługi sprawdź, czy możesz przekazać jej pracę ucznia, kandydata lub nieopublikowany materiał. Te informacje pozwolą później ustalić, czego faktycznie dotyczył sygnał, zwłaszcza gdy autor poprawił tekst po wykonaniu analizy.
Jakie błędy ujawniły badania
Fałszywy alarm pojawia się wtedy, gdy tekst napisany przez człowieka zostaje oznaczony jako wygenerowany. Badanie zespołu Stanforda wykazało częste błędne oznaczanie angielskich tekstów osób, dla których angielski nie jest językiem ojczystym. Autorzy zwrócili uwagę na ryzyko niesprawiedliwej oceny takich osób w edukacji i innych sytuacjach, w których ocenia się ich pisanie. Badanie dotyczyło określonych detektorów i tekstów po angielsku; nie wyznacza poziomu błędu dla dzisiejszych narzędzi ani dla prac po polsku.
Możliwy jest też błąd w drugą stronę: tekst wygenerowany przez model może zostać uznany za ludzki. W badaniu opublikowanym w 2023 roku sprawdzono 12 narzędzi publicznych i dwa systemy komercyjne; badacze uznali je za niedokładne i niewiarygodne w badanych warunkach, a techniki zaciemniania treści pogarszały skuteczność wykrywania. Ten wynik opisuje narzędzia i teksty z okresu badania. Nie przeczy nowszemu porównaniu, w którym poszczególne detektory osiągały różne rezultaty.
Własne wrażenie, że tekst jest „zbyt gładki” albo „niepodobny do autora”, także wymaga kontekstu. Poprawna interpunkcja, powtarzalna konstrukcja zdań czy zmiana stylu mogą skłonić do zadania pytań, lecz mogą wynikać z korekty, zmiany gatunku tekstu lub pracy nad językiem. Porównanie stylu ma największy sens wtedy, gdy dotyczy prac napisanych w podobnych warunkach i prowadzi do sprawdzenia konkretnej różnicy.
Co sprawdzić przed postawieniem zarzutu
Weryfikację warto oprzeć na informacjach, które można pokazać autorowi i z nim omówić. Poniższa kolejność pomaga oddzielić podejrzenie wywołane detektorem od ustalenia, czy doszło do naruszenia zasad.
- Ustal zakres dopuszczalnej pomocy. Odczytaj instrukcję zadania lub uzgodnienia z autorem: czy wolno było użyć AI do planu, tłumaczenia, korekty albo napisania fragmentu? Jeśli zasady tego nie określały, nie dopisuj zakazu po oddaniu pracy. Oddziel pytanie o użycie narzędzia od pytania o naruszenie ustalonej reguły.
- Zachowaj ocenianą wersję. Odnotuj fragment budzący wątpliwości i poproś o dostępne szkice, notatki lub historię zmian w edytorze. Sprawdź, czy kolejne wersje pokazują rozwój argumentu, dobór przykładów i poprawki. Brak takiej historii sam w sobie niczego nie rozstrzyga: autor mógł pracować poza edytorem zapisującym zmiany.
- Sprawdź źródła i szczegóły. Otwórz cytowane publikacje, porównaj przypisane im twierdzenia z treścią i zweryfikuj konkretne dane. Nieistniejący przypis lub błędne streszczenie to uchwytny problem jakości pracy, lecz samo w sobie nie wskazuje, kto lub co napisało zdanie. Zapisz znalezione niezgodności zamiast zastępować je ogólną oceną stylu.
- Porozmawiaj o procesie. Poproś autora, by własnymi słowami wyjaśnił główną tezę, wybór źródeł i drogę od szkicu do wersji końcowej. Pytaj o konkretne decyzje widoczne w pracy i daj czas na odpowiedź. Celem rozmowy jest wyjaśnienie przebiegu pracy, a nie sprawdzenie, jak szybko osoba zareaguje na podejrzenie.
- Porównaj porównywalne teksty. Jeśli masz wcześniejsze prace autora, uwzględnij ich gatunek, temat, czas na wykonanie i zakres redakcji. Krótkiej odpowiedzi pisanej pod presją nie zestawiaj bez zastrzeżeń z dopracowanym esejem. Różnica stylu może wskazać fragment do omówienia, ale nie zastępuje historii pracy ani kontroli faktów.
- Oddziel ustalenia od interpretacji. Zapisz osobno wynik detektora, obserwacje dotyczące wersji, wyniki kontroli źródeł oraz wyjaśnienie autora. Przy każdym punkcie wskaż, co da się bezpośrednio sprawdzić, a co pozostaje przypuszczeniem. Jeśli informacje sobie przeczą, wróć do konkretnego fragmentu lub etapu pracy przed sformułowaniem zarzutu.
Na czym oprzeć decyzję
Decyzja powinna odpowiadać na konkretne pytanie: jaka obowiązująca zasada została naruszona i na czym opiera się to ustalenie? Sam wysoki wynik detektora połączony z wrażeniem, że styl się zmienił, daje za mało podstaw do przypisania autorowi nieuczciwości. Można wtedy odnotować wątpliwość i jasno określić wymagania wobec kolejnych prac, bez przedstawiania podejrzenia jako faktu.
Jeżeli historia pracy, sprawdzone niezgodności i odpowiedź autora wskazują na konkretny problem, opisz go precyzyjnie oraz umożliw autorowi odniesienie się do ustaleń przed decyzją. W szkole przedmiotem rozmowy będą wymagania zadania, w rekrutacji — warunki wykonania próbki, a w redakcji — odpowiedzialność za twierdzenia przeznaczone do publikacji. Wynik detektora może pomóc wybrać fragment do sprawdzenia; uzasadnienie decyzji powinno wynikać z ustaleń, które da się zweryfikować.
Powiązane artykuły
Zapisz się do naszego newslettera
Otrzymuj najnowsze wiadomości o Web3, AI i kryptowalutach prosto na swoją skrzynkę.

