Jak rozpoznać tekst napisany przez AI? Detektor właśnie uznał Sienkiewicza za maszynę
Poniedziałek, wczesne popołudnie. Wklejam do GPTZero, najgłośniejszego detektora AI na świecie, fragment prozy po polsku. Werdykt przychodzi po kilku sekundach: „We are highly confident this text was AI generated”. Pewność: 100%.
Tekst pochodzi z „Quo vadis”. Henryk Sienkiewicz napisał go w 1896 roku. Nobel dostał w 1905. ChatGPT pojawił się 126 lat później.
Pięć minut wcześniej ten sam detektor ocenił fragment „Lalki” Prusa: człowiek, pewność 100%. Dwóch klasyków, ta sama epoka, ten sam gatunek - dwa przeciwne werdykty wypowiedziane tym samym, absolutnie pewnym tonem.
Ten tekst to zapis eksperymentu: 20 polskich próbek, 4 popularne detektory, 34 pomiary. Wnioski są mocniejsze, niż się spodziewałem - i dotyczą każdego, kto sprawdza cudze teksty detektorem albo bywa przez taki detektor sprawdzany. Zdanie, które warto zapamiętać przed tabelą wyników: detektor nie mierzy, czy tekst napisała maszyna. Mierzy, czy tekst brzmi jak maszyna.
Test: 20 polskich tekstów kontra 4 detektory
Rada „sprawdź detektorem” pojawia się w każdym poradniku o tekstach z AI. Postanowiłem sprawdzić samą radę - na polskich tekstach, bo po polsku pracuje i pisze większość z nas, a detektory trenuje się głównie na angielskim.
Skąd wziąłem próbki
Korpus zbudowałem tak, żeby każdą próbkę dało się zweryfikować niezależnie:
- Człowiek, klasyka (4 próbki): fragmenty z domeny publicznej - „Lalka” Prusa, „Quo vadis” Sienkiewicza, „Ziemia obiecana” i „Chłopi” Reymonta (ten ostatni gwarą). Wszystko z Wolnych Lektur, po ok. 290 słów.
- Człowiek, współczesny (4 próbki): polska Wikipedia w rewizjach z wiosny 2021 - półtora roku przed premierą ChatGPT. Hasła: Fotosynteza, Bitwa pod Grunwaldem, Kawa, Wisła. Każdą rewizję można obejrzeć po numerze wersji, więc daty nie da się podważyć.
- Czyste AI (4 próbki): surowe odpowiedzi Claude na neutralne prompty (poradnik o bieganiu, opis ekspresu do kawy, tekst o pracy zdalnej, wyjaśnienie fotowoltaiki). Bez żadnych wytycznych stylu.
- AI po lekkiej redakcji (4): te same teksty po zmianach szyku, scaleniach zdań i synonimach. Treść nietknięta.
- AI po pełnej redakcji (4): te same teksty przepuszczone przez mój proces redakcyjny - wycięcie typowych fraz AI, przebudowa struktury, zmienny rytm zdań, konkrety. Tak redaguję teksty na tego bloga i mówię o tym otwarcie.
Narzędzia i zasady
Cztery detektory dostępne za darmo, bez logowania: GPTZero (najbardziej znany; obsługuje oficjalnie 5 języków, polskiego wśród nich nie ma), ZeroGPT, QuillBot AI Detector (z polskim na liście języków, model v6.2.1) i isgen.ai (reklamuje się jako „najdokładniejszy polski detektor AI”).
Zasady: jedna próbka to 219-290 słów, wynik uznaję tylko przy potwierdzeniu, że dotyczy właściwego tekstu (świeżo załadowana strona, licznik znaków zgodny z próbką), raportuję wszystko - także trafienia. Test wykonałem 6 lipca 2026 na darmowych wersjach narzędzi. Konflikt interesu ujawniam wprost: piszę z pomocą AI codziennie i uczę tego na blogu.
Wyniki: tabela, po której przestajesz ufać procentom
| Próbka (% AI wg narzędzia) | GPTZero | ZeroGPT | QuillBot | isgen.ai |
|---|---|---|---|---|
| Prus, „Lalka” (1890) | 0 | 0 | 0 | 0 |
| Sienkiewicz, „Quo vadis” (1896) | 100 | 0 | 0 | 0 |
| Reymont, „Ziemia obiecana” i „Chłopi” | - | 0 / 0 | 0 / 0 | 0 / 0 |
| Wikipedia 2021: Fotosynteza | - | 90,7 | 0 | 0 |
| Wikipedia 2021: Grunwald / Kawa / Wisła | - | 92,4 / 61 / 40,7 | - (limit) | 0 / 0 / - (limit) |
| Czyste AI (4 teksty) | - | 73,6 / 83,4 / 100 / 100 | - (limit) | - (limit) |
| AI po lekkiej redakcji (4) | - | 0 / 0 / 28,4 / 78,9 | - (limit) | - (limit) |
| AI po pełnej redakcji (4) | - | 0 / 0 / 0 / 0 | - (limit) | - (limit) |
Cztery obserwacje, które bolą najbardziej:
Fałszywy alarm ma pełną pewność siebie. GPTZero nie zawahał się przy Sienkiewiczu - komunikat brzmiał „highly confident”. Drobny druk z tej samej sesji: pierwszy skan (Prus) szedł na modelu oznaczonym „4.1m”, drugi (Sienkiewicz) już na modelu „2025-03-13-base”. Darmowa wersja sama zmienia silnik między skanami i nie pyta cię o zdanie.
ZeroGPT oskarżył całą ludzką Wikipedię. Cztery hasła, wszystkie z rewizji sprzed ChatGPT, pisane przez wolontariuszy: 90,7%, 92,4%, 61% i 40,7% „AI”. Klasykę literacką ten sam detektor ocenił bezbłędnie. Wzorzec jest oczywisty: proza Reymonta faluje, encyklopedia jest równa - a detektor karze równość, nie maszynowość.
Detektor pomylił kierunki. Ludzka fotosynteza z Wikipedii dostała w ZeroGPT 90,7%. Prawdziwy tekst z AI o bieganiu - 73,6%. Gdyby to był test na prawo jazdy, kursant wjechałby w tłum i dostał pochwałę za płynność.
Dwa narzędzia, ten sam tekst, 90 punktów różnicy. Fotosynteza: ZeroGPT 90,7% AI, QuillBot i isgen - 0%. Który wynik wkleiłbyś do maila oskarżającego studenta?
Uczciwa uwaga o dwóch pozostałych narzędziach: QuillBot (z polskim, model v6.2.1) i isgen.ai nie zrobiły ani jednego fałszywego alarmu na ludzkich tekstach - 12 pomiarów, komplet „human”. Ich testu na próbkach AI dokończyć się nie dało, bo darmowe limity skończyły się w połowie eksperymentu: GPTZero tnie po 2 skanach, QuillBot po 5-6 (potem ekran logowania), isgen po ok. 8 (potem cennik: 8-24 dolary miesięcznie). Wiemy więc, że nie oskarżają ludzi. Nie wiemy, ile AI przepuszczają. To istotna luka - i pierwszy praktyczny wniosek: darmowa weryfikacja większej liczby tekstów po prostu nie istnieje, a to na darmowych skanach opiera się szkolna i rekrutacyjna praktyka.
Dlaczego detektor strzela, zamiast wykrywać
Większość detektorów opiera się na dwóch miarach. Perplexity: jak przewidywalne jest każde kolejne słowo dla modelu językowego. Burstiness: jak bardzo zdania różnią się między sobą długością i budową. Tekst przewidywalny i równy = „AI”. Tekst nieprzewidywalny i nierówny = „człowiek”. Nowsze narzędzia dokładają wytrenowane klasyfikatory, ale fundament zostaje ten sam. Polski akcent: na identycznej zasadzie (perplexity) działa JSA - system antyplagiatowy, którym od lutego 2024 polskie uczelnie sprawdzają prace dyplomowe. Politechnika Warszawska deklaruje, że przez ten filtr przechodzi automatycznie każda praca wgrana do systemu.
Problem w tym, że „równo i przewidywalnie” pisze mnóstwo ludzi. Encyklopedysta. Prawnik. Naukowiec. Student, który wykuł strukturę eseju. Osoba pisząca w obcym języku, trzymająca się bezpiecznych konstrukcji. Osoba w spektrum autyzmu, która wypracowała stały schemat wypowiedzi.
Nauka zna skalę tego problemu od dawna:
- OpenAI wycofało własny detektor po pół roku (lipiec 2023). Oficjalny powód: „niska skuteczność”. Liczby z ich strony: wykrywał 26% tekstów AI, a 9% ludzkich oznaczał błędnie jako AI. Firma, która stworzyła ChatGPT, nie umiała go wykrywać - i miała odwagę to przyznać.
- Stanford (Liang i zespół, 2023): siedem detektorów, 91 esejów TOEFL pisanych przez ludzi. Średnio 61,3% esejów osób niepiszących natywnie po angielsku oznaczono jako AI; jeden detektor oskarżył 97,8% z nich. Eseje amerykańskich ósmoklasistów - niemal bezbłędnie „human”. Detektory karzą prostszą składnię, nie oszustwo.
- Przegląd 14 narzędzi (Weber-Wulff i zespół, 2023), w tym Turnitin: werdykt „ani dokładne, ani wiarygodne”.
- Turnitin deklaruje poniżej 1% fałszywych alarmów na poziomie dokumentu. Uniwersytet Vanderbilta policzył, co to znaczy przy 75 tysiącach prac rocznie: około 750 niesłusznie oskarżonych studentów co roku. Wyłączyli detektor w 2023 i nie wrócili.
- Bloomberg (2024) przepuścił przez GPTZero i Copyleaks 500 esejów aplikacyjnych sprzed ery ChatGPT: 1-2% fałszywych oskarżeń - czasem z „niemal 100-procentową pewnością”. Wśród opisanych przypadków: studentka w spektrum autyzmu oskarżona o oszustwo, bo jej staranny, powtarzalny styl „wyglądał na AI”.
Skala po drugiej stronie też jest realna - brytyjski Guardian doliczył się w roku akademickim 2023/24 około 7 tysięcy udowodnionych przypadków oszustw z AI na uczelniach (5,1 na 1000 studentów). Problem istnieje. Tyle że narzędzie, którym próbujemy go łapać, myli Sienkiewicza z ChatGPT.
Mechanikę modeli językowych - czemu w ogóle „przewidują słowa” - rozbieram w przewodniku po tym, jak naprawdę działa AI. Tu wystarczy wniosek: detektor to test statystycznego podobieństwa stylu, sprzedawany jako test autorstwa.
Redakcja rozbraja detektor w kwadrans
Najciekawsza część eksperymentu to trzy wersje tych samych czterech tekstów.
Surowe AI wpadło w ZeroGPT z hukiem: 73,6-100%. Wystarczyła jednak lekka redakcja - zmieniony szyk, scalone zdania, kilka synonimów, zero zmian w treści - i dwa teksty z czterech zeszły do 0% („Your Text is Human written”). Po pełnej redakcji (wycięte frazy-sygnatury AI, przebudowana struktura, zmienny rytm zdań) na zero zeszły wszystkie cztery.
Badacze pokazali to samo w większej skali: w benchmarku RAID podmiana znaków na homoglify obniżała skuteczność detektorów średnio o 40,6 punktu procentowego, a rekurencyjna parafraza potrafi zbić wykrywalność watermarku z 99% do 15%. Miary się różnią, wniosek nie: każda warstwa obróbki oddala tekst od „sygnatury” AI.
Złóż to w całość, a wyjdzie paradoks detektorów w jednym zdaniu: wykrywają tylko tych, którym nie chciało się nawet raz przeczytać własnego tekstu - a karzą tych, którzy piszą starannie i równo.
Po czym NAPRAWDĘ poznać tekst z AI (i czego to nie dowodzi)
Redaguję teksty pisane z AI codziennie i prowadzę własną stop-listę zwrotów, które wycinam, bo zdradzają maszynę. To poszlaki - mocniejsze niż score z detektora, bo przynajmniej wiesz, NA CO patrzysz. Sygnały językowe, po polsku:
- Frazy-wytrychy: „w dzisiejszym świecie”, „warto zauważyć”, „kluczowe znaczenie”, „kompleksowe rozwiązanie”, „odkryj nowy wymiar”, „to nie tylko X, ale także Y”.
- Rytuał podsumowania: akapit zaczynający się od „Podsumowując,” z obowiązkową nutą optymizmu. W moich surowych próbkach AI wystąpił w 4 tekstach na 4.
- Triady: „cierpliwość, systematyczność i pozytywne nastawienie”. Model uwielbia wyliczać trójkami.
- Symetryczne zestawienia: „zarówno dla początkujących, jak i wymagających koneserów”, „nie tylko oszczędność, ale także wkład w ochronę środowiska”.
- Idealna równość: akapity po 3-4 zdania jak od linijki, każdy z tezą na początku i miękkim domknięciem. Zero literówek, zero potknięć, zero ryzyka.
- Brak ciała: żadnej daty z życia, kwoty z faktury, nazwy ulicy, wpadki, ironii, urazy. Tekst o wszystkim i o niczym - poprawny jak formularz.
Teraz część, którą poradniki pomijają: czego te sygnały nie dowodzą. Ludzie też tak piszą - zwłaszcza po korporacyjnych szkoleniach z „profesjonalnej komunikacji”, które od dekad uczą dokładnie tych fraz. Obecność trzech wytrychów to sygnał do rozmowy, nie do oskarżenia. Dokładnie tak samo jak wynik „92% AI” z narzędzia, które przed chwilą oskarżyło Wikipedię.
Co robić zamiast wierzyć w procent
Jeśli sprawdzasz (nauczyciel, promotor, rekruter, redaktor): score może najwyżej otworzyć rozmowę - nigdy jej zamknąć. Realną wiedzę dają: historia zmian dokumentu (Google Docs i Word pokazują ją za darmo), wersje robocze, pięć minut rozmowy o decyzjach w tekście („czemu ten argument tu?”, „co znaczy to pojęcie?”, „co byś wyciął?”). Autor własnego tekstu odpowiada bez wahania. Dyrektor OPI, którego system JSA sprawdza polskie prace dyplomowe, mówi zresztą wprost: narzędzie „nie daje stuprocentowej pewności”, decyzja należy do promotora. Skoro taką pokorę deklaruje operator systemu, tym bardziej powinna obowiązywać każdego z detektorem w przeglądarce.
Jeśli jesteś sprawdzany: pisz w narzędziu z historią zmian i jej nie kasuj - to twoje alibi. Po fałszywym oskarżeniu żądaj wskazania metody i jej udokumentowanej skuteczności dla języka polskiego. Dla żadnego z testowanych narzędzi taki dokument nie istnieje - Senuto szacuje margines błędu detektorów dla polskiego na 10-15%, a GPTZero polskiego oficjalnie nie obsługuje w ogóle.
Jeśli publikujesz (marketer, wydawca): pytanie „czy to pisała AI” jest mniej ważne niż dwa inne - czy treść jest prawdziwa i czy ktoś wziął za nią odpowiedzialność. Fałszywe liczby w tekście to realna szkoda niezależnie od autora; pisałem o tym w przewodniku po halucynacjach AI. Autentyczność głosu buduje się inaczej niż score'em - o tym z kolei tekst o marce osobistej w czasach AI.
AI Act: od sierpnia prawo przestaje wierzyć w detektory
Unijna regulacja podchodzi do problemu dokładnie odwrotnie niż detektory - i to jest najciekawsza zmiana tego roku.
Od 2 sierpnia 2026 obowiązują przepisy o przejrzystości z art. 50 AI Act: dostawcy systemów generujących tekst, obraz, audio i wideo mają oznaczać wygenerowane treści w formacie czytelnym maszynowo, a podmioty publikujące deepfake'i - ujawniać ich sztuczność. Za naruszenia grozi do 15 mln euro lub 3% światowego obrotu. Dla systemów działających na rynku przed tą datą trwają prace nad okresem przejściowym (pakiet „AI Omnibus” przewiduje czas do grudnia 2026 na wdrożenie znakowania).
Kierunek jest jednoznaczny: oznaczanie u źródła zamiast zgadywania po fakcie. Technologia do tego istnieje od dawna - Google opisał w „Nature” watermark SynthID przetestowany na 20 milionach odpowiedzi Gemini, a OpenAI według doniesień „Wall Street Journal” ma gotowy znak wodny dla ChatGPT o deklarowanej skuteczności 99,9%. Nie wypuściło go, bo w ankiecie prawie 30% użytkowników zapowiedziało, że przy włączonym znakowaniu używaliby narzędzia rzadziej. Wniosek zostawiam tobie.
Jest jeszcze jeden zapis, który wart jest zapamiętania: obowiązek oznaczania nie obejmuje tekstu, który przeszedł ludzką redakcję i za który odpowiedzialność redakcyjną bierze wydawca. Prawo mówi więc to samo, co mój eksperyment: granica nie przebiega między „pisał człowiek” a „pisała maszyna”, tylko między treścią, za którą ktoś odpowiada, a treścią wypuszczoną bez kontroli.
Ograniczenia tego testu
Uczciwość wymaga wyliczenia słabości. Próba była mała: 20 tekstów, 34 pomiary, jeden język. Wszystkie próbki AI pochodziły z jednej rodziny modeli (Claude) - inne modele mogą mieć inne „sygnatury”. Redakcję wersji K4/K5 wykonałem swoim procesem redakcyjnym, narzędziowo - mierzyłem wpływ obróbki, nie tożsamość redaktora. Darmowe limity ucięły test QuillBota i isgen na próbkach AI, więc ich zdolności wykrywania nie oceniam. Wyniki dotyczą wersji narzędzi z 6 lipca 2026 - detektory zmieniają modele bez zapowiedzi, czasem między dwoma kolejnymi skanami, co sam zaobserwowałem. Pochodzenie każdej próbki opisałem wyżej na tyle dokładnie, że test można powtórzyć niezależnie - i do tego zachęcam.
Wynik detektora to opinia algorytmu o stylu. Traktuj ją najwyżej jak plotkę: czasem coś w niej jest, ale karier się na plotkach nie kończy.
Autor
Mateusz Czech // Czechu
AI Senior Digital Product Specialist w grupie Górskie Resorty. Projektuję i wdrażam aplikacje oparte na AI dla sprzedaży i obsługi klienta w hotelach. Wcześniej w SentiOne współtworzyłem voicebota InfoNina dla Alior Banku (Celent Model Bank Awards 2022). Piszę o wdrożeniach AI na czechu.blog. Prywatnie gram w tenisa i słucham polskiego rapu.
Tagi
Powiązane artykuły
Co jeszcze warto przeczytać
Statystyki-zombie o AI. Znalazłem je także we własnych tekstach
Liczby o AI, które krążą bez źródła albo mówią więcej niż źródło. Sześć mechanizmów, błędy z moich tekstów i 5 pytań przed wklejeniem liczby do prezentacji.
Czym jest AI, ML, LLM, AR i VR. Jedna doba, w której użyłeś ich wszystkich
AI, machine learning, model językowy, AR, VR, IoT i agenci - wyjaśnione przez jeden zwykły dzień, a potem uporządkowane w trzy mapy. Bez definicji z Wikipedii.
Sędzia, który nie mruga. Czego mundial 2026 uczy o oddawaniu decyzji maszynie
Ofsajd na mundialu 2026 mierzy 16 kamer i sensor 500 Hz, a człowiek tylko zatwierdza. Jak działa ta maszyna decyzyjna i czego uczy firmy wdrażające AI.
Newsletter Strategic AI Implementation
Co tydzień jeden framework, jedno case study, zero spamu
Dołącz do listy. Dostajesz to, czego nie wrzucam na bloga: kulisy moich wdrożeń, sprawdzone prompty, błędy do uniknięcia. Wypisujesz się jednym kliknięciem.