POWRÓT DO BLOGA
AI Fundamentals 6 lipca 2026

Jak rozpoznać tekst napisany przez AI? Detektor właśnie uznał Sienkiewicza za maszynę

15 min Czechu

Poniedziałek, wczesne popołudnie. Wklejam do GPTZero, najgłośniejszego detektora AI na świecie, fragment prozy po polsku. Werdykt przychodzi po kilku sekundach: „We are highly confident this text was AI generated”. Pewność: 100%.

Tekst pochodzi z „Quo vadis”. Henryk Sienkiewicz napisał go w 1896 roku. Nobel dostał w 1905. ChatGPT pojawił się 126 lat później.

Pięć minut wcześniej ten sam detektor ocenił fragment „Lalki” Prusa: człowiek, pewność 100%. Dwóch klasyków, ta sama epoka, ten sam gatunek - dwa przeciwne werdykty wypowiedziane tym samym, absolutnie pewnym tonem.

Ten tekst to zapis eksperymentu: 20 polskich próbek, 4 popularne detektory, 34 pomiary. Wnioski są mocniejsze, niż się spodziewałem - i dotyczą każdego, kto sprawdza cudze teksty detektorem albo bywa przez taki detektor sprawdzany. Zdanie, które warto zapamiętać przed tabelą wyników: detektor nie mierzy, czy tekst napisała maszyna. Mierzy, czy tekst brzmi jak maszyna.

W SKRÓCIE
  • GPTZero uznał Sienkiewicza za AI (100% pewności), a ZeroGPT oznaczył wszystkie 4 ludzkie teksty z Wikipedii sprzed ChatGPT jako AI lub „mieszane” - do 92,4%.
  • Ta sama ludzka Wikipedia dostała 90,7% AI, podczas gdy prawdziwy tekst z AI - 73,6%. Detektor pomylił kierunki.
  • Lekka redakcja zbiła wykrywalność AI do zera w 2 z 4 tekstów. Po pełnej redakcji: 4 razy „Human written”. Treść bez zmian.
  • Nauka potwierdza: OpenAI wycofało własny detektor przy 26% skuteczności, Stanford wykrył 61,3% fałszywych oskarżeń wobec piszących w obcym języku, Vanderbilt wyłączył detektor Turnitina.
  • Darmowe limity kończą się po 2-8 skanach. Realna weryfikacja klasy tekstów za darmo nie istnieje - a decyzje o ludziach zapadają po jednym skanie.
  • Od 2 sierpnia 2026 AI Act odwraca logikę: zamiast zgadywać po fakcie, generator ma oznaczać treści u źródła. Prawo właśnie przyznało, że detekcja zawodzi.

Test: 20 polskich tekstów kontra 4 detektory

Rada „sprawdź detektorem” pojawia się w każdym poradniku o tekstach z AI. Postanowiłem sprawdzić samą radę - na polskich tekstach, bo po polsku pracuje i pisze większość z nas, a detektory trenuje się głównie na angielskim.

Skąd wziąłem próbki

Korpus zbudowałem tak, żeby każdą próbkę dało się zweryfikować niezależnie:

  • Człowiek, klasyka (4 próbki): fragmenty z domeny publicznej - „Lalka” Prusa, „Quo vadis” Sienkiewicza, „Ziemia obiecana” i „Chłopi” Reymonta (ten ostatni gwarą). Wszystko z Wolnych Lektur, po ok. 290 słów.
  • Człowiek, współczesny (4 próbki): polska Wikipedia w rewizjach z wiosny 2021 - półtora roku przed premierą ChatGPT. Hasła: Fotosynteza, Bitwa pod Grunwaldem, Kawa, Wisła. Każdą rewizję można obejrzeć po numerze wersji, więc daty nie da się podważyć.
  • Czyste AI (4 próbki): surowe odpowiedzi Claude na neutralne prompty (poradnik o bieganiu, opis ekspresu do kawy, tekst o pracy zdalnej, wyjaśnienie fotowoltaiki). Bez żadnych wytycznych stylu.
  • AI po lekkiej redakcji (4): te same teksty po zmianach szyku, scaleniach zdań i synonimach. Treść nietknięta.
  • AI po pełnej redakcji (4): te same teksty przepuszczone przez mój proces redakcyjny - wycięcie typowych fraz AI, przebudowa struktury, zmienny rytm zdań, konkrety. Tak redaguję teksty na tego bloga i mówię o tym otwarcie.

Narzędzia i zasady

Cztery detektory dostępne za darmo, bez logowania: GPTZero (najbardziej znany; obsługuje oficjalnie 5 języków, polskiego wśród nich nie ma), ZeroGPT, QuillBot AI Detector (z polskim na liście języków, model v6.2.1) i isgen.ai (reklamuje się jako „najdokładniejszy polski detektor AI”).

Zasady: jedna próbka to 219-290 słów, wynik uznaję tylko przy potwierdzeniu, że dotyczy właściwego tekstu (świeżo załadowana strona, licznik znaków zgodny z próbką), raportuję wszystko - także trafienia. Test wykonałem 6 lipca 2026 na darmowych wersjach narzędzi. Konflikt interesu ujawniam wprost: piszę z pomocą AI codziennie i uczę tego na blogu.

Wyniki: tabela, po której przestajesz ufać procentom

Próbka (% AI wg narzędzia) GPTZero ZeroGPT QuillBot isgen.ai
Prus, „Lalka” (1890) 0 0 0 0
Sienkiewicz, „Quo vadis” (1896) 100 0 0 0
Reymont, „Ziemia obiecana” i „Chłopi” - 0 / 0 0 / 0 0 / 0
Wikipedia 2021: Fotosynteza - 90,7 0 0
Wikipedia 2021: Grunwald / Kawa / Wisła - 92,4 / 61 / 40,7 - (limit) 0 / 0 / - (limit)
Czyste AI (4 teksty) - 73,6 / 83,4 / 100 / 100 - (limit) - (limit)
AI po lekkiej redakcji (4) - 0 / 0 / 28,4 / 78,9 - (limit) - (limit)
AI po pełnej redakcji (4) - 0 / 0 / 0 / 0 - (limit) - (limit)

Cztery obserwacje, które bolą najbardziej:

Fałszywy alarm ma pełną pewność siebie. GPTZero nie zawahał się przy Sienkiewiczu - komunikat brzmiał „highly confident”. Drobny druk z tej samej sesji: pierwszy skan (Prus) szedł na modelu oznaczonym „4.1m”, drugi (Sienkiewicz) już na modelu „2025-03-13-base”. Darmowa wersja sama zmienia silnik między skanami i nie pyta cię o zdanie.

ZeroGPT oskarżył całą ludzką Wikipedię. Cztery hasła, wszystkie z rewizji sprzed ChatGPT, pisane przez wolontariuszy: 90,7%, 92,4%, 61% i 40,7% „AI”. Klasykę literacką ten sam detektor ocenił bezbłędnie. Wzorzec jest oczywisty: proza Reymonta faluje, encyklopedia jest równa - a detektor karze równość, nie maszynowość.

Detektor pomylił kierunki. Ludzka fotosynteza z Wikipedii dostała w ZeroGPT 90,7%. Prawdziwy tekst z AI o bieganiu - 73,6%. Gdyby to był test na prawo jazdy, kursant wjechałby w tłum i dostał pochwałę za płynność.

Dwa narzędzia, ten sam tekst, 90 punktów różnicy. Fotosynteza: ZeroGPT 90,7% AI, QuillBot i isgen - 0%. Który wynik wkleiłbyś do maila oskarżającego studenta?

Uczciwa uwaga o dwóch pozostałych narzędziach: QuillBot (z polskim, model v6.2.1) i isgen.ai nie zrobiły ani jednego fałszywego alarmu na ludzkich tekstach - 12 pomiarów, komplet „human”. Ich testu na próbkach AI dokończyć się nie dało, bo darmowe limity skończyły się w połowie eksperymentu: GPTZero tnie po 2 skanach, QuillBot po 5-6 (potem ekran logowania), isgen po ok. 8 (potem cennik: 8-24 dolary miesięcznie). Wiemy więc, że nie oskarżają ludzi. Nie wiemy, ile AI przepuszczają. To istotna luka - i pierwszy praktyczny wniosek: darmowa weryfikacja większej liczby tekstów po prostu nie istnieje, a to na darmowych skanach opiera się szkolna i rekrutacyjna praktyka.

Dlaczego detektor strzela, zamiast wykrywać

Większość detektorów opiera się na dwóch miarach. Perplexity: jak przewidywalne jest każde kolejne słowo dla modelu językowego. Burstiness: jak bardzo zdania różnią się między sobą długością i budową. Tekst przewidywalny i równy = „AI”. Tekst nieprzewidywalny i nierówny = „człowiek”. Nowsze narzędzia dokładają wytrenowane klasyfikatory, ale fundament zostaje ten sam. Polski akcent: na identycznej zasadzie (perplexity) działa JSA - system antyplagiatowy, którym od lutego 2024 polskie uczelnie sprawdzają prace dyplomowe. Politechnika Warszawska deklaruje, że przez ten filtr przechodzi automatycznie każda praca wgrana do systemu.

Problem w tym, że „równo i przewidywalnie” pisze mnóstwo ludzi. Encyklopedysta. Prawnik. Naukowiec. Student, który wykuł strukturę eseju. Osoba pisząca w obcym języku, trzymająca się bezpiecznych konstrukcji. Osoba w spektrum autyzmu, która wypracowała stały schemat wypowiedzi.

Nauka zna skalę tego problemu od dawna:

  • OpenAI wycofało własny detektor po pół roku (lipiec 2023). Oficjalny powód: „niska skuteczność”. Liczby z ich strony: wykrywał 26% tekstów AI, a 9% ludzkich oznaczał błędnie jako AI. Firma, która stworzyła ChatGPT, nie umiała go wykrywać - i miała odwagę to przyznać.
  • Stanford (Liang i zespół, 2023): siedem detektorów, 91 esejów TOEFL pisanych przez ludzi. Średnio 61,3% esejów osób niepiszących natywnie po angielsku oznaczono jako AI; jeden detektor oskarżył 97,8% z nich. Eseje amerykańskich ósmoklasistów - niemal bezbłędnie „human”. Detektory karzą prostszą składnię, nie oszustwo.
  • Przegląd 14 narzędzi (Weber-Wulff i zespół, 2023), w tym Turnitin: werdykt „ani dokładne, ani wiarygodne”.
  • Turnitin deklaruje poniżej 1% fałszywych alarmów na poziomie dokumentu. Uniwersytet Vanderbilta policzył, co to znaczy przy 75 tysiącach prac rocznie: około 750 niesłusznie oskarżonych studentów co roku. Wyłączyli detektor w 2023 i nie wrócili.
  • Bloomberg (2024) przepuścił przez GPTZero i Copyleaks 500 esejów aplikacyjnych sprzed ery ChatGPT: 1-2% fałszywych oskarżeń - czasem z „niemal 100-procentową pewnością”. Wśród opisanych przypadków: studentka w spektrum autyzmu oskarżona o oszustwo, bo jej staranny, powtarzalny styl „wyglądał na AI”.

Skala po drugiej stronie też jest realna - brytyjski Guardian doliczył się w roku akademickim 2023/24 około 7 tysięcy udowodnionych przypadków oszustw z AI na uczelniach (5,1 na 1000 studentów). Problem istnieje. Tyle że narzędzie, którym próbujemy go łapać, myli Sienkiewicza z ChatGPT.

Mechanikę modeli językowych - czemu w ogóle „przewidują słowa” - rozbieram w przewodniku po tym, jak naprawdę działa AI. Tu wystarczy wniosek: detektor to test statystycznego podobieństwa stylu, sprzedawany jako test autorstwa.

Redakcja rozbraja detektor w kwadrans

Najciekawsza część eksperymentu to trzy wersje tych samych czterech tekstów.

Surowe AI wpadło w ZeroGPT z hukiem: 73,6-100%. Wystarczyła jednak lekka redakcja - zmieniony szyk, scalone zdania, kilka synonimów, zero zmian w treści - i dwa teksty z czterech zeszły do 0% („Your Text is Human written”). Po pełnej redakcji (wycięte frazy-sygnatury AI, przebudowana struktura, zmienny rytm zdań) na zero zeszły wszystkie cztery.

Badacze pokazali to samo w większej skali: w benchmarku RAID podmiana znaków na homoglify obniżała skuteczność detektorów średnio o 40,6 punktu procentowego, a rekurencyjna parafraza potrafi zbić wykrywalność watermarku z 99% do 15%. Miary się różnią, wniosek nie: każda warstwa obróbki oddala tekst od „sygnatury” AI.

Złóż to w całość, a wyjdzie paradoks detektorów w jednym zdaniu: wykrywają tylko tych, którym nie chciało się nawet raz przeczytać własnego tekstu - a karzą tych, którzy piszą starannie i równo.

Zasada z tego testu
Świadomy oszust przechodzi przez detektor w 15 minut. Wpada uczciwy autor o równym stylu.
Narzędzie, które przepuszcza winnych i wskazuje niewinnych, nie nadaje się na dowód. Nadaje się co najwyżej na poszlakę.

Po czym NAPRAWDĘ poznać tekst z AI (i czego to nie dowodzi)

Redaguję teksty pisane z AI codziennie i prowadzę własną stop-listę zwrotów, które wycinam, bo zdradzają maszynę. To poszlaki - mocniejsze niż score z detektora, bo przynajmniej wiesz, NA CO patrzysz. Sygnały językowe, po polsku:

  • Frazy-wytrychy: „w dzisiejszym świecie”, „warto zauważyć”, „kluczowe znaczenie”, „kompleksowe rozwiązanie”, „odkryj nowy wymiar”, „to nie tylko X, ale także Y”.
  • Rytuał podsumowania: akapit zaczynający się od „Podsumowując,” z obowiązkową nutą optymizmu. W moich surowych próbkach AI wystąpił w 4 tekstach na 4.
  • Triady: „cierpliwość, systematyczność i pozytywne nastawienie”. Model uwielbia wyliczać trójkami.
  • Symetryczne zestawienia: „zarówno dla początkujących, jak i wymagających koneserów”, „nie tylko oszczędność, ale także wkład w ochronę środowiska”.
  • Idealna równość: akapity po 3-4 zdania jak od linijki, każdy z tezą na początku i miękkim domknięciem. Zero literówek, zero potknięć, zero ryzyka.
  • Brak ciała: żadnej daty z życia, kwoty z faktury, nazwy ulicy, wpadki, ironii, urazy. Tekst o wszystkim i o niczym - poprawny jak formularz.

Teraz część, którą poradniki pomijają: czego te sygnały nie dowodzą. Ludzie też tak piszą - zwłaszcza po korporacyjnych szkoleniach z „profesjonalnej komunikacji”, które od dekad uczą dokładnie tych fraz. Obecność trzech wytrychów to sygnał do rozmowy, nie do oskarżenia. Dokładnie tak samo jak wynik „92% AI” z narzędzia, które przed chwilą oskarżyło Wikipedię.

Co robić zamiast wierzyć w procent

Jeśli sprawdzasz (nauczyciel, promotor, rekruter, redaktor): score może najwyżej otworzyć rozmowę - nigdy jej zamknąć. Realną wiedzę dają: historia zmian dokumentu (Google Docs i Word pokazują ją za darmo), wersje robocze, pięć minut rozmowy o decyzjach w tekście („czemu ten argument tu?”, „co znaczy to pojęcie?”, „co byś wyciął?”). Autor własnego tekstu odpowiada bez wahania. Dyrektor OPI, którego system JSA sprawdza polskie prace dyplomowe, mówi zresztą wprost: narzędzie „nie daje stuprocentowej pewności”, decyzja należy do promotora. Skoro taką pokorę deklaruje operator systemu, tym bardziej powinna obowiązywać każdego z detektorem w przeglądarce.

Jeśli jesteś sprawdzany: pisz w narzędziu z historią zmian i jej nie kasuj - to twoje alibi. Po fałszywym oskarżeniu żądaj wskazania metody i jej udokumentowanej skuteczności dla języka polskiego. Dla żadnego z testowanych narzędzi taki dokument nie istnieje - Senuto szacuje margines błędu detektorów dla polskiego na 10-15%, a GPTZero polskiego oficjalnie nie obsługuje w ogóle.

Jeśli publikujesz (marketer, wydawca): pytanie „czy to pisała AI” jest mniej ważne niż dwa inne - czy treść jest prawdziwa i czy ktoś wziął za nią odpowiedzialność. Fałszywe liczby w tekście to realna szkoda niezależnie od autora; pisałem o tym w przewodniku po halucynacjach AI. Autentyczność głosu buduje się inaczej niż score'em - o tym z kolei tekst o marce osobistej w czasach AI.

AI Act: od sierpnia prawo przestaje wierzyć w detektory

Unijna regulacja podchodzi do problemu dokładnie odwrotnie niż detektory - i to jest najciekawsza zmiana tego roku.

Od 2 sierpnia 2026 obowiązują przepisy o przejrzystości z art. 50 AI Act: dostawcy systemów generujących tekst, obraz, audio i wideo mają oznaczać wygenerowane treści w formacie czytelnym maszynowo, a podmioty publikujące deepfake'i - ujawniać ich sztuczność. Za naruszenia grozi do 15 mln euro lub 3% światowego obrotu. Dla systemów działających na rynku przed tą datą trwają prace nad okresem przejściowym (pakiet „AI Omnibus” przewiduje czas do grudnia 2026 na wdrożenie znakowania).

Kierunek jest jednoznaczny: oznaczanie u źródła zamiast zgadywania po fakcie. Technologia do tego istnieje od dawna - Google opisał w „Nature” watermark SynthID przetestowany na 20 milionach odpowiedzi Gemini, a OpenAI według doniesień „Wall Street Journal” ma gotowy znak wodny dla ChatGPT o deklarowanej skuteczności 99,9%. Nie wypuściło go, bo w ankiecie prawie 30% użytkowników zapowiedziało, że przy włączonym znakowaniu używaliby narzędzia rzadziej. Wniosek zostawiam tobie.

Jest jeszcze jeden zapis, który wart jest zapamiętania: obowiązek oznaczania nie obejmuje tekstu, który przeszedł ludzką redakcję i za który odpowiedzialność redakcyjną bierze wydawca. Prawo mówi więc to samo, co mój eksperyment: granica nie przebiega między „pisał człowiek” a „pisała maszyna”, tylko między treścią, za którą ktoś odpowiada, a treścią wypuszczoną bez kontroli.

Ograniczenia tego testu

Uczciwość wymaga wyliczenia słabości. Próba była mała: 20 tekstów, 34 pomiary, jeden język. Wszystkie próbki AI pochodziły z jednej rodziny modeli (Claude) - inne modele mogą mieć inne „sygnatury”. Redakcję wersji K4/K5 wykonałem swoim procesem redakcyjnym, narzędziowo - mierzyłem wpływ obróbki, nie tożsamość redaktora. Darmowe limity ucięły test QuillBota i isgen na próbkach AI, więc ich zdolności wykrywania nie oceniam. Wyniki dotyczą wersji narzędzi z 6 lipca 2026 - detektory zmieniają modele bez zapowiedzi, czasem między dwoma kolejnymi skanami, co sam zaobserwowałem. Pochodzenie każdej próbki opisałem wyżej na tyle dokładnie, że test można powtórzyć niezależnie - i do tego zachęcam.

Wynik detektora to opinia algorytmu o stylu. Traktuj ją najwyżej jak plotkę: czasem coś w niej jest, ale karier się na plotkach nie kończy.

Co dalej
Jak pracować z AI tak, żeby tekst bronił się treścią, a nie zgadywanką o autorstwie - od promptów po weryfikację faktów - uczę krok po kroku w darmowym kursie Claude AI.
Oskarżono cię kiedyś na podstawie detektora? Napisz do mnie - zbieram polskie przypadki. Wnioski z takich testów wysyłam w newsletterze, zapis niżej.
Mateusz Czech - autor bloga

Autor

Mateusz Czech // Czechu

AI Senior Digital Product Specialist w grupie Górskie Resorty. Projektuję i wdrażam aplikacje oparte na AI dla sprzedaży i obsługi klienta w hotelach. Wcześniej w SentiOne współtworzyłem voicebota InfoNina dla Alior Banku (Celent Model Bank Awards 2022). Piszę o wdrożeniach AI na czechu.blog. Prywatnie gram w tenisa i słucham polskiego rapu.

Powiązane artykuły

Co jeszcze warto przeczytać

Newsletter Strategic AI Implementation

Co tydzień jeden framework, jedno case study, zero spamu

Dołącz do listy. Dostajesz to, czego nie wrzucam na bloga: kulisy moich wdrożeń, sprawdzone prompty, błędy do uniknięcia. Wypisujesz się jednym kliknięciem.