Halucynacje AI: dlaczego AI zmyśla najpewniej wtedy, gdy brzmi najpewniej
W marcu tego roku zapytałem Claude Opus 4.7 o prostą rzecz: ilu turystów rocznie odwiedza Szklarską Porębę. Odpowiedź przyszła w dwie sekundy: „około 2,1 mln rocznie według danych GUS”.
Konkretna liczba. Znane źródło. Ton eksperta.
Sprawdziłem. GUS w ogóle nie publikuje liczby turystów dla pojedynczej gminy - tajemnica statystyczna wymusza agregację od poziomu powiatu w górę. Liczba była zmyślona. Przypis też.
Najgroźniejsza halucynacja AI to nie ta, która brzmi absurdalnie - tę wyłapiesz od razu. Najgroźniejsza jest ta, która brzmi jak prawda i podaje źródło.
Ten tekst to nie kolejna definicja z poradą „weryfikuj odpowiedzi”. Buduję systemy, w których zmyślona liczba nie ma prawa wejść do raportu - i regularnie oglądam, jak weryfikatory łapią błędy, których sam bym nie zauważył. Pokażę ci, ile halucynacje kosztują w realnych pieniądzach, kiedy zdarzają się najczęściej i jak wygląda obrona: od nawyku za zero złotych po architekturę, która wycięła 33-procentowy błąd, zanim ktokolwiek go zobaczył.
Cennik zmyśleń: od 812 dolarów kanadyjskich do 15,5 miliona złotych
Halucynacje przestały być ciekawostką z konferencji. Mają już orzecznictwo, kwoty i sygnatury akt.
| Kto | Co zmyśliło AI | Rachunek |
|---|---|---|
| Prawnik z Nowego Jorku (Mata v. Avianca, 2023) | 6 orzeczeń sądowych, których nigdy nie było | 5 tys. USD kary |
| Air Canada (2024) | Chatbot obiecał zniżkę żałobną wbrew regulaminowi | 812 CAD + precedens |
| Deloitte Australia (2025) | Raport dla rządu ze zmyślonym cytatem z wyroku i nieistniejącymi publikacjami naukowymi | zwrot ponad 97 tys. AUD |
| Exdrog, przetarg na drogi w Małopolsce (2025) | 280 stron wyjaśnień ceny z nieistniejącymi interpretacjami podatkowymi | wykluczenie z przetargu na 15,5 mln zł |
| Prezes spółki IT, Wrocław (2025) | Pozew z ChatGPT mylił reżimy prawne i przeinaczał treść istniejących przepisów | powództwo oddalone w całości |
Dwie z tych spraw są polskie. Krajowa Izba Odwoławcza wykluczyła wykonawcę, bo wyjaśnienia rażąco niskiej ceny oparł na wygenerowanych przez AI interpretacjach podatkowych, które nie istnieją (sprawa opisana pod sygnaturą KIO 3347/25). Sąd Okręgowy we Wrocławiu oddalił z kolei pozew, który prezes spółki IT napisał sobie ChatGPT - model pomylił reżimy prawne i „poprawił” treść przepisów.
Skala rośnie szybciej, niż branża lubi przyznawać. Baza AI Hallucination Cases, prowadzona przez badacza Damiena Charlotina, do maja 2026 zebrała około 1,5 tys. orzeczeń, w których sądy stwierdziły zmyślone przez AI treści w pismach procesowych. Rekord padł 31 marca 2026: 17 takich orzeczeń jednego dnia, w samych Stanach.
Mechanizm wpadki jest wszędzie ten sam. Badanie KPMG i Uniwersytetu w Melbourne na 48 tys. pracowników w 47 krajach: 66% używa wyników AI bez sprawdzenia, 56% przyznaje, że przez AI popełniło błąd w pracy, a 57% przedstawia treści od AI jako własne. Politykę użycia AI ma 40% firm. Reszta dowiaduje się o problemie z faktury.
Wspólny mianownik całej tabeli: żadna z tych treści nie wyglądała na błąd. Wszystkie brzmiały profesjonalnie.
Dlaczego AI brzmi pewnie, kiedy zgaduje
Model językowy nie sięga do bazy faktów, bo żadnej nie ma. Generuje tekst, który statystycznie pasuje do pytania. Fraza „według danych GUS” występuje w tysiącach polskich tekstów o liczbach - dlatego model dokleja ją tam, gdzie stylistycznie pasuje. Nie sprawdza, czy GUS cokolwiek takiego publikuje, bo nie ma czym sprawdzić. Pełną mechanikę rozbieram w przewodniku po tym, jak naprawdę działa AI - tutaj wystarczą dwa fakty z badań.
Fakt pierwszy: statystyka. We wrześniu 2025 badacze OpenAI opublikowali pracę „Why Language Models Hallucinate” z twardym wynikiem - halucynacje powstają z „naturalnej presji statystycznej”, nawet gdyby dane treningowe były bezbłędne. Kluczowy jest los faktów rzadkich: jeśli 20% dat urodzin występuje w danych treningowych dokładnie raz, model bazowy zmyśli co najmniej 20% z nich. Autorzy sprawdzili to na sobie. Zapytany o datę urodzin jednego z nich, model open source podał trzy różne błędne daty w trzech próbach.
Fakt drugi: ekonomia testów. Większość benchmarków - czyli testów porównawczych, którymi ściga się branża - daje 0 punktów za „nie wiem”, dokładnie tyle, co za odpowiedź błędną. Zgadywanie ma więc dodatnią wartość oczekiwaną. Model, który blefuje, wygrywa ranking z modelem, który uczciwie milczy.
W karcie systemowej GPT-5 z sierpnia 2025 jest tabela, którą powinien zobaczyć każdy kupujący „najlepszy model z rankingu”. Na teście faktograficznym SimpleQA model o4-mini osiągnął wyższą trafność niż gpt-5-thinking-mini: 24% wobec 22%. Ten sam o4-mini halucynował przy tym w 75% odpowiedzi. Konkurent - w 26%. Prymus rankingu okazał się notorycznym blagierem, bo strzelał zawsze, a wstrzymywał się nigdy.
Część badaczy uważa zresztą, że słowo „halucynacja” jest mylące. Zespół z Oksfordu w „Nature” (czerwiec 2024) proponuje „konfabulacje” - termin z psychologii pamięci, oznaczający wypełnianie luk zmyśleniami bez intencji kłamstwa. Geoffrey Hinton mówi podobnie. Nazwa mniej efektowna, za to precyzyjna: model nie widzi zjaw. Uzupełnia brakującą wiedzę najbardziej prawdopodobną zmyłką.
Mapa ryzyka: kiedy AI zmyśla najczęściej
Halucynacje nie rozkładają się równomiernie. W moich pipeline'ach łapię je w pięciu strefach.
Strefa 1: liczby, ceny, statystyki
Weryfikator w moim pipelinie researchu wyłapał w jednym przebiegu: cenę biletu Dinolandii zawyżoną o jedną trzecią (raport podawał 100 zł, oficjalny cennik - 75 zł), cenę Energylandii zaniżoną o 10% i proporcję „3,6 razy” tam, gdzie poprawny wynik to 4,3. Ostatni błąd to czysta arytmetyka - model nie liczy, model generuje coś, co wygląda jak wynik liczenia.
Zasada praktyczna: jeśli liczba ma konsekwencje, czat jest ostatnim miejscem, z którego ją bierzesz.
Strefa 2: cytaty, źródła, orzeczenia
Zmyślone orzeczenie ze sprawy Avianca nazywało się „Varghese v. China Southern Airlines”. Brzmi idealnie - i o to chodzi. Model generuje nazwę o strukturze prawdziwej sygnatury, nie odwołanie do rejestru.
Tryb „z dostępem do internetu” zmniejsza ryzyko, ale go nie wyłącza. Centrum Tow przy Columbia Journalism Review przetestowało w marcu 2025 osiem narzędzi AI z wyszukiwaniem na 1 600 zapytaniach o cytaty z prasy: ponad 60% odpowiedzi było błędnych, a dwa narzędzia podawały więcej zmyślonych linków niż prawdziwych.
Strefa 3: fakty niszowe
Im rzadziej fakt występuje w internecie, tym pewniej model go zmyśli - dokładnie to pokazuje wyliczenie OpenAI o faktach występujących w danych treningowych tylko raz. Data urodzin mało znanej osoby, parametr niszowego urządzenia, cennik małego parku rozrywki, historia twojej branży w twoim mieście.
Pytania o oczywistości są bezpieczne. Sęk w tym, że pytania, na które naprawdę potrzebujesz odpowiedzi, rzadko dotyczą oczywistości.
Strefa 4: treści po polsku
Badanie halucynacji na biografiach w 19 językach (październik 2024) pokazało wyraźny wzorzec: modele zmyślają istotnie częściej w językach o mniejszych zasobach treningowych niż angielski. Kolejna praca (styczeń 2026) dodaje, że w tych językach gorzej działają także automatyczne detektory halucynacji. Recenzowanego benchmarku dla polskiego wciąż nie ma - mówię to wprost, zamiast zmyślać liczbę. W prasowym teście modeli po polsku (Computerworld, 2026) jeden z nich wygenerował za to nieistniejące ulgi podatkowe. Anegdota, nie pomiar - ale idealnie spójna ze wzorcem.
Skalę ekspozycji widać w dwóch polskich liczbach. ChatGPT miał w październiku 2025 ponad 10 mln realnych użytkowników w Polsce (Mediapanel). Jednocześnie według GUS tylko 8,7% firm deklarowało w 2025 wykorzystanie AI. Miliony osób używają więc AI prywatnie i wnoszą ją do pracy bocznymi drzwiami - bez procedur, bez weryfikacji, bez świadomości stref ryzyka.
Moja Szklarska Poręba to podręcznikowy zbieg wszystkich czynników naraz: polski, lokalny, niszowy fakt plus wiarygodnie brzmiąca instytucja.
Strefa 5: raporty z pracy, której nie było
Osobna klasa zmyśleń dotyczy agentów AI - systemów, które wykonują zadania, a nie tylko piszą. Model potrafi zaraportować, że „sprawdził kalendarz” albo „uruchomił testy”, choć nie miał jak. Anthropic mierzy to wprost: starszy Sonnet 4.6 nie zmyślał działania niedostępnych narzędzi tylko w 31% przypadków, Opus 4.8 - już w 95%. Postęp jest realny. Pozostałe 5% przy setkach uruchomień tygodniowo to nie margines, tylko statystyczna pewność wpadki. Pisałem o tym szerzej w tekście o Claude Opus 4.8.
Czy nowe modele zmyślają mniej
Uczciwa odpowiedź: tak, ale nierówno - i nie do zera.
Wiosną 2025 OpenAI zaliczyło wpadkę, która dobrze kalibruje oczekiwania. Nowy wtedy model o3 halucynował na firmowym teście PersonQA w 33% odpowiedzi - dwa razy częściej niż starszy o1 (16%). Nowszy nie znaczy wierniejszy. Dopiero GPT-5 w trybie thinking zbił ten wskaźnik o 65% względem o3 (dane z karty systemowej, sierpień 2025).
Aktualny obraz daje leaderboard halucynacji Vectary, mierzący zmyślenia przy streszczaniu dokumentów (stan: maj 2026). Najlepsze modele schodzą do 1,8-3,3%. Ogon stawki: 23-24%. W trójce najgorszych siedzi o3-pro - model „rozumujący” za dopłatą. Głębsze myślenie nie chroni przed zmyślaniem, bo zmyślanie nie jest błędem myślenia. Jest właściwością generowania.
Anthropic poszedł inną drogą niż reszta: zamiast dokładać wiedzy, uczy model wstrzymywać się od odpowiedzi. Opus 4.8 osiągnął najniższy odsetek błędnych odpowiedzi ze wszystkich sześciu porównywanych modeli na czterech testach wiedzy nie dlatego, że wie więcej - dlatego, że częściej mówi „nie wiem”.
Stan na lipiec 2026: domyślnym modelem ChatGPT jest GPT-5.5, Anthropic oferuje Opus 4.8 i Fable 5, Google - Gemini 3.1 Pro. Żaden producent nie deklaruje zera halucynacji dla żadnego z nich.
Przelicz to na swoją pracę. Przy trzech streszczeniach dziennie najlepszy model zmyśli ci coś raz-dwa razy w miesiącu. Najgorszy - około pięciu razy w tygodniu. W obu przypadkach zmyślenie będzie brzmiało dokładnie tak samo pewnie jak reszta tekstu. Pytanie nie brzmi „czy AI zmyśla”, tylko „czy twój proces to wyłapie”.
Siedem warstw obrony: od darmowej do pancernej
Rada „weryfikuj odpowiedzi AI” jest bezwartościowa, bo nie mówi ani jak, ani kiedy, ani za ile. Obrona działa warstwami. Każda kolejna kosztuje więcej i włącza się przy wyższej stawce.
Warstwa 1: przestaw domyślne założenie (koszt: 0 zł)
Liczba z czatu to hipoteza, nie fakt. Tyle. Większość wpadek z tabeli na górze zaczęła się od odwrotnego założenia: skoro brzmi dobrze, jest dobrze. Pamiętaj o proporcjach z badania KPMG - 66% ludzi nie sprawdza wcale. Sama zmiana nastawienia wyprzedza dwie trzecie rynku.
Warstwa 2: karm materiałem, nie pamięcią (koszt: 2 minuty)
Zamiast pytać model „z głowy”, wklej mu dokument, cennik, raport - i każ odpowiadać wyłącznie na jego podstawie. W branży ta technika nazywa się RAG (retrieval-augmented generation, generowanie wsparte wyszukiwaniem), ale jej domowa wersja to po prostu „najpierw materiał, potem pytanie”.
Dane z medycyny pokazują siłę i granicę tej warstwy. W konsultacjach radiologicznych ugruntowanie na dokumentach ścięło halucynacje z 8% do zera, a dedykowany system dla zdrowia publicznego zredukował je o ponad 40%. W innym teście model z włączonym wyszukiwaniem nadal zmyślał w co czwartej odpowiedzi. Redukcja - tak. Eliminacja - nie.
Warstwa 3: przywróć prawo do „nie wiem” (koszt: 1 linijka promptu)
Trening ukarał model za przyznawanie się do niewiedzy. Lokalnie możesz to odwrócić jedną instrukcją: „Jeśli nie masz pewności, napisz wprost: nie wiem. Wolę brak odpowiedzi niż zgadywanie”. Dołóż pytanie kontrolne: „co w twojej odpowiedzi jest najmniej pewne?”. Badacze Meta pokazali w technice Chain-of-Verification, że wymuszenie na modelu samodzielnego sprawdzenia własnych twierdzeń poprawia trafność o mniej więcej jedną czwartą. To nie czyni modelu uczciwym. Zdejmuje mu za to premię za blef.
Warstwa 4: otwieraj każde źródło (koszt: 2 minuty)
Link to nie dowód - patrz wyniki testu ośmiu wyszukiwarek AI wyżej. Cytat czytasz w oryginale, sygnaturę sprawdzasz w rejestrze, cennik na stronie sprzedawcy. Pytanie do modelu „czy na pewno?” nie jest weryfikacją: model, który zmyślił, potwierdzi zmyślenie tym samym pewnym tonem.
Warstwa 5: drugi model na chłodno (koszt: 5 minut)
Otwórz świeżą sesję albo inny model i nadaj rolę: „Jesteś recenzentem. Znajdź w tym tekście twierdzenia bez pokrycia, błędy i liczby do sprawdzenia”. Świeża sesja nie zna uzasadnień, którymi pierwszy model obudował swoje odpowiedzi, więc nie broni cudzej pracy.
Przy okazji do kasacji popularny mit: obniżenie temperatury (parametru losowości) nie czyni odpowiedzi prawdziwszymi. W badaniu na dziewięciu modelach (EMNLP 2024) zmiana temperatury w zakresie 0,0-1,0 nie miała statystycznie istotnego wpływu na poprawność. Deterministyczne zmyślenie to nadal zmyślenie.
Warstwa 6: liczby tylko z systemów (koszt: dyscyplina)
Przy decyzjach z konsekwencjami źródłem liczby jest system: API urzędu, baza, oficjalny dokument, arkusz z księgowości. Model może liczbę skomentować, zinterpretować, osadzić w kontekście. Nie może jej dostarczyć. U mnie to reguła architektury, nie dobra praktyka: liczba bez URL-a źródła nie wchodzi do raportu.
Warstwa 7: izolowany weryfikator (koszt: osobny przebieg)
Przy najwyższej stawce - publikacja, oferta, budżet - weryfikację robi osobny agent, który nie widzi rozumowania autora. Dostaje sam wynik i samodzielnie odtwarza źródła. Nauka zna to od stuleci jako ślepą recenzję.
Rachunek się broni. Według badania BetterUp Labs i Stanforda naprawa jednego przypadku „workslopu” - treści od AI udającej porządną robotę - zajmuje średnio 1 godzinę 56 minut, a dostaje go co miesiąc 41% pracowników. Mój weryfikator potrzebuje minut i łapie błędy, zanim ktokolwiek straci na nie czas.
Jak to działa u mnie: liczba bez źródła nie istnieje
Do researchu statystycznego zbudowałem zespół ośmiu agentów z dziesięcioma bramkami jakości. Każda liczba w raporcie musi mieć URL źródła i kryptograficzny skrót odpowiedzi serwera. Na końcu wchodzi cold-blind weryfikator: agent odpalany w odizolowanym środowisku, bez dostępu do rozumowania reszty zespołu. Samodzielnie pobiera każdy URL jeszcze raz i porównuje dane z raportem. Pełną architekturę rozbieram w osobnym tekście o pipelinie researchu.
Po co ta artyleria? Dlatego, że działa na klasę błędu, a nie na pojedynczy błąd:
Te dwa odrzucone twierdzenia bolały najbardziej. Oba brzmiały świetnie i oba chciałem zacytować. Dokładnie dlatego system musi być silniejszy od pokusy - autor tekstu jest najgorszym weryfikatorem własnych ulubionych faktów. To samo zjawisko znasz z ludzi: najłatwiej wierzy się w to, co pasuje do tezy.
Granica opłacalności jest prosta. Burza mózgów, szkic, tekst na wewnętrzny czat - wystarczą warstwy 1-3. Architektura z weryfikatorem wchodzi tam, gdzie liczba idzie do klienta, do zarządu albo do internetu z moim nazwiskiem.
Nie traktuję tego jako nieufności wobec AI. Ta sama zasada obowiązuje wobec ludzi: ufaj i sprawdzaj. Różnica jest jedna - człowiek zmyśla z wysiłkiem, model bez.
Checklist: 60 sekund, zanim uwierzysz AI
Halucynacje nie znikną, bo są wpisane w sposób, w jaki te systemy generują tekst. Znikają za to z twoich raportów - w dniu, w którym przestajesz mylić pewny ton z prawdą i dajesz procesowi to, czego model nie ma: kontakt ze źródłem.
Autor
Mateusz Czech // Czechu
AI Senior Digital Product Specialist w grupie Górskie Resorty. Projektuję i wdrażam aplikacje oparte na AI dla sprzedaży i obsługi klienta w hotelach. Wcześniej w SentiOne współtworzyłem voicebota InfoNina dla Alior Banku (Celent Model Bank Awards 2022). Piszę o wdrożeniach AI na czechu.blog. Prywatnie gram w tenisa i słucham polskiego rapu.
Tagi
Powiązane artykuły
Co jeszcze warto przeczytać
Statystyki-zombie o AI. Znalazłem je także we własnych tekstach
Liczby o AI, które krążą bez źródła albo mówią więcej niż źródło. Sześć mechanizmów, błędy z moich tekstów i 5 pytań przed wklejeniem liczby do prezentacji.
Jak naprawdę działa AI - przewodnik dla ludzi, którzy używają, ale nie rozumieją
Dlaczego AI halucynuje i czemu ten sam prompt daje różne wyniki? Mechanika modeli językowych wyjaśniona bez żargonu, z analogiami i danymi.
Jak zaplanować wycieczkę z AI i zbudować własny planer podróży
Rzym zaplanowany w tydzień: AI rozpisało dni, pilnowało biletów i zbudowało planer z mapą. Co oddaję AI, a co sprawdzam podwójnie. Z gotowym promptem.
Newsletter Strategic AI Implementation
Co tydzień jeden framework, jedno case study, zero spamu
Dołącz do listy. Dostajesz to, czego nie wrzucam na bloga: kulisy moich wdrożeń, sprawdzone prompty, błędy do uniknięcia. Wypisujesz się jednym kliknięciem.