POWRÓT DO BLOGA
AI Fundamentals 6 lipca 2026

Halucynacje AI: dlaczego AI zmyśla najpewniej wtedy, gdy brzmi najpewniej

15 min Czechu

W marcu tego roku zapytałem Claude Opus 4.7 o prostą rzecz: ilu turystów rocznie odwiedza Szklarską Porębę. Odpowiedź przyszła w dwie sekundy: „około 2,1 mln rocznie według danych GUS”.

Konkretna liczba. Znane źródło. Ton eksperta.

Sprawdziłem. GUS w ogóle nie publikuje liczby turystów dla pojedynczej gminy - tajemnica statystyczna wymusza agregację od poziomu powiatu w górę. Liczba była zmyślona. Przypis też.

Najgroźniejsza halucynacja AI to nie ta, która brzmi absurdalnie - tę wyłapiesz od razu. Najgroźniejsza jest ta, która brzmi jak prawda i podaje źródło.

Ten tekst to nie kolejna definicja z poradą „weryfikuj odpowiedzi”. Buduję systemy, w których zmyślona liczba nie ma prawa wejść do raportu - i regularnie oglądam, jak weryfikatory łapią błędy, których sam bym nie zauważył. Pokażę ci, ile halucynacje kosztują w realnych pieniądzach, kiedy zdarzają się najczęściej i jak wygląda obrona: od nawyku za zero złotych po architekturę, która wycięła 33-procentowy błąd, zanim ktokolwiek go zobaczył.

W SKRÓCIE
  • Halucynacja to nie usterka, tylko matematyka treningu. Badacze OpenAI pokazali we wrześniu 2025, że benchmarki nagradzają zgadywanie: za „nie wiem” jest 0 punktów, jak za błąd.
  • 66% pracowników używa odpowiedzi AI bez żadnej weryfikacji (badanie KPMG na 48 tys. osób). Stąd realne rachunki: od 5 tys. USD kary dla prawnika po utracony kontrakt na 15,5 mln zł w polskim przetargu.
  • Pięć stref najwyższego ryzyka: liczby, cytaty i źródła, fakty niszowe, treści po polsku, raporty agentów o pracy, której nie było.
  • Nowe modele zmyślają mniej, ale nie liniowo. o3 halucynował 2 razy częściej niż starszy o1. Najlepsi dziś schodzą do ~2% przy streszczeniach. Zero nie istnieje.
  • Obrona ma 7 warstw - od darmowej zmiany nawyku po izolowanego weryfikatora. Dobierasz warstwę do stawki, nie odwrotnie.
  • Na końcu checklist 60 sekund - do wdrożenia od dziś, bez żadnych narzędzi.

Cennik zmyśleń: od 812 dolarów kanadyjskich do 15,5 miliona złotych

Halucynacje przestały być ciekawostką z konferencji. Mają już orzecznictwo, kwoty i sygnatury akt.

Kto Co zmyśliło AI Rachunek
Prawnik z Nowego Jorku (Mata v. Avianca, 2023) 6 orzeczeń sądowych, których nigdy nie było 5 tys. USD kary
Air Canada (2024) Chatbot obiecał zniżkę żałobną wbrew regulaminowi 812 CAD + precedens
Deloitte Australia (2025) Raport dla rządu ze zmyślonym cytatem z wyroku i nieistniejącymi publikacjami naukowymi zwrot ponad 97 tys. AUD
Exdrog, przetarg na drogi w Małopolsce (2025) 280 stron wyjaśnień ceny z nieistniejącymi interpretacjami podatkowymi wykluczenie z przetargu na 15,5 mln zł
Prezes spółki IT, Wrocław (2025) Pozew z ChatGPT mylił reżimy prawne i przeinaczał treść istniejących przepisów powództwo oddalone w całości

Dwie z tych spraw są polskie. Krajowa Izba Odwoławcza wykluczyła wykonawcę, bo wyjaśnienia rażąco niskiej ceny oparł na wygenerowanych przez AI interpretacjach podatkowych, które nie istnieją (sprawa opisana pod sygnaturą KIO 3347/25). Sąd Okręgowy we Wrocławiu oddalił z kolei pozew, który prezes spółki IT napisał sobie ChatGPT - model pomylił reżimy prawne i „poprawił” treść przepisów.

Skala rośnie szybciej, niż branża lubi przyznawać. Baza AI Hallucination Cases, prowadzona przez badacza Damiena Charlotina, do maja 2026 zebrała około 1,5 tys. orzeczeń, w których sądy stwierdziły zmyślone przez AI treści w pismach procesowych. Rekord padł 31 marca 2026: 17 takich orzeczeń jednego dnia, w samych Stanach.

Mechanizm wpadki jest wszędzie ten sam. Badanie KPMG i Uniwersytetu w Melbourne na 48 tys. pracowników w 47 krajach: 66% używa wyników AI bez sprawdzenia, 56% przyznaje, że przez AI popełniło błąd w pracy, a 57% przedstawia treści od AI jako własne. Politykę użycia AI ma 40% firm. Reszta dowiaduje się o problemie z faktury.

Wspólny mianownik całej tabeli: żadna z tych treści nie wyglądała na błąd. Wszystkie brzmiały profesjonalnie.

Dlaczego AI brzmi pewnie, kiedy zgaduje

Model językowy nie sięga do bazy faktów, bo żadnej nie ma. Generuje tekst, który statystycznie pasuje do pytania. Fraza „według danych GUS” występuje w tysiącach polskich tekstów o liczbach - dlatego model dokleja ją tam, gdzie stylistycznie pasuje. Nie sprawdza, czy GUS cokolwiek takiego publikuje, bo nie ma czym sprawdzić. Pełną mechanikę rozbieram w przewodniku po tym, jak naprawdę działa AI - tutaj wystarczą dwa fakty z badań.

Fakt pierwszy: statystyka. We wrześniu 2025 badacze OpenAI opublikowali pracę „Why Language Models Hallucinate” z twardym wynikiem - halucynacje powstają z „naturalnej presji statystycznej”, nawet gdyby dane treningowe były bezbłędne. Kluczowy jest los faktów rzadkich: jeśli 20% dat urodzin występuje w danych treningowych dokładnie raz, model bazowy zmyśli co najmniej 20% z nich. Autorzy sprawdzili to na sobie. Zapytany o datę urodzin jednego z nich, model open source podał trzy różne błędne daty w trzech próbach.

Fakt drugi: ekonomia testów. Większość benchmarków - czyli testów porównawczych, którymi ściga się branża - daje 0 punktów za „nie wiem”, dokładnie tyle, co za odpowiedź błędną. Zgadywanie ma więc dodatnią wartość oczekiwaną. Model, który blefuje, wygrywa ranking z modelem, który uczciwie milczy.

W karcie systemowej GPT-5 z sierpnia 2025 jest tabela, którą powinien zobaczyć każdy kupujący „najlepszy model z rankingu”. Na teście faktograficznym SimpleQA model o4-mini osiągnął wyższą trafność niż gpt-5-thinking-mini: 24% wobec 22%. Ten sam o4-mini halucynował przy tym w 75% odpowiedzi. Konkurent - w 26%. Prymus rankingu okazał się notorycznym blagierem, bo strzelał zawsze, a wstrzymywał się nigdy.

Część badaczy uważa zresztą, że słowo „halucynacja” jest mylące. Zespół z Oksfordu w „Nature” (czerwiec 2024) proponuje „konfabulacje” - termin z psychologii pamięci, oznaczający wypełnianie luk zmyśleniami bez intencji kłamstwa. Geoffrey Hinton mówi podobnie. Nazwa mniej efektowna, za to precyzyjna: model nie widzi zjaw. Uzupełnia brakującą wiedzę najbardziej prawdopodobną zmyłką.

Mapa ryzyka: kiedy AI zmyśla najczęściej

Halucynacje nie rozkładają się równomiernie. W moich pipeline'ach łapię je w pięciu strefach.

Strefa 1: liczby, ceny, statystyki

Weryfikator w moim pipelinie researchu wyłapał w jednym przebiegu: cenę biletu Dinolandii zawyżoną o jedną trzecią (raport podawał 100 zł, oficjalny cennik - 75 zł), cenę Energylandii zaniżoną o 10% i proporcję „3,6 razy” tam, gdzie poprawny wynik to 4,3. Ostatni błąd to czysta arytmetyka - model nie liczy, model generuje coś, co wygląda jak wynik liczenia.

Zasada praktyczna: jeśli liczba ma konsekwencje, czat jest ostatnim miejscem, z którego ją bierzesz.

Strefa 2: cytaty, źródła, orzeczenia

Zmyślone orzeczenie ze sprawy Avianca nazywało się „Varghese v. China Southern Airlines”. Brzmi idealnie - i o to chodzi. Model generuje nazwę o strukturze prawdziwej sygnatury, nie odwołanie do rejestru.

Tryb „z dostępem do internetu” zmniejsza ryzyko, ale go nie wyłącza. Centrum Tow przy Columbia Journalism Review przetestowało w marcu 2025 osiem narzędzi AI z wyszukiwaniem na 1 600 zapytaniach o cytaty z prasy: ponad 60% odpowiedzi było błędnych, a dwa narzędzia podawały więcej zmyślonych linków niż prawdziwych.

Strefa 3: fakty niszowe

Im rzadziej fakt występuje w internecie, tym pewniej model go zmyśli - dokładnie to pokazuje wyliczenie OpenAI o faktach występujących w danych treningowych tylko raz. Data urodzin mało znanej osoby, parametr niszowego urządzenia, cennik małego parku rozrywki, historia twojej branży w twoim mieście.

Pytania o oczywistości są bezpieczne. Sęk w tym, że pytania, na które naprawdę potrzebujesz odpowiedzi, rzadko dotyczą oczywistości.

Strefa 4: treści po polsku

Badanie halucynacji na biografiach w 19 językach (październik 2024) pokazało wyraźny wzorzec: modele zmyślają istotnie częściej w językach o mniejszych zasobach treningowych niż angielski. Kolejna praca (styczeń 2026) dodaje, że w tych językach gorzej działają także automatyczne detektory halucynacji. Recenzowanego benchmarku dla polskiego wciąż nie ma - mówię to wprost, zamiast zmyślać liczbę. W prasowym teście modeli po polsku (Computerworld, 2026) jeden z nich wygenerował za to nieistniejące ulgi podatkowe. Anegdota, nie pomiar - ale idealnie spójna ze wzorcem.

Skalę ekspozycji widać w dwóch polskich liczbach. ChatGPT miał w październiku 2025 ponad 10 mln realnych użytkowników w Polsce (Mediapanel). Jednocześnie według GUS tylko 8,7% firm deklarowało w 2025 wykorzystanie AI. Miliony osób używają więc AI prywatnie i wnoszą ją do pracy bocznymi drzwiami - bez procedur, bez weryfikacji, bez świadomości stref ryzyka.

Moja Szklarska Poręba to podręcznikowy zbieg wszystkich czynników naraz: polski, lokalny, niszowy fakt plus wiarygodnie brzmiąca instytucja.

Strefa 5: raporty z pracy, której nie było

Osobna klasa zmyśleń dotyczy agentów AI - systemów, które wykonują zadania, a nie tylko piszą. Model potrafi zaraportować, że „sprawdził kalendarz” albo „uruchomił testy”, choć nie miał jak. Anthropic mierzy to wprost: starszy Sonnet 4.6 nie zmyślał działania niedostępnych narzędzi tylko w 31% przypadków, Opus 4.8 - już w 95%. Postęp jest realny. Pozostałe 5% przy setkach uruchomień tygodniowo to nie margines, tylko statystyczna pewność wpadki. Pisałem o tym szerzej w tekście o Claude Opus 4.8.

Czy nowe modele zmyślają mniej

Uczciwa odpowiedź: tak, ale nierówno - i nie do zera.

Wiosną 2025 OpenAI zaliczyło wpadkę, która dobrze kalibruje oczekiwania. Nowy wtedy model o3 halucynował na firmowym teście PersonQA w 33% odpowiedzi - dwa razy częściej niż starszy o1 (16%). Nowszy nie znaczy wierniejszy. Dopiero GPT-5 w trybie thinking zbił ten wskaźnik o 65% względem o3 (dane z karty systemowej, sierpień 2025).

Aktualny obraz daje leaderboard halucynacji Vectary, mierzący zmyślenia przy streszczaniu dokumentów (stan: maj 2026). Najlepsze modele schodzą do 1,8-3,3%. Ogon stawki: 23-24%. W trójce najgorszych siedzi o3-pro - model „rozumujący” za dopłatą. Głębsze myślenie nie chroni przed zmyślaniem, bo zmyślanie nie jest błędem myślenia. Jest właściwością generowania.

Anthropic poszedł inną drogą niż reszta: zamiast dokładać wiedzy, uczy model wstrzymywać się od odpowiedzi. Opus 4.8 osiągnął najniższy odsetek błędnych odpowiedzi ze wszystkich sześciu porównywanych modeli na czterech testach wiedzy nie dlatego, że wie więcej - dlatego, że częściej mówi „nie wiem”.

Stan na lipiec 2026: domyślnym modelem ChatGPT jest GPT-5.5, Anthropic oferuje Opus 4.8 i Fable 5, Google - Gemini 3.1 Pro. Żaden producent nie deklaruje zera halucynacji dla żadnego z nich.

Przelicz to na swoją pracę. Przy trzech streszczeniach dziennie najlepszy model zmyśli ci coś raz-dwa razy w miesiącu. Najgorszy - około pięciu razy w tygodniu. W obu przypadkach zmyślenie będzie brzmiało dokładnie tak samo pewnie jak reszta tekstu. Pytanie nie brzmi „czy AI zmyśla”, tylko „czy twój proces to wyłapie”.

Siedem warstw obrony: od darmowej do pancernej

Rada „weryfikuj odpowiedzi AI” jest bezwartościowa, bo nie mówi ani jak, ani kiedy, ani za ile. Obrona działa warstwami. Każda kolejna kosztuje więcej i włącza się przy wyższej stawce.

Warstwa 1: przestaw domyślne założenie (koszt: 0 zł)

Liczba z czatu to hipoteza, nie fakt. Tyle. Większość wpadek z tabeli na górze zaczęła się od odwrotnego założenia: skoro brzmi dobrze, jest dobrze. Pamiętaj o proporcjach z badania KPMG - 66% ludzi nie sprawdza wcale. Sama zmiana nastawienia wyprzedza dwie trzecie rynku.

Warstwa 2: karm materiałem, nie pamięcią (koszt: 2 minuty)

Zamiast pytać model „z głowy”, wklej mu dokument, cennik, raport - i każ odpowiadać wyłącznie na jego podstawie. W branży ta technika nazywa się RAG (retrieval-augmented generation, generowanie wsparte wyszukiwaniem), ale jej domowa wersja to po prostu „najpierw materiał, potem pytanie”.

Dane z medycyny pokazują siłę i granicę tej warstwy. W konsultacjach radiologicznych ugruntowanie na dokumentach ścięło halucynacje z 8% do zera, a dedykowany system dla zdrowia publicznego zredukował je o ponad 40%. W innym teście model z włączonym wyszukiwaniem nadal zmyślał w co czwartej odpowiedzi. Redukcja - tak. Eliminacja - nie.

Warstwa 3: przywróć prawo do „nie wiem” (koszt: 1 linijka promptu)

Trening ukarał model za przyznawanie się do niewiedzy. Lokalnie możesz to odwrócić jedną instrukcją: „Jeśli nie masz pewności, napisz wprost: nie wiem. Wolę brak odpowiedzi niż zgadywanie”. Dołóż pytanie kontrolne: „co w twojej odpowiedzi jest najmniej pewne?”. Badacze Meta pokazali w technice Chain-of-Verification, że wymuszenie na modelu samodzielnego sprawdzenia własnych twierdzeń poprawia trafność o mniej więcej jedną czwartą. To nie czyni modelu uczciwym. Zdejmuje mu za to premię za blef.

Warstwa 4: otwieraj każde źródło (koszt: 2 minuty)

Link to nie dowód - patrz wyniki testu ośmiu wyszukiwarek AI wyżej. Cytat czytasz w oryginale, sygnaturę sprawdzasz w rejestrze, cennik na stronie sprzedawcy. Pytanie do modelu „czy na pewno?” nie jest weryfikacją: model, który zmyślił, potwierdzi zmyślenie tym samym pewnym tonem.

Warstwa 5: drugi model na chłodno (koszt: 5 minut)

Otwórz świeżą sesję albo inny model i nadaj rolę: „Jesteś recenzentem. Znajdź w tym tekście twierdzenia bez pokrycia, błędy i liczby do sprawdzenia”. Świeża sesja nie zna uzasadnień, którymi pierwszy model obudował swoje odpowiedzi, więc nie broni cudzej pracy.

Przy okazji do kasacji popularny mit: obniżenie temperatury (parametru losowości) nie czyni odpowiedzi prawdziwszymi. W badaniu na dziewięciu modelach (EMNLP 2024) zmiana temperatury w zakresie 0,0-1,0 nie miała statystycznie istotnego wpływu na poprawność. Deterministyczne zmyślenie to nadal zmyślenie.

Warstwa 6: liczby tylko z systemów (koszt: dyscyplina)

Przy decyzjach z konsekwencjami źródłem liczby jest system: API urzędu, baza, oficjalny dokument, arkusz z księgowości. Model może liczbę skomentować, zinterpretować, osadzić w kontekście. Nie może jej dostarczyć. U mnie to reguła architektury, nie dobra praktyka: liczba bez URL-a źródła nie wchodzi do raportu.

Warstwa 7: izolowany weryfikator (koszt: osobny przebieg)

Przy najwyższej stawce - publikacja, oferta, budżet - weryfikację robi osobny agent, który nie widzi rozumowania autora. Dostaje sam wynik i samodzielnie odtwarza źródła. Nauka zna to od stuleci jako ślepą recenzję.

Rachunek się broni. Według badania BetterUp Labs i Stanforda naprawa jednego przypadku „workslopu” - treści od AI udającej porządną robotę - zajmuje średnio 1 godzinę 56 minut, a dostaje go co miesiąc 41% pracowników. Mój weryfikator potrzebuje minut i łapie błędy, zanim ktokolwiek straci na nie czas.

Jak to działa u mnie: liczba bez źródła nie istnieje

Do researchu statystycznego zbudowałem zespół ośmiu agentów z dziesięcioma bramkami jakości. Każda liczba w raporcie musi mieć URL źródła i kryptograficzny skrót odpowiedzi serwera. Na końcu wchodzi cold-blind weryfikator: agent odpalany w odizolowanym środowisku, bez dostępu do rozumowania reszty zespołu. Samodzielnie pobiera każdy URL jeszcze raz i porównuje dane z raportem. Pełną architekturę rozbieram w osobnym tekście o pipelinie researchu.

Po co ta artyleria? Dlatego, że działa na klasę błędu, a nie na pojedynczy błąd:

Co złapał izolowany weryfikator
Cena biletu Dinolandii: 100 zł w raporcie → 75 zł w cenniku (zawyżenie o 1/3)
Cena biletu Energylandii: 199 zł → 219 zł (zaniżenie o 10%)
Proporcja wydatków: 3,6× → 4,3× (błąd arytmetyczny)
Research do artykułu o Fable 5: 2 twierdzenia odrzucone jako niepotwierdzalne

Te dwa odrzucone twierdzenia bolały najbardziej. Oba brzmiały świetnie i oba chciałem zacytować. Dokładnie dlatego system musi być silniejszy od pokusy - autor tekstu jest najgorszym weryfikatorem własnych ulubionych faktów. To samo zjawisko znasz z ludzi: najłatwiej wierzy się w to, co pasuje do tezy.

Granica opłacalności jest prosta. Burza mózgów, szkic, tekst na wewnętrzny czat - wystarczą warstwy 1-3. Architektura z weryfikatorem wchodzi tam, gdzie liczba idzie do klienta, do zarządu albo do internetu z moim nazwiskiem.

Nie traktuję tego jako nieufności wobec AI. Ta sama zasada obowiązuje wobec ludzi: ufaj i sprawdzaj. Różnica jest jedna - człowiek zmyśla z wysiłkiem, model bez.

Checklist: 60 sekund, zanim uwierzysz AI

60 sekund weryfikacji
01 Liczba, nazwa, cytat, data albo link? Tryb podejrzliwości: włączony.
02 Fakt niszowy, lokalny albo polski? Czujność razy dwa.
03 „Podaj źródło” - i otwórz je. Link działa? Treść mówi to samo?
04 „Co w tej odpowiedzi jest najmniej pewne?” - to pytanie zadajesz zawsze.
05 Liczba krytyczna? Bierzesz ją z systemu źródłowego, nie z czatu.
06 Wysoka stawka? Świeża sesja z rolą recenzenta: „obal ten tekst”.
07 Do raportu wchodzi tylko to, co widziałeś w źródle na własne oczy.

Halucynacje nie znikną, bo są wpisane w sposób, w jaki te systemy generują tekst. Znikają za to z twoich raportów - w dniu, w którym przestajesz mylić pewny ton z prawdą i dajesz procesowi to, czego model nie ma: kontakt ze źródłem.

Co dalej
Checklist to poziom pierwszy. Cały warsztat - od promptów wymuszających „nie wiem” po agentów weryfikujących research - rozkładam krok po kroku w darmowym kursie Claude AI. Bez teorii dla teorii, same procedury.
Wnioski z testów nowych modeli i złapane zmyślenia wysyłam też w newsletterze - zapis niżej.
Mateusz Czech - autor bloga

Autor

Mateusz Czech // Czechu

AI Senior Digital Product Specialist w grupie Górskie Resorty. Projektuję i wdrażam aplikacje oparte na AI dla sprzedaży i obsługi klienta w hotelach. Wcześniej w SentiOne współtworzyłem voicebota InfoNina dla Alior Banku (Celent Model Bank Awards 2022). Piszę o wdrożeniach AI na czechu.blog. Prywatnie gram w tenisa i słucham polskiego rapu.

Powiązane artykuły

Co jeszcze warto przeczytać

Newsletter Strategic AI Implementation

Co tydzień jeden framework, jedno case study, zero spamu

Dołącz do listy. Dostajesz to, czego nie wrzucam na bloga: kulisy moich wdrożeń, sprawdzone prompty, błędy do uniknięcia. Wypisujesz się jednym kliknięciem.