POWRÓT DO BLOGA
AI Implementation 4 sierpnia 2026

Context engineering: dlaczego okno na milion tokenów psuje Twoje odpowiedzi

29 min Czechu

Twój model ma okno na milion tokenów. To jest dokładnie ten powód, dla którego dostajesz gorsze odpowiedzi niż rok temu.

W skrócie: context engineering (inżynieria kontekstu) to projektowanie kompletu informacji, który widzi model, zanim odpowie. Instrukcje, narzędzia, przykłady, historia rozmowy, pobrane dokumenty, pamięć. Wszystko to konkuruje o ten sam ograniczony zasób uwagi. Badania z trzech niezależnych ośrodków pokazują to samo: im dłuższe wejście, tym gorsza skuteczność, nawet przy zadaniach banalnych. Umiejętność roku 2026 nie polega na wrzucaniu większej ilości danych, tylko na wycinaniu tych, które rozcieńczają sygnał.

Aktualizacja: 4 sierpnia 2026 r. Wszystkie liczby pochodzą z podanych źródeł albo z moich udokumentowanych pipeline'ów.

Milion tokenów, które pracują przeciwko Tobie

Producenci sprzedają okno kontekstowe jak pojemność bagażnika. Claude Opus 5, Sonnet 5, Gemini 3.1 Pro, GPT-5.5: milion tokenów. Llama 4 Scout deklaruje dziesięć milionów. W czerwcu 2026 trzynaście hostowanych modeli czołowych miało okno powyżej miliona (Morph, porównanie okien kontekstowych).

Milion tokenów to około 555 tysięcy słów angielskiego tekstu. Polszczyzna tokenizuje się gorzej, więc realnie mieści się mniej. Nadal: kilka powieści naraz.

Teraz spójrz na liczby z drugiej strony.

Benchmark NoLiMa (Adobe Research, przyjęty na ICML 2025) sprawdza coś, czego klasyczny test „igła w stogu siana” nie sprawdza. Pytanie i szukana informacja nie mają wspólnych słów, więc model musi skojarzyć sens, a nie dopasować ciąg znaków. Wynik: przy 32 tysiącach tokenów 10 z 12 badanych modeli spadło poniżej połowy swojego wyniku bazowego z krótkiego kontekstu. GPT-4o zjechał z 99,3% na 69,7% (NoLiMa, arXiv:2502.05167).

32 tysiące tokenów. To jest trzy procent okna, które kupiłeś.

Badanie Context Rot laboratorium Chroma poszło szerzej: 18 modeli, w tym Claude Opus 4, GPT-4.1, o3, Gemini 2.5 Pro i Qwen3. Wnioski są niewygodne (Chroma Research):

  • Skuteczność spada wraz z długością wejścia nawet przy zadaniach trywialnych, takich jak powtórzenie słów czy proste wyszukanie.
  • Na zestawie LongMemEval różnica między wejściem skupionym (około 300 tokenów) a pełnym (około 113 tysięcy tokenów) jest wyraźna dla wszystkich modeli. Ta sama informacja, ta sama odpowiedź, inna otoczka.
  • Wystarczy jeden dystraktor, czyli fragment podobny do szukanego, ale nieprawdziwy, żeby trafność spadła. Kilka dystraktorów kumuluje efekt.
  • Zaskoczenie, które powtórzyło się we wszystkich 18 modelach: model radzi sobie lepiej z materiałem przetasowanym losowo niż logicznie uporządkowanym.

Lost in the Middle (Liu i inni, Stanford, TACL 2024) dokłada trzeci wymiar: pozycję. Model najlepiej korzysta z informacji na początku i na końcu kontekstu, najgorzej ze środka. Przesunięcie właściwego dokumentu z pierwszej pozycji na dziesiątą w zestawie dwudziestu obniżyło trafność o ponad 30 punktów procentowych (Liu i in., 2023).

Trzy badania w jednej tabeli:

Badanie Co mierzy Wynik
NoLiMa
Adobe, ICML 2025
Wyszukanie informacji bez wspólnych słów z pytaniem (12 modeli) Przy 32K tokenów 10 z 12 modeli poniżej połowy swojego wyniku bazowego
Context Rot
Chroma, 2025
Wpływ długości wejścia na zadania proste i złożone (18 modeli) Spadek nawet przy zadaniach trywialnych; jeden dystraktor obniża trafność
Lost in the Middle
Stanford, TACL 2024
Wpływ pozycji informacji w oknie Przeniesienie z pozycji 1 na 10 z 20: ponad 30 pkt proc. w dół

Trzy niezależne zespoły, trzy metody, ten sam wniosek. Model nie przetwarza dziesięciotysięcznego tokena tak samo uważnie jak setnego.

SPADEK SKUTECZNOŚCI WRAZ Z DŁUGOŚCIĄ KONTEKSTU
100% 75% 50% 25% baza 1K 2K 4K 8K 16K 32K GPT-4o, wynik bazowy: 99,3% GPT-4o przy 32K: 69,7% Llama 3.3 70B, wynik bazowy: 97,3% Llama 3.3 70B przy 32K: 42,7% Gemini 1.5 Pro, wynik bazowy: 92,6% Gemini 1.5 Pro przy 32K: 48,2% Claude 3.5 Sonnet, wynik bazowy: 87,6% Claude 3.5 Sonnet przy 32K: 29,8% GPT-4o 69,7% Gemini 1.5 Pro 48,2% Llama 3.3 70B 42,7% Claude 3.5 Sonnet 29,8%
Wyniki benchmarku NoLiMa (Adobe Research, ICML 2025). „Baza” to wynik przy krótkim kontekście. Modele pochodzą z lat 2024-2025, bo tylko dla nich opublikowano pełną krzywą pomiarową. Ten wykres pokazuje kształt zjawiska: jak wygląda spadek. Świeże liczby dla modeli z 2026 roku znajdziesz na wykresie poniżej - zjawisko nie zniknęło, przesunęło się tylko dalej, na dłuższe konteksty.

„Ale to stare modele. Dziś jest inaczej”

Uczciwy zarzut. Odpowiedź brzmi: nie jest.

Benchmark MRCR v2 sprawdza, czy model odnajdzie i odtworzy osiem konkretnych faktów ukrytych w bardzo obszernym tekście. Oto wyniki dla modeli z 2026 roku przy pełnym oknie miliona tokenów:

MRCR v2: SKUTECZNOŚĆ PRZY PEŁNYM OKNIE 1 MLN TOKENÓW
25% 50% 75% 100% Claude Opus 4.6: 78,3% przy 1 mln tokenów GPT-5.6 Sol: 73,8% w zakresie 512K-1M Claude Sonnet 4.6: 65,8% przy 1 mln tokenów GPT-5.4: 36,6% w zakresie 512K-1M Claude Opus 4.7: 32,2% przy 1 mln tokenów Gemini 3 Pro: 24,5% przy 1 mln tokenów Claude Opus 4.6 GPT-5.6 Sol Claude Sonnet 4.6 GPT-5.4 Claude Opus 4.7 Gemini 3 Pro 78,3% 73,8% 65,8% 36,6% 32,2% 24,5% ← lipiec 2026
Benchmark MRCR v2 (8 igieł) przy pełnym oknie. Źródła: system card Anthropic (Opus 4.6, Sonnet 4.6, Opus 4.7), dane OpenAI dla zakresu 512K-1M (GPT-5.6 Sol, GPT-5.4), contextarena.ai (Gemini 3 Pro). Wyniki pochodzą z różnych testów i nie są w pełni porównywalne między sobą, ale rząd wielkości jest we wszystkich ten sam.

Przeczytaj te liczby jeszcze raz. Najlepszy model odpowiada poprawnie w niecałych czterech przypadkach na pięć. Najsłabszy - w jednym na cztery. Mowa o oknach, za które płacisz i które producent reklamuje jako gotowe do użycia.

Teraz najciekawsze. Zwróć uwagę na dwa słupki z tej samej rodziny:

NOWSZY MODEL, GORSZA PAMIĘĆ DO DŁUGIEGO TEKSTU
Claude Opus 4.6
78,3%
przy 1 mln tokenów (91,9% przy 256K)
Claude Opus 4.7 - następca
32,2%
przy 1 mln tokenów (59,2% przy 256K)
▸ Spadek o 46 punktów procentowych w kolejnej wersji tego samego modelu

Nowsza wersja wypadła na tym teście ponad dwukrotnie gorzej od poprzedniczki. Anthropic nie ukrywa tego w drobnym druku: system card wprost stwierdza, że starszy Opus 4.6 w trybie rozszerzonego myślenia przewyższa następcę, gdy trzeba znaleźć wiele faktów w obszernym dokumencie, i zaleca zostawienie 4.6 jako wersji zapasowej do takich zadań.

Powód jest prozaiczny. Firma poszła w długie zadania agentowe i kodowanie, nie w precyzję uwagi przy dużych odległościach w tekście.

Przypadek nie jest odosobniony. W tym samym teście, w zakresie od 512 tysięcy do miliona tokenów, GPT-5.5 osiąga 74,0 procenta, a nowszy od niego GPT-5.6 Sol 73,8. Różnica jest w granicach błędu, ale kierunek ten sam: kolejna generacja nie dołożyła tu nic.

Osobna sprawa to modele, których na tym wykresie nie ma. Claude Opus 5 (premiera 24 lipca 2026), Claude Sonnet 5 oraz Kimi K3 (16 lipca 2026, otwarte wagi, okno miliona tokenów) nie mają opublikowanych wyników MRCR. Sprawdziłem rankingi zbiorcze i porównania producentów: rubryka długiego kontekstu jest przy nich pusta.

Brak danych też jest daną. Materiały premierowe tych modeli mówią o kodowaniu, zadaniach agentowych i cenie. O tym, ile z reklamowanego okna faktycznie działa, nie mówią. Dopóki liczby się nie pojawią, jedynym sposobem sprawdzenia jest własny test na własnych dokumentach.

Wniosek dla praktyka jest twardszy, niż się wydaje: „nowszy model” nie znaczy „lepiej poradzi sobie z Twoim stukartkowym dokumentem”. Kupujesz numer wersji, nie gwarancję uwagi. Trzeba sprawdzać, nie zakładać.

Anthropic tłumaczy mechanizm bez owijania: architektura transformera tworzy n² relacji między tokenami. Przy n tokenach model musi utrzymać n do kwadratu powiązań. Każdy nowy token uszczupla ten budżet. Do tego modele mają mniej doświadczenia z zależnościami rozciągniętymi na cały kontekst, bo w danych treningowych dominowały krótsze sekwencje (Anthropic Engineering).

Stąd zdanie, które warto powiesić nad biurkiem:

„Kontekst trzeba traktować jako zasób skończony o malejącej użyteczności krańcowej”
Anthropic · Effective context engineering for AI agents
Sedno
Okno kontekstowe to pojemność techniczna, nie gwarancja uwagi. Producent sprzedaje litry bagażnika. Nie sprzedaje umiejętności znalezienia w nim jednej śrubki.

Czym jest context engineering i skąd się wziął

Termin ma metrykę. Powstał w ciągu trzech miesięcy 2025 roku.

19 czerwca 2025 · Tobi Lütke, prezes Shopify
Woli określenie „context engineering” od „prompt engineering”, ponieważ lepiej opisuje rdzeń umiejętności: „sztukę dostarczenia całego kontekstu, w którym zadanie staje się dla modelu rozwiązywalne”.
25 czerwca 2025 · Andrej Karpathy
Sześć dni później podbija termin i domyka jego definicję: „delikatna sztuka i nauka wypełniania okna kontekstowego dokładnie tą informacją, która jest potrzebna do następnego kroku”.
29 września 2025 · Anthropic
Publikuje inżynierski przewodnik, który zamienia hasło z internetu w dyscyplinę z regułami.

Różnica w jednym zdaniu:

  Inżynieria promptów Inżynieria kontekstu
Pytanie Jakie słowa wpisać? Co ma się znaleźć w oknie, w jakiej kolejności i co stamtąd wyrzucić?
Jednostka pracy Jedna wiadomość Cały stan informacyjny, także po stu turach rozmowy
Miara sukcesu Lepsza pojedyncza odpowiedź Powtarzalne zadanie wykonane do końca, w budżecie
Typowy błąd Zbyt ogólne polecenie Zbyt dużo materiału „na wszelki wypadek”

Definicja Anthropic brzmi tak: context engineering to „zestaw strategii kurowania i utrzymywania optymalnego zbioru tokenów podczas pracy modelu, wliczając wszystkie informacje, które trafiają tam poza promptami”.

Zwróć uwagę na czasownik. Nie „dostarczania”. Utrzymywania. Kontekst nie jest jednorazowym wsadem, tylko stanem, którym zarządzasz przez cały czas trwania zadania.

Jedno prostowanie, bo internet powtarza bzdurę. Prompt engineering nie umarł. Anthropic nazywa inżynierię kontekstu naturalną kontynuacją inżynierii promptów i nadal zaleca przykłady few-shot jako dobrą praktykę. Prompt to jeden ze składników kontekstu, tyle że przestał być składnikiem jedynym. Jeśli dopiero zaczynasz, framework CRISP do pisania promptów zostaje fundamentem, na którym stawiasz resztę.

Rynek zdążył zareagować. Mediana wynagrodzenia na stanowisku „context engineer” w USA to 101 752 dolary rocznie, widełki 84-116,5 tysiąca (ZipRecruiter, lipiec 2026).

Sześć warstw, które walczą o to samo miejsce

Zanim zaczniesz cokolwiek optymalizować, musisz zobaczyć, z czego składa się kontekst. To nie jest „prompt plus załącznik”.

Warstwa Co zawiera Typowa patologia
1. Instrukcja systemowa Rola, zasady, format wyjścia, granice Dwie strony reguł na każdy możliwy wyjątek
2. Narzędzia Opisy funkcji, do których model ma dostęp Czterdzieści narzędzi o zachodzących na siebie opisach
3. Przykłady Wzorce poprawnych odpowiedzi (few-shot) Dwadzieścia przykładów zamiast pięciu reprezentatywnych
4. Historia rozmowy Wszystkie poprzednie tury i wyniki narzędzi Trzy dni dyskusji, w tym dwie porzucone ścieżki
5. Dane pobrane Dokumenty, wyniki wyszukiwania, rekordy z bazy Dwadzieścia fragmentów z RAG, z czego dwa na temat
6. Pamięć Ustalenia z poprzednich sesji, profil, preferencje Notatki sprzed pół roku, dawno nieaktualne

Wszystkie sześć warstw wchodzi do jednego okna. Wszystkie zjadają ten sam budżet uwagi. Większość zespołów optymalizuje wyłącznie warstwę pierwszą, bo tylko ją widzi.

Sygnał kontra szum: jak odróżnić potrzebne od „na wszelki wypadek”

Praktyczny test na każdy fragment, który chcesz wrzucić do okna. Trzy pytania:

  1. Czy model użyje tego w TYM kroku? Nie „czy może się przydać”. Czy użyje teraz.
  2. Czy da się to zastąpić wskaźnikiem? Ścieżką do pliku, linkiem, nazwą zapytania. Model dociągnie to sam, jeśli będzie potrzebować.
  3. Czy to nie jest dystraktor? Materiał podobny do właściwego, ale nieaktualny albo dotyczący innego klienta. Badanie Chroma pokazało, że pojedynczy dystraktor obniża trafność. Stary cennik obok nowego jest gorszy niż brak cennika.

Najbardziej kontrintuicyjny wniosek z badania Chroma dotyczy porządku. Modele wypadły lepiej na materiale przetasowanym niż logicznie uporządkowanym. Wyjaśnienie: przy materiale spójnym tematycznie wszystko wygląda na trafne, więc model gubi się między podobnymi fragmentami. Przypadkowy nieład daje kontrast, którego uporządkowany materiał nie daje.

Wniosek dla praktyka: nie sklejaj do kontekstu dziesięciu dokumentów o tym samym. Wybierz jeden właściwy.

Mam na to własny pomiar, z zupełnie innego podwórka. Budując pipeline dziewięciu agentów rozwiązujący olimpiadę matematyczną, sprawdziłem, co się dzieje, gdy weryfikator dowodu widzi kontekst pracy autora, czyli strategię, notatki, wcześniejsze próby.

POMIAR WŁASNY: TEN SAM MODEL, DWA OKNA
87%
Weryfikator widzi kontekst autora
Przepuszcza dowody z lukami. Gumowy stempel.
62%
Weryfikator odcięty od kontekstu
Zaczyna łapać błędy. Uczciwy pomiar.
▸ Usunięcie informacji z okna = +25 punktów procentowych surowości oceny

Ten sam model, to samo zadanie, te same dowody. Jedyna różnica to zawartość okna. Weryfikator, który widział, jak bardzo autor się napracował, przepuszczał dowody z lukami. Odcięty od tego kontekstu zaczął łapać błędy.

Usunięcie informacji poprawiło jakość o 25 punktów procentowych. To jest cała teza tego artykułu w jednej liczbie.

Budżet kontekstu, czyli rachunek, którego nikt nie robi

Kontekst kosztuje dwa razy. Raz jakością, raz gotówką.

Claude Opus 5 kosztuje 5 dolarów za milion tokenów wejściowych (CloudZero). Wypełnienie całego okna to 5 dolarów za jedno zapytanie. Dwadzieścia takich zapytań dziennie przez dwadzieścia dwa dni robocze daje 2 200 dolarów miesięcznie, czyli ponad 8 200 złotych przy kursie NBP z 3 sierpnia 2026 (3,73). Za coś, co według badań działa gorzej niż zapytanie z dobrze dobranym kontekstem na 20 tysięcy tokenów.

Dwie rzeczy ten rachunek zbijają.

Pierwsza: pamięć podręczna promptu (prompt caching). Powtarzalny początek kontekstu (instrukcja systemowa, opisy narzędzi, stała dokumentacja) można zapisać w cache. Odczyt z niej kosztuje u Anthropic około 90% mniej niż normalne wejście, na przykład 0,30 dolara zamiast 3,00 za milion tokenów w Sonnecie 4.6. GPT-5.4 i 5.5 mają identyczny mnożnik. Opóźnienie spada o 30-85% (analiza porównawcza). Warunek jest jeden: stała część musi być naprawdę stała i musi być na początku. Jedna zmieniona linijka na górze unieważnia cały cache.

Druga: czyszczenie kontekstu w trakcie pracy. Anthropic udostępnił mechanizm, który automatycznie usuwa z okna zużyte wyniki narzędzi, gdy zbliża się limit. W teście wyszukiwania sieciowego obejmującym sto tur pozwolił dokończyć zadania, które wcześniej padały z powodu wyczerpania kontekstu, przy 84% mniejszym zużyciu tokenów. Połączenie tego z narzędziem pamięci dało 39% wzrostu skuteczności na złożonych zadaniach wieloetapowych, samo czyszczenie 29% (Anthropic, zarządzanie kontekstem).

Te dwie liczby, 84% mniej tokenów i 39% lepszy wynik, występują razem. Mniej kontekstu, lepszy rezultat, niższy rachunek.

Pięć technik, które realnie zmieniają wynik

1. Właściwa wysokość instrukcji

Anthropic nazywa to „strefą Złotowłosej”, czyli miejscem w sam raz między dwoma sposobami na porażkę.

Za nisko: zespół wpisuje sztywną logikę na każdy przypadek. „Jeśli klient pyta o zwrot i minęło 14 dni i produkt jest z kategorii X, to…” Taka instrukcja jest krucha. Pierwszy przypadek spoza listy ją łamie.

Za wysoko: „Bądź pomocnym asystentem obsługi klienta”. Model nie ma z czego wywnioskować konkretów i zgaduje.

Celuj w środek: na tyle konkretnie, żeby prowadzić zachowanie, na tyle elastycznie, żeby model miał mocne heurystyki. Do tego struktura: wyraźne sekcje w rodzaju kontekstu, instrukcji, opisu narzędzi i formatu wyjścia, oznaczone nagłówkami albo znacznikami. Zasada nadrzędna brzmi: minimalny zestaw informacji, który w pełni opisuje oczekiwane zachowanie.

2. Dociąganie w locie zamiast ładowania z góry

Klasyczne podejście: przed zadaniem pobierasz wszystko, co może być potrzebne, i wrzucasz do okna. Podejście, które wygrywa w 2026: model dostaje lekkie wskaźniki (ścieżki plików, zapisane zapytania, linki) i sam dociąga dane wtedy, kiedy ich potrzebuje.

Anthropic porównuje to do ludzkiego poznania. Nie pamiętasz zawartości wszystkich segregatorów. Pamiętasz, gdzie stoją. Sama organizacja materiału niesie informację: rozmiar pliku sugeruje złożoność, nazwa sugeruje przeznaczenie, data modyfikacji sugeruje aktualność.

Koszt jest realny: eksploracja w locie jest wolniejsza od gotowych danych. Dlatego najlepsze rozwiązania są hybrydowe. W Claude Code plik CLAUDE.md ładuje się z góry, a konkretne pliki model wyszukuje sam, kiedy są potrzebne. Tak działa też mój blog: zasady pisania i dane dostępowe siedzą w jednym pliku projektu, a treści model dociąga w miarę potrzeb.

3. Kompakcja, czyli kontrolowane streszczenie

Rozmowa dobija do limitu okna. Zamiast ją ucinać, przekazujesz historię modelowi z poleceniem: streść, zachowaj decyzje, nierozwiązane problemy i szczegóły wdrożenia, wyrzuć powtarzalne wyniki narzędzi. Startujesz nowe okno ze streszczeniem.

Anthropic podpowiada kolejność strojenia takiego streszczenia: najpierw maksymalizuj kompletność (żeby nic ważnego nie wypadło), potem precyzję (żeby wyciąć zbędne). Odwrotna kolejność gubi rzeczy, o których nie wiesz, że zginęły.

Najlżejsza wersja tej techniki to zwykłe czyszczenie starych wyników narzędzi. Wynik wyszukiwania sprzed czterdziestu tur zwykle do niczego już nie służy, a budżet zjada nadal.

4. Notatki na zewnątrz okna

Model zapisuje ustalenia do pliku poza kontekstem i wczytuje je, kiedy są potrzebne. Prosty mechanizm, duży efekt: pamięć trwała przy minimalnym koszcie w oknie.

Anthropic pokazał to na Claude grającym w Pokémona. Agent utrzymywał precyzyjne rachunki przez tysiące kroków gry, w rodzaju „przez ostatnie 1234 kroki trenuję na Route 1, Pikachu zyskał 8 poziomów z docelowych 10”. Bez żadnej instrukcji o strukturze pamięci sam zbudował mapy zwiedzonych obszarów i notatki strategiczne.

Odpowiednik dla firmy jest oczywisty: plik z ustaleniami projektu, aktualizowany po każdej sesji, wczytywany na starcie następnej. Nie musisz mieć API. Wystarczy dokument, który podrzucasz do rozmowy.

5. Subagenci z czystym oknem

Zamiast jednego agenta trzymającego stan całego projektu, wyspecjalizowani subagenci wykonują wąskie zadania w czystych oknach. Agent główny prowadzi plan, subagenci schodzą w szczegóły.

Ekonomia jest brutalnie prosta: subagent może spalić dziesiątki tysięcy tokenów na przeszukiwanie, ale zwraca destylat rzędu 1000-2000 tokenów. Szczegóły zostają po jego stronie. Okno agenta głównego pozostaje czyste.

W moim pipeline'u olimpiadowym ta sama zasada dała mierzalne efekty poza jakością: średnia liczba cykli między dowodzącym a weryfikatorem spadła z 5,2 do 3,1, czyli o 40%. Osobno: tanie bramki mechaniczne uruchamiane przed wywołaniem drogiego modelu (regexy szukające typowych uników w rodzaju „w sposób oczywisty”) ucięły 22% prób, a sprawdzenie symboliczne kolejne 8%. Razem 30% zaoszczędzonych wywołań Opusa. Więcej wzorców podziału pracy opisałem we wzorcach koordynacji agentów.

Reguła podziału: dziel agentów według kontekstu, którego potrzebują, nie według nazw ról. Nie „ten pisze, ten robi SEO”, tylko „ten ma dostęp do bazy produktów, ten do danych klienta, ten do cennika”.

Structured outputs: kiedy odpowiedź ma być danymi, nie prozą

Context engineering dotyczy wejścia. Structured outputs (wyjścia strukturalne) domykają temat od drugiej strony i dają w firmie najszybszy zwrot z całej tej listy.

Mechanizm: zamiast prosić o tekst, podajesz schemat (najczęściej JSON Schema albo definicję narzędzia). Model nie może wygenerować pola spoza schematu ani pominąć wymaganego, ponieważ ograniczenie działa na poziomie dekodowania, a nie sugestii w prompcie.

Stan na sierpień 2026:

  • Anthropic: structured outputs weszły do ogólnej dostępności 29 stycznia 2026 dla modeli Claude 4.5 i nowszych. Parametr przeniesiono z output_format na output_config.format. Działa w dwóch trybach: ze schematem JSON albo ze specyfikacją narzędzi (dokumentacja Claude).
  • OpenAI: Structured Outputs z wymuszonym dekodowaniem, deklarowana pełna zgodność ze schematem (OpenAI).
  • Porównania wskaźników awarii dają rząd wielkości poniżej 0,2% dla obu podejść.

Dlaczego to jest sprawa dla prezesa, a nie tylko dla programisty? Odpowiedź w prozie wymaga, żeby ktoś ją przeczytał i przepisał. Odpowiedź w schemacie wpada prosto do arkusza, CRM-u albo następnego kroku procesu. Cała klasa błędów „model napisał kwotę słownie, a system oczekiwał liczby” znika.

Praktyczny przykład dla marketingu: klasyfikacja 500 zgłoszeń z formularza. Zamiast prosić o opis każdego, definiujesz schemat: kategoria z zamkniętej listy, pilność w skali 1-5, kraj, czy wymaga kontaktu handlowca, jednozdaniowe uzasadnienie. Wynik ląduje w arkuszu bez ręcznego przepisywania.

Wersja bez kodu: ten sam efekt osiągasz w oknie czatu, definiując kolumny tabeli i zamknięte listy wartości. „Zwróć tabelę o kolumnach: kategoria (tylko: reklamacja, zapytanie, oferta, inne), pilność (1-5), kraj, kontakt (tak/nie), uzasadnienie (max 12 słów). Bez komentarza przed tabelą i po niej”. Dyscyplina schematu działa, nawet gdy nie masz API. Zysk jest mniejszy, ponieważ nic tu nie wymusza zgodności na poziomie dekodowania. Wynik nadal trzeba przejrzeć.

Co z tego zrobisz dziś, bez linijki kodu

Cztery rzeczy działające w zwykłym oknie czatu.

1. Stały plik kontekstu firmy. Jeden dokument: czym się zajmujecie, do kogo mówicie, jakim tonem, czego nie robicie nigdy, pięć przykładów dobrych tekstów. Podrzucasz go na starcie rozmowy zamiast tłumaczyć wszystko od nowa. To jest odpowiednik CLAUDE.md dla nieprogramisty.

2. Nowa rozmowa przy zmianie tematu. Ciągnięcie jednego wątku tygodniami to najprostszy sposób na zafundowanie sobie degradacji opisanej w badaniach powyżej. Zmienił się temat: nowa rozmowa, ze streszczeniem ustaleń wklejonym na starcie.

3. Ręczna kompakcja co kilkadziesiąt wiadomości. Poproś: „Podsumuj naszą rozmowę: podjęte decyzje, otwarte kwestie, ustalone liczby. Pomiń ścieżki, które porzuciliśmy”. Streszczenie wklej do nowej rozmowy i pracuj dalej.

4. Kontekst na początku, pytanie na końcu. Skoro model najsłabiej wykorzystuje środek okna, nie chowaj tam najważniejszego. Materiał wrzuć na górę, pytanie postaw na dole. Ta jedna zmiana bywa różnicą między trafną a chybioną odpowiedzią przy dłuższych załącznikach.

Pięć antywzorców, które kosztują najwięcej

Wrzucanie „na wszelki wypadek”. Cała dokumentacja, bo a nuż się przyda. Każdy zbędny fragment to dystraktor konkurujący o uwagę z fragmentem właściwym.

Rozmowa bez końca. Trzy tygodnie w jednym wątku, w tym dwie porzucone ścieżki i pięć nieaktualnych wersji. Model widzi to wszystko i traktuje jako obowiązujące.

Lista dwudziestu narzędzi. Test Anthropic jest bezlitosny: „Jeśli inżynier nie potrafi jednoznacznie wskazać, którego narzędzia użyć w danej sytuacji, agent tym bardziej tego nie zrobi”. Nakładające się opisy narzędzi to gwarantowane pomyłki.

Instrukcja na każdy wyjątek. Zespoły wpisują listę przypadków brzegowych, zamiast dać kilka reprezentatywnych przykładów. Anthropic ujmuje to obrazowo: dla modelu przykłady są „obrazkami wartymi tysiąca słów”.

Pamięć bez daty ważności. Notatka „klient preferuje kontakt mailowy” sprzed roku, gdy klient od pół roku dzwoni. Pamięć bez przeglądu zamienia się w źródło halucynacji, o których pisałem osobno przy mechanizmach zmyślania modeli.

Jak zacząć: cztery kroki na najbliższy tydzień

  1. Zmierz punkt wyjścia. Weź jedno powtarzalne zadanie, które oddajesz AI. Policz, ile razy poprawiasz wynik ręcznie. To Twój wskaźnik bazowy.
  2. Wytnij połowę kontekstu. Usuń wszystko, co nie przechodzi testu trzech pytań z sekcji o sygnale. Uruchom to samo zadanie. Porównaj.
  3. Nadaj wyjściu strukturę. Zdefiniuj kolumny albo schemat zamiast prosić o prozę. Sprawdź, ile czasu oszczędzasz na przepisywaniu.
  4. Zapisz to, co zadziałało, do pliku kontekstu. Następna sesja startuje z gotowego stanu, nie od zera.

Co z tego zostaje

Producenci będą dalej licytować się na rozmiar okna. Dziesięć milionów tokenów, sto milionów, wszystko jedno. Ta licytacja rozwiązuje problem pojemności, nie problem uwagi.

Trzy niezależne badania mówią to samo: model nie czyta dziesięciotysięcznego tokena tak uważnie jak setnego. Mój własny weryfikator był o 25 punktów procentowych surowszy, gdy odebrałem mu kontekst, którego nie potrzebował.

Umiejętność, która się z tego wyłania, jest nudna i niemodna. Nie polega na znalezieniu magicznej formuły. Polega na decydowaniu, co wyrzucić. Kontekst to budżet, nie magazyn.

Kto to zrozumie w tym roku, będzie miał przewagę nad wszystkimi, którzy dalej wklejają całe segregatory i zastanawiają się, dlaczego model „głupieje”.

FAQ

Czym jest context engineering? Projektowaniem całego zestawu informacji, który trafia do modelu przed odpowiedzią: instrukcji, narzędzi, przykładów, historii rozmowy, pobranych dokumentów i pamięci. Anthropic definiuje to jako strategie kurowania i utrzymywania optymalnego zbioru tokenów podczas pracy modelu. Inżynieria promptów pyta, jakie słowa wpisać. Inżynieria kontekstu pyta, co ma się w oknie znaleźć i w jakiej kolejności.

Czy prompt engineering jest już niepotrzebny? Nie. Anthropic nazywa inżynierię kontekstu naturalną kontynuacją inżynierii promptów, a przykłady few-shot nadal poleca. Prompt jest jednym ze składników kontekstu, przestał być składnikiem jedynym.

Skoro model ma okno na milion tokenów, dlaczego nie wrzucić do niego wszystkiego? Skuteczność spada wraz z długością wejścia. W NoLiMa przy 32 tysiącach tokenów 10 z 12 modeli spadło poniżej połowy wyniku bazowego. Badanie Context Rot na 18 modelach pokazało degradację nawet przy zadaniach trywialnych. Okno to pojemność techniczna, nie gwarancja uwagi.

Co to są structured outputs i po co mi one? Wymuszenie odpowiedzi zgodnej ze schematem (zwykle JSON Schema) zamiast dowolnego tekstu. Model nie wygeneruje pola spoza schematu ani nie pominie wymaganego. U Anthropic funkcja jest ogólnie dostępna od stycznia 2026 dla modeli 4.5 i nowszych, u OpenAI działa na wymuszonym dekodowaniu. Zysk: odpowiedź wpada prosto do arkusza albo systemu, bez parsowania prozy.

Od czego zacząć bez umiejętności programowania? Od stałego pliku z kontekstem firmy, nowej rozmowy po każdej zmianie tematu i żądania odpowiedzi w tabeli o zadanych kolumnach. Trzy nawyki, zero kodu.


Źródła: Anthropic, Effective context engineering for AI agents (29.09.2025) | Chroma, Context Rot (2025) | NoLiMa, arXiv:2502.05167 (ICML 2025) | Liu i in., Lost in the Middle (TACL 2024) | Anthropic, zarządzanie kontekstem | Claude Docs, structured outputs | wyniki MRCR v2 za zestawieniem benchmarków długiego kontekstu (15.03.2026) i analizą system card Opus 4.7. Dostęp: 4 sierpnia 2026 r.

Mateusz Czech - autor bloga

Autor

Mateusz Czech // Czechu

AI Senior Digital Product Specialist w grupie Górskie Resorty. Projektuję i wdrażam aplikacje oparte na AI dla sprzedaży i obsługi klienta w hotelach. Wcześniej w SentiOne współtworzyłem voicebota InfoNina dla Alior Banku (Celent Model Bank Awards 2022). Piszę o wdrożeniach AI na czechu.blog. Prywatnie gram w tenisa i słucham polskiego rapu.

Powiązane artykuły

Co jeszcze warto przeczytać

Newsletter Strategic AI Implementation

Co tydzień jeden framework, jedno case study, zero spamu

Dołącz do listy. Dostajesz to, czego nie wrzucam na bloga: kulisy moich wdrożeń, sprawdzone prompty, błędy do uniknięcia. Wypisujesz się jednym kliknięciem.