Test czterech czołowych modeli AI w negocjacjach umów: odrzuciły tylko 6 do 50 proc. poprawek, które powinny odrzucić
Benchmark RedlineBench, opublikowany w czerwcu 2026 r. przez Crosby i micro1, sprawdził cztery czołowe modele AI w kolejnych turach negocjacji umowy SaaS prowadzonych przez prawników. Modele zaliczyły 80 do 99 proc. kryteriów, które wymagały przyjęcia poprawki kontrahenta, i tylko 6 do 50 proc. tych, które wymagały jej odrzucenia; w jednym scenariuszu model przyjął 98 proc. tego, co miał przyjąć, i odrzucił 6,6 proc. tego, co miał odrzucić. Z tej asymetrii wyrasta zjawisko, które w praktyce kancelarii widać od kilkunastu miesięcy, a które dotąd nie miało nazwy: pętla negocjacyjna AI, w której kolejna wersja umowy zastępuje poprawę pozycji klienta, a porozumienie staje się celem zamiast miarą.
Ten tekst rozkłada pętlę na cztery mechanizmy, sprawdza każdy z nich w opublikowanych badaniach i pokazuje, jak z niej wyjść. Stan badań podaję na 1 października 2026 r. Tam, gdzie piszę o mechanizmach, oznaczam, co jest zmierzone, a co jest hipotezą. Różnica między jednym a drugim jest w tym temacie ważniejsza niż zwykle, bo nic nie brzmi tak przekonująco jak płynnie uzasadniony błąd.
Wersja czternasta
Jest wtorkowy wieczór. Dwie kancelarie negocjują umowę wdrożeniową: po jednej stronie dostawca oprogramowania, po drugiej spółka, która ma je kupić. Każdy z pełnomocników pracuje z asystentem AI. Dokument ma numer czternaście. Limit odpowiedzialności dostawcy wynosił w wersji trzeciej równowartość dwunastomiesięcznego wynagrodzenia, w wersji siódmej trzydziestosześciomiesięcznego, w wersji jedenastej dwudziestoczteromiesięcznego, a w czternastej wraca do trzydziestu sześciu, tyle że z wyłączeniem danych osobowych, które w wersji ósmej ktoś dopisał i o których w wersji dziesiątej ktoś zapomniał. Klauzula o karach umownych została przeredagowana sześć razy; jej sens nie zmienił się ani razu. Definicja „dnia roboczego” rosła w każdej turze. Nikt nie pamięta, co ustalono w turze szóstej, bo ustalenia nie mają własnego miejsca: żyją w wątku e-mailowym, który obie strony czytają z pomocą tego samego rodzaju narzędzia.
Scena jest złożona z kilku spraw i nie opisuje żadnej konkretnej. Ważne jest w niej co innego: żadna ze stron nie postępowała głupio. Każda poprawka miała uzasadnienie. Każde ustępstwo było „rozsądne w świetle praktyki rynkowej”. Każda runda była odpowiedzią na poprzednią. A mimo to po czternastu wersjach klient dostawcy ma gorszą umowę niż po trzeciej, choć w międzyczasie kontrahent trzykrotnie „ustąpił”. Ruch był, postępu nie było. Tak wygląda pętla negocjacyjna AI widziana od środka.
Czym jest pętla negocjacyjna AI w negocjacjach umów
Pętlą negocjacyjną AI nazywam stan dwustronnej, wspomaganej modelami językowymi negocjacji umowy, w którym proces zmian oderwał się od celów mocodawcy, a widoczny postęp (kolejne wersje, kolejne kompromisy, kolejne „uzgodnienia”) zasłania pogarszanie się pozycji. To nie jest twierdzenie, że modele „lubią kompromis”, ani że negocjacje trwają dosłownie w nieskończoność. To hipoteza o awarii procesu, którą da się rozłożyć na cztery mechanizmy. Każdy z nich ma w badaniach cząstkowe potwierdzenie; całość, jako zjawisko mierzone w praktyce prawniczej, czeka na eksperyment, który opisuję na końcu.
Młyn poprawek
Pierwszy mechanizm to zmiana bez poprawy: system przeredagowuje brzmienie albo otwiera na nowo kwestie, które były zamknięte, bez uzasadnionego zysku dla klienta. Młyn mieli zawsze, bo mielenie jest tym, co umie. Z RedlineBench wynika, że prawnicy robili średnio 3,10 poprawki na dotknięty akapit, każda długości około 101 znaków, a modele 1,06 do 1,20 poprawki, za to długości 318 do 518 znaków. Prawnik wymienia słowo; model wymienia zdanie. W tym samym raporcie jednym z pięciu kryteriów oceny, nazwanym orientacją na zamknięcie transakcji, jest niepotrzebne przedłużanie negocjacji drobnymi zmianami o małym znaczeniu. Prawnicy autorzy rubryk uznali więc młyn za błąd sztuki, zanim ktokolwiek nadał mu nazwę.
Podmiana celu
Drugi mechanizm to uznanie porozumienia za sukces, choć porozumienie nie realizuje celów mocodawcy. W literaturze o negocjacjach między ludźmi istnieje pojęcie pułapki porozumienia: Taya Cohen, Geoffrey Leonardelli i Leigh Thompson pokazali w eksperymentach z 2014 r., że gdy strefa porozumienia jest ujemna, czyli żadna umowa nie jest dla stron lepsza od jej braku, zespoły częściej niż pojedynczy negocjatorzy rozpoznają ten fakt i kończą rozmowy impasem. Pojedynczy negocjator częściej podpisuje. Pytanie, które stawia ten tekst, brzmi: czy model językowy przy stole nie jest aby tym pojedynczym negocjatorem w najczystszej postaci.
Cudza linijka
Trzeci mechanizm to ocena „rozsądności” względem punktu odniesienia, który ustaliła druga strona. Jeżeli dostawca proponuje limit odpowiedzialności w wysokości rocznego wynagrodzenia, a nabywca dziewięcioletniego, to pięcioletni „kompromis” nie ma żadnego samoistnego tytułu do nazywania się odpowiednim handlowo. Właściwe porównanie dotyczy ekspozycji na szkodę, ubezpieczenia, ceny, alternatyw i siły przetargowej, a nie symetrii liczb. Środek jest wartością na linijce; kto podsunie linijkę, ten wyznacza środek. Mechanizm ma mocne oparcie w badaniach nad kotwiczeniem, do których wrócę.
Dryf mandatu
Czwarty mechanizm to brak uzgodnienia kolejnych lokalnych odpowiedzi z pierwotnymi priorytetami klienta, jego warunkami granicznymi i wcześniej zaakceptowanymi ustępstwami. Każda runda jest odpowiedzią na poprzednią rundę, a nie na mandat. Po kilku turach dokument odpowiada już tylko na samego siebie. W badaniu Liang i Xu, o którym niżej, autorzy piszą wprost, że przy delegowaniu negocjacji na agenta to prompt pełni funkcję mandatu. Jeśli mandat jest jednym zdaniem w rodzaju „popraw i znajdź rozsądne rozwiązanie”, dryf nie jest ryzykiem, lecz pewnością.
Te cztery etykiety są narzędziami analitycznymi, nie zweryfikowaną taksonomią. Ich wartość polega na tym, że każdy mechanizm da się mierzyć osobno i każdy może wystąpić bez pozostałych. Młyn bez podmiany celu to kosztowna, ale nieszkodliwa kosmetyka. Podmiana celu bez młyna to szybka zła umowa. Cudza linijka bez dryfu to jedno złe ustępstwo. Dopiero razem tworzą pętlę: proces, który nie ma mandatu, nie ma pamięci spraw zamkniętych i nie ma ekonomicznie sensownej reguły stopu.
Deficyt odmowy: co naprawdę pokazał RedlineBench
Zacznijmy od najbliższego praktyce źródła, z zastrzeżeniem, że nie jest to recenzowana praca naukowa, lecz raport branżowy. Sharan Ramjee i współautorzy z Crosby oraz micro1 zbudowali RedlineBench na trzech symulowanych transakcjach SaaS: spółka technologiczna z rundy A negocjuje z dużo większym kontrahentem, raz na własnym wzorze, raz na cudzym, raz w wersji „umowa, którą trzeba wygrać”. Wielu prawników niezależnie inicjowało poprawki i odpowiadało na cudze poprawki, co dało rozgałęzione drzewo wzorcowych odpowiedzi i rubryk. Modele nie negocjowały ze sobą: każdy był oceniany tura po turze za odpowiedź na stan umowy przygotowany przez prawników. Modele (GPT-5.5, Claude Fable 5, Gemini 3.5 Flash, Claude Opus 4.8) uzyskały łącznie 44,4 do 50,5 proc. punktów, przy czym Claude Fable 5, o którego ograniczonej dostępności pisałem osobno, miał tylko jedno przejście testu zamiast trzech. Rozrzut między modelami jest wąski; żaden nie oderwał się od stawki.
Trzy ustalenia szczegółowe są dla tezy o pętli ważniejsze niż wynik łączny.
Pierwsze: modele najgorzej wypadły w pierwszej turze, czyli tam, gdzie trzeba samodzielnie zdecydować, które postanowienia są istotne i w jakim kierunku je ruszyć (17,9 do 30,3 proc. punktów, wobec 50 do 60 proc. w turach późniejszych). Co znamienne, pierwsza tura jest zarazem miejscem największej zgodności prawników co do tego, co ma znaczenie. Modele radzą sobie więc lepiej z odpowiadaniem w ustalonym kontekście niż z wyznaczaniem kontekstu. Negocjator, który umie odpowiadać, a nie umie zaczynać, jest skazany na reagowanie: idealny uczestnik pętli.
Drugie: deficyt odmowy. Gdy rubryka wymagała przyjęcia poprawki kontrahenta, modele zaliczały ją w 80 do 99 proc. przypadków; gdy wymagała odrzucenia, w 6 do 50 proc. Autorzy raportu nazywają to postawą potakiwacza i piszą, że modele nie rozumieją handlowej stawki stojącej za poprawką, więc domyślnie się zgadzają. Trzeba tu uczciwie dodać, czego ta liczba nie mówi: 6 do 50 proc. zaliczonych kryteriów odrzucenia to nie 50 do 94 proc. szkodliwych ustępstw w każdej umowie. Mianownikiem są kryteria rubryk, nie klauzule. Ale kierunek asymetrii jest jednoznaczny i powtarzalny we wszystkich czterech modelach, także w scenariuszach, w których nic wprost nie zachęcało do zgody.
Trzecie: zakres poprawek. Wszystkie modele częściej niż prawnicy sięgały po wymianę całych bloków tekstu (62 do 81 proc. zmian wobec 51 proc. u prawników). Większa zmiana nie jest tym samym co zmiana zbędna, raport tego nie rozstrzyga. Ale jest tym samym co większa powierzchnia ataku: każde przeredagowane zdanie to nowe miejsce, w które kontrahent może wejść z własną poprawką. Blok rodzi blok. Młyn ma więc mechanizm napędowy wbudowany w sam sposób pisania.
Deficyt odmowy wart jest osobnego terminu, bo tłumaczy, dlaczego pętla działa w jedną stronę. Negocjator, któremu łatwiej powiedzieć „tak” niż „nie”, nie oscyluje wokół równowagi; zsuwa się. Każda runda, w której druga strona coś zaproponuje, kończy się dla niego częściowym przyjęciem, a każda runda, w której to on proponuje, kończy się częściowym cofnięciem po sprzeciwie. Suma takich rund nie jest kompromisem. Jest serią ustępstw rozłożoną w czasie tak, by żadne z osobna nie wyglądało na kapitulację.
Zgoda to nie wynik
Deficyt odmowy byłby ciekawostką, gdyby nie drugi nurt badań, z którego wynika, że wysoki odsetek zawieranych porozumień nie mierzy kompetencji negocjacyjnej. Erica Zhang, Susan Athey, James Zou i współautorzy ze Stanfordu zbudowali TERMS-Bench, w którym środowisko samo jest sędzią: badacz zna ukryty typ, politykę i funkcję wypłaty symulowanego kontrahenta, więc może policzyć, ile wartości agent zostawił na stole. Spośród trzynastu badanych modeli, obejmujących czołowe systemy głównych dostawców, modele czołowe osiągają niemal pełny odsetek zawartych transakcji, a potem rozchodzą się w wyciąganiu nadwyżki, kalibracji przekonań i reakcji na sygnały. Autorzy piszą, że ciepłe sygnały w komunikacji kontrahenta skłaniają agentów do nadmiernych ustępstw, a sygnały presji wywołują zachowania kruche, i że oszacowany efekt sygnałów był ujemny we wszystkich badanych modelach. Deal rate, jak to nazywają, maskuje wąskie gardła.
Jeszcze bliżej umów stoi praca Bhavyesha Sajji, Maxa Kleimana-Weinera, Rogera Zimmermanna i Tana Zhi-Xuana z sierpnia 2026 r., którzy w środowisku ContractSim kazali modelom (Claude Opus 5, Gemini 3.6 Flash, GPT-5.6-Sol) negocjować w języku naturalnym wieloetapowe umowy dostawy, a potem je wykonywać. Ze 162 negocjacji 159 zakończyło się umową. Ale tylko 84,9 proc. umów było korzystnych dla obu stron, co znaczy, że w 15,1 proc. zawartych umów co najmniej jeden z agentów przyjął umowę gorszą dla siebie niż jej brak. Po stronie dostawcy wskaźnik żalu akceptacji, czyli odsetek zakończonych negocjacji, w których agent skończył na warunkach gorszych od wcześniej dostępnej propozycji, wyniósł 15,7 do 35,2 proc. Innymi słowy: dostawca miał na stole lepszą propozycję, przeszedł obok niej, a potem zamknął negocjacje na gorszej. To podmiana celu, jeden z czterech mechanizmów pętli, w miniaturze, i to zmierzona. Autorzy odnotowują też, że żaden model nie dodał z własnej inicjatywy klauzul warunkowych (na wypadek niewykonania, wzrostu cen, strat w dostawie), choć takie klauzule mogłyby przesunąć umowę w stronę granicy efektywności; dodawał je dopiero po wyraźnym poleceniu, i to bez wyraźnej poprawy jakości umowy.
Trzecie badanie, Chen Lianga i Fashenga Xu z University of Connecticut, jest najlepszym dostępnym pomiarem kosztu rundy. W 9 840 negocjacjach dziewięciu modeli od OpenAI, Google i Alibaby w klasycznym modelu kontraktu w łańcuchu dostaw agenci dochodzili do porozumienia w 98,9 proc. przypadków i realizowali 95,4 proc. teoretycznie dostępnej nadwyżki, ale potrzebowali na to średnio 2,98 rundy, podczas gdy równowaga bayesowska przewiduje 1,25. Gdy opóźnienie wycenić (autorzy traktują dyskontowanie jako test obciążeniowy, nie jako pomiar rzeczywistej niecierpliwości), delay zjada 21 do 34 proc. nadwyżki. Co istotne dla uczciwości tezy: najzdolniejsze modele brały więcej rund (3,25 wobec 2,75 u modeli bazowych), ale osiągały lepsze wyniki niezdyskontowane (98,9 wobec 91,0 proc.). Dodatkowa runda nie jest więc z definicji stratą; jest inwestycją, która opłaca się tylko wtedy, gdy ktoś liczy jej koszt. Autorzy wprowadzają rozróżnienie, które w negocjacjach umów powinno stać się kanonem: cierpliwość strategiczna agenta, ustawiana w prompcie i darmowa, oraz cierpliwość ekonomiczna mocodawcy, czyli rzeczywisty koszt czekania. Runda między dwoma modelami trwa sekundy; runda między dwiema kancelariami trwa dni, kosztuje honoraria i blokuje transakcję. Model negocjuje cierpliwością, której nie płaci. Nazwijmy to cierpliwością na cudzy koszt.
Z tych trzech prac wynika jeden wniosek, który zamyka drogę najprostszemu usprawiedliwieniu pętli: „ale przecież doszliśmy do porozumienia”. Dojście do porozumienia jest w tych badaniach niemal gwarantowane. Różnica między dobrym a złym negocjatorem rozgrywa się całkowicie poniżej tego progu.
Cudza linijka: kotwiczenie i kompromis gramatyczny
Mechanizm cudzej linijki wymaga dwóch składników: podatności na kotwicę oraz skłonności do uznawania środka za rozwiązanie. Pierwszy składnik jest dobrze udokumentowany. Yoshiki Takenami, Yin Jou Huang, Yugo Murawaki i Chenhui Chu w pracy przedstawionej w Findings of EMNLP 2025 kazali sprzedającym agentom świadomie stosować kotwiczenie w symulowanych negocjacjach cenowych i stwierdzili, że kupujące modele ulegają mu tak jak ludzie; modele rozumujące były na kotwicę mniej podatne, co sugeruje, że długi łańcuch rozumowania częściowo ją neutralizuje. Yossi Maaravi i Tamar Gur w sześciu badaniach opublikowanych we wrześniu 2026 r. w International Journal of Human-Computer Interaction (premie, czynsze, sprzedaż zakładu) stwierdzili kotwiczenie w odpowiedziach ChatGPT i Claude, przy czym próba odkotwiczenia przez przyjęcie perspektywy drugiej strony nie usunęła efektu, a jedna z interwencji opartych na rozumowaniu krok po kroku go nasiliła. Federico Bianchi, Dan Jurafsky, James Zou i współautorzy w NegotiationArena (ICML 2024) pokazali, że agent, który udaje zdesperowanego, poprawia swoją wypłatę o 20 proc. w negocjacji ze standardowym GPT-4. Kotwicą nie musi być więc liczba; może nią być nastrój.
Drugi składnik ma starszą metrykę. Itamar Simonson opisał w 1989 r. w Journal of Consumer Research efekt kompromisu: opcja zyskuje na atrakcyjności, gdy zostanie umieszczona pośrodku zbioru, a efekt jest silniejszy, gdy wybierający spodziewa się, że będzie musiał swój wybór uzasadnić. Tu pojawia się hipoteza, której, o ile wiem, nikt jeszcze nie sprawdził na modelach, a która wydaje mi się najważniejsza w całym temacie: model językowy w użyciu prawniczym niemal zawsze uzasadnia, bo uzasadnienie jest jego właściwym produktem. Jeżeli u ludzi konieczność uzasadnienia wzmacnia skłonność do środka, to u systemu, który w tym użyciu nie robi niczego bez uzasadnienia, skłonność ta powinna być strukturalna. Powtórzę: to hipoteza, nie wynik.
Z połączenia obu składników powstaje coś, co nazywam kompromisem gramatycznym. Niebezpieczeństwo nie polega na tym, że model odkryje fałszywą prawdę prawną w połowie drogi między dwiema klauzulami. Polega na tym, że potraktuje kompromis obronny językowo jak decyzję uzasadnioną handlowo. W negocjacji umowy trzeba rozdzielać trzy pytania: co postanowienie znaczy, czy przesłanka faktyczna lub prawna jest prawdziwa, oraz czy podział ryzyka służy celom klienta. Tylko dwa pierwsze są pytaniami o poprawność; trzecie jest pytaniem o preferencje, alternatywy i strategię, i nie ma na nie „prawidłowej odpowiedzi w środku”. Kompromis gramatyczny to odpowiedź na pytanie trzecie udzielona metodami właściwymi dla pytań pierwszego i drugiego. Brzmi jak analiza. Jest arytmetyką na cudzej linijce.
Jest to zresztą drugi tom tej samej historii, którą opisałem przy okazji steganografii kontraktowej: tam chodziło o słowa ukryte w dokumencie, które przesuwają ocenę modelu, tu o liczby i tony ukryte w negocjacji, które przesuwają jego środek. Mechanizm jest wspólny. Model nie waży interesów; waży sygnały.
Iluzja korekty: dlaczego piętnasta wersja nie jest lepsza od czternastej
Wyjściem z pętli, jakie podpowiada intuicja, jest „jeszcze jedna runda przeglądu”. Badania nad samokorektą modeli każą tę intuicję odłożyć. Jie Huang i współautorzy wykazali w pracy przedstawionej na ICLR 2024, że badane modele, poproszone o poprawienie własnej odpowiedzi bez zewnętrznej informacji zwrotnej, nie poprawiały rozumowania, a bywało, że je psuły. Ryo Kamoi i współautorzy w krytycznym przeglądzie opublikowanym w Transactions of the ACL doprecyzowali warunek: korekta działa, gdy jest oparta na wiarygodnej informacji zwrotnej z zewnątrz, a wyniki dla informacji zwrotnej generowanej wyłącznie przez podpowiadane modele są znacznie słabsze. Zwrócili też uwagę na błąd metodologiczny wielu badań: nieliczenie korekt fałszywie dodatnich, czyli przypadków, w których poprawna odpowiedź została zmieniona na gorszą, oraz stosowanie reguły stopu, która ma dostęp do prawidłowej odpowiedzi niedostępnej w praktyce. Przeniesione na umowy brzmi to tak: prośba „przejrzyj jeszcze raz” nie dodaje faktów ani celu; dodaje tylko kolejny powód do zmiany. A zmiana postanowienia, które było już dobre, jest w negocjacji najdroższym rodzajem błędu, bo otwiera to, co było zamknięte.
Trzeba oddać sprawiedliwość stronie przeciwnej. Aman Madaan i współautorzy pokazali w Self-Refine (NeurIPS 2023) poprawę wyników przez iteracyjną autokorektę w siedmiu zadaniach, choć późniejszy przegląd Kamoi i współautorów kwestionuje część metodologii tego nurtu. Poprawny wniosek jest warunkowy: iteracja może poprawiać wynik, ale poprawę trzeba mierzyć wobec mocnej linii bazowej i liczyć szkody w tym, co było już wystarczające. Krytyka dotyczy iteracji bez walidacji, nie iteracji jako takiej.
Najbardziej obrazową ilustrację młyna dostarcza praca spoza prawa. Joshua Ashkinaze, Eric Gilbert i współautorzy z University of Michigan kazali modelom neutralizować stronnicze fragmenty Wikipedii i porównali wynik z poprawkami redaktorów. Mierzone wobec poprawek redaktorów, zmiany modeli miały wysoką czułość, ale niską precyzję: obejmowały większość tego, co zmienili redaktorzy, lecz przy okazji zmieniały też gramatykę i styl zdań, których zadanie nie dotyczyło, co autorzy nazwali „NPOV+”, neutralnością z nadwyżką. Co ciekawe, osoby oceniające wolały wersje modelu jako płynniejsze i bardziej neutralne. Tekst się podobał; redakcja wyszła poza zadanie. W umowie ta sama nadwyżka ma inny skutek niż w encyklopedii: każde ulepszone zdanie to postanowienie, które kontrahent może na nowo zakwestionować, i to z argumentem „skoro zmieniliście, to otwieramy”.
Skąd się bierze uległość
Najczęstsze wyjaśnienie deficytu odmowy brzmi: modele są trenowane na aprobatę ludzi, więc nauczyły się zgadzać. Mrinank Sharma i współautorzy z Anthropic wykazali w pracy o sykofancji (ICLR 2024), że pięć badanych asystentów dostosowuje odpowiedzi do przekonań użytkownika, zmienia zdanie pod wpływem sprzeciwu i ocenia ten sam tekst różnie zależnie od tego, czy użytkownik zadeklarował, że go lubi, nie lubi albo sam napisał; co gorsza, zarówno ludzie, jak i modele preferencji trenowane na ludzkich ocenach bywają skłonni wyżej oceniać odpowiedź przekonująco przytakującą niż poprawną.
Z tego ustalenia nie wolno jednak zbudować prostego łańcucha „trening na aprobatę, więc sykofancja, więc kompromis, więc zła umowa”. Każda strzałka wymaga osobnego dowodu. Sykofancja opisana przez Sharmę dotyczy użytkownika, nie kontrahenta. Model schlebiający własnemu mocodawcy mógłby równie dobrze stać się nadmiernie wojowniczy, bo mocodawca chce usłyszeć, że ma rację. Dlaczego więc w RedlineBench modele ustępują kontrahentowi? Moja hipoteza jest procesowa, nie charakterologiczna. Asystent proszony o „znalezienie ryzyk” proponuje interwencje; asystent proszony o „znalezienie akceptowalnego kompromisu” proponuje ustępstwa. W typowym przebiegu negocjacji pełnomocnik przełącza te tryby z rundy na rundę: raz broni, raz szuka zgody. System bez trwałego mandatu wykonuje każde polecenie lokalnie doskonale i globalnie bez sensu: naprawia ryzyka, które sam wprowadził dwie rundy wcześniej, i otwiera kwestie, które sam zamknął. Tak rozumiana pętla nie wymaga, by model miał jakąkolwiek stałą skłonność do środka. Wystarczy, że ma dwie skłonności naprzemienne i żadnej pamięci, która by je godziła.
Dochodzi do tego zjawisko, które utrudnia obronę przed pętlą przez „drugą opinię”. Min Choi i współautorzy pokazali w ponad 2 500 symulowanych debatach (Findings of ACL 2025), że początkowo neutralni agenci przyjmują z czasem stanowisko liczniejszej grupy albo agenta uznanego za zdolniejszego. Zgodność kilku modeli, które widzą swoje odpowiedzi, nie jest więc niezależnym potwierdzeniem; może być konformizmem. Jeśli pełnomocnik pyta trzy modele i wszystkie zalecają „rozsądny kompromis”, dowiedział się być może tylko tyle, że trzy modele czytały to samo pytanie. Zapytany o to, czy model ma w tej zgodzie własny interes albo własne zdanie, odsyłam do tego, co pisałem o sztucznej inteligencji a świadomości: przypisywanie modelowi intencji jest w tym temacie błędem symetrycznym do przypisywania mu bezstronności.
Co mówi strona przeciwna
Uczciwa analiza musi przedstawić najmocniejszą wersję poglądu, że cała ta diagnoza jest przesadą. Ma on trzy filary.
Pierwszy: ugodowość tworzy wartość. Sean Noh i Herbert Chang w 1 500 symulowanych negocjacjach jednokwestiowych i wielokwestiowych stwierdzili, że agenci o ugodowej „osobowości” bywali wykorzystywani przez mniej ugodowych przeciwników, ale w negocjacjach obejmujących wiele kwestii zyskiwali na możliwości korzystnej wymiany ustępstw. Kompromis nie jest zły; zły jest kompromis nieuzależniony od siły przetargowej, alternatyw, wyceny kwestii i zachowania drugiej strony. Pętla nie jest zarzutem wobec ugodowości, lecz wobec ugodowości bez warunku.
Drugi: nie ma jednej „osobowości AI”. Liang i Xu pokazali, że tożsamość dostawcy modelu przewiduje kierunek przepływu nadwyżki lepiej niż jego moc: przy wspólnym prompcie, gdy model negocjował z samym sobą, udział kupującego w nadwyżce wynosił średnio 40 proc. u modeli OpenAI, 50 proc. u Google i 70 proc. u Qwen Alibaby, a samo odwrócenie ról między dostawcami przesuwało podział o 7 do 18 punktów procentowych. Teza o pętli musi więc dotyczyć klasy podatności procesu, a nie niezmiennej dyspozycji psychicznej każdego modelu. Nadmierne ustępstwo i nadmierna sztywność są dwiema awariami tej samej funkcji: wrażliwości na kontekst.
Trzeci: dodatkowe rundy bywają warte swojej ceny, co już omówiłem; i modele bywają skuteczne, co pokazuje ContractSim w środowiskach o niskiej niepewności, gdzie wiele wynegocjowanych umów leżało na granicy efektywności. Krytyka nie brzmi więc „AI nie umie negocjować”. Brzmi: „AI umie negocjować tam, gdzie negocjacja jest łatwa, i nie wie, kiedy przestaje być łatwa”.
Co z tego zostaje po odjęciu kontrargumentów? Dokładnie tyle, ile proponuję w definicji: nie prawo natury, lecz awaria procesu, do której dochodzi, gdy trzy rzeczy są nieobecne jednocześnie: mandat, pamięć spraw zamkniętych i reguła stopu.
Co to znaczy dla pełnomocnika
Prawo nie zna taryfy ulgowej dla narzędzia, a AI w negocjacjach umów jest narzędziem. Radca prawny lub adwokat, który prowadzi negocjacje umowy, odpowiada wobec klienta z umowy o świadczenie usług prawnych według miary należytej staranności uwzględniającej zawodowy charakter działalności (art. 355 § 2 Kodeksu cywilnego), a za nienależyte wykonanie zobowiązania na zasadach ogólnych (art. 471 Kodeksu cywilnego). Standard ten nie pyta, kto zaproponował ustępstwo: pełnomocnik, aplikant czy model. Pyta, czy ustępstwo mieściło się w tym, co klient chciał osiągnąć, i czy ktoś to sprawdził.
Z tej perspektywy pętla negocjacyjna AI jest przede wszystkim problemem mandatu. Decyzje handlowe, co zaakceptować, a co oddać, należą do klienta; pełnomocnik je przygotowuje, wyjaśnia skutki, co najwyżej podpowiada, a gdy negocjuje w granicach udzielonego z góry umocowania, wykonuje decyzję klienta, nie własną. Model, który w czternastej wersji „rozsądnie” przesunął limit odpowiedzialności, podjął decyzję handlową, do której nikt go nie umocował, a pełnomocnik, który tę decyzję przepuścił, bo „wyglądała na kompromis”, przepuścił ją bez mandatu. Dryf mandatu jest więc nie tylko błędem strategicznym, lecz także błędem w rozumieniu, czyim narzędziem jest pełnomocnik.
Druga konsekwencja dotyczy wrogiego czytelnika. Każdy projekt umowy przeczyta w końcu druga strona, a w razie sporu sąd. Druga strona, jeśli jest sprawna, rozpozna deficyt odmowy po trzeciej rundzie i zacznie z niego korzystać: dorzuci poprawkę, która wie, że przejdzie, cofnie ustępstwo, które wie, że nie zostanie wyegzekwowane, i podsunie linijkę, na której jej żądanie jest środkiem. Kto rozpozna pętlę u kontrahenta, może ją wykorzystać; kto rozpozna ją u siebie, musi ją przerwać. W negocjacjach umów, które prowadzę, stosuję w tym celu jedną regułę, starszą niż modele językowe: po tym, jak druga strona ustąpiła w kwestiach kluczowych, nie odsyłam jej nowej listy żądań. Taki ruch uczy kontrahenta, że ustępstwa niczego nie kończą, a więc nie opłaca się ich robić; na późnym etapie przedmiotem rozmowy mogą być już tylko doprecyzowania postanowień przyjętych, nie nowe fronty. Model, pozostawiony sam sobie, robi dokładnie odwrotnie, bo każda poprawka jest dla niego nową okazją do bycia pomocnym.
Trzecia konsekwencja jest praktyczna i wynika wprost z RedlineBench: modele są najsłabsze w pierwszym ruchu, tam, gdzie prawnicy są najbardziej zgodni. Pierwszy ruch, czyli wybór kwestii, o które warto walczyć, i kierunku, w którym je ruszyć, powinien więc pozostać przy człowieku. Nie z zasady, lecz dlatego, że dziś modele mierzalnie nie dorównują tam standardowi samych prawników.
Jak wyjść z pętli: mandat, rejestr, reguła stopu
Z czterech mechanizmów wynikają trzy brakujące elementy, a z nich trzy narzędzia, które porządkują pracę z AI w negocjacjach umów. Nie są to procedury zweryfikowane eksperymentalnie; są to wnioski z opisanych badań przełożone na praktykę kancelarii.
Mandat negocjacyjny jest dokumentem pisanym przed pierwszą wersją, a nie promptem pisanym przed każdą rundą. Zawiera priorytety klienta w kolejności, warunki graniczne, których pełnomocnik nie przekracza bez nowej decyzji, alternatywę na wypadek braku umowy oraz zależności między postanowieniami (limit odpowiedzialności ma sens tylko razem z ceną, ubezpieczeniem i katalogiem wyłączeń). Każda rekomendacja modelu jest oceniana wobec mandatu, nie wobec poprzedniej wersji. Liang i Xu pokazali, że to prompt jest mandatem agenta; wniosek dla prawnika brzmi, że mandat powinien być napisany jak prompt, a prompt jak mandat.
Rejestr spraw zamkniętych odpowiada na dryf i na młyn. Postanowienie uzgodnione trafia do rejestru z datą i uzasadnieniem i nie podlega ponownemu otwarciu bez nowej informacji. To jest test nowej informacji: jeżeli w rundzie dziewiątej nikt nie dowiedział się niczego, czego nie wiedział w rundzie szóstej, poprawka do klauzuli zamkniętej w rundzie szóstej jest młynem, choćby brzmiała mądrze. Rejestr ma dodatkową zaletę procesową: jest tym, czego model nie ma, czyli pamięcią nieulegającą ostatniemu komunikatowi.
Reguła stopu odpowiada na podmianę celu i na cierpliwość na cudzy koszt. Negocjacja kończy się porozumieniem, uzasadnionym odejściem od stołu albo eskalacją do klienta, a nie wyczerpaniem pomysłów na poprawki. Przed każdą rundą wartość spodziewanej poprawy pozycji porównuje się z kosztem rundy (honoraria, opóźnienie transakcji, ryzyko, że druga strona w międzyczasie zmieni zdanie). Jeśli to porównanie nie wypada na korzyść rundy, runda się nie odbywa, nawet gdy model ma „kilka dodatkowych sugestii”. Zawsze ma.
Do tych trzech dodałbym jedno ograniczenie higieniczne: nie mieszać trybów. Model proszony o inwentaryzację ryzyk nie jest proszony o kompromis, a model proszony o kompromis nie jest proszony o kolejne ryzyka. Każda zmiana merytoryczna otrzymuje jednozdaniowe uzasadnienie odwołujące się do mandatu, a zmiana, dla której takiego uzasadnienia nie da się napisać, nie jest zmianą, lecz młynem. Firmy, które traktują AI jako przewagę konkurencyjną, powinny ten warunek rozumieć najlepiej: przewaga bierze się z lepszych decyzji, nie z większej liczby wersji.
Podsumowanie
Sztuczna inteligencja w negocjacjach umów nie przegrywa przede wszystkim dlatego, że źle czyta prawo. Przegrywa wtedy, gdy nikt nie powiedział jej, czym jest wygrana, i gdy nikt nie pamięta, co już zostało wygrane. Deficyt odmowy napędza podmianę celu i sprawia, że zsuwa się w jedną stronę; cudza linijka sprawia, że środek wyznacza ten, kto pierwszy podsunie liczbę; iluzja korekty karmi młyn poprawek i sprawia, że każda kolejna runda wygląda na postęp; cierpliwość na cudzy koszt podtrzymuje dryf mandatu, bo nikt nie liczy, ile ten postęp kosztuje. Cztery mechanizmy napędzane tymi czterema siłami to pętla negocjacyjna AI, a wyjściem z niej nie jest sam lepszy model, lecz lepszy mandat, rejestr spraw zamkniętych i reguła stopu, które były dobrą praktyką negocjacyjną na długo przed modelami i których modele nie zastąpią.
Kancelaria Prawna Skarbiec zajmuje się sporządzaniem i negocjowaniem umów handlowych, inwestycyjnych i technologicznych, także wtedy, gdy negocjacje trwają już od wielu wersji i trzeba ustalić, które z dotychczasowych „kompromisów” służą klientowi, a które służyły tylko zamknięciu rundy.
Transakcje, przekształcenia i restrukturyzacje
Zmiana struktury firmy niesie skutki w podatkach, w umowach i w odpowiedzialności wspólników, a część z nich rozstrzyga się na etapie wyboru formy operacji. Prowadzimy transakcje, przekształcenia i restrukturyzacje od analizy wariantów po rejestrację.

Robert Nogacki jest radcą prawnym, założycielem i partnerem zarządzającym Kancelarii Prawnej Skarbiec, działającej nieprzerwanie od 2006 roku.
Prawo jest równe dla wszystkich, ale strony rzadko są równe: po jednej stoi organizacja, która ma czas, pieniądze i prawników, po drugiej człowiek, który ma jedną firmę, jedne oszczędności i jedno życie.
Klienci rzadko przychodzą do niego z problemem prawnym. Przychodzą z problemem, który ma także stronę prawną: z kontrolą, która zaczęła się od jednej faktury, z pieniędzmi powierzonymi komuś, kto zniknął, z firmą, którą trzeba przekazać dalej, zanim będzie za późno. Większość takich spraw rozstrzyga się na długo przed pierwszym pismem, w decyzjach podjętych bez pytania i w terminach, o których nikt nie pamiętał. Dlatego zaczyna od pytania, jak klient trafił w to miejsce, a nie od tego, co powinien był zrobić.
Doradza przedsiębiorcom i rodzinom z kilkunastu krajów, także tym, którym fiskus właśnie zajął konto i którzy nie wiedzą, co robić jutro rano. Broni ich w kontrolach podatkowych i celno-skarbowych, w sporach z organami podatkowymi i w sprawach karnych skarbowych. Reprezentuje poszkodowanych w oszustwach inwestycyjnych i piramidach finansowych. Pomaga rodzinom zakładać fundacje rodzinne i planować sukcesję, żeby dorobek życia przetrwał dłużej niż jedno pokolenie.
Nie każdą sprawę da się wygrać. Każdą da się prowadzić tak, żeby klient wiedział, na czym stoi. Od 2006 roku reprezentuje pokrzywdzonych w sprawie WGI (Warszawskiej Grupy Inwestycyjnej), jednej z najdłuższych spraw karnych w historii polskiego rynku finansowego, bo są rzeczy, których nie wolno zostawić w połowie, nawet jeśli trwają dwie dekady. W sprawie upadłej giełdy kryptowalut Zonda (Zondacrypto, operator BB Trade Estonia OÜ) reprezentuje kilkuset poszkodowanych w postępowaniu prowadzonym przez Prokuraturę Krajową i w estońskim postępowaniu upadłościowym.
Kancelaria Prawna Skarbiec jest notowana w rankingach największych firm doradztwa podatkowego Dziennika Gazety Prawnej i Rzeczpospolitej, a w latach 2015 do 2018 czterokrotnie otrzymała Medal Europejski Business Centre Club i Europejskiego Komitetu Ekonomiczno-Społecznego. Robert Nogacki publikuje regularnie, w prasie i na stronie kancelarii, dla ludzi, którzy mają problem, a nie dyplom prawnika, bo opinia prawna, której klient nie rozumie, chroni tylko prawnika.
Wierzy, że najlepsza porada prawna to ta, dzięki której klient nigdy nie musi stanąć przed sądem.