Wróć do bloga

Otwarte narzędzia do polskiego prawa - co pokazał test na czterech ustawach

5 min czytania
Otwarte narzędzia do polskiego prawa - co pokazał test na czterech ustawach
Zapytaliśmy o minimalny udział pojazdów elektrycznych we flocie administracji państwowej. Model podłączony do otwartego serwera prawo-pl-mcp odpowiedział 50 % - w każdej z dziesięciu prób. W ustawie po nowelizacji jest 22 %. Powód nie jest tajemniczy: w 51 z 65 błędów narzędziowych serwer znalazł właściwy akt, ale nie potrafił podać jego treści, więc model odpowiadał z pamięci. To ten sam test i ta sama uprząż, na których wcześniej mierzyliśmy samą wyszukiwarkę.

Co porównywaliśmy

prawo-pl-mcp to otwarty serwer MCP autorstwa MateMatic Solutions, na licencji Apache-2.0. Uruchamia się lokalnie (uvx prawo-pl-mcp, transport stdio) i jest agregatorem nad publicznymi API: ISAP, SAOS, NSA, KRS, EUREKA, KIO, UODO i EUR-Lex. Udostępnia pięć narzędzi ogólnego przeznaczenia - wyszukiwanie po słowach kluczowych, pobranie dokumentu i przekazanie zapytania do wybranego źródła. Nie ma narzędzi weryfikacyjnych, czyli takich, które sprawdzają, czy cytowany przepis albo sygnatura naprawdę istnieje.

Sprawdziliśmy go na tym samym zestawie czterech pytań, na którym opublikowaliśmy wcześniej wynik 27/40 dla samej wyszukiwarki i 40/40 dla narzędzi PrawMi - opis w artykule Czy AI zna polskie prawo?. Ten sam model (Claude Opus 4.7), ta sama uprząż, ten sam system prompt, po 10 prób na pytanie. Konkurenta uruchomiliśmy w dwóch trybach: z samymi jego narzędziami oraz z jego narzędziami plus wyszukiwarka internetowa.

Wyniki

Na 40 prób w każdym trybie: prawo-pl-mcp bez wyszukiwarki 11/40, prawo-pl-mcp z wyszukiwarką 26/40, sama wyszukiwarka 27/40, narzędzia PrawMi 40/40. Żaden run nie przekroczył limitu czasu, więc żaden nie wypadł z mianownika.

Najciekawsza jest środkowa para. Dołożenie tych narzędzi do wyszukiwarki nie poprawiło trafności na tym zestawie - 26/40 wobec 27/40 to remis w granicach szumu. Same narzędzia, bez weba, wypadają wyraźnie poniżej samej wyszukiwarki.

Ilustracja do artykułu: Otwarte narzędzia do polskiego prawa - co pokazał test na czterech ustawach - trendy AI w prawie
Poprawne odpowiedzi na 40 prób w każdym trybie: prawo-pl-mcp bez wyszukiwarki 11, prawo-pl-mcp z wyszukiwarką 26, sama wyszukiwarka 27, narzędzia PrawMi 40.

Dominująca przyczyna - narzędzie znajduje akt, ale nie podaje treści

Z 65 błędów narzędziowych zarejestrowanych w trace'ach 51 to jeden i ten sam błąd: pobranie tekstu ustawy z ISAP kończy się komunikatem, że wersja HTML nie jest udostępniona, i odesłaniem do PDF-a. Dotyczy to obu pytań z ustawy PNR (po 16 wystąpień na pytanie w trybie bez weba).

Skutek jest przewidywalny. Model wie, którą ustawę czytać, nie może jej przeczytać i odpowiada z pamięci - czyli z tekstu sprzed nowelizacji. Stąd 10 na 10 odpowiedzi „50 %" tam, gdzie w obowiązującym art. 34 ustawy o elektromobilności jest 22 %, i zero trafień na pytanie o 60-dniową karencję z nowelizacji z 2025 roku (padały 30, 90, 180 i 75 dni).

To różnica architektoniczna, nie usterka. Agregator nad publicznymi API jest zależny od tego, w jakiej formie źródło wystawia dokument. My serwujemy tekst jednolity z własnej bazy, więc pytanie „co dokładnie mówi ten artykuł" ma zawsze odpowiedź.

Ilustracja do artykułu: Otwarte narzędzia do polskiego prawa - co pokazał test na czterech ustawach - trendy AI w prawie
Poprawne odpowiedzi na każde z czterech pytań, 10 prób każde. Brak słupka oznacza zero trafień - prawo-pl-mcp bez wyszukiwarki nie trafił ani razu w pytaniu o elektromobilność i w pytaniu o karencję PNR.

Gdzie konkurent wypada dobrze

Na pytaniu o obniżkę kary PNR (prawidłowo 75 %) prawo-pl-mcp uzyskał 7/10 w obu trybach - dokładnie tyle samo, co sama wyszukiwarka. Na pytaniu o elektromobilność tryb z wyszukiwarką (6/10) wypadł lepiej niż sama wyszukiwarka (4/10), więc narzędzia realnie tam pomogły.

Mediana czasu jednego przebiegu to 33 s bez weba i 41 s z webem, czyli koszt czasowy jest porównywalny. Widać za to, że model więcej się szarpie: 87 prób pobrania dokumentu i 66 wyszukiwań na 40 przebiegów, bo po każdym błędzie ponawia. Dziewięć razy próbował też wywołać narzędzie bez prefiksu serwera. Pięć narzędzi ogólnych z parametrem „źródło" jest dla modelu mniej czytelne niż narzędzia nazwane po dziedzinie, ale to obserwacja poboczna, nie główny wynik.

Zastrzeżenia, które trzeba przeczytać razem z liczbami

Zestaw nie jest neutralny. Te cztery pytania wybraliśmy wcześniej pod kątem słabości samej wyszukiwarki, a nie pod kątem tego konkretnego serwera. Ten pomiar odpowiada więc na pytanie „czy prawo-pl-mcp zamyka tę samą lukę, którą zamyka PrawMi", a nie „który serwer jest lepszy w ogóle". Neutralny ranking wymagałby zestawu ułożonego przez kogoś trzeciego.

Zestaw nie dotyka źródeł, które konkurent pokrywa. prawo-pl-mcp sięga m.in. do KRS i KIO. Cztery pytania o ustawy nie mówią o tych źródłach nic.

To nie był jeden wspólny przebieg. Liczby dla wyszukiwarki i dla PrawMi pochodzą z 27 kwietnia 2026, liczby konkurenta z 4 września 2026. Model i uprząż są te same, ale pomiar rozdziela kilka miesięcy.

Próba jest mała. Cztery pytania po 10 prób. Mocne jest to, że błąd jest powtarzalny - 10/10 tej samej złej wartości to nie jest szum, tylko systemowa nieaktualność.

Co to oznacza w praktyce

Jeśli podłączasz model do prawa przez otwarty agregator, sprawdź jedną rzecz przed resztą: czy narzędzie potrafi podać treść przepisu, czy tylko go zlokalizować. Wyszukiwarka po słowach kluczowych, która kończy odesłaniem do PDF-a, zostawia model z jego pamięcią, a pamięć modelu jest sprzed nowelizacji.

Druga rzecz to weryfikacja. Żadne z pięciu narzędzi prawo-pl-mcp nie sprawdza, czy cytowany artykuł albo sygnatura istnieje. Przy pisaniu pisma to jest ten moment, w którym błąd wychodzi dopiero po drugiej stronie.

Trzecia: otwarty serwer i tak ma sens tam, gdzie zamknięty go nie ma - KRS, KIO, EUR-Lex, lokalne uruchomienie bez konta. Warto go znać i warto go używać do tego, do czego się nadaje.

Metodologia

Model: Claude Opus 4.7, domyślny effort. Cztery pytania po 10 uruchomień na tryb, limit 480 s na wywołanie, restrykcyjna lista narzędzi. Ground truth z tekstu jednolitego ISAP, weryfikowany ręcznie. Ocena: automatyczna ekstrakcja liczby z odpowiedzi i porównanie z ground truth. Konkurent uruchamiany jako uvx prawo-pl-mcp (FastMCP, stdio), narzędzia odczytane z jego odpowiedzi tools/list. Pełne trace'y JSONL każdego przebiegu są dostępne na życzenie.

Nasz serwer MCP ma dziś 17 narzędzi - poza ustawami i orzecznictwem także KRS, interpretacje podatkowe i regulacje unijne, plus narzędzia weryfikujące cytaty i sygnatury. Jest też endpoint bez klucza, do sprawdzenia bez zakładania konta: opis i konfiguracja serwera MCP.

Źródła:

Przeczytaj również