Jak sprawdzamy
Sztuczna inteligencja (AI) przyporządkowuje Pana/Pani opis do reguł rozporządzenia. Godziny, stopień i pieniądze przelicza stały program, bez AI. Wynik może być błędny, dlatego na końcu to Pan/Pani sprawdza i decyduje.
Jak to działa
- Pan/Pani
Opis
Opisuje Pan/Pani swoją codzienność własnymi słowami.
- AI
Przyporządkowanie
AI przyporządkowuje zdania do reguł, z dosłownym cytatem.
- Program
Obliczenie
Stały program liczy według rozporządzenia.
- Pan/Pani
Decyzja
Przegląda Pan/Pani każdy wiersz i decyduje, co z tym zrobić.
Jak często ma rację
Najbardziej wiarygodne do tej pory: nietknięte przypadki sądowe
5 z 15
W przypadkach sądowych, których po zbudowaniu narzędzia już nie ruszaliśmy, za pierwszym razem ustalił właściwy stopień, w pozostałych zwykle za niski.
Stan na dziś: przypadki ćwiczeniowe
10 z 14
W przypadkach ćwiczeniowych z opublikowanych wyroków, na których go dostrajaliśmy, za pierwszym razem ustalił właściwy stopień.
Pflegegeld-Prüfer pomaga się przygotować. Stopień ustala urząd lub sąd. Proszę skorzystać z doradztwa.
Przygotowanie
Zebraliśmy 29 opublikowanych wyroków dotyczących Pflegegeld (zasiłku pielęgnacyjnego). Już sam Bescheid (decyzja urzędowa) w 13 z tych przypadków nie odpowiadał stopniowi, który ostatecznie ustalił sąd.
Zasady ustalone z góry
Zanim zmierzyliśmy po raz pierwszy, było ustalone, co liczy się jako trafienie i jaki jest cel: 12 z 14 przypadków ćwiczeniowych.
Pierwsze pomiary
Pierwszy przebieg trafił 9 z 14. Raz wprowadziliśmy poprawki, a potem zamroziliśmy reguły i instrukcje dla AI. Ostatni przebieg trafił 10 z 14, cel nie został więc osiągnięty.
W 4 z tych trafień właściwą odpowiedzią nie był żaden stopień: brak prawa do świadczenia albo dziecko, dla którego narzędzie nie wykonuje obliczeń. W przypadkach z rzeczywistym stopniem trafił 6 z 9.
Próba na nietkniętych przypadkach
Jeden raz, na końcu, na 15 kolejnych wyrokach: prawidłowo w 5. Potem niczego już nie zmienialiśmy. W przypadkach z rzeczywistym stopniem było to 4 z 13.
Od tego czasu
Strona jest publiczna. Ulepszyliśmy pytania uzupełniające i wygląd strony. Dnia 28.09.2026 porównaliśmy na tych samych przypadkach modele AI, łącznie 10. Gemini 3.8 Flash, model dla Pana/Pani własnego tekstu, trafiał w przypadkach ćwiczeniowych tak samo często jak model, który przyjmujemy jako miarę jakości. Dnia 29.09.2026 zmierzyliśmy ponownie, wynik jest pokazany wyżej jako stan na dziś.
Mierzymy na opublikowanych wyrokach, w których właściwy stopień jest już znany. Jedną część wykorzystujemy do ćwiczeń i ulepszeń. Innej części przy tym nie ruszamy i sprawdzamy ją dopiero na końcu.
Co liczy się jako trafienie, ustalamy z góry i zapisujemy. Późniejsze zmiany są tam zapisane z datą. Każdy pomiar jest dopisywany i żaden nie jest usuwany, także te złe.
Sami wciąż podważamy naszą metodę. Przy każdej zmianie działa automatyczna kontrola bez AI. Przelicza raporty, sprawdza mianowniki i szuka śladów nietkniętych przypadków w regułach. Nie potrafi mierzyć od nowa. To, co przy tym znajdujemy, jest opisane niżej w części o ograniczeniach.
Zmierzono dnia 29.09.2026 modelem Gemini 3.8 Flash, tym samym, który czyta też Pana/Pani własny tekst. Na tych przypadkach go dostrajaliśmy, dlatego ta liczba jest raczej zawyżona.
Zmierzono jeden raz, dnia 26.09.2026. Ta liczba najwięcej mówi o tym, jak radzi sobie z nowymi przypadkami.
Dla porównania: gdyby w tych przypadkach po prostu przyjąć stopień z Bescheidu, byłoby to trafne w 8 z 14 przypadków, czyli częściej. Narzędzie nie rozpoznaje więc niezawodnie, czy Bescheid jest prawidłowy.
Gdy program dostaje godziny z wyroku, stopień zgadza się we wszystkich 22 przypadkach ćwiczeniowych i fikcyjnych. W nietkniętych przypadkach w 12 z 15. Pozostałe wyroki nie podają godzin dla poszczególnych czynności, więc program nie ma danych wejściowych.
Jeśli się mylił, to zwykle za nisko: dziesięć razy za nisko, dwa razy za wysoko.
Co to oznacza dla Pana/Pani?
Jeśli pokazuje więcej niż Pana/Pani Bescheid, warto przyjrzeć się dokładnie i skorzystać z doradztwa.
Jeśli nie pokazuje więcej, nie znaczy to, że Pana/Pani Bescheid jest prawidłowy. Raczej coś przeoczy, niż obieca za dużo.
Ograniczenia
Gdzie może się mylić
- Mierzono na niewielu przypadkach. To sprawia, że każda liczba jest niedokładna.
- Przypadki sądowe to opowiedziane na nowo wyroki, a jeszcze nie opisy prawdziwych rodzin.
- Jaki stopień jest właściwy dla każdego wyroku, wywnioskowała z wyroku AI. Prawnik jeszcze tego nie sprawdził.
- Część reguł narzędzia wyprowadzono z przypadków, które później posłużyły jako nietknięte przypadki. Może to nieco poprawiać wynik w tych przypadkach.
- Pana/Pani własny tekst czyta Gemini 3.8 Flash, ten sam model co przy stanie na dziś. Na nietkniętych przypadkach nie był on jeszcze mierzony.
Czego nie robi
- Nie decyduje o Pflegegeld (zasiłek pielęgnacyjny).
- Nie udziela porad i nie reprezentuje Pana/Pani.
- AI nie liczy. Częstotliwości przejmuje tylko z Pana/Pani słów.
- Nie zapisuje opisu na stałe.
Czy stopień się zgadza?
Proszę opisać zwykły dzień. Narzędzie przyporządkowuje zdania do reguł i przelicza, czy stopień w Bescheidzie jest właściwy.
Sprawdź mój BescheidDla specjalistów
Ostatnia runda pomiarowa z dnia 29.09.2026.
Wszystkie rundy pomiarowe
Każda oceniona runda, w której AI czyta opis, w kolejności chronologicznej. Nic nie jest nadpisywane.
- 26.09.2026 · Przypadki ćwiczeniowe: 9 z 14Przedział od 39 do 84 % · Model Claude Opus 5.5Erster Lauf aus freiem Text, vor der einen Änderung an der Anweisung an die KI.
- 26.09.2026 · Przypadki ćwiczeniowe: 10 z 14Przedział od 45 do 88 % · Model Claude Opus 5.5Endlauf nach dem Einfrieren von Regeln und Anweisung. Das ist die vorher festgelegte Hauptzahl.
- 26.09.2026 · Przypadki fikcyjne: 7 z 7Przedział od 65 do 100 % · Model Claude Opus 5.5Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 26.09.2026 · Nietknięte przypadki: 5 z 15Przedział od 15 do 58 % · Model Claude Opus 5.5Unberührte Fälle, einmal gemessen, danach nichts verändert.
- 26.09.2026 · Nowe wyroki, pilotaż: 6 z 6Przedział od 61 do 100 % · Model Claude Opus 5.5Pilot mit neuen Urteilen, nicht vorher festgelegt. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Przypadki ćwiczeniowe: 10 z 14Przedział od 45 do 88 % · Model Claude Opus 5.5 · Średnia różnica w godzinach: 17,7Modellvergleich, Bezugsarm für die Qualität. Verfehlt dieselben Übungsfälle wie das Modell, das eigenen Text liest.
- 28.09.2026 · Przypadki fikcyjne: 7 z 7Przedział od 65 do 100 % · Model Claude Opus 5.5 · Średnia różnica w godzinach: 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Przypadki graniczne: 2 z 2Przedział od 34 do 100 % · Model Claude Opus 5.5 · Średnia różnica w godzinach: 0Modellvergleich, Randfälle.
- 28.09.2026 · Nowe wyroki, pilotaż: 6 z 6Przedział od 61 do 100 % · Model Claude Opus 5.5 · Średnia różnica w godzinach: 5Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Przypadki ćwiczeniowe: 10 z 14Przedział od 45 do 88 % · Model Claude Sonnet 5 · Średnia różnica w godzinach: 17,3Modellvergleich, bestes weiteres Modell aus der Sichtung.
- 28.09.2026 · Przypadki fikcyjne: 6 z 7Przedział od 49 do 97 % · Model Claude Sonnet 5 · Średnia różnica w godzinach: 0,7Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Przypadki graniczne: 2 z 2Przedział od 34 do 100 % · Model Claude Sonnet 5 · Średnia różnica w godzinach: 0Modellvergleich, Randfälle.
- 28.09.2026 · Nowe wyroki, pilotaż: 6 z 6Przedział od 61 do 100 % · Model Claude Sonnet 5 · Średnia różnica w godzinach: 0,8Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Przypadki ćwiczeniowe: 10 z 14Przedział od 45 do 88 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 19,4Modellvergleich mit dem Modell, das eigenen Text liest, gleichauf mit Claude Opus. Gemessen über das lokale Abo-Gateway, nicht über den Weg der gehosteten Prüfung.
- 28.09.2026 · Przypadki fikcyjne: 7 z 7Przedział od 65 do 100 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Przypadki graniczne: 1 z 2Przedział od 10 do 91 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 0Modellvergleich, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 28.09.2026 · Nowe wyroki, pilotaż: 5 z 6Przedział od 44 do 97 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 4,2Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 29.09.2026 · Przypadki ćwiczeniowe: 10 z 14Przedział od 45 do 88 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 17,8Zweite Messrunde, neu gemessen nach der Änderung der Regel zur Bindung an den Bescheid bei einer Klage (Link und Wortlaut); die Anweisung an die KI blieb gleich. Wie im Modellvergleich über das lokale Abo-Gateway gemessen, nicht über den Weg der gehosteten Prüfung.
- 29.09.2026 · Przypadki fikcyjne: 7 z 7Przedział od 65 do 100 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 0,9Zweite Messrunde. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 29.09.2026 · Przypadki graniczne: 1 z 2Przedział od 10 do 91 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 0Zweite Messrunde, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 29.09.2026 · Nowe wyroki, pilotaż: 5 z 6Przedział od 44 do 97 % · Model Gemini 3.8 Flash · Średnia różnica w godzinach: 3,3Zweite Messrunde. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
Nietknięte przypadki
Pierwsze podejście: 5 z 15 przypadków z trafionym stopniem referencyjnym. Na 100 podobnych przypadków prawdopodobnie od 15 do 58 byłoby prawidłowych.
W tym: z rzeczywistym stopniem 4 z 13, bez prawa do świadczenia 1 z 1, dziecko poza zakresem 0 z 1.
Chybione: 10. W tym 7 za nisko, 2 za wysoko, raz nie rozpoznano dziecka.
Prawidłowo w każdym przebiegu: 3 z 15.
Z pytaniem uzupełniającym: 7 z 15.
Te przypadki oceniono jeden raz na końcu i potem niczego na nich nie ulepszano. Wynik jest tutaj, nawet jeśli jest zły.
Przed zbudowaniem narzędzia te przypadki brały już udział w porównaniach modeli. Reguły, które podają jeden z nich jako źródło: 22, z czego w tekście dla AI: 10. Dotyczy to: X16, X19, X21, X22, X24, X25, X28, X29, X30. Same identyfikatory przypadków nie występują w tekście dla AI. Dlatego mówimy o tych przypadkach „nietknięte od zbudowania narzędzia”, a nie „nowe”.
Przyjęcie stopnia z Bescheidu
Nietknięte przypadki: spośród 14 przypadków ze stopniem referencyjnym pierwotny Bescheid trafił w 8, czyli częściej niż Pflegegeld-Prüfer.
Przypadki ćwiczeniowe: spośród 14 przypadków ze stopniem referencyjnym Bescheid trafił w 5, czyli rzadziej niż Pflegegeld-Prüfer.
W 16 z 29 zebranych wyroków z Bescheidem Bescheid miał ten sam stopień co wyrok.
Jeśli jego wynik różni się od Bescheidu, nie dowodzi to, że Bescheid jest błędny. To powód, by przyjrzeć się dokładniej i skorzystać z doradztwa.
Czy pokazuje więcej, gdy Bescheid był za niski?
Policzone po fakcie, nie ustalone z góry. Przy następnym pomiarze ustalimy tę wielkość z góry.
Nietknięte przypadki: gdy Bescheid był poniżej stopnia referencyjnego, Pflegegeld-Prüfer pokazał więcej niż Bescheid w 4 z 6 przypadków. Gdy Bescheid był prawidłowy, Pflegegeld-Prüfer mimo to pokazał więcej w 1 z 8 przypadków.
Przypadki ćwiczeniowe: gdy Bescheid był poniżej stopnia referencyjnego, Pflegegeld-Prüfer pokazał więcej niż Bescheid w 3 z 3 przypadków. Gdy Bescheid był prawidłowy, Pflegegeld-Prüfer mimo to pokazał więcej w 0 z 5 przypadków.
Przypadki ćwiczeniowe
Pierwsze podejście: 10 z 14 przypadków z trafionym stopniem referencyjnym. Na 100 podobnych przypadków prawdopodobnie od 45 do 88 byłoby prawidłowych. Cel ustalony z góry: 12, nieosiągnięty.
W tym: z rzeczywistym stopniem 6 z 9, bez prawa do świadczenia 1 z 1, dziecko poza zakresem 3 z 4.
Prawidłowo w każdym przebiegu: 10 z 14.
Trafione oznacza: większość z 3 przebiegów trafia w stopień referencyjny. Do tego dochodzi jeden przypadek szczególny, w którym ocenia się zachowanie. Liczy się go osobno; razem przypadków ćwiczeniowych: 15.
Z pytaniem uzupełniającym: 13 z 15. Liczone, gdy trafił w stopień albo zadał pytanie, które było kluczowe. Cel ustalony z góry: 13, osiągnięty.
Chybione: 4. W tym 3 za nisko, żaden za wysoko. Raz nie rozpoznał przypadku dziecka.
Liczenie bez AI
Z godzinami z wyroku program trafia w 22 z 22 przypadków, łącznie przypadki ćwiczeniowe i fikcyjne. Cel ustalony z góry: 22, osiągnięty.
Nietknięte przypadki: 12 z 15. Chybione: X18, X25 i X30. Te wyroki podają tylko stopień, bez godzin dla poszczególnych czynności, dlatego program nie dostaje danych wejściowych.
Przypadki fikcyjne
Pomiar wykorzystuje przypadki fikcyjne, łącznie 7. AI czyta opis, program liczy: 7 z 7 z oczekiwanym stopniem. Cel ustalony z góry: 6, osiągnięty. Z tego 5 można samodzielnie wypróbować na stronie sprawdzania.
Opowiedziane inaczej: żadne z 35 przeformułowań nie zmieniło stopnia. Ten pomiar nie był ustalony z góry.
Model używany przy sprawdzaniu
Sprawdzanie z własnym tekstem korzysta z modelu Gemini 3.8 Flash. Stan na dziś pochodzi z tego modelu. Szczegóły dotyczące przypadków ćwiczeniowych i nietkniętych przypadków w tej części pochodzą z przebiegów przy użyciu modelu Claude Opus 5.5.
Pierwszy osobny przebieg z modelem Gemini 3.8 Flash dnia 26.09.2026 trafił 11 z 14 przypadków ćwiczeniowych. Na 100 podobnych przypadków prawdopodobnie od 52 do 92 byłoby prawidłowych. Na nietkniętych przypadkach ten model nie był jeszcze mierzony.
Porównanie modeli
Dnia 28.09.2026 porównaliśmy na tych samych przypadkach modele AI, łącznie 10: przypadki ćwiczeniowe, fikcyjne, graniczne i dodatkowe. Nietkniętych przypadków w tym nie było. W przypadkach ćwiczeniowych Gemini 3.8 Flash trafił 10 z 14, a Claude Opus 5.5 10 z 14, za każdym razem według większości przebiegów.
Oba chybiły w tych samych przypadkach: X5, X6, X12 i X15. Przyczyna leży więc raczej w regułach i przebiegu sprawdzania niż w modelu. Gemini 3.8 Flash pozostaje więc modelem dla Pana/Pani tekstu. Claude Opus 5.5 sprawdza chybione przypadki jako druga opinia, a każde ulepszenie mierzymy ponownie modelem Gemini 3.8 Flash na tych samych przypadkach.
To niewiele przypadków, a na przypadkach ćwiczeniowych dostrajaliśmy. Różnica między modelami nie jest więc udowodniona, w żadną stronę.
Skąd pochodzi stopień referencyjny
Przypadki sądowe pochodzą z opublikowanych wyroków sądów austriackich.
Agenci AI wyszukali, przeczytali i opowiedzieli na nowo te wyroki. Z każdego wyroku wywnioskowano, jaki stopień pasuje według reguł. Ten stopień nazywamy tu stopniem referencyjnym.
W niektórych przypadkach różni się od stopnia w wyroku, na przykład gdy dziecko jest poza zakresem.
Sporne kwestie rozstrzygał przy tym prowadzący stronę, za każdym razem tak, jak zalecili agenci. Żaden prawnik nie sprawdził jeszcze stopni referencyjnych.
Jak dbamy o uczciwość
- Przypadki ćwiczeniowe i nietknięte przypadki są od siebie oddzielone. Na nietkniętych przypadkach niczego się nie ulepsza.
- Co liczy się jako trafienie, jest ustalone z góry. Zmiany są dopisywane jako datowane uzupełnienia.
- Każdy pomiar jest dopisywany, żaden nie jest nadpisywany. Każdy ma cyfrowy odcisk palca reguł i instrukcji dla AI.
- Za przebiegi pomiarowe nie płacimy od pojedynczego wywołania, dlatego możemy mierzyć tak często, jak trzeba.
- To, co policzyliśmy po fakcie, jest tak oznaczone.
- Przy każdej zmianie działa kontrola bez AI. Przelicza raporty i mianowniki, szuka śladów nietkniętych przypadków w regułach i opisach oraz porównuje przypadki ćwiczeniowe z nietkniętymi. Nie mierzy od nowa.
Terminy fachowe
- Przypadki ćwiczeniowe
- kalibracja
- Nietknięte przypadki
- holdout, widziane już przed zbudowaniem narzędzia
- Ustalone z góry
- prerejestracja
- Przedział
- przedział 95 % według Wilsona
Przypadek po przypadku
Przypadki ćwiczeniowe pojedynczo. Dotknięcie pokazuje szczegóły.
Nietknięte przypadki pojedynczo.
To nie jest porada prawna. W sprawie Bescheidu (decyzja urzędowa) i pozwu (Klage) swoim członkom doradzają Arbeiterkammer (Izba Pracy) i związki osób z niepełnosprawnościami.