Kako provjeravamo
Umjetna inteligencija (AI) povezuje Vaš opis s pravilima uredbe. Sate, stupanj i novac ponovo izračunava fiksni program, bez AI. Rezultat može biti pogrešan. Zato na kraju Vi provjeravate i odlučujete.
Kako to radi
- Vi
Opis
Vi opisujete svoj svakodnevni život svojim riječima.
- AI
Povezivanje
AI povezuje Vaše rečenice s pravilima, uz doslovan citat.
- Program
Izračun
Fiksni program računa prema uredbi.
- Vi
Odluka
Vi pregledate svaki red i odlučujete šta ćete s tim učiniti.
Koliko često je u pravu
Najpouzdanije do sada: netaknuti sudski slučajevi
5 od 15
Sudske slučajeve koje nakon izrade više nismo dirali iz prvog je pokušaja svrstao u ispravan stupanj, a ostale je uglavnom svrstao prenisko.
Stanje danas: slučajevi za vježbu
10 od 14
Slučajeve za vježbu iz objavljenih presuda, na kojima smo ga podesili, iz prvog je pokušaja svrstao u ispravan stupanj.
Pflegegeld-Prüfer pomaže Vam da se pripremite. Stupanj određuje nadležni organ ili sud. Potražite savjetovanje.
Priprema
Prikupili smo objavljene presude o Pflegegeldu (novčana naknada za njegu), ukupno 29. U 13 slučajeva sam Bescheid (službeno rješenje) nije bio na stupnju koji je sud na kraju odredio.
Pravila utvrđena unaprijed
Prije nego što smo prvi put mjerili, bilo je utvrđeno šta se računa kao pogodak i koji cilj važi: 12 od 14 slučajeva za vježbu.
Prva mjerenja
Prvi prolaz pogodio je 9 od 14. Jednom smo doradili, a zatim zamrznuli pravila i upute za AI. Posljednji prolaz pogodio je 10 od 14, time cilj nije postignut.
Kod 4 od ovih pogodaka ispravan odgovor nije bio stupanj: nema prava na naknadu ili dijete za koje on ne računa. Kod slučajeva sa stvarnim stupnjem pogodio je 6 od 9.
Provjera na netaknutim slučajevima
Jednom, na kraju, na još 15 presuda: 5 ispravno. Nakon toga više ništa nismo mijenjali. Kod slučajeva sa stvarnim stupnjem bilo je 4 od 13.
Od tada
Stranica je javna. Poboljšali smo dodatna pitanja i izgled stranice. Dana 28.09.2026 smo uporedili 10 AI modela na istim slučajevima. Gemini 3.8 Flash, model za Vaš vlastiti tekst, pogodio je slučajeve za vježbu jednako često kao model koji uzimamo kao mjerilo kvaliteta. Dana 29.09.2026 smo ponovo mjerili, rezultat je gore prikazan kao stanje danas.
Mjerimo na objavljenim presudama kod kojih je ispravan stupanj već poznat. Jedan dio koristimo za vježbu i poboljšanje. Drugi dio pri tome ne diramo i provjeravamo ga tek na kraju.
Šta se računa kao pogodak, utvrđujemo unaprijed i zapisujemo. Kasnije izmjene tamo stoje s datumom. Svako mjerenje se dodaje, a nijedno se ne briše, čak ni loše.
Samu metodu stalno iznova preispitujemo. Automatska provjera bez AI radi pri svakoj izmjeni. Ona ponovo izračunava izvještaje, provjerava nazivnike i traži tragove netaknutih slučajeva u pravilima. Ponovo mjeriti ne može. Ono što pri tome nađemo stoji dolje kod granica.
Izmjereno dana 29.09.2026 s modelom Gemini 3.8 Flash, modelom koji čita i Vaš vlastiti tekst. Na ovim slučajevima smo ga podesili, zato je broj vjerovatno previsok.
Izmjereno jednom, dana 26.09.2026. Ovaj broj najviše govori o tome kako radi na novim slučajevima.
Za poređenje: da je u ovim slučajevima jednostavno preuzet stupanj iz Bescheida, to bi bilo ispravno u 8 od 14 slučajeva, dakle češće. To znači da on ne prepoznaje pouzdano je li Bescheid ispravan.
Ako program dobije sate iz presude, stupanj je ispravan u svim slučajevima za vježbu i izmišljenim slučajevima (ukupno 22). Kod netaknutih slučajeva u 12 od 15. Ostale presude ne navode sate po zadatku njege, pa program nema ulazne podatke.
Kada je pogriješio, uglavnom je procijenio prenisko: deset puta prenisko, dva puta previsoko.
Šta to znači za Vas?
Ako pokaže više od Vašeg Bescheida, isplati se pažljivo pogledati i potražiti savjetovanje.
Ako ne pokaže više, to ne znači da je Vaš Bescheid ispravan. Prije će nešto previdjeti nego obećati previše.
Granice
Gdje može pogriješiti
- Mjerilo se na malo slučajeva. Zbog toga je svaki broj neprecizan.
- Sudski slučajevi su prepričane presude, još ne opisi stvarnih porodica.
- Koji je stupanj ispravan za pojedinu presudu, izvela je AI iz presude. Pravni stručnjak to još nije provjerio.
- Pravila alata za provjeru dijelom su izvedena iz slučajeva koji su kasnije služili kao netaknuti slučajevi. To može donekle pogodovati rezultatu na tim slučajevima.
- Vaš vlastiti tekst čita Gemini 3.8 Flash, isti model kao kod stanja danas. Na netaknutim slučajevima još nije izmjeren.
Šta on ne radi
- On ne odlučuje o Vašem Pflegegeldu (novčana naknada za njegu).
- On Vas ne savjetuje i ne zastupa.
- AI ne računa. Učestalosti preuzima samo iz Vaših riječi.
- On ne čuva trajno Vaš opis.
Odgovara li Vaš stupanj?
Opišite jedan običan dan. Pflegegeld-Prüfer povezuje Vaše rečenice s pravilima i ponovo računa odgovara li stupanj u Bescheidu.
Provjeri moj BescheidZa stručnjake
Posljednji krug mjerenja: 29.09.2026.
Svi krugovi mjerenja
Svaki ocijenjeni krug u kojem AI čita opis, po vremenskom redoslijedu. Ništa se naknadno ne mijenja.
- 26.09.2026 · Slučajevi za vježbu: 9 od 14Raspon 39 do 84 % · Model Claude Opus 5.5Erster Lauf aus freiem Text, vor der einen Änderung an der Anweisung an die KI.
- 26.09.2026 · Slučajevi za vježbu: 10 od 14Raspon 45 do 88 % · Model Claude Opus 5.5Endlauf nach dem Einfrieren von Regeln und Anweisung. Das ist die vorher festgelegte Hauptzahl.
- 26.09.2026 · Izmišljeni slučajevi: 7 od 7Raspon 65 do 100 % · Model Claude Opus 5.5Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 26.09.2026 · Netaknuti slučajevi: 5 od 15Raspon 15 do 58 % · Model Claude Opus 5.5Unberührte Fälle, einmal gemessen, danach nichts verändert.
- 26.09.2026 · Nove presude, pilot: 6 od 6Raspon 61 do 100 % · Model Claude Opus 5.5Pilot mit neuen Urteilen, nicht vorher festgelegt. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Slučajevi za vježbu: 10 od 14Raspon 45 do 88 % · Model Claude Opus 5.5 · Sati u prosjeku odstupaju za 17,7Modellvergleich, Bezugsarm für die Qualität. Verfehlt dieselben Übungsfälle wie das Modell, das eigenen Text liest.
- 28.09.2026 · Izmišljeni slučajevi: 7 od 7Raspon 65 do 100 % · Model Claude Opus 5.5 · Sati u prosjeku odstupaju za 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Granični slučajevi: 2 od 2Raspon 34 do 100 % · Model Claude Opus 5.5 · Sati u prosjeku odstupaju za 0Modellvergleich, Randfälle.
- 28.09.2026 · Nove presude, pilot: 6 od 6Raspon 61 do 100 % · Model Claude Opus 5.5 · Sati u prosjeku odstupaju za 5Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Slučajevi za vježbu: 10 od 14Raspon 45 do 88 % · Model Claude Sonnet 5 · Sati u prosjeku odstupaju za 17,3Modellvergleich, bestes weiteres Modell aus der Sichtung.
- 28.09.2026 · Izmišljeni slučajevi: 6 od 7Raspon 49 do 97 % · Model Claude Sonnet 5 · Sati u prosjeku odstupaju za 0,7Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Granični slučajevi: 2 od 2Raspon 34 do 100 % · Model Claude Sonnet 5 · Sati u prosjeku odstupaju za 0Modellvergleich, Randfälle.
- 28.09.2026 · Nove presude, pilot: 6 od 6Raspon 61 do 100 % · Model Claude Sonnet 5 · Sati u prosjeku odstupaju za 0,8Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Slučajevi za vježbu: 10 od 14Raspon 45 do 88 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 19,4Modellvergleich mit dem Modell, das eigenen Text liest, gleichauf mit Claude Opus. Gemessen über das lokale Abo-Gateway, nicht über den Weg der gehosteten Prüfung.
- 28.09.2026 · Izmišljeni slučajevi: 7 od 7Raspon 65 do 100 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Granični slučajevi: 1 od 2Raspon 10 do 91 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 0Modellvergleich, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 28.09.2026 · Nove presude, pilot: 5 od 6Raspon 44 do 97 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 4,2Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 29.09.2026 · Slučajevi za vježbu: 10 od 14Raspon 45 do 88 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 17,8Zweite Messrunde, neu gemessen nach der Änderung der Regel zur Bindung an den Bescheid bei einer Klage (Link und Wortlaut); die Anweisung an die KI blieb gleich. Wie im Modellvergleich über das lokale Abo-Gateway gemessen, nicht über den Weg der gehosteten Prüfung.
- 29.09.2026 · Izmišljeni slučajevi: 7 od 7Raspon 65 do 100 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 0,9Zweite Messrunde. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 29.09.2026 · Granični slučajevi: 1 od 2Raspon 10 do 91 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 0Zweite Messrunde, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 29.09.2026 · Nove presude, pilot: 5 od 6Raspon 44 do 97 % · Model Gemini 3.8 Flash · Sati u prosjeku odstupaju za 3,3Zweite Messrunde. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
Netaknuti slučajevi
Prvi prolaz: 5 od 15 slučajeva s pogođenim referentnim stupnjem. Od 100 sličnih slučajeva, vjerovatno bi 15 do 58 bilo ispravno.
Od toga sa stvarnim stupnjem 4 od 13, bez prava na naknadu 1 od 1, dijete izvan opsega provjere 0 od 1.
Promašeno: 10. Od toga 7 prenisko, 2 previsoko, jednom dijete nije prepoznato.
Ispravno u svakom prolazu: 3 od 15.
S dodatnim pitanjem: 7 od 15.
Ovi slučajevi su ocijenjeni jednom, na kraju, i nakon toga na njima ništa nije poboljšavano. Rezultat stoji ovdje, čak i kada je loš.
Prije izrade ovi slučajevi već su bili dio poređenja modela. 22 pravila navode jedan od njih kao porijeklo, 10 od njih stoje u tekstu za AI. To se odnosi na X16, X19, X21, X22, X24, X25, X28, X29, X30. Same oznake slučajeva ne stoje u tekstu za AI. Zato za te slučajeve kažemo da su „netaknuti od izrade“, a ne „novi“.
Preuzimanje stupnja iz Bescheida
Netaknuti slučajevi: na 14 slučajeva s referentnim stupnjem prvobitni Bescheid je pogodio 8 puta, dakle češće nego Pflegegeld-Prüfer.
Slučajevi za vježbu: na 14 slučajeva s referentnim stupnjem Bescheid je pogodio 5 puta, dakle rjeđe nego Pflegegeld-Prüfer.
U svim prikupljenim presudama s Bescheidom (ukupno 29) Bescheid je 16 puta bio na stupnju prema presudi.
Ako se njegov rezultat razlikuje od Bescheida, to ne dokazuje da je Bescheid pogrešan. To je razlog da se pažljivije pogleda i potraži savjetovanje.
Pokazuje li više kada je Bescheid bio prenizak?
Prebrojano naknadno, nije utvrđeno unaprijed. Za sljedeće mjerenje ovu veličinu utvrđujemo unaprijed.
Netaknuti slučajevi: Kada je Bescheid bio ispod referentnog stupnja, Pflegegeld-Prüfer je pokazao više od Bescheida u 4 od 6 slučajeva. Kada je Bescheid bio ispravan, Pflegegeld-Prüfer je ipak pokazao više u 1 od 8 slučajeva.
Slučajevi za vježbu: Kada je Bescheid bio ispod referentnog stupnja, Pflegegeld-Prüfer je pokazao više od Bescheida u 3 od 3 slučaja. Kada je Bescheid bio ispravan, Pflegegeld-Prüfer je ipak pokazao više u 0 od 5 slučajeva.
Slučajevi za vježbu
Prvi prolaz: 10 od 14 slučajeva s pogođenim referentnim stupnjem. Od 100 sličnih slučajeva, vjerovatno bi 45 do 88 bilo ispravno. Unaprijed utvrđen cilj: 12, nije postignut.
Od toga sa stvarnim stupnjem 6 od 9, bez prava na naknadu 1 od 1, dijete izvan opsega provjere 3 od 4.
Ispravno u svakom prolazu: 10 od 14.
Pogođeno znači: većina od 3 prolaza pogađa referentni stupanj. Uz to postoji jedan poseban slučaj u kojem se ocjenjuje ponašanje. On se broji odvojeno, ukupno ima 15 slučajeva za vježbu.
S dodatnim pitanjem: 13 od 15. Računa se ako je pogodio stupanj ili postavio pitanje koje je bilo bitno. Unaprijed utvrđen cilj: 13, postignut.
Promašeno: 4. Od toga 3 prenisko, nijedan previsoko. Jednom nije prepoznao slučaj djeteta.
Računanje bez AI
Sa satima iz presude program pogađa 22 od 22 slučaja, slučajeve za vježbu i izmišljene slučajeve zajedno. Unaprijed utvrđen cilj: 22, postignut.
Netaknuti slučajevi: 12 od 15. Promašeno: X18, X25 i X30. Ove presude navode samo stupanj, ne i sate po zadatku njege, zato program nema ulazne podatke.
Izmišljeni slučajevi
Mjerenje koristi 7 izmišljenih slučajeva. AI čita opis, program računa: 7 od 7 s očekivanim stupnjem. Unaprijed utvrđen cilj: 6, postignut. 5 od njih možete sami isprobati na stranici za provjeru.
Drugačije ispričano: nijedna od 35 preformulacija nije promijenila stupanj. Ovo mjerenje nije bilo unaprijed utvrđeno.
Model Vaše provjere
Vaša provjera s vlastitim tekstom koristi Gemini 3.8 Flash. Stanje danas potiče od ovog modela. Pojedinosti o slučajevima za vježbu i netaknutim slučajevima u ovom dijelu potiču iz prolaza s Claude Opus 5.5.
Prvi poseban prolaz s Gemini 3.8 Flash dana 26.09.2026 pogodio je 11 od 14 slučajeva za vježbu. Od 100 sličnih slučajeva, vjerovatno bi 52 do 92 bilo ispravno. Na netaknutim slučajevima ovaj model još nije izmjeren.
Poređenje modela
Dana 28.09.2026 uporedili smo 10 AI modela na istim slučajevima: slučajevi za vježbu, izmišljeni slučajevi, granični i dodatni slučajevi. Netaknuti slučajevi nisu bili uključeni. Na slučajevima za vježbu Gemini 3.8 Flash je pogodio 10 od 14, a Claude Opus 5.5 10 od 14, svaki put prema većini prolaza.
Oba su promašila iste slučajeve: X5, X6, X12 i X15. Nedostatak je dakle prije u pravilima i postupku nego u modelu. Gemini 3.8 Flash zato ostaje model za Vaš tekst. Claude Opus 5.5 kao drugo mišljenje provjerava i promašene slučajeve, a svako poboljšanje ponovo mjerimo s Gemini 3.8 Flash na istim slučajevima.
To je malo slučajeva, a na slučajevima za vježbu smo alat podešavali. Razlika između modela time nije dokazana, ni u jednom smjeru.
Odakle dolazi referentni stupanj
Sudski slučajevi potiču iz objavljenih presuda austrijskih sudova.
AI agenti su tražili, čitali i prepričali te presude. Iz svake presude izvedeno je koji stupanj odgovara prema pravilima. Taj stupanj ovdje se zove referentni stupanj.
Kod nekih slučajeva razlikuje se od stupnja u presudi, na primjer kada je dijete izvan opsega provjere.
O spornim pitanjima pri tome je odlučio vlasnik stranice, svaki put onako kako su agenti preporučili. Pravni stručnjak još nije provjerio referentne stupnjeve.
Kako ostajemo pošteni
- Slučajevi za vježbu i netaknuti slučajevi ostaju odvojeni. Na netaknutim slučajevima ništa se ne poboljšava.
- Šta se računa kao pogodak, utvrđeno je unaprijed. Izmjene se dodaju kao naknadni zapisi s datumom.
- Svako mjerenje se dodaje, nijedno se naknadno ne mijenja. Svako nosi otisak prsta pravila i uputa za AI.
- Za prolaze mjerenja ne plaćamo po pojedinačnom pozivu, zato možemo mjeriti onoliko često koliko je potrebno.
- Ono što smo prebrojali naknadno, tako je i označeno.
- Provjera bez AI radi pri svakoj izmjeni. Ona ponovo izračunava izvještaje i nazivnike, traži tragove netaknutih slučajeva u pravilima i opisima i upoređuje slučajeve za vježbu s netaknutim slučajevima. Ona ne mjeri ponovo.
Stručni izrazi
- Slučajevi za vježbu
- kalibracija
- Netaknuti slučajevi
- holdout, već viđeni prije izrade
- Unaprijed utvrđeno
- preregistracija
- Raspon
- Wilsonov interval od 95 %
Slučaj po slučaj
Slučajevi za vježbu pojedinačno. Dodirnite slučaj za pojedinosti.
Netaknuti slučajevi pojedinačno.
Ovo nije pravni savjet. O Bescheidu (službeno rješenje) i tužbi (Klage) svoje članove savjetuju Arbeiterkammer (Radnička komora) i udruženja osoba s invaliditetom.