Jak kontrolujeme
Umělá inteligence (AI) přiřadí váš popis k pravidlům nařízení. Hodiny, stupeň a peníze přepočítá pevně daný program, bez AI. Výsledek může být chybný. Proto nakonec kontrolujete a rozhodujete vy.
Jak to funguje
- Vy
Popsat
Popíšete svůj běžný den vlastními slovy.
- AI
Přiřadit
AI přiřadí vaše věty k pravidlům, s doslovnou citací.
- Program
Spočítat
Pevně daný program počítá podle nařízení.
- Vy
Rozhodnout
Projdete každý řádek a rozhodnete, co s tím uděláte.
Jak často má pravdu
Zatím nejspolehlivější: nedotčené soudní případy
5 z 15
Tolik soudních případů, na které jsme po vytvoření nástroje už nesáhli, zařadil nástroj hned napoprvé do správného stupně, zbylé většinou příliš nízko.
Současný stav: cvičné případy
10 z 14
Tolik cvičných případů ze zveřejněných rozsudků, na kterých jsme nástroj ladili, zařadil hned napoprvé do správného stupně.
Pflegegeld-Prüfer vám pomůže s přípravou. Stupeň stanoví úřad nebo soud. Nechte si poradit.
Příprava
Shromáždili jsme 29 zveřejněných rozsudků o Pflegegeld (příspěvek na péči). Už Bescheid (úřední rozhodnutí) tam v 13 případech neodpovídal stupni, který nakonec stanovil soud.
Pravidla stanovená předem
Než jsme poprvé měřili, bylo stanoveno, co se počítá jako správný výsledek a jaký cíl platí: 12 z 14 cvičných případů.
První měření
První běh měl správně 9 z 14. Jednou jsme ještě něco vylepšili a pak jsme pravidla i pokyny pro AI zmrazili. Poslední běh měl správně 10 z 14, cíl tím byl nesplněn.
U 4 z těchto správných výsledků nebyl správnou odpovědí žádný stupeň: žádný nárok, nebo dítě, pro které nástroj nepočítá. U případů se skutečným stupněm měl správně 6 z 9.
Zkouška na nedotčených případech
Jednou, na závěr, na 15 dalších rozsudcích: správně 5. Potom jsme už nic neměnili. U případů se skutečným stupněm to bylo 4 z 13.
Od té doby
Stránka je veřejná. Zlepšili jsme doplňující otázky i vzhled stránky. Dne 28.09.2026 jsme porovnali 10 modelů AI na stejných případech. Gemini 3.8 Flash, model pro váš vlastní text, měl cvičné případy správně stejně často jako model, který používáme jako měřítko kvality. Dne 29.09.2026 jsme znovu měřili. Výsledek je nahoře jako současný stav.
Měříme na zveřejněných rozsudcích, u kterých je správný stupeň už známý. Jednu část používáme k procvičování a vylepšování. Jiné části se přitom nedotýkáme a zkoušíme ji až na závěr.
Co se počítá jako správný výsledek, stanovíme předem a zapíšeme. Pozdější změny jsou tam uvedené s datem. Každé měření se připíše a žádné se nemaže, ani to špatné.
Samotnou metodu stále znovu zpochybňujeme. Při každé změně běží automatická kontrola bez AI. Přepočítá zprávy, zkontroluje jmenovatele a hledá v pravidlech stopy nedotčených případů. Znovu měřit neumí. Co přitom najdeme, je uvedeno níže u omezení.
Měřeno dne 29.09.2026 s modelem Gemini 3.8 Flash, tedy modelem, který čte i váš vlastní text. Na těchto případech jsme ho ladili, proto je číslo spíš příliš vysoké.
Měřeno jednou, dne 26.09.2026. Toto číslo nejvíc vypovídá o tom, jak si povede u nových případů.
Pro srovnání: kdyby se u těchto případů prostě převzal stupeň z Bescheidu, bylo by to správně v 8 z 14 případů, tedy častěji. Nástroj tedy spolehlivě nepozná, zda je Bescheid správný.
Když program dostane hodiny z rozsudku, je stupeň správně ve všech 22 cvičných a smyšlených případech. U nedotčených případů v 12 z 15. Ostatní rozsudky neuvádějí hodiny u jednotlivých úkonů péče, a tak program nemá vstupní údaje.
Když se spletl, pak většinou směrem dolů: desetkrát příliš nízko, dvakrát příliš vysoko.
Co to znamená pro vás?
Pokud ukáže víc než váš Bescheid, vyplatí se podívat se pozorně a vyhledat poradenství.
Pokud víc neukáže, neznamená to, že je váš Bescheid správný. Spíš něco přehlédne, než aby sliboval příliš mnoho.
Omezení
Kde se může mýlit
- Měřilo se na malém počtu případů. Proto je každé číslo nepřesné.
- Soudní případy jsou převyprávěné rozsudky, zatím ne popisy skutečných rodin.
- Který stupeň je u kterého rozsudku správný, odvodila z rozsudku AI. Právní odborník to zatím nezkontroloval.
- Pravidla nástroje byla zčásti odvozena z případů, které později sloužily jako nedotčené případy. To může výsledek tam trochu zvýhodnit.
- Váš vlastní text čte Gemini 3.8 Flash, stejný model jako u současného stavu. Na nedotčených případech zatím změřen nebyl.
Co nedělá
- Nerozhoduje o vašem Pflegegeld (příspěvek na péči).
- Neposkytuje vám poradenství a nezastupuje vás.
- AI nepočítá. Četnosti přebírá jen z vašich slov.
- Váš popis neukládá natrvalo.
Je váš stupeň správný?
Popište prosím běžný den. Nástroj přiřadí vaše věty a spočítá, zda stupeň v Bescheidu odpovídá.
Zkontrolovat můj BescheidPro odborníky
Poslední kolo měření: 29.09.2026.
Všechna kola měření
Každé vyhodnocené kolo, ve kterém AI čte popis, v časovém pořadí. Nic se nepřepisuje.
- 26.09.2026 · Cvičné případy: 9 z 14Rozpětí 39 až 84 % · Model Claude Opus 5.5Erster Lauf aus freiem Text, vor der einen Änderung an der Anweisung an die KI.
- 26.09.2026 · Cvičné případy: 10 z 14Rozpětí 45 až 88 % · Model Claude Opus 5.5Endlauf nach dem Einfrieren von Regeln und Anweisung. Das ist die vorher festgelegte Hauptzahl.
- 26.09.2026 · Smyšlené případy: 7 z 7Rozpětí 65 až 100 % · Model Claude Opus 5.5Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 26.09.2026 · Nedotčené případy: 5 z 15Rozpětí 15 až 58 % · Model Claude Opus 5.5Unberührte Fälle, einmal gemessen, danach nichts verändert.
- 26.09.2026 · Nové rozsudky, pilot: 6 z 6Rozpětí 61 až 100 % · Model Claude Opus 5.5Pilot mit neuen Urteilen, nicht vorher festgelegt. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Cvičné případy: 10 z 14Rozpětí 45 až 88 % · Model Claude Opus 5.5 · Průměrná odchylka v hodinách: 17,7Modellvergleich, Bezugsarm für die Qualität. Verfehlt dieselben Übungsfälle wie das Modell, das eigenen Text liest.
- 28.09.2026 · Smyšlené případy: 7 z 7Rozpětí 65 až 100 % · Model Claude Opus 5.5 · Průměrná odchylka v hodinách: 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Hraniční případy: 2 z 2Rozpětí 34 až 100 % · Model Claude Opus 5.5 · Průměrná odchylka v hodinách: 0Modellvergleich, Randfälle.
- 28.09.2026 · Nové rozsudky, pilot: 6 z 6Rozpětí 61 až 100 % · Model Claude Opus 5.5 · Průměrná odchylka v hodinách: 5Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Cvičné případy: 10 z 14Rozpětí 45 až 88 % · Model Claude Sonnet 5 · Průměrná odchylka v hodinách: 17,3Modellvergleich, bestes weiteres Modell aus der Sichtung.
- 28.09.2026 · Smyšlené případy: 6 z 7Rozpětí 49 až 97 % · Model Claude Sonnet 5 · Průměrná odchylka v hodinách: 0,7Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Hraniční případy: 2 z 2Rozpětí 34 až 100 % · Model Claude Sonnet 5 · Průměrná odchylka v hodinách: 0Modellvergleich, Randfälle.
- 28.09.2026 · Nové rozsudky, pilot: 6 z 6Rozpětí 61 až 100 % · Model Claude Sonnet 5 · Průměrná odchylka v hodinách: 0,8Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Cvičné případy: 10 z 14Rozpětí 45 až 88 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 19,4Modellvergleich mit dem Modell, das eigenen Text liest, gleichauf mit Claude Opus. Gemessen über das lokale Abo-Gateway, nicht über den Weg der gehosteten Prüfung.
- 28.09.2026 · Smyšlené případy: 7 z 7Rozpětí 65 až 100 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Hraniční případy: 1 z 2Rozpětí 10 až 91 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 0Modellvergleich, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 28.09.2026 · Nové rozsudky, pilot: 5 z 6Rozpětí 44 až 97 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 4,2Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 29.09.2026 · Cvičné případy: 10 z 14Rozpětí 45 až 88 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 17,8Zweite Messrunde, neu gemessen nach der Änderung der Regel zur Bindung an den Bescheid bei einer Klage (Link und Wortlaut); die Anweisung an die KI blieb gleich. Wie im Modellvergleich über das lokale Abo-Gateway gemessen, nicht über den Weg der gehosteten Prüfung.
- 29.09.2026 · Smyšlené případy: 7 z 7Rozpětí 65 až 100 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 0,9Zweite Messrunde. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 29.09.2026 · Hraniční případy: 1 z 2Rozpětí 10 až 91 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 0Zweite Messrunde, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 29.09.2026 · Nové rozsudky, pilot: 5 z 6Rozpětí 44 až 97 % · Model Gemini 3.8 Flash · Průměrná odchylka v hodinách: 3,3Zweite Messrunde. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
Nedotčené případy
První průchod: 5 z 15 případů se správně určeným referenčním stupněm. Ze 100 podobných případů by bylo správně asi 15 až 58.
Z toho se skutečným stupněm 4 z 13, bez nároku 1 z 1, dítě mimo rozsah 0 z 1.
Chybně: 10. Z toho 7 příliš nízko, 2 příliš vysoko, jednou nerozpoznané dítě.
Správně v každém běhu: 3 z 15.
S doplňující otázkou: 7 z 15.
Tyto případy byly vyhodnoceny jednou na závěr a potom se na nich už nic nevylepšovalo. Výsledek je uveden zde, i když je špatný.
Před vytvořením nástroje už tyto případy byly součástí porovnání modelů. Pravidla, která jeden z nich uvádějí jako původ: 22. Z nich je v textu pro AI: 10. Týká se to případů X16, X19, X21, X22, X24, X25, X28, X29, X30. Samotná označení případů (ID) v textu pro AI nejsou. Proto tyto případy nazýváme nedotčené od vytvoření nástroje, ne nové.
Převzít stupeň z Bescheidu
Nedotčené případy: na 14 případech s referenčním stupněm měl původní Bescheid správně 8krát, tedy častěji než Pflegegeld-Prüfer.
Cvičné případy: na 14 případech s referenčním stupněm měl Bescheid správně 5krát, tedy méně často než Pflegegeld-Prüfer.
Ve všech shromážděných rozsudcích s Bescheidem (celkem 29) byl Bescheid 16krát na stupni podle rozsudku.
Pokud se jeho výsledek liší od Bescheidu, nedokazuje to, že je Bescheid chybný. Je to důvod podívat se pozorněji a nechat si poradit.
Ukáže víc, když byl Bescheid příliš nízký?
Spočítáno dodatečně, ne stanoveno předem. Pro příští měření tuto veličinu stanovíme předem.
Nedotčené případy: když byl Bescheid pod referenčním stupněm, ukázal nástroj v 4 z 6 případů víc než Bescheid. Když Bescheid odpovídal, ukázal i tak víc v 1 z 8 případů.
Cvičné případy: když byl Bescheid pod referenčním stupněm, ukázal nástroj v 3 z 3 případů víc než Bescheid. Když Bescheid odpovídal, ukázal i tak víc v 0 z 5 případů.
Cvičné případy
První průchod: 10 z 14 případů se správně určeným referenčním stupněm. Ze 100 podobných případů by bylo správně asi 45 až 88. Předem stanovený cíl: 12, nesplněn.
Z toho se skutečným stupněm 6 z 9, bez nároku 1 z 1, dítě mimo rozsah 3 z 4.
Správně v každém běhu: 10 z 14.
Správný výsledek znamená: většina z 3 běhů určí referenční stupeň. K tomu je tu jeden zvláštní případ, u kterého se hodnotí chování. Počítá se zvlášť, dohromady je to 15 cvičných případů.
S doplňující otázkou: 13 z 15. Počítá se, když určil správný stupeň nebo položil otázku, na které záleželo. Předem stanovený cíl: 13, splněn.
Chybně: 4. Z toho 3 příliš nízko, žádný příliš vysoko. Jednou nerozpoznal případ dítěte.
Počítání bez AI
S hodinami z rozsudku má program správně 22 z 22 případů, cvičné a smyšlené případy dohromady. Předem stanovený cíl: 22, splněn.
Nedotčené případy: 12 z 15. Chybně: X18, X25 a X30. Tyto rozsudky uvádějí jen stupeň, ne hodiny u jednotlivých úkonů péče, proto program nedostane vstupní údaje.
Smyšlené případy
Měření používá 7 smyšlených případů. AI čte popis, program počítá: 7 z 7 s očekávaným stupněm. Předem stanovený cíl: 6, splněn. 5 z nich si můžete vyzkoušet na stránce pro kontrolu.
Jinak popsáno: u žádného z 35 přeformulování se stupeň nezměnil. Toto měření nebylo stanoveno předem.
Model pro vaši kontrolu
Vaše kontrola s vlastním textem používá model Gemini 3.8 Flash. Současný stav pochází z tohoto modelu. Podrobnosti o cvičných a nedotčených případech v této části pocházejí z běhů s modelem Claude Opus 5.5.
První vlastní běh s modelem Gemini 3.8 Flash dne 26.09.2026 měl správně 11 z 14 cvičných případů. Ze 100 podobných případů by bylo správně asi 52 až 92. Na nedotčených případech tento model zatím změřen nebyl.
Porovnání modelů
Dne 28.09.2026 jsme porovnali 10 modelů AI na stejných případech: cvičné, smyšlené, hraniční a doplňkové případy. Nedotčené případy v tom nebyly. Na cvičných případech měl Gemini 3.8 Flash správně 10 z 14, Claude Opus 5.5 10 z 14, vždy podle většiny běhů.
Oba modely se spletly u stejných případů: X5, X6, X12 a X15. Příčina je tedy spíš v pravidlech a postupu než v modelu. Gemini 3.8 Flash proto zůstává modelem pro váš text. Claude Opus 5.5 kontroluje chybné případy jako druhý názor a každé zlepšení znovu měříme s modelem Gemini 3.8 Flash na stejných případech.
Je to málo případů a na cvičných případech jsme nástroj ladili. Rozdíl mezi modely tím tedy není prokázán, v žádném směru.
Odkud pochází referenční stupeň
Soudní případy pocházejí ze zveřejněných rozsudků rakouských soudů.
Agenti AI tyto rozsudky vyhledali, přečetli a převyprávěli. Z každého rozsudku se odvodilo, který stupeň podle pravidel odpovídá. Tento stupeň se zde nazývá referenční stupeň.
U některých případů se liší od stupně v rozsudku, například když je dítě mimo rozsah.
Sporné otázky přitom rozhodl provozovatel, vždy tak, jak agenti doporučili. Právní odborník referenční stupně zatím nezkontroloval.
Jak zůstáváme poctiví
- Cvičné a nedotčené případy zůstávají oddělené. Na nedotčených případech se nic nevylepšuje.
- Co se počítá jako správný výsledek, je stanoveno předem. Změny se přidávají jako dodatky s datem.
- Každé měření se připojí, žádné se nepřepíše. Každé nese otisk pravidel a pokynů pro AI.
- Za jednotlivá volání při měření neplatíme, proto můžeme měřit, jak často je potřeba.
- Co jsme spočítali dodatečně, je tak označeno.
- Při každé změně běží kontrola bez AI. Přepočítá zprávy a jmenovatele, hledá stopy nedotčených případů v pravidlech a popisech a porovnává cvičné případy s nedotčenými. Znovu neměří.
Odborné výrazy
- Cvičné případy
- kalibrace
- Nedotčené případy
- holdout, viděné už před vytvořením nástroje
- Stanoveno předem
- předregistrace
- Rozpětí
- 95% interval podle Wilsona
Případ po případu
Cvičné případy jednotlivě. Klepnutím zobrazíte podrobnosti.
Nedotčené případy jednotlivě.
Toto není právní poradenství. K Bescheidu (úřední rozhodnutí) a k žalobě (Klage) radí svým členům Arbeiterkammer (Komora práce) a svazy osob se zdravotním postižením.