Як ми перевіряємо
Штучний інтелект (ШІ) зіставляє Вашу розповідь з правилами постанови. Години, ступінь і суму перераховує фіксована програма, без ШІ. Результат може бути хибним. Тому наприкінці перевіряєте й вирішуєте Ви.
Як це працює
- Ви
Розповісти
Ви описуєте свій день власними словами.
- ШІ
Зіставити
ШІ зіставляє Ваші речення з правилами і дослівно їх цитує.
- Програма
Розрахувати
Фіксована програма рахує відповідно до постанови.
- Ви
Вирішити
Ви переглядаєте кожен рядок і вирішуєте, що з цим робити.
Як часто Pflegegeld-Prüfer має рацію
Найнадійніше досі: недоторкані судові випадки
5 з 15
У стількох судових випадках, яких ми після створення програми більше не торкалися, він з першої спроби визначив правильний ступінь, в інших здебільшого занадто низький.
Стан на сьогодні: тренувальні випадки
10 з 14
У стількох тренувальних випадках з опублікованих судових рішень, на яких ми його налаштовували, він з першої спроби визначив правильний ступінь.
Pflegegeld-Prüfer допомагає підготуватися. Ступінь визначає орган влади або суд. Зверніться по консультацію.
Підготовка
Ми зібрали 29 опублікованих судових рішень про допомогу на догляд (Pflegegeld). Уже рішення (Bescheid) у 13 з цих випадків не відповідало ступеню, який зрештою визначив суд.
Правила визначено заздалегідь
Перш ніж ми виміряли вперше, було визначено, що вважається влучанням і яка ціль діє: 12 з 14 тренувальних випадків.
Перші вимірювання
Перший запуск влучив у 9 з 14. Ми один раз доопрацювали, а потім заморозили правила та інструкції для ШІ. Останній запуск влучив у 10 з 14, тож ціль було не досягнуто.
У 4 з цих влучань правильною відповіддю був не ступінь: немає права на допомогу або дитина, для якої він не рахує. У випадках зі справжнім ступенем він влучив у 6 з 9.
Перевірка на недоторканих випадках
Один раз, наприкінці, на 15 інших судових рішеннях: 5 правильно. Після цього ми нічого не змінювали. У випадках зі справжнім ступенем: 4 з 13.
Відтоді
Сайт загальнодоступний. Ми покращили уточнювальні питання та інтерфейс. 28.09.2026 ми порівняли 10 моделей ШІ на тих самих випадках. Gemini 3.8 Flash, модель для Вашого власного тексту, влучала в тренувальні випадки так само часто, як модель, яку ми беремо за еталон якості. 29.09.2026 ми виміряли знову. Результат показано вище як стан на сьогодні.
Ми вимірюємо на опублікованих судових рішеннях, де правильний ступінь уже відомий. Одну частину ми використовуємо для тренування й покращення. Іншої частини ми при цьому не торкаємося і перевіряємо її лише наприкінці.
Що вважається влучанням, ми визначаємо заздалегідь і записуємо. Пізніші зміни записані там із датою. Кожне вимірювання додається, і жодне не видаляється, навіть погані.
Ми знову й знову ставимо під сумнів сам метод. Автоматична перевірка без ШІ запускається при кожній зміні. Вона перераховує звіти, перевіряє знаменники і шукає сліди недоторканих випадків у правилах. Виміряти знову вона не може. Що ми при цьому знаходимо, написано нижче в розділі про межі.
Виміряно 29.09.2026 з моделлю Gemini 3.8 Flash, яка читає і Ваш власний текст. Ми налаштовували його на цих випадках, тому число, імовірно, завищене.
Виміряно один раз 26.09.2026. Це число найбільше говорить про те, як він працює з новими випадками.
Для порівняння: якби в цих випадках просто взяли ступінь із рішення, це було б правильно у 8 з 14 випадків, тобто частіше. Отже, він не може надійно розпізнати, чи рішення правильне.
Якщо програма отримує години із судового рішення, ступінь правильний в усіх 22 тренувальних і вигаданих випадках. У недоторканих випадках: у 12 з 15. Інші судові рішення не називають годин для кожної дії, тому програмі бракує вхідних даних.
Коли він помилявся, то здебільшого занижував: десять разів занадто низько, двічі занадто високо.
Що це означає для Вас?
Якщо він показує більше, ніж Ваше рішення, варто уважно придивитися і звернутися по консультацію.
Якщо він не показує більше, це не означає, що Ваше рішення правильне. Він радше щось пропустить, ніж пообіцяє забагато.
Межі
Де він може помилятися
- Виміряно на небагатьох випадках. Через це кожне число неточне.
- Судові випадки є переказаними судовими рішеннями, а ще не розповідями справжніх родин.
- Який ступінь правильний для кожного судового рішення, вивів ШІ із самого рішення. Юрист цього ще не перевіряв.
- Частину правил програми перевірки виведено з випадків, які згодом слугували недоторканими випадками. Це може трохи покращити результат на них.
- Ваш власний текст читає Gemini 3.8 Flash, та сама модель, що й для стану на сьогодні. На недоторканих випадках її ще не вимірювали.
Чого він не робить
- Він не вирішує щодо Вашої допомоги на догляд (Pflegegeld).
- Він не консультує і не представляє Вас.
- ШІ не рахує. Частоту він бере лише з Ваших слів.
- Він не зберігає Вашу розповідь назавжди.
Чи правильний Ваш ступінь?
Ви описуєте звичайний день. Програма перевірки зіставляє його з правилами і перераховує, чи підходить ступінь у рішенні (Bescheid).
Перевірити моє рішенняДля фахівців
Останній раунд вимірювань: 29.09.2026.
Усі раунди вимірювань
Кожен оцінений раунд, у якому ШІ читає розповідь, у хронологічному порядку. Нічого не перезаписується.
- 26.09.2026 · Тренувальні випадки: 9 з 14Діапазон від 39 до 84 % · Модель Claude Opus 5.5Erster Lauf aus freiem Text, vor der einen Änderung an der Anweisung an die KI.
- 26.09.2026 · Тренувальні випадки: 10 з 14Діапазон від 45 до 88 % · Модель Claude Opus 5.5Endlauf nach dem Einfrieren von Regeln und Anweisung. Das ist die vorher festgelegte Hauptzahl.
- 26.09.2026 · Вигадані випадки: 7 з 7Діапазон від 65 до 100 % · Модель Claude Opus 5.5Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 26.09.2026 · Недоторкані випадки: 5 з 15Діапазон від 15 до 58 % · Модель Claude Opus 5.5Unberührte Fälle, einmal gemessen, danach nichts verändert.
- 26.09.2026 · Нові судові рішення, пілот: 6 з 6Діапазон від 61 до 100 % · Модель Claude Opus 5.5Pilot mit neuen Urteilen, nicht vorher festgelegt. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Тренувальні випадки: 10 з 14Діапазон від 45 до 88 % · Модель Claude Opus 5.5 · Години в середньому відхиляються на 17,7Modellvergleich, Bezugsarm für die Qualität. Verfehlt dieselben Übungsfälle wie das Modell, das eigenen Text liest.
- 28.09.2026 · Вигадані випадки: 7 з 7Діапазон від 65 до 100 % · Модель Claude Opus 5.5 · Години в середньому відхиляються на 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Граничні випадки: 2 з 2Діапазон від 34 до 100 % · Модель Claude Opus 5.5 · Години в середньому відхиляються на 0Modellvergleich, Randfälle.
- 28.09.2026 · Нові судові рішення, пілот: 6 з 6Діапазон від 61 до 100 % · Модель Claude Opus 5.5 · Години в середньому відхиляються на 5Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Тренувальні випадки: 10 з 14Діапазон від 45 до 88 % · Модель Claude Sonnet 5 · Години в середньому відхиляються на 17,3Modellvergleich, bestes weiteres Modell aus der Sichtung.
- 28.09.2026 · Вигадані випадки: 6 з 7Діапазон від 49 до 97 % · Модель Claude Sonnet 5 · Години в середньому відхиляються на 0,7Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Граничні випадки: 2 з 2Діапазон від 34 до 100 % · Модель Claude Sonnet 5 · Години в середньому відхиляються на 0Modellvergleich, Randfälle.
- 28.09.2026 · Нові судові рішення, пілот: 6 з 6Діапазон від 61 до 100 % · Модель Claude Sonnet 5 · Години в середньому відхиляються на 0,8Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Тренувальні випадки: 10 з 14Діапазон від 45 до 88 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 19,4Modellvergleich mit dem Modell, das eigenen Text liest, gleichauf mit Claude Opus. Gemessen über das lokale Abo-Gateway, nicht über den Weg der gehosteten Prüfung.
- 28.09.2026 · Вигадані випадки: 7 з 7Діапазон від 65 до 100 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 0,6Modellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Граничні випадки: 1 з 2Діапазон від 10 до 91 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 0Modellvergleich, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 28.09.2026 · Нові судові рішення, пілот: 5 з 6Діапазон від 44 до 97 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 4,2Modellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 29.09.2026 · Тренувальні випадки: 10 з 14Діапазон від 45 до 88 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 17,8Zweite Messrunde, neu gemessen nach der Änderung der Regel zur Bindung an den Bescheid bei einer Klage (Link und Wortlaut); die Anweisung an die KI blieb gleich. Wie im Modellvergleich über das lokale Abo-Gateway gemessen, nicht über den Weg der gehosteten Prüfung.
- 29.09.2026 · Вигадані випадки: 7 з 7Діапазон від 65 до 100 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 0,9Zweite Messrunde. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 29.09.2026 · Граничні випадки: 1 з 2Діапазон від 10 до 91 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 0Zweite Messrunde, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 29.09.2026 · Нові судові рішення, пілот: 5 з 6Діапазон від 44 до 97 % · Модель Gemini 3.8 Flash · Години в середньому відхиляються на 3,3Zweite Messrunde. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
Недоторкані випадки
Перший прохід: еталонний ступінь влучено у 5 з 15 випадків. Зі 100 схожих випадків правильними були б, імовірно, від 15 до 58.
З них зі справжнім ступенем 4 з 13, без права на допомогу 1 з 1, дитина поза межами охоплення 0 з 1.
Помилки: 10. З них 7 занадто низько, 2 занадто високо, один раз не розпізнано дитину.
Правильно в кожному запуску: 3 з 15.
З уточнювальним питанням: 7 з 15.
Ці випадки оцінили один раз наприкінці, і після цього на них нічого не покращували. Результат показано тут, навіть якщо він поганий.
Ще до створення програми ці випадки брали участь у порівняннях моделей. Правил, які називають один із них своїм джерелом: 22, з них у тексті для ШІ: 10. Це стосується X16, X19, X21, X22, X24, X25, X28, X29, X30. Самих ідентифікаторів випадків у тексті для ШІ немає. Тому ми називаємо ці випадки недоторканими з часу створення програми, а не новими.
Взяти ступінь із рішення
Недоторкані випадки: на 14 випадках з еталонним ступенем первісне рішення влучило 8 разів, тобто частіше, ніж Pflegegeld-Prüfer.
Тренувальні випадки: на 14 випадках з еталонним ступенем рішення влучило 5 разів, тобто рідше, ніж Pflegegeld-Prüfer.
Серед усіх 29 зібраних судових справ, у яких відоме рішення (Bescheid), воно 16 разів збігалося зі ступенем, який визначив суд.
Якщо його результат відрізняється від рішення, це не доводить, що рішення хибне. Це привід придивитися уважніше і звернутися по консультацію.
Чи показує він більше, коли рішення було занизьким?
Пораховано згодом, а не визначено заздалегідь. Для наступного вимірювання ми визначимо цей показник заздалегідь.
Недоторкані випадки: коли рішення було нижче за еталонний ступінь, він показав більше, ніж рішення, у 4 з 6 випадків. Коли рішення було правильним, він усе одно показав більше у 1 з 8 випадків.
Тренувальні випадки: коли рішення було нижче за еталонний ступінь, він показав більше, ніж рішення, у 3 з 3 випадків. Коли рішення було правильним, він усе одно показав більше у 0 з 5 випадків.
Тренувальні випадки
Перший прохід: еталонний ступінь влучено у 10 з 14 випадків. Зі 100 схожих випадків правильними були б, імовірно, від 45 до 88. Ціль, визначена заздалегідь: 12, не досягнуто.
З них зі справжнім ступенем 6 з 9, без права на допомогу 1 з 1, дитина поза межами охоплення 3 з 4.
Правильно в кожному запуску: 10 з 14.
Влучання означає: більшість із 3 запусків влучає в еталонний ступінь. До цього додається один особливий випадок, у якому оцінюють поведінку. Він рахується окремо, разом тренувальних випадків: 15.
З уточнювальним питанням: 13 з 15. Зараховано, якщо він влучив у ступінь або поставив питання, від якого все залежало. Ціль, визначена заздалегідь: 13, досягнуто.
Помилки: 4. З них 3 занадто низько, жодної занадто високо. Один раз він не розпізнав випадок дитини.
Розрахунок без ШІ
З годинами із судового рішення програма влучає у 22 з 22 випадків, тренувальних і вигаданих разом. Ціль, визначена заздалегідь: 22, досягнуто.
Недоторкані випадки: 12 з 15. Не влучено: X18, X25 і X30. Ці судові рішення називають лише ступінь, без годин для кожної дії, тому програма не отримує вхідних даних.
Вигадані випадки
Вимірювання використовує вигадані випадки, їх 7. ШІ читає розповідь, програма рахує: 7 з 7 з очікуваним ступенем. Ціль, визначена заздалегідь: 6, досягнуто. 5 з них Ви можете самі випробувати на сторінці перевірки.
Інакше розказано: жодне з 35 переформулювань не змінило ступінь. Це вимірювання не було визначене заздалегідь.
Модель Вашої перевірки
Ваша перевірка з власним текстом використовує Gemini 3.8 Flash. Стан на сьогодні отримано з цією моделлю. Подробиці про тренувальні й недоторкані випадки в цій частині походять із запусків з Claude Opus 5.5.
Перший окремий запуск з Gemini 3.8 Flash 26.09.2026 влучив у 11 з 14 тренувальних випадків. Зі 100 схожих випадків правильними були б, імовірно, від 52 до 92. На недоторканих випадках цю модель ще не вимірювали.
Порівняння моделей
28.09.2026 ми порівняли 10 моделей ШІ на тих самих випадках: тренувальних, вигаданих, граничних і додаткових. Недоторканих випадків серед них не було. На тренувальних випадках Gemini 3.8 Flash влучила у 10 з 14, Claude Opus 5.5 у 10 з 14, щоразу за більшістю запусків.
Обидві не влучили в ті самі випадки: X5, X6, X12 і X15. Отже, прогалина радше в правилах і порядку роботи, ніж у моделі. Тому Gemini 3.8 Flash залишається моделлю для Вашого тексту. Claude Opus 5.5 перевіряє випадки без влучання як друга думка, а кожне покращення ми знову вимірюємо з Gemini 3.8 Flash на тих самих випадках.
Випадків небагато, і на тренувальних випадках ми налаштовували. Тому різниця між моделями не доведена, у жодному напрямку.
Звідки береться еталонний ступінь
Судові випадки походять з опублікованих рішень австрійських судів.
Агенти ШІ знайшли, прочитали й переказали ці судові рішення. З кожного судового рішення виведено, який ступінь підходить за правилами. Тут цей ступінь називається еталонним ступенем.
У деяких випадках він відрізняється від ступеня в судовому рішенні, наприклад коли дитина перебуває поза межами охоплення.
Спірні питання при цьому вирішував власник сервісу, щоразу так, як радили агенти. Юрист ще не перевіряв еталонні ступені.
Як ми залишаємося чесними
- Тренувальні й недоторкані випадки залишаються окремо. На недоторканих випадках нічого не покращують.
- Що вважається влучанням, визначено заздалегідь. Зміни додаються як доповнення з датою.
- Кожне вимірювання додається, жодне не перезаписується. Кожне має відбиток правил та інструкцій для ШІ.
- Ми не платимо за кожен окремий запит під час вимірювань, тому можемо вимірювати так часто, як потрібно.
- Що ми порахували згодом, позначено саме так.
- Перевірка без ШІ запускається при кожній зміні. Вона перераховує звіти й знаменники, шукає сліди недоторканих випадків у правилах і розповідях і порівнює тренувальні випадки з недоторканими. Вона не вимірює знову.
Фахові терміни
- Тренувальні випадки
- калібрування
- Недоторкані випадки
- відкладена вибірка (holdout), бачена ще до створення програми
- Визначено заздалегідь
- попередня реєстрація
- Діапазон
- 95-відсотковий інтервал за Вільсоном
Випадок за випадком
Тренувальні випадки окремо. Торкніться випадку, щоб побачити подробиці.
Недоторкані випадки окремо.
Це не юридична консультація. Щодо рішення (Bescheid) і позову до суду (Klage) Палата праці (Arbeiterkammer, AK) та організації людей з інвалідністю консультують своїх членів.