Nasıl kontrol ediyoruz
Bir yapay zekâ, anlatımınızı yönetmeliğin kurallarıyla eşleştirir. Saatleri, kademeyi ve parayı sabit bir program yeniden hesaplar, yapay zekâ olmadan. Sonuç yanlış olabilir. Bu yüzden en sonunda kontrol eden ve karar veren sizsiniz.
Nasıl çalışır
- Siz
Anlatın
Günlük hayatınızı kendi sözlerinizle anlatırsınız.
- Yapay zekâ
Eşleştirme
Yapay zekâ cümlelerinizi kurallarla eşleştirir, sözlerinizi aynen alıntılayarak.
- Program
Hesaplama
Sabit bir program, yönetmeliğe göre hesaplar.
- Siz
Karar verin
Her satırı gözden geçirir ve bununla ne yapacağınıza karar verirsiniz.
Ne sıklıkla doğru sonuç veriyor
Şimdiye kadar en güvenilir: dokunulmamış mahkeme vakaları
15 içinden 5
Aracı geliştirdikten sonra hiç dokunmadığımız mahkeme vakalarında, kademeyi ilk denemede doğru buldu; diğerlerinde çoğunlukla çok düşük buldu.
Bugünkü durum: alıştırma vakaları
14 içinden 10
Yayımlanmış mahkeme kararlarından alınan ve aracı ayarlarken kullandığımız alıştırma vakalarında, kademeyi ilk denemede doğru buldu.
Pflegegeld-Prüfer hazırlık yapmanıza yardım eder. Kademeyi kurum veya mahkeme belirler. Danışmanlık alın.
Hazırlık
Pflegegeld (bakım ödeneği) hakkında yayımlanmış 29 mahkeme kararı topladık. Bunların 13 tanesinde Bescheid (resmî karar yazısı), mahkemenin sonunda belirlediği kademeyi vermemişti.
Kurallar önceden belirlendi
İlk kez ölçmeden önce, neyin isabet sayılacağı ve hangi hedefin geçerli olduğu belliydi: 14 alıştırma vakasından 12 tanesi.
İlk ölçümler
İlk çalıştırma 14 vakanın 9 tanesini doğru buldu. Bir kez düzeltme yaptık, sonra kuralları ve yapay zekâya verilen talimatı dondurduk. Son çalıştırma 14 vakanın 10 tanesini doğru buldu. Böylece hedefe ulaşılamadı.
Bu isabetlerin 4 tanesinde doğru cevap bir kademe değildi: hak yok ya da aracın hesap yapmadığı bir çocuk. Gerçek kademesi olan vakalarda 9 vakanın 6 tanesini doğru buldu.
Dokunulmamış vakalarla test
Bir kez, en sonda, 15 başka mahkeme kararında: 5 tanesi doğru. Ondan sonra hiçbir şeyi değiştirmedik. Gerçek kademesi olan vakalarda 13 vakanın 4 tanesi doğruydu.
O zamandan beri
Sayfa herkese açık. Ek soruları ve arayüzü iyileştirdik. 28.09.2026 tarihinde 10 yapay zekâ modelini aynı vakalarda karşılaştırdık. Gemini 3.8 Flash, yani kendi metninizi okuyan model, alıştırma vakalarını kalite ölçütü olarak aldığımız modelle aynı sıklıkta doğru buldu. 29.09.2026 tarihinde yeniden ölçtük. Sonuç yukarıda bugünkü durum olarak görünüyor.
Doğru kademenin zaten belli olduğu, yayımlanmış mahkeme kararlarıyla ölçüyoruz. Bir kısmını alıştırma ve iyileştirme için kullanıyoruz. Başka bir kısmına bu sırada dokunmuyoruz ve onu yalnızca en sonda test ediyoruz.
Neyin isabet sayılacağını önceden belirliyor ve yazıyoruz. Sonraki değişiklikler orada tarihiyle birlikte yer alır. Her ölçüm eklenir, hiçbiri silinmez, kötü olanlar da.
Yöntemin kendisini sürekli sorguluyoruz. Her değişiklikte, yapay zekâ kullanmayan otomatik bir kontrol de çalışır. Raporları yeniden hesaplar, paydaları kontrol eder ve kurallarda dokunulmamış vakaların izlerini arar. Yeniden ölçüm yapamaz. Bulduklarımız aşağıda sınırlar bölümünde yer alır.
29.09.2026 tarihinde Gemini 3.8 Flash ile ölçüldü. Bu, kendi metninizi de okuyan modeldir. Aracı bu vakalarla ayarladık. Bu yüzden sayı muhtemelen fazla yüksek.
26.09.2026 tarihinde bir kez ölçüldü. Bu sayı, yeni vakalarda nasıl sonuç verdiğini en iyi gösterir.
Karşılaştırma için: Bu vakalarda kademe doğrudan Bescheid’den alınsaydı, 14 vakanın 8 tanesinde doğru olurdu, yani daha sık. Demek ki araç, bir Bescheid’in doğru olup olmadığını güvenilir şekilde anlayamaz.
Program saatleri mahkeme kararından alırsa, kademe 22 alıştırma ve kurgusal vakanın hepsinde doğru çıkar. Dokunulmamış vakalarda 15 vakanın 12 tanesinde. Diğer kararlar her iş için saat vermiyor. Bu yüzden programın girdisi yok.
Yanıldığında çoğunlukla düşük kaldı: çok düşük on kez, çok yüksek iki kez.
Bu sizin için ne anlama geliyor?
Bescheid’inizden daha fazlasını gösteriyorsa, dikkatle bakmaya ve danışmanlık almaya değer.
Daha fazlasını göstermiyorsa, bu Bescheid’inizin doğru olduğu anlamına gelmez. Fazla söz vermekten çok, bir şeyi gözden kaçırma ihtimali daha yüksektir.
Sınırlar
Nerede yanılabilir
- Az sayıda vakayla ölçüldü. Bu, her sayıyı belirsiz kılar.
- Mahkeme vakaları yeniden anlatılmış kararlardır, henüz gerçek ailelerin anlatımları değil.
- Her karar için hangi kademenin doğru olduğunu bir yapay zekâ karardan çıkardı. Bir hukuk uzmanı bunu henüz kontrol etmedi.
- Kontrol aracının bazı kuralları, sonradan “dokunulmamış vakalar” olarak ayrılan vakalardan çıkarıldı. Bu, oradaki sonucu biraz olumlu etkileyebilir.
- Kendi metninizi Gemini 3.8 Flash okur. Bu, bugünkü durumdaki modelle aynıdır. Dokunulmamış vakalarda henüz ölçülmedi.
Ne yapmaz
- Pflegegeld’iniz (bakım ödeneği) hakkında karar vermez.
- Size danışmanlık vermez ve sizi temsil etmez.
- Yapay zekâ hesap yapmaz. Sıklıkları yalnızca sizin sözlerinizden alır.
- Anlatımınızı kalıcı olarak saklamaz.
Kademeniz doğru mu?
Normal bir gününüzü anlatın. Kontrol aracı cümlelerinizi eşleştirir ve Bescheid’deki kademenin uyup uymadığını hesaplar.
Bescheid’imi kontrol etUzmanlar için
Son ölçüm turu: 29.09.2026.
Tüm ölçüm turları
Yapay zekânın anlatımı okuduğu, değerlendirilmiş her tur, zaman sırasıyla. Hiçbir şeyin üzerine yazılmaz.
- 26.09.2026 · Alıştırma vakaları: 14 içinden 9Aralık %39 ile %84 arası · Model Claude Opus 5.5Erster Lauf aus freiem Text, vor der einen Änderung an der Anweisung an die KI.
- 26.09.2026 · Alıştırma vakaları: 14 içinden 10Aralık %45 ile %88 arası · Model Claude Opus 5.5Endlauf nach dem Einfrieren von Regeln und Anweisung. Das ist die vorher festgelegte Hauptzahl.
- 26.09.2026 · Kurgusal vakalar: 7 içinden 7Aralık %65 ile %100 arası · Model Claude Opus 5.5Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 26.09.2026 · Dokunulmamış vakalar: 15 içinden 5Aralık %15 ile %58 arası · Model Claude Opus 5.5Unberührte Fälle, einmal gemessen, danach nichts verändert.
- 26.09.2026 · Yeni kararlar, pilot: 6 içinden 6Aralık %61 ile %100 arası · Model Claude Opus 5.5Pilot mit neuen Urteilen, nicht vorher festgelegt. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Alıştırma vakaları: 14 içinden 10Aralık %45 ile %88 arası · Model Claude Opus 5.5 · Saatlerde ortalama 17,7 sapmaModellvergleich, Bezugsarm für die Qualität. Verfehlt dieselben Übungsfälle wie das Modell, das eigenen Text liest.
- 28.09.2026 · Kurgusal vakalar: 7 içinden 7Aralık %65 ile %100 arası · Model Claude Opus 5.5 · Saatlerde ortalama 0,6 sapmaModellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Sınır vakalar: 2 içinden 2Aralık %34 ile %100 arası · Model Claude Opus 5.5 · Saatlerde ortalama 0 sapmaModellvergleich, Randfälle.
- 28.09.2026 · Yeni kararlar, pilot: 6 içinden 6Aralık %61 ile %100 arası · Model Claude Opus 5.5 · Saatlerde ortalama 5 sapmaModellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Alıştırma vakaları: 14 içinden 10Aralık %45 ile %88 arası · Model Claude Sonnet 5 · Saatlerde ortalama 17,3 sapmaModellvergleich, bestes weiteres Modell aus der Sichtung.
- 28.09.2026 · Kurgusal vakalar: 7 içinden 6Aralık %49 ile %97 arası · Model Claude Sonnet 5 · Saatlerde ortalama 0,7 sapmaModellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Sınır vakalar: 2 içinden 2Aralık %34 ile %100 arası · Model Claude Sonnet 5 · Saatlerde ortalama 0 sapmaModellvergleich, Randfälle.
- 28.09.2026 · Yeni kararlar, pilot: 6 içinden 6Aralık %61 ile %100 arası · Model Claude Sonnet 5 · Saatlerde ortalama 0,8 sapmaModellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 28.09.2026 · Alıştırma vakaları: 14 içinden 10Aralık %45 ile %88 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 19,4 sapmaModellvergleich mit dem Modell, das eigenen Text liest, gleichauf mit Claude Opus. Gemessen über das lokale Abo-Gateway, nicht über den Weg der gehosteten Prüfung.
- 28.09.2026 · Kurgusal vakalar: 7 içinden 7Aralık %65 ile %100 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 0,6 sapmaModellvergleich. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 28.09.2026 · Sınır vakalar: 2 içinden 1Aralık %10 ile %91 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 0 sapmaModellvergleich, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 28.09.2026 · Yeni kararlar, pilot: 6 içinden 5Aralık %44 ile %97 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 4,2 sapmaModellvergleich. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
- 29.09.2026 · Alıştırma vakaları: 14 içinden 10Aralık %45 ile %88 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 17,8 sapmaZweite Messrunde, neu gemessen nach der Änderung der Regel zur Bindung an den Bescheid bei einer Klage (Link und Wortlaut); die Anweisung an die KI blieb gleich. Wie im Modellvergleich über das lokale Abo-Gateway gemessen, nicht über den Weg der gehosteten Prüfung.
- 29.09.2026 · Kurgusal vakalar: 7 içinden 7Aralık %65 ile %100 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 0,9 sapmaZweite Messrunde. Erfundene Fälle mit Antworten auf die Rückfragen, darum eine Obergrenze.
- 29.09.2026 · Sınır vakalar: 2 içinden 1Aralık %10 ile %91 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 0 sapmaZweite Messrunde, Randfälle. Ein Randfall blieb ohne Wertung, weil das Gateway zweimal keine Antwort lieferte; er zählt hier als nicht getroffen.
- 29.09.2026 · Yeni kararlar, pilot: 6 içinden 5Aralık %44 ile %97 arası · Model Gemini 3.8 Flash · Saatlerde ortalama 3,3 sapmaZweite Messrunde. Fast alle Fälle ohne Anspruch, sagt über Stufen darum wenig.
Dokunulmamış vakalar
İlk tur: 15 vakanın 5 tanesinde referans kademe doğru bulundu. Benzer 100 vakadan muhtemelen 15 ile 58 arası doğru olurdu.
Bunlardan gerçek kademesi olan 13 içinden 4, hak yok 1 içinden 1, kapsam dışında çocuk 1 içinden 0.
Yanlış: 10. Bunlardan çok düşük: 7, çok yüksek: 2, bir kez bir çocuk tanınmadı.
Her çalıştırmada doğru: 15 vakanın 3 tanesi.
Bir ek soruyla: 15 vakanın 7 tanesi.
Bu vakalar en sonda bir kez değerlendirildi ve sonrasında üzerlerinde hiçbir iyileştirme yapılmadı. Sonuç kötü olsa da burada yer alır.
Aracı geliştirmeden önce bu vakalar model karşılaştırmalarında zaten kullanılmıştı. 22 kural bunlardan birini kaynak olarak gösteriyor, bunların 10 tanesi yapay zekâya verilen metinde yer alıyor. Bu durum şunları etkiliyor: X16, X19, X21, X22, X24, X25, X28, X29, X30. Vaka kimliklerinin kendisi yapay zekâya verilen metinde yer almıyor. Bu yüzden bu vakalara “yeni” değil, “geliştirmeden beri dokunulmamış” diyoruz.
Kademeyi Bescheid’den almak
Dokunulmamış vakalar: Referans kademesi olan 14 vakada ilk Bescheid 8 kez doğruydu, yani Pflegegeld-Prüfer ile karşılaştırıldığında daha sık.
Alıştırma vakaları: Referans kademesi olan 14 vakada Bescheid 5 kez doğruydu, yani Pflegegeld-Prüfer ile karşılaştırıldığında daha seyrek.
Bescheid’i olan toplanmış 29 mahkeme kararının tamamında, Bescheid 16 kez karardaki kademedeydi.
Aracın sonucu Bescheid’den farklıysa, bu Bescheid’in yanlış olduğunu kanıtlamaz. Daha dikkatli bakmak ve danışmanlık almak için bir sebeptir.
Bescheid çok düşükse, daha fazlasını gösteriyor mu?
Sonradan sayıldı, önceden belirlenmedi. Bir sonraki ölçüm için bu ölçütü önceden belirleyeceğiz.
Dokunulmamış vakalar: Bescheid referans kademenin altındaysa, 6 vakanın 4 tanesinde Bescheid’den fazlasını gösterdi. Bescheid doğruysa, 8 vakanın 1 tanesinde yine de daha fazlasını gösterdi.
Alıştırma vakaları: Bescheid referans kademenin altındaysa, 3 vakanın 3 tanesinde Bescheid’den fazlasını gösterdi. Bescheid doğruysa, 5 vakanın 0 tanesinde yine de daha fazlasını gösterdi.
Alıştırma vakaları
İlk tur: 14 vakanın 10 tanesinde referans kademe doğru bulundu. Benzer 100 vakadan muhtemelen 45 ile 88 arası doğru olurdu. Önceden belirlenen hedef: 12, ulaşılamadı.
Bunlardan gerçek kademesi olan 9 içinden 6, hak yok 1 içinden 1, kapsam dışında çocuk 4 içinden 3.
Her çalıştırmada doğru: 14 vakanın 10 tanesi.
İsabet şu demek: 3 çalıştırmanın çoğunluğu referans kademeyi doğru buluyor. Buna ek olarak, davranışın değerlendirildiği bir özel vaka var. Ayrı sayılır. Hepsi birlikte 15 alıştırma vakası eder.
Bir ek soruyla: 15 vakanın 13 tanesi. Kademeyi doğru bulduysa ya da önemli olan soruyu sorduysa sayıldı. Önceden belirlenen hedef: 13, ulaşıldı.
Yanlış: 4. Bunlardan çok düşük: 3, çok yüksek: hiçbiri. Bir kez bir çocuk vakasını tanımadı.
Yapay zekâ olmadan hesaplama
Mahkeme kararındaki saatlerle program, alıştırma ve kurgusal vakalar birlikte, 22 vakanın 22 tanesini doğru buluyor. Önceden belirlenen hedef: 22, ulaşıldı.
Dokunulmamış vakalar: 15 vakanın 12 tanesi. Doğru bulunamayanlar: X18, X25 ve X30. Bu kararlar yalnızca kademeyi veriyor, her iş için saat vermiyor. Bu yüzden program girdi alamıyor.
Kurgusal vakalar
Ölçümde 7 kurgusal vaka kullanılıyor. Yapay zekâ anlatımı okuyor, program hesaplıyor: 7 vakanın 7 tanesinde beklenen kademe. Önceden belirlenen hedef: 6, ulaşıldı. Bunlardan 5 tanesini kontrol sayfasında kendiniz deneyebilirsiniz.
Farklı anlatıldığında: 35 yeniden yazımın hiçbiri kademeyi değiştirmedi. Bu ölçüm önceden belirlenmemişti.
Kontrolünüzdeki model
Kendi metninizle yaptığınız kontrol Gemini 3.8 Flash kullanır. Bugünkü durum bu modelden geliyor. Bu bölümdeki alıştırma vakaları ve dokunulmamış vakalarla ilgili ayrıntılar, Claude Opus 5.5 ile yapılan çalıştırmalardan geliyor.
Gemini 3.8 Flash ile 26.09.2026 tarihindeki ilk ayrı çalıştırma, 14 alıştırma vakasının 11 tanesini doğru buldu. Benzer 100 vakadan muhtemelen 52 ile 92 arası doğru olurdu. Bu model dokunulmamış vakalarda henüz ölçülmedi.
Model karşılaştırması
28.09.2026 tarihinde 10 yapay zekâ modelini aynı vakalarda karşılaştırdık: alıştırma vakaları, kurgusal vakalar, sınır vakalar ve ek vakalar. Dokunulmamış vakalar buna dahil değildi. Alıştırma vakalarında Gemini 3.8 Flash 14 vakanın 10 tanesini, Claude Opus 5.5 14 vakanın 10 tanesini doğru buldu, her biri çalıştırmaların çoğunluğuna göre.
İkisi de aynı vakaları doğru bulamadı: X5, X6, X12 ve X15. Yani eksiklik modelden çok kurallarda ve süreçte. Bu yüzden Gemini 3.8 Flash, metniniz için kullanılan model olarak kalıyor. Claude Opus 5.5, doğru bulunamayan vakaları ikinci görüş olarak kontrol ediyor. Her iyileştirmeyi aynı vakalarda yine Gemini 3.8 Flash ile ölçüyoruz.
Bunlar az sayıda vaka, ayrıca aracı alıştırma vakalarıyla ayarladık. Bu yüzden modeller arasında bir fark kanıtlanmış değil, hiçbir yönde.
Referans kademe nereden geliyor
Mahkeme vakaları, Avusturya mahkemelerinin yayımlanmış kararlarından geliyor.
Yapay zekâ ajanları bu kararları aradı, okudu ve yeniden anlattı. Her karardan, kurallara göre hangi kademenin uyduğu çıkarıldı. Bu kademeye burada referans kademe diyoruz.
Bazı vakalarda bu, karardaki kademeden farklıdır, örneğin bir çocuk kapsam dışında kaldığında.
Bu sırada tartışmalı soruları işletmeci karara bağladı, her seferinde ajanların önerdiği gibi. Bir hukuk uzmanı referans kademeleri henüz kontrol etmedi.
Dürüst kalmak için ne yapıyoruz
- Alıştırma vakaları ve dokunulmamış vakalar ayrı kalır. Dokunulmamış vakalarda hiçbir iyileştirme yapılmaz.
- Neyin isabet sayılacağı önceden bellidir. Değişiklikler tarihli eklerle eklenir.
- Her ölçüm eklenir, hiçbirinin üzerine yazılmaz. Her birinde kuralların ve yapay zekâya verilen talimatın bir parmak izi vardır.
- Ölçüm çalıştırmalarında tek tek çağrılar için para ödenmez. Bu yüzden gerektiği kadar sık ölçebiliriz.
- Sonradan saydıklarımız, sonradan sayıldığı belirtilerek yer alır.
- Her değişiklikte yapay zekâ kullanmayan bir kontrol de çalışır. Raporları ve paydaları yeniden hesaplar, kurallarda ve anlatımlarda dokunulmamış vakaların izlerini arar ve alıştırma vakalarını dokunulmamış vakalarla karşılaştırır. Yeniden ölçüm yapmaz.
Teknik terimler
- Alıştırma vakaları
- kalibrasyon
- Dokunulmamış vakalar
- holdout, aracı geliştirmeden önce zaten görülmüş
- Önceden belirlenmiş
- ön kayıt
- Aralık
- Wilson’a göre %95 aralığı
Vaka vaka
Alıştırma vakaları tek tek. Ayrıntılar için bir vakaya dokunun.
Dokunulmamış vakalar tek tek.
Bu hukuki danışmanlık değildir. Arbeiterkammer (Çalışanlar Odası) ve engelli dernekleri, üyelerine Bescheid ve dava konusunda danışmanlık verir.