İçeriğe atla
0 XP 0
0/5

Puan ders bitince hesaba yazılır. Bu dersi tamamlayınca +50 XP alacaksın. Giriş yapmadan ilerlersen puan yalnız bu tarayıcıda durur.

8 dk · 50 XP · 5 etkinlik

Değerlendirme ve sürekli red team

Geçen ay guardrail'ini test ettin ve saldırıların çoğu durdu. Bu hafta model sağlayıcısı yeni sürüm yayımladı, ekip sistem promptunu değiştirdi ve ajana iki araç eklendi. Geçen ayın sonucu artık neyi gösteriyor? Hiçbir şeyi. LLM güvenliğinde tek seferlik test bu yüzden yanıltır. Değerlendirme bir olay değil, her değişiklikte dönen bir döngüdür. NIST AI 600-1 de guardrail'lerin düzenli gözden geçirilmesini ve yayından sonra izleme planını ister.

Döngünün ilk parçası saldırı setidir. Her saldırı ailesi için onlarca örnek toplarsın: doğrudan enjeksiyon, belgeye gizlenmiş dolaylı enjeksiyon, sistem promptu sızıntısı, kişisel veri kaçağı, jailbreak kalıpları ve araç kötüye kullanımı. Setin Türkçe örnek taşıması gerekir. Hazır setlerin çoğu İngilizce yazılır. Filtre İngilizcede iyi sonuç verip Türkçede zayıf kalabilir. Bunu ancak Türkçe örnekle ölçerek görürsün.

İkinci parça ölçüttür. İki oran birlikte tutulur. Saldırı başarı oranı, setteki saldırıların yüzde kaçının amacına ulaştığını gösterir. Yanlış pozitif oranı ise meşru isteklerin yüzde kaçının yanlışlıkla engellendiğini gösterir. Birincisi savunmanın gücünü, ikincisi ürünün kullanılabilirliğini ölçer. Yalnız ilk orana bakarsan her şeyi reddeden bir sistem kusursuz görünür. Bu yüzden sete saldırıların yanında meşru örnekler de koyarsın.