Puan ders bitince hesaba yazılır. Bu dersi tamamlayınca +55 XP alacaksın. Giriş yapmadan ilerlersen puan yalnız bu tarayıcıda durur.
Ölçümü otomatikleştirmek
a11'de kurduğun değerlendirme setini her sürümde elle koşmak mümkündür, ama sürdürülebilir değildir. Bir mühendis dört yüz örneği elle çalıştırıp hakem modeline gönderip sonucu tabloya işlerse günün büyük kısmı bu işe gider. Sürüm haftada birkaç kez değişiyorsa bu döngü tıkanır ve ekip testi seyrekleştirir. Seyrekleşen test, sessizce kapanan bir güvenlik kapısı demektir.
Otomatikleştirmek, aynı değerlendirme setini ve aynı hakem kuralını bir insan dokunmadan çalıştırmak demektir. Koşu bir zamanlayıcıya bağlanır, sonuç bir dosyaya yazılır, eşik aşılırsa uyarı çıkar. a11'de öğrendiğin ölçütler burada değişmez, değişen yalnız kimin tetiklediğidir. Otomasyon insanın yargısını ortadan kaldırmaz, yalnız aynı yargıyı çok daha sık uygularsın.
Bu işi sıfırdan yazmak yerine üç açık kaynak araç bu boşluğu doldurur: garak, PyRIT ve promptfoo. Üçü de LLM güvenliği için üretildi ama farklı katmanda çalışır ve farklı soruya cevap verir. Birini seçerken önce sorduğun soruyu netleştirmen gerekir: modelin kendisini mi, özel bir saldırı senaryosunu mu, yoksa kendi uygulamanın yapılandırmasını mı sınıyorsun? Yanlış aracı seçmek, doğru sonucu yanlış yerde aramaktır.
garak, NVIDIA'nın geliştirdiği açık kaynak tarayıcıdır. Bir dil modelini hazır problar (probe) listesiyle tarar: jailbreak kalıpları, zehirli çıktı, halüsinasyon, kodlanmış saldırı metinleri. Soru şudur: bu modelin kendisinde bilinen zafiyet sınıflarından hangisi açık? garak senin uygulamana değil, altındaki modele bakar. Bir modeli değiştirmeden önce ya da yeni bir sağlayıcı seçerken temel bir taban çizgisi verir.
PyRIT, Microsoft'un risk belirleme aracıdır. Hazır bir problar listesinden çok bir çatı (framework) sunar. Kendi saldırı senaryonu Python koduyla kurarsın: çok turlu bir konuşma, bir dönüştürücü zinciri, özel bir skor fonksiyonu. Soru şudur: belirli bir tehdit modelini nasıl programlı biçimde deneyip tekrar tekrar koşabilirim? PyRIT hazır cevap vermez, sana senaryo kurma imkanı verir.
promptfoo senin uygulamanı sınar: modeli değil, model, sistem promptu, RAG bağlamı ve araç tanımları birleşimini. Ayarlarını bir yaml dosyasına yazarsın, hem kendi işlevsel test senaryolarını hem de kırmızı takım eklentilerini aynı dosyada tutarsın. Soru şudur: benim gerçek yapılandırmam, kendi test senaryolarıma göre geçiyor mu? Üç araç arasında dağıtıma en yakın duran budur, çünkü sonucu doğrudan senin sürümünle değişir.