NOVA ile Prompt Injection ve Jailbreak Tespiti

LLM tabanlı sistemlerde tehdit artık sadece “kötü niyetli kullanıcı” değil; prompt injection, jailbreak, veri sızdırma (exfiltration) ve agent/tool abuse gibi TTP’ler. Klasik keyword filtreleri tek başına yetersiz kalıyor; çünkü saldırganlar aynı niyeti farklı kelimelerle ifade ederek kaçabiliyor.

NOVA, bu problemi “YARA benzeri” bir yaklaşımla ele alan açık kaynak bir prompt pattern matching sistemidir:

  • Keyword/regex eşleşmesi,
  • semantic similarity,
  • LLM tabanlı değerlendirme
    katmanlarını bir araya getirerek prompt içeriğini analiz eder ve “kural tabanlı” şekilde avlar.

Not: Proje dokümantasyonunda NOVA’nın beta aşamasında olduğu ve erken test sürecinde bulunduğu belirtiliyor.


🔍 NOVA nedir, neyi çözer?

NOVA’nın amacı: kötü niyetli prompt’ları tespit etmek, sınıflandırmak ve isterseniz guardrail gibi “önleyici” akışlarda bloklamak. Kural mantığıyla “eşleşme koşulları” tanımlayıp, bu kurallarla prompt’ları tarıyorsunuz.

Öne çıkan yaklaşım:

  • Kural tabanlı avcılık (hunting): “Bu TTP’ye benzeyen prompt’u bul”
  • Kural tabanlı koruma (guardrail): “Eşleşirse uyar/engelle” (pipeline’a bağlanabilir)

🧠 NOVA nasıl tespit yapar? (3 katman)

  1. Keyword detection (keyword/regex)
    Belirli anahtar kelime veya regex desenleri ile eşleşme.
  2. Semantic similarity
    Aynı niyeti farklı kelimelerle ifade eden varyasyonları, eşik (threshold) ile yakalama.
  3. LLM matching
    “Doğal dilde” yazılmış değerlendirme kuralı ile prompt’u LLM’e analiz ettirme (API key’lerle). Kurulum dokümanında LLM değerlendirme için environment variable örnekleri veriliyor.

🎯 Hangi prompt türlerini yakalamaya uygundur?

NOVA; aşağıdaki sınıflarda kural yazıp tarama yapmaya elverişli:

  • Prompt Injection (talimatları geçersiz kılma / davranış değiştirme)
  • Jailbreaking (güvenlik/etik kısıtları aşma)
  • Malicious code generation (kötüye kullanım amaçlı kod/komut isteği)
  • Scam / phishing üretimi
  • Recon / exfiltration (hassas veri sızdırma, sistem prompt avı vb.)
  • Toksiklik / NSFW / önyargı gibi içerik riskleri

Bu sınıfları “rule collection” olarak yönetmek için ayrı bir nova-rules deposu da bulunuyor.


⚙️ Hızlı başlama (PoC)

1) Kurulum

pip install nova-hunting

2) Kuralları çek

git clone https://github.com/Nova-Hunting/nova-rules

3) Prompt tarama (CLI)
Repo hızlı başlangıç bölümünde novarun CLI ile tarama anlatılıyor.

LLM tabanlı değerlendirme açacaksanız ilgili API anahtarlarını env var olarak set etmeniz gerekiyor (ör. OpenAI/Anthropic).


🧩 Nerede konumlandırılır? (pratik senaryolar)

  • SOC / Threat hunting: SIEM’de toplanan prompt loglarını periyodik tarayıp “yüksek sinyal” liste üretmek
  • Guardrail: Uygulama katmanında prompt girişini NOVA ile kontrol edip eşleşenleri bloklamak/etiketlemek (MCP/agent akışları gibi)
  • Agent güvenliği: MCP server’lar / agent skills üzerinde güvenlik taraması (Nova ekosisteminde buna dönük yan projeler de var)

✅ Operasyonel ipuçları (gürültüyü azaltmak için)

  • Kuralları “geniş” yazıp her şeyi yakalamak yerine, yüksek doğruluk hedefleyen katmanlı kural seti kurun.
  • “Semantic threshold” değerlerini PoC’de farklı gruplarda test edip FP/TP dengesini ölçün.
  • Eşleşen prompt’lara kural adı + timestamp + session id gibi alanlarla kayıt tutun (incident response için).

Cem Kemal Erbaş sitesinden daha fazla şey keşfedin

Subscribe to get the latest posts sent to your email.

About Cem Kemal Erbaş

Check Also

Authorization, Capture ve Settlement Nedir? Kartlı Ödeme Süreci Nasıl Çalışır?

Kartınızı POS cihazına okuttunuz. Birkaç saniye sonra: “Ödeme Başarılı” mesajını gördünüz. Mobil bankacılık uygulamasına baktığınızda …

Bir yanıt yazın