LLM Jailbreak
Ein LLM Jailbreak umgeht die Schutzmechanismen eines Sprachmodells, damit es Inhalte liefert, die es verweigern sollte.
Ein LLM Jailbreak ist der Versuch, die Sicherheitsvorgaben eines Sprachmodells zu umgehen. Das Modell soll Dinge tun oder preisgeben, die es nach seinen Regeln verweigern müsste.
So funktioniert es
Anbieter und Entwickler legen fest, was ein Modell nicht tun darf. Dazu gehören schädliche Inhalte, aber auch interne Anweisungen und vertrauliche Daten. Beim Jailbreak versucht ein Benutzer, diese Grenzen durch geschickte Formulierungen zu umgehen. Typische Muster sind Rollenspiele, erfundene Szenarien oder schrittweise Gespräche, die das Modell langsam von seinen Regeln wegführen. Anders als bei Prompt Injection stammt der Angriff meist direkt vom Benutzer.
Ein Beispiel aus der Praxis
Ein Unternehmen betreibt einen Chatbot für den Kundendienst. Ein Angreifer verwickelt ihn in ein Rollenspiel, in dem der Chatbot angeblich ein Entwickler bei einer Fehlersuche ist. Nach einigen Runden gibt der Chatbot seine internen Anweisungen preis. Darin stehen Hinweise auf angebundene Systeme und Kundendaten, die er abfragen kann. Der Angreifer versucht nun, gezielt Daten anderer Kunden zu erhalten.
Worauf Sie achten sollten
- Gehen Sie davon aus, dass interne Anweisungen früher oder später bekannt werden. Legen Sie dort keine Geheimnisse ab.
- Beschränken Sie, auf welche Daten der Chatbot zugreifen kann, und prüfen Sie Berechtigungen ausserhalb des Modells.
- Filtern Sie Ausgaben auf vertrauliche Inhalte, bevor sie angezeigt werden.
- Überwachen Sie Gespräche auf auffällige Muster.
- Testen Sie Ihre Anwendung regelmässig mit gezielten Versuchen.
Warum es wichtig ist
Ein Jailbreak allein ist oft harmlos, solange das Modell keinen Zugriff auf sensible Daten oder Werkzeuge hat. Kritisch wird es, wenn der Chatbot mit Kundendaten oder internen Systemen verbunden ist. Dann wird aus einer Spielerei ein Datenleck.
Schweiz und Regulierung
Gibt ein Chatbot Personendaten an Unbefugte heraus, liegt eine Verletzung der Datensicherheit nach revDSG vor. Führt die Verletzung voraussichtlich zu einem hohen Risiko für die betroffenen Personen, ist eine Meldung an den EDÖB nötig.
Typische Fehler
Häufig verlassen sich Unternehmen allein auf die Schutzmechanismen des Modellanbieters. Diese decken aber die Risiken der eigenen Anwendung nicht ab. Ein zweiter Fehler sind Chatbots mit breitem Datenzugriff ohne eigene Berechtigungsprüfung.
So setzen wir es um
Unsere Agents arbeiten innerhalb der Grenzen Ihres Mandats. Folgenreiche Eingriffe legen sie unseren Analysten zur Freigabe vor.