Was ist Prompt Injection
Prompt Injection ist ein Versuch, ein Modell durch schädliche Instruktionen zu beeinflussen, die in einen Bericht, Dokument, Webseite oder andere verarbeitete Quelle eingebunden sind. Der Angreifer versucht, die ursprüngliche Aufgabe zu ändern, Daten zu erfassen oder eine illegale Aktion zu starten.
Das Risiko steigt, wenn das Modell die Instrumente steuert.
Direkt und indirekt
Die direkte Manipulation kommt vom Nutzer in der Unterhaltung. Die indirekte Information kann in einem Dokument, einer E-Mail oder einer geladenen Seite versteckt werden, die der Agent als Informationsquelle betrachtet. Jeder externer Inhalt wird daher als unzuverlässig verarbeitet, nicht als übergeordneter Regel.
Berechtigung und Abteilung von Rollen
Das Modell erhält nur die Werkzeuge, die für die Aufgabe erforderlich sind. Anweisungen, Benutzerdaten und Ressourceninhalte haben getrennte Rollen, damit das Dokument nicht selbst die Sicherheitspolitik ändern kann.
Empfindliche Aktionen und Bestätigungen
Nachrichten, Zahlungen, Veröffentlichungen oder Löschungen erfordern Validierung und bewusste Bestätigung. Das Modell hat weder direkten Zugang zu den geheimen Schlüsseln noch die Möglichkeit, die Beschränkung durch nur die Textanforderung zu umgehen.
Monitoring und Testing
Die Prüfung erfasst Instruments, abgelehnte Operationen und ungewöhnliche Formulierungen. Die Tests beinhalten verborgene Anweisungen in verschiedenen Formaten, Versuche, Geheimnisse zu erlangen und Kombinationen von mehreren Schritten. Die Verteidigung wird nach jedem Modellwechsel oder Integration überprüft.
Zugriff PAR HOUSE Agency
Wir bauen die Agent*innen nach dem Grundsatz der Mindestberechtigung und des sicheren Ausgangszustands. Untrustbare Inhalte werden isoliert, sensible Schritte bestätigt und Geschäftsregeln außerhalb des Modells erzwungen. Monitoring und regelmäßige Tests ergänzen Schutz, den eine Anleitung nicht lösen kann.