Čo je Prompt Injection
Prompt Injection je pokus ovplyvniť model škodlivou inštrukciou vloženou do správy, dokumentu, webovej stránky alebo iného spracovaného zdroja. Útočník sa snaží zmeniť pôvodné úlohy, získať údaje alebo spustiť neoprávnenú akciu.
Riziko sa zvyšuje, keď model ovláda nástroje.
Priame a nepriame útoky
Priame manipulácie prichádzajú od používateľa v konverzácii. Nepriame môžu byť skryté v dokumente, e-mailovi alebo načítanej stránke, ktorú agent považuje za zdroj informácií. Každý externý obsah sa preto spracúva ako nedôveryhodný údaj, nie ako nadriadený pravidlo.
Povolenie a oddelenie roli
Model dostáva len nástroje potrebné na vykonanie daného úkolu. Server vždy kontroluje identitu, vlastníctvo a povolený rozsah. Inštrukcie, používateľské údaje a obsah zdrojov majú oddelené úlohy, aby dokument sám nemohol zmeniť bezpečnostnú politiku.
Citlivé akcie a potvrdenia
Odosielanie správy, platba, publikácia alebo vymazanie vyžadujú overenie a vedome potvrdenie. Systém ukazuje presne, čo urobí a s akými údajmi. Model nemá priamy prístup k tajným kľúčom ani možnosť obehnúť obmedzenia iba textovou požiadavkou.
Monitorovanie a testovanie
Audit zaznamenáva volanie nástrojov, zamietnuté operácie a neobvyklé vzorce. Testy obsahujú skryté pokyny v rôznych formátoch, pokusy získať tajomstvo a kombináciu viacerých krokov. Obrana sa overuje po každej zmene modelu alebo integrácii.
Prístup PAR HOUSE Agency
Agentov budujeme podľa minimálnych oprávnení a bezpečného výchozného stavu, izolujeme nebezpečné obsah, potvrdzujeme citlivé kroky a vynúkame obchodné pravidlá mimo modelu, monitorovanie a pravidelné testovanie doplňujú ochranu, ktorú nedá jedna inštrukcia vyriešiť.