Ce qu'est le poison de données
Le poisonnement des données est une perturbation des données pour que le modèle ou le système automatisé puisse tirer une conclusion erronée. Il peut affecter la formation, l'apprentissage continu, la base de données, la recherche ou l'analyse, et peut être causé par une attaque, une mauvaise intégration ou une erreur humaine.
Comment une attaque ou un défaut survient
Les données malveillantes peuvent être insérées dans les données collectées publiquement, importées, retenues ou documents utilisés par le système RAG. L'attaquant essaie de modifier un comportement général ou de provoquer une erreur sur un sujet spécifique.
Origine et autorisation des données
Chaque source a son propriétaire, son but, sa date, sa version et ses règles d'accès. Le contenu externe est séparé des connaissances approuvées et ne reçoit pas automatiquement la même confiance.
Validation et suivi
Les contrôles recherchent des valeurs inhabituelles, des changements subits de distribution, des duplicités et des conflits avec une source fiable. Le système surveille la qualité des réponses à un ensemble stable de tests.
Réaction et rétablissement
En cas de suspicion, ils arrêtent leur traitement, marquent les versions concernées et conservent les preuves. L'équipe rétablit le dernier état vérifié, modifie les approches et réessaie le comportement.
Accès à l'accès
Nous proposons des flux de données avec des autorisations minimales et des origines observables. Nous séparons les informations utilisateur des instructions fiables, nous révisons les connaissances et nous testons régulièrement les scénarios critiques. Chaque automatisation a la possibilité de s'arrêter et de revenir en toute sécurité.