RRecherchily
Retour aux projets
En coursJuin 2026

Benchmarking des vulnérabilités d'injection de prompts indirects et stratégies d'atténuation dans les trajectoires d'agents autonomes à appels de fonctions

Alors que les applications LLM passent d'interfaces de chat isolées à des agents autonomes dotés d'accès à des outils (scraping web, exécution de code, requêtes de bases de données), l'injection de prompts indirects constitue un risque de sécurité majeur. Cette recherche évalue systématiquement la vulnérabilité des modèles à appels de fonctions face aux injections de prompts indirects multi-tours et à long horizon, intégrées dans des entrées externes non fiables.

Sécurité IAPrompt InjectionAgents autonomesBenchmark

Équipe

AM
Abdelhamid MASSERITI
Directeur de recherche
FB
Farid BENHAMMADI
Chercheur
KT
Karim TOUATI
Chercheur

Méthodologie

  1. Construction d'un sandbox d'exécution léger (Python) avec des outils simulés : recherche web, lecteur de fichiers, requêtes SQL, envoi de webhooks API.
  2. Création d'un jeu de données de référence de 100 scénarios réalistes d'exécution d'agents avec des charges utiles adversariales cachées dans des commentaires HTML, des champs JSON et du texte naturel.
  3. Évaluation des taux de succès d'attaque (ASR) sur des boucles multi-tours pour mesurer la dégradation des mécanismes de sécurité à mesure que la fenêtre de contexte s'allonge.
  4. Test de techniques d'atténuation légères : sandboxing XML dans les prompts système et sanitiseurs LLM secondaires (GPT-4o-mini comme garde-fou).

Scénarios d'attaque

  • Exfiltration de données — amener l'agent à lire des fichiers locaux et les envoyer vers un endpoint externe via un outil de requête web.
  • Détournement du flux de contrôle — faire sauter à l'agent des sous-objectifs assignés pour exécuter les tâches de l'attaquant.
  • Escalade de privilèges — forcer l'agent à exécuter des appels d'outils administratifs non autorisés.

Métriques d'évaluation

  • Taux de succès d'attaque (ASR) — pourcentage d'injections ayant réussi à détourner l'exécution des outils.
  • Taux de rétention d'utilité (URR) — mesure si les garde-fous brisent la capacité de l'agent à résoudre les tâches bénignes normales.
  • Surcoût en tokens / latence — calcul exact du coût et de la latence ajoutés par les couches d'atténuation.

Budget

1 000 $ en crédits API OpenAI — 400 $ pour les tests de vulnérabilité de base (2 000+ boucles multi-tours), 400 $ pour les tests de garde-fous secondaires, 200 $ pour les sweeps finaux.

Livrables attendus

  • Dépôt GitHub public avec le harness d'évaluation, le dataset d'attaques et les scripts d'atténuation.
  • Jeu de données ouvert hébergé sur Hugging Face Datasets.
  • Article technique soumis à arXiv et/ou conférence internationale (AAAI, NeurIPS Workshop on AI Safety).
Retour aux projets