Approche
Les classiques n'ont pas disparu, il y en a de nouveaux
Auditer une application basée sur un LLM combine les méthodologies de test applicatif classiques (validation des entrées, contrôle d'accès, autorisation multi-tenant) avec des techniques spécifiques à l'IA générative : injection de prompt directe ou indirecte, tentatives de jailbreak, extraction d'instructions système, et abus des capacités données au modèle (exécution de code, accès à des API internes, mémoire d'agent).
Les vulnérabilités client-side historiques (XSS, injection) ne disparaissent pas avec l'IA générative : un rendu non assaini d'une sortie de modèle reste une XSS classique.
Cas emblématiques
Le type de faille recherchée ici
Bing Chat « Sydney » — extraction du prompt système
En février 2023, un étudiant de Stanford a extrait le prompt système confidentiel de Bing Chat par simple injection de prompt, révélant le nom de code interne et les règles de modération — largement repris par la presse tech internationale.
ChatGPT — fuite de conversations via un bug de cache
En mars 2023, un bug de cache Redis a exposé des titres de conversation et des informations de facturation partielles d'autres utilisateurs — incident officiellement reconnu et documenté par OpenAI.
Injection de prompt indirecte via document ingéré
Une classe de vulnérabilité largement documentée (recherches publiques dont celles de Simon Willison) : un agent qui résume un document ou un email externe peut exécuter des instructions cachées dans ce contenu, sans que l'utilisateur ne rédige lui-même le prompt malveillant.
Chatbot concessionnaire détourné pour vendre un véhicule à 1$
En 2023, le chatbot IA d'un concessionnaire automobile américain a été manipulé par injection de prompt pour accepter contractuellement la vente d'un véhicule à 1 dollar — incident viral illustrant le risque d'un agent aux permissions mal cadrées.
Fuite du prompt système de GPT personnalisés
Des chercheurs ont démontré à plusieurs reprises qu'il suffisait de demander avec insistance à un GPT personnalisé pour qu'il révèle ses instructions système confidentielles et parfois les documents fournis en contexte.
Exfiltration de données via appel d'outil non validé
Un agent disposant d'un outil d'accès réseau (navigation web, appel d'API) peut être manipulé pour transmettre des données sensibles du contexte vers un domaine contrôlé par l'attaquant, si l'appel d'outil n'est pas validé côté application.
Autres prestations
Prêt à savoir ce qu'un attaquant verrait de vous ?
Discutons de votre application, de votre calendrier, et de ce qu'un test d'intrusion peut couvrir.