Quelle est la performance de votre application d’IA générative ?

9senses Generative AI Audit

Les applications d’IA générative sont désormais omniprésentes – des chatbots destinés aux clients et assistants internes exploitant les connaissances de l’entreprise aux systèmes de retrieval, outils de synthèse et déploiements Copilot.

Parfois, elles fonctionnent remarquablement bien : elles fournissent en quelques secondes des réponses ou des résultats utiles et nous évitent une demi-heure d’attente dans un centre d’appels ou de longues recherches sur le web pour trouver l’information dont nous avons besoin.

Mais il nous arrive tout aussi souvent de nous retrouver face à une application d’IA qui ne comprend pas ce que nous voulons, fournit des résultats peu pertinents ou peu fiables et nous laisse avec l’impression d’avoir perdu un temps précieux avec un outil auquel nos problèmes sont parfaitement indifférents.

C’est dans ce contexte que nous avons développé le 9senses GenAI Audit, un outil standardisé permettant d’évaluer la performance des applications d’IA générative et de la comparer à ce qu’il est techniquement possible d’atteindre. À partir de notre méthodologie soigneusement développée et testée, nous analysons votre application, vous fournissons une évaluation claire et identifions les améliorations possibles.

How the GenAI Audit works

Use case creation
Open internet search
Login-protected access
GenAI Audit
Audit Scope
Variance testing
Translation test
Executive briefing
Delivery time: 5 workdays

01Configure your audit

Select the options that fit for your situation:

  • Use cases developed by us (recommended)
  • Bots with broad scope or access restrictions
  • Variance testing (multiple turns and varied wording)
  • Testing multiple languages
  • Executive debriefing by 9senses

Audit Level 1

Une évaluation externe et indépendante de la performance observable de votre application d’IA générative. Aucun accès à votre environnement technique interne n’est nécessaire. Réalisée sous 5 jours ouvrés.

Audit Level 2

Une analyse approfondie et sur mesure, par exemple de l’architecture technique, des systèmes de retrieval, de la gouvernance, de la conformité et de la valeur métier – recommandée lorsque le Level 1 met en évidence des problèmes critiques.

Level 1 Audits Completed
Avg. Rating
Lowest Rating
Highest Rating
Business Value
1 lowest5 highest

FAQ – Questions fréquentes

Qu’est-ce qu’un GenAI Audit ?

Le GenAI Audit de 9senses est une évaluation indépendante de la performance d’une application d’IA générative en conditions réelles. Nous l’examinons du point de vue de l’utilisateur et vérifions qu’elle remplit de manière fiable l’objectif pour lequel elle a été conçue.

Le GenAI Audit Level 1 est un audit Black-Box standardisé basé sur le 9senses GenAI Audit Framework. Nous testons l’application à partir de cas d’usage convenus et évaluons la Qualité des réponses, la Vitesse, l’Interface utilisateur et la Qualité du dialogue. Vous recevez un rapport structuré qui présente les performances de l’application, ses points forts et ses faiblesses, ainsi que les améliorations à traiter en priorité.

Quels types d’applications d’IA générative 9senses peut auditer ?

9senses peut auditer un large éventail d’applications d’IA générative : chatbots destinés aux clients, assistants IA internes, systèmes de connaissances et de retrieval, implémentations RAG, outils de synthèse, déploiements Microsoft Copilot et autres applications basées sur des LLM.

Le principe reste le même : nous définissons des cas d’usage réalistes à partir de l’usage prévu de l’application, puis en dérivons des cas de test concrets pour évaluer la qualité des résultats produits.

L’audit peut donc s’appliquer à des applications destinées aux clients, aux collaborateurs ou à des groupes d’utilisateurs spécialisés, qu’elles soient conversationnelles ou intégrées à un processus plus large.

Que comprend le GenAI Audit Level 1 ?

Le GenAI Audit Level 1 est un audit Black-Box de la performance observable. Nous interagissons avec l’application comme le ferait un utilisateur réel, sans avoir besoin d’accéder au modèle sous-jacent, aux prompts, à l’architecture de retrieval, aux systèmes sources ni aux autres composants techniques internes.

L’audit commence par un briefing et un ensemble convenu de cas d’usage. Nous en dérivons des cas de test concrets, exécutons le jeu de tests convenu et évaluons l’application selon le 9senses GenAI Audit Framework : Qualité des réponses, Vitesse, Interface utilisateur et Qualité du dialogue. Un Test de traduction peut être ajouté si nécessaire.

Vous recevez un rapport structuré avec des scores, des constats et des recommandations d’amélioration priorisées.

Voir un exemple d’audit Level 1

Comment le GenAI Audit détecte-t-il les hallucinations et les autres risques ?

Les hallucinations – c’est-à-dire la production de contenus invalides ou inventés – présentent un risque important pour la réputation et la conformité. Dans le cadre de la Qualité des réponses, l’audit comprend donc des tests ciblés de résistance aux hallucinations.

Nous introduisons volontairement des références invalides, des fautes d’orthographe et des prompts ambigus afin de vérifier si l’application invente des informations ou demande au contraire des précisions. Nous examinons également la validation des entités, l’ancrage des réponses dans les sources (grounding) et la logique d’escalade.

Lorsque les Tests de variabilité sont sélectionnés, nous répétons et reformulons aussi les prompts afin d’évaluer la constance des réponses lorsque les utilisateurs expriment essentiellement la même demande de différentes manières.

Le GenAI Audit évalue-t-il aussi la conformité, par exemple au règlement européen sur l’IA et au RGPD ?

Le Level 1 comprend une première évaluation externe des indicateurs observables de conformité et de transparence, notamment l’indication qu’il s’agit d’une IA, les éléments de l’interface utilisateur pertinents au regard du RGPD et l’accessibilité.

Une analyse réglementaire et de gouvernance complète – comprenant l’examen de la documentation et de l’architecture – peut faire partie d’un audit Level 2 sur mesure.

De quelles informations 9senses a besoin et combien de temps dure l’audit ?

Nous avons besoin d’un contexte suffisant pour comprendre ce que l’application doit faire, qui l’utilise et ce que signifie une bonne performance dans ce contexte précis.

Pour l’audit standard, vous nous fournissez un bref briefing et 3 à 5 cas d’usage pertinents représentant des situations réalistes que l’application doit savoir gérer. Si vous ne choisissez pas l’option Création de cas d’usage, nous vous fournissons un formulaire pour saisir vos cas d’usage. Si vous choisissez cette option, nous développons à partir de votre briefing 3 à 5 cas d’usage réalistes et pertinents pour votre activité, puis vous les envoyons pour validation avant les tests.

Pour les applications accessibles au public, nous avons besoin d’un accès à l’application en production. Pour les applications protégées par authentification, nous avons également besoin des accès de test nécessaires. Lorsque l’audit s’appuie sur des connaissances internes ou d’autres sources définies, nous avons en plus besoin d’un accès à l’application ainsi qu’à la base de connaissances ou aux sources de référence qu’elle utilise, afin de vérifier la pertinence des réponses et leur grounding.

Le GenAI Audit Level 1 est réalisé sous 5 jours ouvrés à compter de la réception du briefing, des cas d’usage convenus et, le cas échéant, des informations d’accès nécessaires. Si vous choisissez la Création de cas d’usage, prévoyez 2 jours ouvrés supplémentaires pour leur élaboration et leur validation.

Comment 9senses garantit-il la confidentialité ?

Tous les travaux et livrables liés à l’audit sont traités de manière confidentielle. Les rapports et constats ne sont partagés qu’avec le client. Seuls les résultats numériques de l’audit sont utilisés pour alimenter le benchmark des meilleures performances.

Quelles options puis-je ajouter au GenAI Audit Level 1 ?

Le GenAI Audit Level 1 peut être adapté à la configuration technique et au contexte métier de votre application. En complément de l’audit de base, vous pouvez choisir les options suivantes :

  • Création de cas d’usage
    Nous développons à partir de votre briefing 3 à 5 cas d’usage réalistes et pertinents pour votre activité, puis vous les envoyons pour validation avant les tests. Cette option convient si vous ne disposez pas encore de cas de test structurés.
  • Recherche sur le web ouvert
    Pour les applications qui récupèrent des informations sur des sites externes ou via des moteurs de recherche. Nous évaluons la cohérence des sources, le grounding et l’exposition accrue aux hallucinations.
  • Accès avec authentification
    Pour les applications accessibles uniquement après connexion, par exemple des portails clients ou des systèmes internes pour collaborateurs. Cette option permet d’évaluer l’application dans des environnements authentifiés et des parcours liés à des rôles spécifiques.
  • Tests de variabilité
    Nous testons deux fois le même prompt utilisateur initial afin d’identifier les variations, puis ajoutons une version reformulée du prompt d’origine pour éprouver la constance des réponses.
  • Test de traduction
    Comprend la vérification structurée d’une langue supplémentaire, en mettant l’accent sur la cohérence, le comportement lors des changements de langue et la qualité de la traduction.
  • Briefing de direction
    Une présentation structurée des résultats au niveau de la direction. Nous traduisons les résultats de l’audit en priorités de décision, implications en matière de risques et prochaines étapes concrètes.

Ces options permettent d’adapter le GenAI Audit à la configuration de votre application, à son profil de risque et à vos exigences de gouvernance.

Quelle est la différence entre le Level 1 et le Level 2, et quand le Level 2 est-il recommandé ?

Un GenAI Audit Level 1 est un audit Black-Box centré sur la performance observable du point de vue de l’utilisateur. Il ne nécessite aucun accès à l’environnement technique sous-jacent et fournit rapidement une évaluation indépendante de la performance de l’application.

Un audit Level 2 est un audit Open-Book adapté aux questions ou problèmes qui nécessitent une analyse plus approfondie. À partir d’informations internes détaillées, il peut examiner notamment l’architecture technique de l’application, les systèmes de retrieval/RAG, la gouvernance, la conformité, la gestion des risques et la modélisation de la valeur métier.

Le Level 2 est recommandé lorsqu’un audit Level 1 met en évidence des problèmes qui nécessitent une analyse plus approfondie – par exemple un score inférieur à 3,5 en Qualité des réponses ou en Qualité du dialogue pour une application très visible auprès des utilisateurs. Il convient également aux applications stratégiquement importantes ou aux systèmes destinés à des groupes d’utilisateurs définis, comme des clients ou des collaborateurs, lorsque les risques métier ou réglementaires sont significatifs.