Wie gut ist Ihre GenAI-Anwendung?
9senses Generative AI Audit
Mittlerweile sind Generative-AI-Anwendungen allgegenwärtig – von kundenorientierten Chatbots und internen Wissensassistenten bis hin zu Retrieval-Systemen, Zusammenfassungstools und Copilot-Implementierungen.
Manchmal funktionieren sie erstaunlich gut, indem sie innerhalb weniger Sekunden wertvolle Antworten oder Ergebnisse liefern und uns so eine halbe Stunde in der Warteschleife eines Callcenters oder die mühsame Websuche nach benötigten Informationen ersparen.
Oft geraten wir leider auch an eine KI-Anwendung, die unsere Bedürfnisse nicht versteht, irrelevante oder unzuverlässige Ergebnisse liefert und uns am Ende mit dem Gefühl zurücklässt, wertvolle Zeit mit einem Tool verschwendet zu haben, dem unsere Probleme völlig egal sind.
Vor diesem Hintergrund haben wir das 9senses GenAI Audit entwickelt, ein standardisiertes Tool zur Prüfung der Performance von GenAI-Anwendungen im Vergleich zu dem, was technisch möglich ist. Auf Basis unserer sorgfältig entwickelten und getesteten Methodik analysieren wir Ihre Anwendung, liefern Ihnen eine klar verständliche Bewertung und zeigen Verbesserungsmöglichkeiten auf.
Level 1 Audit
Eine unabhängige, externe Prüfung der beobachtbaren Leistung Ihrer GenAI-Anwendung. Kein Zugang zu Ihrer internen technischen Umgebung erforderlich. Durchführung innerhalb von 5 Arbeitstagen.
Level 2 Audit
Eine maßgeschneiderte vertiefte Analyse, zum Beispiel von technischer Architektur, Retrieval-Systemen, Governance, Compliance und Business Value – empfohlen, wenn Level 1 gravierende Probleme aufzeigt.
→ Unverbindlich anfragen
FAQs - Häufige Fragen und Antworten
Was ist ein GenAI Audit?
Ein 9senses GenAI Audit ist eine unabhängige Bewertung, wie gut eine Generative-AI-Anwendung im realen Einsatz funktioniert. Wir betrachten die Anwendung aus Nutzersicht und prüfen, ob sie ihren vorgesehenen Zweck zuverlässig erfüllt.
Das Level 1 GenAI Audit ist ein standardisiertes Black-Box-Audit auf Basis des 9senses GenAI Audit Frameworks. Wir testen die Anwendung anhand abgestimmter Use Cases und bewerten Antwortqualität, Geschwindigkeit, User Interface und Dialogqualität. Das Ergebnis ist ein strukturierter Bericht, der zeigt, wie die Anwendung abschneidet, wo ihre Stärken und Schwächen liegen und welche Verbesserungen priorisiert werden sollten.
Welche Arten von GenAI-Anwendungen kann 9senses auditieren?
9senses kann ein breites Spektrum an Generative-AI-Anwendungen prüfen, darunter kundenorientierte Chatbots, interne KI-Assistenten, Wissens- und Retrieval-Systeme, RAG-Implementierungen, Zusammenfassungstools, Microsoft-Copilot-Implementierungen und andere LLM-basierte Anwendungen.
Das Grundprinzip ist immer dasselbe: Wir definieren realistische Use Cases auf Basis des vorgesehenen Einsatzes der Anwendung und leiten daraus konkrete Testfälle ab, mit denen wir die Qualität der Ergebnisse bewerten.
Das Audit eignet sich damit für Anwendungen, die Kunden, Mitarbeitende oder spezialisierte Nutzergruppen unterstützen – unabhängig davon, ob sie dialogbasiert oder in einen größeren Workflow eingebettet sind.
Was umfasst das Level 1 GenAI Audit?
Das Level 1 GenAI Audit ist ein Black-Box-Audit der beobachtbaren Leistung. Wir interagieren mit der Anwendung so, wie es reale Nutzende tun würden, ohne Zugriff auf das zugrunde liegende Modell, Prompts, die Retrieval-Architektur, Quellsysteme oder andere interne technische Komponenten zu benötigen.
Das Audit beginnt mit einem Briefing und einem abgestimmten Set von Use Cases. Daraus leiten wir konkrete Testfälle ab, führen das abgestimmte Testset durch und bewerten die Anwendung anhand des 9senses GenAI Audit Frameworks in den Dimensionen Antwortqualität, Geschwindigkeit, User Interface und Dialogqualität. Bei Bedarf kann zusätzlich ein Übersetzungstest gebucht werden.
Sie erhalten einen strukturierten Bericht mit Scores, Ergebnissen und priorisierten Empfehlungen für Verbesserungen.
Wie erkennt das GenAI Audit Halluzinationen und andere Risiken?
Halluzinationen – also ungültige oder erfundene Inhalte – stellen ein erhebliches Reputations- und Compliance-Risiko dar. Im Rahmen der Antwortqualität führen wir deshalb gezielte Stresstests auf Halluzinationen durch.
Wir verwenden bewusst ungültige Referenzen, Rechtschreibfehler und mehrdeutige Prompts, um zu prüfen, ob die Anwendung Informationen erfindet oder stattdessen Rückfragen stellt. Dabei betrachten wir auch die Validierung von Entitäten, das Grounding-Verhalten und die Eskalationslogik.
Wenn Varianztests gebucht sind, wiederholen und variieren wir Prompts zusätzlich, um zu prüfen, wie konsistent die Anwendung reagiert, wenn Nutzende im Wesentlichen dieselbe Anfrage unterschiedlich formulieren.
Prüft das GenAI Audit auch Compliance, zum Beispiel EU AI Act und DSGVO?
Level 1 umfasst eine erste externe Prüfung beobachtbarer Compliance- und Transparenzindikatoren, beispielsweise hinsichtlich KI-Kennzeichnung, DSGVO-relevanter Elemente im User Interface und Barrierefreiheit.
Eine umfassende regulatorische und Governance-Prüfung – einschließlich Dokumentations- und Architekturanalyse – kann Teil eines maßgeschneiderten Level 2 Audits sein.
Welche Informationen benötigt 9senses, und wie lange dauert das Audit?
Wir benötigen ausreichend Kontext, um zu verstehen, was die Anwendung leisten soll, wer sie nutzt und was in diesem konkreten Einsatz eine gute Leistung ausmacht.
Für das Standard-Audit stellen Sie uns ein kurzes Briefing und 3–5 relevante Use Cases zur Verfügung, die realistische Situationen abbilden, welche die Anwendung bewältigen können sollte. Wenn Sie keine Use-Case-Erstellung buchen, erhalten Sie von uns ein Formular zur Eingabe Ihrer Use Cases. Wenn Sie die Use-Case-Erstellung buchen, entwickeln wir auf Basis Ihres Briefings 3–5 realistische, geschäftsrelevante Use Cases und senden sie Ihnen vor dem Test zur Prüfung und Abstimmung.
Bei öffentlich zugänglichen Anwendungen benötigen wir Zugang zur live verfügbaren Anwendung. Bei zugangsgeschützten Anwendungen benötigen wir zusätzlich die erforderlichen Testzugänge. Wenn das Audit auf internen Wissensbeständen oder anderen definierten Quellen basiert, benötigen wir außerdem Zugang zur Anwendung sowie zu der Wissensbasis oder dem sonstigen Quellenmaterial, das sie nutzt, damit wir Relevanz und Grounding der Antworten überprüfen können.
Das Level 1 GenAI Audit wird innerhalb von 5 Arbeitstagen durchgeführt, sobald uns das Briefing, die abgestimmten Use Cases und gegebenenfalls die erforderlichen Zugangsdaten vorliegen. Wenn Sie die Use-Case-Erstellung buchen, planen Sie bitte 2 zusätzliche Arbeitstage für die Erstellung und Abstimmung unserer vorgeschlagenen Use Cases ein.
Wie stellt 9senses die Vertraulichkeit sicher?
Alle Arbeiten und Ergebnisse im Rahmen des Audits werden vertraulich behandelt. Berichte und Ergebnisse werden ausschließlich mit dem Kunden geteilt. Für das Best-in-Class-Benchmarking werden lediglich numerische Audit-Ergebnisse verwendet.
Welche Optionen kann ich zum Level 1 GenAI Audit hinzubuchen?
Das Level 1 GenAI Audit kann an die technische Ausgestaltung und den geschäftlichen Kontext Ihrer Anwendung angepasst werden. Zusätzlich zum Kern-Audit können Sie folgende Optionen wählen:
- Use-Case-Erstellung
Wir entwickeln auf Basis Ihres Briefings 3–5 realistische, geschäftsrelevante Use Cases und senden sie Ihnen vor dem Test zur Prüfung und Abstimmung. Diese Option eignet sich, wenn Sie noch keine strukturierten Testfälle vorbereitet haben. - Offene Internetsuche
Für Anwendungen, die Informationen von externen Websites oder über Suchmaschinen abrufen. Dabei prüfen wir Quellenkonsistenz, Grounding und das erhöhte Halluzinationsrisiko. - Login-geschützter Zugriff
Für Anwendungen, die nur nach Anmeldung zugänglich sind, beispielsweise Kundenportale oder interne Mitarbeitersysteme. Damit können wir die Anwendung in authentifizierten Umgebungen und rollenbezogenen Abläufen prüfen. - Varianztests
Wir testen denselben initialen Nutzer-Prompt zweimal, um Abweichungen zu erkennen, und ergänzen eine umformulierte Version des Ausgangsprompts, um die Konsistenz der Antworten gezielt zu testen. - Übersetzungstest
Umfasst die strukturierte Prüfung einer zusätzlichen Sprache mit Fokus auf Konsistenz, Verhalten bei Sprachwechseln und Übersetzungsqualität. - Executive Briefing
Eine strukturierte Besprechung der Ergebnisse auf Management-Ebene. Wir ordnen die Audit-Ergebnisse nach Entscheidungsprioritäten, relevanten Risiken und konkreten nächsten Schritten.
Mit diesen Optionen können Sie das GenAI Audit an die Ausgestaltung Ihrer Anwendung, ihr Risikoprofil und Ihre Governance-Anforderungen anpassen.
Was ist der Unterschied zwischen Level 1 und Level 2, und wann ist Level 2 sinnvoll?
Ein Level 1 GenAI Audit ist ein Black-Box-Audit der beobachtbaren Leistung aus Nutzersicht. Es erfordert keinen Zugriff auf die zugrunde liegende technische Umgebung und liefert eine schnelle, unabhängige Einschätzung, wie gut die Anwendung funktioniert.
Ein Level 2 Audit ist ein Open-Book-Audit für Fragestellungen oder Probleme, die eine vertiefte Untersuchung erfordern. Auf Basis detaillierter interner Einblicke können beispielsweise die technische Architektur, Retrieval-/RAG-Systeme, Governance, Compliance, Risikomanagement und Business-Value-Modellierung untersucht werden.
Level 2 ist sinnvoll, wenn ein Level 1 Audit auf Probleme hinweist, die genauer untersucht werden sollten – beispielsweise bei einer Bewertung unter 3,5 in Antwortqualität oder Dialogqualität und hoher Sichtbarkeit der Anwendung. Ebenso eignet sich Level 2 für strategisch wichtige Anwendungen oder Systeme für klar definierte Nutzergruppen wie Kunden oder Mitarbeitende, wenn damit wesentliche geschäftliche oder regulatorische Risiken verbunden sind.
