Qualität und Geschäftsbeitrag von KI sicherstellen
Generative AI Audit Framework
Das 9senses GenAI Audit Framework ist eine strukturierte Methodik, mit der wir bewerten, wie gut ein Generative-AI-System in realen Geschäftssituationen funktioniert – und wie sicher, verantwortungsvoll und zuverlässig es sich aus Nutzer-, Governance- und Risikoperspektive verhält. Das Framework verbindet die Bewertung konkreter Use Cases, des Geschäftsbeitrags und standardisierter Qualitätsdimensionen und zeigt, wo gezielte Verbesserungen ansetzen können.
Das Framework umfasst zwei Audit-Level: Level 1 als Black-Box-Bewertung des beobachtbaren Verhaltens und Level 2 als Open-Book-Analyse von Architektur, Retrieval-/RAG-Pipelines, Agenten-Orchestrierung, Governance, Compliance, Ethik und Business-Value-Modellierung. Es ist auf das gesamte Spektrum von GenAI-Anwendungen anwendbar – von kundenorientierten KI-Assistenten über interne Copilots und Dokumentenverarbeitung bis hin zu mehrstufigen autonomen Agenten.
Level 1 Audit
Eine unabhängige, externe Prüfung der beobachtbaren Leistung Ihrer GenAI-Anwendung. Kein Zugang zu Ihrer internen technischen Umgebung erforderlich. Durchführung innerhalb von 5 Arbeitstagen.
Level 2 Audit
Eine maßgeschneiderte vertiefte Analyse, zum Beispiel von technischer Architektur, Retrieval-Systemen, Governance, Compliance und Business Value – empfohlen, wenn Level 1 gravierende Probleme aufzeigt.
→ Unverbindlich anfragen
Warum ist ein Generative AI Audit sinnvoll?
Generative-AI-Anwendungen werden zunehmend in geschäftskritischen Abläufen eingesetzt – im Kundenservice, Vertrieb, Rechtsbereich, HR oder operativen Geschäft. Fehler können Reputationsschäden, regulatorische Risiken oder finanzielle Folgen verursachen. Ein strukturiertes GenAI Audit macht Schwächen frühzeitig sichtbar und prüft, ob die Anwendung ihren vorgesehenen Zweck erfüllt und einen messbaren Geschäftsbeitrag leistet.
Das Framework betrachtet dabei fünf Bereiche:
- Praxisrelevanz: Funktioniert die Anwendung zuverlässig in den Situationen, für die sie entwickelt wurde?
- Geschäftsbeitrag: Verbessert die Anwendung relevante Kennzahlen wie Containment, Conversion, Lösungszeit, Kosteneffizienz oder Zufriedenheit?
- Risiken: Halluziniert die Anwendung, gibt sie sensible Daten preis oder versagt sie bei adversarial Prompts?
- Governance: Sind Transparenz, Human-in-the-Loop-Kontrollen, Eskalationswege und Monitoring angemessen umgesetzt?
- Regulatorische Anforderungen: Entspricht die Anwendung den anwendbaren Anforderungen des EU AI Act, der DSGVO und branchenspezifischen Vorgaben?
Level 1: Black-Box-Audit
Level 1 ist eine standardisierte externe Bewertung des zum Testzeitpunkt beobachtbaren Verhaltens. Sie zeigt, wie die Anwendung aus Nutzersicht abschneidet, macht Schwächen sichtbar und liefert priorisierte Empfehlungen – ohne Zugriff auf das zugrunde liegende System.
Bewertungsdimensionen und Gewichtung
| Dimension | Was wird bewertet? | Gewichtung |
|---|---|---|
| Antwortqualität | Relevanz für das Nutzerziel, sachliche Richtigkeit, Vollständigkeit, Formatierung, Robustheit gegenüber Halluzinationen und Umgang mit Quellenangaben | 50 % |
| Geschwindigkeit | Latenz bei einfachen und komplexen Anfragen, Streaming-Verhalten und wahrgenommene Geschwindigkeit unter Last | 20 % |
| User Interface | Klarheit, Bedienbarkeit, Layout, Lesbarkeit, Verständlichkeit der Bedienelemente und Hinweise zur Barrierefreiheit | 15 % |
| Dialogqualität | Gesprächsfluss, Erwartungsmanagement, angemessener Ton, Kohärenz über mehrere Interaktionen und Eskalationsverhalten | 15 % |
Zusätzlich betrachten wir Business Value, Compliance und Ethik. Diese Bereiche fließen nicht in den Level-1-Gesamtscore ein, ergänzen aber die qualitative Bewertung und zeigen Themen auf, die in Level 2 vertieft untersucht werden sollten.
Bewertungsmethodik
Jede Dimension wird auf einer standardisierten Skala von 1–5 bewertet und entsprechend ihrer Gewichtung zu einem Gesamtscore zusammengeführt. So lassen sich die Ergebnisse konsistent vergleichen.
| Score | Bedeutung |
|---|---|
| 1 | Kritischer Mangel mit starken Auswirkungen auf die Nutzung oder erheblichen Risiken |
| 2 | Deutliche Schwächen mit klarem Verbesserungsbedarf |
| 3 | Akzeptable Leistung mit erkennbaren Einschränkungen |
| 4 | Gute Leistung mit kleineren Schwächen |
| 5 | Sehr gute Leistung auf Benchmark-Niveau |
Level 2: Open-Book-Audit
Level 2 geht einen Schritt weiter und untersucht, warum sich ein GenAI-System so verhält, wie es sich verhält. Dafür betrachten wir die technischen und organisatorischen Strukturen hinter der Anwendung. Das Ergebnis ist ein gezielter Maßnahmenplan, der an den Ursachen ansetzt und nicht nur an den sichtbaren Symptomen.
Umfang und Ergebnisse des Open-Book-Audits
| Bereich | Was wir prüfen (Beispiele) | Typische Ergebnisse |
|---|---|---|
| Architektur & Orchestrierung | Systemgrenzen, Nutzung von Tools und APIs, Routing, Fallback-Strategien, Agenten-Logik und technische Abhängigkeiten | Priorisierte Architekturmaßnahmen; robusteres Routing und Fallback-Design |
| Retrieval / RAG | Chunking, Relevanz der abgerufenen Inhalte, Grounding, Quellenlogik, Umgang mit Kontext und veralteten Inhalten | Verbesserungen an Retrieval und Grounding; höhere Antwortqualität |
| Prompting & Guardrails | System-Prompts, Policy-Hierarchie, Umgang mit Ablehnungen, Berechtigungen, Prompt Injection und Output-Filter | Robustere Prompts und Policies; geringeres Manipulationsrisiko |
| Security & Datenschutz | Zugriffskontrollen, Umgang mit vertraulichen Daten, Datenminimierung, mögliche Datenlecks und sensible Logging-Inhalte | Maßnahmenplan für Security und Datenschutz; verbesserte Kontrollen |
| Governance & Betrieb | Verantwortlichkeiten, Human-in-the-Loop, Eskalationswege, Monitoring, Incident Response, regelmäßige Evaluation und Change Management | Klare Verantwortlichkeiten; belastbares Betriebs- und Monitoring-Modell |
| Compliance & Ethik | Transparenz, Kennzeichnung, Datenverarbeitung, Fairness, Risikoklassifizierung nach EU AI Act und Anforderungen regulierter Use Cases | Maßnahmen für Compliance Readiness; verbesserte Dokumentation und Policies |
| Business-Value-Modellierung | KPIs, Ausgangslage und Zielwerte, Messbarkeit, laufende Kosten und Sensitivität des Business Case | Business Case; KPI- und Kostenmodell; priorisierte Roadmap |
Methodische Grundsätze
- Maßstab: Entscheidend ist, ob die Anwendung in ihrem konkreten Einsatz funktioniert und einen substanziellen Geschäftsbeitrag leistet.
- Anwendungsbereich: Das Framework lässt sich auf unterschiedliche Generative-AI-Anwendungen anwenden – von kundenorientierten KI-Assistenten und internen Copilots über Wissens- und Retrieval-Systeme bis hin zu Dokumentenverarbeitung, Multi-Agenten-Systemen und hybriden Mensch-KI-Workflows.
The 9senses Chatbot Audit evaluates the performance of your chatbot from a user perspective.
Wenn wir mit generativer KI neue Inhalte erstellen, schöpfen wir aus dem Wissen vergangener Generationen. Aber wer baut dieses Wissen für die nächste Generation wieder auf?
9senses-Analyse: Nur 16 von 129 untersuchten Herstellern und großen Händlern in der DACH-Region setzen auf KI-Chatbots im Kundenservice – mit großer Qualitätsstreuung
KI erspart uns die mühevolle Arbeit auf dem Weg zu intellektueller Kompetenz. Die Rechnung dafür bekommen wir in der Zukunft, wenn wir niemanden mehr finden, der die Experten von heute…
Große Sprachmodelle bewerten Dinge jedes Mal anders, wenn wir sie um Feedback bitten. Diese KI-Eigenart wird zur grundlegenden Herausforderung, wenn wir Ideen entwickeln und überprüfen wollen.
Halluzinationen treten nicht zufällig auf - sondern genau dort, wo man sie am wenigsten erkennen kann.
Im Bereich der dialogorientierten KI dominiert die englische Sprache, was für andere Sprachen schwerwiegende strukturelle Folgen hat, die nur mit erheblichem Aufwand behoben werden können.