Qualität und Geschäftsbeitrag von KI sicherstellen

Generative AI Audit Framework

Das 9senses GenAI Audit Framework ist eine strukturierte Methodik, mit der wir bewerten, wie gut ein Generative-AI-System in realen Geschäftssituationen funktioniert – und wie sicher, verantwortungsvoll und zuverlässig es sich aus Nutzer-, Governance- und Risikoperspektive verhält. Das Framework verbindet die Bewertung konkreter Use Cases, des Geschäftsbeitrags und standardisierter Qualitätsdimensionen und zeigt, wo gezielte Verbesserungen ansetzen können.

Das Framework umfasst zwei Audit-Level: Level 1 als Black-Box-Bewertung des beobachtbaren Verhaltens und Level 2 als Open-Book-Analyse von Architektur, Retrieval-/RAG-Pipelines, Agenten-Orchestrierung, Governance, Compliance, Ethik und Business-Value-Modellierung. Es ist auf das gesamte Spektrum von GenAI-Anwendungen anwendbar – von kundenorientierten KI-Assistenten über interne Copilots und Dokumentenverarbeitung bis hin zu mehrstufigen autonomen Agenten.

Level 1 Audit

Eine unabhängige, externe Prüfung der beobachtbaren Leistung Ihrer GenAI-Anwendung. Kein Zugang zu Ihrer internen technischen Umgebung erforderlich. Durchführung innerhalb von 5 Arbeitstagen.

Level 2 Audit

Eine maßgeschneiderte vertiefte Analyse, zum Beispiel von technischer Architektur, Retrieval-Systemen, Governance, Compliance und Business Value – empfohlen, wenn Level 1 gravierende Probleme aufzeigt.

→ Unverbindlich anfragen

Warum ist ein Generative AI Audit sinnvoll?

Generative-AI-Anwendungen werden zunehmend in geschäftskritischen Abläufen eingesetzt – im Kundenservice, Vertrieb, Rechtsbereich, HR oder operativen Geschäft. Fehler können Reputationsschäden, regulatorische Risiken oder finanzielle Folgen verursachen. Ein strukturiertes GenAI Audit macht Schwächen frühzeitig sichtbar und prüft, ob die Anwendung ihren vorgesehenen Zweck erfüllt und einen messbaren Geschäftsbeitrag leistet.

Das Framework betrachtet dabei fünf Bereiche:

  • Praxisrelevanz: Funktioniert die Anwendung zuverlässig in den Situationen, für die sie entwickelt wurde?
  • Geschäftsbeitrag: Verbessert die Anwendung relevante Kennzahlen wie Containment, Conversion, Lösungszeit, Kosteneffizienz oder Zufriedenheit?
  • Risiken: Halluziniert die Anwendung, gibt sie sensible Daten preis oder versagt sie bei adversarial Prompts?
  • Governance: Sind Transparenz, Human-in-the-Loop-Kontrollen, Eskalationswege und Monitoring angemessen umgesetzt?
  • Regulatorische Anforderungen: Entspricht die Anwendung den anwendbaren Anforderungen des EU AI Act, der DSGVO und branchenspezifischen Vorgaben?

Wie gut ist Ihr Chatbot?

The 9senses Chatbot Audit evaluates the performance of your chatbot from a user perspective.

Mit Eliza reden

Talk to Joseph Weizenbaum's Eliza in a replica of the 1966 version.

Wie wir uns mit generativer KI selbst bestehlen

Wenn wir mit generativer KI neue Inhalte erstellen, schöpfen wir aus dem Wissen vergangener Generationen. Aber wer baut dieses Wissen für die nächste Generation wieder auf?

KI-Chatbots in der Automobilindustrie – große Versprechen, ernüchternde Realität

9senses-Analyse: Nur 16 von 129 untersuchten Herstellern und großen Händlern in der DACH-Region setzen auf KI-Chatbots im Kundenservice – mit großer Qualitätsstreuung

Die verlorene Generation

KI erspart uns die mühevolle Arbeit auf dem Weg zu intellektueller Kompetenz. Die Rechnung dafür bekommen wir in der Zukunft, wenn wir niemanden mehr finden, der die Experten von heute ersetzen kann.

Die KI-Feedback-Lotterie

Große Sprachmodelle bewerten Dinge jedes Mal anders, wenn wir sie um Feedback bitten. Diese KI-Eigenart wird zur grundlegenden Herausforderung, wenn wir Ideen entwickeln und überprüfen wollen.

Der neue Baron von Münchhausen

Halluzinationen treten nicht zufällig auf - sondern genau dort, wo man sie am wenigsten erkennen kann.

Lost in Translation

Im Bereich der dialogorientierten KI dominiert die englische Sprache, was für andere Sprachen schwerwiegende strukturelle Folgen hat, die nur mit erheblichem Aufwand behoben werden können.

  • Wie gut ist Ihr Chatbot?
    The 9senses Chatbot Audit evaluates the performance of your chatbot from a user perspective.
  • Mit Eliza reden
    Talk to Joseph Weizenbaum's Eliza in a replica of the 1966 version.
  • Wie wir uns mit generativer KI selbst bestehlen
    Wenn wir mit generativer KI neue Inhalte erstellen, schöpfen wir aus dem Wissen vergangener Generationen. Aber wer baut dieses Wissen für die nächste Generation wieder auf?
  • KI-Chatbots in der Automobilindustrie – große Versprechen, ernüchternde Realität
    9senses-Analyse: Nur 16 von 129 untersuchten Herstellern und großen Händlern in der DACH-Region setzen auf KI-Chatbots im Kundenservice – mit großer Qualitätsstreuung
  • Die verlorene Generation
    KI erspart uns die mühevolle Arbeit auf dem Weg zu intellektueller Kompetenz. Die Rechnung dafür bekommen wir in der Zukunft, wenn wir niemanden mehr finden, der die Experten von heute…
  • Die KI-Feedback-Lotterie
    Image by Waldemar Brandt on www.unslplash.comGroße Sprachmodelle bewerten Dinge jedes Mal anders, wenn wir sie um Feedback bitten. Diese KI-Eigenart wird zur grundlegenden Herausforderung, wenn wir Ideen entwickeln und überprüfen wollen.
  • Der neue Baron von Münchhausen
    Halluzinationen treten nicht zufällig auf - sondern genau dort, wo man sie am wenigsten erkennen kann.
  • Lost in Translation
    Image by Joachim Schnürle on Unsplash.comIm Bereich der dialogorientierten KI dominiert die englische Sprache, was für andere Sprachen schwerwiegende strukturelle Folgen hat, die nur mit erheblichem Aufwand behoben werden können.
First page of a sample 9senses Level 1 audit report

Level 1: Black-Box-Audit

Level 1 ist eine standardisierte externe Bewertung des zum Testzeitpunkt beobachtbaren Verhaltens. Sie zeigt, wie die Anwendung aus Nutzersicht abschneidet, macht Schwächen sichtbar und liefert priorisierte Empfehlungen – ohne Zugriff auf das zugrunde liegende System.

Bewertungsdimensionen und Gewichtung

Dimension Was wird bewertet? Gewichtung
Antwortqualität Relevanz für das Nutzerziel, sachliche Richtigkeit, Vollständigkeit, Formatierung, Robustheit gegenüber Halluzinationen und Umgang mit Quellenangaben 50 %
Geschwindigkeit Latenz bei einfachen und komplexen Anfragen, Streaming-Verhalten und wahrgenommene Geschwindigkeit unter Last 20 %
User Interface Klarheit, Bedienbarkeit, Layout, Lesbarkeit, Verständlichkeit der Bedienelemente und Hinweise zur Barrierefreiheit 15 %
Dialogqualität Gesprächsfluss, Erwartungsmanagement, angemessener Ton, Kohärenz über mehrere Interaktionen und Eskalationsverhalten 15 %

Zusätzlich betrachten wir Business Value, Compliance und Ethik. Diese Bereiche fließen nicht in den Level-1-Gesamtscore ein, ergänzen aber die qualitative Bewertung und zeigen Themen auf, die in Level 2 vertieft untersucht werden sollten.

Bewertungsmethodik

Jede Dimension wird auf einer standardisierten Skala von 1–5 bewertet und entsprechend ihrer Gewichtung zu einem Gesamtscore zusammengeführt. So lassen sich die Ergebnisse konsistent vergleichen.

Score Bedeutung
1 Kritischer Mangel mit starken Auswirkungen auf die Nutzung oder erheblichen Risiken
2 Deutliche Schwächen mit klarem Verbesserungsbedarf
3 Akzeptable Leistung mit erkennbaren Einschränkungen
4 Gute Leistung mit kleineren Schwächen
5 Sehr gute Leistung auf Benchmark-Niveau

Level 2: Open-Book-Audit

Level 2 geht einen Schritt weiter und untersucht, warum sich ein GenAI-System so verhält, wie es sich verhält. Dafür betrachten wir die technischen und organisatorischen Strukturen hinter der Anwendung. Das Ergebnis ist ein gezielter Maßnahmenplan, der an den Ursachen ansetzt und nicht nur an den sichtbaren Symptomen.

Umfang und Ergebnisse des Open-Book-Audits

Bereich Was wir prüfen (Beispiele) Typische Ergebnisse
Architektur & Orchestrierung Systemgrenzen, Nutzung von Tools und APIs, Routing, Fallback-Strategien, Agenten-Logik und technische Abhängigkeiten Priorisierte Architekturmaßnahmen; robusteres Routing und Fallback-Design
Retrieval / RAG Chunking, Relevanz der abgerufenen Inhalte, Grounding, Quellenlogik, Umgang mit Kontext und veralteten Inhalten Verbesserungen an Retrieval und Grounding; höhere Antwortqualität
Prompting & Guardrails System-Prompts, Policy-Hierarchie, Umgang mit Ablehnungen, Berechtigungen, Prompt Injection und Output-Filter Robustere Prompts und Policies; geringeres Manipulationsrisiko
Security & Datenschutz Zugriffskontrollen, Umgang mit vertraulichen Daten, Datenminimierung, mögliche Datenlecks und sensible Logging-Inhalte Maßnahmenplan für Security und Datenschutz; verbesserte Kontrollen
Governance & Betrieb Verantwortlichkeiten, Human-in-the-Loop, Eskalationswege, Monitoring, Incident Response, regelmäßige Evaluation und Change Management Klare Verantwortlichkeiten; belastbares Betriebs- und Monitoring-Modell
Compliance & Ethik Transparenz, Kennzeichnung, Datenverarbeitung, Fairness, Risikoklassifizierung nach EU AI Act und Anforderungen regulierter Use Cases Maßnahmen für Compliance Readiness; verbesserte Dokumentation und Policies
Business-Value-Modellierung KPIs, Ausgangslage und Zielwerte, Messbarkeit, laufende Kosten und Sensitivität des Business Case Business Case; KPI- und Kostenmodell; priorisierte Roadmap

Methodische Grundsätze

  • Maßstab: Entscheidend ist, ob die Anwendung in ihrem konkreten Einsatz funktioniert und einen substanziellen Geschäftsbeitrag leistet.
  • Anwendungsbereich: Das Framework lässt sich auf unterschiedliche Generative-AI-Anwendungen anwenden – von kundenorientierten KI-Assistenten und internen Copilots über Wissens- und Retrieval-Systeme bis hin zu Dokumentenverarbeitung, Multi-Agenten-Systemen und hybriden Mensch-KI-Workflows.