Diesen Beitrag anhören
Die KI-Feedback-Lotterie
Große Sprachmodelle bewerten Dinge jedes Mal anders, wenn wir sie um Feedback bitten. Diese KI-Eigenart wird zur grundlegenden Herausforderung, wenn wir Ideen entwickeln und überprüfen wollen.
Stellen Sie sich vor, Sie haben wochenlang an einem Businessplan gearbeitet. Sie zeigen ihn einem KI-Assistenten, und dieser lobt ihn in den höchsten Tönen: „Das ist ein überzeugendes, gut strukturiertes Konzept – Sie können loslegen.“ Voller Tatendrang schließen Sie das Chatfenster und machen sich an die Arbeit. Ein paar Tage später überkommt Sie die Neugier. Sie eröffnen eine neue Unterhaltung, fügen genau denselben Plan mit genau derselben Eingabe ein und warten. Diesmal lautet das Urteil ganz anzders: „Hier gibt es erhebliche strukturelle Schwächen. Die Marktanalyse ist unzureichend, die Finanzprognosen beruhen auf ungetesteten Annahmen und die Value Proposition sollte grundlegend überdacht werden.“
Das genau gleiche Dokument. Die gleiche Frage. Zwei praktisch gegensätzliche Meinungen.
Das ist kein Fehler. Es handelt sich um eine der am meisten unterschätzten strukturellen Tatsachen bei der Arbeit mit großen Sprachmodellen – und sie hat reale Konsequenzen für jeden, der KI als kreativen Berater oder als Sparringspartner für seine Ideen nutzt.
Sprachmodelle haben keine stabile Meinung
Ein großes Sprachmodell vertritt keine festen Meinungen, wie es ein menschlicher Mitarbeiter tut. Jede Antwort wird neu auf der Grundlage von Wahrscheinlichkeiten generiert, die sich aus dem aktuellen Gesprächskontext ergeben. Wenn Sie die Sitzung löschen, geht das Modell Ihre Arbeit wieder von Grund auf neu an – was bedeutet, dass dieselbe Eingabeaufforderung über verschiedene Sitzungen hinweg zu erheblich unterschiedlichen Einschätzungen führen kann, insbesondere bei subjektiven oder kreativen Aufgaben.
Beide Antworten stammen aus demselben Modell. Beide sind schlüssig, gut begründet und überzeugend verfasst. Keiner der beiden lügt. Aber sie können auch nicht beide recht haben – und dennoch wird das Modell jede Position mit gleicher Gewandtheit verteidigen, wenn man es darum bittet. Technisch gesehen ruft das Modell keine festgelegte Bewertung ab, die irgendwo intern gespeichert ist. Selbst bei identischer Eingabebefehlsfolge beinhaltet jede Generierung eine probabilistische Token-Auswahl, bei der mehrere plausible Fortsetzungen miteinander konkurrieren und kleine statistische Unterschiede zu unterschiedlichen Gesamtantworten führen. In kreativen Bereichen – wo es keine einzige richtige Antwort gibt – können diese Verzweigungswahrscheinlichkeiten dazu führen, dass das Modell in einer Sitzung Begeisterung zeigt und in einer anderen grundlegende Skepsis.
J.K. Rowling und der Zufall
Als J.K. Rowling das erste Manuskript zu „Harry Potter“ fertiggestellt hatte, erhielt sie zwölf Rückmeldungen professioneller Verlagslektoren, und jede einzelne war eine Absage. Die Geschichte, die zu einer der erfolgreichsten Kinderbuchreihen der letzten Jahrzehnte werden sollte, war nach einhelliger Meinung der Experten nicht veröffentlichungswürdig.
Nach zwölf Absagen schickte J.K. Rowling ihr Manuskript übrigens ein dreizehntes Mal ein, was schließlich den Weg für die erfolgreiche Veröffentlichung von „Harry Potter und der Stein der Weisen“ im Jahr 1997 ebnete.
Die Lektoren trafen sicherlich fundierte, auf Erfahrung basierende Entscheidungen – doch diese Entscheidungen wurden auch von der Stimmung der Leser, den aktuellen Vorlieben des Verlags, der persönlichen Verfassung des Lektors an jenem Tag und tausend anderen unbekannten Variablen beeinflusst. Die Beurteilung kreativer Werke war im Kern schon immer ein probabilistischer Prozess. Die KI hat dieses probabilistische Chaos lediglich reibungslos gemacht und von der Realität losgelöst.
Drei Möglichkeiten, für den Umgang mit KI-Feedback
Wenn Sie im Rahmen kreativer Projekte auf Unstimmigkeiten im KI-Feedback stoßen, gibt es drei Möglichkeiten, darauf zu reagieren, und nur eine davon führt zu einem effizienten Evaluierungsprozess. Dazu muss man wissen, was das Tool ist – und was nicht.
Rowling blieb nichts anderes übrig, als zwölf Urteile hinzunehmen wie zwölf Lose aus derselben Trommel. Bei der KI ziehen Sie selbst – die Frage ist, was Sie mit den Losen anfangen.
Wie nutzt man KI als kreativen Partner?
All das heißt nicht, dass KI-Feedback wertlos wäre. Eine einzelne Sitzung kann blinde Flecken aufdecken, unklare Passagen identifizieren, Alternativen vorschlagen, auf die Sie nicht gekommen wären, und Sie zu einer ausgereifteren Version Ihrer Idee führen.
The real leverage, though, comes from using the statistical distribution to your advantage. Ask the model the same question three times in three fresh sessions, and you get something no single answer can give you: a distribution. Where all three runs agree – in praise or in criticism – you are probably looking at a genuine property of your work. Where they contradict each other, you have found the places where reasonable judges could disagree, which is exactly where your own judgment is needed. If you want, you can hand the comparison work back to the model and let it map the agreements and contradictions for you.
Die Lotterie hört nicht auf, eine Lotterie zu sein. Aber wer weiß, dass er es mit einer zu tun hat, hält ein einzelnes Los nicht mehr für ein Urteil – sondern beginnt, die Chancen zu lesen. Ihr Businessplan hat mindestens drei Lose verdient.
