
Nachdem ich von einer neuen Studie über KI-generierte Kurzgeschichten gelesen hatte, wollte ich nicht nur drüber schreiben. Ich wollte ausprobieren, was ChatGPT tatsächlich kann.
Also gab ich der KI einen Auftrag: eine Kriminalgeschichte im klassischen amerikanischen Stil. Kalifornien, Ende der vierziger Jahre. Ein Privatdetektiv namens Michael McDonald fährt in den Urlaub. Auf dem Highway läuft ihm ein angeschossener Mann vors Auto. Die örtliche Polizei behandelt den Toten als Unfallopfer. McDonald beginnt zu ermitteln und stößt auf ein Netz aus Drogenschmuggel, Korruption und Mord.
Ich legte Schauplatz, Hauptfigur, Handlung, Grundton und Länge fest. Außerdem wollte ich Sarkasmus, schwarzen Humor, spannende Dialoge und einen Detektiv, dessen Menschenbild bei aller Härte von Empathie geprägt ist.
ChatGPT schrieb daraus die Kurzgeschichte »Die Straße nach Westen«.
Anschließend bat ich die KI, ihren eigenen Text kritisch zu prüfen. Sie fand einige Schwächen: eine historisch falsche Behördenzuständigkeit, einen Widerspruch bei der Schussverletzung, einen plötzlich auftauchenden Lastwagenfahrer und einen zu blassen Gegenspieler. ChatGPT überarbeitete die Geschichte selbst.
Ich habe danach kein Wort mehr geändert. Nicht, weil ich nichts zu ändern gefunden hätte. Im Gegenteil. An einigen Stellen hätte ich gekürzt, an anderen den Dialog weniger glatt gemacht und manche Formulierung gegen eine weniger gefällige ausgetauscht. Aber dann wäre es nicht mehr das Experiment gewesen.
»Die Straße nach Westen« lesen – vollständig von ChatGPT formuliert
Die KI-Geschichte gewinnt
Der Anlass für den Versuch ist die Studie »Bot or not: Can people tell the difference between stories written by a human or by an AI system?«. Sydney Sears und Deena Skolnick Weisberg von der Villanova University veröffentlichten sie am 5. August 2026 im Fachjournal »Judgment and Decision Making«.
Im ersten Experiment lasen 1.682 Erwachsene aus den USA jeweils eine von sechs etwa 1.000 Wörter langen Kurzgeschichten. Drei Texte stammten von menschlichen Autoren und waren zuvor in Literaturzeitschriften oder Erzählbänden erschienen. Drei korrespondierende Geschichten hatte ChatGPT 4.0 geschrieben.
Ein Teil der Versuchspersonen erhielt die korrekte Information über die Herkunft des Textes. Den anderen wurde eine falsche Urheberschaft genannt. Menschliche Geschichten wurden als KI-Texte ausgegeben und KI-Geschichten als Werke menschlicher Autoren.
Das Ergebnis klingt zunächst wie der Stoff für eine jener Schlagzeilen, nach denen Schriftsteller ihre Schreibmaschinen (wenn die noch einer nutzt) ins Meer werfen sollen: Die von ChatGPT erzeugten Geschichten wurden im Durchschnitt als qualitativ besser und fesselnder bewertet.
Gleichzeitig bekamen alle Texte bessere Noten, wenn die Versuchspersonen glaubten, ein Mensch habe sie geschrieben. Die besten Bewertungen erhielten deshalb KI-Geschichten, die als menschliche Werke ausgegeben wurden.
In zwei weiteren Experimenten lasen insgesamt 905 Personen jeweils eine menschliche und eine KI-generierte Geschichte. Sie sollten erkennen, welcher Text von wem stammte. In einem Versuch lag die Trefferquote bei rund 39 Prozent und damit sogar unter dem Zufallswert. Im anderen erreichte sie knapp 52 Prozent und unterschied sich statistisch nicht vom Raten.
Erfahrung mit KI half bei der Zuordnung. Erfahrung mit Literatur dagegen nicht. Das ist interessant. Es bedeutet aber nicht das, was sich so verführerisch darüber schreiben lässt.
»KI schreibt besser als Menschen« ist Unsinn
Die Studie hat nicht festgestellt, wer »besser schreibt«. Sie untersuchte, welche Texte die Versuchspersonen als fesselnder und qualitativ hochwertiger empfanden. Das ist ein wichtiger Unterschied.
Auch die Autoren der Studie weisen darauf hin, dass sich fesselnde Storys und literarische Qualität keineswegs decken müssen. Clickbait kann außerordentlich fesselnd und zugleich außerordentlich schlecht sein. Anspruchsvolle Literatur kann sich einer schnellen Erschließung widersetzen und gerade darin ihre Qualität entfalten.
Hinzu kommt: Die verwendete Skala für die wahrgenommene Qualität der Geschichten war eigens für die Studie entwickelt und zuvor nicht wissenschaftlich validiert worden. Untersucht wurden lediglich drei Textpaare, ausschließlich kurze realistische Erzählungen. Über Romane, experimentelle Literatur, Komödien oder komplexe Kriminalgeschichten sagt das Ergebnis nichts aus.
Und ChatGPT stand nicht vor einem leeren Blatt. Die Prompts enthielten (wie bei mir) bereits Thema, Perspektive, zentrale Konflikte, Motive und teilweise sogar das gewünschte Ende. Die Maschine musste diese Ideen nicht hervorbringen. Sie musste sie sprachlich umsetzen.
Genau dasselbe gilt für mein Experiment. Die Idee des angeschossenen Mannes auf dem Highway, der korrupte Sheriff und der humanistische Privatdetektiv kamen nicht von ChatGPT. Die KI entwickelte aus dem Prompt Figuren, Szenen, Dialoge und eine Dramaturgie.
Das ist eine beachtliche Leistung für eine KI. Aber es ist eine andere Leistung als die Erfindung des Ausgangsgedankens und daraus eine eigene Geschichte zu erzählen.
Glätte wird mit Qualität verwechselt
Der Hype-Satz »KI schreibt jetzt besser als Menschen« ist deshalb Unsinn. Die spannendere Deutung lautet: KI-Texte sind häufig klarer, glatter und leichter konsumierbar. Genau das können Leser mit Qualität verwechseln.
Auch die Forscherinnen diskutieren diese Möglichkeit. Sprachmodelle bilden ihre Texte aus unzähligen sprachlichen Mustern. Dabei können sie die Ecken, Widerstände und Eigenwilligkeiten einzelner menschlicher Texte abschleifen. Das Ergebnis ähnelt einem statistisch gemittelten Gesicht: vertraut, symmetrisch und auf Anhieb gefällig.
ChatGPT setzt deutliche Signale. Es baut erkennbare Spannungsbögen. Es erklärt Motive. Es formuliert Themen gern so, dass niemand sie übersehen muss. Der Text stellt dem Leser selten ein Bein.
Das ist eine Stärke, wenn ein Text schnell verstanden werden soll. Im Marketing, in der Unternehmenskommunikation, in Erklärtexten oder in der Genreliteratur ist Klarheit kein ästhetischer Makel. Sie ist Teil des Produkts.
Literatur lebt jedoch von etwas anderem: von Mehrdeutigkeit, Widerstand, Auslassungen und Sätzen, die nicht beim ersten Lesen vollständig aufgehen. Ein menschlicher Text darf sperrig, überladen oder eigensinnig sein. Er kann scheitern und gerade dadurch etwas versuchen, das noch keine statistisch sichere Zustimmung verspricht.
Die Studie selbst verweist auf ein ähnliches Problem: KI-generierte Ergebnisse sind tendenziell homogener. Ein einzelner KI-Text kann besser bewertet werden als ein einzelner menschlicher Text. In ihrer Gesamtheit bewegen sich menschliche Autoren aber offenbar durch einen größeren Raum an Möglichkeiten.
Anders gesagt: Die Maschine produziert möglicherweise den besseren Durchschnitt. Der Mensch produziert häufiger den Ausreißer. Und ohne Ausreißer gäbe es vermutlich wenig Literatur, an die wir uns lange erinnern.
Hat eine KI schon einen eigenen Gedanken gehabt?
Damit bleibt die schwierigere Frage: Hat die heute als künstliche Intelligenz bezeichnete Technik bereits einen einzigen wirklich originellen eigenen Gedanken hervorgebracht? Oder ist sie letztlich eine ungeheuer leistungsfähige Autovervollständigung?
Die Studie beantwortet diese Frage nicht. Sie untersucht Ergebnisse, nicht Bewusstsein, Absicht oder Urheberschaft. Technisch erzeugt ein Sprachmodell Text, indem es auf der Grundlage gelernter Muster berechnet, welche sprachlichen Elemente aufeinander folgen könnten. Die Bezeichnung »Autovervollständigung« ist deshalb nicht völlig falsch. Sie unterschlägt allerdings, wie komplex die daraus entstehenden Kombinationen sein können.
Auch Menschen erfinden nicht einfach aus dem Nichts. Wir schreiben aus Erinnerungen, gelesenen Büchern, gesehenen Filmen, Gesprächen, Erfahrungen und übernommenen Erzählmustern. Raymond Chandler hat den Privatdetektiv nicht erfunden. Er hat aus bekannten Bestandteilen etwas geschaffen, das seine Handschrift trug: Philip Marlowe!
Die unbequeme Lehre der Studie
Für Verlage, Medien, Marketingabteilungen und professionelle Autoren enthält die Untersuchung eine unangenehme Botschaft. Viele Leser erkennen die Herkunft eines Textes nicht. Und sie bewerten einen Text nicht nach seinem Entstehungsprozess, solange sie diesen Prozess nicht kennen.
Wer vor allem Klarheit, Tempo und zuverlässig gute Durchschnittswerte benötigt, bekommt mit generativer KI ein mächtiges Werkzeug.
Die Kurzgeschichte beweist in dieser Frage nichts. Sie ist kein kontrolliertes Experiment und tritt gegen keinen menschlichen Vergleichstext an. Der Text wurde vollständig von ChatGPT formuliert. Idee, Handlung, Figuren und Anforderungen stammen von mir. Die zweite Fassung entstand, nachdem ChatGPT seinen eigenen Text geprüft hatte. Den Prompt habe ich vorher geschrieben.