iureka Blog

KI · GPTZero

Pangram, GPTZero & Co.: Wie zuverlässig ist die KI-Textpolizei?

Programme wie GPTZero und Pangram versprechen, KI-generierte Texte zu enttarnen – und Hochschulen setzen sie massenhaft ein. Doch Studien zeigen: Die Detektoren sind besser als Menschen, aber weit von Perfektion entfernt. Was die Zahlen über Fehlalarme und blinde Flecken verraten.

iureka Team ·

Foto: Matheus Bertelli / Pexels
Foto: Matheus Bertelli / Pexels

Hamburg, 16. August 2026 – Können Sie KI-Texte erkennen? Der SPIEGEL ruft seine Leser dieser Tage zum Selbsttest auf – im direkten Vergleich mit den Programmen Pangram und GPTZero, die versprechen, künstlich erzeugte Texte zuverlässig zu enttarnen.^[DER SPIEGEL – Pangram, GPTZero – und Sie: Testen Sie, wie gut Sie KI-Texte erkennen – url: https://www.spiegel.de/netzwelt/web/pangram-gptzero-und-sie-testen-sie-wie-gut-sie-ki-texte-erkennen-a-ec90cc74-6a4c-4410-af56-c3b52b87d230] Das Interesse ist kein Zufall: An Hochschulen und Verlagen gehören KI-Detektoren längst zum Alltag.

Die 85-Prozent-Hürde

Entscheidend für die Güte eines Detektors ist nicht nur, wie viele KI-Texte er erkennt, sondern auch, wie oft er menschliche Texte fälschlich als KI markiert – die sogenannte Falsch-Positiv-Quote. Rund 85 Prozent aller KI-generierten Texte würden erkannt, 15 Prozent nicht, bilanziert die taz. Pangram markiert dabei wenige Texte irrtümlich als KI, während GPTZero und Copyleaks bei der Erkennung sogar etwas besser abschneiden – dafür aber häufiger falschen Alarm schlagen.^[taz – „Pangram“: Wie verlässlich ist KI-Erkennungs-Software? – url: https://taz.de/KI-Erkennungssoftware/!6185273] Das US-Magazin „The Atlantic“ spricht bereits von einem „Pangram-Problem“: Auch bei den jüngsten deutschen KI-Enthüllungen kam das Tool zum Einsatz.^[taz – „Pangram“: Wie verlässlich ist KI-Erkennungs-Software? – url: https://taz.de/KI-Erkennungssoftware/!6185273]

Was unabhängige Studien zeigen

Eine im Juni 2026 veröffentlichte, begutachtete Studie der Vrije Universiteit Brussel testete vier Detektoren an 160 wissenschaftlichen Arbeiten. Pangram erkannte 97,5 Prozent der vollständig KI-generierten Texte und wies bei englischsprachigen Aufsätzen keine Fehlalarme auf – während Turnitin, Copyleaks und GPTZero bei vollständig KI-generierten Texten überraschend schlecht abschnitten.^[Pangram – Bewertungen durch Dritte: VUB-Studie – url: https://www.pangram.com/de/blog/third-party-pangram-evals] Forscher der Universität Chicago kamen zu dem Ergebnis, Pangram sei der einzige Detektor, der eine strenge Fehlalarm-Grenze einhalte, ohne die Erkennungsgenauigkeit zu opfern – und zugleich der günstigste: durchschnittlich 0,0228 US-Dollar pro korrekt markiertem KI-Textabschnitt, gegenüber 0,0575 US-Dollar bei GPTZero.^[Pangram – Bewertungen durch Dritte: Universität Chicago – url: https://www.pangram.com/de/blog/third-party-pangram-evals]

Kurze Texte, Humanizer und die Grenzen der Technik

Die Achillesferse aller Detektoren sind kurze Passagen unter 50 Wörtern – hier zeigte Pangram laut einer weiteren Analyse die höchste Zuverlässigkeit, während andere Tools die Verarbeitung oft verweigerten.^[mind-verse – Neue Studie zeigt Überlegenheit von Pangram in der KI-Texterkennung – url: https://www.mind-verse.de/news/neue-studie-zeigt-ueberlegenheit-von-pangram-in-der-ki-texterkennung] Gegen „Humanizer“-Programme, die KI-Text menschlicher erscheinen lassen sollen, erwies sich Pangram weitgehend als robust – andere Detektoren hatten erhebliche Schwierigkeiten. Ein Open-Source-Detektor auf RoBERTa-Basis markierte dagegen 30 bis 69 Prozent der menschlichen Texte fälschlich als KI-generiert.^[mind-verse – Neue Studie zeigt Überlegenheit von Pangram – url: https://www.mind-verse.de/news/neue-studie-zeigt-ueberlegenheit-von-pangram-in-der-ki-texterkennung] Und eine Studie der University of Maryland fand: Menschen, die ChatGPT häufig für Schreibaufgaben nutzen, sind selbst treffsichere Erkenner von KI-Texten – Pangram schnitt in dem Vergleich besser ab als jeder einzelne menschliche Prüfer.^[Pangram – Wie schneidet Pangram im Vergleich zu GPTZero ab? – url: https://www.pangram.com/de/blog/how-does-pangram-compare-against-gptzero]

Die Botschaft der Studien ist zwiespältig: KI-Detektoren sind mächtige Werkzeuge gegen den Missbrauch generativer KI – aber sie bleiben Statistik, keine Wahrheit. Wer Studierende, Autoren oder Bewerber auf dieser Basis beurteilt, riskiert im Zweifel Fehlurteile über Menschen, die gar nichts falsch gemacht haben.

Quellen: DER SPIEGEL – Testen Sie, wie gut Sie KI-Texte erkennen · taz – Wie verlässlich ist KI-Erkennungs-Software? · mind-verse – Studie zur KI-Texterkennung · Pangram – Drittbewertungen und Studien · Pangram – Vergleich mit GPTZero