2025 lag der Anteil KI-verdächtiger Papers im Fachbereich Informatik noch unter 2 %. 2026 sind es 15 %. Kein allmählicher Anstieg, sondern ein sprunghafter Anstieg.
Zu diesem Ergebnis kommt eine aktuelle Massenauswertung des Unslop-Teams. Sie analysierten die Volltexte von 12.750 arXiv-Papers und kalibrierten die Erkennungsschwelle auf eine Falsch-Positiv-Rate von lediglich 0,4 % – das heißt, vor ChatGPT erstellte menschliche Papers würden nur zu 0,4 % fälschlich als KI-generiert eingestuft. Auf dieser Basis stieg der Anteil KI-geschriebener Texte in der Informatik von nahezu null auf 15 %. Betrachtet man das letzte vollständige Quartal, sind es sogar 32 %, mit einem Spitzenwert von fast 39 % Anfang 2026.
Dies geschah im Jahr 2026 – real, nicht erfunden.
Wie tief ist die KI in die Wissenschaft eingedrungen?
Das Unslop-Team untersuchte zehn Fachrichtungen. Hier die Daten (letzte 12 Monate bis Juli 2026):
- Informatik: 65 % der neuen Papers als KI-verdächtig eingestuft
- Quantitative Biologie: 56,3 %
- Elektrotechnik & Systeme: 51,3 %
- Wirtschaft & Finanzen: 47 %
- Angewandte Physik: 34 %
- Statistik: 31,3 %
- Kondensierte Materie: 24 %
- Hochenergiephysik: 14 %
- Astrophysik: 10,7 %
- Mathematik: 0,7 %
Allen diesen Daten gemeinsam ist, dass die Basis-Falsch-Positiv-Rate vor ChatGPT (2021–2022) in allen Disziplinen zwischen 0 % und 3,5 % lag. Die Kurve steigt erst ab Anfang 2023 merklich an.
Anders gesagt: Texte in wissenschaftlichen Publikationen, die „sich wie KI anhören” sind von einem vernachlässigbaren Rauschsignal in vielen Disziplinen zum Mainstream geworden.
Abbildung 1: Entwicklung des Anteils KI-verdächtiger arXiv-Papers (2021–2026)
Abbildung 2: Anteil KI-verdächtiger Papers nach Disziplin
Warum KI-geschriebene Papers nicht erkannt werden
Man könnte meinen: KI-Texte sind doch leicht erkennbar, oder? Diese großen Modelle schreiben doch so typisch „KI-artig”?
Das Gegenteil ist der Fall.
Erstens: Die Evolution der KI-Schreibfähigkeiten überholt die Erkennungswerkzeuge bei Weitem. Frühe GPT-3-Ausgaben hatten tatsächlich erkennbare Muster – repetitive Satzstrukturen, übermäßige Nutzung von Füllwörtern, inhaltsleere Schlussfolgerungen. Doch bei GPT-4, Claude und anderen Modellen der nächsten Generation, gepaart mit sorgfältiger Nachbearbeitung, verschwimmt die Grenze zwischen KI- und menschlichem Text zunehmend.
Zweitens: Sogenannte „KI-Detektoren” sind im Kern statistische Klassifikatoren. Sie lernen statistische Unterschiede in Wortwahl und Satzmustern zwischen menschlichem und KI-Text. Doch jedes statistische Modell hat zwei Schwachstellen: Falsch-Positive – menschliche Texte mit „zu sauberem” Stil werden als KI eingestuft – und False Negatives – leicht überarbeitete KI-Texte, deren statistische Merkmale verwischt wurden.
Noch beunruhigender: Die Genauigkeit der Erkennungstools sinkt bei absichtlich getarnten KI-Texten drastisch. Wer seinen KI-generierten Rohtext ein wenig umschreibt – Synonyme austauscht, Absätze umstellt, ein oder zwei eigene Urteile einfügt – macht die Detektoren praktisch wirkungslos.
Ein HN-Nutzer (pbui) machte den Test: Sein 2011 selbst verfasster Paper wurde zu 27 % als Maschinentext eingestuft, seine Doktorarbeit von 2012 zu 40 %, ein 2015 veröffentlichter IEEE-Artikel zu 74 %. Ein von einem Menschen geschriebener, vor-KI-Text wird als maschinengeneriert eingestuft. Das zeigt: Diese Detektoren haben noch nicht einmal verstanden, was „menschliches Schreiben” ausmacht – geschweige denn, sie könnten Mensch und KI zuverlässig unterscheiden.
Katz-und-Maus-Spiel: Die Aufrüstung zwischen Detection und Anti-Detection
Dieser Wettlauf ist ein ungleiches Wettrüsten:
Die Verteidiger (Erkennungstools): Müssen alle denkbaren KI-Generierungsstrategien erkennen. Doch KI-Modelle werden täglich aktualisiert, Prompt-Engineering entwickelt sich weiter – die Detektoren hinken immer hinterher.
Die Angreifer (KI-Nutzer): Müssen den Text nur „menschlich aussehen lassen”. Heute mit GPT-4 geschrieben und zweimal überarbeitet, morgen mit Claude in einem anderen Stil, übermorgen durch einen Rewriter gejagt – die Trainingsdaten der Detektoren sind immer einen Schritt zurück.
Das Unslop-Team räumt dies selbst ein: Ihr Detektor reagiert unterschiedlich empfindlich auf verschiedene Sprachmodelle, und die tatsächlich verwendeten Modelle und Prompt-Kombinationen sind unbekannt. Daher sind ihre Daten nur als „Untergrenze” zu betrachten – die tatsächlichen Anteile sind höher, nicht niedriger.
Erschwerend kommt hinzu: Selbst bei 99 % Genauigkeit erzeugt der Einsatz bei tausenden von Papers massenhaft Falsch-Positive. Ein HN-Nutzer (NitpickLawyer) weist darauf hin, dass frühe KI-Detektoren die amerikanische Unabhängigkeitserklärung zu 100 % als KI-generiert einstuften. Die Folgen sind real – Studenten wurden bereits aufgrund falscher Detektor-Ergebnisse zu Unrecht beschuldigt, KI für Hausarbeiten genutzt zu haben.
Warum Forscher KI zum Schreiben nutzen
Hier wirken zwei gegensätzliche Kräfte:
Da ist die „wissenschaftliche Integrität”. Papers sollten die eigene Denkleistung und Arbeit repräsentieren. Wenn selbst das Schreiben an KI delegiert wird, was genau wird dann eigentlich „erforscht”?
Da ist der „Effizienzimperativ” – oder schlicht: Überlebensdruck. In der Wissenschaft gilt eisern: Publish or perish. Nachwuchsforschende müssen Paper vorweisen, Professoren um Indikatoren kämpfen, Doktoranden brauchen Publikationen zur Promotion. Unter diesem Druck erscheint es rational, KI zu nutzen, um Gedanken schnell in ein规范的 Paper zu gießen.
Manche sind gezwungen – knappe Laboretats, atemberaubende Produktivität der Konkurrenz, immer längere Begutachtungszyklen. Ohne KI kommt man nicht mit. Andere spekulieren – KI-generierte Inhalte leicht überarbeitet einreichen, den eigenen Namen daruntersetzen, Massenproduktion von Papieren zur Indikator-Steigerung.
Meines Erachtens vermischen sich diese Motive in der Praxis oft. Ein Forscher beginnt vielleicht mit „Ich lasse die KI nur meine Sprache glätten”, stellt dann fest „Das geht ja ganz flott” und endet bei „Der Rohtext der KI ist schon ganz gut, ich ändere noch ein paar Stellen”. Es gibt keine klare rote Linie, aber es verändert real die Ökologie des wissenschaftlichen Schreibens.
Was bedeutet das für die wissenschaftliche Integrität?
Die meisten wissenschaftlichen Journals und Konferenzen tasten sich bei KI-Schreibhilfen noch vor. Manche verbieten es explizit, andere verlangen eine Offenlegung, wieder andere drücken ein Auge zu.
Doch das Problem liegt nicht in der Haltung, sondern in der Durchsetzbarkeit. Wenn Erkennungstools unzuverlässig sind, bleibt die Offenlegung von KI-Nutzung reine Selbstverpflichtung. Und wer bereit ist, KI fürs Paper-Schreiben zu nutzen, ohne es anzugeben, wird kaum plötzlich ehrlich.
Die tiefere Krise: Steigt der Anteil KI-geschriebener Texte auf ein hohes Niveau, sinkt der Signalwert der wissenschaftlichen Literatur selbst. Wenn man viel Zeit in ein Paper investiert und feststellt, dass es nur eine KI-generierte Standardvorlage mit ein paar Formeln ist, wird die Basis des wissenschaftlichen Austauschs erschüttert.
Natürlich gibt es auch eine andere Stimme: Werkzeuge an sich sind weder gut noch böse. Wenn KI Forschern hilft, Gedanken schneller auszudrücken und Argumente klarer zu strukturieren, ist sie nur ein Schreibassistent. Entscheidend ist die Art und Weise der Nutzung und die Grenzen – nutzt man KI, um das Denken zu verstärken, oder um es zu ersetzen.
Die Studie des Unslop-Teams hinterlässt eine klare Schlussfolgerung: Die Durchdringung der KI im wissenschaftlichen Schreiben ist irreversibel. Erkennungstools können nicht aufholen, Regulierungen können nicht blockieren, Integrität beruht auf Eigenverantwortung. Was als Nächstes passiert, hängt davon ab, ob die Wissenschaft eine vertretbare Balance zwischen „Effizienz nutzen” und „Standards wahren” findet.
Die eigentliche Herausforderung für die Wissenschaft lautet: „Wie nutzt man KI, ohne die Wissenschaft selbst zu zerstören.”
Referenzen:
- How we measured AI writing across arXiv, and where the measurement breaks — Unslop team original article
- Hacker News discussion: 187 points, 137 comments — HN community discussion
- Unslop Detector technical notes — detection principle and calibration method
