En 2025, moins de 2 % des nouveaux articles en informatique étaient soupçonnés d’être rédigés par IA. En 2026, ce chiffre a bondi à 15 %. Pas une progression graduelle — une explosion.
C’est la conclusion d’une vaste analyse menée récemment par l’équipe d’Unslop. Ils ont examiné le texte intégral de 12 750 articles sur arXiv, en calibrant leur détecteur pour atteindre un « taux de faux positifs de seulement 0,4 % » — autrement dit, parmi les articles humains d’avant ChatGPT, seuls 0,4 % sont faussement étiquetés comme générés par IA. Sur cette base, la proportion d’articles suspects en informatique est passée de quasi zéro à 15 %. Sur le dernier trimestre complet, le chiffre atteint même 32 %, avec un pic à près de 39 % début 2026.
C’est la réalité — en 2026.
À quel point l’IA a-t-elle « envahi » le monde académique ?
L’équipe d’Unslop a couvert dix disciplines. Voici les données (sur les 12 derniers mois, jusqu’en juillet 2026) :
- Informatique : 65 % des nouveaux articles jugés suspects
- Biologie quantitative : 56,3 %
- Génie électrique et systèmes : 51,3 %
- Économie et finance : 47 %
- Physique appliquée : 34 %
- Statistiques : 31,3 %
- Physique de la matière condensée : 24 %
- Physique des hautes énergies : 14 %
- Astrophysique : 10,7 %
- Mathématiques : 0,7 %
Un point commun à toutes ces disciplines : avant l’arrivée de ChatGPT (2021-2022), le taux de faux positifs de base oscillait entre 0 % et 3,5 %. La courbe n’a commencé à s’élever qu’à partir de début 2023.
Autrement dit, le texte « qui sonne comme de l’IA » dans les publications académiques est passé d’un bruit négligeable à une caractéristique dominante dans de nombreux domaines.
Illustration 1 : Évolution de la proportion d’articles arXiv jugés rédigés par IA (2021-2026)
Illustration 2 : Comparaison par discipline du taux d’articles suspects
Pourquoi l’IA est-elle si difficile à détecter ?
On pourrait penser qu’un texte généré par IA se reconnaît facilement — cette « odeur artificielle » si caractéristique ?
La réalité est tout autre.
Premièrement, l’évolution de la qualité rédactionnelle de l’IA dépasse de loin celle des outils de détection. Les premiers GPT-3 affichaient des motifs évidents — phrases répétitives, abus de connecteurs logiques, conclusions creuses. Mais avec GPT-4, Claude et les modèles récents, combinés à une relecture humaine minutieuse, la frontière entre texte humain et texte IA est devenue extrêmement floue.
Deuxièmement, les « détecteurs d’IA » ne sont que des classifieurs statistiques. Ils apprennent les différences de distribution lexicale et syntaxique entre l’écriture humaine et celle de l’IA. Mais tout modèle statistique a deux faiblesses fatales : les faux positifs (un texte humain très « propre » étiqueté IA) et les faux négatifs (un texte IA modifié perd ses caractéristiques statistiques et devient indétectable).
Le plus cinglant : la fiabilité des détecteurs chute en présence d’un texte IA délibérément camouflé. Quiconque prend quelques minutes pour retravailler un brouillon généré par IA — remplacer des synonymes, réorganiser les paragraphes, ajouter un jugement personnel — rend le détecteur presque impuissant.
Un chercheur (pbui) a fait l’expérience sur HN : il a soumis son propre article de 2011 à un détecteur, qui l’a jugé « 27 % machine » ; sa thèse de 2012, 40 % ; un article IEEE de 2015, 74 %. Un texte écrit par un humain avant l’existence de l’IA, étiqueté comme généré par machine. Cela montre que ces détecteurs peinent déjà à définir ce qu’est une « écriture humaine », alors comment pourraient-ils distinguer IA et humain ?
Le jeu du chat et de la souris : la course aux armements détection vs anti-détection
Cette confrontation est une course aux armements asymétrique :
Le camp de la défense (outils de détection) doit identifier toutes les stratégies possibles de génération par IA. Mais les modèles évoluent chaque jour, le prompt engineering progresse, et les détecteurs sont toujours en retard.
Le camp de l’attaque (utilisateurs de l’IA) n’a qu’un seul objectif : faire en sorte que le texte « paraisse humain ». Aujourd’hui, on écrit un brouillon avec GPT-4 et on le retouche ; demain, on change de style avec Claude ; après-demain, on passe le texte dans un outil de reformulation. Les données d’entraînement des détecteurs sont toujours en retard d’un train.
L’équipe d’Unslop le reconnaît elle-même : leur détecteur a une sensibilité variable selon les modèles de langage, et ils ne peuvent pas connaître la combinaison exacte modèle + invite utilisée par chaque auteur. Les chiffres qu’ils rapportent ne sont donc qu’une « limite basse » — la proportion réelle ne peut être que plus élevée.
Plus inquiétant encore : même avec une précision de 99 %, appliqué à des milliers d’articles, un détecteur génère une masse de faux positifs. Un utilisateur HN (NitpickLawyer) rappelle que les premiers détecteurs d’IA considéraient la Déclaration d’indépendance américaine comme 100 % générée par IA. Les conséquences sont réelles : des étudiants ont déjà été accusés à tort d’avoir utilisé l’IA sur la base de ces détecteurs.
Pourquoi les chercheurs utilisent-ils l’IA pour rédiger ?
Deux forces s’affrontent :
D’un côté, « l’intégrité académique ». Un article doit refléter la réflexion et le travail du chercheur. Si même la rédaction est déléguée à l’IA, qu’est-ce qui reste de la recherche ?
De l’autre côté, l’« efficacité » — ou plutôt, la pression de survie. Le monde académique obéit à une loi de fer : publish or perish. Les jeunes chercheurs doivent accumuler les publications, les professeurs doivent tenir leurs indicateurs, les doctorants doivent valider leur thèse. Face à cette pression, utiliser l’IA pour transformer rapidement une idée en article formaté semble un choix rationnel.
Certains y sont contraints — financement de laboratoire limité, productivité fulgurante des concurrents, délais d’examen toujours plus longs. Sans IA, impossible de suivre le rythme. D’autres jouent le système : ils génèrent du contenu par IA, le modifient à la marge, le soumettent sous leur nom et accumulent les publications.
Dans la réalité, ces deux motivations se mêlent souvent. Un chercheur commence par « utiliser l’IA pour améliorer la formulation », puis constate que « c’est plutôt pratique », et finit par se dire que « ce brouillon IA est acceptable, je n’ai plus qu’à corriger deux ou trois choses ». Il n’y a pas de ligne rouge claire, mais ce glissement transforme profondément l’écosystème de l’écriture académique.
Quelles conséquences pour l’intégrité académique ?
Les principales revues et conférences adoptent des positions encore tâtonnantes. Certaines interdisent explicitement l’IA, d’autres exigent une déclaration, d’autres encore ferment les yeux.
Mais le vrai problème n’est pas l’attitude : c’est la possibilité même du contrôle. Si les outils de détection ne sont pas fiables, la déclaration d’usage de l’IA repose sur la seule bonne foi de l’auteur. Et un chercheur prêt à utiliser l’IA sans la déclarer n’est pas soudainement pris d’honnêteté.
La crise plus profonde est la suivante : lorsque la proportion de textes générés par IA devient trop élevée, la valeur même du signal que constitue la littérature académique s’effondre. Si vous passez des heures à lire un article pour découvrir qu’il n’est qu’un template standard généré par IA agrémenté de quelques formules, le fondement même de la communication scientifique est ébranlé.
Bien sûr, une autre voix s’élève : l’outil n’est ni bon ni mauvais en soi. Si l’IA aide les chercheurs à exprimer leurs idées plus vite et à organiser leurs arguments plus clairement, elle n’est qu’un auxiliaire d’écriture. L’essentiel est la manière et les limites de son usage — l’IA sert-elle à amplifier la réflexion, ou à la remplacer ?
L’étude d’Unslop laisse un constat sans équivoque : la pénétration de l’IA dans l’écriture académique est irréversible. Les détecteurs ne rattrapent pas leur retard, les régulations ne suffisent pas à endiguer le phénomène, l’intégrité repose sur la bonne volonté. La suite dépend de la capacité du monde académique à trouver un équilibre tenable entre « efficacité » et « préservation des fondamentaux ».
Le véritable défi pour la recherche est « comment utiliser l’IA sans détruire l’essence même du travail académique ».
Références :
- How we measured AI writing across arXiv, and where the measurement breaks — article original d’Unslop
- Hacker News discussion : 187 points, 137 commentaires
- Note technique sur le détecteur Unslop — principe et calibrage
