En 2025, menos del 2% de los artículos nuevos en ciencias de la computación eran sospechosos de haber sido escritos por IA. En 2026, la cifra es del 15%. No es un crecimiento gradual: es una explosión.
Esta es la conclusión de un análisis masivo publicado por el equipo de Unslop. Examinaron el texto completo de 12.750 artículos en arXiv, calibrando el umbral de detección a un nivel de “falsos positivos de solo el 0,4%” — es decir, antes de ChatGPT, solo el 0,4% de los artículos humanos habrían sido etiquetados como escritos por IA. Sobre esa base, la proporción de escritura con IA en ciencias de la computación pasó de casi cero al 15%. Si se amplía al último trimestre completo, la cifra alcanza el 32%, con un pico cercano al 39% a principios de 2026.
Esto está ocurriendo realmente en 2026.
¿Hasta qué punto la IA ha “invadido” el mundo académico?
La detección de Unslop cubrió diez disciplinas. Estos son los datos (últimos 12 meses, hasta julio de 2026):
- Ciencias de la Computación: 65% de los artículos nuevos sospechosos de escritura con IA
- Biología Cuantitativa: 56,3%
- Ingeniería Eléctrica y Sistemas: 51,3%
- Economía y Finanzas: 47%
- Física Aplicada: 34%
- Estadística: 31,3%
- Física de la Materia Condensada: 24%
- Física de Altas Energías: 14%
- Astrofísica: 10,7%
- Matemáticas: 0,7%
Todas estas cifras comparten una característica común: antes de ChatGPT (2021-2022), la tasa de falsos positivos en estas disciplinas oscilaba entre el 0% y el 3,5%. La curva comenzó a dispararse a principios de 2023.
En otras palabras, el texto que “parece escrito por IA” en los artículos académicos ha pasado de ser una señal de ruido insignificante a convertirse en la norma en muchas disciplinas.
Figura 1: Evolución de la proporción de artículos en arXiv clasificados como escritos por IA (2021-2026)
Figura 2: Comparación por disciplinas de artículos clasificados como escritos por IA
Si la IA escribe los artículos, ¿por qué no se detecta?
Quizás pienses: lo escrito por IA debería ser fácil de reconocer, ¿no? Esos textos con ese “olor a IA” tan característico…
La realidad es justo la contraria.
Primero, la evolución de la calidad de escritura de la IA supera con creces la evolución de las herramientas de detección. El GPT-3 temprano sí tenía patrones evidentes — estructura de oraciones repetitiva, abuso de conectores como “además” o “por otro lado”, conclusiones genéricas. Pero con GPT-4, Claude y otras generaciones recientes, sumado a la edición cuidadosa por parte de los usuarios, la frontera entre texto humano y de IA se ha vuelto extremadamente difusa.
Segundo, los llamados “detectores de IA” no son más que clasificadores estadísticos. Su funcionamiento se basa en aprender las diferencias estadísticas en la selección de palabras y la distribución de estructuras sintácticas entre la escritura humana y la generada por IA. Pero cualquier modelo estadístico tiene dos talones de Aquiles: falsos positivos (clasificar como IA un texto humano pero excesivamente “formal”) y falsos negativos (texto de IA que, tras una edición superficial, pierde las características estadísticas que el detector busca).
El dato más preocupante: la precisión de los detectores se desploma frente a textos de IA deliberadamente camuflados. Si una persona dedica unos minutos a reescribir un borrador generado por IA — cambiar sinónimos, reordenar párrafos, añadir algún juicio propio — el detector se vuelve prácticamente inútil.
En HN, un investigador (pbui) hizo un experimento: pasó por el detector un artículo que escribió en 2011 y fue clasificado como 27% generado por máquina; su tesis doctoral de 2012, 40%; un artículo IEEE de 2015, 74%. Un texto escrito por una persona real, antes de que existiera la IA generativa, fue clasificado como escrito por una máquina. Esto demuestra que estos detectores ni siquiera tienen claro “qué es escritura humana”, y mucho menos pueden distinguir entre humanos y máquinas.
El juego del gato y el ratón: la carrera armamentista entre detección y anti-detección
Esta contienda es esencialmente una carrera armamentista asimétrica:
Defensa (herramientas de detección): deben identificar todas las estrategias posibles de generación con IA. Pero los modelos de IA se actualizan a diario, la ingeniería de prompts evoluciona constantemente, y los detectores siempre van por detrás.
Ataque (quienes usan IA): solo necesitan que el texto “parezca humano”. Hoy usan GPT-4 para un borrador y lo corrigen dos veces, mañana usan Claude con otro estilo, pasado mañana pasan el resultado por una herramienta de paráfrasis — los datos de entrenamiento de los detectores siempre van un paso atrás.
El propio equipo de Unslop lo admite con franqueza: su detector tiene sensibilidades distintas según el modelo de lenguaje y no puede conocer la combinación real de modelo y prompt utilizada por el usuario. Por lo tanto, sus datos representan solo un “límite inferior” — la proporción real solo puede ser mayor, nunca menor.
Aún más problemático: incluso si un detector alcanzara un 99% de precisión, al aplicarse a miles de artículos generaría una enorme cantidad de falsos positivos. Un usuario de HN (NitpickLawyer) señaló que todos los detectores de IA tempranos clasificaron la Declaración de Independencia de EE.UU. como 100% escrita por IA. Las consecuencias de los falsos positivos son reales — ya hay estudiantes acusados injustamente de usar IA por errores de los detectores.
¿Por qué los investigadores usan IA para escribir?
Detrás de esto hay dos fuerzas en tensión:
Por un lado, la “integridad académica”. Un artículo debería representar el pensamiento y el trabajo del investigador. Si hasta la escritura se delega a la IA, ¿qué se está “investigando” realmente?
Por otro lado, el “eficientismo” — o, más bien, la presión de supervivencia. El mundo académico tiene una ley de hierro: publish or perish. Los investigadores jóvenes necesitan cantidad de artículos, los profesores compiten por métricas, los doctorandos necesitan publicar para graduarse. Bajo esta presión, usar IA para convertir rápidamente unas ideas en un artículo formal parece una opción razonable.
Algunos lo hacen por necesidad — el laboratorio tiene fondos limitados, los colegas publican a un ritmo vertiginoso, los plazos de revisión son cada vez más largos; sin IA es imposible seguir el ritmo. Otros lo hacen por oportunismo — generar contenido con IA, retocarlo ligeramente, firmarlo y producir artículos en serie para inflar métricas.
En la práctica, ambas motivaciones suelen estar mezcladas. Un investigador puede empezar con “solo voy a usar IA para pulir el lenguaje”, luego descubrir que “es bastante útil”, y terminar con “el borrador que hizo IA está más o menos bien, solo tengo que cambiar un par de cosas”. No hay una línea roja clara en este proceso, pero está transformando realmente el ecosistema de la escritura académica.
¿Qué significa esto para la integridad académica?
Las principales revistas y conferencias académicas están aún en una fase de “tanteo” respecto a la escritura con IA. Algunas la prohíben explícitamente, otras exigen una declaración, otras miran hacia otro lado.
Pero el problema no es la actitud, sino la viabilidad de la supervisión. Si las herramientas de detección no son fiables, cualquier declaración sobre el uso de IA depende de la honestidad del autor. Y alguien dispuesto a usar IA para escribir un artículo sin declararlo probablemente no se volverá honesto de repente.
La crisis más profunda es: cuando la proporción de escritura con IA alcanza un nivel crítico, el valor mismo de la literatura académica como señal se degrada. Si dedicas horas a leer un artículo y descubres que no es más que una plantilla estándar generada por IA con algunas fórmulas, los cimientos de la comunicación académica se resienten.
Por supuesto, también hay otra voz: las herramientas no son intrínsecamente buenas ni malas. Si la IA ayuda a los investigadores a expresar ideas más rápido y a organizar argumentos con mayor claridad, entonces es solo una ayuda para la escritura. La clave está en cómo y hasta dónde se usa — si para potenciar el pensamiento o para reemplazarlo.
El estudio de Unslop nos deja una conclusión clara: la penetración de la IA en la escritura académica ya es irreversible. Las herramientas de detección no pueden seguir el ritmo, las regulaciones no pueden contenerla, y la honestidad es voluntaria. Lo que ocurra a continuación depende de si la academia puede encontrar un punto de equilibrio defendible entre “abrazar la eficiencia” y “mantener los estándares”.
El verdadero desafío para la academia es “cómo usar la IA sin destruir la academia misma”.
Enlaces de referencia:
- How we measured AI writing across arXiv, and where the measurement breaks — Artículo original del equipo Unslop
- Hacker News discussion: 187 points, 137 comments — Discusión en la comunidad HN
- Unslop Detector technical notes — Principios del detector y método de calibración
