Según un análisis del Pew Research Center sobre casi medio millón de páginas web recopiladas mediante la herramienta de detección Open Pangram, el 10 % de una muestra de páginas extraídas en julio presenta indicios significativos de haber sido redactadas por IA. Si se tienen en cuenta únicamente las páginas publicadas tras el lanzamiento de ChatGPT, en noviembre de 2022, esta cifra asciende al 35 %. 1
- Los sitios web con fines comerciales (cuyo dominio es .com) registran el mayor porcentaje de contenido generado por la IA o con su ayuda: alrededor del 10 % en 2026.
- Este fenómeno afecta en menor medida al dominio .org (4,6 %) y, con aún menos frecuencia, a los sitios web de centros educativos (.edu) y de la administración pública (.gov), en torno al 1 %.
El aumento de los contenidos generados por la IA o con su ayuda puede provocar una disminución de la calidad y un aumento del riesgo de errores fácticos. También podría suponer un riesgo para el entrenamiento de los futuros modelos de inteligencia artificial.
En un estudio publicado en 2024, Ilia Shumailov, Zakhar Shumaylov y otros investigadores desarrollaron la teoría del «colapso de los modelos».
- Según este estudio, cuando un modelo de IA se entrena de forma recursiva con datos generados por otros modelos, en lugar de con datos creados por personas, va perdiendo progresivamente calidad y diversidad.
- Los errores y sesgos se acumulan con cada generación de entrenamiento, lo que provoca la desaparición de la información poco frecuente o atípica y, a la larga, un deterioro general de la coherencia de los resultados obtenidos.
Hasta hace poco eran fáciles de detectar debido a estructuras semánticas similares y a ciertos rasgos estilísticos identificados —frases más largas, guiones largos…—, los contenidos generados por IA resultan hoy en día cada vez más difíciles de detectar, a medida que los modelos aprenden y se adaptan al «estilo humano».
- Claude es, al día de hoy, el único chatbot que sigue utilizando más guiones que los autores humanos. 2
- En un estudio de la Universidad de California, el modelo GPT-4o de OpenAI fue confundido con un interlocutor humano en el 77 % de las conversaciones con los participantes. 3
- Las noticias generadas por IA se consideran ahora más «atractivas» y de mejor calidad que las escritas por humanos, cuando el lector desconoce quién es el autor. 4
Desde el 2 de agosto, la Ley de IA obliga a los proveedores que operan en la Unión a hacer detectables los contenidos generados por sus modelos. Según uno de los matemáticos pioneros en la tecnología del «watermarking», Scott Aaronson, este tipo de marcado sigue siendo fácil de eludir, pero podría servir precisamente para otro objetivo: permitir a los laboratorios reconocer los textos generados por los LLM y, de este modo, entrenar sus modelos únicamente con textos escritos por humanos.
Notas al pie
- Samuel Bestvater, Aaron Smith, Carson TerBush, Chris Baronavski y Janakee Chavda, «How Much of the Internet Is Written With AI?», Pew Research Center, 20 de agosto de 2026.
- «How to spot AI writing», The Economist, 30 de julio de 2026.
- Jones, Cameron Robert, et al., «People cannot distinguish GPT-4 from a human in a Turing test», Actas de la Conferencia ACM de 2025 sobre Equidad, Responsabilidad y Transparencia, 2025.
- Sears, S., & Weisberg, D. S., «Bot or not: Can people tell the difference between stories written by a human or by an AI system», Judgment and Decision Making, vol. 21, 2026.