Correos electrónicos internos entre ejecutivos de Microsoft y OpenAI, difundidos recientemente, muestran una preocupación compartida por las prácticas de rastreo masivo de contenido web utilizadas para entrenar modelos como ChatGPT. Según informó Ars Technica, un ejecutivo de Microsoft llegó a describir esta práctica como “el mayor robo de trabajo en la historia de la humanidad”. De acuerdo con Engadget, la correspondencia también refleja el temor de ambas compañías a que este tipo de entrenamiento, que incluyó el rastreo de millones de artículos periodísticos, termine debilitando de forma irreversible a la industria de las noticias.
Lo esencial
- Correos internos entre ejecutivos de Microsoft y OpenAI salieron a la luz y fueron reportados por Ars Technica y Engadget.
- Un ejecutivo de Microsoft calificó el scraping de datos para entrenamiento de IA como “el mayor robo de trabajo en la historia de la humanidad”.
- Los mensajes reflejan temor a un “doom loop” (bucle de destrucción) que podría afectar gravemente a los medios de noticias.
- El entrenamiento de ChatGPT involucró el rastreo de millones de artículos de organizaciones periodísticas.
- Los reportes no precisan nombres completos de los ejecutivos ni fechas exactas de los intercambios, más allá de confirmar que se trata de comunicaciones internas entre ambas empresas.
Qué reveló la correspondencia interna
Los correos citados por Ars Technica y Engadget muestran que, dentro de las propias compañías que lideran el desarrollo de inteligencia artificial generativa, existía inquietud sobre las implicaciones éticas y económicas del scraping masivo de contenido. La frase del ejecutivo de Microsoft —“el mayor robo de trabajo en la historia de la humanidad”— resume una tensión que hasta ahora se discutía sobre todo desde afuera, por parte de editores, periodistas y creadores de contenido, pero que según estos reportes también preocupaba a actores clave dentro de la industria de la IA.
Engadget precisa que la inquietud de los ejecutivos se centraba específicamente en el entrenamiento de ChatGPT, que recurrió al rastreo de millones de artículos de noticias para nutrir sus modelos de lenguaje. Esto ocurre en un contexto donde compañías como OpenAI y Microsoft han construido productos de IA generativa a partir de enormes volúmenes de texto extraído de internet, incluyendo contenido periodístico protegido por derechos de autor.
El scraping de datos: qué es y por qué genera controversia
El scraping, o rastreo automatizado de contenido web, consiste en recolectar grandes cantidades de texto, imágenes u otro tipo de datos publicados en sitios de internet para utilizarlos como material de entrenamiento de modelos de inteligencia artificial. En el caso de los modelos de lenguaje como ChatGPT, esto ha incluido artículos noticiosos, publicaciones de blogs, foros y otros formatos de texto disponibles públicamente en la red.
La controversia surge porque este contenido suele ser producido por periodistas, medios de comunicación y creadores independientes que invierten tiempo, recursos y trabajo editorial en generarlo, sin que necesariamente reciban compensación o autorización previa cuando ese material se utiliza para entrenar sistemas comerciales de IA. La comparación hecha por el ejecutivo de Microsoft con un “robo de trabajo” apunta precisamente a esta tensión: el valor generado por el trabajo humano de reportería se traslada, sin remuneración directa, a productos de IA que compiten después por la misma audiencia.
El temor a un “doom loop” para el periodismo
Según Ars Technica, los correos entre Microsoft y OpenAI reflejan el temor a lo que describen como un “doom loop”, es decir, un ciclo de retroalimentación negativa que podría terminar destruyendo a las organizaciones de noticias. La lógica de ese temor es sencilla: si los sistemas de IA generativa absorben y reformulan el contenido periodístico para responder directamente a las consultas de los usuarios, estos podrían dejar de visitar los sitios web originales, lo que reduciría el tráfico y los ingresos publicitarios de los medios. Con menos ingresos, las redacciones tendrían menos capacidad de producir periodismo original, lo que a su vez dejaría menos contenido de calidad disponible tanto para los lectores como para entrenar futuros modelos de IA.
Este escenario, documentado en los correos internos según ambos medios, no es solo una preocupación externa de editores y sindicatos de periodistas, sino que —de acuerdo con lo reportado— también fue objeto de debate dentro de las propias empresas que desarrollan estas tecnologías.
Qué significa esto para creadores de contenido en América Latina
Aunque los correos citados en los reportes se centran en el mercado de noticias en general, sin detalles específicos sobre América Latina, la controversia tiene implicaciones directas para la región. Buena parte del contenido en español disponible en internet —artículos periodísticos, blogs, foros y publicaciones de medios locales— también puede haber sido incluido en los conjuntos de datos utilizados para entrenar modelos de lenguaje como los que impulsan ChatGPT.
Para los medios y creadores independientes de la región, esto plantea preguntas similares a las que preocupan a sus contrapares en Estados Unidos y Europa: si sus artículos son utilizados para entrenar sistemas de IA sin compensación, y si el uso creciente de asistentes de IA generativa por parte de los usuarios latinoamericanos podría reducir el tráfico hacia sus sitios web, afectando sus ingresos publicitarios y su sostenibilidad financiera. Para los usuarios finales, el debate también toca un punto sensible: la calidad y diversidad de la información disponible en español podría verse afectada si los medios que la producen enfrentan dificultades económicas derivadas de este fenómeno.
Qué esperar
Los reportes de Ars Technica y Engadget no detallan qué medidas concretas tomarán Microsoft u OpenAI a partir de estos correos internos, ni si habrá cambios en sus políticas de entrenamiento de datos o en sus acuerdos de licenciamiento con medios de comunicación. Tampoco se precisa si estas comunicaciones influirán en litigios o negociaciones en curso relacionadas con el uso de contenido periodístico para entrenar inteligencia artificial. Lo que sí queda claro, según ambas fuentes, es que la tensión entre el desarrollo de IA generativa y la sostenibilidad de la industria de noticias es reconocida incluso por ejecutivos dentro de las propias compañías que lideran esta tecnología, lo que podría anticipar futuras discusiones públicas, acuerdos comerciales o cambios regulatorios sobre cómo se recopilan y compensan los datos usados para entrenar modelos de IA.

