El 'model collapse' ocurre cuando modelos generativos sucesivos se entrenan con datos producidos por máquinas anteriores, perdiendo progresivamente información de la distribución original. La cultura humana siempre se ha alimentado de cultura, pero con una experiencia corporal detrás; la IA introduce la posibilidad de una cultura que se alimenta únicamente de sus propias representaciones.
Canibalismo digital: cuando la IA aprende de sus propias creaciones
Una máquina cuyo aprendizaje de lo humano ha quedado tan en el pasado que ni tan siquiera sea capaz de recordarlo
¿Por qué debería preocuparme por esto ahora? El contenido generado por IA es todavía una fracción pequeña de Internet.
Pequeña ahora, sí. Pero crece exponencialmente. Y el problema no es solo la cantidad, es que los sistemas aprenden de sí mismos sin que nos demos cuenta. Es un proceso silencioso.
Pero espera. ¿Cuánto contenido sintético hay realmente en Internet ahora mismo? El artículo habla de riesgos futuros, pero ¿tenemos números de cuánto de lo que los modelos ven es ya contenido generado?
Ese es precisamente el punto. No lo sabemos. No hay transparencia sobre el origen. Por eso el artículo insiste en que el verdadero problema es que olvidamos que una máquina lo escribió.
Entonces, ¿el estudio de Nature que mencionas demuestra que esto ya está sucediendo?
Demuestra que cuando los modelos se entrenan sucesivamente con datos sintéticos, pierden información de la distribución original. Es decir, el mundo se vuelve más plano, más predecible.
Pero ese estudio es de 2024. ¿Cuántos modelos principales están realmente siendo entrenados principalmente con datos sintéticos? ¿O es más bien una mezcla?
Probablemente una mezcla todavía. Pero la tendencia es clara. Y el riesgo es que no nos demos cuenta hasta que sea demasiado tarde.
¿Qué significaría demasiado tarde?
Que Internet se haya convertido en un espejo de sí mismo. Que todo suene razonable pero nada sea sorprendente. Que hayamos perdido la capacidad de aprender cosas nuevas.
Aunque el artículo también dice que esto no es inevitable. Que si controlamos la procedencia de los datos y combinamos sintéticos con reales, podemos evitarlo.
Exacto. El colapso no es una profecía. Es una advertencia. Y la solución existe. Solo necesitamos ser intencionales al respecto.
El Pulso
- Estudio de Nature 2024: model collapse ocurre cuando modelos sucesivos se entrenan con datos sintéticos
- Las rarezas y casos extremos desaparecen primero en el colapso del modelo
- La cultura humana siempre ha tenido una experiencia corporal detrás; la IA introduce cultura sin cuerpo
- El colapso no es inevitable si se combinan datos sintéticos con reales y se controla procedencia
El 'model collapse' ocurre cuando modelos generativos sucesivos se entrenan con datos producidos por máquinas anteriores, perdiendo progresivamente información de la distribución original. La cultura humana siempre se ha alimentado de cultura, pero con una experiencia corporal detrás; la IA introduce la posibilidad de una cultura que se alimenta únicamente de sus propias representaciones.
A medida que Internet se llena de contenido generado por IA, los modelos comienzan a entrenarse con datos sintéticos, creando un bucle autorreferencial que puede degradar la diversidad y originalidad del aprendizaje automático.
Internet se está llenando de contenido fabricado por máquinas. Textos, imágenes, voces sintéticas aparecen cada día en más rincones de la red. Y aquí comienza un problema que nadie imaginó del todo: los sistemas de inteligencia artificial que aprendieron del mundo humano ahora están aprendiendo de sí mismos.
Durante años hemos alimentado a la IA como si fuera una criatura hambrienta. Le dimos libros, fotografías, películas, conversaciones, código, dibujos, páginas web. Cantidades de información que ningún ser humano podría procesar en cientos de vidas. El sistema aprendió a representar el mundo porque le mostramos el mundo. Pero el mundo que le ofrecemos ahora es diferente. Contiene cada vez más cosas que ella misma ha creado.
Un modelo genera un texto y lo publica en la web. Otro modelo lo encuentra y aprende de él. Genera su propio texto. Ese texto vuelve a Internet. Una tercera máquina lo utiliza como material de entrenamiento. Es un bucle cerrado, una máquina comiéndose sus propias creaciones. Los investigadores tienen un nombre para lo que sucede después: model collapse, colapso del modelo. Un estudio publicado en Nature en 2024 mostró que cuando los modelos generativos se entrenan sucesivamente con datos producidos por máquinas anteriores, pierden progresivamente información de la distribución original. Las rarezas desaparecen primero. Los casos extremos se borran. La representación del mundo se estrecha.
Imaginemos una biblioteca donde cada generación de escritores solo pudiera leer los libros de la generación anterior. Al principio casi nada cambiaría. Pero después los argumentos comenzarían a repetirse. Las palabras se volverían predecibles. Los personajes se parecerían entre sí. Las excepciones desaparecerían. Los estilos extravagantes se borrarían. Los errores de un escritor se convertirían en convenciones para el siguiente. Después de muchas generaciones, todos los libros serían impecables y soporíferamente parecidos, no porque alguien lo hubiera decidido, sino porque el sistema habría eliminado poco a poco todo lo que se encontraba fuera de lo más probable. Algo semejante puede ocurrir con los datos sintéticos.
Aquí aparece una paradoja contemporánea: la inteligencia artificial necesita Internet para aprender, pero la inteligencia artificial está transformando Internet en algo de lo que resulta cada vez más difícil aprender. No porque el contenido generado por IA sea necesariamente malo. Una imagen artificial puede ser extraordinaria. Un texto generado por un modelo puede resultar útil, preciso o incluso hermoso. El problema aparece cuando ya no sabemos distinguir el origen. Durante siglos, la cultura ha sido una cadena de transformaciones: un escritor lee a otro escritor, un pintor mira a otro pintor, un músico samplea y compone. Pero detrás de esas operaciones existe una experiencia del mundo. Una persona ha visto llover, ha perdido a alguien, ha estado en un lugar, ha sentido miedo. Ha observado un rostro durante demasiado tiempo. Incluso cuando la cultura se alimenta de cultura, existe en algún punto un cuerpo mirando. La inteligencia artificial introduce una posibilidad diferente: una cultura que empieza a alimentarse de sus propias representaciones.
Los modelos generativos no buscan exactamente la verdad, sino regularidades. Aprenden qué suele aparecer después de qué, qué imágenes se parecen a otras, qué palabras tienen mayor probabilidad de acompañarse. Su extraordinaria capacidad procede de esa gigantesca operación estadística. Pero lo interesante de una cultura no siempre es lo probable. A veces es precisamente lo improbable. La cultura humana está llena de obras irrepetibles. Una máquina, en cambio, parece sentirse tentada estadísticamente hacia lo reconocible. Si los modelos se alimentan cada vez más de contenidos generados artificialmente, existe el riesgo de que las siguientes generaciones aprendan una versión ya filtrada del mundo: una realidad suavizada por todas las máquinas anteriores.
El resultado no tendría por qué ser una catástrofe visible. Quizá no aparezca ningún día una pantalla anunciando que Internet ha dejado de ser humano. Sería algo mucho más silencioso: los textos comenzarán a parecerse ligeramente más entre sí, las imágenes repetirán determinadas composiciones, las metáforas se volverán familiares, las respuestas sonarán narcóticamente razonables. Cada generación sería un poco más parecida a la anterior. Existe una palabra para describir buena parte de nuestra relación con este fenómeno: canibalismo digital. La imagen recuerda a ciertas mitologías del eterno retorno: una criatura que devora su propia cola y descubre que, al hacerlo, también está devorando el espacio que necesita para existir.
Pero hay una diferencia importante entre esta metáfora y una profecía apocalíptica: el colapso de modelos no es inevitable. La investigación ha mostrado que los datos sintéticos pueden utilizarse de manera eficaz cuando se combinan adecuadamente con datos reales y se controla su procedencia. El problema no es que una máquina escriba un texto. El problema es que olvidemos que lo ha escrito una máquina. Quizá por eso en el futuro de la inteligencia artificial, una de las palabras más importantes no sea generación, sino origen: quién hizo esta imagen, de dónde procede este texto, qué parte de este conjunto de datos fue producida por seres humanos. Tendemos a pensar que el gran problema de la IA consistirá en distinguir entre el ser humano y la máquina. Pero tal vez el problema futuro sea otro: distinguir entre una máquina que ha aprendido de nosotros y una máquina cuyo aprendizaje de lo humano ha quedado tan en el pasado que ni tan siquiera sea capaz de recordarlo.
Citas Notables
La máquina ha empezado a comerse sus propios sueños— Análisis del artículo sobre el bucle autorreferencial de la IA
El problema no es que una máquina escriba un texto, el problema es que olvidemos que lo ha escrito una máquina— Conclusión central del análisis