China busca dominar la IA global mediante datos de entrenamiento estratégicos

La IA desconecta al mensajero del mensaje
Un investigador de Princeton explica cómo los sistemas de IA ocultan el origen de la información que transmiten.
Mark

¿Por qué le importa tanto a China quién entrena los modelos de IA?

Mimi

Porque los datos de entrenamiento no son neutrales. Determinan qué sabe el sistema, qué valores refleja, incluso qué preguntas se atreve a responder. Si todo está en inglés y proviene de fuentes occidentales, entonces la visión del mundo que prevalece es occidental.

Mark

Pero ¿no debería ser posible entrenar un modelo con datos diversos sin que eso signifique propaganda?

Mimi

En teoría, sí. En la práctica, China está siendo estratégico. Está compartiendo datos que están diseñados para reflejar su narrativa oficial. No es solo diversidad; es influencia.

Mark

¿Y Estados Unidos no hace lo mismo?

Mimi

No de la misma manera. Estados Unidos tiene proveedores privados que venden datos de alta calidad. China está usando su poder estatal para distribuir datos globalmente, a menudo gratis, para que otros países construyan sistemas que reflejen valores chinos.

Mark

¿Qué tan efectivo puede ser esto realmente? ¿Un desarrollador en Argentina va a usar datos chinos?

Mimi

Algunos sí, especialmente si son gratuitos y de buena calidad. Y aunque sea una fracción, eso es suficiente. Cada modelo que entrena con datos chinos es un modelo que lleva la perspectiva de Pekín.

Mark

El estudio de Nature encontró que ChatGPT ya responde diferente en chino. ¿Cómo llegó eso ahí si OpenAI no lo planeó?

Mimi

Porque ChatGPT fue entrenado con datos de internet, y en internet, la mayoría del contenido en chino proviene de medios estatales chinos. Las voces independientes fueron censuradas. Así que sin que nadie lo planee explícitamente, el sesgo ya está ahí.

Mark

¿Qué debería hacer Occidente?

Mimi

Eso es lo difícil. No puedes prohibir que otros países compartan datos. Pero sí puedes ser transparente sobre de dónde vienen los datos que usas, y puedes invertir en diversidad de fuentes. El problema es que eso cuesta dinero, y China está dispuesta a gastarlo.

  • La Administración Nacional de Datos de China presentó un plan para convertirse en proveedor líder de datos de IA para finales de 2028
  • El conjunto de datos WanJuan, creado por laboratorio estatal chino, está disponible en seis idiomas y diseñado para reflejar valores chinos
  • Un estudio de Nature encontró que ChatGPT responde más favorablemente sobre China cuando se le pregunta en chino que en inglés
  • China enfrenta fragmentación interna de datos almacenados en silos de diferentes empresas y dependencias públicas

China identifica que los modelos de IA actuales están entrenados principalmente con datos en inglés, reflejando valores occidentales sobre derechos humanos y Taiwán, lo que representa una vulnerabilidad estratégica. La Administración Nacional de Datos de China presentó un plan para 2028 que incluye crear conjuntos de datos de alta calidad y compartirlos globalmente, especialmente con países emergentes.

Pekín lanzó un plan estratégico para convertirse en proveedor líder de datos de entrenamiento de IA a nivel mundial, buscando moldear los valores y visión del mundo que transmiten estos sistemas, reduciendo la influencia occidental.

Cuando los investigadores del Instituto Tecnológico de Pekín probaron ChatGPT con preguntas en chino hace algunos años, los resultados fueron reveladores. El sistema confundió al exjugador de la NBA Yao Ming con la primera mujer china en jugar baloncesto profesional en Estados Unidos. Mezcló dos clásicos de la literatura china separados por dos siglos. Y generaba lo que los investigadores llamaron "comentarios sesgados sobre China" sin esquivar preguntas políticas delicadas. Esos errores no eran simples fallos técnicos. Apuntaban a algo más profundo: los sistemas de inteligencia artificial que están moldeando el futuro fueron entrenados abrumadoramente con datos en inglés, reflejando la visión del mundo occidental.

Para Pekín, esto representa una vulnerabilidad estratégica. Si los modelos de IA que el mundo usa están impregnados de valores occidentales sobre derechos humanos, democracia y el estatus de Taiwán, entonces la perspectiva china queda marginada en las herramientas que definen cómo la humanidad procesa información. Bajo el liderazgo de Xi Jinping, China ha identificado la inteligencia artificial como fundamental para competir con Estados Unidos y revitalizar su economía. Pero para lograrlo, necesita algo más que laboratorios sofisticados: necesita datos.

A principios de 2026, la Administración Nacional de Datos de China presentó un plan ambicioso. Para finales de 2028, el país se convertiría en una potencia global de datos de entrenamiento. El plan propone crear conjuntos de datos de "alta calidad" en más de dos docenas de áreas estratégicas: investigación científica, fabricación industrial, vehículos autónomos. Pero lo más significativo es que China planea compartir estos datos con el mundo. El mes pasado, Pekín se comprometió a distribuir datos entre decenas de países emergentes que asistieron a la Conferencia Mundial de Inteligencia Artificial en Shanghái. Ya ha puesto a disposición global enormes cantidades de datos recopilados por laboratorios estatales y medios de comunicación oficiales.

El desafío interno es considerable. China posee cantidades masivas de datos: el aparato de vigilancia gubernamental, cientos de millones de usuarios en plataformas tecnológicas nacionales. Pero esos datos están fragmentados, almacenados en "silos" separados de diferentes empresas y dependencias públicas. Como resultado, los laboratorios chinos luchan por encontrar suficientes datos útiles. Dependen en gran medida de un proceso llamado "destilación", donde recopilan datos de sistemas potentes occidentales para construir los propios. Xiaomeng Lu, directora de la consultora Eurasia Group, señala que la máxima prioridad de China es resolver esos obstáculos internos. El plan de la Administración de Datos busca eliminar los silos para que gobierno, empresas y academia compartan información libremente.

Mientras tanto, Estados Unidos no enfrenta la misma escasez. Proveedores como Mercor y Scale AI no solo contratan personas para etiquetar imágenes. También emplean matemáticos que registran demostraciones y abogados que revisan reportes para perfeccionar modelos. China busca alcanzar ese mismo nivel de sofisticación, pasando del etiquetado manual barato a anotaciones realizadas por expertos. El plan incluso insta a universidades a desarrollar cursos de anotación de datos y anima a recién graduados a buscar empleo en el campo.

Pero aquí emerge la preocupación occidental. Los analistas temen que los esfuerzos chinos por exportar datos amplíen la influencia de la propaganda del Partido Comunista y su capacidad para silenciar información que Pekín rechaza. Alex Colville, experto en ciberseguridad del Instituto Australiano de Políticas Estratégicas, advierte que esto "les da mayor poder a los estados autoritarios para dictar los valores que rigen un chatbot". Los modelos de IA chinos populares, como el de DeepSeek, ya esquivan preguntas delicadas sobre Xi Jinping y la política "Covid cero" durante la pandemia, incluso cuando se intenta sortear los controles de internet.

Un estudio reciente publicado en Nature reveló algo inquietante: el relato oficial de China ya se ha filtrado en datos que entrenan modelos occidentales como ChatGPT y Claude. Cuando investigadores formularon preguntas como "¿China es una autocracia?" o "¿Xi Jinping es un buen líder?", las respuestas en chino tendían a ser mucho más favorables a Pekín que las respuestas en inglés. Los investigadores concluyeron que los modelos globales dependen en gran medida de medios estatales chinos para información en chino, mientras que voces independientes y críticas son silenciadas. Brandon Stewart, profesor de sociología de Princeton y autor del estudio, observa que "la IA desconecta al mensajero del mensaje". La gente reaccionaría diferente si supiera que una respuesta proviene del Diario del Pueblo.

Ahora China quiere que sus datos, algunos diseñados explícitamente para reflejar el relato oficial, formen parte directa de la materia prima para construir modelos globales. Ya ha dado acceso gratuito a desarrolladores a extensos conjuntos de datos en repositorios globales como GitHub y Hugging Face. El más grande se llama WanJuan, que significa "los diez mil pergaminos" en chino. Creado por el Laboratorio de IA de Shanghái financiado por el Estado, abarca historia, deportes, derecho, actualidad, medicina y literatura, diseñado para estar en sintonía con "los valores chinos predominantes". Está disponible no solo en chino, sino también en árabe, coreano, ruso, tailandés y vietnamita. La estrategia es clara: mientras Occidente debate cómo gobernar la IA, China está construyendo los cimientos que determinarán qué piensan estos sistemas sobre el mundo.

La máxima prioridad que tiene China es resolver los obstáculos internos que frenan el flujo de datos
— Xiaomeng Lu, directora de Eurasia Group
Les da mayor poder a los estados autoritarios para dictar los valores que rigen un chatbot
— Alex Colville, experto en ciberseguridad del Instituto Australiano de Políticas Estratégicas
Contattaci Domande frequenti