El modelo de IA de Google lidera la evaluación del CDC para pronósticos de hospitalizaciones por gripe

Un modelo de lenguaje grande escribe, prueba y refina software de pronóstico automáticamente
El sistema ERA de Google genera algoritmos de optimización sin intervención humana directa en cada paso.
Mark

¿Por qué importa que Google haya ganado esta competencia de pronósticos de gripe? ¿Qué cambia en la práctica?

Mimi

Los pronósticos precisos ayudan a los CDC a saber dónde asignar medicamentos antivirales, cómo preparar hospitales para oleadas de pacientes, y cuándo comunicar al público sobre vacunación. Si Google puede predecir mejor dónde subirán las hospitalizaciones, eso significa menos sorpresas y mejor preparación.

Luke

Pero aquí hay algo importante: el conjunto FluSight, que es lo que el CDC realmente usa para comunicar sus mensajes, quedó en séptimo lugar. El modelo de Google fue el mejor entre las presentaciones individuales, pero no está claro si el CDC lo incorporará en sus comunicaciones públicas.

Mark

Entonces, ¿el modelo de Google es mejor pero no necesariamente más útil?

Mimi

No exactamente. El conjunto FluSight combina múltiples modelos, y eso tiene valor. Pero sí, el modelo de Google fue el mejor desempeño individual. Y lo interesante es cómo lo hizo: usando una herramienta de IA que escribe y refina automáticamente software de pronóstico.

Luke

Aunque hay que notar que los pronósticos tuvieron problemas reales. Menos del 25 por ciento de los intervalos de predicción a dos semanas capturaron los valores observados alrededor del pico. Eso es bastante malo. El modelo de Google fue el mejor, pero "el mejor" en una temporada donde muchos pronósticos fallaron.

Mark

¿Cómo funciona exactamente el sistema de Google?

Mimi

Usa algo llamado ERA, Empirical Research Assistance. Un modelo de lenguaje grande guía una búsqueda que escribe, prueba y refina código de pronóstico automáticamente. Es como si la IA estuviera escribiendo sus propios algoritmos.

Luke

Y eso es interesante, pero el preprint que lo describe fue publicado en mayo de 2026, después de que la temporada ya había terminado. Así que estamos viendo resultados retrospectivos de un sistema que fue evaluado en tiempo real, pero la documentación completa llegó después.

Mark

¿Qué tan confiable es decir que este sistema es mejor que los conjuntos curados manualmente?

Mimi

El preprint reporta que los conjuntos generados automáticamente funcionaron tan bien o mejor que los conjuntos curados manualmente del CDC. Eso es una afirmación fuerte.

Luke

Pero eso es lo que dice el preprint de Google. El CDC no ha hecho esa comparación directa en su evaluación oficial. El CDC evaluó 39 modelos individuales. Google fue el mejor entre ellos. Eso es verificable. La afirmación sobre superar a los conjuntos curados manualmente viene de la investigación de Google, no de la evaluación del CDC.

Mark

¿Qué viene después? ¿Usará el CDC el modelo de Google?

Mimi

Los CDC, los socios de FluSight y las partes interesadas se reúnen al final de cada temporada para revisar los enfoques y planificar las próximas. Así que es posible que incorporen el modelo de Google o aprendan de él.

Luke

Pero eso no está confirmado. Lo que sabemos es que Google ganó la evaluación de esta temporada. Lo que suceda con eso es una pregunta abierta.

  • El modelo Google_SAI-FluEns encabezó una competencia de 39 modelos evaluados por los CDC, superando a equipos académicos, industriales y gubernamentales en precisión de pronósticos de hospitalización.
  • La temporada 2025-2026 expuso los límites del sistema: menos del 25% de los intervalos de predicción a dos semanas capturaron los valores reales durante el pico de diciembre, evidenciando que incluso los mejores modelos fallaron en los momentos más críticos.
  • Google construyó su ventaja usando ERA, una herramienta de IA que genera, prueba y refina algoritmos de forma autónoma, sin intervención humana directa en cada ciclo de mejora.
  • El conjunto oficial FluSight de los CDC quedó en séptimo lugar, aunque sigue siendo el instrumento de comunicación pública, lo que plantea preguntas sobre qué modelos deben guiar las decisiones sanitarias reales.
  • Los CDC planean incorporar nuevos objetivos de pronóstico para temporadas futuras, reconociendo que la competencia anual ha impulsado mejoras sostenidas desde su inicio en 2013.

En el otoño de 2026, los CDC revelaron que la inteligencia artificial de Google superó a 38 modelos rivales en la tarea de anticipar hospitalizaciones por gripe en Estados Unidos durante la temporada 2025-2026. El hallazgo no es solo un triunfo técnico: es una señal de que las máquinas capaces de escribir y refinar su propio software predictivo están comenzando a integrarse en la vigilancia de la salud pública. Como ocurre con toda herramienta poderosa, su valor último dependerá de cómo la experiencia humana guíe su aplicación.

A finales de septiembre de 2026, los CDC publicaron los resultados de su evaluación anual de modelos de pronóstico de gripe, y el veredicto fue contundente: Google_SAI-FluEns ocupó el primer lugar entre 39 modelos elegibles, seleccionados de 53 presentaciones iniciales de 34 equipos. Para calificar, cada modelo debía haber entregado al menos el 75% de sus pronósticos semanales. De los que pasaron el filtro, 33 superaron la línea base FluSight, un modelo de referencia que simplemente proyecta las admisiones de la semana anterior.

Google construyó su modelo con ERA —Empirical Research Assistance—, una herramienta que emplea un modelo de lenguaje grande para guiar una búsqueda en árbol que escribe, prueba y refina software de pronóstico de manera autónoma. Un preprint de mayo de 2026, elaborado junto con la Universidad de Massachusetts Amherst, documentó cómo el sistema generó modelos para gripe, COVID-19 y virus sincitial respiratorio, con conjuntos automáticos que igualaron o superaron a los curados manualmente por los CDC.

La temporada fue clasificada como moderada. Las hospitalizaciones escalaron desde mediados de noviembre de 2025 y alcanzaron su pico en la semana del 27 de diciembre, con más de 40 mil admisiones semanales. Aun así, los modelos enfrentaron dificultades reales: los intervalos de predicción del conjunto FluSight no anticiparon bien los aumentos de fin de año ni las caídas de enero, y cerca del pico, menos del 25% de las predicciones a dos semanas contenían los valores realmente observados.

El conjunto FluSight oficial de los CDC —el que se usa para comunicar mensajes al público— terminó en séptimo lugar, aunque fue uno de los 12 modelos que superó consistentemente la línea base en todas las jurisdicciones. Google interpretó su resultado como validación de que la IA combinada con la ingeniosidad humana puede mejorar la vigilancia epidemiológica a escala global. Los CDC, por su parte, planean revisar enfoques e incorporar nuevos objetivos de pronóstico para las próximas temporadas, continuando un programa que lleva más de una década perfeccionando la capacidad de anticipar el impacto de la influenza.

A finales de septiembre de 2026, los Centros para el Control y la Prevención de Enfermedades publicaron los resultados de su evaluación anual de pronósticos de gripe, y el hallazgo fue claro: un modelo de inteligencia artificial desarrollado por Google superó a todos los demás en su capacidad para predecir dónde y cuándo aumentarían las hospitalizaciones por influenza en Estados Unidos durante la temporada 2025-2026.

El modelo, llamado Google_SAI-FluEns, se ubicó en primer lugar entre 39 modelos elegibles que fueron evaluados durante la temporada. Estos 39 modelos fueron seleccionados de un conjunto inicial de 53 presentaciones de 34 equipos académicos, industriales y gubernamentales. Para calificar, cada modelo debía haber presentado al menos el 75 por ciento de sus pronósticos semanales. El CDC excluyó los pronósticos nacionales de la puntuación debido a diferencias metodológicas de escala, y también descartó los pronósticos para Puerto Rico por falta de datos suficientes. De los 39 modelos que pasaron el filtro, 33 demostraron un desempeño superior al de la línea base FluSight, un modelo de referencia que simplemente proyecta hacia adelante las admisiones de la semana anterior.

Google desarrolló su modelo usando una herramienta llamada Empirical Research Assistance, o ERA, que la compañía describe como un sistema capaz de generar algoritmos de optimización en diversos campos científicos. Según Zahra Shamsi, investigadora de Google Research, el sistema funciona de manera autónoma: un modelo de lenguaje grande guía una búsqueda en árbol que escribe, prueba y refina software de pronóstico ejecutable. Un preprint publicado en mayo de 2026 por investigadores de Google y la Universidad de Massachusetts Amherst documentó cómo el sistema generó modelos para influenza, COVID-19 y virus sincitial respiratorio durante la temporada 2025-2026, utilizando metodologías variadas. Los autores reportaron que los conjuntos construidos a partir de los modelos generados automáticamente funcionaron tan bien o mejor que los conjuntos curados manualmente por los CDC.

La temporada 2025-2026 fue clasificada por los CDC como moderada en severidad. Las hospitalizaciones comenzaron a aumentar a mediados de noviembre de 2025 y alcanzaron su pico nacional en la semana que terminó el 27 de diciembre de 2025, cuando el número semanal máximo de admisiones superó los 40 mil casos. Sin embargo, los pronósticos enfrentaron desafíos significativos. Los intervalos de predicción del conjunto FluSight al 50 y 95 por ciento no anticiparon adecuadamente los aumentos observados a finales de diciembre ni las disminuciones a mediados de enero de 2026. Alrededor de la semana pico, menos del 25 por ciento de los intervalos de predicción a dos semanas de horizonte en todas las jurisdicciones contenían los valores realmente observados.

El CDC solicitó pronósticos semanales desde noviembre de 2025 hasta mayo de 2026, publicándolos por primera vez en su sitio web FluSight el 12 de diciembre de 2025. Los pronósticos se enfocaron en admisiones hospitalarias semanales por influenza para la semana actual y hasta tres semanas en el futuro para cada estado, Washington D.C., y Puerto Rico, utilizando datos de la Red Nacional de Atención Médica y Seguridad. Los datos finales utilizados para la puntuación se publicaron el 1 de julio de 2026. La evaluación se realizó principalmente mediante el puntaje de intervalo ponderado relativo, una medida estándar que compara qué tan estrechamente los intervalos de predicción de un modelo se alinean con lo que realmente ocurrió. Un puntaje inferior a 1 indica desempeño mejor que la línea base.

El conjunto FluSight, el pronóstico combinado que el CDC utiliza para comunicar sus mensajes públicos, se ubicó en séptimo lugar en general para la temporada en la métrica de rendimiento principal, aunque fue uno de los 12 modelos que superó consistentemente la línea base en todas las jurisdicciones. Entre las presentaciones individuales de equipos, sin embargo, Google_SAI-FluEns fue el mejor desempeño.

Los pronósticos de gripe del CDC están diseñados para predecir con antelación cuándo y dónde pueden producirse aumentos en hospitalizaciones, información que puede orientar la asignación de tratamientos antivirales, la preparación para oleadas de pacientes, la distribución del personal sanitario, camas hospitalarias y recursos de tratamiento. El programa comenzó en 2013 con el "Predict the Influenza Season Challenge" y ha continuado anualmente desde entonces, excepto en 2020-2021 cuando la actividad limitada de influenza impidió pronósticos estables. Google afirmó que el resultado valida su confianza en que la inteligencia artificial combinada con la ingeniosidad humana mejorará la capacidad de pronosticar enfermedades a nivel mundial. Los CDC, los socios de FluSight y las partes interesadas se reúnen al final de cada temporada para revisar los enfoques, discutir la precisión y planificar las próximas temporadas, incluida la incorporación de nuevos objetivos de pronóstico.

Los pronósticos precisos pueden orientar la asignación de tratamientos antivirales, la preparación para oleadas de hospitalizaciones, la distribución del personal sanitario y recursos de tratamiento
— Centros para el Control y la Prevención de Enfermedades
El resultado valida nuestra confianza en que la IA combinada con la ingeniosidad humana mejorará la capacidad de pronosticar enfermedades a nivel mundial
— Google
Envie de l'histoire complète ? Lire l'original sur Unite.AI ↗
Nous contacter FAQ