En el umbral entre la máquina y el experto, investigadores del Center for AI Safety y Scale AI diseñaron una prueba de 2.500 preguntas de nivel doctoral para medir hasta dónde han llegado realmente los grandes modelos de lenguaje. El mejor resultado obtenido hasta ahora, un 48,4% logrado por Gemini 3 Deep Think, revela tanto el asombroso avance de la inteligencia artificial como la distancia que aún la separa del conocimiento humano especializado, que ronda el 90%. Este examen, publicado en Nature y construido por más de mil expertos de cincuenta países, se ha convertido en el espejo más hones
Las IA alcanzan el 48% en el 'Último Examen de la Humanidad', lejos aún del dominio experto
Related Coverage
La Junta de Comisionados de Policía de Los Ángeles aprobó un contrato de 10 años y 235 millones de dólares con Axon Ente…
Telemundo 52 · Sep 22 Amazon Pharmacy expande servicios en español para comunidad hispanohablanteAmazon Pharmacy lanza servicio completo en español con atención farmacéutica 24/7, entrega gratuita y sin requisitos de …
Google News · Sep 22 Cristina Bucsa llega a Shenzhen para las Finales de la Billie Jean King CupLa tenista española Cristina Bucsa ha llegado a Shenzhen para participar en las Finales de la Billie Jean King Cup repre…
Diario AS · Sep 22 Autorradio de menos de 60 euros: CarPlay y Android Auto para coches antiguosUn autorradio de menos de 60 euros permite instalar CarPlay y Android Auto inalámbricos en vehículos antiguos sin modifi…
Bias & Framing
Artículo que presenta resultados de prueba de IA con énfasis en logros tecnológicos, usando lenguaje que sugiere progreso inevitable hacia AGI sin cuestionar implicaciones.
Narrativa de progreso tecnológico inevitable: el artículo enmarca los resultados de IA como 'avances notables' y 'desafíos a la biología', utilizando titulares sensacionalistas que enfatizan capacidades extraordinarias mientras minimiza las limitaciones actuales (48% vs 90% expertos) como 'lejos aún' en lugar de 'significativamente inferior'.
Geopolitical Impact
Los modelos de IA alcanzan el 48% en prueba de expertos mientras la carrera por AGI intensifica la competencia geopolítica entre potencias tecnológicas.
La competencia entre OpenAI, Google (Gemini), Anthropic (Claude) y DeepSeek refleja la rivalidad tecnológica EE.UU.-China. El progreso hacia AGI amplifica la importancia geopolítica del liderazgo en IA, con implicaciones para soberanía tecnológica, seguridad nacional y dominio económico global.
Similar a la carrera espacial de la Guerra Fría, donde el dominio tecnológico determinaba influencia geopolítica; ahora la IA sustituye al espacio como arena de competencia estratégica entre superpotencias.
Economic Lens
Los modelos de IA alcanzan el 48% en prueba experta versus 90% humano, señalando progreso significativo pero distancia considerable hacia AGI, con implicaciones para inversión tecnológica y competitividad sectorial.
Los consumidores experimentarán mejoras graduales en asistentes de IA para tareas complejas, pero seguirán requiriendo expertos humanos para decisiones críticas en salud, finanzas y asesoría profesional. Esto mantiene demanda de profesionales especializados y limita automatización masiva a corto plazo.
Los gobiernos y reguladores deben establecer marcos de evaluación estandarizados para capacidades de IA, similar a este examen. Surge necesidad de políticas sobre formación de trabajadores en sectores donde IA complementa pero no reemplaza expertise humana, y regulaciones sobre transparencia en capacidades reales de sistemas de IA.