Una investigación publicada en PNAS Nexus este junio revela que los modelos de lenguaje más avanzados —GPT-4o, Claude 3.5 Sonnet y sus sucesores— colapsan en su capacidad de resolver instrucciones contradictorias con apenas 40 palabras de contexto, cayendo por debajo del 50% de precisión. No se trata de un fallo de entrenamiento ni de escala, sino de una limitación inscrita en la arquitectura misma de los transformers: carecen del equivalente funcional de las redes frontales del cerebro humano, aquellas que permiten mantener prioridades bajo interferencia. En un momento en que startups de todo
LLM Performance Collapses Under Conflicting Instructions, Study Warns
Related Coverage
Expansión publica su primera edición cubriendo desarrollos en Singular Bank, Samsung, Apple, Shein, Alibaba y tendencias…
Google News · Aug 24 Las mejores ofertas de Amazon del 24 de agosto: descuentos hasta 47% en marcas premiumAmazon presenta sus mejores ofertas del día 24 de agosto con descuentos de hasta 47% en marcas como Salomon, Oral-B y ad…
La Razón · Aug 24 Las 10 mejores ofertas de hoy en Amazon: descuentos de hasta el 47% en Salomon, adidas y másRecopilación de diez productos en oferta en Amazon con descuentos de hasta el 47%, incluyendo zapatillas Salomon, prenda…
Cinco Días · Aug 24 Mapfre apuesta por IA híbrida y rechaza automatización total por seguridad y sesgosMapfre defiende un modelo híbrido de inteligencia artificial donde humanos y máquinas conviven, rechazando automatizació…
Bias & Framing
Article uses alarmist framing ('collapse,' 'severe degradation') to present LLM limitations, emphasizing business risk while lacking nuance on study scope and practical implications.
Crisis framing with business-risk emphasis. The article positions academic findings as urgent operational threats requiring 'immediate mitigation,' appealing to startup founders' risk aversion. Uses dramatic language ('colapso casi total') and selective emphasis on worst-case scenarios.
Geopolitical Impact
Study reveals fundamental LLM architectural limitations under conflicting instructions, not a geopolitical issue requiring international assessment.
Economic Lens
Study reveals leading LLMs (GPT-4o, Claude 3.5) experience severe performance collapse below 50% accuracy when resolving conflicting instructions in short contexts, exposing fundamental transformer architecture limitations with significant implications for enterprise AI deployment.
Consumers and businesses relying on LLM-powered applications for document review, legal analysis, customer support, and complex decision-making face reliability risks. Enterprise customers may experience degraded service quality in AI systems handling nuanced instructions with conflicting parameters, potentially requiring human oversight and increasing operational costs.
Regulatory bodies may require transparency disclosures about LLM limitations in high-stakes applications (legal, financial, healthcare). Enterprise AI governance frameworks will likely mandate human-in-the-loop validation for conflict resolution tasks. Standards bodies may establish baseline performance requirements for LLM deployment in critical business processes.