Anthropic presenta Claude Opus 4.6: IA que programa, investiga y trabaja como profesional

Puede procesar tres novelas sin olvidar una palabra
Claude Opus 4.6 resuelve el problema histórico de los modelos de IA que pierden información en conversaciones largas.
Mark

¿Qué significa realmente que pueda procesar un millón de palabras sin perder el hilo?

Mimi

Significa que puede leer tres novelas completas, recordar detalles de la primera página cuando está en la última, y usar esa información para responder preguntas o completar tareas. Los modelos anteriores empezaban a olvidar o contradecirse después de cierto punto.

Mark

¿Y ese problema de la pudrición del contexto que mencionas? ¿Por qué es tan importante resolverlo?

Mimi

Porque es la diferencia entre un asistente que puede trabajar contigo en un proyecto largo y uno que necesita que le repitas constantemente lo que ya le dijiste. Un abogado revisando un contrato de cien páginas, un programador en un proyecto complejo: necesitan que el modelo recuerde todo.

Mark

Los números en las pruebas son impresionantes, pero ¿qué significa en la práctica que supere a GPT-5.2 por 144 puntos Elo?

Mimi

En tareas profesionales reales —análisis financiero, redacción legal, investigación— Opus 4.6 produce resultados notablemente mejores. No es solo un poco mejor; es una diferencia cualitativa en lo que puede hacer sin supervisión.

Mark

Mencionas que mantiene estándares de seguridad. ¿No es contradictorio que sea más potente y más seguro a la vez?

Mimi

No necesariamente. Anthropic ha invertido en evaluaciones más exhaustivas, en métodos para entender cómo funciona el modelo internamente, en pruebas específicas de ciberseguridad. La potencia sin seguridad sería irresponsable; la seguridad sin potencia sería inútil.

Mark

¿Cuál es el siguiente paso? ¿Qué viene después de esto?

Mimi

Probablemente veremos cómo se comporta en el mundo real, en manos de profesionales que lo usen para trabajos verdaderos. Las pruebas de laboratorio son una cosa; el uso en producción es otra. Y seguramente habrá nuevas preocupaciones que nadie anticipó.

  • Claude Opus 4.6 procesa conversaciones de hasta un millón de palabras sin perder información
  • Logra 76% de precisión en memoria a largo plazo, frente al 18,5% de Sonnet 4.5
  • Supera a GPT-5.2 de OpenAI por 144 puntos Elo en tareas profesionales de alto valor
  • Anthropic aplicó el conjunto más exhaustivo de evaluaciones de seguridad de cualquier modelo hasta la fecha

Claude Opus 4.6 puede mantener contextos enormes sin perder información, superando a competidores en pruebas de programación autónoma y razonamiento complejo multidisciplinar. El modelo resuelve el problema de la 'pudrición del contexto' logrando 76% de precisión en memoria a largo plazo, frente al 18,5% de su predecesor Sonnet 4.5.

Anthropic lanza Claude Opus 4.6, su modelo de IA más potente, capaz de procesar conversaciones de un millón de palabras y realizar tareas profesionales complejas en programación, análisis financiero e investigación con autonomía mejorada.

Anthropic acaba de presentar Claude Opus 4.6, la versión más avanzada de su modelo estrella, y los cambios van mucho más allá de las mejoras incrementales que suelen acompañar a cada lanzamiento. Este sistema puede procesar conversaciones del tamaño de tres novelas completas —hasta un millón de palabras— sin perder el hilo ni contradecirse, una capacidad que lo distingue fundamentalmente de sus competidores.

Lo que hace especial a esta nueva versión, ya disponible, es su capacidad para planificar con cuidado y mantener tareas complejas durante períodos prolongados. En programación, Opus 4.6 navega por proyectos de código extenso con mayor fiabilidad, revisa su propio trabajo y detecta errores que versiones anteriores dejaban pasar. Pero las habilidades van mucho más allá del código: el modelo realiza análisis financieros, lleva a cabo investigaciones, crea y trabaja con documentos, hojas de cálculo y presentaciones, todo con un nivel de autonomía que le permite encadenar tareas sin supervisión constante.

Los números respaldan estas afirmaciones. En Terminal-Bench 2.0, una evaluación centrada en programación autónoma, Claude Opus 4.6 obtiene la puntuación más alta del sector. En el Humanity's Last Exam, un examen multidisciplinar de razonamiento complejo, supera a todos los modelos de la competencia. El dato más revelador quizá sea su rendimiento en GDPval-AA, una prueba que mide el desempeño en tareas profesionales de alto valor en finanzas, derecho y otras áreas: Opus 4.6 supera al siguiente mejor modelo del mercado, el GPT-5.2 de OpenAI, por 144 puntos Elo, y a su propio predecesor por 190 puntos.

Uno de los problemas más frustrantes con los modelos de IA anteriores era lo que se conoce como pudrición del contexto: a medida que las conversaciones se alargan, los sistemas empiezan a perder información, a contradecirse o a olvidar detalles importantes mencionados páginas atrás. Opus 4.6 ataca este problema de frente. En pruebas diseñadas para evaluar la memoria a largo plazo, donde se esconde información relevante entre cientos de miles de palabras, este modelo logra un 76% de acierto, frente al 18,5% de Sonnet 4.5. No se trata solo de que el modelo pueda almacenar mucha información, sino de que pueda usarla eficazmente incluso en conversaciones larguísimas.

Anthropicasegura que Opus 4.6 mantiene, e incluso mejora, los estándares de seguridad de sus predecesores. Según las auditorías automatizadas de la compañía, el nuevo modelo muestra tasas bajas de comportamientos indeseables como el engaño, la adulación excesiva o la cooperación con usos indebidos. Además, presenta la tasa más baja de negativas excesivas —casos en los que el modelo se niega a responder preguntas inofensivas— de cualquier Claude reciente. La empresa ha aplicado el conjunto más exhaustivo de evaluaciones de seguridad de cualquier modelo hasta la fecha, incorporando nuevas pruebas sobre bienestar del usuario, capacidad de rechazar peticiones peligrosas y habilidad para realizar acciones dañinas de forma encubierta. Han comenzado incluso a experimentar con métodos de interpretabilidad para detectar problemas que los tests convencionales podrían pasar por alto.

Conscientes de que las capacidades mejoradas en ciberseguridad pueden usarse tanto para atacar como para defender, Anthropic ha desarrollado seis nuevas sondas especializadas para detectar respuestas potencialmente dañinas en este ámbito, y está utilizando el modelo para encontrar y corregir vulnerabilidades en software de código abierto. Junto al modelo, la compañía ha introducido funcionalidades que permiten aprovecharlo mejor: pensamiento adaptativo, donde Claude puede decidir por sí mismo cuándo necesita pensar más profundamente sobre un problema; niveles de esfuerzo con cuatro opciones que permiten ajustar cuánto trabaja el modelo según las necesidades; y compactación de contexto, que resume automáticamente la información antigua cuando las conversaciones largas se acercan al límite. Para usuarios no técnicos, las mejoras también son notables: Claude en Excel maneja ahora tareas más complejas y prolongadas, puede planificar antes de actuar e inferir la estructura correcta de datos desordenados.

Es como tener un programador experimentado que, además, puede explicarte qué está haciendo en cada momento
— Descripción de Anthropic sobre las capacidades de Opus 4.6 en programación
Contáctanos FAQ