Puesto #1 Ecosistema Diario — Los Asistentes Líderes
Anthropic

Claude Opus 5.5

Claude Opus 5.5 es el modelo al que confiaríamos un trabajo enredado y de alto riesgo con la tranquilidad de que volverá con la respuesta correcta. Anthropic asegura que rinde al nivel de su modelo premium, Fable 5.1, en la mayoría de las tareas, pero cuesta menos de la mitad por token. Y ahora escribe como un colega sereno, no como un recién graduado nervioso.

Actualizado 27 de septiembre de 2026 AA Index 58 #1Knowledge Work SOTAAdaptive Thinking
Ideal para

Claude Opus 5.5 es el modelo al que confiaríamos un trabajo enredado y de alto riesgo con la tranquilidad de que volverá con la respuesta correcta. Anthropic asegura que rinde al nivel de su modelo premium, Fable 5.1, en la mayoría de las tareas, pero cuesta menos de la mitad por token. Y ahora escribe como un colega sereno, no como un recién graduado nervioso.

Por qué gana

La puntuación más alta del índice independiente Artificial Analysis Intelligence Index en su lanzamiento (58, esfuerzo máximo). Lidera GDPval-AA v2.1, una prueba de trabajo profesional real, con 1846 Elo, por delante de Fable 5.1 (1735). El precio por token bajó un 20 %, a $4/$20, y la lectura desde caché un 60 %, a $0,20, lo que según Anthropic abarata un 40 % las cargas de trabajo típicas frente a Opus 5. Genera texto más de un 30 % más rápido, y los límites de uso de cinco horas subieron en los planes de pago.

Ten en cuenta

En esfuerzo máximo piensa en voz alta muchísimo: Artificial Analysis midió unos 119.000 tokens de salida por tarea, frente a unos 27.000 de GPT-6 Astra. Así que el precio bajo solo compensa si el trabajo rutinario se queda en el esfuerzo predeterminado. No genera imágenes, el razonamiento ya no se puede desactivar y la mayoría de las peticiones de ciberseguridad se derivan discretamente al antiguo Opus 4.8.

01

Lo que realmente es

La mayoría de los asistentes de IA se comportan como un becario muy rápido. Responden al instante y suenan seguros de sí mismos. Pásales un contrato de alquiler de cuarenta páginas y te devolverán un resumen impecable que se salta justo la cláusula de la página 37, la que de verdad importa.

Claude Opus 5.5 se parece más a la colega veterana que primero se lee el documento entero. Después te dice, en dos frases, cuál es el problema y dónde encontrarlo.

Anthropic lanzó Opus 5.5 el 22 de septiembre de 2026 como primer modelo de su familia Claude 5.5. Se queda con nuestro primer puesto en Ecosistema cotidiano por una razón sencilla: es el modelo que mejor razona con cuidado de todos los que podemos medir, y ya no tiene precio de artículo de lujo.

Qué dicen las pruebas independientes

Dos cifras sostienen casi todo el argumento, y ambas proceden de Artificial Analysis, no del marketing de Anthropic.

La primera es el Artificial Analysis Intelligence Index, una puntuación que combina diez evaluaciones exigentes de razonamiento, ciencia, programación y conocimiento. Con esfuerzo máximo, Opus 5.5 obtuvo 58 en septiembre de 2026. Era el primer puesto de la tabla en su lanzamiento, por delante de GPT-6 Astra y del propio modelo premium de Anthropic, Claude Fable 5.1. (El índice se reescala cada cierto tiempo, así que una puntuación solo tiene sentido al lado de modelos medidos en la misma época).

La segunda es GDPval-AA v2.1, que se parece más a la vida real. En lugar de responder preguntas de examen, los modelos producen entregables auténticos —un modelo en hoja de cálculo, un memorando jurídico, un informe ejecutivo— de 44 profesiones, y los resultados se enfrentan por parejas, como en una clasificación de ajedrez. Opus 5.5 logró 1846 Elo. Fable 5.1 sacó 1735, Opus 5 1708 y GPT-6 Astra 1542.

Las pruebas internas de Anthropic apuntan en la misma dirección. En una de ellas, tres modelos redactaron un informe sobre los resultados trimestrales de una empresa usando una copia de la web en la que costaba encontrar la nota de resultados, y cualquier cifra o cita inventada significaba suspender. Opus 5.5 aprobó 16 veces de 18. Fable 5.1 y Opus 5 no aprobaron ninguna. Eso es exactamente lo que se le pide a un asistente: no solo que sea listo, sino que tenga cuidado con lo que afirma.

El precio, contado con precisión

Quizá hayas leído que Opus 5.5 es «un 40 % más barato». Es cierto, pero conviene entender de dónde sale esa cifra.

  • El precio por token bajó un 20 %: $4 por millón de tokens de entrada y $20 por millón de salida, frente a $5 y $25.
  • La lectura desde caché bajó un 60 %: hasta $0,20 por millón. Cuando haces pregunta tras pregunta sobre el mismo documento largo, el modelo lo vuelve a leer desde una memoria intermedia, y esa relectura es la mayor parte de la factura de los agentes y las herramientas de programación.
  • Con el esfuerzo predeterminado usa menos tokens: según Anthropic, eso es lo que deja las cargas de trabajo típicas un 40 % por debajo de Opus 5.

Para comparar: Fable 5.1 cuesta $10/$50 según su tarifa. Con Opus 5.5 obtienes casi toda la capacidad de Fable por el 40 % de su precio por token. Anthropic llega a decir que, en su propio uso diario, la distancia entre ambos es «menor de lo que sugieren estas puntuaciones».

Ahora escribe como una persona

Una de las quejas más frecuentes sobre Opus 5 era que sus respuestas costaban de seguir: largas, llenas de jerga y con la idea importante escondida en el cuarto párrafo. Anthropic dice que ha trabajado justo en eso. Opus 5.5 empieza por la respuesta, usa palabras más sencillas y sigue las reglas de estilo que le des.

Parece un detalle estético, pero no lo es. Una respuesta que puedes leer en treinta segundos es una respuesta que puedes comprobar. Una respuesta brillante que tienes que descifrar acabarás leyéndola por encima y creyéndotela a ciegas.

La pega, sin rodeos

El esfuerzo máximo tiene mucha sed. En su nivel más alto, Opus 5.5 explora muchos caminos antes de responder. Artificial Analysis midió unos 119.000 tokens de salida por tarea en esfuerzo máximo, frente a unos 27.000 de GPT-6 Astra. Con esos volúmenes, un precio por token más bajo no garantiza una factura por respuesta más baja. La regla práctica es sencilla: déjalo en el esfuerzo predeterminado (medio) para el trabajo diario, donde según Anthropic ya supera en GDPval a Astra con esfuerzo máximo por aproximadamente una quinta parte del coste. Súbelo solo cuando un problema sea de verdad difícil.

No crea imágenes. Claude lee muy bien gráficos, capturas de pantalla y PDF escaneados, pero no genera imágenes, audio ni vídeo. Si quieres una aplicación que lo haga todo, ChatGPT sigue siendo más completo.

Algunas puertas tienen vigilancia. Opus 5.5 es tan capaz en ciberseguridad y biología que Anthropic le aplica salvaguardas adicionales. La mayoría de las tareas de seguridad las resuelve en segundo plano el antiguo Opus 4.8, y ciertas investigaciones de biología exigen unirse al programa de verificación de Anthropic. A la mayoría de la gente nunca le afectará; a los equipos de seguridad, sí.

A quién le conviene

Si tu día consiste en… Recurre a Por qué
Contratos, investigación, informes, modelos financieros Claude Opus 5.5 El mejor trabajo profesional medido; respuestas que se pueden comprobar
«Maneja este programa en mi ordenador y termina el trabajo» GPT-6 Astra Un agente de uso del ordenador más potente y más económico
Una sola aplicación para chat, imágenes y voz ChatGPT La oferta más amplia para el consumidor
Enormes volúmenes de peticiones sencillas GPT-6 Luna Una fracción de céntimo por tarea

El veredicto para el día a día

Para correos rápidos y preguntas informales, casi cualquier asistente moderno sirve. Pero cuando los documentos son un lío, la pregunta es ambigua y equivocarse tiene consecuencias, Claude Opus 5.5 es el asistente en el que más confiamos, y por primera vez esa confianza no viene con precio de lujo.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El modelo más completo que se ha medido: Artificial Analysis le otorgó 58 puntos en su Intelligence Index con esfuerzo máximo en septiembre de 2026: el primer puesto de la tabla en su lanzamiento, por delante de GPT-6 Astra y Claude Fable 5.1.
  • Trabajo de oficina real, no solo preguntas de examen: En GDPval-AA v2.1, que evalúa entregables terminados de 44 profesiones, obtiene 1846 Elo, frente a 1735 de Fable 5.1 y 1708 de Opus 5. En una prueba de Anthropic en la que cada cifra debía poder rastrearse hasta una fuente, aprobaron 16 de sus 18 informes; ni Fable 5.1 ni Opus 5 aprobaron ni una sola vez.
  • Resultados de Fable a menor precio: $4 por entrada y $20 por salida por millón de tokens es el 40 % de lo que cobra Fable 5.1 ($10/$50). La lectura desde caché —volver a leer el mismo documento largo o el mismo código, que es la mayor parte del coste de un agente— bajó un 60 %, hasta $0,20.
  • Más fácil de leer: Anthropic rehízo la forma en que escribe el modelo. Empieza por la conclusión, evita la jerga y respeta tus reglas de estilo. Los primeros probadores en Ramp y Deloitte lo destacaron, y tiene su importancia: un informe que se puede leer por encima es un informe que se puede comprobar.
  • Más rápido y más generoso: Genera el texto más de un 30 % más rápido que Opus 5, y Anthropic amplió los límites de uso de cinco horas en los planes Pro, Max, Team y Enterprise por usuario.

Limitaciones honestas

  • El esfuerzo máximo sale caro: En su nivel más alto, Opus 5.5 explora muchas líneas de razonamiento. Artificial Analysis midió unos 119.000 tokens de salida por tarea en esfuerzo máximo, frente a unos 27.000 de GPT-6 Astra, así que un token más barato no garantiza una respuesta más barata. Las propias cifras de Anthropic muestran que el ahorro está en el esfuerzo predeterminado (medio).
  • Ni imágenes ni estudio de voz: Claude interpreta muy bien imágenes y gráficos, pero no genera imágenes, audio ni vídeo. Si quieres una sola suscripción que también dibuje, ChatGPT sigue siendo la opción más completa para el consumidor.
  • Las salvaguardas desvían parte del trabajo: Como Opus 5.5 es muy capaz en ciberseguridad y biología, la mayoría de las tareas de seguridad pasan a Opus 4.8, y ciertos trabajos de biología requieren el programa de verificación de Anthropic. Los profesionales de la seguridad deben contar con cierta fricción hasta que los aprueben.
  • El razonamiento siempre está activo: Puedes bajar el nivel de esfuerzo, pero ya no desactivar el razonamiento por completo, lo que añade algo de espera a las peticiones triviales.
03

Resumen de Benchmarks

Artificial Analysis Intelligence Index — 58 (n.º 1 en el lanzamiento)

Puntuación compuesta independiente con esfuerzo máximo, medida en septiembre de 2026. La más alta de la tabla en el lanzamiento. Artificial Analysis reescala el índice de vez en cuando, así que compárala solo con modelos medidos en el mismo periodo.

GDPval-AA v2.1 — 1846 Elo

Entregables profesionales reales de 44 profesiones, evaluados por Artificial Analysis. En la tabla de lanzamiento de Anthropic, Fable 5.1 obtiene 1735, Opus 5 1708 y GPT-6 Astra 1542.

Humanity's Last Exam — 67,7 % con herramientas

Cifra de Anthropic en el lanzamiento, con herramientas activadas. En la misma tabla, Fable 5.1 logra un 65,6 % y GPT-6 Astra un 57,2 %. Preguntas multidisciplinares muy difíciles redactadas por especialistas.

OSWorld 2.0 — 81,8 % (puntuación parcial)

Cifra de Anthropic para manejar un escritorio real: hacer clic, escribir y moverse entre aplicaciones. Se puntúa con crédito parcial, así que no es directamente comparable con las cifras de OpenAI de tareas completadas.

Precio — $4 / $20 por millón de tokens, $0,20 de lectura en caché

Un 20 % menos que Opus 5 en tokens y un 60 % menos en lecturas desde caché. Anthropic calcula un coste un 40 % menor en cargas típicas porque, con el esfuerzo predeterminado, el modelo también usa menos tokens. El modo rápido cuesta $8/$40.

04

El Veredicto

Claude Opus 5.5 ocupa nuestro primer puesto en Ecosistema cotidiano porque reúne tres cosas: la mejor puntuación de inteligencia independiente en su lanzamiento, el mejor resultado en trabajo profesional real y un precio que por fin hace práctico el criterio de nivel Fable para el día a día. No es la aplicación que lo hace todo: ChatGPT sigue dibujando y GPT-6 Astra sigue manejando software con más eficiencia. Pero cuando hay que leer algo largo y enrevesado, pensarlo con calma y dar una respuesta que se pueda comprobar, Opus 5.5 es el primero al que recurriríamos. Déjalo en el esfuerzo predeterminado y reserva el máximo para los problemas que lo merecen.

05

Preguntas frecuentes