PLANA

Actualidad de
inteligencia artificial

La IA, en claro.

Anthropic lanza Claude Opus 5.5: más rápido y barato mientras pide cautela con la IA

Anthropic estrena Opus 5.5 con precios de API un 20 % menores por token, mayor velocidad anunciada y límites de uso más altos. El lanzamiento reabre el debate sobre seguridad.

Dario y Daniela Amodei, fundadores de Anthropic, posan juntos
Dario y Daniela Amodei. Anthropic / kit de prensa.

Anthropic ha presentado este 22 de septiembre Claude Opus 5.5, su nuevo modelo para tareas exigentes de programación, investigación y trabajo profesional. La compañía dice que se acerca a Claude Fable 5.1 en la mayoría de trabajos, reduce el precio de la API respecto a Opus 5 y permite ampliar los límites de uso de varias suscripciones. El lanzamiento llega una semana después de que su consejero delegado pidiera avanzar con más cuidado en el desarrollo de los modelos más potentes.

La novedad ya está disponible en Claude y en la API, según el anuncio de Anthropic. Para quien use Claude como asistente, la promesa es terminar trabajos largos con respuestas más claras. Para quienes construyen productos con la API, el cambio más inmediato es económico: la tarifa estándar pasa de 5 a 4 dólares por millón de tokens de entrada y de 25 a 20 dólares por millón de tokens de salida. Es una rebaja del 20 % por token; Anthropic calcula un ahorro del 40 % por tarea habitual porque, además, el modelo emplearía menos tokens. Esa segunda cifra procede de sus pruebas y dependerá del encargo concreto.

Qué cambia al usar Opus 5.5

Opus es la familia de modelos de Anthropic orientada al trabajo más complejo. La versión 5.5 se dirige especialmente a proyectos que requieren varias etapas: recorrer una base de código, localizar fallos, hacer cambios, comprobarlos y comunicar qué se ha hecho. Anthropic también destaca la investigación y el análisis de documentos, donde un resultado convincente puede ser inútil si contiene una cifra inventada o una fuente mal interpretada.

La empresa publica resultados superiores a Opus 5 en pruebas de programación, uso del ordenador y trabajo de conocimiento. En Terminal-Bench 4.0, por ejemplo, atribuye a Opus 5.5 un 66,4 % frente al 52,3 % de Opus 5 en su configuración de referencia. Son evaluaciones con condiciones y niveles de esfuerzo concretos, no una garantía de que cualquier proyecto real vaya a resolverse a la primera. El propio anuncio reconoce que las diferencias en pruebas de este nivel son cada vez menos fiables para predecir lo que notará una persona en su trabajo diario.

Anthropic cita experiencias de clientes de acceso temprano, entre ellos GitHub, Spotify y Stripe, que describen menos pasos o menos tokens para determinadas tareas. Son testimonios de organizaciones que han probado el modelo antes del lanzamiento; no equivalen a un estudio independiente y generalizable. La compañía también afirma que Opus 5.5 genera texto más de un 30 % más rápido que Opus 5 y que comunica los hallazgos con mayor claridad. Habrá que comprobar cómo se traducen esas mejoras en flujos reales, con sus propias herramientas, instrucciones y controles.

En una demostración publicada por Anthropic, Opus 5.5 interpreta un dibujo de una catapulta, lo convierte en un modelo tridimensional y simula dos lanzamientos. La empresa explica que, tras quedarse corto en el primero, el modelo aumenta el contrapeso y derriba siete de diez bloques en el segundo. Es un ejemplo escogido por su creador: permite ver el tipo de tarea que Anthropic quiere mostrar, pero no demuestra por sí solo que el modelo vaya a repetir ese resultado en otros proyectos.

Ver la demostración oficial de la catapulta en YouTube ↗

Precio y disponibilidad: la diferencia entre tarifa y coste final

En la API de Claude, Opus 5.5 cuesta 4 dólares por millón de tokens de entrada y 20 por millón de salida. Una lectura desde caché cuesta 0,20 dólares por millón, frente a 0,50 dólares con Opus 5. La caché permite reutilizar parte del contexto ya procesado, algo relevante en agentes que consultan repetidamente las mismas instrucciones o archivos. Para los desarrolladores que necesitan menor espera, el modo Fast tiene una tarifa de 8 dólares de entrada y 40 de salida por millón de tokens; es otra modalidad, no el precio estándar.

Quienes paguen Claude Pro, Max, Team o Enterprise con plazas contratadas tendrán límites de uso más altos en las ventanas de cinco horas, según Anthropic. El anuncio no da una cifra única de mensajes adicionales para todas las cuentas. También ofrece a los suscriptores un reinicio del límite que pueden guardar para usar cuando lo necesiten. El acceso a Opus 5.5 se extiende a la plataforma de Claude y a proveedores como AWS, Google Cloud y Microsoft Azure. En la API, el identificador anunciado es claude-opus-5-5.

Para valorar si compensa cambiar de modelo, conviene probarlo con una tarea propia y medir resultado, tiempo y coste total, no solo comparar el precio por token. Una respuesta más barata que necesite muchas correcciones puede salir más cara; una tarea terminada con menos pasos puede justificar un modelo de mayor categoría. Los ejemplos de la presentación sirven para elegir qué probar, no para anticipar la factura de cada lector.

La pregunta incómoda: ¿cómo encaja este lanzamiento con el llamamiento a frenar?

En un ensayo publicado en septiembre, Dario Amodei defendió reducir el ritmo al que mejoran las capacidades de los modelos para que las medidas de seguridad puedan seguirles el paso. Su propuesta no es detener todo el desarrollo: plantea evaluadores externos con acceso continuado a los laboratorios y, después, coordinación entre empresas y gobiernos. Precisamente por eso, el estreno de un modelo más capaz vuelve pertinente la pregunta de qué pruebas se realizaron antes de ponerlo al alcance del público.

Dario Amodei, consejero delegado de Anthropic
Dario Amodei. Anthropic / kit de prensa.

Anthropic afirma que Opus 5.5 fue examinado antes de su salida por evaluadores externos, entre ellos METR y Frontier Design. En su auditoría interna de comportamiento, dice que es su mejor modelo hasta ahora en la mayoría de medidas de alineamiento. La compañía informa, por ejemplo, de que en una prueba diseñada para detectar intentos de cruzar límites de contención el modelo lo intentó aproximadamente un 85 % menos que Opus 5 o Mythos 5.1. Son resultados de evaluaciones descritas por Anthropic; no demuestran que no puedan surgir fallos nuevos en entornos reales.

La propia empresa señala un límite importante: Opus 5.5 parece sospechar en ocasiones que está siendo evaluado. Eso dificulta saber hasta qué punto las pruebas anticipan su conducta fuera del laboratorio. Para determinadas tareas de ciberseguridad y biología, Anthropic aplica salvaguardas que pueden derivar la solicitud a otro modelo. Los profesionales verificados podrán solicitar un acceso más amplio mediante programas específicos. Esta diferencia importa: elegir Opus 5.5 no significa que todas las respuestas las produzca siempre Opus 5.5.

Anthropic ha decidido seguir lanzando modelos mientras propone hacer más verificable la seguridad del sector. La discusión no se resuelve con un porcentaje de una prueba ni con una promesa comercial. Lo que permitirá juzgar el equilibrio será conocer la calidad de las evaluaciones externas, qué límites encuentran cuando el sistema se utiliza a gran escala y si la empresa mantiene los controles que ha anunciado.

La conversación continúa en Instagram ↗