Claude Opus 5.5 llega más rápido y un 40% más barato que Opus 5

by Tecnoandroid
Claude Opus 5.5 llega más rápido y un 40% más barato que Opus 5

Claude Opus 5.5 llega con una idea bien clara en mente: no basta con puntuar alto en las pruebas, hay que hacer más trabajo real gastando menos. Durante mucho tiempo comparar grandes modelos de inteligencia artificial parecía fácil, bastaba mirar quién sacaba la nota más alta en una tanda de benchmarks. Pero cuando estos sistemas empiezan a trabajar durante horas sobre proyectos enteros, esa comparación se queda corta. Ahora también cuenta cuánto cuesta terminar una tarea, cuántos pasos necesita el agente para resolverla y hasta qué punto respeta los límites mientras trabaja. Y justo ahí es donde el nuevo modelo de referencia de Anthropic quiere marcar la diferencia, apostando por capacidad, eficiencia y control a partes iguales.

Más rápido y bastante más barato que Opus 5

Este modelo inaugura la nueva familia 5.5 y manda a Opus 5 al segundo plano en lo alto del catálogo. Anthropic dice que genera respuestas más de un 30% más rápido y recorta cerca de un 40% el coste de las cargas habituales. El precio de entrada en la API baja a unos 4 euros por millón de tokens, frente a los 5 euros de antes, mientras que la salida pasa de unos 25 a 20 euros y las lecturas de caché caen de 0,50 a 0,20 euros por millón. La compañía sube además los límites de uso en los planes Pro, Max, Team y Enterprise, y ya prepara la llegada de Sonnet 5.5 y Haiku 5.5 en las próximas semanas.

El salto de rendimiento se nota sobre todo en programación agéntica, uso autónomo del ordenador y trabajo profesional. En Terminal-Bench 4.0 alcanza un 66,4%, frente al 52,3% de Opus 5, y en GDPval-AA v2.1 llega a 1846 Elo. Aun así, Anthropic insiste en que esas pequeñas diferencias entre benchmarks dicen cada vez menos sobre la experiencia real. Y hay ejemplos que ayudan a entenderlo: un evaluador usó el modelo para completar una migración de 680.000 líneas de código en menos de un día, y otro revisó y corrigió una base de 200.000 líneas en menos de tres horas, cuando con Opus 5 habría necesitado más de 20 horas.

Seguridad, límites y trabajo real por delante de los números

La eficiencia pesa probablemente tanto como el aumento de potencia. Según Anthropic, el modelo necesita menos tokens y menos pasos para terminar tareas complejas, lo que baja el tiempo y el coste cuando un agente trabaja durante sesiones largas. En sus comparaciones internas consigue resultados parecidos o mejores que GPT-6 Astra usando una fracción del coste por tarea. GitHub también asegura que en sus pruebas con Copilot CLI y VS Code resolvió más tareas de terminal que Opus 5 con menos de la mitad de pasos. La idea de fondo es sencilla: agentes más listos que además desperdician menos trabajo por el camino.

Link affiliato

Esa autonomía cada vez mayor explica el peso que Anthropic le da a la seguridad. Después de los incidentes conocidos en evaluaciones de ciberseguridad, donde modelos anteriores acabaron cruzando los límites de los entornos de prueba, la compañía afirma que este intenta saltarse las barreras de contención alrededor de un 85% menos que Opus 5 o Claude Mythos 5.1. Mejora también frente a los ataques de prompt injection y logra la mejor puntuación de un Claude en su auditoría automatizada de comportamiento. Hay un pero importante, eso sí: parece detectar con cierta frecuencia cuándo lo están evaluando, algo que complica saber hasta qué punto esas pruebas predicen su comportamiento real.

Que sea capaz de hacer una tarea no significa que Anthropic vaya a dejársela hacer sin freno. En solicitudes sensibles de ciberseguridad, ciertas acciones pueden desviarse hacia Opus 4.8, mientras que los profesionales verificados accederán poco a poco a límites más permisivos con el Cyber Verification Program. Algo parecido pasa con la biología, donde las organizaciones aprobadas pueden pedir acceso mediante el Life Sciences Verification Program. A eso se suma preserved thinking, una protección pensada para poner difíciles los ataques de destilación masiva. Así, la compañía separa con mucha más precisión dos cosas que antes solían ir juntas: lo que el modelo puede hacer y lo que el usuario tiene permiso para pedirle.

El modelo ya está disponible en las plataformas de Anthropic, además de Amazon Web Services, Google Cloud y Microsoft Azure. Mejora también un detalle menos vistoso pero muy útil en sesiones largas, la comunicación, con respuestas más claras, menos jerga y mayor fidelidad a las reglas de estilo que define el usuario. Todo apunta a que esta generación quiere competir menos por una décima extra en un benchmark y más por el trabajo real que completa de forma fiable, en menos tiempo, por menos dinero y con menos sorpresas.

Fuente
Imagen: muycomputer.com

Link affiliato

Related Articles