Anthropic lanza Claude Opus 5.5 con menores costos y mejor rendimiento de codificación

0
Anthropic-lanza-Claude-Opus-55-con-menores-costos-y-mejor.jpeg

Anthropic ha presentado Opus 5.5, su modelo de IA más nuevo, y la compañía promueve un rendimiento más sólido en tareas de codificación, trabajo de conocimiento y uso de computadoras a un costo significativamente menor que su predecesor. El lanzamiento le da a Claude AI un nuevo modelo de alta gama solo dos meses después del lanzamiento del Opus 5, mientras que Anthropic dice que el Opus 5.5 ofrece un rendimiento comparable al de su modelo más caro Fable 5.1 en la mayoría de los trabajos.

El lanzamiento llega en un momento particularmente notable para Anthropic, cuyo director ejecutivo Dario Amodei Recientemente pidió a la industria de la IA que “seguir la frontera” mientras los desarrolladores trabajan para mantener las medidas de seguridad en línea con sistemas cada vez más capaces. Opus 5.5 es el primer lanzamiento de modelo de la compañía desde esa convocatoria e introduce mejoras de rendimiento y salvaguardias adicionales destinadas a gestionar los riesgos asociados con sistemas de IA más capaces.

Anthropic afirma que Opus 5.5 lidera los puntos de referencia de codificación

Anunciado el martes 22 de septiembre, el Opus 5.5 es el primer modelo de la nueva familia Claude 5.5 de Anthropic. La compañía afirma que el modelo ofrece los resultados más sólidos en varias categorías, incluida la codificación de agentes, el uso de computadoras y el trabajo de conocimiento.

En GDPval-AA v2.1, un punto de referencia que mide el rendimiento de la IA en 44 ocupaciones, Anthropic informó que Opus 5.5 obtuvo una puntuación de 1.846, en comparación con 1.735 de Fable 5.1 y 1.708 de Opus 5.

Relacionados:  Aminé aporta un toque del noroeste del Pacífico a las New Balance 992 “Outdoor School”

La compañía también obtuvo una puntuación del 66,4% para Opus 5.5 en Terminal-Bench 4.0, un punto de referencia centrado en el desarrollo de software para agencias. Fable 5.1 obtuvo un 55,8%, mientras que GPT-6 Astra de OpenAI obtuvo un 57,9%, según los resultados publicados por Anthropic.

Sin embargo, el Opus 5.5 no superó todos los puntos de referencia. En Terminal-Bench-Science 0.1, GPT-6 Astra obtuvo una puntuación del 64,6% en comparación con el 58,7% del Opus 5.5. Anthropic también advirtió que las diferencias de referencia en este nivel de capacidad pueden no traducirse directamente en diferencias notables en el uso diario.

El nuevo modelo de IA de Claude cuesta menos de ejecutar

El precio es uno de los mayores cambios que acompañan al lanzamiento. Anthropic está cobrando $4 por millón de tokens entrantes y $20 por millón de tokens salientes para Opus 5.5, en comparación con $5 y $25, respectivamente, para Opus 5.

La compañía afirma que la reducción va más allá de los precios más bajos de los tokens. Debido a que Opus 5.5 puede completar ciertas tareas con menos tokens y entregar resultados más de un 30% más rápido, Anthropic estima que las cargas de trabajo típicas podrían costar alrededor de un 40% menos que con Opus 5.

Las lecturas de caché también han disminuido de $0,50 a $0,20 por millón de tokens, mientras que las escrituras de caché han disminuido de $6,25 a $5. Anthropic también está introduciendo un modo más rápido para Claude Code y su plataforma Claude, que puede ejecutarse hasta 2,5 veces más rápido, aunque tiene un precio más alto.

Relacionados:  Kerry Washington regresa a su era de thriller político con “Animals”, también protagonizada por Ben Affleck.

Los costos más bajos pueden ser particularmente relevantes para los desarrolladores que crean agentes de IA, donde una sola tarea puede implicar numerosas llamadas de modelos. Las pruebas internas y de clientes de Anthropic sugieren que Opus 5.5 a veces puede completar tareas complejas en menos pasos que Opus 5.

Anthropic destaca las ganancias de eficiencia

Varias de las primeras evaluaciones citadas por Anthropic apuntan a mejoras en la eficiencia con la que el modelo maneja grandes tareas técnicas. Box informó que Opus 5.5 utilizó aproximadamente un tercio de los tokens de Opus 5 en sus evaluaciones, al tiempo que produjo respuestas más cortas sin perder precisión.

GitHub también probó el modelo en Copilot CLI y VS Code, y Anthropic informó que Opus 5.5 completó más tareas de terminal que Opus 5, requiriendo menos pasos. Mientras tanto, Deloitte informó mejoras en el rendimiento de la revisión de código en la configuración de bajo esfuerzo del modelo en comparación con Opus 5 en la configuración de alto esfuerzo.

Estas evaluaciones no son puntos de referencia independientes estandarizados y los desarrolladores aún deberán probar el modelo con sus propias cargas de trabajo. Aun así, son parte del argumento de Anthropic de que el último modelo de Claude AI no sólo es más capaz, sino también más eficiente.

Relacionados:  Esa chica con hábitos que me hicieron una mejor persona.

La seguridad sigue siendo un foco importante

El lanzamiento también presta mayor atención a la seguridad de la IA. Anthropic dice que Opus 5.5 fue evaluado antes de su lanzamiento por las organizaciones independientes de investigación de seguridad de IA Frontier Design y METR.

Según Anthropic, el modelo funcionó mejor que los sistemas anteriores en sus evaluaciones internas y tenía aproximadamente un 85% menos de probabilidades que el Opus 5 o Mythos 5.1 de intentar eludir los límites de contención en una prueba dedicada.

Opus 5.5 también utiliza clasificadores de seguridad que cubren áreas como la ciberseguridad, la biología y el desarrollo de la IA de vanguardia. Cuando una solicitud activa una de estas salvaguardas, Anthropic dice que se puede reenviar a un modelo anterior.

La compañía está ampliando el acceso al modelo para investigadores examinados en ciberseguridad y ciencias biológicas a través de programas de verificación especializados, al tiempo que mantiene restricciones adicionales en torno a capacidades sensibles.

Se acercan Soneto 5.5 y Haiku 5.5

Opus 5.5 es la primera versión de la generación Claude 5.5, pero no será la última. Anthropic dice que Claude Sonnet 5.5 y Claude Haiku 5.5 se lanzarán en las próximas semanas, brindando el mismo enfoque más amplio en rendimiento, velocidad y seguridad a los otros niveles de su línea de modelos.

Para los desarrolladores, Opus 5.5 está disponible a través de Anthropic, así como en plataformas en la nube que incluyen Amazon Web Services, Google Cloud y Microsoft Azure. El lanzamiento marca otro paso en el esfuerzo de la compañía para hacer que la implementación de modelos de IA sea cada vez más capaz y más eficiente, al mismo tiempo que amplía las salvaguardas que rodean su uso.

Imagen de portada: Antrópico


—Lea también

Source link

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *