En bref

  • Anthropic a publié Claude Sonnet 5.5 lundi à 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie—inchangé par rapport à Sonnet 5 et moitié moins cher qu'Opus 5.5.
  • Sonnet 5.5 a obtenu 70,6 % sur Terminal-Bench 4.0 contre 66,4 % pour Opus 5.5, selon Anthropic ; le testeur indépendant Artificial Analysis le place également en tête, 63,6 % contre 59,6 %.
  • Artificial Analysis le classe deuxième derrière Opus 5.5, mais indique qu'il a utilisé plus de tokens par tâche que tout autre modèle qu'il a testé.

Anthropic a publié Claude Sonnet 5.5 lundi, une mise à niveau de Sonnet 5 de juin. Anthropic affirme que ce modèle de gamme intermédiaire fonctionne plus de 30 % plus rapidement que son prédécesseur.

« Sonnet 5.5 est le plus performant pour les tâches quotidiennes bien délimitées, la correction de bugs et la création de documents, diapositives et feuilles de calcul soignés. Il a aussi un œil aiguisé pour le design », a écrit Anthropic.

Myriad : Jusqu'où Nvidia va-t-il chuter ? Cliquez pour faire votre prédiction.
Myriad : Jusqu'où Nvidia va-t-il chuter ? Cliquez pour faire votre prédiction.

Le prix reste à 2 $ par million de jetons d'entrée et à 10 $ par million de jetons de sortie. Les jetons sont les morceaux de texte qu'une IA lit et écrit, un peu plus courts qu'un mot, et les entreprises facturent au million. C'est la moitié de ce que facture Opus 5.5. Cependant, il utilise près d'un tiers de jetons en moins par tâche, ce qui signifie qu'il finit par être moins cher à exécuter que Sonnet 5.

Cela dit, ce modèle brille en codage. Sur Terminal-Bench 4.0—un test visant à déterminer si un agent IA peut accomplir des tâches professionnelles complexes en tapant des commandes de manière autonome, noté comme la part des tâches accomplies—Sonnet 5.5 a atteint 70,6 %. Opus 5.5 a obtenu 66,4 %, et Sonnet 5 a réussi 10,3 %.

En termes simples, le modèle moins cher a terminé plus de tâches. Artificial Analysis, une société de tests indépendante, a exécuté sa propre version et est d'accord : 63,6 % pour Sonnet 5.5, 59,6 % pour Opus 5.5, et 59,1 % pour GPT-6 Astra d'OpenAI.

Les scores dépendent aussi du réglage d'effort, un curseur qui pousse un modèle à réfléchir plus longtemps pour une meilleure réponse et une facture plus élevée. Anthropic affirme que Sonnet 5.5 en effort élevé égale GPT-6 Sol sur FrontierCode pour environ un cinquième du coût par tâche.

Sur GDPval-AA, qui évalue le travail professionnel réel dans 44 métiers à l'aide d'Elo—le système de type échecs qui classe la compétence relative—Sonnet 5.5 a obtenu 1844 contre 1846 pour Opus 5.5, soit pratiquement une égalité. GPT-6 Sol a obtenu 1487.

Les rivaux s'alignent sur le prix. OpenAI a réduit GPT-6 Sol à 2 $ et 10 $ la semaine dernière, et GPT-5.6 Terra, son modèle de milieu de gamme, est affiché à 2 $ et 12 $. Anthropic n'a publié aucun benchmark de Terra.

Le piège

Sonnet 5.5 est un grand bavard. À effort maximal, il a écrit environ 193 000 tokens par tâche de test, le plus élevé mesuré par Artificial Analysis et environ 60 % de plus qu'Opus 5.5. Cela revenait à 7,60 $ par tâche, environ 50 % de plus que Sonnet 5, ce qui va à l'encontre de l'affirmation d'Anthropic d'économies allant jusqu'à 30 %.

Les économies d'Anthropic proviennent de réglages inférieurs : à effort moyen, la valeur par défaut dans ses applications, il affirme que Sonnet 5.5 dépasse le meilleur score de codage de Sonnet 5 pour moins d'un dixième du coût. Artificial Analysis affirme que l'effort élevé est le meilleur rapport qualité-prix. Pour les utilisateurs quotidiens, cela signifie un codage proche du haut de gamme à une fraction du prix, tant que le curseur reste bas.

Le tableau d'Anthropic est auto-déclaré, et Artificial Analysis a testé une version préliminaire comportant un bug dont Anthropic s'attend à ce qu'il ait peu changé ou légèrement sous-estimé ses scores. Anthropic affirme qu'Opus 5.5 reste nettement plus performant sur les travaux complexes nécessitant un jugement soutenu.

Claude Haiku 5.5, conçu pour les applications à gros volume et sensibles aux coûts, est attendu dans les semaines à venir.