Claude Sonnet 5.5 is vooral sneller en efficiënter geworden dan Sonnet 5. Anthropic meldt dat het model ruim 30% sneller output genereert en voor veel taken minder tokens nodig heeft.
De grootste verbetering is zichtbaar bij taken waarbij Claude zelfstandig meerdere stappen moet uitvoeren. Sonnet 5.5 behaalt bijvoorbeeld 70,6% op Terminal-Bench 4.0, tegenover 10,3% voor Sonnet 5. Dat is een benchmark voor complexe taken in een command-lineomgeving.
Ook bij professioneel kenniswerk komt Sonnet opvallend dicht bij Opus 5.5. Op GDPval-AA scoort Sonnet 1844 punten en Opus 1846. Het verschil op die specifieke test is dus zeer klein.
Anthropic noemt daarnaast verbeteringen bij het begrijpen van grotere codebases, werken met tools, langdurige opdrachten, beeldinterpretatie en het maken van documenten en presentaties.
Een hoge benchmarkscore betekent niet automatisch dat Sonnet 5.5 voor iedere opdracht even goed is als Opus 5.5. Anthropic geeft zelf aan dat Opus in praktijktests duidelijk sterker blijft bij moeilijk, open werk waarbij langdurig oordeel nodig is.