Volgens OpenAI presteert GPT-6 Sol op meerdere tests beter dan Claude Opus 5, en evenaart of verslaat het op sommige tests Claude Fable 5.1, tegen een fractie van de kosten per taak. OpenAI vergeleek echter niet met Claude Opus 5.5, het nieuwste Claude-model dat op dezelfde dag verscheen. Een eerlijk eindoordeel is er daarom nog niet.
Het sterkste cijfer komt van AutomationBench, een test van bedrijfsprocessen met 47 zakelijke tools. Daarop scoort Sol 33,2%, tegenover 26,9% voor Claude Opus 5 en 31,4% voor Claude Fable 5.1, terwijl een taak met Opus 5 ruim elf keer zoveel kost. Op Agents’ Last Exam, dat complexe professionele taken test, haalt Sol 56,4%. Dat is meer dan de hoogste score van Opus 5, bij 60% lagere kosten per taak. En op DeepSWE, een test met lange programmeertaken in echte codebases, komt Sol tot 1,1 procentpunt van Claude Fable 5, tegen ongeveer 80% lagere kosten per taak.
Let op: dit zijn cijfers van OpenAI zelf. Waar scores van Fable 5.1 ontbraken, gebruikte OpenAI die van Fable 5.
Op prijs is de vergelijking wel al te maken: per token kost Sol via de API de helft van Claude Opus 5.5. Hoe de topmodellen van beide makers zich tot elkaar verhouden, lees je in onze vergelijking GPT-6 Astra vs Claude Fable 5.1.