Claude Opus 5.5 scoort in vier van de zes gedeelde benchmarks uit Anthropic’s vergelijking hoger dan GPT-6 Astra. Dat maakt Opus 5.5 vooral interessant voor agentic coding, kenniswerk en bepaalde redeneertaken. Astra scoort daarentegen duidelijk hoger op Terminal-Bench-Science en nipt hoger op AutomationBench.
Het grootste verschil zit mogelijk niet eens in de maximale benchmarkscore, maar in de verhouding tussen resultaat en kosten. Anthropic meldt bijvoorbeeld dat Opus 5.5 op de standaardinstelling 54,6% haalt op FrontierCode, tegenover Astra’s gepubliceerde topscore van 53,3%, voor ongeveer een vijfde van de geschatte kosten per taak. Dat is een claim van Anthropic en dus geen onafhankelijke kostenmeting.
OpenAI laat tegelijkertijd zien waarom Astra niet zomaar kan worden afgeschreven. Astra scoort volgens OpenAI 64,6% op Terminal-Bench-Science, 97,6% op FrontierMath Tier 4 en 96,0% op GPQA Diamond. Ook is het model sterk gericht op computergebruik en langdurige professionele workflows.
Werk je vooral binnen ChatGPT, dan kan het bovendien praktischer zijn om daar te blijven in plaats van alleen voor een benchmarkverschil van model te wisselen. GPT-6 Astra is beschikbaar voor ChatGPT Plus, Pro, Business en Enterprise. Wil je vooral beter leren werken met het platform en goede instructies leren schrijven, dan sluit ChatGPT in 1 dag daar beter op aan dan een overstap puur vanwege een leaderboard.