Siebenfacher Benchmark-Sprung bei unveränderten Preisen
Am 28. September 2026 stellte Anthropic mit Sonnet 5.5 das zweite Modell der Claude-5.5-Familie vor. Unter den offiziell veröffentlichten Benchmark-Ergebnissen sorgte ein Wert für besondere Überraschung: Auf dem Programmier-Benchmark Terminal-Bench 4.0 sprang die Erfolgsquote von 10,3 % der Vorgängergeneration auf beachtliche 70,6 %. Auf dieser maßgeblichen Bestenliste zur Bewertung autonomer Coding-Agenten überholte Sonnet 5.5 damit sogar das Flaggschiff derselben Modellgeneration, Opus 5.5, das 66,4 % erzielte.
Auch im Programmier-Benchmark CursorBench 4.0 sicherte sich das Modell 55,5 %. Damit übertraf es nicht nur die 34,1 % der Vorgängergeneration deutlich, sondern rückte auch dicht an die 57,8 % von Opus 5.5 heran. Am Preismodell änderte sich derweil nichts. In seiner Rolle als kostengünstiges Arbeitspferd verharrt der Tarif unverändert bei 2 US-Dollar pro Million Input-Tokens, 10 Dollar für Output-Tokens und 0,20 Dollar für Cache-Lesezugriffe.
Auf dem OSWorld-2.1-Benchmark, der reale Computerbedienung durch Menschen simuliert und bewertet, erzielte Sonnet 5.5 einen Wert von 80,1 %. Es ist das erste Modell der Sonnet-Reihe, das Pokémon Red allein durch die optische Analyse von Screenshots vollständig durchspielen konnte. Die Verbesserungen beschränken sich keineswegs auf reine Codegenerierung: Im Chartography-Benchmark zur Messung des multimodalen Bildverständnisses kletterte das Ergebnis von mageren 15,6 % der Vorgängergeneration auf 61,6 %.
In der GDPval-AA-v2.1-Evaluation, die praxisnahe Arbeitsabläufe aus 44 verschiedenen Berufsfeldern abprüft, erreichte das Modell 1844 Punkte. Damit schließt es nahezu mit den 1846 Punkten von Opus 5.5 auf und lässt die 1449 Punkte der Vorgängergeneration weit hinter sich. Der AA-Briefcase-v1.1-Wert stieg parallel von 1359 auf 1811 Punkte. Ein Mittelklasse-Modell auf der Preisliste liefert damit direkt eine Ingenieurs- und Automatisierungskompetenz, die bisherige Spitzenmodelle hinter sich lässt.
Effizienz-Umbau senkt Kosten pro Aufgabe um bis zu 90 Prozent
Trotz unveränderter Token-Preise müssen Nutzer für dieselben Aufgaben spürbar weniger Rechenbudget aufwenden. Nach Angaben von Anthropic benötigt Sonnet 5.5 bei klar abgegrenzten Routineaufgaben deutlich weniger Tokens und liefert Ausgaben über 30 % schneller als der Vorgänger. Offizielle Messungen belegen, dass die monetären Kosten pro Einzelaufgabe um bis zu 30 % unter denen der Vorgängergeneration liegen. Der Leistungssprung dieser Generation beruht nicht auf einer expansiven Aufstockung der Rechenleistung, sondern auf der physischen Verdichtung der Ausführungsschritte.
Aus den Vergleichsdaten des Herstellers geht hervor, dass Sonnet 5.5 selbst dann, wenn es auf die mittlere Effort-Stufe („medium effort“) gedrosselt wird, immer noch die Bestwerte übertrifft, die das Vorgängermodell unter Volllast erreichte. In dieser mittleren Einstellung sinken die Kosten für die Erledigung einer einzelnen Aufgabe auf weniger als ein Zehntel des früheren Vergleichswerts.
Frühe Tester beobachteten, dass das neue Modell Werkzeugaufrufe (Tool Calls) wesentlich effizienter bündelt. Dadurch verringert sich die Gesamtzahl der Inferenzschritte, die für die Interaktion mit externen Systemumgebungen erforderlich sind, erheblich. Auch die Diskussionen in den Reddit-Entwicklerforen drehen sich vor allem um diesen Punkt: Unstrukturiertes „Vibe Coding“ verschlang früher Unmengen an Tokens durch endlose Versuch-und-Irrtum-Schleifen. Da das Modell nun Anfragen bündelt und Tools präzise ansteuert, bricht der bisherige Token-Overhead drastisch ein.
Abbildung: Platzierung desselben Modells unter verschiedenen Effort-Stufen. Je weiter oben links, desto mehr Leistung pro Dollar; Sonnet 5.5 liegt deutlich links oberhalb der Vorgängergeneration. Quelle: Anthropic
Warum maximale Rechenleistung unerwartet zu Punktverlusten führt
Auf dem anspruchsvollen Haupttestset FrontierCode 1.1 zeigte sich jedoch ein kontraintuitiver Leistungseinbruch. Bei der Voreinstellung „Xhigh“ erzielte das Modell noch 52,1 %. Wurde die Rechenleistung jedoch auf die Maximalstufe („Max“) heraufgeschraubt, stürzte die Quote auf 46,2 % ab. Im selben Test erreichten Opus 5.5 54,4 % und GPT-6 Sol 49,3 %. Der bloße Einsatz zusätzlicher Rechenressourcen garantiert kein besseres Ergebnis mehr; eine übermäßige Kaskadierung autonomer Agenten führt zu unkontrollierbaren Systemverlusten.
Anthropic erklärte dieses Phänomen damit, dass das Modell auf der Max-Stufe im Hintergrund überproportional häufig Code-Review-Funktionen auslöste. Dabei versuchte es, Prüfaufgaben an unzählige Sub-Agenten zu delegieren. Diese stark fragmentierte Aufgabenverteilung führte zu massiven Timeouts.
Zudem fehlte es den einzelnen Sub-Agenten an gegenseitiger Synchronisation, was zu eigenmächtigen Änderungen außerhalb des vorgegebenen Aufgabenrahmens führte. Das FrontierCode-System belegt Abweichungen vom ursprünglichen Scope jedoch mit empfindlichen Punktabzügen. Wenn die Handlungsgrenzen autonomer Agenten über mehrere Hierarchieebenen hinweg verschwimmen, werden die theoretischen Inferenzvorteile des Einzelmodells durch Koordinationsaufwand und Fehlerfortpflanzung vollständig aufgefressen.
Abbildung: Kosten- und Genauigkeitskurven weiterer Benchmarks im Vergleich zwischen Sonnet 5.5 und Flaggschiff-Modellen. Quelle: Anthropic
Leistungsüberhang erzwingt Flaggschiff-Schutzmechanismen in der Mittelklasse
Wenn ein verhältnismäßig günstiges Modell über eine derart hohe autonome Code-Ausführungskompetenz verfügt, vergrößert sich auch sein Schadenspotenzial im gleichen Maße. Anthropic bestätigte offiziell, dass die Cybersicherheitsfähigkeiten von Sonnet 5.5 auf dem Niveau des bisherigen Spitzenmodells Opus 5 liegen. Es ist daher das erste Sonnet-Modell der Firmengeschichte, das standardmäßig mit vollständigen Sicherheitsleitplanken gegen Cyberangriffe und einem obligatorischen Rollback-Mechanismus ausgeliefert wird. Die biologischen Schutzmechanismen entsprechen weiterhin den strengen Vorgaben der Vorgängergeneration. Dass solche Sicherheitsbarrieren nun auch in der Mittelklasse implementiert werden müssen, beweist, dass gefährliche autonome Fähigkeiten längst nicht mehr nur exklusiven Spitzenmodellen vorbehalten sind.
Neben der Abwehr von Angriffen ist Sonnet 5.5 auch das erste Mittelklasse-Modell mit einem integrierten Anti-Destillations-Klassifikator. In der Vergangenheit setzten Angreifer automatisierte Konten primär auf Flaggschiff-Modelle an, um deren Ausgaben im großen Stil zur Schulung konkurrierender Systeme abzusaugen. Dass ein Modell im 10-Dollar-Output-Segment nun mit solchen Schutzvorkehrungen versehen wird, zeigt, dass seine Antwortqualität die Präzision der Trainingsgrundlagen erreicht hat. Die regulären Ausgaben eines preiswerten Modells sind damit erstmals zu einem schützenswerten Unternehmensgut geworden.
Reale Produktivitätsgewinne: Halbe Iterationszyklen in der Praxis
Die Benchmark-Werte spiegeln sich auch in der Praxis wider. In 118 realen Anwendungsszenarien, die der Dienstleister Base44 untersuchte, benötigte Sonnet 5.5 durchschnittlich nur 3,6 Dialogrunden, um den produktionsreifen Code-Standard von Opus 5 zu erreichen. Opus 5 benötigte für dieselben Aufgaben im Schnitt 7,7 Runden.
Der Spielekonzern Epic Games urteilte nach internen Tests, dass Sonnet 5.5 bei Audits des Systemdesigns und Prüfungen tiefer Datenflüsse die Codequalität höherpreisiger Flaggschiff-Modelle erreicht. Ingenieure des Unity-Teams berichteten, dass das Modell 90 % komplexer mehrstufiger Editor- und Programmieraufgaben eigenständig meisterte und anspruchsvolle Laufzeitprüfungen fehlerfrei bestand.
In einer Nachbemerkung räumten die Chefarchitekten von Anthropic ein, dass synthetische Benchmarks immer nur einen Ausschnitt des Leistungsspektrums abbilden. Bei hochgradig komplexen, ergebnisoffenen Aufgabenstellungen mit unklarer Umgebungsumgrenzung behält das Spitzenmodell Opus 5.5 weiterhin die Oberhand bei der langfristigen strategischen Planung. Zudem soll in den kommenden Wochen Haiku 5.5 für extrem latenzkritische Anwendungen folgen. Der Triumph des Mittelklasse-Modells basiert auf seiner bestechenden Effizienz bei klar umgrenzten Werkzeugaufrufen. Dieser Leistungssprung bricht das traditionelle Preisdiktat der bisherigen Spitzenklasse auf.
Weiterführende Links:
- Offizieller Anthropic-Blog
- Diskussionen in der Reddit-Entwickler-Community
- Testergebnisse von Epic Games und Unity