Anthropic hat Claude Sonnet 5.5 am 28. September veröffentlicht, und zwar zum gleichen Listenpreis wie Sonnet 5. Das Unternehmen gibt an, dass das Modell über 30% schneller läuft und pro Aufgabe bis zu 30% weniger kostet.
Ein unabhängiges Benchmarking-Unternehmen ist nach eigenen Tests jedoch zu einem anderen Ergebnis bei den Kosten gekommen, als es das Modell an seine Grenzen gebracht hat.
Folgen Sie uns auf X, um aktuelle Nachrichten direkt zu erhalten
Anthropics zweites 5.5-Modell erscheint wenige Tage nach Opus
Sonnet 5.5 ist das zweite Modell in der Claude 5.5-Reihe. Anthropic brachte Opus 5.5 am 22. September heraus. Am gleichen Tag stellte auch OpenAI GPT-6 Sol und Luna vor.
Das neue Modell behält die Preise von Sonnet 5 bei: 2 USD je eine Million Eingangstoken und 10 USD je eine Million Ausgangstoken. Anthropic meldete einen Score von 70,6% im Terminal-Bench 4.0, einem agentenbasierten Coding-Test. Sonnet 5 erzielte nur 10,3%, während Opus 5.5 auf 66,4% kam.
„Während Opus 5.5 für komplexe Aufgaben mit sorgfältiger Bewertung entwickelt wurde, ist Sonnet 5.5 besonders stark bei klar umrissenen Alltagsaufgaben, beim Beheben von Fehlern sowie beim Erstellen ausgefeilter Dokumente, Präsentationen und Tabellen”, erklärte das Team.
Anthropic betonte, dass Sonnet 5.5 die bisherigen Fähigkeiten nicht übertrifft. Daher lag der Fokus bei der Überprüfung auf Risiken wie Irreführung der Nutzer und Missbrauch bei kritischen Anwendungen.
Sonnet 5.5 enthält zudem Schutzmechanismen gegen Cyberangriffe und spezielle Filter gegen die Nachahmung durch konkurrierende Systeme. Diese blockieren Versuche, die Denkweise des Modells zur Schulung anderer Systeme zu entnehmen. Claude Haiku 5.5 soll in den nächsten Wochen folgen.
Inzwischen hat OpenAI das geplante Modell GPT-6.1 Astra aus Sicherheitsgründen auf Eis gelegt. CNBC bestätigte am Montag, dass das Modell die Standards des Unternehmens nicht erfüllt hat.
Artificial Analysis stellt bei maximaler Auslastung höhere Token-Kosten fest
Artificial Analysis ist das Benchmarking-Unternehmen, das Grok 4.7 auf Platz vier eingeordnet hat. Für Sonnet 5.5 vergab das Team 56 Punkte im Intelligence Index. Damit landet Sonnet 5.5 insgesamt auf Platz zwei, 2 Punkte hinter Opus 5.5 bei maximaler Auslastung.
Laut Unternehmen erreichte Sonnet 5.5 64% im Terminal-Bench 4.0. Opus 5.5 sowie GPT-6 Astra kamen jeweils auf 60%. Bei Wissenstests wie dem GDPval-AA lagen Sonnet 5.5 und Opus 5.5 etwa gleichauf.
Artificial Analysis stellte zudem fest, dass Sonnet 5.5 deutlich mehr Token benötigte, um diese Ergebnisse zu erzielen.
„Bei maximaler Auslastung, wenn eine Leistung nahe der von Opus 5.5 erreicht wird, nutzte Claude Sonnet 5.5 rund 193.000 Ausgangstoken je Intelligence-Index-Aufgabe”, heißt es im Post.
Dieser Wert liegt rund 60% über dem, was Opus 5.5 und Sonnet 5 bei maximaler Auslastung benötigen. Es ist auch etwa siebenmal so viel wie bei GPT-6 Astras Höchstwert.
Kunden mit frühem Zugang, die von Anthropic zitiert werden, berichteten im Vergleich zu Sonnet 5 hingegen von gegenläufigen Ergebnissen, allerdings für andere Aufgabenbereiche. Balyasny Asset Management verzeichnete bei Finanzaufgaben einen deutlich geringeren Token-Verbrauch.
„In unserem internen Bündel aus 2.441 Finanzaufgaben, zu denen unter anderem Q&A, Datenextraktion, Analysen und Prognosen zählen, schnitt Claude Sonnet 5.5 besser ab als Sonnet 5 und benötigte etwa 121.000 Token pro Antwort, während Sonnet 5 497.000 verwendete”, so Joe Poirier, Senior AI Engineer bei Balyasny Asset Management.
Artificial Analysis testete eine Vorabversion von Sonnet 5.5, in der noch ein Fehler beim strukturierten Output vorlag, den Anthropic mittlerweile behoben hat. Die Firma plant, die betreffenden Tests bald zu wiederholen.
Abonnieren Sie unseren YouTube-Kanal, um Fachbeiträge von Experten und Journalisten zu sehen









