Mathematik-Tests sind seit langem die Standardmethode, um die Fähigkeiten von KI-Modellen wie ChatGPT und Claude zu überprüfen. OpenAI erklärt, dass die eigenen Modelle mittlerweile so gut sind, dass bisherige Mathematik-Tests immer weniger aussagekräftig werden. Daher haben die Forscher etwas Schwierigeres versucht.
Sie gaben einem bisher nicht veröffentlichten Modell etwa 4.000 ungelöste Mathematik-Aufgaben. Die Ergebnisse waren überraschend und auch besorgniserregend.
Die KI erstellte 722 Manuskripte, die in 372 Gruppen von verwandten Ergebnissen unterteilt wurden. OpenAI berichtet, dass jede Lösung im Schnitt etwa drei Stunden Rechenzeit benötigte.
„Einige spannende Tage stehen der mathematischen Community bevor!” sagte Stefano Gogioso, Mitglied des Future Tech and AI Experts Council von BeInCrypto
Wird KI zu stark, zu schnell?
Dies ist die wichtigere Entwicklung. Fortschrittliche KI geht inzwischen über das Beantworten bekannter Fragen hinaus und beginnt, mögliche Antworten auf bisher unbekannte Fragen zu erzeugen.
Das könnte künftig deutlich steigern, wie viel geistige Arbeit ein Forscher, Ingenieur oder Analyst leisten kann.
Allerdings ist nicht jedes Ergebnis auch wirklich korrekt. Viele der Arbeiten von OpenAI enthalten Lean-Beweise, die maschinell überprüfbar sind. Einige jedoch nicht. OpenAI weist darauf hin, dass einige nicht überprüfte Ergebnisse „Probleme haben könnten”.
Dadurch entsteht ein neues Nadelöhr: Menschen schaffen es womöglich nicht mehr, Forschungsergebnisse so schnell zu überprüfen wie die KI sie schreibt.
Könnte eine KI jetzt Vorhersagen treffen und Investment-Entscheidungen fällen?
Möglich, aber der Finanzbereich ist auf andere Weise schwierig.
Ein mathematischer Beweis lässt sich irgendwann als richtig oder falsch herausstellen. Märkte sind dagegen unruhig und verändern sich ständig.
Aktuelle Messgrößen für den Finanzbereich zeigen weiterhin, dass fortschrittliche KI mit komplexer Investment-Forschung kämpft. Studien zur Markttiming-Strategie finden zudem nur begrenzte Vorhersagevorteile.
Die kurzfristige Chance liegt daher eher in einer tieferen Analyse als in perfekten Vorhersagen.
Eine KI, die stundenlang verknüpft denken kann, könnte zum Beispiel Finanzberichte, Konferenzgespräche, wichtige Wirtschaftsdaten und verschiedene Szenarien gleichzeitig analysieren und viel mehr Hypothesen prüfen als ein Analyst alleine.
Genau das ist möglicherweise die wichtigste Erkenntnis aus dem OpenAI-Experiment. KI kann heute schon große Mengen an anspruchsvoller Analyse liefern. Die nächste Herausforderung ist zu entscheiden, welchen dieser Ergebnisse man vertrauen kann.









