Ich ließ fünf KI-Systeme einen Reasoning-Benchmark absolvieren: ChatGPT erzielte 99/100, und die Fehler sind interessanter als die Rangliste

Ich bat GPT-6 Astra, einen neuartigen Benchmark zu entwerfen, der Logik, Wahrscheinlichkeiten, Kausalität, Software-Konkurrenz, Optimierung und Selbstverifikation vereint. ChatGPT, Gemini, DeepSeek, Kimi und Grok absolvierten ihn anschließend ohne Zugriff auf die Lösung. Das Ergebnis ist nicht nur eine Rangliste: Es ist eine ziemlich schonungslose Röntgenaufnahme dessen, wie diese Modelle denken, beweisen … und manchmal in ihren eigenen Fehlern verharren.

Informatik12 Min. Lesezeit

Der geheime Krieg um das Kopieren der besten KI

Hunderte Millionen Anfragen, Tausende Fake-Accounts und Modelle, die auf den Antworten ihrer Konkurrenten trainiert wurden: Destillation ist zu einem industriellen und geopolitischen Thema geworden. Doch die Grenze zwischen legitimen Lernen, Fähigkeitsextraktion und echtem Diebstahl ist viel weniger klar, als es scheint.

Informatik12 Min. Lesezeit

Mindestens zwei Zeichen eingeben, um zu suchen.