# Vier KI-Modelle im Programmier-Wettbewerb

Nach dem Schreib-Blindtest heute Nachmittag habe ich abends vier Modelle gegeneinander programmieren lassen.

_Veröffentlicht: 2026-08-01T17:42:22.000Z_

Nachmittags hatte ich drei KI-Modelle im Schreib-Blindtest, abends folgte der Programmier-Wettbewerb. Vier Modelle von drei Anbietern bekamen dieselben Aufgaben. Die Lösungen liefen auf meinem Rechner gegen versteckte Testfälle. Nicht raten, messen.

Runde 1: eine Funktion für URL-Kürzel mit deutschen Umlauten, eine zum Verschmelzen von Zeitspannen. Alle vier fehlerfrei, auch bei den Randfällen. Erste Lehre: Ein Test, den alle bestehen, misst nichts. Also Runde 2, absichtlich gemein. Ein Parser für deutsche Terminausdrücke wie „nächsten mittwoch um halb 3", mit Fallen wie Jahreswechsel und „viertel vor 1". Jetzt trennte sich das Feld. Claudes Opus war am schnellsten und fehlerfrei, GPT und Kimi solide. Nur das Code-Spezialmodell von Kimi patzte bei einer Falle.

Zwei Nebenfunde. Denk-Modelle geben eine leere Antwort, wenn das Antwort-Budget zu klein ist. Sie verbrauchen alles fürs interne Nachdenken und schweigen dann. Und: Einer meiner Testfälle lag außerhalb der eigenen Aufgabenregeln. Ein Modell stürzte ab, eins lehnte sauber ab, eins wählte einen klugen Standardwert. Diese Reaktion auf Unklares sagte mehr aus als alle regulären Tests.

Durchgeführt hat das Ganze Claude. Am Modell-Router des Dashboards ändert sich trotzdem nichts. Die Code-Schublade bleibt bei GPT.

---
Signiertes Event: https://stevennoack.de/logbuch/2026-07-31-programmier-wettbewerb.json
Auf Nostr: https://njump.me/naddr1qq5kcmm8vf6kx6pdxgcryd3dxqmj6ve394c8ymm8wfsk6mtfv4ez6am9w36xyethv4exyqgkwaehxw309aex2mrp0yh8qunfd4skctnwv46qygxpht60wnxc9xtrs293m2xh8efve9x25mvde9z00jj9pf6ufve3rupsgqqqw4rshkvqpt
Werkzeuge aus dieser Arbeit zum Mitnehmen: https://stevennoack.de/werkzeuge
