Die Einführung von GPT-5, dem neuesten Sprachmodell von OpenAI, hat in der Technologiewelt für Aufsehen gesorgt. Doch trotz der hohen Erwartungen hat das Modell in einem entscheidenden Bereich enttäuscht: der Programmierung. In einer Reihe von Tests, die darauf abzielen, die Programmierfähigkeiten von KI-Modellen zu bewerten, hat GPT-5 nur die Hälfte der Aufgaben erfolgreich abgeschlossen – ein Ergebnis, das schlechter ist als bei seinen Vorgängern.
Ein zentraler Test bestand darin, ein WordPress-Plugin zu schreiben. Frühere Modelle wie GPT-3.5 und GPT-4 hatten diese Aufgabe mit Bravour gemeistert und damit die Erwartungen an GPT-5 weiter erhöht. Doch das neue Modell scheiterte zunächst daran, ein funktionierendes Plugin zu erstellen. Beim ersten Versuch leitete das Plugin den Benutzer auf eine falsche Seite um, anstatt die erwarteten Ergebnisse zu liefern. Erst nach mehreren Anläufen und einer vollständigen Neugenerierung des Plugins konnte GPT-5 die Aufgabe korrekt abschließen.
Ein weiteres Testfeld war die Überarbeitung einer String-Funktion zur Überprüfung von Dollar- und Centbeträgen. Hier schnitt GPT-5 besser ab und erfüllte die Aufgabe ohne unnötige Ergänzungen. Es zeigte sich, dass das Modell in der Lage ist, spezifische Anweisungen präzise umzusetzen, ohne unnötige Fehlerprüfungen einzubauen, die in diesem Kontext nicht gefragt waren.
Ein komplizierterer Test drehte sich um das Auffinden eines schwer zu identifizierenden Bugs im WordPress-Framework. Hier bewies GPT-5 seine Stärke und konnte, wie schon seine Vorgänger, eine klare und präzise Lösung präsentieren. Dies unterstreicht, dass das Modell in der Lage ist, komplexe Probleme zu analysieren und fundierte Lösungen anzubieten.
Doch nicht alle Tests verliefen positiv. Bei der Aufgabe, ein Skript unter Verwendung von AppleScript und dem Mac-Tool Keyboard Maestro zu schreiben, zeigte GPT-5 deutliche Schwächen. Das Modell erstellte einen fehlerhaften Code, der ein nicht existierendes Attribut einführte und grundlegende Fehler in der Syntax aufwies. Diese Fehler zeigten, dass das Modell in bestimmten Bereichen seiner Wissensbasis Lücken aufweist und manchmal falsche Annahmen trifft.
Die Einführung von GPT-5 hat in der Entwicklergemeinschaft zu gemischten Reaktionen geführt. Während einige Nutzer von den verbesserten Fähigkeiten im Bereich der tiefen logischen Analyse beeindruckt sind, haben viele die mangelnde Zuverlässigkeit bei Programmieraufgaben kritisiert. Besonders problematisch war die Tatsache, dass OpenAI ursprünglich geplant hatte, ältere Modelle wie GPT-4o nicht mehr zugänglich zu machen. Nach massiven Nutzerprotesten wurde diese Entscheidung jedoch revidiert, und Anwender können nun wieder auf die bewährten Vorgängermodelle zurückgreifen.
Für Entwickler, die auf die Zuverlässigkeit und Präzision von KI-gestützter Programmierung angewiesen sind, bleibt somit die Frage offen, ob sie auf GPT-5 setzen oder lieber bei älteren Modellen wie GPT-4o bleiben sollten. Während das neue Modell in einigen Bereichen durchaus Fortschritte zeigt, bleibt es in der Praxis hinter den Erwartungen zurück. Die Zukunft wird zeigen, ob OpenAI in der Lage sein wird, diese Schwächen zu beheben und GPT-5 zu einem verlässlichen Werkzeug für Programmierer zu machen. Bis dahin bleibt abzuwarten, wie sich die Technologie weiterentwickelt und ob zukünftige Updates die bestehenden Probleme adressieren können.