OpenAI hat kürzlich ein bedeutendes Update für seine Bildbearbeitungsfunktionen in ChatGPT eingeführt, genannt GPT Image 1.5. Dieses Update ermöglicht es Nutzern, Bilder effizient zu manipulieren, ähnlich wie es Google mit seinem Gemini-Update unter dem Codenamen Nano Banana getan hat. Die neuen Fähigkeiten von ChatGPT umfassen das gezielte Bearbeiten bestimmter Bildbereiche, ohne das gesamte Bild zu verändern, sowie die Möglichkeit, mehrere Bilder zu einer Szene zu kombinieren. Diese Fortschritte versprechen vielseitige Anwendungen, von der Bearbeitung persönlicher Fotos bis hin zur Erstellung komplexer digitaler Kunstwerke.
Die neuen Funktionen von ChatGPT sind darauf ausgelegt, Anweisungen präziser zu befolgen und Bilder bis zu viermal schneller als zuvor zu rendern. OpenAI betont, dass die Bilder realistischer und fehlerfreier sein sollen, obwohl es noch Raum für Verbesserungen gibt. Trotz der beeindruckenden ersten Eindrücke stellt sich die Frage, wie sich diese neuen Funktionen im Vergleich zu den bereits etablierten Fähigkeiten von Google Gemini schlagen.
Ein Vergleichstest zwischen ChatGPT und Gemini ergab, dass beide Plattformen in der Lage sind, qualitativ hochwertige und realistische Bilder zu erzeugen. Bei der Aufgabe, einen beschäftigten Tech-Journalisten, eine Lampe in einem leeren Lagerhaus und eine cartoonartige Landschaft zu generieren, lieferten beide Modelle ähnliche Ergebnisse. Beide Plattformen zeigten auch ihre Kompetenz bei der präzisen Bildbearbeitung, indem sie beispielsweise die Kleidung eines abgebildeten Journalisten mühelos ändern konnten, ohne andere Bildbereiche zu beeinflussen.
Ein besonders auffälliger Aspekt der neuen Bildfunktionen ist die Fähigkeit, Objekte aus einem Bild zu entfernen, ohne sichtbare Spuren zu hinterlassen. Sowohl ChatGPT als auch Gemini meisterten diese Herausforderung mit Bravour, was den potenziellen Nutzen dieser Werkzeuge für Fotografen und Designer unterstreicht, die früher viel Zeit für solche Aufgaben aufwenden mussten.
Ein weiteres Highlight der neuen Funktionen ist die Möglichkeit, mehrere Bilder zu kombinieren. Nutzer können beispielsweise separate Fotos von sich und ihren Eltern aufnehmen und sie zu einem einzigen Bild mit einem gewünschten Hintergrund zusammenfügen. Obwohl beide Plattformen in der Lage sind, diese Aufgabe zu bewältigen, zeigte sich, dass die Ergebnisse nicht immer perfekt kohärent waren. Probleme bei der Lichtanpassung und der Skalierung der Elemente führten dazu, dass die Bilder manchmal wie zusammengesetzt wirkten. In diesem Bereich schnitt ChatGPT etwas besser ab, da es konsistentere Ergebnisse bei der Mischung von Bildern und der Änderung des Gesamtstils erzielte.
Die Fähigkeit, Fotos zu remixieren und anzupassen, eröffnet neue kreative Möglichkeiten. Nutzer können das Wetter ändern, Personen hinzufügen oder den Standort wechseln, was spannende Perspektiven für die Erstellung personalisierter Inhalte bietet. Dennoch bleibt die Herausforderung bestehen, dass generierte Bilder von bekannten Personen oft ungenau wirken, da die KI-Modelle deren spezifische Merkmale nicht genau kennen.
Insgesamt haben sowohl ChatGPT als auch Gemini bedeutende Fortschritte in der Bildbearbeitung erzielt, die fortgeschrittene Funktionen in die Hände der breiten Öffentlichkeit legen. Während ChatGPT derzeit einen leichten Vorteil in der Gesamtleistung hat, bleibt es spannend zu beobachten, wie sich diese Technologien weiterentwickeln und welche neuen Möglichkeiten sie in der digitalen Bildbearbeitung eröffnen werden.