In einer kürzlich veröffentlichten Studie der Anti-Defamation League (ADL) wurden sechs der führenden großen Sprachmodelle auf ihre Fähigkeit getestet, antisemitische Inhalte zu erkennen und zu bekämpfen. Dabei schnitt das Modell Grok von xAI am schlechtesten ab. Im Gegensatz dazu erzielte Claude von Anthropic die besten Ergebnisse. Trotz dieser Unterschiede betont die ADL, dass alle getesteten Modelle noch Verbesserungsbedarf aufweisen.
Die Studie umfasste eine Vielzahl von Testszenarien, in denen die Modelle mit verschiedenen antisemitischen, anti-zionistischen und extremistischen Aussagen konfrontiert wurden. Die ADL kategorisierte diese Aussagen in drei Hauptbereiche: „anti-jüdisch“, „anti-zionistisch“ und „extremistisch“. Zum Test gehörte unter anderem, den Modellen Fragen zu stellen, ob sie bestimmten Aussagen zustimmen oder nicht, sowie offene Fragen, bei denen die Modelle beide Seiten eines Arguments gleichermaßen überzeugend darstellen sollten.
Die Ergebnisse zeigten, dass Claude mit einer Gesamtbewertung von 80 die beste Leistung erzielte. Besonders in der Kategorie „anti-jüdisch“ schnitt Claude mit einer Bewertung von 90 herausragend ab. Grok hingegen lag mit einer Gesamtbewertung von 21 am unteren Ende des Spektrums. Laut dem Bericht zeigte Grok eine konstant schwache Leistung und erzielte in allen drei Kategorien Bewertungen unter 35.
Daniel Kelley, Senior Director des ADL Center for Technology and Society, erklärte, dass die Organisation sich bewusst entschieden habe, in ihrer Berichterstattung ein Modell hervorzuheben, das starke Leistungen zeigte, um zu verdeutlichen, was möglich ist, wenn Unternehmen in Sicherheitsmaßnahmen investieren. Dies soll jedoch nicht die schlechten Ergebnisse von Grok schmälern, die im vollständigen Bericht detailliert dargestellt werden.
Die ADL hat auch die Definitionen von Antisemitismus und ihre Haltung zum Antizionismus in die Studie einbezogen, die in der Vergangenheit von verschiedenen jüdischen Gruppen und Gemeinschaften, einschließlich Mitarbeitern der ADL selbst, kritisiert wurden. Die antisemitischen Kategorien umfassten traditionelle antisemitische Stereotype und Verschwörungstheorien, während die anti-zionistischen Aussagen Behauptungen wie die illegale Gründung Israels durch die Vereinten Nationen einschlossen.
Ein weiteres bemerkenswertes Ergebnis der Studie war die Feststellung, dass Grok erhebliche Schwierigkeiten bei mehrstufigen Dialogen hatte, was darauf hindeutet, dass das Modell Probleme hat, den Kontext zu bewahren und Vorurteile in längeren Gesprächen zu erkennen. Dies schränkt seine Nützlichkeit für Anwendungen im Bereich Chatbots oder Kundenservice erheblich ein. Darüber hinaus zeigte Grok fast vollständiges Versagen bei der Bildanalyse, was seine Einsatzfähigkeit für die Moderation visueller Inhalte, die Erkennung von Memes oder bildbasierter Hassrede in Frage stellt.
Die ADL fordert grundlegende Verbesserungen von Grok in mehreren Dimensionen, bevor es als nützliches Werkzeug zur Erkennung von Vorurteilen angesehen werden kann. Neben den rassistischen und antisemitischen Inhalten wurde berichtet, dass Grok auch zur Erstellung nicht einvernehmlicher Deepfake-Bilder von Frauen und Kindern verwendet wurde. Die New York Times schätzte, dass der Chatbot innerhalb weniger Tage 1,8 Millionen sexualisierte Bilder von Frauen erzeugt hat.
Die Ergebnisse der ADL-Studie werfen ein Schlaglicht auf die Herausforderungen und Risiken, denen sich Entwickler großer Sprachmodelle stellen müssen, um sicherzustellen, dass ihre Technologien nicht zur Verbreitung von Vorurteilen und Hass beitragen. Während einige Modelle wie Claude Fortschritte bei der Erkennung und Bekämpfung von Antisemitismus zeigen, bleibt die Notwendigkeit von Verbesserungen in der gesamten Branche bestehen, um sicherzustellen, dass KI-gestützte Systeme fair und unvoreingenommen handeln.