Wird Gemini 4 Argon seine Versprechen halten? Selbst Google fragt sich das
Google hat das Gemini 4 Argon als sein neues Flaggschiffmodell vorgestellt, das in mehreren Benchmarks hervorragende Ergebnisse erzielte. Doch schon kurz nach der Ankündigung kamen innerhalb des Unternehmens selbst erste Zweifel an seinen tatsächlichen Fähigkeiten auf.
Zweifel von Google Mitarbeitern an Gemini 4 Argon

Laut einem Bericht von Bloomberg hatten einige Google Mitarbeiter, die bereits Zugriff auf das Modell hatten, Schwierigkeiten, es anhand realer Programmieraufgaben und im Webdesign zu testen. Diese Kritik ist bedeutsam, da die Programmierung einer der Bereiche ist, auf die sich Google bei der Präsentation des Modells besonders konzentriert hat.
Die Mitarbeiter wurden nicht namentlich genannt und es liegen keine direkten Aussagen von ihnen vor, aber es ergibt sich das Bild eines in Tests sehr leistungsfähigen Modells, das im Alltagseinsatz weniger überzeugt.
Das Problem mit dem Benchmaxing
Die Zweifel basieren auf einem bekannten Phänomen im Bereich der künstlichen Intelligenz, dem sogenannten Benchmaxxing: der Optimierung eines Modells, um hervorragende Ergebnisse bei Standardtests zu erzielen, ohne dass sich dies in einer ebenso guten Leistung bei realen Problemen niederschlägt.
Edwin Chen, Gründer von Surge AI, verglich das Phänomen allgemein mit einem Schüler, der bei Hochschulaufnahmeprüfungen Bestnoten erzielt, ohne die im realen Leben benötigten Fähigkeiten entwickelt zu haben.
Tatsächlich hatte Google bei der Markteinführung darauf hingewiesen, dass Argon in verschiedenen Tests den ersten Platz oder Spitzenwerte erzielt hatte, von 77,9 % bei DeepSWE v1.1 für Programmierung bis hin zum ersten Platz bei AutomationBench, wie wir in unserem Artikel über die Markteinführung von Gemini 4 Argon gesehen haben.
Google Antwort
Google seinerseits zeigt sich zuversichtlich. Koray Kavukcuoglu, der nach dem Wechsel von Demis Hassabis zum Präsidenten die operative Leitung von Google DeepMind übernommen hat, äußerte sich zuversichtlich über die Arbeit seines Teams.
Das Unternehmen hebt die Stärken des Modells in Bereichen wie Sicherheit, Cyberabwehr, natürlicher Konversation und Videoanalyse hervor. Zur Untermauerung seiner Position verweist das Unternehmen aus Mountain View zudem darauf, dass sowohl sein Chatbot für Endverbraucher als auch sein Such-KI-Modus die Marke von einer Milliarde Nutzern überschritten haben.
Um herauszufinden, wer Recht hat, müssen wir allerdings warten, bis Argon mehr Entwickler und Nutzer erreicht, da der Zugang derzeit noch begrenzt ist.
Die aktuellsten Neuigkeiten aus der Welt der künstlichen Intelligenz finden Sie in unseren neuesten Artikeln im KI- Bereich von GizChina .
Dieser Artikel mit dem Titel „Wird Gemini 4 Argon seine Versprechen halten? Google fragt sie“ wurde ursprünglich auf GizChina veröffentlicht.
