Gemini 4 ist offiziell erschienen, und wir haben endlich ein hochmodernes Modell, bei dem Schreiben dem Programmieren überlegen ist
Das Flaggschiffmodell Gemini, das siebeneinhalb Monate lang pausiert hatte, wurde endlich aktualisiert.
Soeben haben mehrere Google-nahe Accounts gleichzeitig verkündet: Gemini 4 Argon ist offiziell erschienen.
Darüber hinaus ist dies möglicherweise das einzige hochmoderne Modell der letzten Zeit, bei dem die Fähigkeiten im Schreiben, im Wissenserwerb und im Verfassen langer Texte deutlich stärker ausgeprägt sind als die Programmier- und Agentenfähigkeiten.
Innerhalb von nur drei Tagen hat sich sogar die Namenskonvention für Gemini 4 geändert, sodass es nun fast wie ein Modell von OpenAI aussieht. Die offizielle Erklärung für diesen Namen ist spärlich; wir wissen lediglich, dass es sich um einen internen Codenamen aus der Testphase handelt, der nun in der finalen Version verwendet wird.
Es repräsentiert wörtlich das Element 18, Argon, ein Edelgas, was eine interessante Parallele zu Chrom darstellt.
Probieren Sie es nicht gleich in der Gemini-App aus – ganz im Sinne der aktuellen „Sicherheits“-Theorie ist Gemini 4 Argon derzeit nur für eine begrenzte Anzahl von Cybersicherheitspartnern über das Fairwind-Programm verfügbar. Die offizielle Ankündigung nennt keinen Zeitplan für die vollständige öffentliche Veröffentlichung, sondern besagt lediglich, dass es „zuerst für zahlende API-Nutzer und Abonnenten von Google AI Ultra verfügbar sein wird“. Reguläre Abonnenten müssen sich noch etwas gedulden.

Zuvor war ein angebliches Modell des Gemini 4 auf einem Testgelände aufgetaucht. Da es jedoch nie offiziell bestätigt wurde, ist unklar, ob es sich tatsächlich um einen Gemini 4 handelt oder ob er Fable und Astra enthält. Die Ergebnisse dieser Vergleichstests sind daher wenig verlässlich. Wir können uns vorerst nur auf die von den offiziellen Stellen veröffentlichten Daten stützen (was den Aufwand für diesen Artikel deutlich reduziert).
Zumindest den offiziellen Benchmark-Ergebnissen zufolge ist die Gemini 4 Argon extrem leistungsstark:

Sie haben richtig gelesen. Von den 18 aufgeführten Tests erzielte das Gemini 4 in 13 davon Spitzenergebnisse.
Der größte Vorsprung zeigt sich im Bereich Wissensarbeit. Sowohl im Vals Finance Agent v2 als auch im Harvey's Legal Agent Benchmark-Test, die reale Finanzanalysen und reale juristische Arbeit umfassen, ist Gemini 4 allen anderen Modellen um zwei Stufen voraus. Das ist nicht überraschend – selbst in seinen schwächsten Momenten hat niemand jemals an Geminis umfassenden Wissenskompetenzen gezweifelt.

Eine weitere traditionelle Stärke von Gemini ist sein großer Kontext. Im GraphWalks-Benchmark, der die Fähigkeit testet, extrem lange Kontexte von 256k bis 1M effektiv zu nutzen, übertraf Gemini 4 andere Flaggschiffmodelle um mehr als 10 %.
Eine neue Funktion könnte diese Spur erklären.

Gemini 4 Argon erhöht das Ausgabelimit von 64.000 Token in der vorherigen Generation auf 1 Million Token. Das bedeutet: Wenn Ihre Wallet dies verarbeiten kann und Gemini die volle Leistung erbringen möchte, kann es etwa 700.000 bis 1 Million chinesische Schriftzeichen auf einmal ausgeben – ein enormer Fortschritt für den Aufbau von Mindchains. Die offizielle Erklärung lautet:
Wenn ein Modell genügend Raum hat, um tiefgründig zu denken und Hunderttausende von lexikalischen Einheiten in einem einzigen Denkprozess generiert, wird es eine ganz neue Ebene der Tiefe des Denkens erreichen und so knifflige Probleme auf einmal lösen.
Im Gegensatz dazu ist die Programmierleistung von Gemini 4 etwas uneinheitlich. Bei DeepSWE v1.1, dem am häufigsten verwendeten realen Langzeit-Software-Build-Test, erreichte Gemini 4 einen Wert von 77,9 % und übertraf damit GPT-6 Astra und Claude Opus 5.5 um fast 4 Prozentpunkte.

Allerdings schneidet Gemini 4 in FrontierSWE v2, das das Erstellen von Projekten von Grund auf erfordert, um Probleme zu lösen, und in Terminal-Bench 4.0, das Linux-Terminals zur Bewältigung komplexer Aufgaben nutzt, schlecht ab.
Die Eigenschaften von Gemini 4 lassen sich grob wie folgt zusammenfassen: Wissen/Schreiben > Programmierung > Terminal.
Tests durch Dritte können diese Einschätzung ebenfalls bestätigen.
Bei der anonymen Bewertung auf Arena.ai erzielte Gemini 4 in der Text Arena hervorragende Ergebnisse und belegte aufgrund seiner starken Leistung bei der Bewältigung anspruchsvoller Aufgaben, dem Befolgen von Anweisungen und dem kreativen Schreiben den ersten Platz. In den Code Arena: WebDev und Agent Arena, die sich stärker auf Programmierfähigkeiten konzentrieren, erreichte Gemini 4 jedoch nur den achten Platz.

In gewisser Weise erweisen sich Geminis eingeschränkte Programmierfähigkeiten als Glück im Unglück. Die Überoptimierung der Agentenprogrammierung scheint viele hochmoderne Modelle „unnatürlich“ wirken zu lassen, darunter die seit GPT-5.3 immer noch verbreiteten Zeilenumbrüche und der rätselhafte Slang, der mit Opus 4.7 seinen Anfang nahm. In solchen Fällen kann ein Gemini-Modell, das trotz seiner begrenzten Programmierfähigkeiten ein gewisses ästhetisches Sprachgefühl bewahrt, viele Schreibprobleme lösen.
Eine weitere bemerkenswerte Veränderung ist der deutliche Rückgang der Halluzinationsrate.

Im Test mit künstlicher Analyse wies Gemini 4 eine Halluzinationsrate von nur 15 % auf – die niedrigste aller hochmodernen Modelle. Das bedeutet, dass es bei unsicheren Antworten eher „Ich weiß es nicht“ sagt, als sich eine Antwort auszudenken.
Für normale Nutzer ist jedoch der wichtigste Punkt natürlich der Preis, und Google war diesbezüglich schon immer sehr großzügig.
Die offizielle API-Preisgestaltung für Gemini 4 Argon beträgt 2 US-Dollar pro Million eingegebener Token und 10 US-Dollar pro ausgegebener Million Token, bei einer Trefferquote von 5 % (0,10 US-Dollar). Laut offizieller Ankündigung soll sich der Preis nach der anfänglichen Rabattphase verdoppeln. Erfahrungsgemäß ist es jedoch sehr wahrscheinlich, dass die Rabattphase bis zur Veröffentlichung des Nachfolgemodells andauern wird.

Aufgrund des reduzierten Preises kostet der Gemini 4 nur ein Fünftel des GPT-6 Astra und Fable 5.1 und liegt preislich etwa auf dem Niveau des GPT-6.1 Sol und Sonnet 5.5. Mit anderen Worten: Sofern keine irreführende Werbung vorliegt, bietet der Gemini 4 aktuell das beste Preis-Leistungs-Verhältnis und damit Intelligenz auf Flaggschiff-Niveau zu einem Mittelklassepreis.
Mit der Veröffentlichung von Gemini 4 Argon wurde auch ein peinlicher Rekord beendet: Fast ein halbes Jahr lang wurden die Vorteile des Google AI Pro-Pakets damit beschrieben, dass man „das 3 Pro-Modell nutzen kann“… Angesichts der Tatsache, dass selbst Flash-Modelle nach der 3,5-Flash-Ära die Pro-Modelle übertreffen können, wirkt dieses Mitgliedschaftspaket ziemlich amüsant; größtenteils haben die Leute die Mitgliedschaft nur wegen der 5 TB Google Drive gekauft.

Nun kann Google endlich offen für sein Mitgliedschaftsprogramm werben.
An dieser Stelle möchte ich auch noch ein paar Worte zu einem anderen Thema sagen.
Jeder hat sein persönliches „ideales Gerät“, und für mich ist dieses „ideale Gerät“ im Bereich KI das Gemini 2.5 Pro. Anfang letzten Jahres waren die Textverarbeitungsfähigkeiten des 2.5 Pro wirklich verblüffend, und danach habe ich KI offiziell in meinen Workflow integriert. Als dann das Gemini 3 auf den Markt kam, habe ich es sofort in meinen WeChat Moments geteilt.
In diesem Sinne wünscht sich niemand mehr als ich, dass der Gemini 4 heraussticht.

Dennoch müssen wir objektive Gesetze respektieren. Wie bereits vielfach angemerkt wurde, ist die Massenproduktion letztlich eine Form der Fertigungsindustrie, vergleichbar mit der Herstellung von Mobiltelefonen und Chips. Wir können nicht erwarten, dass ein Modell, das lange Zeit nicht aktualisiert wurde, plötzlich den Markt dominiert; das ist genauso unrealistisch, wie wenn eine Chipfabrik, die seit Jahren bei 10 nm stagniert, plötzlich einen 2-nm-Chip produziert.
Die erhebliche Diskrepanz zwischen den Benchmark-Ergebnissen des Gemini 3.8 Flash und seiner tatsächlichen Leistung im Alltag lässt vermuten, dass Google möglicherweise „spezielle Optimierungen“ vorgenommen hat, um die Benchmark-Ergebnisse zu manipulieren und so die eigene Blamage zu vertuschen. Ebenso fraglich ist, ob der Gemini 4 in den meisten Benchmark-Tests den aktuellen Stand der Technik erreicht.
Fast zeitgleich mit der Ankündigung des Gemini 4 berichtete Bloomberg auch, dass Google-Mitarbeiter skeptisch hinsichtlich der tatsächlichen Leistung des Gemini 4 seien. Sie beriefen sich auf „Insider“, die angaben, dass der Gemini 4 in realen Anwendungen schlecht abschnitt und „Schwierigkeiten bei bestimmten Programmieraufgaben hatte“.

Obwohl Google die Behauptungen umgehend zurückwies und einige Mitarbeiter Gemini 4 als recht gut bezeichneten, ist anzunehmen, dass die endgültige Version von Gemini 4 nicht so leistungsstark sein wird, wie die Benchmark-Ergebnisse vermuten lassen. Zudem bietet die Entwicklungszeit von Gemini 4 ChatGPT und Claude Modell genügend Zeit für eine Iteration.
Positiv zu vermerken ist jedoch, dass die Veröffentlichung des Gemini 4 Argon bedeutet, dass Google endlich wieder im Wettbewerb steht.
Die Obergrenze mag nicht sehr hoch sein, aber die Untergrenze kann dennoch garantiert werden. Nun gilt es, schrittweise aufzuholen, indem man die Methoden der großtechnischen Modellfertigung anwendet.
