Перейти к содержимому

Gemini 4 Argon im Faktencheck: Was Googles Benchmarks nicht zeigen

ЯФабиан

0:00 / 0:00

Gemini 4 Argon im Faktencheck: Was Googles Benchmarks nicht zeigen

1 968 просмотров · 4 часа назад
ЯФабиан
11,5 тыс. подписчиков
1 968 просмотров · 4 часа назад
Gemini 4 Argon im Faktencheck: Google liegt in der eigenen Benchmark-Tabelle in 13 von 19 Zeilen vorne, vor Claude Opus 5.5 und GPT-6 Astra. Ich prüfe die Zahlen gegen unabhängige Ranglisten und zeige, wer Argon überhaupt nutzen darf und was es kosten soll. Du brauchst Hilfe bei der KI-Integration in deinem Unternehmen? Buch dir hier dein kostenloses Gespräch: 👉 https://ichbinfabian.com/termin?utm_s... 0:00 Gemini 4 Argon ist da, aber gesperrt 0:54 Googles Pro-Pause seit Februar 1:56 Eine Million Token am Stück 2:33 Argon-Agenten und über 300 Terabyte Arbeitsspeicher 2:57 Googles Benchmarks: Wo Argon vorne liegt 4:04 Wo Argon beim Programmieren zurückliegt 4:28 Vals Index: Platz 1 von 41 4:43 Harvey Legal Agent: Platz 5 von 73 5:09 Cybersicherheit: Gleichstand, aber viel teurer 6:09 Artificial Analysis: 53 Punkte auf hoher Denkstufe 7:38 Bloomberg: Zweifel bei Google selbst 8:02 Zwischenfazit 8:25 Wer Argon nutzen darf: das Fairwind-Programm 8:53 Dasselbe Muster wie bei Claude Mythos 10:01 Was Argon kosten soll 11:05 Mein Fazit Gemini 4 Argon ist Googles erstes neues Pro-Modell seit Gemini 3.1 Pro im Februar. Es schreibt bis zu eine Million Token am Stück, vorher war bei 64.000 Schluss. In Googles eigener Tabelle gewinnt Argon bei Büroarbeit, Finanzrecherche und Video, beim Programmieren im Terminal und bei FrontierSWE liegen Opus 5.5 und GPT-6 Astra vorne. Ich schaue mir an, welche Zahlen bei Vals, beim Harvey Legal Agent Benchmark, bei CWE-bench und bei Artificial Analysis halten und wo Googles Vergleich Lücken hat. Die wichtigsten Ergebnisse (Stand 02.10.2026): ✅ Vals Index: Argon auf Platz 1 von 41, Googles Zahl stimmt ✅ Harvey Legal Agent: Google zeigt 19,6 gegen 3,8 für Opus, öffentlich ist Argon auf Platz 5 von 73, vier Meta-Modelle liegen davor ✅ CWE-bench: Gleichstand bei 68 % mit Grok 4.7 und GPT-6 Astra, aber 6,63 Dollar pro Durchlauf zum Startpreis gegen 0,79 Dollar bei Opus 5.5 ✅ Artificial Analysis: Argon kommt auf 53 Punkte und liegt auf hoher Denkstufe gleichauf mit Fable 5.1, Opus 5.5 führt mit 58 ✅ Zugang: erst nur Sicherheitsteams im Fairwind-Programm, danach zahlende API-Kunden und Google AI Ultra, ohne Datum ✅ Preis: zum Start 2 Dollar rein und 10 Dollar raus pro Million Token, danach 4 und 20 Dollar, genauso viel wie Opus 5.5 Links und Quellen: Google-Blog Gemini 4 Argon: https://blog.google/innovation-and-ai... Fairwind-Programm: https://deepmind.google/fairwind-prog... Benchmark-Tabelle als Text (DataCamp): https://www.datacamp.com/blog/gemini-... Vals, Gemini 4 Argon: https://www.vals.ai/models/google_gem... Harvey Legal Agent Benchmark: https://www.vals.ai/benchmarks/hlab CWE-bench: https://cwe-bench.com Artificial Analysis: https://artificialanalysis.ai/article... Bloomberg-Bericht via TNW: https://thenextweb.com/news/google-ge... Claude Mythos: https://www.anthropic.com/claude/mythos API-Preise Claude: https://platform.claude.com/docs/en/a... API-Preise OpenAI: https://developers.openai.com/api/doc... Meine Skool, Eure Community: https://www.skool.com/die-ki-werkstat... Dieses Video behandelt: Gemini 4 Argon, Google Gemini 4, Gemini 4 Benchmarks, Claude Opus 5.5, GPT-6 Astra, Fable 5.1, Claude Mythos, Fairwind-Programm, Vals Index, CWE-bench, Artificial Analysis, KI-Modelle im Vergleich 📸 Instagram:   / ichbinfabiande   💬 Schafft Google mit Argon das Comeback, oder bleibt ihr bei Claude und ChatGPT? Schreibt es in die Kommentare.