Qwen 3.8 27B gegen Claude: Schlägt das lokale Modell wirklich Opus? Test auf RTX 5090
ЯФабиан
0:00 / 0:00
Qwen 3.8 27B gegen Claude: Schlägt das lokale Modell wirklich Opus? Test auf RTX 5090
28 036 просмотров · 1 месяц назад
ЯФабиан
11,5 тыс. подписчиков
28 036 просмотров · 1 месяц назад
Qwen 3.8 27B soll laut Benchmark Claude Opus 4.6 schlagen: 61,7 gegen 53,4 Punkte auf SWE-Bench Pro. Ich habe das lokale Modell einen ganzen Tag auf einer RTX 5090 und einem Mac mini M4 Pro laufen lassen und selbst nachgemessen. Die Zahl hat einen Haken.
Du brauchst Hilfe bei der KI-Integration in deinem Unternehmen? Buch dir hier dein kostenloses Gespräch:
👉 https://ichbinfabian.com/termin?utm_s...
📍 Kapitel:
0:00 Die Benchmark-Behauptung
0:41 Qwen 3.8 27B auf Hugging Face, Apache 2.0
1:29 Die Architektur im HF Viewer: 48 lineare und 16 volle Schichten
3:06 Vergleich mit Qwen 3.6: identische Architektur, neue Trainingsdaten
3:42 Vision Tower: das Modell versteht Bilder und Videos
4:08 Die echten Benchmark-Zahlen
5:38 Die Fußnote: Qwen hat alles selbst gemessen
6:01 Opus 4.6 ist ein Februar-Modell, Opus 4.7 liegt darüber
6:34 Hacker News: der Benchmaxing-Vorwurf
6:51 Test 1: Snake in Python auf einer gemieteten RTX 5090
8:39 Der Fehler, der mich Stunden gekostet hat: alles lief auf der CPU
10:09 Ergebnis: 1:47 Minuten bei 75,5 Token pro Sekunde
10:26 Das Snake-Spiel läuft
11:18 Test 2: Physik-Simulation mit hüpfenden Bällen
13:05 Der Fallstrick: 3:39 Minuten nur Nachdenken, dann Abbruch
13:49 Zweiter Anlauf komplett ohne Thinking
14:34 Die Simulation im Browser
16:10 Die Messwerte: RTX 5090 gegen Mac mini M4 Pro
17:09 Beim Einlesen von Kontext liegt Faktor 40 dazwischen
18:10 Speicherbedarf und Fazit zu den Zahlen
18:50 Läuft das auf deiner Karte? Quantisierungen von 12 bis 24 GB
19:45 RunPod: 69 Cent pro Stunde statt 3.000 Euro Grafikkarte
20:37 Chinesisches Modell: was Datenschutz lokal wirklich bedeutet
21:02 Mein Fazit
21:52 Was im nächsten Video kommt
Qwen 3.8 27B ist seit dem 14.08.2026 als offene Gewichte unter Apache 2.0 verfügbar. In diesem Video geht es um die Frage, ob ein lokales Modell mit 27 Milliarden Parametern wirklich an Claude Opus herankommt, und was davon nach eigener Messung übrig bleibt.
Du erfährst:
✅ Warum 48 lineare und 16 volle Attention-Schichten das Modell auch bei vollem Kontext schnell halten
✅ Wie schnell Qwen 3.8 27B wirklich ist: 80 Token pro Sekunde auf einer RTX 5090, 8,4 auf einem Mac mini M4 Pro
✅ Warum der Unterschied beim Einlesen von Kontext viel größer ist als beim Schreiben, Faktor 40
✅ Welche Quantisierung auf 12, 16 oder 24 GB VRAM passt
✅ Warum der Denkmodus in der höchsten Stufe eine offene Aufgabe komplett sprengen kann
✅ Wie du das Modell für 69 Cent pro Stunde testest, bevor du eine Grafikkarte kaufst
🔗 Qwen 3.8 27B auf Hugging Face: https://huggingface.co/Qwen/Qwen3.8-27B
🔗 Unsloth GGUF-Quantisierungen: https://huggingface.co/unsloth/Qwen3....
🔗 Unsloth Hardware-Guide: https://unsloth.ai/docs/models/qwen3.8
🔗 RunPod: https://runpod.io
Meine Skool, Eure Community:
https://www.skool.com/die-ki-werkstat...
Dieses Video behandelt: Qwen 3.8 27B, lokale KI, Local LLM, Qwen vs Claude, Claude Opus 4.6, SWE-Bench Pro, RTX 5090, Mac mini M4 Pro, Open Weights, Apache 2.0, Ollama, llama.cpp, Quantisierung, KI ohne Cloud
📸 Instagram: / ichbinfabiande
💬 Was habt ihr für Hardware zu Hause? Reicht euch noch eine 3090 oder steht bei euch schon eine 5090? Schreibt es in die Kommentare.