Перейти к содержимому

Qwen 3.8 27B gegen Claude: Schlägt das lokale Modell wirklich Opus? Test auf RTX 5090

ЯФабиан

0:00 / 0:00

Qwen 3.8 27B gegen Claude: Schlägt das lokale Modell wirklich Opus? Test auf RTX 5090

28 036 просмотров · 1 месяц назад
ЯФабиан
11,5 тыс. подписчиков
28 036 просмотров · 1 месяц назад
Qwen 3.8 27B soll laut Benchmark Claude Opus 4.6 schlagen: 61,7 gegen 53,4 Punkte auf SWE-Bench Pro. Ich habe das lokale Modell einen ganzen Tag auf einer RTX 5090 und einem Mac mini M4 Pro laufen lassen und selbst nachgemessen. Die Zahl hat einen Haken. Du brauchst Hilfe bei der KI-Integration in deinem Unternehmen? Buch dir hier dein kostenloses Gespräch: 👉 https://ichbinfabian.com/termin?utm_s... 📍 Kapitel: 0:00 Die Benchmark-Behauptung 0:41 Qwen 3.8 27B auf Hugging Face, Apache 2.0 1:29 Die Architektur im HF Viewer: 48 lineare und 16 volle Schichten 3:06 Vergleich mit Qwen 3.6: identische Architektur, neue Trainingsdaten 3:42 Vision Tower: das Modell versteht Bilder und Videos 4:08 Die echten Benchmark-Zahlen 5:38 Die Fußnote: Qwen hat alles selbst gemessen 6:01 Opus 4.6 ist ein Februar-Modell, Opus 4.7 liegt darüber 6:34 Hacker News: der Benchmaxing-Vorwurf 6:51 Test 1: Snake in Python auf einer gemieteten RTX 5090 8:39 Der Fehler, der mich Stunden gekostet hat: alles lief auf der CPU 10:09 Ergebnis: 1:47 Minuten bei 75,5 Token pro Sekunde 10:26 Das Snake-Spiel läuft 11:18 Test 2: Physik-Simulation mit hüpfenden Bällen 13:05 Der Fallstrick: 3:39 Minuten nur Nachdenken, dann Abbruch 13:49 Zweiter Anlauf komplett ohne Thinking 14:34 Die Simulation im Browser 16:10 Die Messwerte: RTX 5090 gegen Mac mini M4 Pro 17:09 Beim Einlesen von Kontext liegt Faktor 40 dazwischen 18:10 Speicherbedarf und Fazit zu den Zahlen 18:50 Läuft das auf deiner Karte? Quantisierungen von 12 bis 24 GB 19:45 RunPod: 69 Cent pro Stunde statt 3.000 Euro Grafikkarte 20:37 Chinesisches Modell: was Datenschutz lokal wirklich bedeutet 21:02 Mein Fazit 21:52 Was im nächsten Video kommt Qwen 3.8 27B ist seit dem 14.08.2026 als offene Gewichte unter Apache 2.0 verfügbar. In diesem Video geht es um die Frage, ob ein lokales Modell mit 27 Milliarden Parametern wirklich an Claude Opus herankommt, und was davon nach eigener Messung übrig bleibt. Du erfährst: ✅ Warum 48 lineare und 16 volle Attention-Schichten das Modell auch bei vollem Kontext schnell halten ✅ Wie schnell Qwen 3.8 27B wirklich ist: 80 Token pro Sekunde auf einer RTX 5090, 8,4 auf einem Mac mini M4 Pro ✅ Warum der Unterschied beim Einlesen von Kontext viel größer ist als beim Schreiben, Faktor 40 ✅ Welche Quantisierung auf 12, 16 oder 24 GB VRAM passt ✅ Warum der Denkmodus in der höchsten Stufe eine offene Aufgabe komplett sprengen kann ✅ Wie du das Modell für 69 Cent pro Stunde testest, bevor du eine Grafikkarte kaufst 🔗 Qwen 3.8 27B auf Hugging Face: https://huggingface.co/Qwen/Qwen3.8-27B 🔗 Unsloth GGUF-Quantisierungen: https://huggingface.co/unsloth/Qwen3.... 🔗 Unsloth Hardware-Guide: https://unsloth.ai/docs/models/qwen3.8 🔗 RunPod: https://runpod.io Meine Skool, Eure Community: https://www.skool.com/die-ki-werkstat... Dieses Video behandelt: Qwen 3.8 27B, lokale KI, Local LLM, Qwen vs Claude, Claude Opus 4.6, SWE-Bench Pro, RTX 5090, Mac mini M4 Pro, Open Weights, Apache 2.0, Ollama, llama.cpp, Quantisierung, KI ohne Cloud 📸 Instagram:   / ichbinfabiande   💬 Was habt ihr für Hardware zu Hause? Reicht euch noch eine 3090 oder steht bei euch schon eine 5090? Schreibt es in die Kommentare.