Lokale KI mit Bonsai 2: 27B kostenlos auf PC und Mac
ЯФабиан
0:00 / 0:00
Lokale KI mit Bonsai 2: 27B kostenlos auf PC und Mac
46 403 просмотра · 2 дня назад
ЯФабиан
10,9 тыс. подписчиков
46 403 просмотра · 2 дня назад
Qwen 3.8 27B als Bonsai 2 lokal nutzen: Ich teste die kostenlose KI auf einer RTX 5070 Ti und einem MacBook. Mit Setup, Tempo und Coding-Test.
Kostenlose Downloads und Startbefehle aus der offiziellen Anleitung:
https://github.com/PrismML-Eng/Bonsai...
Mac-Anleitung mit MLX und passendem Loader:
https://huggingface.co/prism-ml/Terna...
Du brauchst Hilfe bei der KI-Integration in deinem Unternehmen? Buch dir hier dein kostenloses Gespräch:
👉 https://ichbinfabian.com/termin?utm_s...
Kapitel:
0:00 Bonsai 2: Qwen 3.8 27B als kleineres Modell
1:24 Wie ternäre Gewichte Speicher sparen
2:32 Windows: Download und Einrichtung
3:47 Warum Ollama und LM Studio im Test scheitern
4:53 Bis zu 262.144 Token Kontext auf 16 GB
6:16 Bonsai gegen Qwen: 77 statt 43 Token/s
6:48 MacBook M2 Max: Modell und Hardware
7:18 Mac: MLX installieren und starten
9:14 Mac-Messung: Tempo und Speicherverbrauch
9:51 Coding-Test: Ein Sonnensystem bauen
11:26 Weniger Denkaufwand, schnelleres Ergebnis
12:14 Acht Coding-Läufe im Vergleich
13:15 Hardware-Grenzen und CPU-Offloading
14:20 Fazit: Für wen lohnt sich Bonsai 2?
Ich zeige dir, wie du Ternary Bonsai 2 27B unter Windows und auf einem Mac mit Apple Silicon einrichtest. Im Test messe ich Geschwindigkeit, Speicherbedarf und das große Kontextfenster auf meiner RTX 5070 Ti mit 16 GB VRAM. Auf dem MacBook M2 Max mit 32 GB prüfe ich die MLX-Fassung. Anschließend lasse ich das Modell ein Sonnensystem programmieren und vergleiche acht Läufe mit unterschiedlichem Denkaufwand. Du siehst auch, warum Ollama und LM Studio in meinem Test scheitern und wie stark CPU-Offloading das Tempo drückt. Das hilft dir einzuschätzen, ob Bonsai 2 zu deiner Hardware und deinen Aufgaben passt.
Links und Quellen:
GGUF-Modell für die Grafikkarte:
https://huggingface.co/prism-ml/Terna...
Qwen 3.8 27B, das Originalmodell:
https://huggingface.co/Qwen/Qwen3.8-27B
Whitepaper mit den Hersteller-Benchmarks:
https://github.com/PrismML-Eng/Bonsai...
Wichtig zur Einrichtung: Bonsai 2 benötigt die passende PrismML-Runtime beziehungsweise den mitgelieferten MLX-Loader. Die kleinere GGUF-Datei ist rund 6 GB groß. Das ist nicht der gesamte VRAM-Bedarf. Die Mac-Fassung ist rund 8,6 GB groß. Für weniger Denkaufwand heißt die unterstützte Einstellung „medium“, nicht „low“.
Einordnung der Messungen: 77 statt 43 Token/s stammt aus meinem Vergleich auf derselben Grafikkarte. Die genannten 98,2 % sind ein Durchschnitt aus Hersteller-Benchmarks, keine Garantie für jede Aufgabe. Das auf 262.144 Token eingestellte Kontextfenster ist kein Nachweis fehlerfreien Erinnerns über diese gesamte Länge.
Meine Skool, Eure Community:
https://www.skool.com/die-ki-werkstat...
Instagram: / ichbinfabiande
Welche Grafikkarte oder welchen Mac nutzt du für lokale KI? Schreib es in die Kommentare.
#LokaleKI #Qwen #Bonsai2