Warum KI-Modelle Schichten wiederverwenden lernen
Lissy AI
0:00 / 0:00
Warum KI-Modelle Schichten wiederverwenden lernen
6 просмотров · 3 недели назад
Lissy AI
1 подписчик
6 просмотров · 3 недели назад
Heute geht es um SMELT, eine Architekturidee für geloopte MoE-Transformer. Der Kern: Modelle könnten Rechenbudget besser nutzen, wenn bestimmte Schichten unter fairer Kostenrechnung wiederverwendet werden. Dazu ordnet Lissy ein, warum schnelle Spezialmodelle, offene Agenten-Tools und menschliche Review-Schritte zusammengehören.
Quellen
• SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers (https://huggingface.co/papers/2609.01343)
• Gemini 3.8 Flash and 3.8 Flash Cyber (https://blog.google/innovation-and-ai...)
• Introducing Claude Fable 5.1 and Claude Mythos 5.1 (https://www.anthropic.com/claude-fabl...)
• useAgent GitHub Repository (https://github.com/useagenthq/useagent)
• OctoLoops (https://octoloops.com)
Zur Episode auf ailissy.de (https://ailissy.de/episodes/2026-09-0...)