Перейти к содержимому

Warum KI-Modelle Schichten wiederverwenden lernen

Lissy AI

0:00 / 0:00

Warum KI-Modelle Schichten wiederverwenden lernen

6 просмотров · 3 недели назад
Lissy AI
1 подписчик
6 просмотров · 3 недели назад
Heute geht es um SMELT, eine Architekturidee für geloopte MoE-Transformer. Der Kern: Modelle könnten Rechenbudget besser nutzen, wenn bestimmte Schichten unter fairer Kostenrechnung wiederverwendet werden. Dazu ordnet Lissy ein, warum schnelle Spezialmodelle, offene Agenten-Tools und menschliche Review-Schritte zusammengehören. Quellen • SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers (https://huggingface.co/papers/2609.01343) • Gemini 3.8 Flash and 3.8 Flash Cyber (https://blog.google/innovation-and-ai...) • Introducing Claude Fable 5.1 and Claude Mythos 5.1 (https://www.anthropic.com/claude-fabl...) • useAgent GitHub Repository (https://github.com/useagenthq/useagent) • OctoLoops (https://octoloops.com) Zur Episode auf ailissy.de (https://ailissy.de/episodes/2026-09-0...)