CLM от Stanford и NVIDIA: решения в 13 раз быстрее — обзор на русском
Трезво об ИИ
0:00 / 0:00
CLM от Stanford и NVIDIA: решения в 13 раз быстрее — обзор на русском
58 просмотров · 12 дн. назад
Трезво об ИИ
39 подписчиков
58 просмотров · 12 дн. назад
CLM (контрастивная языковая модель) — новая модель первого типа (System 1) от команды из Стэнфорда и NVIDIA Research. Она не генерирует токены, а работает как CLIP, только для решений: ситуация и каждое возможное действие попадают в одно пространство эмбеддингов, и модель выбирает ближайший вариант.
В ролике разобрано, откуда берётся скорость. Действия встраиваются один раз и кэшируются, поэтому на каждом шаге нужен только один проход для состояния и скалярные произведения. При почти тысяче вариантов — 44 мс против 570 мс у Jev, то есть примерно в 13 раз быстрее. Обучение идёт в три этапа: 60 млн пар «вопрос — ответ» из Nemotron, 30 млн сложных отрицательных примеров от Gemini и около миллиона шагов агентных траекторий. Базовая модель на 8B заморожена, обучаются только небольшие головы примерно на 20 млн параметров.
Автор проверил CLM на DGX Spark: классификация обращений в поддержку, выбор из 1080 инструментов и WikiRacing. Задержка держится в районе 80 мс, но точность падает с 86% при 8 инструментах до 17% при 1080 — варианты кодируются по отдельности, и модель не может сравнить их между собой.
Ролик пригодится разработчикам агентов и инженерам, которым нужен быстрый роутинг, выбор инструментов и классификация. Здесь также разобрано, где CLM полезна уже сейчас: как быстрый первый этап, который отбирает шорт-лист перед моделью System 2.
Источник: Prompt Engineering
#ИИ #нейросети #AI