Перейти к содержимому

Теория возникновения сложных навыков у языковых моделей

Simons Institute for the Theory of Computing

0:00 / 0:00

Теория возникновения сложных навыков у языковых моделей

19 314 просмотров · Трансляция закончилась 3 года назад
Simons Institute for the Theory of Computing
76,7 тыс. подписчиков
19 314 просмотров · Трансляция закончилась 3 года назад
Санджив Арора (Принстонский университет) Теория возникновения сложных навыков в языковых моделях Большие языковые модели и трансформеры Одним из главных факторов развития ИИ сегодня является то, что новые навыки возникают в языковых моделях при увеличении их набора параметров и обучающих корпусов. Это явление плохо изучено, и механистическое объяснение с помощью математического анализа градиентного обучения представляется сложным. В данной статье используется другой подход, анализирующий возникновение навыков с помощью известных (и эмпирических) законов масштабирования больших языковых моделей и простой статистической модели. Вклад включает в себя: (а) Статистическую модель, связывающую потери кросс-энтропии больших языковых моделей с компетентностью в базовых навыках, лежащих в основе языковых задач. (б) Математический анализ, показывающий, что законы масштабирования подразумевают сильную форму индуктивного смещения, которая позволяет предварительно обученной модели учиться очень эффективно. Мы неофициально называем это *обобщением с помощью рогатки*, поскольку наивно рассматриваемое, оно, по-видимому, дает уровни компетентности в навыках, которые нарушают обычную теорию обобщения. (c) Ключевой пример обобщения по принципу «рогатки»: компетентность в выполнении задач, включающих k-кортежи навыков, развивается по существу с той же скоростью и масштабируемостью, что и компетентность в самих элементарных навыках.