Семинар по методу Монте-Карло | Ной Голович | Понимание параллельных рассуждений в выводе языковы...
Monte Carlo Seminar
0:00 / 0:00
Семинар по методу Монте-Карло | Ной Голович | Понимание параллельных рассуждений в выводе языковы...
233 просмотра · 4 мес. назад
Monte Carlo Seminar
1,02 тыс. подписчиков
233 просмотра · 4 мес. назад
Онлайн-семинар по методу Монте-Карло
sites.google.com/view/monte-carlo-seminar
Докладчик: Ноа Голович (Техасский университет в Остине)
Название: Понимание параллельных рассуждений в выводе языковых моделей
Аннотация: Эффективная выборка из сложного распределения вероятностей является фундаментальной проблемой в машинном обучении и теоретической информатике. В последние годы она стала все более актуальной с развитием генеративного ИИ, поскольку были предложены сложные процедуры выборки из больших языковых моделей (LLM) для решения сложных задач рассуждения, охватывающих такие области, как математика и программирование. Однако в большинстве случаев нам не хватает принципиального понимания компромисса между точностью и стоимостью таких процедур. В этом докладе мы предлагаем формализацию таких задач как проблему получения выборки из целевой меры вероятности, имея оракула, который дает приблизительные оценки плотности для целевой меры. В зависимости от контекста этот оракул может быть интерпретирован как приблизительный верификатор или модель вознаграждения процесса для конкретной задачи языкового моделирования. Данная схема тесно связана с проблемой сведения выборки к приблизительному подсчету, изученной в основополагающих работах Джеррума, Валианта и Вазирани (1986) и Джеррума и Синклера (1989).
Обобщая результаты из существующей литературы, мы устанавливаем доказуемые гарантии для алгоритма последовательного Монте-Карло и связанных с ним подходов к фильтрации частиц, которые недавно эмпирически доказали свою эффективность в контексте как языкового моделирования, так и диффузии. В частности, наша теория определяет несколько свойств оракула, достаточных для эффективной выборки. Мы проводим эксперименты, чтобы показать, что эти свойства действительно коррелируют с эффективностью выборки для определенных задач языкового моделирования.
Однако эффективность таких алгоритмов выборки ограничена взаимосвязью между лежащей в основе LLM и конкретной задачей выборки, что послужило мотивацией для концепции обучения во время тестирования (Test-Time Training, TTT). В частности, TTT обновляет веса модели в ответ на частичные генерации и обратную связь по вознаграждению, полученную во время вывода. Во второй половине доклада мы обсудим некоторые доказанные преимущества TTT в контексте нашей модели выборки.
Основано на https://arxiv.org/pdf/2603.07887 (совместная работа с Фан Ченом, Дхрувом Рохатги, Рагхавом Сингхалом, Карлесом Доминго-Энрихом, Диланом Дж. Фостером и Акшаем Кришнамурти); и предстоящей совместной работе с Анкуром Мойтрой и Дхрувом Рохатги.