Дистилляция по одной итерации: переизбыток данных при дефиците алгоритмов
Research Paper Review
0:00 / 0:00
Дистилляция по одной итерации: переизбыток данных при дефиците алгоритмов
52 просмотра · 14 часов назад
Research Paper Review
1,38 тыс. подписчиков
52 просмотра · 14 часов назад
В статье рассматривается удивительное открытие: метод **On-Policy Distillation (OPD)**, используемый в постобучении крупномасштабных языковых моделей (LLM), позволяет восстановить большую часть эффектов обучения, используя весь набор данных всего одним запросом (Query). Благодаря этому мы впервые определяем эффективность данных и механизм обучения OPD.
https://arxiv.org/pdf/2609.04172