Перейти к содержимому

Дистилляция по одной итерации: переизбыток данных при дефиците алгоритмов

Research Paper Review

0:00 / 0:00

Дистилляция по одной итерации: переизбыток данных при дефиците алгоритмов

52 просмотра · 14 часов назад
Research Paper Review
1,38 тыс. подписчиков
52 просмотра · 14 часов назад
В статье рассматривается удивительное открытие: метод **On-Policy Distillation (OPD)**, используемый в постобучении крупномасштабных языковых моделей (LLM), позволяет восстановить большую часть эффектов обучения, используя весь набор данных всего одним запросом (Query). Благодаря этому мы впервые определяем эффективность данных и механизм обучения OPD. https://arxiv.org/pdf/2609.04172