FrontierMath: когда ИИ сравняется с лучшими математиками мира?
Epoch AI
0:00 / 0:00
FrontierMath: когда ИИ сравняется с лучшими математиками мира?
3 695 просмотров · 1 год назад
Epoch AI
2,47 тыс. подписчиков
3 695 просмотров · 1 год назад
Что бы это значило, если бы ИИ смог заменить лучших математиков-людей? В этом интервью, записанном в ноябре 2024 года, ведущий математик Epoch Эллиот Глейзер объясняет, почему мы разработали FrontierMath — очень сложную математическую задачу, предназначенную для проверки пределов возможностей рассуждений ИИ.
Одним из главных препятствий в развитии ИИ является способность моделей ИИ формировать целостное мировоззрение и представление об истине, а также участвовать в длинных и сложных логических цепочках. Высшая математика предлагает очень хорошую среду для оценки такого рода сложных рассуждений, что делает FrontierMath уникальным инструментом для надежного отслеживания прогресса ИИ.
Бенчмарк FrontierMath охватывает современную математику, охватывая основные области — от вычислительно сложных задач теории чисел до абстрактных вопросов алгебраической геометрии и теории категорий. Эллиот рассказывает о том, как FrontierMath развивался, чтобы включить в себя все более сложные задачи, которые, как ожидается, значительно бросят вызов системам ИИ.
Эта беседа позволяет понять, как тщательно разработанные бенчмарки помогают нам оценить истинные возможности ИИ, потенциально отслеживая и направляя развитие систематического, инновационного мышления, необходимого для научных исследований.
Примечания*
• С момента записи этого видео (ноябрь 2024 г.) до его выпуска (апрель 2025 г.) оценки Эллиота относительно сроков решения первой версии FrontierMath сократились с 5 до 2 лет, учитывая, что последние модели показали более высокие результаты, чем ожидалось, на этом бенчмарке. Другие исследователи из Epoch обновили свои прогнозы, сделав их еще более оптимистичными. Мы решили оставить первоначальные прогнозы для прозрачности, а также потому, что эти обновления демонстрируют, что FrontierMath выполняет свою работу: помогает нам сделать наши представления о будущем ИИ более точными.
• На момент записи этого видео FrontierMath состоял всего из трех уровней сложности. В последнее время Epoch работает над 4-м уровнем FrontierMath, вводя еще более сложные задачи, для решения которых требуются недели или даже месяцы работы экспертов. Изучите методологию FrontierMath, ознакомьтесь с примерами задач с решениями и проверьте производительность ИИ здесь: https://epoch.ai/frontiermath/the-ben...
Временные метки
00:00 - Предварительный просмотр
00:13 - Почему Epoch AI вложила столько усилий именно в математический бенчмарк?
01:19 - Чего должны достичь модели ИИ, прежде чем они смогут хорошо работать на FrontierMath?
02:33 - Почему модели LLM не могут превзойти FrontierMath, просто обучаясь на существующих математических данных?
04:29 - Как долго, по вашему мнению, просуществует FrontierMath?
05:02 - Насколько репрезентативны вопросы FrontierMath для исследовательских задач?
07:14 - С какими основными трудностями вы столкнулись при создании FrontierMath?
10:14 - Столкнулись ли вы со значительными трудностями при создании сложных задач?
10:52 - Как вы измеряете сложность задач на FrontierMath?
12:31 — Как проект FrontierMath развивался по сравнению с его первоначальными целями?
13:57 — Что вас, как математика, привлекает в этом проекте?