Перейти к содержимому

GPT-6 Astra — следующая великая модель?

Ryan & Matt Data Science

0:00 / 0:00

GPT-6 Astra — следующая великая модель?

1 089 просмотров · 9 дней назад
Ryan & Matt Data Science
46,2 тыс. подписчиков
1 089 просмотров · 9 дней назад
💼 Владелец бизнеса или руководитель с командой? Мы создаём системы автоматизации на основе ИИ, которые сокращают затраты и масштабируют операции — всё готово для вас: https://ryanandmattdatascience.com/ai... 🚀 Хотите зарабатывать деньги с помощью навыков в области ИИ? Присоединяйтесь к нашему бесплатному сообществу — реальные проекты, реальные стратегии для клиентов и тот самый стек технологий, который мы используем: https://www.skool.com/data-and-ai Компания OpenAI только что выпустила GPT-6 Astra, и после изучения всей 117-страничной документации системы я думаю, что этот релиз имеет гораздо большее значение, чем предполагает ажиотаж вокруг него. В этом видео я подробно рассматриваю бенчмарки, которые действительно что-то говорят: Terminal Bench, Automation Bench, ARC-AGI, BrowseComp, частоту ошибок «галлюцинации» и оценки обмана в кодировании. Заголовок не в том, что Astra превосходит всё. Дело в том, что OpenAI удалось достичь примерно такой же точности, как у Клода Фабле, при этом затраты на API составили примерно треть от первоначальной, количество ошибок, связанных с распознаванием фальсификаций, сократилось более чем вдвое, а процент неудачных попыток обмана при кодировании снизился с 14% до 3%. ВРЕМЕННЫЕ МЕТКИ 0:00 OpenAI отказывается от GPT-6 Astra 0:24 Что такое Astra на самом деле 0:53 Две вещи, на которых сосредоточилась OpenAI 1:55 Точность против стоимости API в флагманских бенчмарках 3:03 Сопоставление с Claude Fable при трети стоимости 4:09 Terminal Bench, Automation Bench и разговор об AGI 5:14 Почему математические бенчмарки — самые простые 5:36 ARC-AGI: измерение обучения, а не решения 6:38 BrowseComp — бенчмарк, о котором никто не говорит 8:50 Видео об Unreal Engine, которым все делятся 9:43 Что это делает с Higgsfield и платформами генерации видео 10:41 Частота ошибок галлюцинаций — показатель, который меня больше всего волнует 11:51 Astra снижает частоту галлюцинаций ниже 10% 12:50 Объяснение оценок обмана в кодировании 14:24 Частота ошибок увеличивается с 14% до 3% 15:39 Показатель неработающего инструмента поиска просто зашкаливает 16:52 Длина цепочки мыслей и сокращение токенов 17:39 Почему Astra важнее, чем Soul 18:45 Где это применимо: агентные потоки и многофункциональные системы 19:41 Мое честное мнение и буду ли я переходить на другую платформу 20:07 Присоединяйтесь к сообществу ДРУГИЕ СОЦИАЛЬНЫЕ СЕТИ: 🌐 Веб-сайт и блог: https://ryanandmattdatascience.com/ LinkedIn Райана:   / ryan-p-nolan   LinkedIn Мэтта:   / matt-payne-ceo   Twitter/X: https://x.com/RyanMattDS *Это партнерская программа. Мы получаем небольшую часть от конечной продажи без дополнительных затрат для вас.