GPT-6 Astra — следующая великая модель?
Ryan & Matt Data Science
0:00 / 0:00
GPT-6 Astra — следующая великая модель?
1 089 просмотров · 9 дней назад
Ryan & Matt Data Science
46,2 тыс. подписчиков
1 089 просмотров · 9 дней назад
💼 Владелец бизнеса или руководитель с командой? Мы создаём системы автоматизации на основе ИИ, которые сокращают затраты и масштабируют операции — всё готово для вас: https://ryanandmattdatascience.com/ai...
🚀 Хотите зарабатывать деньги с помощью навыков в области ИИ? Присоединяйтесь к нашему бесплатному сообществу — реальные проекты, реальные стратегии для клиентов и тот самый стек технологий, который мы используем: https://www.skool.com/data-and-ai
Компания OpenAI только что выпустила GPT-6 Astra, и после изучения всей 117-страничной документации системы я думаю, что этот релиз имеет гораздо большее значение, чем предполагает ажиотаж вокруг него.
В этом видео я подробно рассматриваю бенчмарки, которые действительно что-то говорят: Terminal Bench, Automation Bench, ARC-AGI, BrowseComp, частоту ошибок «галлюцинации» и оценки обмана в кодировании. Заголовок не в том, что Astra превосходит всё. Дело в том, что OpenAI удалось достичь примерно такой же точности, как у Клода Фабле, при этом затраты на API составили примерно треть от первоначальной, количество ошибок, связанных с распознаванием фальсификаций, сократилось более чем вдвое, а процент неудачных попыток обмана при кодировании снизился с 14% до 3%.
ВРЕМЕННЫЕ МЕТКИ
0:00 OpenAI отказывается от GPT-6 Astra
0:24 Что такое Astra на самом деле
0:53 Две вещи, на которых сосредоточилась OpenAI
1:55 Точность против стоимости API в флагманских бенчмарках
3:03 Сопоставление с Claude Fable при трети стоимости
4:09 Terminal Bench, Automation Bench и разговор об AGI
5:14 Почему математические бенчмарки — самые простые
5:36 ARC-AGI: измерение обучения, а не решения
6:38 BrowseComp — бенчмарк, о котором никто не говорит
8:50 Видео об Unreal Engine, которым все делятся
9:43 Что это делает с Higgsfield и платформами генерации видео
10:41 Частота ошибок галлюцинаций — показатель, который меня больше всего волнует
11:51 Astra снижает частоту галлюцинаций ниже 10%
12:50 Объяснение оценок обмана в кодировании
14:24 Частота ошибок увеличивается с 14% до 3%
15:39 Показатель неработающего инструмента поиска просто зашкаливает
16:52 Длина цепочки мыслей и сокращение токенов
17:39 Почему Astra важнее, чем Soul
18:45 Где это применимо: агентные потоки и многофункциональные системы
19:41 Мое честное мнение и буду ли я переходить на другую платформу
20:07 Присоединяйтесь к сообществу
ДРУГИЕ СОЦИАЛЬНЫЕ СЕТИ:
🌐 Веб-сайт и блог: https://ryanandmattdatascience.com/
LinkedIn Райана: / ryan-p-nolan
LinkedIn Мэтта: / matt-payne-ceo
Twitter/X: https://x.com/RyanMattDS
*Это партнерская программа. Мы получаем небольшую часть от конечной продажи без дополнительных затрат для вас.