GPT-6 Astra: действительно ли это прорыв?
Hemanth SR
0:00 / 0:00
GPT-6 Astra: действительно ли это прорыв?
759 просмотров · 2 недели назад
Hemanth SR
3,57 тыс. подписчиков
759 просмотров · 2 недели назад
Я потратил четыре дня на тестирование GPT-6 Astra в сравнении с моделью, которую использую каждый день. Вот полный анализ: что действительно изменилось, что это даёт вам для вашей реальной работы, два теста, которые я провёл сам (один Astra выиграла явно, другой проиграл), и два бенчмарка из собственной таблицы OpenAI, которые никто из тех, кто освещал этот запуск, не упомянул.
Astra — самая сильная модель, выпущенная OpenAI, и я покажу вам, почему.
Я также покажу вам разрыв между тем, что говорится в таблице, и тем, что говорится в анонсе, потому что этот разрыв — вся история.
РАЗДЕЛЫ
0:00 Она сама записалась на приём к врачу
0:18 Что на самом деле изменилось
1:18 Три обновления, стоящие за ней
2:42 Работа несложная. Она просто бесконечная.
3:55 Это AGI? Оценка 99,9%
4:18 Почему 99,9 превратилось в 62,7
4:55 Где Клод все еще побеждает
5:32 Тест веб-сайта из 11 слов
7:51 Тест, в котором проиграла Astra
9:10 Две строки, пропущенные в объявлении
10:14 Предостережение, которое OpenAI указала на себя
11:07 Шесть способов его реального использования
12:57 Что нельзя сделать в плане за 20 долларов
13:43 Единственная настройка, которую нужно изменить
14:00 Где он все еще ломается
15:00 Вердикт
ЧТО Я РАССМАТРИВАЮ
Три улучшения, лежащие в его основе: он работает как программное обеспечение, он придерживается плана вместо того, чтобы смещаться, и он принимает контекст в миллион токенов
Тест подсказки из 11 слов: целевая страница GPT-5.6 Sol против страницы Astra, оценка вслух
Аудит бизнес-плана, в котором проиграла Astra, медленнее и примерно в четыре раза дороже по кредиту
Почему Результат ARC-AGI-3, равный 99,9%, составил 62,7% в нейтральной для провайдера среде тестирования.
Последний экзамен человечества: Claude Fable 5.1 65,0%, Opus 5 63,6%, GPT-6 Astra 57,2%
Две независимые лаборатории, два разных метода, оба поставили Astra на третье место.
Снижение способности OpenAI к мониторингу и анализу рассуждений.
Шесть задач, которые стоит поручить, и одна задача, которую никогда не стоит поручать.
Что нельзя сделать в тарифном плане за 20 долларов, и какую настройку следует изменить в первую очередь.
УПОМЯНУТЫЕ ИНСТРУМЕНТЫ
GPT-6 Astra (OpenAI) - на момент съёмки работает в ChatGPT Work и ChatGPT Codex, а не в стандартном окне чата.
GPT-5.6 Sol (OpenAI) - предыдущая модель, использованная в качестве контрольной в обоих тестах.
Claude Fable 5.1 и Claude Opus 5 (Anthropic) — сравнение в собственной таблице OpenAI.
Один вопрос: если вы управляете бизнесом в одиночку и это спасло вас от неудачного решения по подписке, расскажите в комментариях, какую из шести задач вы бы отдали в первую очередь.
Я читаю каждый комментарий, и ответы определяют, что я буду снимать дальше.
Создавайте бизнес, развивайте себя, сохраняйте улыбку.
#GPT6Astra #OpenAI #ClaudeAI