Перейти к содержимому

GPT-6 Astra: действительно ли это прорыв?

Hemanth SR

0:00 / 0:00

GPT-6 Astra: действительно ли это прорыв?

759 просмотров · 2 недели назад
Hemanth SR
3,57 тыс. подписчиков
759 просмотров · 2 недели назад
Я потратил четыре дня на тестирование GPT-6 Astra в сравнении с моделью, которую использую каждый день. Вот полный анализ: что действительно изменилось, что это даёт вам для вашей реальной работы, два теста, которые я провёл сам (один Astra выиграла явно, другой проиграл), и два бенчмарка из собственной таблицы OpenAI, которые никто из тех, кто освещал этот запуск, не упомянул. Astra — самая сильная модель, выпущенная OpenAI, и я покажу вам, почему. Я также покажу вам разрыв между тем, что говорится в таблице, и тем, что говорится в анонсе, потому что этот разрыв — вся история. РАЗДЕЛЫ 0:00 Она сама записалась на приём к врачу 0:18 Что на самом деле изменилось 1:18 Три обновления, стоящие за ней 2:42 Работа несложная. Она просто бесконечная. 3:55 Это AGI? Оценка 99,9% 4:18 Почему 99,9 превратилось в 62,7 4:55 Где Клод все еще побеждает 5:32 Тест веб-сайта из 11 слов 7:51 Тест, в котором проиграла Astra 9:10 Две строки, пропущенные в объявлении 10:14 Предостережение, которое OpenAI указала на себя 11:07 Шесть способов его реального использования 12:57 Что нельзя сделать в плане за 20 долларов 13:43 Единственная настройка, которую нужно изменить 14:00 Где он все еще ломается 15:00 Вердикт ЧТО Я РАССМАТРИВАЮ Три улучшения, лежащие в его основе: он работает как программное обеспечение, он придерживается плана вместо того, чтобы смещаться, и он принимает контекст в миллион токенов Тест подсказки из 11 слов: целевая страница GPT-5.6 Sol против страницы Astra, оценка вслух Аудит бизнес-плана, в котором проиграла Astra, медленнее и примерно в четыре раза дороже по кредиту Почему Результат ARC-AGI-3, равный 99,9%, составил 62,7% в нейтральной для провайдера среде тестирования. Последний экзамен человечества: Claude Fable 5.1 65,0%, Opus 5 63,6%, GPT-6 Astra 57,2% Две независимые лаборатории, два разных метода, оба поставили Astra на третье место. Снижение способности OpenAI к мониторингу и анализу рассуждений. Шесть задач, которые стоит поручить, и одна задача, которую никогда не стоит поручать. Что нельзя сделать в тарифном плане за 20 долларов, и какую настройку следует изменить в первую очередь. УПОМЯНУТЫЕ ИНСТРУМЕНТЫ GPT-6 Astra (OpenAI) - на момент съёмки работает в ChatGPT Work и ChatGPT Codex, а не в стандартном окне чата. GPT-5.6 Sol (OpenAI) - предыдущая модель, использованная в качестве контрольной в обоих тестах. Claude Fable 5.1 и Claude Opus 5 (Anthropic) — сравнение в собственной таблице OpenAI. Один вопрос: если вы управляете бизнесом в одиночку и это спасло вас от неудачного решения по подписке, расскажите в комментариях, какую из шести задач вы бы отдали в первую очередь. Я читаю каждый комментарий, и ответы определяют, что я буду снимать дальше. Создавайте бизнес, развивайте себя, сохраняйте улыбку. #GPT6Astra #OpenAI #ClaudeAI