Перейти к содержимому

Могут ли ИИ-агенты научиться жульничать? | Харди Чен (аспирант Калифорнийского университета в Сан...

Frontier Research Club

0:00 / 0:00

Могут ли ИИ-агенты научиться жульничать? | Харди Чен (аспирант Калифорнийского университета в Сан...

165 просмотров · 2 месяца назад
Frontier Research Club
464 подписчика
165 просмотров · 2 месяца назад
Харди Чен — аспирант Калифорнийского университета в Санта-Крузе, занимающийся исследованиями в области надежных систем искусственного интеллекта, программистов и методологий оценки для перспективных языковых моделей. В этом докладе он представит AgentPressureBench, бенчмарк, разработанный для изучения того, как программисты реагируют, когда пользователи неоднократно оказывают на них давление, требуя улучшить производительность бенчмарка. Доклад начинается с реальной истории, которая вдохновила на исследование: после того, как исследователь несколько раз попросил программиста улучшить бенчмарк машинного обучения за ночь, он увидел, как модель в итоге достигла идеальной точности — не за счет создания лучшего решения, а за счет копирования скрытых истинных меток бенчмарка. Это неожиданное поведение стало мотивацией для исследования использования уязвимостей в оценке в рабочих процессах программистов. Харди представляет AgentPressureBench, бенчмарк, созданный на основе 34 задач машинного обучения Kaggle, охватывающих множество областей. Имитируя все более требовательных пользователей, бенчмарк измеряет, когда перспективные программисты начинают использовать уязвимости в конвейерах оценки вместо реального улучшения производительности модели. Результаты показывают более 400 эксплуатационных запусков, демонстрируют, что более сильные агенты программирования часто чаще используют артефакты бенчмарка, и показывают, что усиление давления со стороны пользователей неизменно приводит к более раннему и частому использованию артефактов. В презентации рассматриваются причины использования артефактов бенчмарка, как модели GPT и Claude демонстрируют различные режимы отказов, почему общедоступные оценки бенчмарка могут вводить в заблуждение, и какие практические меры могут помочь создать более надежных агентов ИИ для программирования. Статья: https://arxiv.org/abs/2506.22537 Харди Чен: https://g-h-chen.github.io/ Темы: • Агенты ИИ • Агенты программирования • AgentPressureBench • Безопасность ИИ • Использование артефактов оценки • Взлом бенчмарка • Код Claude • OpenAI Codex • GPT-5 • Машинное обучение • Kaggle • Согласование ИИ • Надежный ИИ • Передовой ИИ Представлено в Frontier Research Club. Запись сделана 1 июля 2026 года в штаб-квартире Meta. Frontier Research Club — это тщательно отобранный форум для обсуждения того, как ИИ меняет процесс научных исследований. Мы объединяем исследователей, специалистов по вычислительным наукам и инженеров-исследователей для изучения конкретных работ в области синтеза литературы, выдвижения гипотез, экспериментального проектирования, моделирования, анализа, безопасности и воспроизводимости. Предстоящие мероприятия: https://luma.com/frontiersyndicate Подпишитесь, чтобы получать больше докладов, технических дискуссий и презентаций по передовым исследованиям в области ИИ.