Фреймворк оценки LLM для ИИ в критически важных областях
Software Engineering Institute | Carnegie Mellon University
0:00 / 0:00
Фреймворк оценки LLM для ИИ в критически важных областях
322 просмотра · 2 месяца назад
Software Engineering Institute | Carnegie Mellon University
18,8 тыс. подписчиков
322 просмотра · 2 месяца назад
Экспериментирование и проверка производительности LLM имеют решающее значение при создании систем, основанных на LLM, которые должны надежно предоставлять услуги, от чат-ботов для обслуживания клиентов до инструментов анализа данных. Чтобы помочь командам удовлетворить потребность в строгих методах оценки, исследовательская группа в подразделении искусственного интеллекта SEI под руководством Вайолет Турри разработала библиотеку Evaluating Large Language Models (ELM), которая основана на лучших практиках оценки и бенчмаркинга LLM. В последнем эпизоде подкаста Института программной инженерии Университета Карнеги-Меллона Турри беседует с Кэти Робинсон, исследователем дизайна, также работающей в подразделении искусственного интеллекта SEI, о библиотеке ELM, которая превращает оценку из несистематизированного процесса в повторяемую, расширяемую структуру.
Серия подкастов SEI также доступна на:
Apple Podcasts https://podcasts.apple.com/us/podcast...
Spotify https://open.spotify.com/show/1CAKTiV...
Soundcloud https://soundcloud.com/cmu-sei-podcas...
Цифровая библиотека SEI https://www.sei.cmu.edu/podcasts/
#llm #ai @TheSEICMU
Вступление к подкасту и гости: (0:00 - 1:35)
Профессиональный опыт Вайолет Турри: (1:36 - 4:03)
Важность формальной оценки программ LLM: (4:04 - 6:20)
Основные особенности библиотеки ELM: (6:21 - 8:04)
Целевая аудитория и варианты использования ELM: (8:05 - 9:54)
Разделение вывода и оценки: (9:55 - 10:55)
Агентные системы и их оценка: (10:56 - 12:42)
Доступные ресурсы и способы доступа к ним: (12:43 - 13:58)
Будущие исследования и критерии масштабирования: (13:59 - 16:33)