Перейти к содержимому

Фреймворк оценки LLM для ИИ в критически важных областях

Software Engineering Institute | Carnegie Mellon University

0:00 / 0:00

Фреймворк оценки LLM для ИИ в критически важных областях

322 просмотра · 2 месяца назад
Software Engineering Institute | Carnegie Mellon University
18,8 тыс. подписчиков
322 просмотра · 2 месяца назад
Экспериментирование и проверка производительности LLM имеют решающее значение при создании систем, основанных на LLM, которые должны надежно предоставлять услуги, от чат-ботов для обслуживания клиентов до инструментов анализа данных. Чтобы помочь командам удовлетворить потребность в строгих методах оценки, исследовательская группа в подразделении искусственного интеллекта SEI под руководством Вайолет Турри разработала библиотеку Evaluating Large Language Models (ELM), которая основана на лучших практиках оценки и бенчмаркинга LLM. В последнем эпизоде ​​подкаста Института программной инженерии Университета Карнеги-Меллона Турри беседует с Кэти Робинсон, исследователем дизайна, также работающей в подразделении искусственного интеллекта SEI, о библиотеке ELM, которая превращает оценку из несистематизированного процесса в повторяемую, расширяемую структуру. Серия подкастов SEI также доступна на: Apple Podcasts https://podcasts.apple.com/us/podcast... Spotify https://open.spotify.com/show/1CAKTiV... Soundcloud https://soundcloud.com/cmu-sei-podcas... Цифровая библиотека SEI https://www.sei.cmu.edu/podcasts/ #llm #ai @TheSEICMU Вступление к подкасту и гости: (0:00 - 1:35) Профессиональный опыт Вайолет Турри: (1:36 - 4:03) Важность формальной оценки программ LLM: (4:04 - 6:20) Основные особенности библиотеки ELM: (6:21 - 8:04) Целевая аудитория и варианты использования ELM: (8:05 - 9:54) Разделение вывода и оценки: (9:55 - 10:55) Агентные системы и их оценка: (10:56 - 12:42) Доступные ресурсы и способы доступа к ним: (12:43 - 13:58) Будущие исследования и критерии масштабирования: (13:59 - 16:33)