Безопасное тестирование и оценка ИИ
Data Science Dojo
0:00 / 0:00
Безопасное тестирование и оценка ИИ
216 просмотров · Трансляция закончилась 3 недели назад
Data Science Dojo
122 тыс. подписчиков
216 просмотров · Трансляция закончилась 3 недели назад
Как узнать, действительно ли замена модели или другое изменение улучшают ситуацию до запуска в эксплуатацию? Появляется новая модель, более дешевая и быстрая, и поставщик клянется, что она работает так же хорошо. Подключается новый инструмент. Настраивается подсказка. Любое из этих изменений может незаметно нарушить рабочий процесс, от которого зависят ваши клиенты, — и первым признаком проблем часто является недовольный клиент, а не панель управления.
Мы рассмотрим, что такое эталонный набор запросов — небольшой набор вопросов, критически важных для монетизации, с нулевой терпимостью к ошибкам, дополненный реальными запросами из истории пользователей (особенно теми, которые получили отрицательные оценки) и гипотетическими крайними случаями, которые эксперт хочет протестировать, прежде чем клиент их задаст.
Далее мы рассмотрим некоторые ключевые метрики, на которых стоит сосредоточиться — семантическое сходство, соответствие и обоснованность — и почему запуск этих метрик в масштабе, когда один эксперт оценивает результаты другого, является реальным компромиссом, который стоит учитывать.
Мы также обсудим, что меняется, когда оценка автоматизирована и напрямую интегрирована в CI/CD, так что каждое предлагаемое изменение тестируется по вашим собственным пользовательским бенчмаркам еще до того, как оно станет доступно для проверки развертывания — никому не нужно будет помнить о том, чтобы спросить.
Мы поделимся своим опытом и ответим на вопросы аудитории.
*Что вы узнаете*
Почему тестирование на тестовой среде позволяет определить, безопасно ли вносить изменения, а оценка — это отдельный вопрос о том, действительно ли они полезны
Как создать эталонный показатель: критически важные для монетизации запросы, реальная история пользователей и крайние случаи, рассматриваемые экспертами
Три ключевых показателя, на которые следует обратить внимание — семантическое сходство, точность и обоснованность — и что каждый из них на самом деле отражает
Почему оценка, основанная на оценке LLM, сопряжена с реальным компромиссом в стоимости и как эффективно ее проводить
Как интеграция оценки в CI/CD превращает «нам, вероятно, следует это протестировать» в автоматический, повторяемый этап перед каждым развертыванием
Живой пример проведения оценки на тестовой и производственной средах с разбивкой по категориям запросов внутри платформы Ejento