Перейти к содержимому

Безопасное тестирование и оценка ИИ

Data Science Dojo

0:00 / 0:00

Безопасное тестирование и оценка ИИ

216 просмотров · Трансляция закончилась 3 недели назад
Data Science Dojo
122 тыс. подписчиков
216 просмотров · Трансляция закончилась 3 недели назад
Как узнать, действительно ли замена модели или другое изменение улучшают ситуацию до запуска в эксплуатацию? Появляется новая модель, более дешевая и быстрая, и поставщик клянется, что она работает так же хорошо. Подключается новый инструмент. Настраивается подсказка. Любое из этих изменений может незаметно нарушить рабочий процесс, от которого зависят ваши клиенты, — и первым признаком проблем часто является недовольный клиент, а не панель управления. Мы рассмотрим, что такое эталонный набор запросов — небольшой набор вопросов, критически важных для монетизации, с нулевой терпимостью к ошибкам, дополненный реальными запросами из истории пользователей (особенно теми, которые получили отрицательные оценки) и гипотетическими крайними случаями, которые эксперт хочет протестировать, прежде чем клиент их задаст. Далее мы рассмотрим некоторые ключевые метрики, на которых стоит сосредоточиться — семантическое сходство, соответствие и обоснованность — и почему запуск этих метрик в масштабе, когда один эксперт оценивает результаты другого, является реальным компромиссом, который стоит учитывать. Мы также обсудим, что меняется, когда оценка автоматизирована и напрямую интегрирована в CI/CD, так что каждое предлагаемое изменение тестируется по вашим собственным пользовательским бенчмаркам еще до того, как оно станет доступно для проверки развертывания — никому не нужно будет помнить о том, чтобы спросить. Мы поделимся своим опытом и ответим на вопросы аудитории. *Что вы узнаете* Почему тестирование на тестовой среде позволяет определить, безопасно ли вносить изменения, а оценка — это отдельный вопрос о том, действительно ли они полезны Как создать эталонный показатель: критически важные для монетизации запросы, реальная история пользователей и крайние случаи, рассматриваемые экспертами Три ключевых показателя, на которые следует обратить внимание — семантическое сходство, точность и обоснованность — и что каждый из них на самом деле отражает Почему оценка, основанная на оценке LLM, сопряжена с реальным компромиссом в стоимости и как эффективно ее проводить Как интеграция оценки в CI/CD превращает «нам, вероятно, следует это протестировать» в автоматический, повторяемый этап перед каждым развертыванием Живой пример проведения оценки на тестовой и производственной средах с разбивкой по категориям запросов внутри платформы Ejento