Перейти к содержимому

Этапы зрелости при оценке эффективности ИИ-агентов — Фил Хетцель, Braintrust

AI Engineer

0:00 / 0:00

Этапы зрелости при оценке эффективности ИИ-агентов — Фил Хетцель, Braintrust

18 118 просмотров · 3 месяца назад
AI Engineer
633 тыс. подписчиков
18 118 просмотров · 3 месяца назад
Большинство команд подходят к оценке как к модульным тестам и пытаются охватить все возможные сбои. Фил Хетцель из Braintrust утверждает, что это неправильный подход: перечислите известные режимы сбоев, охватите их конкретно и внедряйте. Цель — создать своего рода «маховик», где трассировки в производственной среде выявляют проблемы, передают информацию в офлайн-эксперименты и направляют дальнейшие улучшения. В ходе сессии рассматриваются четыре этапа зрелости: проверка на соответствие стандартам с документированными обоснованиями от людей, а не просто оценками «нравится» или «не нравится», использование LLM в качестве судьи, основанного на этих обоснованиях в масштабе, и, наконец, самая сложная часть — вызовы инструментов, затрагивающие внешние системы. Инструменты для сбора контекста управляемы. Инструменты CRUD — нет, потому что необходимо представить состояние внешних систем в тот самый момент, когда выполнялась исходная трассировка. Запросы по временным меткам к векторной базе данных и внедрение захваченного состояния системы непосредственно в трассировку — два подхода к достижению этой цели. Информация о докладчике: -