Этапы зрелости при оценке эффективности ИИ-агентов — Фил Хетцель, Braintrust
AI Engineer
0:00 / 0:00
Этапы зрелости при оценке эффективности ИИ-агентов — Фил Хетцель, Braintrust
18 118 просмотров · 3 месяца назад
AI Engineer
633 тыс. подписчиков
18 118 просмотров · 3 месяца назад
Большинство команд подходят к оценке как к модульным тестам и пытаются охватить все возможные сбои. Фил Хетцель из Braintrust утверждает, что это неправильный подход: перечислите известные режимы сбоев, охватите их конкретно и внедряйте. Цель — создать своего рода «маховик», где трассировки в производственной среде выявляют проблемы, передают информацию в офлайн-эксперименты и направляют дальнейшие улучшения.
В ходе сессии рассматриваются четыре этапа зрелости: проверка на соответствие стандартам с документированными обоснованиями от людей, а не просто оценками «нравится» или «не нравится», использование LLM в качестве судьи, основанного на этих обоснованиях в масштабе, и, наконец, самая сложная часть — вызовы инструментов, затрагивающие внешние системы. Инструменты для сбора контекста управляемы. Инструменты CRUD — нет, потому что необходимо представить состояние внешних систем в тот самый момент, когда выполнялась исходная трассировка. Запросы по временным меткам к векторной базе данных и внедрение захваченного состояния системы непосредственно в трассировку — два подхода к достижению этой цели.
Информация о докладчике:
-