Перейти к содержимому

Агент проходит 61% тестов, но надёжен в 25%. Разбираем evals

Дмитрий Березницкий

0:00 / 0:00

Агент проходит 61% тестов, но надёжен в 25%. Разбираем evals

2 103 просмотра · 7 часов назад
Дмитрий Березницкий
14,4 тыс. подписчиков
2 103 просмотра · 7 часов назад
Как тестировать AI-агента, чтобы ему можно было доверять: тесты проходят, а в проде он врёт, зацикливается и дёргает не те инструменты. Разбираем evals для агентов: что на самом деле тестировать, чем мерить и как отличить регрессию от шума. В видео: — почему при нулевой температуре LLM всё равно отвечает по-разному — pass@k и pass^k: почему агент проходит тесты, но ненадёжен — что в harness проверяется без единого вызова модели и почему это бесплатно — как модель меняется под вами, даже если вы её не трогали — почему в памяти агента опаснее не забытый факт, а устаревший — LLM-судья видел поломку и всё равно ставил зачёт: как калибровать судью по разметке людей — тест с живой моделью падает через раз: регрессия это или шум — как суд в Германии спросил с компании за выдумки её чат-бота Таймкоды: 0:00 — Введение 2:14 — Почему обычные тесты не работают: pass@k и pass^k 8:59 — Что тестировать: harness и модель 17:30 — Память и tools 23:59 — Кто ставит оценку: код, LLM-судья, человек 29:46 — Регрессия или шум. Откуда брать тест-кейсы 32:57 — Что ещё ломает агентов: от перефразировок до суда Недетерминизм LLM на GPU (Yuan et al.) — https://arxiv.org/html/2506.09501v2 Метрика pass^k, τ-bench — https://arxiv.org/abs/2406.12045 Средний успех против стабильности, 16 моделей (Zhou et al.) — https://arxiv.org/abs/2606.00920 HAL, надёжность агентов (Принстон) — https://hal.cs.princeton.edu/reliabil... Harness сильнее модели — https://arxiv.org/abs/2605.23950 Регрессии при обновлении модели, flip rate — https://arxiv.org/abs/2608.13607 From Recall to Forgetting, устаревшая память — https://arxiv.org/html/2604.20006v1 Ошибки tools копятся по цепочке — https://arxiv.org/abs/2608.26189 Судья по результату пропускает тихие сбои — https://arxiv.org/abs/2609.00038 21 LLM-судья и каппа Коэна (Norman et al.) — https://arxiv.org/abs/2606.19544 Судья видел дефект и ставил зачёт за тон — https://arxiv.org/abs/2606.10315 Agent-as-a-Judge — https://arxiv.org/abs/2410.10934 Hamel Husain и Shreya Shankar о системе evals — https://www.lennysnewsletter.com/p/bu... Решение суда Хамма о чат-боте клиники — https://nrwe.justiz.nrw.de/olgs/hamm/... AgentChaos, отказы LLM API — https://arxiv.org/abs/2608.06790